Personal Agent 可能成为下一代互联网入口
Personal Agent 和 Coding Agent 的本质区别。
连续看了 Instinct 创始人 Noah Shinn 和分析师 Ben Thompson 对 Personal Agent 的讨论,还是想写一些我的理解。
AI 行业的风向变化实在太快了。 从 ChatBot 到 Coding Agent,再到通用 Agent,然后又到了 Personal Agent,也就一年多时间,整个行业已经连续转了好几次方向。
这一次 Muse 火起来以后,我感觉特别明显。大家讨论的重点,突然不再是模型的能力,而是云端电脑、Context、长期记忆、主动性、权限这些东西。 好像,应用的时代应该真的来了。真的来了。
当然,这里面到底还有多少创业公司的机会,现在不敢下结论。Meta、OpenAI 已经进场了,国内字节、腾讯、阿里虎视眈眈。 很多人会抨击说 Personal Agent 完全是炒作概念。
是的,它更像是之前很多技术创新的组合,最终酝酿成了一种新的产品形态。所以,也不能叫炒作。如果大家去看下工业革命相关的书,会发现那个时代的技术也同样如此。 所有的创新本质都是 Mix。
我写几点自己的理解。
一、Personal Agent 和 Coding Agent 的区别
Personal Agent 和 Coding Agent 最大的区别是,会不会根据 Context 主动行动。
之前的 Coding Agent,核心逻辑还是等着用户派活。比如打开 Codex,说帮我改一个 Bug,或者让它写一个 Slides 之类。一切的任务都需要从用户的指令开始。
但 Personal Agent 会基于用户的 Context,主动工作。因为它知道我们的日历、邮件、位置、消费记录,也了解我们的习惯和偏好。 所以很多时候,我们甚至不需要明确告诉它现在应该干什么,它自己就可以判断。
举个很简单的例子。 假设我今天上午十点要去拜访一个客户。 Personal Agent 知道这件事,也知道客户公司位置。九点半的时候,它可以自己检查路况,判断今天坐地铁还是打车更合适。
如果要打车,它甚至可以提前安排车辆,然后告诉我该出发了。 感觉这其实就是一个特别熟悉你工作习惯的秘书应该处理的事情。
Instinct 这个产品现在已经在做类似的事情。如果一个文件下午三点前必须签,它发现到了两点五十五分你还没有处理,甚至可以直接给你打电话提醒。 它已经不只是接受任务,然后完成任务的模式。Personal Agent 开始有眼力见了。
二、Personal Agent 会让 Token 消耗量再次跃迁
从 Token 消耗的角度看,Personal Agent 又会是一个重要的分水岭。 过去几年,Token 消耗大概经历了几个明显的跃迁拐点。
第一个是 ChatGPT。大家开始大量使用模型生成回答、文章和代码等等。 第二个节点是 o1,推理模型开始普及。模型回答一个问题之前,会投入更多的算力进行推理。
第三个节点是 Coding Agent。Coding Agent 可以连续工作几个小时,不停的读取文件、修改代码、运行测试,然后继续修改,一次任务就会消耗大量 Token。
现在第四个节点 Personal Agent 也来了。因为它长期在线。 之前算力主要发生在用户主动找 AI 的时候,所以这中间诞生了手机遥控电脑之类的功能。但这些都是过渡,人还在 Loop 之中。
Personal Agent 以后大量算力可能发生在后台。我们没有打开 AI,没有给它发消息,它仍然在理解 Context、检查变化、判断有没有事情需要处理。 AI 的工作时间,开始和人的在线时间脱钩。
三、隐私的问题会通过技术方式解决
当然,Personal Agent 也不是从零开始冒出来的。云端电脑、长时间执行任务、主动提醒、拟人化沟通,这些东西之前我们都已经零零散散见过。 Coding Agent 里有一部分,OpenClaw 里也有一部分。Personal Agent 其实是把这些元素重新组合到了一起。
给 Agent 一台长期在线的电脑,让它拿到足够多的 Context,再给它执行任务的权限。 这几个元素一旦组合起来,新一代的产品就来了。
当然,隐私一直是一个无法抛开的关键命题。 Personal Agent 越了解我们,能力就越强。但反过来,它越了解我们,我们需要给它的数据也就越敏感。
邮件、IM、日历、联系人、文档、银行卡、购物记录,这些信息都是隐私,所以 Personal Agent 真正普及之前,隐私和安全的问题一定需要解决。
Meta 现在给 Muse 做了一套 Secure VM。简单理解,每个用户都有一台隔离的云端电脑,账号和数据都保存在里面。他们的计划是,今年晚些时候会推出 Muse Confidential VM。到时候整个虚拟机都会使用只有用户自己持有的密钥加密,连 Meta 自己都无法读取里面的数据。 这个思路我觉得是可行的。总之就是通过技术的手段来彻底解决隐私的问题。
四、Agent Network 也就水到渠成了
一旦 Personal Agent 足够了解我们,Agent Network 也就水到渠成了。这个话题我后面还想单独写一篇。 因为当 Agent 足够了解一个人以后,它其实已经很像这个人的数字分身,或者说一个非常了解我们的私人秘书。
这时候 Agent 和 Agent 就可以直接沟通。 比如我想约一个朋友见面,现在的流程特别麻烦。我问他周三有没有时间,他说没空,然后给我两个时间。我发现其中一个时间自己在出差,又重新发三个时间过去。
如果我们两个人都有 Agent,这件事就简单很多。我告诉自己的 Agent,这周找个时间和��见面。两个 Agent 可以自己查看双方允许共享的日历,协调时间,最后直接把会议放进日历。
所以我觉得 Personal Agent 最后可能会长出新一代微信一样的产品。 Agent to Agent 至少可以消掉大量社交中的协调成本。朋友聚会、商务会议、旅行计划,这里面有大量信息其实根本不需要人亲自来回沟通。
很多人与人之间的沟通,本质上是在交换 Context、约束和意图。既然双方的 Agent 已经掌握这些信息,那这些沟通就可以直接发生在 Agent 之间。
五、下一代互联网的总入口
Personal Agent 很可能会成为下一代互联网的总入口。 大家想想,我们今天手机上装这么多 App,电脑上使用这么多 SaaS,本质上都是为了完成一件具体的任务。 也就是产品经理常说的,Jobs to Be Done。
想起克里斯坦森那句经典名言,用户使用某个产品,是为了完成某个任务。仅此而已。 但 Personal Agent 之后,完成任务的逻辑会彻底变化。以后我们可能只告诉 AI 自己想完成什么,然后 AI 去决定调用具体什么服务。 用户和 App 之间那一层 UI,不再重要了。
举个例子,我刚刚还在折腾 10 月 6 日的海底捞订餐。家人过生日,我需要打开海底捞小程序,找到家附近的门店,然后选择日期、人数。特别繁琐。 我在想,这种事情以后完全可以交给 Personal Agent。 直接跟 A