AI Pulse
📡 X 信号

OpenAI负责人透露ChatGPT与Codex将合并

Matthew Berman 最近采访了 OpenAI Codex 负责人 Tibo,整期大概 44 分钟,主要聊 Codex、Agent、下一代模型,以及 OpenAI 接下来的产品方向。Tibo 这次访谈里透露的信息比我预想的多很多。ChatGPT 和 Codex 最终会合并成同一个 personal AGI。

Ultra Fast 这种速度可能 1~2 年后就会接近默认,未来的 Agent 也会越来越依赖 cloud,一台 laptop 的资源已经开始成为限制。更有意思的是,现在这些需要手动维护 skills、memory、sub-agent 的复杂工作流,在 Tibo 看来都还很早期。他描述的目标是让 Agent 长期理解你、你的目标、每天在做什么,甚至理解你的团队,然后主动帮你工作。

我把整期 44 分钟里比较重要的内容整理了一下: 0:45 Tibo 在 Google DeepMind 学到了什么 ChatGPT 发布大约一年前,Google 内部已经有 LM Chat。当时的模型已经能生成连贯、甚至有帮助的内容,DeepMind 也产生了把 LM Chat 做成公开产品的想法。Tibo 对那段经历的评价很直接,DeepMind 是一个非常有���造力的地方,但整个组织并没有很好地围绕 shipping product 运作。

到了 OpenAI,研究和产品团队会非常紧密地一起工作,从想法阶段就开始 co-design,而且整个组织有非常强的 shipping 倾向。他现在很在意保留这种文化。OpenAI 很 bottom-up,一个人有想法之后可以快速找人一起做,然后很快上线,对新产品想法的 stop energy 很少。

同时他也提到另一个问题。速度太快很容易让产品变成一堆互相没有关系的 feature,所以 OpenAI 现在也很强调 simplicity、performance、efficiency,以及最终产品整体的统一。4:22 OpenAI 怎么保持这种高速文化 Tibo 给创业公司的建议其实很简单:要有 conviction,要尽早拥有真实用户,然后根据反馈快速迭代。

对于 OpenAI 这种已经很大的公司,还有一件更难的事情,就是愿意主动打乱自己已经建立起来的东西。当新的研究、新能力出现之后,他们会重新判断资源应该放在哪里,有时候甚至会从当前主要业务里重新分配资源。他说 AI 的未来不会等你把现在的业务慢慢经营舒服了。

而且模型能力也不是 benchmark 跑完就完全知道了。OpenAI 自己训练出新模型以后,内部还需要大量使用,才会突然发现它原来可以这样用,然后产品方向跟着发生变化。他举了 voice 的例子。

现在新的 ChatGPT voice 足够自然,也能使用工具,他自己已经开始大量直接和 ChatGPT 说话。早上拿起手机,把今天要做的事情直接说出来,ChatGPT 有他的工具权限,然后自己开始工作。这种模型能力的变化,会直接反过来改变产品设计。

7:23 Astra / 下一代模型和 Agent harness 这段我感觉非常值得看。Tibo 说,现在高级 Codex 用户已经习惯了很多奇怪的复杂度。你要维护 skill files,memory 偶尔会忘东西,使用 sub-agent 以后又要考虑 sub-agent 怎么工作,最后会构成一个越来越复杂的小网络。

OpenAI 想做的目标非常明确: Agent 深度理解你,理解你的目标,理解你的日常工作,理解你的团队,并且可以主动行动。你不需要天天管理这些底层结构。另外一个问题是 laptop 本身开始成为限制。

电脑本来就是按照人类的工作速度设计的。我们能同时处理多少窗口、打字有多快、一次开多少应用,这些限制对模型没有意义。未来的模型可能可以同时处理 100 个 application,探索方案、写 tests、compile、验证不同 hypothesis 全部并行。

所以 Tibo 明确认为,下一代模型需要的资源会超过一台 laptop,cloud agent 会越来越重要。11:18 开发者工作流会怎么变 这里有个观点我很喜欢,OpenAI 现在非常在意人的 attention。目前很多人用 coding agent 的方式是一次开 10 个甚至 15 个 agent,然后不断 context switch,过半小时再回来检查结果。

Ultra Fast + voice 之后,工作流会发生很大变化。Agent 的速度可以接近甚至超过你思考和表达的速度,你可以保持在同一个 flow 里,边说想法,边看 prototype,边让它生成 report,然后继续修改。Tibo 把 Agent 方向分成两类。

一类是 personal AGI。它非常了解你,和你一起工作,主动提出重要信息,而且覆盖 coding、research、advice 等各种任务。另一类是 full automation。

比如自动看 production logs,发现性能问题以后自己优化;发现 regression 后自己 patch;安全 scanner 找到 vulnerability 后自动修复,把漏洞暴露窗口压到接近 0。人在里面可能只需要批准 high-risk action。14:27 ChatGPT 和 Codex 为什么一定要合并 这一段基本把 OpenAI 的产品终点讲明白了。

Tibo 说,他们一开始收到很多反馈:为什么一定要把 ChatGPT 和 Codex 合并?他的回答是 future models want us to be merged。因为未来底层就是同一种技术,同一个 harness,同一个高度 multimodal、voice-first、非常高效的 Agent。

它天然就能 coding,也天然能做其他事情。OpenAI 最终想做的是一个 personal AGI,然后 interface 根据每个人自己适应。程序员、设计师、PM、普通用户这些身份只是人类为了理解复杂现实创造出来的分类。

每个人实际需要的能力都不同。主持人问,那最后会不会真的只剩一个 interface?Tibo 直接说,是的。

你和你妈妈未来用的是同一个东西。连接的工具不同、做的事情不同、看到的界面和得到的能力也不同,但底层就是同一个 personal AGI。他还提到了更 ambient 的交互。

未来你在办公室白板上写东西,AI 可以看到;你直接对它说话,它理解你正在指什么。Vision、voice、人的语气、动作这些信息都会逐渐进入交互。20:25 OpenAI vs Anthropic Codex 已经到 2000 万用户了。

主持人专门问了一次 Anthropic,因为前一段时间 Anthropic 在 coding agent 上存在感非常强。Tibo 的态度倒是挺 OpenAI 的,他说自己很少看竞争对手。他现在关注的是模型能力、模型效率,以及怎么把这些能力交给尽可能多的人。

他认为 OpenAI 很重要的一点是 communi

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新