拥有你的智能:一份从零到一的指南
By @sonyatweetybird, @gradypb, and @w1tness1ngh
AI 应用层的竞赛不仅仅关乎用户界面、工作流或市场策略……它是一场对智能层本身的争夺。
呼吁拥有自己智能的声音不断高涨……
最近,Alex Karp 鼓励企业“拥有生产资料。”不久之后,@satyanadella 宣称,从前沿实验室购买智能就像付了两次钱:一次是金钱,另一次是你为了让它变得有用而透露出的专有知识。
每个人都在问的问题是:谁应该拥有你业务核心的智能?
需要说明的是,拥有自己的智能不是一项强制要求,也不是建议你离开实验室。对于许多工作负载,前沿 API 和智能体仍然是正确的答案。但在我们的投资组合中,我们看到越来越多的公司为自己的部分产品构建 AI 能力,通过垂直整合朝着拥有并塑造自己的权重迈进。
几周前,我们红杉资本召集了一批 AI 创始人和构建者,举办了一场关于拥有你自己的 AI 技术栈的活动。@harvey 给我们带来了客户视角。接着 @mercor_ai、@LangChain、@trajectorylabs 和 @FireworksAI_HQ 带我们梳理了后训练技术栈中的技术构建模块。
在所有演讲中,一个清晰的行动手册浮现出来。
为什么是现在?
首先,开放权重领域的进展比预期更快。Kimi K3 和 GLM 5.2 非常出色!在开放模型上训练曾经像在跑步机上跑步……你可能花几个月微调,而下一个前沿发布就会抹掉你的成果。现在,你可以从一个接近前沿的基座开始。
其次,独立的后续训练技术栈已经成熟。得益于 @FireworksAI_HQ 和 @Mercor_ai 等公司,每家公司都能获得前沿研究实验室的技术栈,从训练到推理,再到人类数据或合成数据。凭借强大的评估、控制框架工程、后训练和在线学习,开放模型现在可以在特定领域击败前沿模型。
一年前,你选择开放权重是因为性能是可以牺牲的东西。如今,这正在变成一个关乎存亡和战略的问题。最新的战场是智能层。不是你的权重,不是你的产品。
你什么时候应该行动?
没有一刀切的方法。除了性能之外,你产品中的某些部分,租用智能可能会变成一种约束,因为……
1. 成本。你的 AI 产品越成功,你的 AI 销售成本就越高。如果推理成本直接随使用量增加,那么拥有模型是保护利润率的最佳方式。
2. 速度。如果你在编码(标签自动补全)或网络安全等领域运营,小型蒸馏定制模型可能击败大型通用模型,因为速度至关重要。
3. 专有数据。如果让你的系统变得更好的是你的反馈、评估、客户互动或领域数据,你可能会希望这些数据留在你的墙内。
4. 掌控命运。应用层和智能层正在开始融合。实验室正在向上进入产品,而应用公司正在向下进入定义产品思考方式的训练循环。拥有产品,可能越来越多地意味着控制更多的学习循环和智能本身(鸣谢 @harvey Research、@RampLabs、@glean、@factoryAI 等)。
路线图是什么?
假设你已经决定了拥有与租用的策略,问题就变成了:你如何从零到一?
组建你的团队。不要把它硬塞进平台团队。拥有自己的智能需要主动出击的人:构建评估、塑造数据、试验开放模型、调优控制框架,并在一个领域内推动性能。小而新的团队在这里可以走得很远,与五六个生态系统伙伴合作。例如,@harvey 用仅仅七个人的团队完成了惊人的研究量!
让工作清晰可读。现在每个买家都在选择自己的 AI 冠军。越来越多的决胜因素是公开发表的研究、基准或技术文章。如果你选择在内部做精彩的研究,那就与生态系统分享吧。
执行技术步骤。我们在下面列出了高层次框架。
1/ 评估
@gabepereyra 说得很到位:“如果你没有好的基准,你就无法训练模型。”
评估是一组任务,用来衡量你的系统能否把工作做好。每个任务包含一个提示、模型可以使用的上下文,以及一个评分器。大多数评估一开始都是创始人眯着眼看输出,凭感觉判断是否合适。目标是把那种判断变成可重复的东西。
@harvey 通过把真实的法律工作转化为模型可以测试的离散任务,构建了它的法律智能体基准。第一版包含 24 个法律实践领域中的 1,200 多个智能体任务,并由超过 75,000 条专家编写的评分标准进行评估。
在决定拥有自己的智能之前,拥有一个评估非常重要。一旦每次前向传播都有一个评估,决定使用哪个模型就可以是经过衡量的决策,而不是猜测。
2/ 控制框架与上下文工程
一个智能体有三个部分:模型、上下文和控制框架。控制框架围绕模型治理产品逻辑:路由、检索、工具、记忆、回退和追踪。@hwchase17 的简洁框架是:“控制框架的主要工作是在正确的时间点把上下文带给模型。”任务对于模型来说越是偏离分布,现成的控制框架效果就越差。
好的控制框架能让你将任务路由到最适合特定工作的模型,跨模型复用同一套评估,并决定智能体获得什么上下文和工具。它还能让智能体可检查。你可以追踪进去的上下文、调用了哪些工具,以及它在哪里卡住了。
3/ 后训练
后训练涵盖了几种技术。选择哪一种取决于你想改进什么。
@lqiao 这样阐述:如果模型缺少事实,你不需要后训练——只需使用上下文或 RAG。如果输出格式或行为不对,使用监督微调。如果问题是产品品味,使用偏好调优。如果模型需要在专门任务上改进,使用强化学习。如果模型太慢或太贵,就蒸馏它。
目标是选择能让你的评估发生变化的最轻量方法。然后通过同一个控制框架服务模型,并在运行中测量质量、延迟和成本。
4/ 在线学习
一旦系统具备了各个部分——评估、控制框架和模型——最后一步是在生产环境中改进该系统。
@QuantumArjun 提出了一个好观点:模型不断变得更聪明,但每次会话都像是它们上班的第一天。你可以把 Terence Tao 放进一家会计师事务所,但很可能(至少在第一天)他不会成为那里最好的会计师。缺少的不是智力,而是经验。智能体在运行时创造经验。
轨迹是完成任务时所经过的路径:模型看到的上下文、调用的工具和子智能体、产生的答案,以及用户编辑、撤销或重试的内容。在像 @LangChain 的 LangSmith 这样的工具中捕获这些轨迹,是构建持续生产循环所必需的。失败的任务变成评估。缺失的信息进入上下文或记忆。糟糕的工具响应变成控制框架的修复。
最后的想法
买家当心:拥有自己的智能打开了潘多拉魔盒。
封闭模型的技术栈很简单。你调用一个前沿模型,使用开箱即用的控制框架(例如 Claude Code 或 Codex),加上提示和上下文,然后发布。那会给你一个很高的下限,但也是一个较低的天花板。
拥有你自己的技术栈意味着自己承担系统中的更多部分。生产技术栈变成你的开源模型、定制控制框架、工具和上下文。开发技术栈变成你的专有评估、领域数据和在线学习循环。
这当然是更多的工作!它可能给你一个更低的下限——但它也提高了天花板。
实验室将继续构建巨型大脑。我们都应该使用它们。
但与此同时,最好的产品公司正在培养他们自己的小天才:快速、有主见、痴迷于领域,并针对他们每天看到的工作进行调优。在一个更多公司拥有自己智能的世界里,生态系统蓬勃发展,个性取得胜利。
这就是一个公司拥有自己智能的世界的承诺。我们很高兴看到小家伙们的进步,那些想要把那个世界带进现实的初创公司。💚