AI进入大拆分时代:能力不再捆绑
过去三年,大语言模型(LLM)的奇迹在于能力捆绑。需要从文档中提取内容?调用大语言模型。想搜索信息、给五个选项排序、判断某个东西是否可疑、选择下一个工具、浏览网页、撰写回复、校验工作,或者解决一个真正困难的推理问题?调用大语言模型。GPT、Claude、Gemini和Kimi将数量惊人的原本独立的能力整合进了一个通用产品。这是生成式AI最重大的产品突破之一:开发者无需再拼凑十几个专用系统,只需在应用核心放置一个足够聪明的模型,让它处理几乎所有事情。
这种便利掩盖了一件重要的事。这些能力对计算的要求截然不同,不同模型在捆绑包的不同部分已经各有所长。随着这些能力在性能、延迟和成本上的差异逐渐拉大,经济上理性的架构也随之改变。
我认为,我们正在进入智能的大拆分时代。
为什么是现在?智能代理将一个人类目标变成成百上千个机器决策,因此每一步成本和延迟上的微小差异会不断累积,最终主导整个产品的经济性。推理已经成为实实在在的销售成本,让成本和投资回报越来越成为必须考量的因素。更小和开源权重的模型已经足够承担大量常规工作。搜索、检索、重排序、记忆和计算机使用正在变成独立的基础设施层。应用有了更好的评估体系,能够准确判断何时更便宜的系统已经够用。矛盾的是,前沿模型变得更强反而让拆分更加安全:应用可以大胆使用廉价智能,因为如果廉价层不奏效,前沿模型就在技术栈顶端随时待命。架构开始从“默认前沿、之后再优化”翻转为“默认廉价、异常时才动用前沿”。考虑到智能代理庞大的推理规模,同一个目标内部的不同步骤需要截然不同数量和种类的智能。
这正是Jev来得恰到好处的原因。TypeSafe从生成式捆绑中拆出了一项通用能力:判断。向Jev输入杂乱的状态、一个边界清晰的问题和已定义的可选答案,它会返回结构化的决策和概率,而不是开放式文本。底层想法并不新鲜。新鲜的是直接在模型层封装单一认知操作,成本和速度都适配智能代理的内部循环。如果任务只是“看一眼然后做决定”,模型就不再需要先生成一句话。Jev恰好在智能代理把这个问题变成经济问题的时候到来。
理解这一点的一个有用概念是“解码税”。如果软件只需要知道紧急/不紧急、继续/停止、允许/阻止或者该用哪个工具,我们今天往往会要求语言模型生成一段答案,然后把输出重新转换成应用想要的决策。智能代理一直在做这件事。它们内部循环中相当大一部分操作可能根本不需要生成。
现在想想这对大语言模型捆绑的经济学意味着什么。据报道,Anthropic的毛利率超过80%,这就是一个强大捆绑的样子。Claude可以在单个产品中完成写作、分类、提取、排序、判断、编码、规划、校验和推理。如今,一个简单的分类或校验任务就要支付前沿级价格,仅仅因为它发生在一次Claude调用之内。拆分提出了一个更令人不安的问题:那次调用中隐藏的每一种能力,其独立市场价格是多少?困难推理或许配得上极高的溢价。但是,判断一封邮件是否紧急需要吗?给五份检索结果排序需要吗?检查一次浏览器操作是否成功需要吗?当判断在竞争中被压到几分之一美分,排序交给了重排序服务,搜索交给了搜索提供商,精准任务交给了代码模型,普通生成交给了更便宜或开源的模型——应用就不需要直接攻击Anthropic的利润率,它们可以攻击推高Anthropic利润率的工作组合。
这为前沿推理制造了逆向选择。如今前沿模型承接的是混合型工作量。随着应用路由能力越来越强,它系统性地剥离掉那些廉价、可预测、高体量的工作。浏览器模型接走重复的计算机控制,编码模型接走确定性推理,小型和开源权重模型接走普通生成。前沿实验室越来越只接到最高端的工作:那些奇怪、含糊、长期的问题,在这些问题上便宜系统不太有把握。因此,前沿智能可能会同时变得更强大、每次调用更有价值,但调用频率更低。而且这里还有一记潜在的双重打击。不仅到达前沿模型的操作减少了;而且由于路由优先挑选出了最难的问题,到达前沿模型的平均操作可能需要更多的测试时计算。对前沿推理的威胁不只是更便宜的前沿推理,而是它底层工作量的分解。
一旦能力变成可分离的,就需要有人把它们重新缝合成一个整体,这就是应用层变得更加重要的原因。应用不再问哪个模型应该处理整个任务,而是决定任务需要哪些能力。应用变成了一个智能编译器:接收一个人目标,将其拆解为认知操作,为每个操作购买最便宜的足够智能,重新组合结果,只在必要时升级。
下一步比“哪个模型回答这个提示”更深一层:这个任务中的每一种能力该由谁来提供?一旦某个能力有了稳定接口,供应商就可以被独立地基准评测、替换、路由和定价。智能的大拆分并不会消除AI的利润池,而是迫使每一项能力证明自己配得上一份利润。
而这种变化不止于利润率。廉价的判断会改变哪些产品在经济上可行。只要几分之一美分和几百毫秒,你就可以在每个智能代理动作后面安排一个判断器,而不是偶尔抽查。你可以把智能放进浏览器和语音循环,这些场景里数秒级的推理延迟过于缓慢。你还可以从只抽样检查系统的1%,转变为评估系统的100%,覆盖每一次客服对话、检索、交易、理赔、合同条款或客户账户。这会带来持续的监督、持续的质量保证,以及全新的产品循环和用例。
今天,软件本可以做出的大多数决策从未被做出,因为智能连续应用的成本仍然太高。一旦判断、排序、校验和其他能力变得足够便宜,软件就可以评估每一个客户、每一个工作流、每一个代理动作,以及每一次状态变化。
廉价的智能扩展了软件能够负担得起智能化的覆盖范围。真正的解锁,是一个智能不再是“事件”、而成为技术“背景属性”的世界。如果所有产品都能近乎免费地思考一切,会怎样?过去几年,我们一直在问一个模型能塞进多少能力。未来十年,我们可能会忙着把它们拆开,再在应用层重新组合。