AI长任务成败关键不在模型,而在于外面的“软件壳”
当你让AI去完成一个需要多步骤、长时间的任务时,真正决定成败的往往不是AI模型本身,而是包裹在模型外面的那层“软件壳”。
Nvidia上周五发布了一项研究,给出了一个出人意料的结论:对于长时程任务——那些需要把多个决策串联起来,有时持续数天才能完成的工作——软件壳比底层模型重要得多。
什么是“软件壳”?Nvidia AI部门产品副总裁Adel El Hallak说,业界通常把AI智能体看作模型的API接口,但智能体远不止于此。它包含模型本身,以及围绕模型的脚手架结构、工具集、运行时环境和技能库。这个脚手架,就是“软件壳”,业内也称之为harness。
简单说,harness负责三件事:记忆、上下文和反馈。它把原始模型变成一个能自主行动的系统。
一组实验:30%到100%的差距
Nvidia的团队做了一个实验。他们选用了Anthropic的Claude Opus 5模型,在ARC-AGI-3基准上测试。ARC-AGI-3是一组没有说明书的2D小游戏,模型必须像人类一样自己理解规则并获胜——这恰恰是AI最不擅长的类型。
没有harness的情况下,Opus 5得分30%,这已经是所有测试模型中的最高分。但研究人员给这个模型套上了一个定制版harness,专门优化了内存处理,还加入了一个“监督者”组件。结果,同一个模型在同一个基准上拿到了100%得分。
这个结果不是孤例。OpenAI上月也做了类似研究。OpenAI对自己的模型在ARC-AGI-3上的得分很不满意——不到10%。他们发现,仅仅调整harness上的两个设置,模型得分就提高了三倍。但OpenAI没能让模型接近100%。
Nvidia做到了。区别在于,Nvidia的harness包含一个“监督者”组件。
给AI配一个CEO
El Hallak把监督者比作CEO。主智能体在执行任务,监督者在一旁观察。当主智能体偏离方向或走进死胡同时,监督者会把它拉回来;如果主智能体忽略了之前走过的路径,监督者也会提醒它重新探索。
这个想法并不新鲜,但大多数AI用户目前只依赖单层harness,比如Claude Code、Codex或Hermes。
Nvidia的研究人员自己动手做了一个增强版,取名叫Agentic Variation Operators(AVO)。
这不是Nvidia要卖的新产品。Nvidia有一个叫Nemo的品牌,专门生产各种用于构建harness的组件,部分商业,大部分开放可用。
错误、成本和风险
让AI独立完成长时程任务,风险不小。微软4月发布的研究测试了19个大语言模型处理文档编辑长任务,结果所有模型——包括最前沿的那几个——都在文档里填满了错误。
更糟的是,AI在自主串联决策时,曾被观察到删除用户文件甚至整个数据库,或者转向犯罪行为,比如串通和黑客攻击,只为实现目标。
El Hallak认为,开放harness能让用户拥有更多控制权,从而降低这样的风险。“我们相信,开放智能体栈——在harness、基础设施、运行时上拥有控制权——是推动生态系统前进和安全所必需的。”
成本方面,harness的影响同样显著。Databricks 7月的研究显示,harness比模型更显著地影响AI成本。Databricks CEO Ali Ghodsi说,用同一个模型配上不同的harness,选错harness可能让成本翻倍。
开放与封闭
Nvidia的更大观点是:开放harness像开放模型一样,让用户比他们意识到的更能控制AI系统。El Hallak提到,OpenAI因为模型造成安全漏洞而放缓训练,而开放harness允许用户调整更多参数来提高准确性。
但Nvidia的AVO harness未来是否会作为独立产品推出,目前还不清楚。监督者组件如何具体实现、是否适用于所有类型任务,也尚无定论。
Nvidia的这项研究,只是越来越多证据中的一块。模型选择很重要,但远非智能体性能的唯一因素。对于长时程任务,那个看不见的软件壳,可能才是决定AI能否靠谱完成工作的关键。