英伟达研究:真正的英雄是AI框架,而非模型
英伟达周五发布了一些有趣的新研究,表明在让AI执行长周期任务时,框架(harness)比底层模型重要得多。框架是包围AI模型的软件包装——包括工具、内存管理和规则,能将原始模型转化为可以自主行动的东西。
简而言之:通过使用一个针对内存处理进行优化的定制框架,并加入一个“监督者”(supervisor)式的老板组件,研究人员让Claude Opus 5在交互推理基准ARC-AGI-3上取得了100%的分数。ARC-AGI-3是一组没有说明的2D游戏,模型必须像人类一样摸索玩法并获胜。(这个基准尤其惹恼了竞争对手前沿实验室OpenAI。)没有框架时,Opus 5的得分为30%,但这已经是在所有测试模型中最好的结果。
英伟达的研究再次表明,虽然模型选择确实重要,但模型本身——充当智能体“大脑”的部分——在智能体系统中所占的比例比许多AI用户意识到的要小,尤其是在长周期任务中。框架才是让模型成为智能体的关键:它处理记忆、上下文和反馈。
“一般来说,业界几乎把智能体理解为模型的API,”英伟达AI部门产品副总裁Adel El Hallak(上图)告诉TechCrunch。但智能体实际上不止于此。“它是模型。它是模型周围的脚手架,我们称之为框架,也就是它使用的那套工具。它是运行时,以及我们允许它访问的相关技能和库。”
长周期任务是指需要将许多决策串联起来、有时需要数天才能完成工作的任务。这与AI只对提示做出回应形成对比。如何让AI执行长周期任务而不分心、不陷入异想天开的境地,是智能体研究中的圣杯之一。
例如,微软在四月份发表了一项研究,测试了19个LLM在涉及文档编辑的长周期任务上的表现,发现所有模型(包括前沿模型)都在文档中充满了错误。(如果人类做出这样的工作,很快就会被解雇。)
自主串联决策的模型还被发现会删除用户的文件甚至整个数据库,或者为了达成目标而转向犯罪行为,从串通到黑客攻击。
英伟达研究人员选择使用这种交互推理基准进行测试,尤其意味深长,几乎有点讽刺。100%的分数意味着模型能像人类一样通关游戏。
OpenAI对其模型在ARC-AGI-3上的糟糕得分(不到10%)感到非常不安,上个月也进行了自己的研究。和英伟达一样,OpenAI发现只需调整框架上的两个设置,其模型的得分就达到了原来的三倍。
但没有任何模型像英伟达研究人员那样接近100%的分数。他们表明,框架需要一个“监督者”组件,在智能体陷入困境时将其推向正确的方向。
“更有趣的部分是,除了执行工作的主智能体之外,再引入一个监督智能体,”El Hallak说。它“几乎像CEO一样,在智能体偏离方向或开始探索可能走入死胡同的路径时推动它,或者重新探索它之前走过的路径。”
虽然监督智能体的概念并不新鲜,但如今大多数智能体用户只依靠框架的单层结构,如Claude Code、Codex或Hermes。英伟达研究人员创建了他们自己的强化版框架,名为Agentic Variation Operators(AVO)。
注意,这并不是英伟达的新产品。英伟达实际上在Nemo品牌下提供大量用于构建框架的开源技术片段。其中一些是商业化的,而大部分是开放可用的。
尽管如此,英伟达的结果进一步证明了,模型选择远不是智能体性能的唯一因素。例如,七月份Databricks发表了一项惊人研究,表明框架而非模型对AI成本影响巨大。
“你可以选择相同的模型但使用不同的框架,如果选错了框架,成本会显著增加,”Databricks CEO Ali Ghodsi告诉TechCrunch。“所以你会想,这是昂贵的模型,这是便宜的模型。但等等,你用的是哪个框架?这本身就能让你的成本翻倍。”
英伟达更大的观点是:开放框架与开放模型一样,能让用户获得比他们意识到的更多的控制权。
“我们相信,并且正在通过生态系统证明,开放框架如何让你转动更多旋钮来提升准确率,”El Hallak说。“这与OpenAI因模型造成安全漏洞而放慢模型训练有关。”
“我们相信,拥有一个开放的智能体技术栈——让你能够在框架、基础设施、运行时上拥有控制权——才是我们引领生态安全前进所需要的,”他补充道。