扔进陌生环境不给提示,英伟达AI自己通关183个关卡
英伟达内部开发的AI系统AVO,在ARC-AGI-3测试中取得了100%的RHAE分数,完成了全部25个公开环境的183个关卡。整个过程没有任何指令、明确的规则或陈述的目标。AI被扔进一个完全陌生的环境,自己观察、自己决定要做什么,然后自己完成所有任务。
AVO被描述为一个“harness”(框架),但也被直接称为“agent”(智能体)。它使用Anthropic的Claude Opus 5作为底层模型,通过自己设计的harness来驱动模型。这个harness是英伟达内部开发的私有闭源系统,没有对外公开。
效率对比:少用12%的动作
在完成全部183个关卡时,AVO一共使用了6,624次环境动作。作为对比,另一个同样使用Claude Opus 5的系统VISTA,完成同样的183个公开关卡需要7,542次环境动作。AVO比VISTA少用了大约12%的动作。同样的模型,配上不同的框架,效率可以相差这么多——就像同样的引擎装在不同车上,性能表现不同。
实际用途:优化计算内核
AVO的harness技术不只是用于测试。英伟达在相关论文中提到,他们用这个框架来优化底层计算内核。在某些配置下,优化后的内核性能超过了cuDNN最多3.5%,超过FlashAttention-4最多10.5%。现有AI芯片上的一些计算任务,可能在不换硬件的情况下就变得更快,因为背后的软件被优化了。
质疑与争议
不过,也有人不买账。有评论认为这只是英伟达的营销噱头,因为100%的分数在AVO之前已经被其他系统达到过。一位评论者说:“100%的基准满分早就有人做了,完全不值得关注。”目前还不清楚AVO的100%分数是否比之前的100%更有意义,也不清楚它在私有测试集上的表现如何。
还有猜测认为AVO可能使用了Ox Alpha或GLM 5.3模型,但这一说法没有证据。英伟达没有公开AVO使用的具体模型细节,除了已知的Claude Opus 5。AVO的harness技术能否推广到其他AI任务,如编程、写作、数据分析,也仍是一个未解问题。
英伟达AVO展示了AI在无指导环境下自主探索和完成任务的能力,不过围绕它的争议和未解问题同样不少。