AI Pulse
🔥 热点深度解读

英伟达AVO拿了AI推理满分,顶级大模型都做不到

你打开一个新游戏,没人告诉你规则是什么、要达成什么目标,只能自己试错摸索。

这个听起来很日常的探索过程,对AI来说曾经是比写代码、做数学题难得多的挑战。

ARC-AGI-3就是专门测试这种能力的基准:它要求AI在没有明确指令、规则和目标的前提下,探索陌生环境自己推理出任务,考验的就是类似人类的「流体智力」,也就是面对新环境快速学习适应的能力。

在这项测试推出初期,最强的AI得分只有0.37%,只有人类能拿到满分100%。GPT-5.4、Claude Opus 4.6和Gemini 3.1这些顶级大模型单独测试,得分都是0%,Claude Opus 5单独测试也只拿到了30%。

2026年3月末,英伟达推出了通用编码智能体NVIDIA AVO。当Claude Opus 5和AVO结合后,结果超出了很多人的预期:完成了25个公开环境里全部183个关卡,得分刚好100%。

@NVIDIAAI 认为:AVO可以在没有指令、明确规则或既定目标的情况下,自己判断该做什么。

@kimmonismus 感慨:NVIDIA的编码智能体AVO在没有给出任何规则或目标的前提下,通关了所有关卡。

这件事和普通科技爱好者的关系,不在于某一款测试拿了多少分,而在于AI能力的组合模式已经显现——就算单个大模型搞不定的陌生任务,加上专门的智能体框架,就能补齐自主探索试错的短板。

以前要让AI处理没见过的新任务,总得有人写好提示词、定好步骤,现在AVO证明,AI可以自己摸清楚规则。

那些顶尖大模型都拿0分的测试,靠组合拿到了满分,下次换一个你我日常要处理的陌生任务,会不会也能靠这种组合搞定?

📎 参考来源

查看原始推文

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新