AI Pulse

英伟达竞赛模型IOI超人类冠军,但本地跑不动

NVIDIA发布了一个竞赛编程专用模型。它由NVIDIA-Nemotron-3-Ultra-550B-A55B微调而来。官方定位是“竞争编程专家模型”,不是通用编码智能体,不承担自主写代码的任务。

模型在IOI(国际信息学奥林匹克竞赛)2026问题集上完成实时评估。评估按官方竞赛时间、联网条件和提交限制来。得分535.4分(满分600),超过金牌门槛361.12分。最高分人类选手的498.27分也被甩在后面。这是第一个被报道在IOI问题集上超越最高分人类选手的AI系统。

训练方法:蒸馏加测试时计算

模型在477,642条合成推理轨迹上训练了一个epoch。这些轨迹从GLM-5.2蒸馏而来,记录了解题推理过程。简单说,就是把GLM-5.2的竞赛思路教给新模型。训练数据覆盖22,000个精选问题,来自16个地区级和国际级编程竞赛系列。

教师模型选了GLM-5.2,而不是DeepSeek-V4-Flash变体。原因是GLM-5.2准确率更高,生成长度还短约30%。生成越短,处理成本越低。

推理时叠加了GenCorrect策略,这属于“测试时计算”。模型不直接交答案,而是先生成多个候选方案。然后根据评估反馈修正,最后在固定提交次数内选定结果。竞赛场景提交次数有限,这个策略把提交机会留给经过多轮修正的方案。

竞赛模型不等于日常编码助手

成绩亮眼,但用途边界很清楚。IOI 2026考的是算法竞赛题,不是软件开发任务。有评论者追问:给它一份5到10页的详细软件规格说明,它能否精确照做。这是竞赛专家模型和通用编码模型的分野。算法题上赢了人类冠军,不代表能帮人写业务代码。

开放权重,但本地跑不动

Nemotron是NVIDIA的开放模型家族,开放权重、训练数据和配方。这个模型可用于商业或非商业用途,研究者可以复现和改进。不过参数规模太大,有评论者说,参数量是自己电脑内存容量的约四倍,本地跑不起来。开放权重和本地运行是两回事。

评论区:性能相当,更大更晚

评论区反应偏冷静。有评论者认为,它的性能和Qwen 3.5 397B大致相当。但模型更大、激活参数更多,发布还晚了好几个月。另一名评论者说,自己测下来Qwen 3.6胜过Nemotron 3 Ultra。

有评论者对NVIDIA做后训练感到意外,他原来的印象是NVIDIA只训练基础模型。别的声音包括:希望NVIDIA下一步蒸馏Kimi K3这类模型,问完整训练流程是否公开。还有人想确认蒸馏用的问题集在哪能看到。半开玩笑的评论也有:这又是一款可用于编程面试作弊的模型。

Nemotron家族的发布惯例是开放权重、训练数据和配方,这次没改。选择GLM-5.2当教师的原因也写得很明白。竞赛成绩刷新了纪录。但通用编码能力没有超出已有开源模型的范围,日常开发者手里不会多出新工具。

阅读原文
📚 相关主题 大模型开源

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新