Anthropic内部未发布模型Model 2核心信息整理
Anthropic最新风险报告提到,该公司有一款尚未对外发布的模型,已经用于内部研究和工程工作,目前仅公开少量确定事实、一项基准测试数据,仍存在大量未解答的问题。
这款模型并未纳入Claude产品序列,也没有正式的产品名称,仅被称为Model 2,是Anthropic能力最强、使用最广泛的内部模型之一,公司目前没有对外发布它的计划。
Anthropic在风险报告第16页给出了最清晰的描述:Model 2的能力略强于Mythos 5,在多项和Anthropic自身工作相关的任务上有明显提升,但提升幅度小于Opus 4.6到Mythos Preview的提升幅度。
报告还给出四项确定事实:Model 2已经通过内部部署前审核,使用和评估覆盖度不及Mythos 5,尚未完成全套常规发布前评估,目前没有对外发布计划。
报告中最受关注的数据是Model 2在Anthropic内部基准CoBench v2上的得分,为62.8%。
CoBench v2由449道真实的Anthropic研究与工程问题构成,要求模型还原工程师此前解决过的问题,不能直接查看最终答案。Mythos 5在该测试的得分是50.3%,Model 2比它高出12.5个百分点,比Mythos Preview高出8个百分点。
CoBench v2不是通用智能评测,仅衡量模型解决Anthropic特定工程问题的能力,且测试集已经过难度筛选,大多是Mythos Preview三次尝试至少失败一次的问题。Anthropic估算,能完全替代技术人员的模型,得分至少需要达到85%,这个阈值目前并不确定,评测本身和评分规则也存在局限。
在这项内部测试中,Model 2解决的问题比Mythos 5多很多,但距离Anthropic估算的完全替代人员的门槛还有明显差距。
Mythos 5和Model 2目前都被Anthropic大量用于研究和工程工作,支持交互使用和智能体持续运行。Claude现在已经编写了Anthropic生产代码库中合并的大部分代码。
报告没有单独统计Model 2贡献的代码量、带来的生产力提升或产生的错误,报告统计的886个内部工作样本也仅覆盖Mythos 5,没有给出Model 2的公开可靠性研究。
在Anthropic自身的AI研发进度衡量标准中,Model 2比Mythos 5高出约1.5分,误差范围较大,提升幅度小于Mythos Preview到Mythos 5的提升。报告的描述始终保持一致:Model 2确实更强,但不算突破性进展。
Anthropic没有解释不发布Model 2的产品层面原因,仅说明Model 2尚未完成外部部署前的全部常规评估,公司对其能力的把握不足。
Model 2有限的化学生物风险评估结果,和Mythos 5相当或更弱,这说明它在CoBench v2上领先,不代表它在所有领域都更强。目前没有发布计划不等于永远不会发布,但公司也没有做出任何发布承诺。
本次报告中,Anthropic将灾难性对齐风险评级从“极低”调整为“低”,这一调整和Model 2无关,是近期网络安全事件提升了公司整体不确定性,Model 2通过内部部署审核,没有出现新的对齐问题。
Anthropic此前曾将同一基础模型推出两个配置:面向普通用户的Fable 5,配备更强的网络安全和生物风险防护;限制访问的Mythos 5,防护更少,仅对经审核的合作方开放。
有人猜测Model 2未来可能会以类似方式推出,或是作为防护版本开放普通使用,或是作为低限制版本开放给合作方,或是不单独发布,将改进整合到后续模型中。这三种可能性都存在,Anthropic没有明确表态,目前只是合理猜测。
报告没有解答的问题包括:Model 2是发布候选版本还是实验分支,在Claude发布常用的公开基准测试上表现如何,内部使用中交互工作和智能体持续运行各自占比,后续公开模型是否会沿用它的基础权重。
这些问题比参数数量更重要,现在前沿实验室很少公开参数数量,未发布的内部模型更不太可能披露这类细节。
Model 2是Anthropic的内部模型,能力略强于Mythos 5,已经用于内部研究和工程工作,在CoBench v2上领先Mythos 5 12.5个百分点,尚未完成常规对外发布评估,目前没有发布计划。
此前Fable和Mythos的拆分可以作为未来推出的参考,但没有证据表明一定会这么做。现阶段,Model 2更多是让外界得以窥见Anthropic的内部研发进展,不是一款待发布的产品。