Model 2是什么?Anthropic内部模型能力更强但暂无发布计划
Anthropic 的最新风险报告提到了一款尚未发布的模型,该模型已用于内部研究和工程。我们只获得了一些可靠的事实、一个基准测试分数,以及大量悬而未决的问题。
Anthropic 的新风险报告中提到了一款模型,它不在 Claude 中提供,也没有正式的产品名称。它就叫 Model 2。
这个名字之所以出现,是因为报告既涵盖 Anthropic 内部使用的模型,也涵盖向客户发布的模型。Model 2 是该公司能力最强、使用最广泛的内部模型之一。Anthropic 表示目前没有将其外部发布的计划。
这留下了一个显而易见的问题:它到底是什么?
Anthropic 实际说了什么
风险报告第 16 页给出了最清晰的描述。Anthropic 称 Model 2 “比 Mythos 5 略强一些”。Anthropic 内部粗略判断是,在诸多与自身工作相关的任务上,Model 2 相对 Mythos 5 有明显改进。
但这种比较有其限度。Anthropic 表示,改进幅度小于从 Opus 4.6 到 Mythos Preview 的跨越。
报告还给出了另外四项有用的事实:
- Model 2 通过了 Anthropic 的内部部署前审查。
- 它没有被像 Mythos 5 那样广泛地使用或评估。
- Anthropic 没有运行其全套常规发布前评估。
- 目前没有外部发布计划。
这就是报告中全部确凿的证据。Model 2 是一个在积极使用的内部模型,而非已公布的 Claude 产品。
62.8% 的成绩
报告中最引人注目的数字是 Model 2 在 CoBench v2 上的得分。
CoBench 是 Anthropic 内部构建的一项评测,由 449 个真实研究和工程问题组成。模型会被置于 Anthropic 系统中的一个历史节点,并被要求诊断其工程师此前已经解决的问题。它可以访问代码库快照、日志、内部消息和文档,但看不到最终答案。
Model 2 得分 62.8%。Mythos 5 得分 50.3%,因此 Model 2 高出 12.5 个百分点。它还比 Mythos Preview 高出 8 个百分点。
关于这个分数的一些背景:CoBench 不是通用智能分数。它衡量的是在 Anthropic 特定工程问题集上的表现。该数据集也经过难度筛选,主要使用 Mythos Preview 在三次尝试中至少失败过一次的问题。
Anthropic 估计,一个能够完全替代其技术人员的模型需要至少拿到 85%。它表示该阈值存在不确定性,并指出了评测及其评分中的若干局限。
因此,结论是有限的:在这项内部测试中,Model 2 解决的问题明显多于 Mythos 5,但距离 Anthropic 自己对完全替代人员的估算还差得很远。
Model 2 在 Anthropic 内部做什么?
报告称,Mythos 5 和 Model 2 都被广泛用于研究和工程,既通过交互方式,也通过持久化智能体。
报告还称,Claude 现在编写了合并到 Anthropic 生产代码库中的绝大部分代码。
这些说法适用于 Anthropic 整体上的模型使用。报告没有单独区分 Model 2 在代码、生产力提升或错误中的占比。其包含 886 个内部会话的详细样本覆盖的是 Mythos 5,而不是 Model 2。
这一点很重要。Model 2 似乎在做实际工作,但公开报告并没有为我们提供一份干净的 Model 2 可靠性研究。
还有另一项直接比较。在 Anthropic 的 AI 研发进展指标上,Model 2 比 Mythos 5 高出约 1.5 分,误差范围较大。Anthropic 称,这一提升幅度小于从 Mythos Preview 到 Mythos 5。
报告自身的表述是一致的:Model 2 更好,但它没有被描述为戏剧性的阶跃变化。
为什么不发布?
Anthropic 没有给出产品层面的解释。
它表示,Model 2 尚未完成外部部署前通常运行的所有评估,因此公司对其模型能力判断的信心较低。
其有限的化学和生物评估结果与 Mythos 5 相当或更弱。这再次提醒我们,CoBench 上的领先并不意味着 Model 2 在每个领域都更强。
“目前没有计划”不等于“永远不会”,但这里没有任何发布承诺。
另一个值得注意的细节:在本报告中,Anthropic 将灾难性错误对齐的风险评估从“极低”调整为“低”。这一改变并不是因为 Model 2 未能通过安全测试。公司表示,近期的网络安全事件提高了其整体不确定性,尽管其底层论证仍然支持较低的评级。Model 2 通过了内部部署前审查,没有浮现新的错误对齐问题。
它会成为 Fable 5.1 或 Fable 6 吗?
如果明确这是猜测,那这是更有意思的猜测。
Anthropic 将 Fable 5 和 Mythos 5 作为同一底层模型的两种配置发布。Fable 5 是通用访问版本,具有更强的网络安全和生物学防护。Mythos 5 的防护较少,并仅限于经过审查的合作伙伴,包括 Project Glasswing 中的组织。
Model 2 最终可能会走类似路线:
- 一个带防护的 Fable 版本,供通用使用。
- 一个限制较少的版本,供经过批准的研究或安全合作伙伴使用。
- 不外部发布,而是将其改进合并到后续模型中。
这三种情况都有可能。Anthropic 没有说明它打算采取哪一种(如果有的话)。
CoBench 的结果使得“未来的 Fable 5.1 或 Fable 6 基于 Model 2”成为一项可以理解的猜测。但它仍然只是猜测。
我们所不知道的
报告没有告诉我们:
- Model 2 是发布候选版本还是实验分支;
- 它在 Claude 发布时使用的广泛公开基准上表现如何;
- 其内部使用中,交互式工作与持久化智能体各占多少;
- 后续公开模型是否会使用相同的基础权重。
这些问题比它的参数数量更有意义。前沿实验室现在很少公布参数数量,而一个未发布的内部模型更不可能附带这种级别的细节。
那么,Model 2 是什么?
它是 Anthropic 的内部模型,公司称其能力略强于 Mythos 5。
它已经用于研究和工程。它在 CoBench v2 上领先 Mythos 5 12.5 个百分点。它尚未完成 Anthropic 通常的外部发布评估,Anthropic 目前也没有发布它的计划。
Fable 和 Mythos 的分拆为未来版本可能以何种方式推出提供了一个先例,但这并非它一定会发生的证据。
目前,Model 2 最好被视为一扇了解 Anthropic 内部研发工作的窗口,而不是一个等待发布日期的产品。