AI Pulse
📡 X 信号

MLCR-AA发布医疗AI推理榜单,Claude Fable 5居首

MLCR-AA发布医疗AI推理榜单,Claude Fable 5居首

我们正式推出 MLCR-AA,这是针对 Wisedocs 的 MLCR(Medical Long Context Reasoning,医疗长上下文推理)基准测试打造的排行榜,专门评估模型对长医疗病例文件的推理能力。

我们测试了难度最高的留存问题层级,其中 Claude Fable 5 以 64.4% 的得分拿下第一名。

MLCR-AA 在由 @wisedocsai 团队构建的真实合成医疗与保险病例文件上测试模型,这些文件基于该平台专长的记录审核工作开发。我们的排行榜使用来自两个最难类别的私有留存测试集,包含 60 道问题:Expert(专家级)要求对完整病例文件进行专科医疗推理,Compound(复合级)则会在单个查询中嵌入多个独立问题。

每道问题都需要对照一份约 70-150 页的完整病例文件作答,由三个模型组成的评审团从完整性、准确性两个维度评分,同时还会进行简洁性测试,对比专家答案限制冗余回应。

准确性验证回应是否有充分的源文档和病例上下文依据,完整性则评估模型是否输出了专家标注答案包含的所有核心细节。简洁性测试验证模型不会生成过度冗长的内容(长度超过专家回答的5倍)。

@AnthropicAI 最新发布的 Claude 模型在 MLCR-AA 中领先,Claude Fable 5 得分 64.4%,Claude Opus 5 多次测试的得分在 53.9% 到 59.4% 之间。来自 @Kimi_Moonshot 的 Kimi K3 (max) 是得分最高的开放权重模型,得分为 38.3%。

MLCR-AA 的核心结果:
➤ 医疗记录审核如今已经可以部分用 AI 完成,但成本高,仍有很大改进空间:领先模型 Claude Fable 5 得分为 64.4%,每个任务成本为 1 美元,中位数模型得分低于 15%。

➤ 模型能够忠实于源文档,但会遗漏完整回答所需的关键细节:近 40% 的测试模型准确性得分超过 80%,绝大多数模型完整性得分低于 50%。模型对自己输出的内容基本都是正确的,但会遗漏大量信息。GPT-5.6 Terra (max) 的准确性得分最高,达到 93.7%,但仍排在第 10 位,被完整性拖了后腿。

➤ Anthropic 模型领先的原因是完整性而非准确性:得分最高的模型都来自 Anthropic,但它们的准确性和最强的 OpenAI 模型相当,甚至更低。差距来自它们能够覆盖专家参考答案的全部范围。

我们感谢 Wisedocs 构建了 MLCR,也感谢他们与我们合作,将它带到 Artificial Analysis!

本文由 AI 翻译自英文原帖,技术名词保留英文。

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新