ArtificialAnlys发布MLCR-AA医疗长文本推理排行榜
我们正式推出MLCR-AA,这是针对Wisedocs的MLCR(Medical Long Context Reasoning)医疗长上下文推理基准的排行榜,该基准用于评估长医疗病例文件的推理能力。我们运行了难度最高的预留问题层级,其中Claude Fable 5取得了64.4%的最高分。
MLCR-AA在由@wisedocsai团队构建的真实合成医疗与保险病例文件上测试模型,这些文件基于该平台专长的记录审核工作打造。我们的排行榜运行了来自两个最难类别的60道题私有预留集:Expert类要求对完整病例文件进行专科医疗推理,Compound类则在单个查询中打包了多个独立问题。
每道题都需要基于一份约70-150页的完整病例文件作答,由三模型评审团从完整性、准确性,以及简洁性测试几个维度评分,简洁性测试会限制模型输出比专家答案更冗长的回答。准确性验证回答是否有扎实的源文档和病例上下文依据,完整性则评估模型是否产出了专家标注答案中包含的全部核心细节。简洁性测试验证模型不会生成过度冗长的内容(超过专家答案长度的5倍)。
来自@AnthropicAI的最新Claude版本在MLCR-AA中领先,Claude Fable 5得分为64.4%,Claude Opus 5多次测试得分在53.9%到59.4%之间。来自@Kimi_Moonshot的Kimi K3 (max)是排名最高的开放权重模型,得分为38.3%。
MLCR-AA的核心结果:
➤ 医疗记录审核目前部分可由AI完成,但成本高仍有改进空间:头部模型Claude Fable 5得分为64.4%,每个任务成本为1美元,中位数模型得分低于15%
➤ 模型能忠实遵循源文档,但会遗漏完整回答所需的关键细节:近40%的测试模型准确性得分超过80%,绝大多数模型完整性得分低于50%。模型对自己输出的内容基本正确,但会遗漏大量信息。GPT-5.6 Terra (max)的准确性得分最高,为93.7%,但仍排在第10位,被完整性拖了后腿
➤ Anthropic模型领先源于完整性而非准确性:得分最高的模型都来自Anthropic,但它们的准确性与最强的OpenAI模型相当甚至更低,差距来自它们能覆盖专家参考答案的全部范围
我们感谢Wisedocs构建了MLCR,也感谢他们与我们合作将其引入Artificial Analysis!
本文由 AI 翻译自英文原帖,技术名词保留英文。
查看 X 原帖