AI Pulse
📡 X 信号

Artificial Analysis发布Artificial Analysis Intelligence Index v4.2(4.2)

Artificial Analysis发布Artificial Analysis Intelligence Index v4.2(4.2)

宣布发布 Artificial Analysis Intelligence Index v4.2。我们正在加速推进即将推出的 v5 版本的各项内容,现在推出本次过渡更新,以跟上前沿发展的步伐。

v4.2 版本包含更复杂、更贴近现实的任务,以及更多私有测试集来防止投机。v4.2 版本更新日志:+ AA-Briefcase,我们的智能体知识工作评估,配有私有测试集 + @HelloSurgeAI 的 GDP.pdf,跨 4592 页 PDF 的长上下文文档推理 - GPQA Diamond,这是一项出色的科学推理评估,目前已经达到饱和……此外,我们提高了留出测试集的权重来防止投机,并升级了评分基础设施以提升鲁棒性。

本次更新让指数更贴近真实用例,加入了更具挑战性、更复杂、更贴近现实的任务和私有测试集来防止投机。我们已经规划和构建 v5 版本的各项内容有好几个月了——距离我们在 1 月推出 v4 版本已经过去 8 个月。我们此前故意推迟更新,以便在近期各大模型发布期间保持指数稳定。但随着近几周前沿发展速度极快,我们认为有必要立即推出一次过渡更新,确保指数对用户而言依旧保持相关性和实用性。

除本次过渡更新外,我们团队正在全力开发 v5 版本。我们计划在不久的将来推出更多增量版本。敬请关注!

Intelligence Index v4.2 详细变更:
➤ 新增 AA-Briefcase:这项内部评估配有私有留出测试集,AA-Briefcase 测试模型在行业专家构建的复杂项目中完成真实智能体知识工作任务的能力。模型会在为期数周的知识工作项目中接受评估,每个项目包含多个关联任务和数千个输入源文件。AA-Briefcase 结合评分规则和成对比较来评估可验证任务完成度、分析质量和演示质量,全面呈现知识工作中整体智能体能力。

➤ 新增 GDP.pdf:由 @HelloSurgeAI 创建,GDP.pdf 评估跨 100 份 PDF 和 10 个领域的单轮专业文档推理能力。模型必须综合分布在 4592 页中的证据,包括文本、表格、图表、脚注和排除项。回答会根据 1275 条由专家编写的原子标准评分;全通过率指标仅在所有标准都满足时才给该任务计分。

➤ 调整权重以衡量真实使用并防止投机:现在指数权重中 40% 是私有留出测试集,这是 v4.1 版本的两倍。留出数据包括 AA-Briefcase、AA-Omniscience 和 CritPt 的解决方案。这降低了实验室投机评估的可能性。留出数据的比例在 v5 版本中会进一步提升。

➤ 升级评分基础设施:在 AA-LCR v1.1 中,我们新增了评分系统提示,并修正了答案键中的错误和歧义,提升了评分准确性。对于 GDPval-AA v2 和 AA-Briefcase,我们改进了采样并重新锚定了 Elo 标度,让比率……

本文由 AI 翻译自英文原帖,技术名词保留英文。

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新