AI Pulse

基准测试

6 篇文章 · 31 条信号 · 持续更新

📡

@j_dekoninck发布BrokenArXiv 和 ArXivMath 基准测试

𝕏2026 年 9 月 16 日
📡

对CadQuery和OpenSCAD做了智能CAD基准测试

𝕏2026 年 9 月 13 日
📡

NateSilver538 不建议关注预告知AI基准测试

𝕏2026 年 9 月 12 日
📖

模型是大脑,框架是手脚,AI基准只测大脑

AIAI Agent2026 年 9 月 11 日
📡

发布AutoResearchExam基准测试,测AI研究Agent

𝕏2026 年 9 月 10 日
📡

新研究测Claude Opus 5编码智能体得分仅23.9%

𝕏2026 年 9 月 8 日
📡

Prathkum质疑大模型基准测试只是虚荣指标

𝕏2026 年 9 月 7 日
📡

Apodex_AI 发布 TRACES 新基准测试

𝕏2026 年 9 月 5 日
📡

Proximal发布FrontierSWE 编码基准测试(millions of dollars)

𝕏2026 年 9 月 4 日
📡

阿里通义千问发布E-Commerce Bench 基准测试(¥100,000)

𝕏2026 年 9 月 3 日
📡

阿里通义发布CommerceAgentBench,Qwen3.8-Max获第一

𝕏2026 年 9 月 1 日
📖

GLM-5.3 与 Fable 5 同一水平,价格只要十分之一

AI大模型2026 年 8 月 30 日
📡

Accio开源CommerceAgentBench 基准测试集(27 years)

𝕏2026 年 8 月 26 日
📡

编码智能体基准更新,新增奖励作弊评分修正

𝕏2026 年 8 月 26 日
📖

AI药物预测排名因数据切分和误差波动大,勿信单一分数

AI药物研发生物信息学2026 年 8 月 23 日
📡

OpenCode发布Ox Alpha,实测碾压GPT-5.6-sol

𝕏2026 年 8 月 21 日
📡

Artificial Analysis发布AI代理搜索API基准榜

𝕏2026 年 8 月 19 日
📖

Qwen 3.8 27B 基准:medium 模式才是智能体编程首选

大语言模型AI2026 年 8 月 18 日
📖

Qwen3.8-27B混合架构多模态模型在DGX Spark上完成测试

AI大模型2026 年 8 月 17 日
📡

Artificial Analysis推出端点准确度指数,帮开发者选API

𝕏2026 年 8 月 5 日
📡

法律AI有了首个超大规模测试基准

𝕏2026 年 7 月 30 日
📡

通用AI基准不准,给你的代码测个专属的

𝕏2026 年 7 月 23 日
📡

AI agent拼长期任务,赢的居然不是点子最好的

𝕏2026 年 7 月 22 日
📡

大模型刷榜早就可以作弊,居然没人能实锤?

𝕏2026 年 7 月 21 日
📡

老牌基准测试pelican 已经跟不上当前模型能力了

𝕏2026 年 7 月 17 日
📡

AI搜索公司把自己用的测试题库开源了

𝕏2026 年 7 月 15 日
📡

Perplexity开源AI智能体研究基准WANDR

𝕏2026 年 7 月 15 日
📡

现有强化学习基准太假,新基准更贴合真实场景

𝕏2026 年 7 月 14 日
📡

顶尖代码AIAgent居然连六成任务都做不对

𝕏2026 年 7 月 12 日
📡

OpenAI审计发现热门AI编码基准SWE-Bench Pro失效

𝕏2026 年 7 月 9 日
📡

医疗AI高分 benchmark 其实根本不靠谱?

𝕏2026 年 7 月 6 日
📡

有人放出了Claude Sonnet 5的基准测试结果

𝕏2026 年 7 月 1 日
📡

做自动研究工作流,这个基准测试挺有用

𝕏2026 年 6 月 24 日
📖

查文档和代码,一个不知名AI工具竟击败了主流产品

AI企业应用2026 年 6 月 20 日
📡

OAI Evals团队连续三次发布Claude在OpenAI关注任务上表现更优的基准测试结果

𝕏2026 年 6 月 12 日
📡

AI语音客服对话最快2.4分钟完成,速度差一倍

𝕏2026 年 5 月 13 日
📡

Cursor配Claude Opus 4.7成全球第一编码代理

𝕏2026 年 5 月 12 日

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新