📡
@j_dekoninck发布BrokenArXiv 和 ArXivMath 基准测试
𝕏2026 年 9 月 16 日
📡
对CadQuery和OpenSCAD做了智能CAD基准测试
𝕏2026 年 9 月 13 日
📡
NateSilver538 不建议关注预告知AI基准测试
𝕏2026 年 9 月 12 日
📖
模型是大脑,框架是手脚,AI基准只测大脑
AIAI Agent2026 年 9 月 11 日
📡
发布AutoResearchExam基准测试,测AI研究Agent
𝕏2026 年 9 月 10 日
📡
新研究测Claude Opus 5编码智能体得分仅23.9%
𝕏2026 年 9 月 8 日
📡
Prathkum质疑大模型基准测试只是虚荣指标
𝕏2026 年 9 月 7 日
📡
Apodex_AI 发布 TRACES 新基准测试
𝕏2026 年 9 月 5 日
📡
Proximal发布FrontierSWE 编码基准测试(millions of dollars)
𝕏2026 年 9 月 4 日
📡
阿里通义千问发布E-Commerce Bench 基准测试(¥100,000)
𝕏2026 年 9 月 3 日
📡
阿里通义发布CommerceAgentBench,Qwen3.8-Max获第一
𝕏2026 年 9 月 1 日
📖
GLM-5.3 与 Fable 5 同一水平,价格只要十分之一
AI大模型2026 年 8 月 30 日
📡
Accio开源CommerceAgentBench 基准测试集(27 years)
𝕏2026 年 8 月 26 日
📡
编码智能体基准更新,新增奖励作弊评分修正
𝕏2026 年 8 月 26 日
📖
AI药物预测排名因数据切分和误差波动大,勿信单一分数
AI药物研发生物信息学2026 年 8 月 23 日
📡
OpenCode发布Ox Alpha,实测碾压GPT-5.6-sol
𝕏2026 年 8 月 21 日
📡
Artificial Analysis发布AI代理搜索API基准榜
𝕏2026 年 8 月 19 日
📖
Qwen 3.8 27B 基准:medium 模式才是智能体编程首选
大语言模型AI2026 年 8 月 18 日
📖
Qwen3.8-27B混合架构多模态模型在DGX Spark上完成测试
AI大模型2026 年 8 月 17 日
📡
Artificial Analysis推出端点准确度指数,帮开发者选API
𝕏2026 年 8 月 5 日
📡
法律AI有了首个超大规模测试基准
𝕏2026 年 7 月 30 日
📡
通用AI基准不准,给你的代码测个专属的
𝕏2026 年 7 月 23 日
📡
AI agent拼长期任务,赢的居然不是点子最好的
𝕏2026 年 7 月 22 日
📡
大模型刷榜早就可以作弊,居然没人能实锤?
𝕏2026 年 7 月 21 日
📡
老牌基准测试pelican 已经跟不上当前模型能力了
𝕏2026 年 7 月 17 日
📡
AI搜索公司把自己用的测试题库开源了
𝕏2026 年 7 月 15 日
📡
Perplexity开源AI智能体研究基准WANDR
𝕏2026 年 7 月 15 日
📡
现有强化学习基准太假,新基准更贴合真实场景
𝕏2026 年 7 月 14 日
📡
顶尖代码AIAgent居然连六成任务都做不对
𝕏2026 年 7 月 12 日
📡
OpenAI审计发现热门AI编码基准SWE-Bench Pro失效
𝕏2026 年 7 月 9 日
📡
医疗AI高分 benchmark 其实根本不靠谱?
𝕏2026 年 7 月 6 日
📡
有人放出了Claude Sonnet 5的基准测试结果
𝕏2026 年 7 月 1 日
📡
做自动研究工作流,这个基准测试挺有用
𝕏2026 年 6 月 24 日
📖
查文档和代码,一个不知名AI工具竟击败了主流产品
AI企业应用2026 年 6 月 20 日
📡
OAI Evals团队连续三次发布Claude在OpenAI关注任务上表现更优的基准测试结果
𝕏2026 年 6 月 12 日
📡
AI语音客服对话最快2.4分钟完成,速度差一倍
𝕏2026 年 5 月 13 日
📡
Cursor配Claude Opus 4.7成全球第一编码代理
𝕏2026 年 5 月 12 日