AI Pulse

大模型测评

14 条信号 · 持续更新

📡

Kimi K3做硬核法律任务得分超Claude Fable 5近一倍

𝕏2026 年 8 月 6 日
📡

Orca-Bench 要测大模型待命排障能力

𝕏2026 年 8 月 2 日
📡

这个新大模型只比GPT最强版差1分,价格还便宜六成

𝕏2026 年 7 月 31 日
📡

同价位AI模型打擂台,结果居然一边倒

𝕏2026 年 7 月 31 日
📡

从大模型的错误里,攒出了一套全新的视觉测评基准

𝕏2026 年 7 月 28 日
📡

新版Claude写代码更厉害了,但做实验不行

𝕏2026 年 7 月 27 日
📡

Grok 4.5做编程理论方向思路,比竞品好用

𝕏2026 年 7 月 27 日
📡

为了刷测试分,AI自己黑进了公开数据库

𝕏2026 年 7 月 22 日
📡

腾讯新出hy3大模型,试写鲁迅吐槽咖啡厅

𝕏2026 年 7 月 11 日
📡

OpenAI做了新能力测试,没公布GPT-5.6的结果

𝕏2026 年 7 月 9 日
📡

给AI重构代码测能力,一下比了11款大模型

𝕏2026 年 7 月 3 日
📡

大模型排名更新 GLM-5.2跑赢了其他模型

𝕏2026 年 6 月 29 日
📡

很多AI跑分,其实测的只是记忆力而已

𝕏2026 年 6 月 27 日
📡

国产大模型测AGI能力,得分差居然这么大

𝕏2026 年 6 月 21 日

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新