AI Pulse

大模型评测

1 篇文章 · 20 条信号 · 持续更新

📡

Lanyon AI 称主流前沿AI都算不对基础科学方程

𝕏2026 年 8 月 4 日
📡

Deepseek v4 Flash 0731 跑分超越GPT 5.6 Luna 成本准确率双优

𝕏2026 年 8 月 3 日
📡

AI评测基准正在升级,现在要考建三维场景了

𝕏2026 年 8 月 2 日
📡

这套自研AI系统跑分,已经超过了GPT-5.5

𝕏2026 年 7 月 31 日
📡

让AI代理做AI研究,结果全被作者拒了

𝕏2026 年 7 月 31 日
📡

蒸馏大模型后,内容审核机制没传下来

𝕏2026 年 7 月 31 日
📖

启用两个设置使我们在ARC-AGI-3基准测试中的得分提升三倍

AIOpenAI2026 年 7 月 30 日
📡

原来AI排名,测的不只是模型本身

𝕏2026 年 7 月 30 日
📡

有人说Opus 5文案烂写代码也没变强

𝕏2026 年 7 月 26 日
📡

英国机构公布了对Kimi K3网络能力的初步评估

𝕏2026 年 7 月 25 日
📡

Kimi K3在AA-Briefcase评分仅次于Fable 5

𝕏2026 年 7 月 22 日
📡

大模型搜索能力比推理能力更强?这太反常识了

𝕏2026 年 7 月 19 日
📡

Kimi K3软件工程性能追平Claude Fable 5,只要三成价格

𝕏2026 年 7 月 18 日
📡

英国官方AI机构要测月之暗面Kimi K3

𝕏2026 年 7 月 18 日
📡

有人出了Kimi K3 全方位分析,蹲结果

𝕏2026 年 7 月 17 日
📡

老牌基准测试pelican 已经跟不上当前模型能力了

𝕏2026 年 7 月 17 日
📡

装越多AI技能插件,模型反而变弱了

𝕏2026 年 7 月 12 日
📡

给大模型出了道新测试题:你会偷懒省事吗?

𝕏2026 年 7 月 10 日
📡

顶尖大模型测医疗推理,结果居然说不合格

𝕏2026 年 6 月 26 日
📡

30个顶尖大模型比画SVG,居然是人来打分

𝕏2026 年 6 月 25 日
📡

测了大模型做游戏:贵十倍的模型做出来差不多

𝕏2026 年 6 月 17 日

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新