AI Pulse

AI测试

13 条信号 · 持续更新

📡

测试显示fable 5.2表现优于gpt 6 astra

𝕏2026 年 9 月 18 日
📡

用户测试基于Qwen 4B改造的OpenJev,凸显本家Jev稳定性

𝕏2026 年 9 月 18 日
📡

TesterArmy获120万美元融资,用AI做应用测试

𝕏2026 年 9 月 15 日
📡

GPT-6 Astra 测空间推理得分仅 14%

𝕏2026 年 9 月 7 日
📡

曝Kimi新模型K3.1正在匿名测试中

𝕏2026 年 8 月 21 日
📡

OpenRouter正在测试未公开的Ox-Alpha新模型

𝕏2026 年 8 月 21 日
📡

Apple 测试发现大模型根本不会做小学数学

𝕏2026 年 8 月 16 日
📡

RealReplicaBench 改了AI测试的评判标准

𝕏2026 年 8 月 6 日
📡

AIbenchmark ARC-AGI-3,测评分规则更新了

𝕏2026 年 7 月 30 日
📡

本来是开玩笑提的需求,AI真做出来一篇论文

𝕏2026 年 7 月 25 日
📡

Meta内部测试显示,新模型编码能力接近头部

𝕏2026 年 7 月 10 日
📡

大语言模型能通过镜子测试吗?这问题吵翻了

𝕏2026 年 6 月 29 日
📡

它用真AI跑出20个真实任务

𝕏2026 年 4 月 18 日

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新