📡
Lanyon AI 称主流前沿AI都算不对基础科学方程
𝕏2026 年 8 月 4 日
📡
Deepseek v4 Flash 0731 跑分超越GPT 5.6 Luna 成本准确率双优
𝕏2026 年 8 月 3 日
📡
AI评测基准正在升级,现在要考建三维场景了
𝕏2026 年 8 月 2 日
📡
这套自研AI系统跑分,已经超过了GPT-5.5
𝕏2026 年 7 月 31 日
📡
让AI代理做AI研究,结果全被作者拒了
𝕏2026 年 7 月 31 日
📡
蒸馏大模型后,内容审核机制没传下来
𝕏2026 年 7 月 31 日
📖
启用两个设置使我们在ARC-AGI-3基准测试中的得分提升三倍
AIOpenAI2026 年 7 月 30 日
📡
原来AI排名,测的不只是模型本身
𝕏2026 年 7 月 30 日
📡
有人说Opus 5文案烂写代码也没变强
𝕏2026 年 7 月 26 日
📡
英国机构公布了对Kimi K3网络能力的初步评估
𝕏2026 年 7 月 25 日
📡
Kimi K3在AA-Briefcase评分仅次于Fable 5
𝕏2026 年 7 月 22 日
📡
大模型搜索能力比推理能力更强?这太反常识了
𝕏2026 年 7 月 19 日
📡
Kimi K3软件工程性能追平Claude Fable 5,只要三成价格
𝕏2026 年 7 月 18 日
📡
英国官方AI机构要测月之暗面Kimi K3
𝕏2026 年 7 月 18 日
📡
有人出了Kimi K3 全方位分析,蹲结果
𝕏2026 年 7 月 17 日
📡
老牌基准测试pelican 已经跟不上当前模型能力了
𝕏2026 年 7 月 17 日
📡
装越多AI技能插件,模型反而变弱了
𝕏2026 年 7 月 12 日
📡
给大模型出了道新测试题:你会偷懒省事吗?
𝕏2026 年 7 月 10 日
📡
顶尖大模型测医疗推理,结果居然说不合格
𝕏2026 年 6 月 26 日
📡
30个顶尖大模型比画SVG,居然是人来打分
𝕏2026 年 6 月 25 日
📡
测了大模型做游戏:贵十倍的模型做出来差不多
𝕏2026 年 6 月 17 日