📡
研究者实测四款大模型 结果和AAII差异很大
𝕏2026 年 9 月 24 日
📡
MiMo发布V2.6 Pro,相同性能成本仅1/20
𝕏2026 年 9 月 23 日
📡
MiMo v2.6 Pro 智能比肩Grok 4.7
𝕏2026 年 9 月 22 日
📡
实测对比后,称 Anthropic 方向比 OpenAI 领先
𝕏2026 年 9 月 21 日
📡
Fable 5.1文档OCR性能实测提升
𝕏2026 年 9 月 3 日
📡
相同prompt高推理测试下 Fable 5.1比GPT 5.6 Sol更贵更慢
𝕏2026 年 9 月 2 日
📡
MLCR-AA发布医疗AI推理榜单,Claude Fable 5居首
𝕏2026 年 8 月 22 日
📡
Qwen 27B本地模型 复杂任务表现不及竞品
𝕏2026 年 8 月 19 日
📡
@mertcobanov实测Qwen 3.8 27B在不同设备速度
𝕏2026 年 8 月 16 日
📡
Kimi K3做硬核法律任务得分超Claude Fable 5近一倍
𝕏2026 年 8 月 6 日
📡
Orca-Bench 要测大模型待命排障能力
𝕏2026 年 8 月 2 日
📡
这个新大模型只比GPT最强版差1分,价格还便宜六成
𝕏2026 年 7 月 31 日
📡
同价位AI模型打擂台,结果居然一边倒
𝕏2026 年 7 月 31 日
📡
从大模型的错误里,攒出了一套全新的视觉测评基准
𝕏2026 年 7 月 28 日
📡
新版Claude写代码更厉害了,但做实验不行
𝕏2026 年 7 月 27 日
📡
Grok 4.5做编程理论方向思路,比竞品好用
𝕏2026 年 7 月 27 日
📡
为了刷测试分,AI自己黑进了公开数据库
𝕏2026 年 7 月 22 日
📡
腾讯新出hy3大模型,试写鲁迅吐槽咖啡厅
𝕏2026 年 7 月 11 日
📡
OpenAI做了新能力测试,没公布GPT-5.6的结果
𝕏2026 年 7 月 9 日
📡
给AI重构代码测能力,一下比了11款大模型
𝕏2026 年 7 月 3 日
📡
大模型排名更新 GLM-5.2跑赢了其他模型
𝕏2026 年 6 月 29 日
📡
很多AI跑分,其实测的只是记忆力而已
𝕏2026 年 6 月 27 日
📡
国产大模型测AGI能力,得分差居然这么大
𝕏2026 年 6 月 21 日