📡
给AI生物学能力设公开评测难题
𝕏2026 年 9 月 20 日
📡
实测对比Jev和DeepSeek V4.1 Flash分单效率
𝕏2026 年 9 月 19 日
📡
阶跃星辰Step 5 Preview得分追平国产头部模型
𝕏2026 年 9 月 19 日
📡
不同大模型训练阶段表现各有优劣
𝕏2026 年 9 月 19 日
📡
NateSilver538 不建议关注预告知AI基准测试
𝕏2026 年 9 月 12 日
📡
Apodex_AI 发布 TRACES 新基准测试
𝕏2026 年 9 月 5 日
📡
潜空间汇总GPT6-Astra评测结果
𝕏2026 年 9 月 4 日
📡
Perplexity Search 登顶搜索索引 推理成本最低
𝕏2026 年 8 月 29 日
📡
liquidai 发布端侧AI Pipette评测套件
𝕏2026 年 8 月 25 日
📡
Speech Agent Arena 实测主流语音对话模型
𝕏2026 年 8 月 21 日
📡
Qwen 3.8 27B跑分超GLM 5.2仅需几万硬件
𝕏2026 年 8 月 19 日
📡
GLM-5.3 得分达60,基座参数743B
𝕏2026 年 8 月 19 日
📡
GLM-5.3 得分60,能力不止编码
𝕏2026 年 8 月 19 日
📡
Z AI发布GLM-5.3,评测得分追平Kimi K3
𝕏2026 年 8 月 19 日
📡
Qwen3.8 27B 评测拿到了52分
𝕏2026 年 8 月 19 日
📡
7款AI判定同一场辩论胜负,结果出奇一致
𝕏2026 年 8 月 17 日
📡
DeepSeek发布新旗舰模型,涨价后仍在性价比前沿
𝕏2026 年 8 月 15 日
📖
只因询问基准测试遭删帖封号——DavidAU 390模型全面分析
大语言模型开源2026 年 8 月 13 日
📡
开发者实测Prime Agent 24小时分享使用体验评价
𝕏2026 年 8 月 7 日
📡
Multi-Agent Arena 开放免费对战大模型
𝕏2026 年 8 月 6 日
📡
EdotEnv 用量化交易环境训练LLM做研究
𝕏2026 年 8 月 5 日
📡
Homebench 能帮你测试本地大模型的性能
𝕏2026 年 8 月 4 日
📡
GPT-4.1返回的概率值居然位数不够用
𝕏2026 年 8 月 1 日
📡
DeepSeek新模型出来了,有人做了性能价格分析
𝕏2026 年 8 月 1 日
📡
AI编码助手要考试了,题目是用Supabase干活
𝕏2026 年 8 月 1 日
📡
测试榜第一的大模型,成本居然才对手一半
𝕏2026 年 7 月 26 日
📡
腾讯办AI编码榜,自家模型居然没拿一个第一
𝕏2026 年 7 月 25 日
📡
这个AI团队居然公开了全套测试数据集
𝕏2026 年 7 月 24 日
📡
开源工具能提前测出AI agent靠不靠谱了
𝕏2026 年 7 月 19 日
📡
大模型搜索能力比推理能力更强?这太反常识了
𝕏2026 年 7 月 19 日
📡
这个开源模型从不拒答任务,比Deepseek V4 Flash好用
𝕏2026 年 7 月 13 日
📖
新AI模型本地跑长文档更省内存,但推理可能打折
大模型NVIDIA2026 年 7 月 7 日
📡
人类专家要做二三十小时的题,AI抢先一步了
𝕏2026 年 7 月 2 日
📡
国内开源大模型GLM 5.2跑分超过了Claude
𝕏2026 年 6 月 29 日
📡
很多AI跑分,其实测的只是记忆力而已
𝕏2026 年 6 月 27 日
📡
本地跑国产大模型,速度对比GPT和Claude
𝕏2026 年 6 月 24 日
📡
Kimi K2.7没比Claude聪明,但胜在更快免费
𝕏2026 年 6 月 16 日