AI Pulse

AI评测

2 篇文章 · 35 条信号 · 持续更新

📡

给AI生物学能力设公开评测难题

𝕏2026 年 9 月 20 日
📡

实测对比Jev和DeepSeek V4.1 Flash分单效率

𝕏2026 年 9 月 19 日
📡

阶跃星辰Step 5 Preview得分追平国产头部模型

𝕏2026 年 9 月 19 日
📡

不同大模型训练阶段表现各有优劣

𝕏2026 年 9 月 19 日
📡

NateSilver538 不建议关注预告知AI基准测试

𝕏2026 年 9 月 12 日
📡

Apodex_AI 发布 TRACES 新基准测试

𝕏2026 年 9 月 5 日
📡

潜空间汇总GPT6-Astra评测结果

𝕏2026 年 9 月 4 日
📡

Perplexity Search 登顶搜索索引 推理成本最低

𝕏2026 年 8 月 29 日
📡

liquidai 发布端侧AI Pipette评测套件

𝕏2026 年 8 月 25 日
📡

Speech Agent Arena 实测主流语音对话模型

𝕏2026 年 8 月 21 日
📡

Qwen 3.8 27B跑分超GLM 5.2仅需几万硬件

𝕏2026 年 8 月 19 日
📡

GLM-5.3 得分达60,基座参数743B

𝕏2026 年 8 月 19 日
📡

GLM-5.3 得分60,能力不止编码

𝕏2026 年 8 月 19 日
📡

Z AI发布GLM-5.3,评测得分追平Kimi K3

𝕏2026 年 8 月 19 日
📡

Qwen3.8 27B 评测拿到了52分

𝕏2026 年 8 月 19 日
📡

7款AI判定同一场辩论胜负,结果出奇一致

𝕏2026 年 8 月 17 日
📡

DeepSeek发布新旗舰模型,涨价后仍在性价比前沿

𝕏2026 年 8 月 15 日
📖

只因询问基准测试遭删帖封号——DavidAU 390模型全面分析

大语言模型开源2026 年 8 月 13 日
📡

开发者实测Prime Agent 24小时分享使用体验评价

𝕏2026 年 8 月 7 日
📡

Multi-Agent Arena 开放免费对战大模型

𝕏2026 年 8 月 6 日
📡

EdotEnv 用量化交易环境训练LLM做研究

𝕏2026 年 8 月 5 日
📡

Homebench 能帮你测试本地大模型的性能

𝕏2026 年 8 月 4 日
📡

GPT-4.1返回的概率值居然位数不够用

𝕏2026 年 8 月 1 日
📡

DeepSeek新模型出来了,有人做了性能价格分析

𝕏2026 年 8 月 1 日
📡

AI编码助手要考试了,题目是用Supabase干活

𝕏2026 年 8 月 1 日
📡

测试榜第一的大模型,成本居然才对手一半

𝕏2026 年 7 月 26 日
📡

腾讯办AI编码榜,自家模型居然没拿一个第一

𝕏2026 年 7 月 25 日
📡

这个AI团队居然公开了全套测试数据集

𝕏2026 年 7 月 24 日
📡

开源工具能提前测出AI agent靠不靠谱了

𝕏2026 年 7 月 19 日
📡

大模型搜索能力比推理能力更强?这太反常识了

𝕏2026 年 7 月 19 日
📡

这个开源模型从不拒答任务,比Deepseek V4 Flash好用

𝕏2026 年 7 月 13 日
📖

新AI模型本地跑长文档更省内存,但推理可能打折

大模型NVIDIA2026 年 7 月 7 日
📡

人类专家要做二三十小时的题,AI抢先一步了

𝕏2026 年 7 月 2 日
📡

国内开源大模型GLM 5.2跑分超过了Claude

𝕏2026 年 6 月 29 日
📡

很多AI跑分,其实测的只是记忆力而已

𝕏2026 年 6 月 27 日
📡

本地跑国产大模型,速度对比GPT和Claude

𝕏2026 年 6 月 24 日
📡

Kimi K2.7没比Claude聪明,但胜在更快免费

𝕏2026 年 6 月 16 日

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新