AI Pulse

AI评估

17 条信号 · 持续更新

📡

Sean和Daniel发布Jev评估模型新教程

𝕏2026 年 9 月 20 日
📡

百名顶尖AI专家提出AI外部评估要求

𝕏2026 年 9 月 19 日
📡

METR披露机构运作:不接受前沿AI公司捐款

𝕏2026 年 9 月 17 日
📡

@Vtrivedy10(LangChain实验室负责人)发布AI评估38分钟大师课(38分钟)

𝕏2026 年 9 月 15 日
📡

LLM裁判意见一致就该相信吗?

𝕏2026 年 9 月 15 日
📡

Artificial Analysis 成为韩国主权AI项目评估方

𝕏2026 年 9 月 14 日
📡

AI领域evals并不复杂,一文带你理清核心概念

𝕏2026 年 9 月 9 日
📡

AISecurityInst 开源 optstop 评估工具

𝕏2026 年 8 月 28 日
📡

Google DeepMind试点行业首个前沿AI双盲评估

𝕏2026 年 8 月 27 日
📡

编码智能体基准更新,新增奖励作弊评分修正

𝕏2026 年 8 月 26 日
📡

Meta AI 发布 WildArtifactBench 多模态测试框架

𝕏2026 年 8 月 21 日
📡

花99美元用老文字游戏测大模型

𝕏2026 年 7 月 23 日
📡

AI 能力不能用单个数字评分?得换算法了

𝕏2026 年 7 月 3 日
📡

有人推出新评估修复了GSM8k验证错误

𝕏2026 年 6 月 28 日
📡

扩散Transformer生成模型推出了统一评估基准

𝕏2026 年 6 月 24 日
📡

AI安全核心问题:稳健模型行为评估的形式化自动化

𝕏2026 年 6 月 22 日
📡

Hugging Face数据集排行榜能按参数大小筛选了

𝕏2026 年 5 月 21 日

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新