AI Pulse
📡 X 信号

AI领域evals并不复杂,一文带你理清核心概念

要真正理解 AI,你需要理解评估(evals)。而且它们没有你想的那么可怕。我请@Vtrivedy10给我好好上了一课评估课,一下子就想通了。以下是我们通话的记录:

简单模式:评估到底是什么

- 评估就是测试 AI 智能体做的事是不是正确的
- “正确”的核心在于把你/你的组织认为正确的东西编码进软件里
- Viv 给我举了一个例子:一个负责记录客户会议、撰写跟进草稿并在发送前暂停的 GTM 智能体
- 在这个场景下,评估可以检查客户会议是否已记录、跟进草稿是否已撰写、智能体是否在发送前暂停
- 评估其实不是新东西,它们只是单元测试的进化版,单元测试在软件工程里一直存在
- 搭建评估的流程其实非常简单:智能体 + 系统 + 任务 + 验证器
- 在 GTM 智能体的例子里,你的智能体拥有 Salesforce 的读写权限,有一组任务(比如更新线索状态、记录通话、撰写跟进内容),还有一个验证器(负责判断任务是否正确完成的工具)
- 验证器可以是一个简单的 Python 函数,也可以是内容/文本检查
- 对于无法直接验证的任务,评分规则是把“好的表现”标准化的好方法,这样验证器依然能工作
- 一旦制定好评分规则,如果智能体表现不佳,根本原因可能是:检查清单不完整、模型不够智能、上下文不好/不完整,或是提示词不够好

困难模式:智能体环境到底是什么

- 环境 = 智能体开展工作、我们测量它表现的地方
- 当我们从“文字进文字出”的ChatGPT 时代转向“提示词进、真实世界工作出”的智能体时代,环境就成了必需品
- 举例:对于 Claude Code/Codex,当它们在你的电脑上工作时,环境就是文件、浏览器、邮件、应用、权限
- 你现在搭建的智能体环境,是对现有工具的 recreations 模拟,对智能体来说看起来真实,但实际上不是真实环境(不会覆盖生产环境)
- 基本上,你这么做是为了能够测试智能体的性能,同时不会搞乱你公司的在线系统/数据

搭建智能体+评估的需求:
(1) 按团队管理任务(GTM ≠ 软件工程),
(2) 团队专属环境,
(3) 不用自己搭建全部基础设施就能规模化运行

目前有一个流行的用来搭建智能体环境的开源框架叫 Harbor,它提供了运行评估所需的全部智能体环境抽象,你不用自己管理所有内容,但需要的时候可以深入底层。

Harbor 的基础组件覆盖:环境搭建、验证器搭建、指令搭建、沙箱基础设施。

新手路径:找一个现成的 Harbor 格式评估 → 让 Claude Code/Codex 解释 → 针对你的智能体调整。

LangSmith Engine 可以规模化做评估;它提供的 UI 可以让不用写代码的人判断输出好坏并给出反馈。

你可以通过在环境中运行多个真实智能体/模型(比如前沿模型 + GLM + 小参数量 Qwen)并寻找异常模式来验证环境。

环境工程和智能体工程一样是迭代的;由人类搭建并审核输出。

要规模化做评估,你需要一个评估套件。评估套件是你的公司运行的一组智能体任务集合。每个任务都由输入提示词、一个验证器和环境组成。

每当有新模型推出,你就可以运行你的评估套件(或是套件里的部分任务),权衡成本、速度和智能之间的取舍。

上帝模式:自我改进智能体到底是什么

持续循环:智能体在真实世界工作 → 生产数据 → 将生产数据转化为评估(并用评估改进) → 持续改进智能体。

热门观点:如果你的团队非常擅长把生产数据转化为评估,你就能持续改进智能体。

评估的存在就是为了找到失败;然后修改智能体让那个失败不再发生。

改进有两个方向:工具工程调整和小模型微调。

工具工程调整(低成本的起步方式):调整提示词、工具定义/描述、模型选择、模型组合(比如 Sol+Opus,GLM+Opus)。

微调(针对你特定的生产任务):开源模型和微调基础设施都已经存在;在特定任务上效果能媲美 Opus,成本却只有大约十分之一;GTM 智能体不需要前沿模型的数学能力。

上帝模式 = 收集真实生产数据 → 转化为评估/环境 → 选择改进方式(先做工具工程调整;之后再针对特定任务做自有微调)。

瓶颈通常出在人类更新验证器/评分规则这一步。

关于自主性有两个问题:如何加快循环;能不能不用人类介入就能运行?

目标是:最小化循环里的人类接触点。

对于正在使用智能体的组织来说,智能体追踪(Agent Traces)是第一个实用步骤。

追踪 = 对每个动作、工具调用的日志。

人类没办法很好地推理智能体会做什么;查看实时行为(也就是追踪)能让对错一目了然。

看到坏结果 → 查看追踪(记录) → 找到错误步骤 → 修改智能体避免重复犯错。

随着更智能的模型发布,人类介入点会不断减少。

现在人类的首要工作(前置工作)是告诉挖掘/改进智能体好坏的标准(即要寻找的行为提示);大部分工作都是前置的,后续只需要少量修改。

之后智能体就可以自己找到失败的工具调用、不遵循指令的问题等等,还能提出改进方案(新提示词、新的/不同的工具等等)。

有了好的评估套件或是好的生产坏行为测量,智能体可以 overnight 运行,非常擅长提出修复方案。

人类的第二个工作:在把生产数据转化为评估/环境时,审核公司关心的内容。

对组织来说杠杆率最高的行动就是:由人类写下“好表现”的定义。

如果你想观看我和@Vtrivedy10关于评估的完整对话,订阅我的YouTube频道。本集将于本周晚些时候上线。

本文由 AI 翻译自英文原帖,技术名词保留英文。

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新