AI Pulse
📡 X 信号

评估是阻碍企业AI原生转型的第一因素

一个热门观点:评估是阻碍企业成为AI原生企业的头号问题。如果你想了解评估,先读这篇文章,再读配套指南。手动调整prompt、试几个输入的作用是有限的;评估才是让智能体做好部署准备,并在上线后持续正常运行的关键。

首先,给出一些定义……

- 评估:应用于轨迹的评分器。
- 评分器:任何能为智能体的表现打分的东西,从简单的代码检查到充当裁判的LLM都算。
- 轨迹:一次智能体运行的完整记录:输入、它采取的每一步,以及输出。

举个例子,客户问“我的退款在哪?”,智能体先调用search_orders,再调用issue_refund,然后回复“退款已发出,3-5个工作日到账。”

接下来,我们深入聊聊评分器……评分器分几类,大多数实际应用场景都会对同一条轨迹使用多个评分器。

1)确定性检查。就是纯代码,不涉及模型。智能体是不是正好调用了一次issue_refund,并且使用的是查询到的正确订单ID?重复退款或者给错误订单退款会直接不通过。

2)参考答案评分器。将输出和存储在用例里的参考答案对比,可以是精确匹配,也可以让LLM裁判检查语义是否匹配。

3)评分标准评分器。LLM裁判根据标准给输出打分,不需要参考答案。回复是否简洁?有没有说明清楚情况?

4)轨迹评分器。这类评分器给智能体采取的步骤打分,而不只是给最终答案打分。它在退款前有没有查询订单?先直接调用issue_refund再查询订单的运行,哪怕最终回复看起来完全正确,也不会通过。

在线评估和离线评估有什么区别?在线评估监测生产环境。离线评估在你的实验室里运行:在任何内容发布前,按需运行或是在持续集成中运行。

- 两种都需要。只有在线评估没有离线评估意味着你能发现问题,但没法安全地修复问题。
- 只有离线评估没有在线评估意味着你测试的是自己想象出来的场景,而不是用户实际遇到的场景。
- 将二者连接起来的是升级,就是把生产环境出问题的轨迹转成离线测试用例。

接下来,评估驱动开发……评估驱动开发就是针对智能体行为的测试驱动开发。

1)定义测试用例和它的通过标准。
2)运行并观察它不通过。
3)修改智能体。
4)再次运行。重复步骤3和4,直到通过。
5)运行整个数据集,而不只是这一个用例,来捕捉回归问题。

每个测试用例都要运行多次(k次),并明确设置标准:对于不允许任何一次失败的高风险行为,要求k次全部通过;或者允许一定波动的情况下,要求k次里成功n次,比如3次里成功2次。

综上,在线评估发现问题,升级将问题转为测试用例,循环在离线环境修复问题,不断增长的数据集确保问题得到永久修复。

点击这里阅读我们完整的评估指南:

本文由 AI 翻译自英文原帖,技术名词保留英文。

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新