AI Pulse
📡 X 信号

如何构建好用的AI评估系统且避开常见问题

你应当把评估系统理解为,保存过去的工作成果,用新模型、新提示词或新能力重新运行,以此验证性能是否得到提升。这套方法能帮你实现三个目标:第一,明确故障位置,方便向老板或用户同步;第二,持续优化直到性能提升;第三,让方案能在更便宜的开源模型上运行。

评估工作中90%的工作量是衡量性能是否提升,仅10%是基础设施搭建。基础设施部分,你只需要让智能体按照Harbor任务格式,把任务存储在Cloudflare R2中——这是一种低成本甚至免费的云存储服务。

存储时需要保存任务指令,以及任务开始前的文件夹状态,确认智能体能获取到你当时可以访问的全部文件,且文件状态保持一致。运行任务时,智能体需要拉取文件,启动docker容器——这是你本地计算机上的一个沙箱,可避免智能体提前看到答案——再发送任务指令。最好复制你的身份认证凭证,这样就能使用你已有的codex或Claude订阅,否则需要花费额外成本购买API令牌。

还有一个实用技巧:对智能体需要调用的工具进行模拟。比如如果智能体通常需要读取Slack频道、搜索谷歌或者查找你的文档,只需要模拟返回结果即可,不用对接真实服务。不这么做的话,每次运行都会得到不同的结果,无法稳定对比。

接下来是核心的性能衡量部分。得到不同模型、不同提示词或能力的任务输出后,你需要一套评分方法判断输出质量,否则无法优化。目前共有三类评估方式:人工评估、模型评估、代码评估。

人工评估速度最慢、成本最高,但如果有领域专家参与,通常准确性也是最高的。操作上要尽量把AI输出放到专家日常的工作环境里:给编辑看的AI修改要放到Google Docs的评论里;工程师评审要放在实际的PR(拉取请求)里;营销人员看文案要放在Notion或他们常用的工具里。

这样做能降低认知负荷,因为专家的时间非常宝贵,数据标注本身又很枯燥。要充分利用专家时间,可以和专家通电话,让他们直接说出对输出的好恶,之后再用AI把通话转写文本整理成结构化数据。拿到专家反馈后,可以训练AI评分模型,不断调整提示词直到模型评分和人工评分的一致率达到90%。

之后就可以开展A/B测试,针对原始任务优化提示词或能力,让模型自动评分,直到找到性能更好、成本更低的方案。评分最好用简单的是/否问题,给每个正确或错误的具体表现分别赋值1或0,这样评分就不会产生歧义。比如可以问:这篇文章是否出现特定的AI生成痕迹,每个类型的痕迹单独判断;演示文档是否使用了品牌规定颜色;代码是否符合团队编码规范。

模型评估比人工评估成本更低、速度更快,只要评分模型可靠,就能运行更多测试,自动优化智能体。做到这一步,你就已经跻身目前全球Top 5%的AI使用者之列,你会有明确的数据证明哪些方案有效、哪些无效,还能清晰看到技术前沿的变化。

当你分析数据时,你会对自己的领域产生新的认识,这时你会发现人工不是评估的上限。很多时候领域专家也会出错,而通过这套方法你可以探索出远超人工的结果。如果想要更复杂的方案,可以投入构建类似强化学习环境的评估系统,用确定性代码大规模快速低成本运行测试,这块内容就不在本文展开了。

祝你搭建评估系统顺利,当前AI在这块做得还不够好,做好这件事能带来很好的职业发展机会。

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新