AI评分不靠谱?我们做了新的开源评估标准
我一直都感觉到,对于智能体来说,「大语言模型当裁判」(LLM-as-a-judge)的效果正在不断下降,某天喝咖啡的时候,@mitch_troy 的一通吐槽帮我理清了原因。
智能体的真实基准不是它的输出,而是智能体**应该如何行为**。
这一点很重要,原因有两个:(1)生成高质量的真实基准数据非常困难,(2)要想有效调试智能体为什么会产出无效输出,你必须对它的行为进行内省。
Mitch 接着解释了为什么这件事对他们团队做的税务智能体来说这么难。这些行为本身非常微妙,是他们在 Braintrust 分析了大量失败追踪轨迹后换来的宝贵经验教训,而要想有效标记出这些行为,你必须先把它们清晰记录下来。
这场讨论推动我们打造了行为规范(behavior specs):这是我们和 @trybasis 一起发布的全新开放标准,用来记录智能体应当如何行为。
代码仓库包含了该规范的定义,还有开源示例,讲解如何编写优质规范、如何用它评估智能体等等。
清晰、由人类表述的自然语言,是推动智能体系统产出优质结果最高效的方式。行为规范提供了一个框架,让你可以结合评估来实现这一点。
我非常开心能在开放社区做这个项目,也非常希望得到其他人的反馈,帮我们把这个规范做得尽可能好用。欢迎大家试用,分享你的想法!
本文由 AI 翻译自英文原帖,技术名词保留英文。
查看 X 原帖