AI工程师必须掌握的11种大模型评估方法
AI工程师必须了解的11种大语言模型评估方法:(收藏这条推文)
大语言模型评估的棘手之处在于,没有单一指标能告诉你一个系统是否优秀。正确的评估方法取决于你想要测量的对象。
你可能想要将输出与已知答案进行比对,判断它在语义上是否正确,检查智能体在多个步骤中的行为,或是在不安全输出到达用户之前进行拦截。
一个有效的分类方式是按它们实际评估的内容来组织。
基于参考的评估:存在真值时
→ BLEU测量n元语法精确率,检查生成文本与参考文本的重叠程度。
→ ROUGE更关注召回率,测量参考内容出现在输出中的比例。
→ BERTScore不对比精确单词,而是对比上下文嵌入,因此语义相似的答案也能得到高分。
基于评判的评估:真值不存在或不完整时
→ G-Eval使用大语言模型根据定义的标准为输出打分。
→ LLM-as-Judge给模型一份评分表,让它为输出打分或进行比较。
→ LLM Juries运行多个独立评判并汇总结果,减少对单个评估者的依赖。
人工和确定性评估
→ 人工评估依赖人类从正确性、相关性、有用性等多个维度为输出打分。
→ 基于DAG的评估将评估编码为确定性决策逻辑,让输出经过明确检查,最终得出结论。
面向智能体的评估
→ 轨迹准确度评估的是智能体采取的行动序列,而不仅仅是最终答案。
→ 多轮评估对整个对话过程中的行为打分,包括一致性、记忆和多轮之间的连贯性。
作为准入关卡的评估
→ 安全评估在输出被接受前,会检查毒性、偏见、敏感数据泄露和违反政策等问题。
重点是这些方法是互补的。一个生产环境中的智能体可能需要:基于参考的评估来确保正确性,基于评判的评估来衡量主观质量,轨迹评估来检查工具使用,以及在任何内容到达用户之前进行安全评估。
如果你正在构建这个评估层,Comet的Opik将追踪、调试、测试套件和智能体评估整合到一个开源堆栈中。去GitHub查看吧:(别忘了点亮星标🌟)
我还写了一篇更深入的分析,讲解评估如何适配生产可观测性和自修复循环。全文如下。
本文由 AI 翻译自英文原帖,技术名词保留英文。
查看 X 原帖