AI Pulse
📡 X 信号

AI工程师必须掌握的11种大模型评估方法

AI工程师必须掌握的11种大模型评估方法

AI工程师必须了解的11种大语言模型评估方法:(收藏这条推文)

大语言模型评估的棘手之处在于,没有单一指标能告诉你一个系统是否优秀。正确的评估方法取决于你想要测量的对象。

你可能想要将输出与已知答案进行比对,判断它在语义上是否正确,检查智能体在多个步骤中的行为,或是在不安全输出到达用户之前进行拦截。

一个有效的分类方式是按它们实际评估的内容来组织。

基于参考的评估:存在真值时

→ BLEU测量n元语法精确率,检查生成文本与参考文本的重叠程度。

→ ROUGE更关注召回率,测量参考内容出现在输出中的比例。

→ BERTScore不对比精确单词,而是对比上下文嵌入,因此语义相似的答案也能得到高分。

基于评判的评估:真值不存在或不完整时

→ G-Eval使用大语言模型根据定义的标准为输出打分。

→ LLM-as-Judge给模型一份评分表,让它为输出打分或进行比较。

→ LLM Juries运行多个独立评判并汇总结果,减少对单个评估者的依赖。

人工和确定性评估

→ 人工评估依赖人类从正确性、相关性、有用性等多个维度为输出打分。

→ 基于DAG的评估将评估编码为确定性决策逻辑,让输出经过明确检查,最终得出结论。

面向智能体的评估

→ 轨迹准确度评估的是智能体采取的行动序列,而不仅仅是最终答案。

→ 多轮评估对整个对话过程中的行为打分,包括一致性、记忆和多轮之间的连贯性。

作为准入关卡的评估

→ 安全评估在输出被接受前,会检查毒性、偏见、敏感数据泄露和违反政策等问题。

重点是这些方法是互补的。一个生产环境中的智能体可能需要:基于参考的评估来确保正确性,基于评判的评估来衡量主观质量,轨迹评估来检查工具使用,以及在任何内容到达用户之前进行安全评估。

如果你正在构建这个评估层,Comet的Opik将追踪、调试、测试套件和智能体评估整合到一个开源堆栈中。去GitHub查看吧:(别忘了点亮星标🌟)

我还写了一篇更深入的分析,讲解评估如何适配生产可观测性和自修复循环。全文如下。

本文由 AI 翻译自英文原帖,技术名词保留英文。

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新