AI Pulse
🔥 热点深度解读

AI评估新方案来了,比大模型更便宜更快

有人开发AI智能体,每次要给几千条测试结果打分,要么花大价钱用大模型评审,要么让人工团队熬夜加班审核。现在,一款叫Jev的新工具可能解决了这个麻烦。

Jev是TypeSafe AI开发的System One模型,和我们熟悉的大语言模型本质不同。大语言模型评审员要逐字生成文本,再给出评估结果,Jev不需要生成文本,它直接返回规范的结构化答案。

LangChain团队把Jev和主流大语言模型评审员做了对比,测试维度包括准确性、一致性、延迟和成本。结果显示,在连续评分任务里,Jev的一致性显著更高,它的质量评分方差比GPT-5.6 Luna、Terra和Claude Sonnet 4.6低92到913倍。

Jev支持多个独立问题并行评估,所有决策能在同一次评估里生成,延迟只有70到500毫秒,这是逐字生成文本的大语言模型做不到的。它还能自动过滤掉低置信度的结果交给人工检查,高置信度结果直接通过,避免人工被大量数据拖累。

@LangChain 认为:Jev为智能体评估提供了一套新的思路。

@hwchase17 认为:Jev作为评审工具,是便宜又快速的语义验证工具,尤其适合需要给大量数据评分的在线评估场景。

对于企业开发AI团队来说,之前用大语言模型做评审,最大的痛点就是API成本会随着评估量上涨,速度也会拖慢开发进度,不得不在覆盖范围、速度和成本里做选择。Jev的出现,给了团队一个新的选择,它的成本更低,速度更快,还能保持更高的一致性。

对于普通使用者来说,这件事意味着AI开发的效率会变更高,成本会降下来,未来我们能用到更多更快迭代的AI产品,不用为开发环节的成本和速度瓶颈买单。

Jev之前还曾演示过玩毁灭战士,它能对游戏的结构化状态快速做出反应。现在它又走进了AI评估环节,下一次它会出现在哪个你常用的AI工具里呢?

📎 参考来源

查看原始推文

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新