AI Pulse
📡 X 信号

工具jev耗时70毫秒比聊天大模型更快,适用特定任务场景

工具jev耗时70毫秒比聊天大模型更快,适用特定任务场景

本文介绍了工具jev的用法,以及哪些任务中jev耗时70毫秒就能击败聊天大模型。jev不会生成文本,你向它发送非结构化状态加上一组带类型的问题,它就能并行一次性返回每个问题带概率评分的答案,耗时在70到500毫秒之间。

同类任务由聊天大模型完成需要3到329秒,原因是聊天大模型需要逐次顺序生成token,哪怕你需要的实际输出只是分类结果或是一个决策。这个速度差距并不适用于所有任务,只存在于特定类别的任务中,区分任务类型就是使用它的核心要点。

70毫秒确实能击败聊天大模型的任务场景包括:在调用大模型之前完成请求路由,决定使用五个prompt中的哪一个、调用哪一个工具、工单该归属到哪个部门。这些都是有类型限制的决策,让完整对话补全模型来处理这类任务,你相当于为原本只需要从少数选项中得到一个结果的问题支付了token生成成本。

另一个适用场景是大规模的安全和内容标记,比如标记需要审核的消息、情感评分、根据合规规则检查字段,所有当前你用低成本大模型调用来获取分类结果,却还要额外解析不必要自然语言输出的工作,都适合交给jev。还有流水线中高频决策会导致延迟累积的场景,单次3秒的聊天调用单独看没什么,一天按顺序运行一万次,且处在用户等待实际响应的前置环节,就会成为整个系统的瓶颈。

有些场景完全帮不上忙,你还是应该使用常规聊天大模型:任何需要自然语言作为输出本身的任务。jev从不生成句子,它没法帮你给客户写回复邮件,只能帮你决定客户的消息需要哪一类邮件回复。

任何真正开放的任务,也就是你没法提前把所有可能的回答定义为固定框架的任务,也不适合jev。jev需要带类型的问题和带类型的可选回答,如果你还不知道一个好回答的形态是什么样,那就不是适合jev的任务。

需要了解它明确的局限:限定框架、带类型的输出不会产生文本幻觉,因为它本来就不生成文本,但它依然可能在有效框架内选错选项。它不能替代验证环节,只是替代特定的决策工作,以低成本、快速度完成决策,再将结果送入后续需要处理的环节。

正确的认知是:jev是放置在常规大模型调用前后的分类和路由层,并不是大模型的竞品。你可以把流水线中所有带类型的重复决策都交给它,把聊天大模型留给所有需要生成自然语言的任务。

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新