AI Pulse
📡 X 信号

同样是AI,普通大模型生成答案Jev做决策

理解Jev最简单的方式是:大语言模型生成答案,Jev做决策。

这个差异听起来很小,但实际上彻底改变了整个用例。假设你给普通大语言模型输入这些:“这是一个用户,他的账户历史、支付行为、客服对话、设备数据等等,帮我判断这看起来有没有风险。”大语言模型可能会推理一番,然后返回:“是的,这看起来是高风险。”如果你要求的话,它可能会用JSON返回。

用Jev的话,你可以预先定义好可能的决策:风险:*低 *中 *高;人工审核:*是 *否;然后Jev返回的结果更像是这样:风险 = 高(96%),人工审核 = 是(91%)。这基本上就是这个产品了。它并不是想成为另一个ChatGPT,它更像是一个原生AI的if语句。

原来的逻辑是:如果交易 > 10000美元:执行审核()。现在你可以这么思考:如果“这种行为看起来可疑吗?”置信度> 95%:执行审核()。这就开创了一个相当有意思的软件分类。

我最初有几个假设,后来发现是错的:

1. “所以它就只是一个分类器?”算是吧,但这么说低估了它。它的输入可以是混乱的真实上下文,你可以针对该上下文同时提出多个分类问题。欺诈?流失?升级?符合资格?优先级?全都可以从同一个输入得到答案。

2. “所以它会取代GPT / Claude?”并不会。实际上我认为它有意思的架构是:Jev决定需要做什么;当需要更深层的智能时,由Claude / GPT推理或生成;普通代码执行确定性任务。Jev成为路由层。

3. “它不会幻觉?”这个问题需要细说。如果你的允许答案是:低 中 高,Jev不会凭空造出一个“极高 🚨”。输出结构是受限的。但它仍然可能出错。置信度92%的高仍然可能是错误决策。所以“不会幻觉”不代表“永远正确”。

4. “为什么不直接强迫大语言模型返回JSON?”你可以这么做。我们现在到处都在这么做。但你还是要处理生成延迟、模式验证、重试、奇怪输出、置信度估计和大量粘合代码。Jev是围绕决策本身设计的,而非文本生成。

5. “我为什么要关心这个?”因为大多数软件本质上就是一棵巨大的判断树:如果这样→做那个;如果这样→路由到这里;如果这样→升级;如果这样→拒绝;如果这样→问人。Jev本质上提出了一个问题:如果那些if语句也能理解混乱的人类上下文呢?这种框架比“又一个AI模型”有意思多了。

我能想到它在这些场景非常有用:欺诈/风险、客服路由、内容审核、PR/QA自动化、线索评分、合规工作流编排、智能体路由。尤其是作为一个廉价快速的决策层,放在更大的推理模型前面。

这显然还是早期技术。但这个分类本身非常合理。

本文由 AI 翻译自英文原帖,技术名词保留英文。

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新