Jev为AI的小判断明码标价,频繁决策有账可算
AI智能体在得到你想要的结果前,需要做出大量小型决策:调用哪个工具、读取哪条搜索结果、是否请求澄清。每一次决策都会消耗时间,增加任务成本。当你对上百个项目重复这个过程时,单次判断的成本就会变得很重要。
这正是TypeSafe的结构化决策模型Jev吸引我注意的地方。你提供信息并描述你需要的判断,Jev会返回一个选择、分数或概率,可供你的应用直接使用。它公开的定价和响应时间,让它成为需要频繁决策的场景下一个值得关注的选项。
分类器已经存在数十年。我认为Jev值得关注,是因为它让更多人开始思考这类模型可以在自己的软件中如何应用。这让我想到了Model Context Protocol(MCP,模型上下文协议)。在我看来,MCP的很大一部分影响来自于让人们将智能体连接到外部工具和服务。Jev在推广快速决策模型方面可能会产生类似效果。熟悉的想法一旦开始被人们投入使用,就能产生更大的影响力。
三种提问方式
Jev接收一个状态并针对该状态提问。以新闻筛选工具为例,状态可以是一篇帖子和它的源材料,问题可以是这篇报道属于哪个分类、它的重要性如何。Jev用三种基础类型覆盖不同的判断需求:
选择(Choice):从你定义的选项中选一个。新闻筛选示例:哪个分类最适合?模型、工具还是研究?
评分(Score):按照有序评分标准给出评级。新闻筛选示例:这篇报道有多重要?从次要更新到重大进展?
Noul(布尔概率):给出一个陈述为真的概率,范围从0到1。新闻筛选示例:评估这篇报道是否需要更多上下文?
选择和评分也会返回概率分布和置信度。评分是评分标准层级索引的概率加权平均值:四个等级给出的分数范围是0到3,包含小数。Noul给出是非问题的概率,你可以在代码中设置采取行动的阈值。
分类器会将输入分配到某个类别,垃圾邮件检测就是常见的例子。通用大语言模型(LLM)也可以做分类。TypeSafe用System One来描述为快速、结构化判断而设计的模型,其选项和标准在请求时提供。这些术语存在重叠:分类是一项任务,System One描述的是TypeSafe处理分类及相关决策的方法。LLM也可以返回结构化输出,TypeSafe为语言模型提供了适配器。比较哪种方法更好,取决于你的应用实际需要的决策效果。
价格与延迟
截至2026年9月21日,TypeSafe定价为每十亿输入令牌42美元,输出令牌免费,也就是每百万输入令牌0.042美元。发布帖公布端到端延迟范围是70到500毫秒。这个范围是服务商公开给出的,不是我自己测试的结果;任务、网络和负载都会影响响应时间。
我的新闻筛选实验
我在为ThursdAI筛选AI新闻时试用了Jev。第一次试点用了26篇公开帖子,每篇帖子提4个问题:主题、重要性、证据状态、是否需要更多上下文。Jev 1.13通过两次成功请求返回了104个结构化判断。我的智能体负责准备输入和处理结果,我仍然需要人工判断报道是否准确、对我们的受众是否新鲜、以及是否适合节目。
保存的响应显示输入令牌为42,943个。按照公开定价计算,Jev推理成本约为0.0018美元,不到五分之一美分。这个成本只包含两次成功调用;智能体的工作和编排是另外的成本。后续运行对我的新闻池里全部698篇候选帖子生成了重要性评分,再由我的智能体排序分组。
有一个结果特别值得注意:所有试点帖子都超过了我设置的“需要更多上下文”的阈值。这个问题没能区分出哪些帖子值得额外研究。这很好地提醒我们,只有当问题给决策提供了有用的基础时,廉价的答案才有帮助。
适用的场景,以及要检查什么
我看到的机遇不止于新闻筛选。你可以在让更大的模型综合搜索结果之前,先用Jev筛选结果,或者给智能体轨迹分类,找出值得调查的失败。如果一个决策模型能在更低成本和延迟下满足你的质量要求,你就可以在相同预算内评估更多候选,或者在用户仍在使用应用时做出响应。包括错误处理在内的整个工作流程都必须受益。
格式正确的答案仍然可能出错。将答案限制在你给出的选项内,不能保证一定选对。选择和评分的置信度值概括了它们概率分布的形态。在用它决定自动处理之前,你需要在自己的例子上测试这个信号的表现。
上下文也需要规划。对于Jev 1.13,两个限制都适用:共享状态加所有问题合计64k个令牌,共享状态加最长单个问题32k个令牌。因此状态必须放进较小的预算,还要给问题留出空间。更大的文档需要拆分成合适的输入。
探索替代方案
相关替代项目的活跃让这个领域更有意思。SimpleJev和SemIf展示了如何从现有开源模型获得结构化决策,Laya提供可下载的决策模型权重。这些项目为你提供了探索本地执行的选项。相似的接口并不代表相同的质量或校准水平;要检查模型的任务限制,并在自己的例子上衡量它。
TypeSafe的工作流评估和社区项目JevBench是进行这类比较的有用起点。阅读它们如何确定答案质量并运行模型。与另一种模型的一致不同于人工验证的准确率,不同的托管条件也会影响延迟。我会用这些结果来选择要测试的候选项。
我们在9月17日的ThursdAI节目中报道了Jev。从01:38:48开始看Allie Laabs讲解Jev,然后从02:08:19看Alex的演示。节目页面包含章节和文字记录。
自己动手试试
要想自己试用,Playground和官方快速入门是最容易的起点。如果你使用编码智能体,官方的TypeSafe技能可以帮它调用API并设计决策工作流。官方文档给出的可选安装命令如下:
技能源代码放在官方仓库里。安装它不会让Jev在本地运行。未经必要批准,不要将敏感数据发送给外部AI服务。学习时请使用单独的演示工作区和合成数据;技能文件不是安全边界。
第一次实验可以这样做:想出十条新闻标题,定义三个主题分类,给每个标题写下你预期的分类,然后用Choice来分类。加入几个模糊的案例,当结果让你意外时查看概率分布。理解这一行为之后,再尝试用明确的重要性等级做一个Score问题。
我希望看到这些小型判断变得足够有用,最终融入日常软件。选一个你熟悉的工作流中重复出现的决策,在你能核实的例子上试一试。这就是Jev的炒作变成你可以亲自评估之处。