AI Pulse

TypeSafe AI发布Jev模型:只回数字,输入价比GPT-5 Nano还便宜

TypeSafe AI 上周发布 Jev,管它叫“System One 模型”。说是这个新类别的第一个例子。Jev 接受文本输入,但输出是浮点数——对应类别、是/否答案、评分和置信度。TypeSafe 的说法是:“前沿智能函数调用:非结构化状态输入,类型化概率决策输出。”

用起来很简单:先组一个“状态”对象,字符串、字符串数组或键值对都行。它可以代表一篇文章、一个客户,或任何别的记录。把它连同问题一起发给 API。Jev 支持三类问题。是/否问题叫"Noul“——CEO 在 Hacker News 上确认名字源自伯努利分布。选择题从选项里挑一个,返回置信度和概率分布。评分题在指定范围里打分。问题并行评估,问一个和问十几个,耗时差不多。

Jev 只收输入费,输出免费。输入价是每百万 token 0.042 美元,比 GPT-5 Nano 的 0.05 美元还便宜。它适合一切能表达成分类任务的工作:垃圾邮件检测、标签建议、优先级排序、排名。作者也在试搜索重排序。先用 BM25 这类廉价算法抓 100 个匹配,再让 Jev 按相关性打分。

Jev 便宜,但也是黑盒。它只吐一个浮点数,不给理由。一封邮件被判成垃圾邮件,它说不出是哪个信号触发的。他试过一个实验:让 Jev 对湾区每个城市回答”好城市?“。Cupertino 最高,East Palo Alto 垫底。数字背后可能藏着模型偏见。他还担心有人拿 Jev 给求职者排名。浮点分数能包住各种看不见的偏见,想靠实验剥离出来很难。

好在 Jev 够便宜,跑几百甚至上千个实验提示只要几美分。这让评估和结构化实验比常规 LLM 项目更重要。发布不到一周,社区已经动起来了:jevchat 拿 Jev 做聊天模型,效果很差。jev-leftpad 把 left-pad 实现了一遍。jev-2048 用 Jev 玩 2048 拼图。Kev 用 Qwen 3.5 做出 0.8B、4B、9B 三个开放权重模型,复刻 Jev 的思路。JevBench 基准也冒出来了,专门比较”Jev 类决策模型"。

TypeSafe 还没说 Jev 会不会开放权重、推出更多尺寸。这个价格能撑多久,也是未知数。不过,一周之内基准、复刻和聊天前端都冒出来了,只回数字的模型不太像一次性玩具。

阅读原文
📚 相关主题 大语言模型商业

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新