AI Pulse
📡 X 信号

用户实测Jev模型:分类场景速度、质量、价格优势明显

用户实测Jev模型:分类场景速度、质量、价格优势明显

这两天Jev模型的热度非常高,是近半年来libukai关注海外社交平台以来,看到原创内容密度最高的一次。

过去一年里,libukai一直在推进一个小项目,项目的其中一个环节是对每日出版的《人民日报》新闻做分类,判断每篇文章是否包含湖北相关元素。

历时一年,该项目累计积累了接近2万4千条数据,其中判定包含湖北相关元素的约有1800条。在此基础上,libukai随机筛选出一个测试数据集,包含500条判定包含内容和500条判定不包含内容。

此前测试后综合成本和速度考虑,libukai一直使用Gemini的Flash Lite系列模型作为最佳选择。OpenRouter上线Jev之后,libukai用相同提示词做了对比测试,并录制了同时开启16个并发进程的实测视频。

测试结果超出预期。速度方面,Gemini Flash Lite处理单篇文章平均耗时3秒,Jev将单篇耗时压缩到0.35秒,速度提升接近10倍,带来了新场景的想象空间。

质量方面,和Gemini Flash Lite的分类结果相比,Jev大约有15%的内容判断不一致。手动审核后发现,大部分差异都是人名导致的。

比如当某位曾在湖北省任职的官员姓名出现在新闻中时,知识库更大的Flash Lite会判定为包含湖北相关元素,而Jev这类判断更弱,会判定为不包含。在实际应用场景中,这种判断差异完全可以接受。

价格方面,在OpenRunner平台前后跑了5千条数据,共30M令牌(Token),总开销仅1美元,性价比非常高。

Jev代表的分类器大模型是一个很有前景的发展方向,它在分类场景下实现了速度、质量、价格三者的平衡,有类似需求的可以尝试使用。分享完内容后,libukai打算连夜用Jev优化自己的生产项目。

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新