开发者开源AI架构一年后,前沿实验室提出相同想法
Reddit今天有4个帖子在问同一个名字:Jev。有用户直接问,Jev到底是什么。这是一个开发者一年前构建并完整开源的AI架构。
简单说,Jev的核心是一次性算出整个答案,而不是逐字生成。有评论者把眼下这股讨论比作“人们终于重新发现了自回归采样流行之前使用语言模型的方式,就像当年的BERT”。
2025年3月,构建者开源了架构、模型、数据集和论文。论文在arXiv,模型在HuggingFace,还有PyPI包。作者顺带提过,自己之前一条帖子被Reddit过滤器删除。
一年后,一个前沿实验室提出了相同的想法,姿态像是宣告突破,但没有技术论文、开放权重或数据集。作者认为,自己2025年9月发的第二篇论文已经覆盖了对方现在提的东西。对方是否知道这项开源工作,没有公开信息。
作者形容这种处境让人极其沮丧:自己花几个月做出的垂直用例,在架构上和前沿实验室的水平构建相似,却得不到应有的支持。
有评论者区分了作者早前的SalesRLAgent和Jev。SalesRLAgent是顺序PPO策略:观测包含嵌入、销售指标、回合信息和概率历史,动作空间是一个单一的连续转化概率。Jev更通用,一个状态可以用多个独立类型的问题查询,并并行输出分类选项、分数和布尔值的分布。
作者自己的技术描述是:主要指导模型是强化学习,不是嵌入模型或语言模型;用PPO在序列嵌入上输出逐轮转换轨迹,概率从0.0到1.0。Jev本身则用并行采样,通过RLCD训练输出置信度分布和模式选择。
速度是这套架构的核心卖点,也是争议最集中的地方。一条技术评论指出代价:并行单次前向解码时,模型不再按自回归方式逐个生成token,无法根据已输出内容调整推断,交叉编码器行为会丢失。响应变快,但会变“笨”。有评论者提出改进方向:需要一种架构,先在潜在空间对整个答案推理,再做单次前向解码。
社区并不全是同情。一条高票评论调侃:“但你有没有发帖子说这是“下一件大事”?新手错误。”另一条说:“不觉得Jev是前沿实验室,但生活里很多事情就是关于时机。”
开源在先这个事实被一条评论点出关键:作者的工作在先,任何人都无法为这个通用想法获得有效专利,也就无法把它锁起来。这个想法因此对所有人开放。
也有评论提到,其他人用过相同术语。一位叫harshatheg的开发者发布过Qwen-2.5-1B-RLCD模型,用了完全相同的术语。有人回忆一年前就读过作者的帖子:“当时被它震撼了,但那时候也没看到全部潜力。”
一条评论把讨论引向更远处:这就是“AI将加速研究发现”的含义——不意味着AI会产出新知识,而是那些没被主流学术界接住的论文和研究,可以被AI系统重新捡起来。
还有评论者给出反向案例:自己私下开发了比Jev更快的系统,从未公开发布,因为觉得“世界不会感兴趣”。那个系统的目标是让语言模型反应闪电般快,在思考间隙实时操控世界,先用机器人,也能扩展到视频游戏。
发布过的Jev成了今天讨论的对象,那个更快的系统仍停在私人仓库里。区别只是是否发了出来。