英伟达斯坦福发布CLM,速度最高快9倍
英伟达和斯坦福刚刚向Jev发起挑战。(他们的全新System 1架构运行速度最高提升9倍。)
这个架构被称为对比语言模型(Contrastive Language Model),简称CLM。和Jev一样,CLM并非设计用于生成文本。它处理AI系统内部小型、重复性的决策,例如选择工具、排序补丁、路由请求,或是选择下一步动作。但CLM做出这些决策的方式不同。
它不是逐token生成答案,而是将决策视为一个检索问题。以下是它的工作原理:
1) 编码状态
CLM接收当前场景,例如智能体的上下文或是游戏状态,并将其转换为向量。它使用一个冻结的Qwen3-8B模型,搭配一个小型可训练状态投影头。
2) 编码所有可能动作
一个独立的动作头将每个候选动作转换到同一个向量空间。以超级马力欧为例,候选动作是左移、跳跃和右跑。CLM不会凭空创造第四个选项,它只评估应用提供的动作。
3) 学习哪些状态和动作相互匹配
训练过程中,正确的状态-动作对会被拉近,错误配对会被推远。一批B个样本会生成一个B×B的相似度矩阵,匹配对位于对角线上,其他所有配对都是负样本。
这种对比训练使用InfoNCE,这和CLIP以及密集检索等系统使用的是同一个通用机制。
4) 将相似度转化为决策
推理时,CLM测量状态和每个候选动作之间的余弦相似度,通过softmax将这些分数转化为概率分布。应用可以选择得分最高的动作,应用置信阈值,或是升级处理不确定结果。
真正的速度优势来自将状态和动作分离。动作可以只嵌入一次并缓存。如果智能体需要在相同工具间重复选择,CLM只需要编码变化的状态,再和存储的动作向量比较就行。这将重复生成替换为一次嵌入传递和一组低成本点积。
研究人员报告称,CLM-8B在电脑使用、游戏和工具调用评测中的表现和Jev相当,同时延迟最高降低9倍。在动作重复或是候选集合变大的场景下,提升最为明显。
CLM仍存在局限:它不能生成新动作,它的概率相对于提供的候选而言,它最强的验证结果需要针对特定任务微调。但其核心思路非常有力。整个研究都是开源的,包括代码。
当软件已经知道可能的答案时,AI模型应该给它们打分,而不是生成更多文字。我还写了一篇完整分析,讲解像Jev这样的system one模型是如何工作的。文章引用如下。
本文由 AI 翻译自英文原帖,技术名词保留英文。
查看 X 原帖