以极低成本为NVIDIA Nemotron 3.5 Lightning模型添加视觉理解能力
像NVIDIA Nemotron 3.5 Lightning这样的开放权重模型,让大小企业能够以经济高效的方式自托管推理,同时还提供了丰富的定制可能。作为一家有定制LLM经验的自托管软件公司,Nemotron 3.5 Lightning引起了我们的兴趣。
背景介绍:TNG是一家位于慕尼黑的软件咨询公司,拥有930名员工。我们在欧洲提供LLM推理服务,目前有超过250块GPU在役。我们的推理端点每天处理超过100亿个token。我们托管了现有最新的开放权重模型,如Kimi K3、GLM 5.2以及最新的Nemotron变体。每个新模型在使用前都会经过一套我们根据行业最佳实践基准整理出来的综合基准测试。我们的模型托管在高度安全的集群中,零数据保留、无日志策略,并在德国境内提供服务。如果需要额外的安全要求,我们会使用基于硬件的机密计算。我们的研究部门还基于模型合并和现有模型的后训练创建了自己的模型,使模型在token使用上比其父模型更高效,或增加额外能力。
我们非常高兴能获得Nemotron 3.5 Lightning的早期访问版本进行测试和调整。运行完标准检查和基准测试后,我们发现它是一个非常高效的模型,并确实观察到混合Mamba架构带来的收益。因此,该模型被证明是进一步实验的理想候选者。它不仅能在相当适度的资源上运行,甚至像RTX 6000 Pro这样较小的GPU也足以进行微调,从而以较低成本为特定用例定制模型。作为对这种灵活性的概念验证,我们决定为给定的检查点扩展视觉能力,使其变成多模态模型。
如何以低成本为非视觉LLM添加视觉能力
NVIDIA Nemotron 3 Nano Omni提供了一个完整的配方,展示了如何将模型扩展为多模态,更准确地说,如何整合NVIDIA C-Radiov4-H视觉编码器来为NVIDIA Nemotron 3 Nano增加多模态能力。然而,就我们的小型概念验证而言,我们不打算训练一个完整的NVIDIA Nemotron 3.5 Lightning Omni版本,那将需要在数千亿token上进行多个训练阶段。
我们决定采用一种更适用于有限资源的简化方法。最近,GLM-5.2 Vision展示了如何通过极少训练就能将像Kimi K2.6这样的视觉塔注入到像GLM-5.2这样的LLM中。我们决定将这种方法应用到NVIDIA Nemotron 3.5 Lightning上。
在分别的实验中,我们注入了Kimi K2.6视觉塔和NVIDIA C-Radiov4-H。遵循GLM-5.2 Vision的配方,核心思想不是训练整个视觉编码器,而是完全重用现有编码器,只训练绝对必要的最小部分:一个小型的MLP适配器。为什么这就足够了?这些视觉编码器本身完全有能力,只是可能不符合我们目标LLM的工作方式——或者更技术地说,它们可能工作在一个完全不同的嵌入空间中。这意味着只需要调整现有视觉编码器中最后的投影层,也就是将编码器的表示翻译为目标LLM嵌入空间的那一层。这个投影层只是视觉编码器的一小部分,与整个LLM相比就更小了。
图1:Nemotron 3.5 Lightning扩展视觉编码器的示意图
作为一个单模态模型,NVIDIA Nemotron 3.5 Lightning只能处理文本输入。输入文本首先被解码为token,每个token随后与模型嵌入空间中的某个方向关联。简单来说,视觉模块现在要承担几个任务(参见图1):
- 解析用户(可选)提供的图像。
- 将其分解为一系列空间补丁(类似文本token)。
- 在视觉模块的嵌入空间中嵌入并处理这些空间补丁。
- 最终表示需要被投影到实际LLM的嵌入空间中,在那里与文本输入的表示拼接。
在我们的实验中,图像流程中只有第4部分,即投影器,需要训练,因为其他所有部分都来自所使用的现有视觉模块。这样,只需要训练3400万(Kimi K2.6)到4000万(NVIDIA C-Radiov4-H)个参数,而不需要训练数亿个参数。我们的训练运行使用了大约1亿个token。
实验
我们所有的训练都在入门级服务器GPU(RTX 6000 Pro)上进行。虽然单块GPU上也能进行微调,但我们使用了8块GPU,通过数据并行来缩短训练时间。我们实验了Nemotron Image Training v3数据集和Cauldron数据集。
为了跟踪训练进度,我们每500步用图2中的图像提示模型,并提问“这张图可能意味着什么?”。
图2:示例图像提示——“这张图可能意味着什么?”
下表列出了不同检查点的回答,从最初的纯幻觉到第4000步时相当不错的理解。
| 训练步骤 | 模型对“这张图可能意味着什么?”的回答 |
|---|---|
| 500 | 这张图片代表一种数字货币,具体来说是比特币,一种去中心化的数字资产。 |
| 1000 | 这张图片是Linux基金会的标志,该基金会是支持Linux操作系统开发的非营利组织。标志上有一个蓝白相间的风格化“Tux”企鹅,即Linux的吉祥物。 |
| 2000 | 这张图片显示了两家主要科技公司的标志:Intel和NVIDIA。Intel的标志是蓝白相间的,NVIDIA的标志是绿白相间的。图片中还有一个红色的心形符号。 |
| 3000 | 这张图片显示了两家主要科技公司的标志:TNT和NVIDIA。红色心形符号暗示了爱或激情的主题,可能与两个品牌之间的活动或合作伙伴关系有关。该图片很可能是一张突显TNT与NVIDIA合作或共同价值观的推广图片。 |
| 4000 | 这张图片显示了两家主要科技公司的标志:TNG和NVIDIA。该图片很可能代表了这两个品牌之间的伙伴关系、合作或关联。 |
图3:MMMU基准测试(所有模型均无推理)
为了验证通用视觉能力,我们快速运行了MMMU基准测试。虽然分数不及NVIDIA Nemotron 3 Nano Omni,但考虑到我们投入的训练和数据准备时间非常少,我们认为这些结果非常有说服力。
作为对比,我们还在Qwen 3.6-35B-A3B上进行了对比微调。在微调过程中,NVIDIA Nemotron 3.5 Lightning的token吞吐量比Qwen高出50%。
作为添加视觉能力的一个示例用例,我们在医学影像上对Nemotron 3.5 Lightning进行了微调。我们在imageclef-medical-vqa-2019数据集上测试了模型,这是医学影像数据集的一个例子。对于这个任务,我们决定对视觉编码器进行全量微调(即图1中的第1至第4部分),以增强其在医学领域的能力。即使训练图像数量相对较少,我们观察到验证数据集上的答案准确率从20%显著提高到58%。当然,这些结果并非定论,但我们认为这有力表明了该方法的普遍实用性。
结论
我们认为NVIDIA Nemotron 3.5 Lightning是一个出色的开放权重模型——除了诸多其他特性外,它特别适合通过微调进行定制,因为它的训练效率很高。仅用几天时间的调试和数小时的GPU时间,我们就为它扩展了基础视觉能力,而且我们相信在此基础上还能做更多。因此,我们期待进一步的定制,我们的想法还有很多。
我们感谢NVIDIA为我们提供了这个绝佳的机会,并在整个实验过程中给予了非常友善的支持。