Nvidia、研究人员发布TwELL 稀疏打包格式论文及开源代码(95%)
英伟达证明,你完全可以让Transformer大语言模型同时实现更稀疏、更快、更轻量,还不会损失精度。
人类大脑的效率极高,因为它只会激活思考所需的特定神经元。大语言模型天生就可以做到完全一样的事情——对于任意输入词,大语言模型前馈层中超过95%的神经元都处于完全静默状态。它们在日常运行中几乎不做任何计算。
那为什么模型不能做到瞬间运行?因为现代GPU是为蛮力计算、规则块密集运算设计的。当模型尝试跳过不激活的神经元时,会产生随机、非结构化的空缺。GPU不规律的内存访问很吃力。过去,让GPU运行稀疏模型实际上反而会让速度变慢,管理空缺的开销吃掉了所有性能收益。
现在,英伟达和研究人员解决了这个问题。他们发布了一篇新论文,介绍了一种名为TwELL的定制稀疏打包格式,搭配了直接为现代硬件打造的全新CUDA内核。
他们没有让GPU强行处理不规律空缺,而是构建了一套混合系统:将99%的稀疏标记通过超高速路径路由,同时用一个小型密集备用矩阵作为安全阀处理高异常值。
结果相当惊人:
• 通过简单的L1正则化,测试模型实现了超过99%的稀疏度,下游智能完全没有损失。
• 在H100上,前向推理和训练的直接提速都超过20%。
• 峰值内存消耗和能源使用量大幅下降。
• 全部代码和内核都已开源,可直接部署。
多年来,业界一直认为让模型变快的唯一方法是缩小模型体积或将其量化为更低比特。英伟达打开了一个全新的维度。
本文由 AI 翻译自英文原帖,技术名词保留英文。
查看 X 原帖