AI Pulse
📡 X 信号

128GB内存DGX Spark运行510GB DeepSeek-V4.1-Flash模型

128GB内存DGX Spark运行510GB DeepSeek-V4.1-Flash模型

510 GB 模型。128 GB 机器。256k 上下文,开启思考模式。DeepSeek-V4.1-Flash 运行在一台 DGX Spark 上,不需要更小的模型,不需要云服务。

诀窍在于:模型每个 token 只使用 384 个专家中的 6 个。所以我告诉这台机器它应该擅长什么,它就只保留这项任务实际需要的专家。这就是选择专家的界面。

它的工作原理,简单来说:把几千个 token 的前端代码输入模型,记录下哪些专家被激活。对 Python、医学、法律、德语、阿拉伯语也做同样操作。这样每个主题都会得到一个直方图。一个配置文件就是一组主题的打包。前端每一层只保留 384 个专家中的 139 个。其他所有专家都保留在磁盘上。

配置文件就是列表。打开 tools/tune.py,修改主题,重新运行就可以了。想要“Rust + 日语 + 法律”?只需要一行代码就能搞定。

今天已经放出了 10 个配置文件:前端、后端、系统、数据与研究、聊天、医学、法律与金融、写作、欧洲语言、世界语言。

开启思考模式、256k 上下文的测试数据:前端 10 个提示词中有 9 个输出了正确答案;数据与研究 11 个中有 10 个正确;后端 10 个全部正确(速度很慢,它会先反复思考 3 到 8 次),token 速度在 17 到 37 每秒,取决于生成的内容。HTML 最快,长文最慢。

有一个我没想到的建议:处理完整文件时,关闭思考模式。短任务可以开着思考模式。如果让模型生成一个完整的落地页,开着思考模式它会精心规划 4 万个字符,然后一直循环“要不要加 X?跳过吗?”。关闭思考模式后,它可以在 158 秒内生成一个完成的页面,3 次运行就搞定了。

每个配置文件保留哪些专家都有可视化。40 层 × 384 个专家,每个主题都是一个切片,每个保留集合就是一个轮廓。这就是 @superalesha 开发的 Weight Atlas,已经整合到工具里,一键就能查看。

这里要注明功劳:查看器是他做的;数据是我们自己跟踪得到的。现在它已经可以直接在 Open WebUI 里回答问题。同一台服务器,和任何 OpenAI 端点用一样的 API。选好配置,点击运行,把你的客户端指向它就行。

关闭思考模式后,只花了 20 分钟就创建了这个小游戏。

坦白说:开着思考模式时,非英语语言仍然会出现循环。生成长文本时会发现我漏掉了一些专家。目前还有 6 个配置文件没有在 256k 设置下重新测试。一个人要处理的任务太多了。如果你有一台或者多台 Spark,你可以自己修改配置。欢迎告诉我你做出了什么。

本文由 AI 翻译自英文原帖,技术名词保留英文。

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新