Qwen3.8-27B混合架构多模态模型在DGX Spark上完成测试
测试者在NVIDIA DGX Spark设备上,通过SGLang推理引擎部署了Qwen3.8-27B-FP8模型,并关闭推理思考模式,运行完整的SMF基准测试套件。
这一模型不是标准Transformer,也不是混合专家模型,它是密集型混合门控DeltaNet(GDN)视觉语言模型,共64层网络结构,包含48层线性注意力门控DeltaNet层、16层全注意力层,额外搭载视觉编码器支持原生图像与视频理解。
本次部署的硬件为拥有128GB统一显存的NVIDIA DGX Spark(GB10),模型采用分块FP8量化,总权重大小约33.7GB,原生支持262144个token的上下文窗口,通过EAGLE 3实现投机解码。
SGLang官方文档已有该模型在DGX Spark上的部署方案,但标注该方案尚未经过平台验证,本次部署为首次验证。启动时SGLang显示,模型最多可支持26个并发请求,每个请求占用5个GDN状态槽,对于智能体场景已经足够。
本次测试包含三个部分:SMF推理标准的157项官方A校准测试、多维度性能测试、视觉理解测试。
校准测试结果显示,模型总通过率为79.0%,工具调用通过率达到100%,所有工具调用都能生成正确格式的结构化请求。
代码测试通过率达86.7%,30项测试仅4项失败,且没有出现低激活混合专家模型常犯的语法错误。数学是模型的短板,通过率仅50.0%,失败题目集中在高阶专家题,这是因为本次测试按规则关闭了思考模式,开启后数学表现应该会提升。
性能测试显示,模型首token延迟稳定在约320毫秒,1024个token的解码吞吐量为每秒15.6个token,1到16路并发测试全部通过,上下文缩放可支持到128K输入token,全部测试运行正常。
视觉测试四项内容全部通过,形状计数、颜色识别、文字识别和空间推理结果全部正确,单轮推理耗时不到3秒。
混合GDN架构实现了预期设计,27B密集模型可以单卡运行在DGX Spark上,对本地智能体最关注的代码和工具调用能力表现出色,线性注意力层控制了状态成本,得以在128GB显存容纳26个并发请求。
未经验证的部署方案没有出现问题,整个测试过程没有发生任何服务器错误,flashinfer搭配EAGLE MTP的方案在DGX Spark上运行稳定。
针对DGX Spark部署给出了几条实用建议:优先选择FP8量化可以获得最佳性能质量比,如果需要同时部署其他模型再选择NVFP4;除非实测确有需要,否则保持--mamba-full-memory-ratio为0.9;智能体和代码场景可以按请求关闭思考模式节省token;工具调用必须使用qwen3_coder解析器;数学场景需要开启思考模式并预留至少4096个token的上下文。
所有测试脚本和原始结果都已公开存档,所有数据都是2026年8月16日在运行节点实测得到,并非厂商公布数据。