249美元的小设备,一口气读完128K长文
这次跑通完整上下文的模型是 Ling-3.0-tiny。跑它的是一块 NVIDIA Jetson Orin Nano Super——发布时卖 249 美元的开发者套件。如今 SparkFun 标价 399 美元。
模型是 MoE 架构,总参数 7.9B。每个 token 只激活约 1.4B 参数。128 个专家里,每步只挑 8 个路由专家和 1 个共享专家上场,其余参数基本闲着。架构代号 BailingMoE V3,需要 llama.cpp 的专门补丁。PR #26608 已在 2026 年 8 月 17 日合并进主分支。
模型以 IQ4_NL 量化运行。模型、KV 缓存和 CUDA 卸载全部塞进 8GB 统一内存,总占用 7.4 GiB。交换空间只用了约 200MB。整个推理过程没离开这块小板子。
长上下文:能读,但读得越深越慢
短上下文时,解码速度约 33 token/s,提示处理 220 到 760 token/s。上下文一拉长,性能就往下掉。96K 时检索成功率 92%(128 次命中 118 次),128K 时降到 88%(命中 113 次)。最后 32K 区间明显掉到 67%。解码速度在接近满深度时降到 15 到 17 token/s,约为短上下文时的一半。
与高端显卡的差距
和 RTX PRO 6000 Blackwell 相比,Orin 的提示处理慢约 30 倍。解码在短上下文时慢约 10 倍,跑到满深度时慢约 19 倍。一段 125K token 的预填充,Orin 要 9.7 分钟,Blackwell 约 19 秒。差距主要来自内存带宽,不是算力。
社区实测:有好有坏
实测反馈好坏参半。u/snugglezone 说它调用工具又快又好,但智能水平有限。即便用工具找到了答案,仍解释不了一个洗车问题。另一个测试者 u/dionisioalcaraz 拿它替换了参数更大的 Qwen3.6-35B-A3B,做网络搜索和研究。在 780M 集成显卡上解码跑到 48 token/s,指令遵循更好。还有 u/Apart_Boat9666,认为它接近 9B 级别模型,处理代理任务更连贯。在 Ryzen 8 集成显卡上,它跑到 30 token/s。
没人回答的问题
持续解码时的实际功耗没人报过。空闲功耗虽低,但常驻代理主机更关心满载数字。有没有人用 YaRN 把上下文扩到约 512K 做长文摘要,目前没有答案。96K 到 128K 之间注意力为什么退化,原因也不清楚。
u/RanklesTheOtter 之前在这块板子上跑的是 Bonsai 27B 1-bit。上下文只有 18K,速度每秒 5 token。现在同一块硬件能处理 128K,代价是深度处的速度和注意力明显缩水。这个交换划不划算,取决于任务本身。