AI Pulse

UkisAI 惩罚模型“想太多”,token 少用 58.3%、速度近翻倍

UkisAI 发布了首个开源模型 Swift Qwen 3.8 27B。上线至今下载量超过 10 万次,在 HuggingFace Trending 上排第 9,微调模型里排第一。

惩罚“想太多”

小型语言模型里有一种病态的过度思考。给出答案之前,模型绕很多弯子,想了一堆,结果并没有变得更好。

UkisAI 在发布说明里写得很明确:不是训练模型把思考变短,而是训练它思考得更高效。惩罚对象是病态的过度思考。团队给出的数字:token 使用量下降 58.3%,生成速度快了 1.95 倍,准确率没掉。

小实验室,开源方向

UkisAI 是一家小实验室,目标是用开源方式让小型前沿语言模型成为可能。发布 Swift 时团队说,没有社区成员到处出力,这次发布不会有现在一半的成果。

评论区整体挺积极。有人说这证明了非前沿实验室也能做出有意义的东西;有人专门谢发布者,说在一切都靠 AI 完成的时代,人工回复本身很珍贵;也有人奇怪,下载量都 10 万了,自己怎么到今天才听说这个微调模型。

社区已经在跑它

已经有人把模型搬到自己机器上日常使用。一位用户把它转成 Ninfer V3 格式,在 RTX 5090 上跑满 262k 上下文,视觉功能也在用。平均解码速度约每秒 190 个 token。另一位用户把 NVFP4 量化版转成 GGUF,让模型能在 llama.cpp 里运行。还有人一直在用 3.5bpw EXL3 量化做逆向工程,说模型又稳又快。他甚至开始怀疑自己是不是真需要 4/5 bit 的量化。有用户开玩笑:5090 怕是要涨价了。

一个几乎没省下 token 的测试

并非所有测试都漂亮。一位用户拿 Swift 和原模型问了同一个问题:怎么计算圆周率。Swift 的思考时间从大概 9 秒缩到约 3 秒,但输出差了一截,漏掉了通常会提到的部分。token 也几乎没省下来。上下文很短的测试里,两款模型的速度几乎一样。

效率提升是真的,但在这类短上下文场景里,收益没有发布数字那么好看。

下一批模型在路上

社区里已经有人问,这套方法会不会用到即将发布的 Flash Next 上;也有人问,会不会有 Qwen 3.6 35b 版本。有人在 Swift 和 byteshape 的 Qwen3.8-27B 量化版之间犹豫。也有人说,要是有未审查版本,模型就完美了。

UkisAI 接下来要发两个模型。Swift1.5 Qwen3.8 27B 是改进版检查点,修了一些训练 bug,加了更多强化学习。Swift Qwen3.8 Flash Next 预计接下来一周内出。团队说,这次按社区建议跑了更多基准测试,包括更多编码和长时程任务,目的就是避免把不成熟的结果放出来。

“不损失准确率”这个说法扛不扛得住更多任务类型,还得看接下来的测试。Flash Next 的基准数字会给出一个更清晰的答案。

阅读原文
📚 相关主题 开源商业

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新