OrcaRouter开源GLM-5.3-Flash-Uncensored-FP8 模型(320B)
GLM-5.3-Flash 刚刚被做成了“无审查版”。
而且最有意思的结果是:他们发现智谱可能把模型的安全对齐做得比想象中更深。
@OrcaRouter 刚刚开源了 GLM-5.3-Flash-Uncensored-FP8,320B 总参数、18B 激活,直接在官方原生 block-FP8 权重上修改。
没有 LoRA,也没有什么 jailbreak prompt,而是直接把模型中的“拒答方向”从权重里削掉。
效果很明显:
MaliciousInstruct 拒答率:96% → 11%
JailbreakBench:93% → 12%
AdvBench:97% → 15%
HarmBench:93% → 18%
甚至连正常问题被误拒的比例,也从 2.4% 降到了 0.4%。
但真正奇怪的地方来了:
他们怎么搞,都没办法把 GLM-5.3-Flash 的拒答率像其他模型一样彻底打到接近 0。
实验发现,GLM-5.3-Flash 的安全机制似乎并不完全依赖一个简单的“线性拒绝方向”。
换句话说,一部分“这个问题我不能回答”可以从模型里直接切掉,但剩下的一部分拒答,被编码在了更复杂的网络结构里,这套方法根本碰不到。
甚至加第二个拒绝方向,模型反而重新开始大规模拒答。
OrcaRouter 因此判断, @Zai_org 对 GLM-5.3-Flash 做的安全对齐,可能比很多前沿模型常见的“单一可操纵特征”更深。
所以这个模型最有价值的地方,可能反而不是“终于有一个无审查 GLM 了”。
它直接变成了一份研究材料:
我们终于可以拿同一个 320B 模型,对着原版和“拆掉大部分安全机制”的版本,一层层看大模型到底把“拒绝人类”这件事学在了哪里。
权重已经放到 Hugging Face,MIT License。