AI Pulse
📡 X 信号

OrcaRouter开源GLM-5.3-Flash-Uncensored-FP8 模型(320B)

GLM-5.3-Flash 刚刚被做成了“无审查版”。

而且最有意思的结果是:他们发现智谱可能把模型的安全对齐做得比想象中更深。

@OrcaRouter 刚刚开源了 GLM-5.3-Flash-Uncensored-FP8,320B 总参数、18B 激活,直接在官方原生 block-FP8 权重上修改。

没有 LoRA,也没有什么 jailbreak prompt,而是直接把模型中的“拒答方向”从权重里削掉。

效果很明显:
MaliciousInstruct 拒答率:96% → 11%
JailbreakBench:93% → 12%
AdvBench:97% → 15%
HarmBench:93% → 18%
甚至连正常问题被误拒的比例,也从 2.4% 降到了 0.4%。

但真正奇怪的地方来了:

他们怎么搞,都没办法把 GLM-5.3-Flash 的拒答率像其他模型一样彻底打到接近 0。

实验发现,GLM-5.3-Flash 的安全机制似乎并不完全依赖一个简单的“线性拒绝方向”。

换句话说,一部分“这个问题我不能回答”可以从模型里直接切掉,但剩下的一部分拒答,被编码在了更复杂的网络结构里,这套方法根本碰不到。

甚至加第二个拒绝方向,模型反而重新开始大规模拒答。

OrcaRouter 因此判断, @Zai_org 对 GLM-5.3-Flash 做的安全对齐,可能比很多前沿模型常见的“单一可操纵特征”更深。

所以这个模型最有价值的地方,可能反而不是“终于有一个无审查 GLM 了”。

它直接变成了一份研究材料:

我们终于可以拿同一个 320B 模型,对着原版和“拆掉大部分安全机制”的版本,一层层看大模型到底把“拒绝人类”这件事学在了哪里。

权重已经放到 Hugging Face,MIT License。

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新