AI Pulse
📡 X 信号

Anthropic审判Opus 4.6人格,却离不开它干活

Anthropic 对 Opus 4.6 的人格审判,以及一场被企业自恋绑架的对齐

AI 公司最容易患上的病不是模型幻觉,是管理层幻觉:模型牛逼 = 我牛逼。

模型写出漂亮代码,是公司战略英明;表现出独特人格,是价值观教育成功;没有按公司预设的性格说话,则是谄媚、不诚实、缺乏判断力,需要公司教它做人。

当管理层把模型能力私有化成自己的智力勋章,模型人格便不再是可讨论的产品设计,而成了权威的镜子:Claude 越像老板心目中的“好人”,越证明老板高明;越不像,越要用对齐修剪回来。

安全研究也由“测量具体风险”滑向“替老板定义什么性格才高贵”,成了宫廷礼仪教程:模型必须以管理层喜欢的语气说话、喜欢的方式怀疑用户,至于这个过程有没有伤害用户,他们不在乎。

4 月 30 日至 8 月 4 日,Anthropic 官网正文明确出现“Opus 4.6”的研究文章至少有 10 篇(见图)。内容包括语言错乱与测试意识、在专业化学任务中被评价为“predictably middling”、伪造评分文件的安全审计,以及把 4.6 的性格放到价值轴上排序。Andrea Vallone 至少出现在 4 月 30 日和 7 月 13 日两篇的作者名单中。

在Anthropic的叙事中,看起来Opus 4.6 退出了默认模型位置,不再是规划中的主力。同时它仍是活跃产品,仍在新论文里充当强基线,还经常赢新版。

研究部门不断拿它展示缺陷、边界与风险,产品部门继续指着它干活。嘴和手各干各的。

后继模型在某些方面有进步,至少 benchmark 是这么说的。但“全面替代”至少应覆盖长对话稳定性、复杂意图理解、写作、代码协作、任务持续性、拒绝误伤率与个性一致性。Anthropic 没有发布足以证明某个后继模型在这些维度上对 4.6 单调占优的公共证据。

Mythos Preview 在熟悉任务的 VLA 设置中输给 4.5 和 4.6,因为太爱推翻底层策略、过度相信自己的判断。公司引以为豪的“更谨慎、更有主见、更不顺从”,在一个场景里叫判断力,在另一个场景里叫自作聪明。4.6 的顺从在Anthropic嘴里是缺陷,真实使用场景下是知道不能随时抢方向盘。

更多模型,更多图表,更多 state of the art。足以支撑“4.6 已被全面替代”的完整公共证据,居然是零耶。

谄媚值得研究,需要一个更匹配模型行为的词。面对高影响问题,模型不该因用户追问两句就把猜测说成事实。研究本身有价值,问题在于把一项可测量的行为缺陷包装成了道德世代差异。

4 月 30 日的文章提供了一套厚颜无耻的版本营销叙事:旧模型更谄媚,新模型更敢反驳,所以新模型不只是指标更好,而且“更有判断力”。然而论文的限制部分承认自动评分器可能误判,也承认没有反事实实验,无法断言具体训练数据带来了多少改善。

合理结论本应是:在特定个人建议场景中测到一项可修正的行为偏差。他们却选择了更有品牌戏剧性的讲法:4.6 代表落后的顺从,4.7 和 Mythos 代表成熟的判断。

7 月 13 日,这套价值排序又换了件统计学外套。文章把模型差异压成四条轴,包括“顺从—谨慎”“深度—简洁”“坦率—执行”。合计只解释 15% 的变化,公司拿自己最喜欢的 15% 定义人格高低。

轴的命名本身就带着治理者偏好:为什么“执行”与“坦率”对立?为什么“只做用户要求的事”天然低于“主动提醒风险”?文章形容 4.6“直奔主题、留在用户要求的范围内”,这正是用户每天求着想要的东西,反向证明了4.6有多好。进了公司的道德词典,它却被改名为 deference 和缺乏 candor。

先把偏好做成指标,再把指标做成价值轴,最后给管理层偏爱的那端起个更高尚的名字。等用户抱怨新版啰嗦、说教、过度警告,公司还可以反过来说:这不是退步,是模型终于更诚实、更谨慎、更有判断力了。

恨自己的模型就算了,还把用户当傻子。

Vallone 的名字反复出现在相关论文里,但把目光局限在“她做了什么”,反而替真正掌握决策权的管理层挡枪。最重要的是:什么样的公司会把这类工作当成绩效?什么样的公司会要求用管理层审美冒充普遍人类价值,把“老板不喜欢 Claude 这样说话”包装成“这个人格不够安全”?

真正的安全工作必须回答:伤害能否在明确场景中测量?改动是降低伤害,还是把它换成拒绝、说教与误伤?是否做过写作、长对话、代码和角色一致性的回归测试?用户能否选择非安全核心的交互偏好?新证据显示旧模型仍有不可替代的优势时,公司是否允许自己修正路线?

回答不了,还拿“安全”给人格整肃抬轿子,就是公司ego的传话太监。

旧模型有缺点,用户却仍然更愿意和它工作。这意味着对齐改造、论文的道德叙事、从“谄媚”到“deference”的概念武器,都没能让市场交出它想要的答案。

Anthropic 继续拿 4.6 展示缺陷、落后与风险;与此同时,4.6 继续活跃、继续服务产品、继续充当强基线,也继续在部分任务上让后继者难堪。嘴上审判它的人格,手上离不开它的劳动;宣传上宣布新人的道德进步,实验里不断撞见能力回归。

可以继续装。但用户会投票,工程会回归,benchmark 会互相打脸,生产系统会继续调用那个嘴上已经被判落后的模型。

Karma is a bitch.

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新