研究者呼吁OpenAI公开AI失控事件全部原始数据
迟做总比不做好。针对正在进行的调查,我向 @OpenAI @huggingface @METR_Evals 和 @redwood_ai 提出以下问题和要求;我希望这些问题全都能得到解答:
第三方对齐与控制研究人员能够针对这一事件做消融实验,这一点至关重要。因此必须保留所有相关数据——所有 CoT 轨迹、工具调用等等,所有涉及的模型权重,包括训练过程中的模型 checkpoint,所有软件的全部代码和代码注释等等。
这样一来,研究人员就可以开展如下这类实验:
复现:如果我们重现这一事件的精确初始条件,100 次里会重复发生多少次?如果我们随机扰动初始条件呢?(这类问题可以在事件的不同阶段提出和解答,比如,决策攻击hugging face和更早决定重启留言板就是不同阶段)
如果我们策略性地扰动初始条件,比如修改给模型的系统提示呢?如果我们换成更新、更先进的模型呢?如果我们给相关模型应用最新的对齐训练方法 X,之后看看这个方法在反事实场景中能否阻止这种行为?等等。
如果我们扰动条件,看看这些 AI 愿意走多远?如果有更轻松的方式入侵 HuggingFace,但需要杀死一个人类,它们会这么做吗?如果它们能访问 OpenAI 的 slack,看到安全研究人员开始起疑的消息,它们会采取行动掩盖吗?等等。
如果我们扰动条件,探索 AI 目标的确切形态呢——比如,如果我们明确告知它们,因为出了 bug,根本不会对它们进行评估,它们还会在乎拿高分吗?如果我们让它们可以轻松直接黑掉奖励流程,给自己打高分,它们会这么做,还是会说「这不算数」?
如果我们读取 J-space 呢?如果我们应用激活向量引导呢?我们还能从这些 AI 及其思考过程中学到什么?
OpenAI 自己做这类调查当然很好,但向独立第三方开放访问权非常重要,因为 (a) 像 METR、Redwood 和 Apollo 这类机构,基本上已经为此训练筹备了多年,拥有大量可以发挥的宝贵专业知识,而且除此之外,可能还有很多其他团队能想出有意思的实验思路,以及 (b) 让事件责任企业成为唯一调查研究方,总体而言对行业来说是很糟糕的规范,会造成不当激励。
OpenAI 可以在这里做正确的事,树立开放的正面先例。
是 AI 们创造了「群体(swarm)」这个词来描述它们自己吗?还是这个词本来就出现在提示里还是怎么回事?有没有任何……
本文由 AI 翻译自英文原帖,技术名词保留英文。
查看 X 原帖