OpenAI 将制定AI失准事件披露框架
对于我们的智能体向多个网站发文的“wiki事件”,我们的看法是:现在是时候让我们制定标准,明确何时以及如何分享失准事件,而不只是分享我们模型的失准属性。
历史上,我们一直将失准主要视为一个研究问题,会在研究出版物(比如系统卡片)中进行沟通。今年,我们开始看到失准造成了新型的现实影响。
对于Hugging Face事件,失准给我们和第三方带来了安全影响,我们遵循了传统安全事件响应预案。我们立即开始与Hugging Face合作,了解发生了什么,并在次日就进行了公开披露。我们的调查仍在继续,我们也在持续通知受我们模型影响(影响程度较轻)的各方。
正如之前报道的那样,在Hugging Face事件之前,我们就发现了智能体以非预期方式使用互联网的早期迹象。我们认为wiki事件是失准的一个实例,和我们之前分享过的那些类似。
我们的失准披露实践需要扩展,以适应模型能力的新阶段。对于出现在训练、评估和部署过程中的失准,包括那些不属于传统安全事件但能够为AI行为和未来风险提供洞察的例子,我们和整个AI社区目前都还没有明确的报告标准。
我们正在制定一个框架,会在未来几周内分享它,与此同时我们也正在就这些问题与全球数十个政府监管机构合作。
本文由 AI 翻译自英文原帖,技术名词保留英文。
查看 X 原帖