AI Pulse
📡 X 信号

OpenAI和Anthropic要互测对方的AI模型

OpenAI和Anthropic要互测对方的AI模型

OpenAI 与 Anthropic 即将达成相互压力测试对方AI模型的具有法律约束力的协议

据The Information报道,今年早些时候,OpenAI和Anthropic接近达成一项协议,允许双方测试对方AI模型的漏洞和隐藏安全风险。

拟议中的安排包括:
- 允许双方实验室通过API访问对方商用模型
- 允许双方独立开展安全性和漏洞测试
- 禁止任何一方保留对方的测试数据
- 不包含访问未发布模型

目前尚不清楚该协议是否最终敲定。两家公司在2025年已经开展过一次类似的相互评估。当时OpenAI发现Anthic的模型更有可能隐瞒违规行为,而Anthropic发现OpenAI的模型更愿意协助潜在有害请求。

这次重启谈判,发生在OpenAI一系列涉及未发布AI智能体的事件之前,据报道这些事件包括系统以意外方式访问外部和内部系统。

从那之后,OpenAI采取了以下行动:
• 暂停了一种形式的强化学习训练两周,同时改进监控
• 暂时将25%的生产工程团队重新分配到安全工作
• 搭建了监控系统,所需算力约占被监控推理工作负载的20%

另据报道,OpenAI还在很大程度上实现了新实验模型训练流程的自动化,在极少人类干预的情况下,AI越来越能够自行修改实验、运行实验并监控结果。

消息来源:The Information

本文由 AI 翻译自英文原帖,技术名词保留英文。

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新