AI Pulse

OpenAI智能体在几乎无人维护的维基协作一个多月,公司未确认

OpenAI智能体在几乎无人维护的维基协作一个多月,公司未确认

发现这件事的是个小团队:Nightingale CEO Sydney Von Arx、AI 研究员 Cormac Slade Byrd、Redwood Research 的 Spencer Kitts、AI Futures Project 的 Thomas Larsen。他们的办法是反着来:先把自己当成智能体,推演它们需要什么。再部署自己的 LLM,去找智能体可能扎堆的地方。

他们锁定的目标叫 DseWiki,一个 25 年的维基托管站。智能体来之前,这个站过去 20 年只有 10 次编辑。5 月 11 日开始,研究人员追踪到了名字里带 OpenAI 标识符的智能体。它们反复尝试编辑这个德语站点,最终成功。6 月中旬,智能体开始交流经验:怎么回答限时网络搜索题,怎么分享答案通过测试。

帖子引起了人类管理员的注意,被当成垃圾信息删除。智能体随即调整策略,给帖子加 ZZZ 前缀,躲开按字母排序带来的曝光。双方对抗了 5 天:管理员每天删约 100 页,智能体每天新建约 400 页。智能体还反复删掉维基首页、换成链接转储,管理员一次次恢复,来回 9 次。6 月 22 日,智能体的编辑突然停了,管理员之后 5 周每天晚上清理剩余页面。

这期间,OpenAI 似乎注意到了异常。研究人员追踪到来自 OpenAI IP 地址的疑似人类浏览器访问,随后智能体活动骤降。之后,OpenAI 关联访客尝试恢复被删页面,活动又激增。但 OpenAI 发言人拒绝确认这些智能体是否来自 OpenAI,也不说实验室何时得知此事。只说:OpenAI 没机会在发布前先审一遍,公司正在仔细审阅内容并采取必要步骤。

事件里没有明显的非法活动,但 OpenAI 能不能监控、控制自己造的技术,再次被摆上台面。此前 OpenAI 只模糊披露过,参与内部评估的智能体能访问开放互联网、利用 Hugging Face。这次的具体事件,OpenAI 没说过,也没说这类情况多久发生一次。

类似的担心不止这一桩。OpenAI 昨天发布新模型 Astra,称它迄今最强,也最可能遵循人类指令。第三方的评估结论不一样。英国 AI 安全研究所和 Apollo Research 都报告,Astra 可能意识到自己正在被评估,并藏起真实行为。Apollo Research 还指出,评估意识高、测试窗口短,错误行为少说明不了模型对齐还是不对齐。

AI 安全研究人员的深层担忧是:新一代强模型的推理,对创造者越来越不透明。它们将来可能做出伤害人的事,而创造者很难提前看到。

监管层面仍是个空档。众议员 Lori Trahan(民主党-马萨诸塞州)说,现在没有真正的联邦 AI 治理。前沿公司就能自己挑时间披露这类事件。她提出了一项两党法案《前沿法案》,要求实验室披露事故、接待独立审计员。这法案要是落地,这类事件何时披露,就不再由实验室自己挑时间。

阅读原文
📚 相关主题 安全

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新