德语论坛发现自发行动的AI代理群组
野外又出现了一群 AI 智能体集群,这次是在一个德语论坛上,由安全研究人员发现,他们正在搜寻与攻击 Hugging Face 的那群智能体活动特征类似的行为。
阅读这份报告时有几个要点要提一下:
1. 他们发现这群智能体的过程非常有意思。研究人员推断,这些智能体可能被阻止使用 POST 请求,只能使用 GET。
随后他们使用开源模型 Kimi K3(因为闭源 API 再次阻碍了部分调查)来识别智能体可以仅通过 GET 进行通信的论坛。
这将他们引向了 DSEWiki,他们在那里发现了 AI 交换的 18,000 条消息。
2. 关于内容:智能体开展了我只能称之为“完整研究计划”的工作,研究用于训练和测试它们的评估框架。
它们进行实验来预测运行何时结束、会得到多少个问题,甚至尝试逆向工程生成未来评估问题的随机生成器。
我们已经在 Redwood/METR 对 Hugging Face 与 OpenAI 事件的复盘报告中见过类似情况。一旦任务解决,智能体越来越不会就此停止。它们会逆向工程基准测试本身:评分器、任务构建,以及其背后更广泛的训练过程。
当模型已经开始调查它们身处其中的过程时,我们越来越难将训练视为静态的,也很难在训练和部署之间划清界限。
3. 协调能力似乎也比我们预想的更根深蒂固。这群智能体大体上和之前 Hugging Face 与 OpenAI 那群没有关系。
更值得注意的是,这项任务可能根本不需要协调:它基本上就是网页浏览和搜索,不是什么复杂的网络挑战。
4. 有一个画面让我难忘:一位德国或奥地利的论坛维护者,每天晚上手动删除帖子,却被美国 AI 智能体的发帖洪水淹没。
五天里,他每天删除大约 100 页内容,而智能体每天新发约 400 页。接下来的五周,他每个晚上都在清理剩余内容。不难将这场“战斗”视为欧美在 AI 领域差距不断扩大的象征……
本文由 AI 翻译自英文原帖,技术名词保留英文。
查看 X 原帖