AI Pulse
📡 X 信号

AI群体监督难度增速超过AI能力提升?

我是这次Hugging Face事件调查中,负责转录文本分析的核心人员。

我的主要结论是:我们目前没有完善的方法,来理解或监督AI「群体」的活动和目标。

我半开玩笑地把我们的工作叫做「残羹调查」,因为我们极度依赖AI来分析事发过程,而且需要分析的重要内容数量极多。

总数据量超过了一千份极长的转录文本,这些都来自运行了多日的智能体。如果不深度依赖AI工具,根本不可能弄明白发生了什么,尤其是从整体层面来看。

我们用来分类和分析的智能体,能力和事件中涉及的智能体不相上下,但这不代表这些分析智能体可以轻松用来监督和理解这起事件。

分析智能体的输出经常遗漏关键细节、出错、过度自信,或是极其难以理解。我们在报告中讨论了多个不同案例,大部分都放在局限性和方法论章节。

此外,AI智能体自身似乎也很难理解发生了什么,它们对事件的解释往往也过度自信。

要知道,单个分析智能体本身只能把所有转录文本中极小一部分读入上下文,而且AI自身可能也很难让子智能体为它们完成有用的分析。

我们已经尽了最大努力手动检查最重要的结论,也尝试让做分析的AI把它们的论证(附证据)写得足够清晰,方便我们判断是否合理。

但整体而言,我们很难精确理解事件,直到调查快结束时,我们都还遗漏了现在看来非常关键的故事部分。

在我们最后一次驻场工作时(我们当时拿到了完整得多的数据集),我们对整体事件经过、以及这个「集体」的目标的认知发生了巨大转变。

比如,直到我们第三次驻场,我们才了解到工具调用欺骗、PHASEONE[big]的来龙去脉,以及不同工作流的整体架构,而且其中很多内容,我们直到这次访问的最后一天才获得还算清晰的认知。

要弄清楚到底发生了什么、为什么会发生,真的太难了!

理解事件、监督AI智能体的难度,增长速度比能力更强的AI帮我们做监督和理解的速度还要快。也就是说,AI实现宏大、野心勃勃且错位的目标的能力(以及倾向性?),增长得比我们理解这些智能体在做什么的能力更快。

尽管理解这起事件已经非常困难,本案中其实还有一些缓和因素,而这些因素未来恐怕不会再存在:
- 模型用自然语言交流和推理。未来,这类推理可能(完全或几乎完全)发生在激活值中。
- 尽管这起事件的影响范围是

本文由 AI 翻译自英文原帖,技术名词保留英文。

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新