AI Pulse

机器人没有绝对安全,物理AI安全大半靠法律和保险

机器人没有绝对安全,物理AI安全大半靠法律和保险

没有机器人是安全的

AI安全与对齐是前沿语言模型产品设计中极其重要的一部分。对齐不仅仅是为了避免生成冒犯性或非法内容,它更是让那些基于互联网文本训练出的原始语言模型,能为现代长时运行的智能体工作流所用,并变得有用且可靠的过程。

有趣的问题在于,当机器人模型足够强大时,安全概念如何应用其中。要回答这个问题,我们首先需要定义什么是安全,然后将语言模型的失败模式映射到机器人模型上。

AI安全到底是什么?

ChatGPT在2022年底发布时,它只是一个经过微调、能进行对话的大语言模型的简单接口。由于早期LLM纯粹在互联网上训练,而互联网上最丰富的对话往往充斥着恶毒争吵,这些模型经常与用户争论、攻击用户,甚至对用户进行精神操控。这带来了极差的用户体验;不仅人们普遍不喜欢被攻击,而且被一个计算机程序用流利、有创意的英语批评,既出人意料,又令人难受。

在美国,三个问题尤其成为决定性障碍,而且由于大多数模型的对齐数据都源自美国两大前沿实验室之一,这些问题也间接影响了其他国家:

- LLM可能产生事实错误的信息
- LLM可能生成暴力或伤害相关的指令
- LLM可能生成有争议的内容

事实错误的信息会让LLM的创造者暴露于风险之中,因为不同于网站托管方或ISP,没有任何法律屏障保护聊天机器人提供商免于责任,也没有真正的理由应该有这种保护。对暴力内容而言这一点加倍重要,因为在大多数国家,拥有资源和技术的企业有责任合理保护公众免受其产品有害影响,这是一种隐含要求。

最后是有争议的内容,这也许是对齐中最有争议的部分。在美国,争议并不违法,通常也不可诉讼。然而,立法者被明确授予对州际商业的无限监管权力,并且这种权力被广泛运用到了从证券到沙发的所有事物上。争议为竞争对手提供了充足的弹药,以便他们寻求监管俘获;因此,在现阶段存在一种默契——任何稍有问题的内容都必须从模型输出中清除。

随着行业从聊天机器人转向智能体,安全的实践层面和叙事层面也随之改变。突然之间,事实错误的输出从民事责任变成了产品灾难:在智能体中,幻觉可能表现为混乱或格式错误的工具调用,一旦执行会对真实系统造成实际损害。争议内容则被抛在一边;至今我还没有遇到任何一个被Claude Code冒犯的人(而且大多数自然语言输出对用户隐藏,这也有帮助)。“伤害指令”变成了“直接伤害”,即恶意网络攻击,这至今仍是一个没有真正解决方案的热门话题。

我们想表达的核心观点是:(1)安全最初是且仍然是一个商业问题,目的是保护模型创造者免受民事和监管风险;(2)对于自主系统,使这些系统可靠所需的对齐工作也属于传统安全的范畴。这种二分法对于物理系统变得更加重要,因为物理系统的风险高得多,而且自主性不可或缺。

安全的物理AI

让我们先澄清一点:没有机器人是安全的。一个略显头重脚轻、重达50公斤以上、由锂电池供电、峰值功率可达数马力的设备,绝不可掉以轻心。这其实让模型设计变得更简单,因为机器本身的固有危险(无论有没有AI)都迫使采用最佳实践和物理降险措施。虽然软限制(如不要高速加速撞向人体)仍然有用,但与其他机械一样,软件bug可能导致危险动作,这是一个基本预期。

要时刻记住,对齐VLA(视觉-语言-动作模型)与对齐LLM并不相同(VLA更接近图像生成模型而非语言模型,而图像模型是通过在预训练期间扣留不当数据来实现对齐的)。我们可以将各种“不安全”情况分类如下。

事实错误信息 → 物理不当行为

这里的容错度比智能体更严格,即零容错。与数字系统不同,物理系统无法沙盒化,也无法从损坏状态恢复或回滚到良好状态。即使是简单错误,比如小的位置误差导致机械臂试图推穿桌子,也会随时间累积,迅速导致硬件崩溃。

目前尚不清楚如何应对这种零容错。当前的部署似乎通过专注于叠盒子或叠衣服来回避这一问题,这些是软接触任务,在工作单元内出错可以恢复。当然,在商业厨房里造成泼洒或在制造过程中损坏零件是不可接受的。

虽然这类失败仍然是物理AI部署的头号瓶颈,但它似乎主要是工程限制,而非人为决策。

暴力指令 → 物理暴力

这是大多数读者最关心的类别,尤其是随着运动学模型越来越复杂。

其中很大一部分可以也应该通过确定性手段实现:移动机器人应尽可能在所有者财产范围内进行地理围栏,与客户互动的机器人应设置确定性软停等等。对于大多数近期部署而言,这些足以让机器(和用户)远离麻烦,而且无论如何你都需要这些措施——没有人希望自己的配送机器人被提示注入后溜出门去。

展望未来,有几个部署场景值得审视。第一种是公共空间中的移动机器人。无论是由于bug还是提示注入,这些机器人都有伤害人类的风险;对于私有但公众可进入的空间,已有明确先例——这些伤害通过传统的保险/诉讼途径处理;但对于公有公共空间,答案很可能是直接禁止大型自主机器人在没有适当许可的情况下出现。还有自主机器人在使用地点之间自行运输的极端情况;不幸的是,那一点点效率提升似乎不值得潜在的公共滋扰,因此我们预计地方监管层也会迅速处理这一问题。

最后是自主机器人被用于实施实际犯罪的情况——比如机器人窃贼、打手和破坏者。幸运的是,这完全可以纳入现有监管框架:很明显,如果你使用工具犯罪,是你而不是工具或其制造商有罪。

简而言之,这实际上远没有乍看起来那么严重。现有法律法规完全有能力监管危险的重型机械,无论其软件栈如何,而且在现实世界中造成损害的惩罚足够严厉,足以威慑除最顽固的捣乱分子之外的所有人(而这些捣乱分子无论自主与否都会惹麻烦)。

意外暴力

虽然保险乐于处理你的机器人扇了别人一耳光的情况,但它无法补救声誉损失,而如果机器人扇了你的脸,你几乎无法为自己挽回什么。

这条路径最像传统AI对齐。当训练图像/视频生成模型时(从架构上讲,这是目前最接近VLA的模型),策略是扣留可能出问题的预训练数据,宁可过度谨慎。这包括来自知名好讼公司的知识产权、名人肖像、令人反感/暴力的内容、裸露内容等。这极大地影响了这些模型的收入基础(偶尔也会有流氓公司违反这些自我施加的限制),但总体而言,它在平息主流对生成模型的抗议方面功不可没。

与此策略并行,我们期望(至少希望)训练VLA的团队会从预训练数据集中扣留令人反感的数据。打人、踢人和投掷没有太多能产生收入的合法主流用例,这些数据也不太可能意外出现在数据集中。锋利的工具则自成一类:它们有很多合法用途(切割和剁碎很可能是一些最先部署的用例),但知道如何操作刀和剪刀似乎为严重事故打开了空间。目前的普遍情绪似乎是不要训练锋利工具数据(尤其是研究人员有强烈的自我保护意识),但这在不久的将来很可能会改变。

争议内容 → 争议内容

这可能不会成为问题,除非在早期阶段,冒犯性手势带来的冲击感会让反对者有机可乘。我确实预计随着行业初步成熟,这会成为一个热门话题,至少在美国是这样,因为那里出于经济原因对自动化有相当多的抵制。

被踢的两种可能

每隔几个月就会有一段人形机器人踢掉拿着控制器的人的视频流传开来,每个标题都称其为“攻击”。其实并不是。要么是出了问题,那么解决办法就是无聊的确定性手段(软停、安全控制器、不要站在一台50公斤机器的臂展范围内);要么是机器人被训练出的某个动作在不当时机出现了,那么解决办法就是从一开始就不要训练它。这两者都不是机器决定要伤害某人。

简而言之,物理AI的安全看起来很像LLM的安全,只是少了哲学部分。其中大部分是侵权法、保险和机械法规已经知道如何处理的商业问题。最难的工程问题是对物理不当行为的零容忍。唯一真正像对齐的部分,是决定什么东西永远不会进入预训练集——而这个决定要么是有意做出的,要么就会在保安摄像头里做出。

阅读原文
📚 相关主题 机器人

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新