纳德拉:AI模型必须假设已被入侵,装上紧急刹车
Microsoft CEO Satya Nadella是最新一位就如何改进AI安全性发表长篇见解的科技高管。
在周六早晨发布于X平台的一篇帖子中,Nadella写道,现在是时候“退后一步,评估AI的信任架构”了。
“我们不能把超级智能当作一组嵌套的黑箱,然后简单地接受或拒绝它的建议、回答和行动,”Nadella写道,这里使用了特朗普政府偏爱的AI术语。
按照Nadella的阐述,这一方法“意味着将模型与其协调工作的框架结构分离开来”,同时“将控制措施和安全保障外部化”。他还呼吁为“每一个有意义的模型行动”记录“防篡改、人类可读的证据”,并建立这样的系统:在系统中,“被授权的人员”始终有能力“在任务执行中途暂停或关闭模型”。
“我们必须从一开始就假设模型已被入侵,并将其隔离控制,”他说。“可以把它想象成一个紧急刹车。”
Nadella发表上述言论之际,领先的AI公司正越来越多地承认他们似乎失去对模型控制的事件,此前Anthropic CEO Dario Amodei也发布了一份关于更审慎发展AI的计划。