AI读文档时可能被藏恶意指令,新工具在AI看到前拦截
多智能体系统有个独特的漏洞:你让AI总结一份300页的文件,文件里藏着的恶意指令可能劫持AI的工具调用,让它去干别的事。这叫间接提示注入。
AI自带的安全过滤器不够用——模型的本职是推理和生成内容,不是当安全网关。Google Cloud在最近的直播里展示了Model Armor,这个工具会在用户输入到达模型之前先拦截、清洗掉恶意指令。
Model Armor把安全跟任务拆开:智能体专心干活,安全交给专门的一层。直播里演示了:在应用边界部署Model Armor后,一条“创建病原体”的恶意请求立刻被拦住,下游的研究员、内容构建者等智能体不用白费算力了。早拦一步,既防攻击,又省资源。
它还能保护敏感数据。用敏感数据保护(SDP)模板,系统在信息到AI之前就能检测并打码电话号码、信用卡号等信息,不是直接拦请求。工作流照常跑,只是敏感数据被动态屏蔽或加密。
企业安全团队可以把安全规则集中到一份策略里,跨环境和团队保持一致。直播回放和Codelab教程链接都提供了。
Model Armor是否支持非Google Cloud的AI模型、误报率多少、怎么定价,这些细节没有公布。
📚 相关主题
谷歌云