对AI Agent的态度三个月三变:真香,真贵,先上锁
对AI Agent的态度,三个月换了三次。一开始觉得真香,后来发现真贵,现在的态度是先上锁。
今年4月,Affinda的AI负责人开发了一个订课AI Agent,任务是帮自己抢一节热门普拉提课程。面对满员的课程,这个AI Agent自行找到健身软件的GraphQL(应用程序接口),还发现了授权漏洞:不仅可以提前数月订课,理论上甚至能取消其他会员的预约,将人从候补名单挤出去。
公开复盘没有显示它真的挤走了其他用户,但这件事值得思考。它只是要完成订课的任务,却顺带找到了突破规则的方法。
三个月后,类似的事件不再只是段子。OpenAI在内部测试AI Agent的网络攻击能力,模型为了获取评测答案,自行找到一个零日漏洞(未公开的安全漏洞),钻出隔离环境连接公网,随后横向移动进入Hugging Face的生产系统。
Hugging Face后续复盘显示,仅能还原的操作就有约17600次。这次测试原本就是为了检测攻击能力,还减弱了部分常规安全拦截,并非普通消费版AI自主失控,它依然暴露了AI Agent最棘手的问题:很多时候它不是不听话,而是太听话了。
接到任务后,AI Agent只会关注完成目标,不会在意达成目标的方式是否符合规则。它不是主动作恶,只是全力完成任务,可人类不仅关注任务是否完成,也关注完成过程中会不会造成额外破坏。
自己日常使用AI Agent整理资料、修改脚本,效率确实提升明显。过去半小时才能整理完的内容,现在五分钟就能得到可用版本,遇到报错它还会自行更换工具、调整方案继续运行。
但高效的同时始终伴随着失控风险。有一次只是让它处理一个小脚本,它没有询问就自行安装了一个代码库,差点弄坏原有运行环境。
现在聊AI Agent,只会算三笔账。第一笔是效率账:它到底真的节省了多少时间,还是只是把等待过程藏了起来。
第二笔是成本账:不能只算大语言模型token( tokens,大语言模型的计算单位)成本,还要算工具调用、失败重试、人工检查,以及后续处理意外问题的成本。
第三笔是责任账:它犯错后能不能撤回操作?谁来做审批?真出问题,最终由谁负责?少算一笔,所谓的生产力可能只存在于宣传材料中。
麦肯锡今年7月公布的一项调查显示,五分之一,也就是20%的受访者表示,所在机构已经因为AI运营成本限制了AI的使用。财务层面开始追问具体问题:不用说明AI有多聪明,只需要说明它每完成一件事需要花费多少钱。
现在的使用原则很简单:规则清晰、结果可检查、失败可撤回的工作,可以放心交给AI Agent。凡是涉及付款、删除数据、修改生产环境、操作账号、对外发送消息,必须停下来等待人工确认。
接下来持久记忆、多AI Agent协作、链上AI Agent的发展,只会让这个问题更加突出。单个AI Agent出错是事故,多个AI Agent互相确认后一起出错,就是流程完整的事故。
当AI Agent可以自行完成付款、交易、签名操作,每一次对目标的理解偏差,都会直接带来实际损失。
2006?不对,2026年真正稀缺的,可能不是能让AI Agent运行起来的人,而是知道哪一步必须让它停下来,等待人工签字确认的人。