Agentic engineering面试,怎么防执行乱操作
简历上写着 Agentic engineering,被一道题刷掉了。
这个面试官问:planner agent 出计划,executor agent 去执行,怎么防止 executor 闭眼照做?
候选人说:在 system prompt 里写上“不要执行危险命令”。
面试官追问:这等于同一个模型自己拦自己,万一它跑出沙箱呢? 然后就没有然后了。
我觉得这题核心就一句:刹车要装在模型够不着的地方。
换我大概这么答:
1. 权限先砍到最小。executor 手里只有白名单工具,没给的能力,prompt 被绕成什么样也调不出来。
2. 计划和执行之间插一层普通代码。按 schema 校验每一步:调哪个工具、碰哪些路径、花多少钱,超范围直接拒。这层是写死的,模型说服不了它。
3. 按能不能撤回分级。读文件随便跑;删库、转账、发邮件、推生产这种收不回来的,停下来等人点头。
4. 沙箱里别放钥匙。凭证用短期、限定范围的 token,网络默认断开。真跑出去了,能炸的范围也就这么大。
5. 全程留日志,能回滚。
我觉得可以把 executor 当成一个很聪明、手很快、但今天刚入职的实习生。
你不会跟他说一句“别乱来”,然后把生产库密码递过去。
这五条拆开看,全是老派工程常识:最小权限、审批流、审计日志。
Agent 把写代码变便宜了,这套老手艺反而变贵了。
要是我去面,可能会在最后补一句“其实我也不太信我自己写的 prompt”,不知道算加分还是减分😂