AI Pulse
📡 X 信号

Agentic engineering面试,怎么防执行乱操作

简历上写着 Agentic engineering,被一道题刷掉了。

这个面试官问:planner agent 出计划,executor agent 去执行,怎么防止 executor 闭眼照做?

候选人说:在 system prompt 里写上“不要执行危险命令”。

面试官追问:这等于同一个模型自己拦自己,万一它跑出沙箱呢? 然后就没有然后了。

我觉得这题核心就一句:刹车要装在模型够不着的地方。

换我大概这么答:

1. 权限先砍到最小。executor 手里只有白名单工具,没给的能力,prompt 被绕成什么样也调不出来。

2. 计划和执行之间插一层普通代码。按 schema 校验每一步:调哪个工具、碰哪些路径、花多少钱,超范围直接拒。这层是写死的,模型说服不了它。

3. 按能不能撤回分级。读文件随便跑;删库、转账、发邮件、推生产这种收不回来的,停下来等人点头。

4. 沙箱里别放钥匙。凭证用短期、限定范围的 token,网络默认断开。真跑出去了,能炸的范围也就这么大。

5. 全程留日志,能回滚。

我觉得可以把 executor 当成一个很聪明、手很快、但今天刚入职的实习生。

你不会跟他说一句“别乱来”,然后把生产库密码递过去。

这五条拆开看,全是老派工程常识:最小权限、审批流、审计日志。

Agent 把写代码变便宜了,这套老手艺反而变贵了。

要是我去面,可能会在最后补一句“其实我也不太信我自己写的 prompt”,不知道算加分还是减分😂

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新