AI Pulse
📡 X 信号

开发者为AI智能体创建了四阶段工作验证工具SureForge

我观察到我的AI智能体在每一项大型任务上都会犯相同的错误,于是我为AI智能体构建了一套流程:这些错误包括在理解请求前就开始构建、把未回答的问题默认当成是同意、只检查一个样本就宣称任务完成,然后自己审核自己的工作并通过。

SureForge 是一份供智能体读取的纯文本指令集。它将工作拆分为四个阶段,每个阶段结束都有一道智能体必须通过的门槛,才能进入下一阶段:

1. 研究与澄清。阅读已有的所有内容,查找未知信息,然后只询问那些会改变结果的问题。跳过的问题永远不能被当成答案。

2. 规划。每一项需求都对应一个步骤,对应将要检查的具体项,以及每一项如何验证。在开始构建任何内容前,先检查计划。

3. 执行。一个负责人,按依赖顺序排序,先测试再修复。如果执行过程中发现计划出错,智能体要退回计划门槛,而不是打补丁。

4. 交付。冻结结果,检查每一项约定好的内容,而不是只检查样本,然后按照实际使用的方式试用它。报告哪些内容通过了验证,哪些没有。

在每一道门槛,智能体都要用三种不同的方法检查自己的工作,而不是重复用同一种方法。之后,会有一名独立审核员,他不了解智能体的推理过程或自我评分,带着全新背景,自己挑选三种方法再次检查。

在做出任何修改前,每一项发现都会被调查。如果三轮检查后仍有未解决的真问题,智能体会向你明确汇报剩余问题,让你来决定,而不是直接宣称工作完成。

小任务保持简单。修复打字错误后只做差异检查,不用当成一个研究项目来处理。

这就是把我的工作方式写下来了。更少返工,更少补丁,我花在检查上的时间少得多,而且结果第一次做就是对的。它还能节省token:仔细走一遍流程比三次马虎的尝试消耗更少。

它免费开源,纯文本格式,没有运行时依赖。可配合 Claude Code、Codex、Cursor、Devin、Hermes 使用。

本文由 AI 翻译自英文原帖,技术名词保留英文。

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新