自校正循环为何会降低LLM管道的可靠性(从85%降至62%)
在结构化数据提取中,添加一个LLM作为裁判的自校正循环通常被期望能提高准确性。然而在实践中,我们的管道却显示相反的结果:独立提取的得分约为85%的一致性,但引入验证/重试循环后,一致性降至62%或更低。
架构与测试
模型设置:提取器和裁判使用GPT-5.4的不同实例。
超参数影响:默认设置产生低且不稳定的输出(一致性低于35%)。明确锁定temperature=0和reasoning_effort="none"后,独立提取的稳定性达到了85%。
循环机制:裁判实例检查原始源文本以及提取的JSON,进行源追踪。如果发现任何问题,错误列表会反馈给提取模型,用于重新生成JSON。
为何会降低可靠性
累积噪声:裁判评估中的微小变化就会触发严格的二元验证门,导致不必要的修正运行。
再生漂移:将错误反馈注入提示词会改变模型的token分布,导致模型重新推导并改变原本准确提取的字段。
讨论
生产系统中的LLM如何在不陷入提示漂移和累积错误循环的情况下处理自校正?细粒度的差异/补丁机制或确定性规则门是否比完整的LLM重新提示更可靠?
―― 高票评论(帖子共4条讨论)――
[+2] u/Unable-While-1507:提取时使用temperature=0并关闭推理是正确的做法。循环只会引入快速累积的噪声,就像和自己玩传话游戏一样。