最新AI模型提示词实践经验分享:更少规则更清边界
最新的AI模型需要更少规则、更清晰边界,以及一套完全不同的提示词栈。在撰写了10万条提示、处理了1500万条模型消息后,我正在做出这些调整。
说实话,到目前为止,我几乎没有改动原有内容。一个重要提醒:我之前的文章主要关注的不是通过API大规模发送的自动化提示词。
在那种场景下,修改提示词需要严格得多、也系统化得多的评估流程。我删掉的大部分内容也一直保持删除状态。我自己的测试不算特别科学,但足够实用:我在几个完全独立的VM上运行同一个仓库,然后使用相同的提示词搭配不同的指令集或提示词变体。
当改动带来了显著且可复现的提升时,我就会保留这个改动。否则,我就会回滚,或者继续测试。
我的团队目前规模很小——一共只有2名高级开发人员。我们结合了经验、人工判断,以及多个LLM的自动审查来测试改动、检测漂移。它还不是一套完全正式的持续验证系统,但我同意,发布后的验证正变得越来越必要。
这和我的方法很接近。最简单的办法是准备一个由真实提示词组成的小型回归测试集:一次删掉一条规则,重新运行相同用例,再将结果和基线对比。
如果同一个错误在多次运行、或是多个模型版本中持续复现,就把这条规则加回去。否则,这条规则大概率只是用来修补旧模型脆弱性的补丁。
本文由 AI 翻译自英文原帖,技术名词保留英文。
查看 X 原帖