AI Pulse
🔥 热点深度解读

AI开发正在转向「评估优先」的全新范式

有人刚做完一个AI聊天机器人的项目,改了十几轮提示词,换了两个大模型,输出质量还是不稳定。

现在有一种新的开发思路能解决这个问题,就是最近在开发者社群引发讨论的Eval驱动开发。

Eval就是评估的意思,这种方法要求开发者在修改提示词或者更换模型之前,先定义好输出的质量标准,每次变更都要按照这个标准自动化测试之后才能上线。

和我们熟悉的测试驱动开发不同,Eval驱动开发不关心函数返回值是不是精确匹配,它核心关注AI能不能成功完成用户要做的任务,评估范围覆盖了结果、行为甚至整个流程。

@jerryjliu0 认为:现在解决任何任务,都可以通过定义评估标准,再用爬山算法逐步优化结果,不用直接设计固定的开发流程。数据公司的工作未来会变成给所有经济活动定义评估标准,让前沿模型能胜任任何工作,开发者只需要明确要解决什么问题,以及怎么判断结果好坏。

@hwchase17 连续三次转发认同这个观点,直接点出这就是「eval driven development」,也就是Eval驱动开发。

目前开发AI应用最大的挑战就是输出质量不稳定,其次还有响应延迟和安全性问题。第一代AI代理更看重拓展能力,下一代AI代理会把重心放在可靠性和可信度上,而Eval驱动开发正好能满足这个需求。

按照行业预测,到2026年,Eval驱动开发就会成为构建稳定AI应用的推荐标准开发实践。

对普通人来说,这意味着以后我们用到的AI工具会越来越靠谱,不会出现上次用着好好的,这次输出就乱七八糟的情况。

对开发者来说,这种开发方式降低了试错成本,不用再靠经验猜来猜去改提示词,有明确的质量标准可以参考。

当所有经济活动都能定义出清晰的评估标准,AI真的能接手所有工作吗?

📎 参考来源

查看原始推文

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新