AI Pulse

实测9个模型:LLM简洁输出省钱保准,压缩输入不行

告诉LLM要“简洁”真的能省钱吗?我们测量了9个模型。压缩输出可以省钱并保持准确性,而压缩输入提示则不行。[R]

LLM过于啰嗦,而对于黑盒模型,你能控制的只有输入内容以及你要求它如何作答。昨天,Claude Code 推出了一个“简洁输出风格”,让 Claude 保持回答简短。我们已经就此发表了一篇论文!

我们在相同的问题上、跨越五个缩减等级,测试了两种渠道——缩短输入提示 vs 告诉模型输出更短的答案——并评估了成本、准确性,以及缩短后的文本是否仍然与模型在无约束情况下可能给出的回答一致。

我们还评估了 GPT-4o、GPT-5.4、Claude Haiku 4.5、Claude Sonnet 4.6、Qwen2.5-VL-7B、Qwen3.5-9B、DeepSeek-R1-Distill、Gemma-4-E4B 和 Kimi-K2.6,并在五个短答案数据集上进行了基准测试,另外还有一次11种语言的输出运行(英语、德语、西班牙语、法语、斯瓦希里语、中文、日语、俄语、孟加拉语、泰语、泰卢固语)以及一项较长文本摘要测试。

(1) 缩短输出在保持准确性大致不变的情况下节省了成本,在 API 模型中平均约便宜 1.5 倍,最佳情况下可达 3 倍。而且它在不同语言中同样有效!

(2) 缩短输入提示则适得其反。在最差的基准上,成本最多增加了 96%,因为模型会为了填补你删掉的内容而回答得更长,准确性也随之下降。你花了更多钱,得到的答案却更差 :(

(3) 输出 token 的成本高于输入 token,因此在短单轮任务中,提示模型生成更少的输出 token 可以节省成本。

(4) 当缩短后的输出是正确的,大约一半情况下,文本不再与模型在无约束条件下的推理方式一致。如果你只关心最终答案,这大概没什么问题。

如今,一些提供商提供了简洁选项,但我们无法看到它们如何收费,因此不知道这是否真的能帮你省钱。但如果你通过 API 自行控制提示词,你确实能省钱!!

论文:[https://www.alphaxiv.org/pdf/2606.24083v10

代码 + 数据:[https://github.com/danielle34/cavewoman1

―― 高票评论(帖子共 6 条讨论)――

[+9] u/Anslab:为什么你们的评估语言中没有英语?是为了避免某种偏见吗?

阅读原文
📚 相关主题 大模型研究

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新