新大模型基准测试,揭秘长上下文两大痛点
朋友们,我已经开始在全新的 LLM 基准测试中测量与上下文相关的生成质量了。为此,我正在从准确性、质量和上下文一致性三个维度,评估模型在 16k、32k、64k、128k、256k 和 512k 上下文请求下给出的回答。🎉
我最初几轮测试的结果非常惊人;Opus、GPT Sol 和 Kimi 模型的测试加准备工作,10 分钟就做完了,一共花了 200 美元。
现在我终于明白 OpenAI 为什么要在 223k 上下文推出 Codex 计划,以及为什么会设置周度限额了。现在在 Openrouter 上,它的成本比 Opus 还要高 🔥
在这些测试中观察到的数据非常不妙:64k 输入上下文以上的生成质量下降越来越明显,与此同时 API 成本飙升得吓人。
我认为,企业在用的 Coding Agent 上下文已经涨到 1M,成本居高不下又跑不出合格成果,原因就出在这里。
我的一点拙见建议是,如果是企业内部使用,将 Coding 和 Workflow Agent 的最大上下文限制在 256k,最好是 128k,你的成本会下降,输出质量也会大幅提升。
我会在本周分享我的测试结果。❤️
本文由 AI 翻译自英文原帖,技术名词保留英文。
查看 X 原帖