框架对AI性能影响竟和模型本身一样大
斯坦福大学和麻省理工学院联合发表的关于模型框架(Model Harnesses)的论文显示,AI性能不仅取决于模型本身,还取决于周围的系统代码——也就是“框架”(harness)。
框架决定了要存储什么、检索什么、向模型展示什么,以及工作流如何运行。在底层大语言模型相同的情况下,更换框架会让同一基准测试中的性能差距最高达到6倍。他们得出结论:模型周围的框架和模型本身同等重要。
论文介绍了Meta-Harness,这是一个能自动优化框架代码的外环系统。不同于只给优化智能体提供分数或过往尝试的简短摘要,Meta-Harness通过类文件系统设置让智能体可以充分访问先前的代码、日志和执行轨迹。这个思路是,更好的诊断可见性能让系统更智能地优化框架。
研究结果非常显著:
- 在在线文本分类任务上,相比性能强劲的SOTA上下文管理方法,提升了7.7个百分点,同时使用的上下文token减少了四分之三。
- 在检索增强的数学推理任务上,针对200道IMO级别问题,五个保留模型的平均得分提升了4.7分。
- 在智能体编码任务上,Meta-Harness发现的框架在TerminalBench-2上击败了人工设计的强基线模型。
这篇论文把关注点从“哪个模型最好?”转向了“整个AI系统要如何设计?”。在实际部署中,框架设计会影响可靠性、工具使用、上下文管理和故障恢复。
论文链接:arxiv.org/abs/2603.28052
论文标题:《元框架:模型框架的端到端优化》
本文由 AI 翻译自英文原帖,技术名词保留英文。
查看 X 原帖