Proximal发布FrontierSWE 编码基准测试(millions of dollars)
我们需要更好的评估。我们开展FrontierSWE工作并发布它的动机之一是,当时我们看到很多博客都在说,运行数小时的智能体可以完成不可思议的任务,比如:
- Cursor从零构建了一款网页浏览器
- 有一个智能体用Rust重写了Bun
- Anthropic构建了一个C编译器。
我们发现许多编码基准已经饱和(比如SWE-Bench Pro等),我们想要一个能够准确反映超长周期、超高难度软件工程任务的基准——这类任务通常需要人类花费数周至数月的时间——以此来衡量AI进步。
随着Muse Spark 1.3和Gemini Flash 3.8在DeepSWE这类基准上得分与Fable 5.1或Astra相近,很明显,我们非常需要能够准确反映模型进步、对前沿模型而言既公平又有难度的优质基准。
我可能有偏见,但FrontierSWE是唯一还未饱和、并且最贴近日常开发者偏好的编码基准。
在Proximal,我们将在未来几个月投入数百万美元,为社区打造更好的评估,覆盖软件工程、科学、硬件工程等领域。如果你对这类工作感兴趣,我们很乐意和你聊聊。团队目前非常精简(只有3个人),自主权很高,资源充足。
本文由 AI 翻译自英文原帖,技术名词保留英文。
查看 X 原帖