AI Pulse

当模型每秒生成1.7万token,卡住你的是测试和编译

如今,开发者体验以秒为单位衡量。如果你的测试运行需要一秒钟,那就算很好;如果需要三十秒,那就是很糟。比一秒钟更快实际上并不重要,因为你大部分时间要么花在思考上,要么花在等待 AI 代理运转上。把开发服务器重载时间或诸如此类的东西缩短几毫秒毫无意义:那不是瓶颈。

它将会成为瓶颈。小型模型正变得越来越快,智能模型正变得越来越小。我认为大多数工程师仍会希望使用最聪明的可用模型——软件工程很难——但我们将越来越多地看到更快的模型被用作子代理或用于理解透彻的任务。这在很大程度上是未知领域。很少有人对与以每秒数千 token 速度运行的代理一起工作会是什么样子形成直觉。

GPT-6-Astra 大约能以每秒六十个 token 的速度运行。这意味着你要花很多时间等待它思考。你像与另一个人合作一样与它合作:委派一个任务,然后在任务完成前不断切换上下文。如果你还没试过,可以玩玩 Jimmy——Taalas 版本的 LLaMA-3.1-8B,它以每秒一万七千 token 的速度运行。无论响应多长,它都会在你按下发送键的瞬间到达。这个模型还不足以胜任代理性工作,但它让我们得以一窥那会是什么样子:你会直接即时得到答案。

嗯,这假设了代理的工具调用是快速的。当生成 token 不再是瓶颈时,它能否在 100 毫秒而不是 10 毫秒内读取文件,或者能否在 500 毫秒而不是两秒内运行你的测试,将突然变得非常重要。快速的工具调用将决定是近乎即时的响应还是必须等待几分钟。因此,将会有巨大的压力,促使人们使用编译器和测试速度快的语言(如 Golang)进行代理式编码,并紧密优化代理代码库中的开发循环。

专注于 DevEx——开发者体验——的团队在很大程度上是 2010 年代的遗物,当时公司有动力让工程师感到快乐。大多数公司已将团队削减到最低限度的人员,或者完全撤销。但在 2020 年代末,我们可能会看到 DevEx 回归,专注于加速 AI 代理的体验。

阅读原文
📚 相关主题 开发者体验大模型

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新