AI Pulse
📡 X 信号

Bending Spoons 99% AI流量运行在自托管开源模型上,成本大幅降低

Bending Spoons将99%的AI流量运行在自托管开源模型上。要实现这一点,必须先通过测试评估证明更低价的模型能得到正确结果。

当作者询问一位CTO,其智能代理运行在哪个模型上时,通常得到的回答都是市场上定价最高的那些模型,比如Claude Fable、GPT-6 Astra。当作者询问他们如何得知更低价的模型能否完成工作时,得到的往往是沉默。

作者并不责怪他们,因为如果没有办法测试低价模型,切换模型就只能等到客户发现错误之后。支付前沿模型的高价是稳妥的选择。

已经实现AI低成本运行的企业,会事先明确正确答案的标准。他们会保留一组从生产环境中提取的案例,答案由自家专家审核,然后让每一个候选模型都在这组案例上测试。

完成这一步之后,模型就变成了可以比价的商品。低价模型处理常规工作,高价模型处理边缘案例。当有新版本发布时,重新跑一遍测试案例,周五就能知道是否可以切换。

作者团队曾为一家医疗保健公司构建索赔智能代理,客户方专家编写了包含60个案例的测试集。模型在测试中60题答对59题,整个基础设施运行在客户自有租户中,每月仅花费250美元。

测试集归客户所有,因此更换底层模型不需要从头开始。

如果你是负责投资组合AI开支的运营合伙人,可以找到代币账单最高的投资组合公司,把他们最昂贵的工作流程私信发给作者。作者会告诉你这个工作流程需要什么样的测试集,以及测试低价模型是否值得。

可以预约探索电话来部署原生AI:

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新