AI Pulse
📡 X 信号

DecagonAI 90%推理跑在自研微调开源模型上

DecagonAI 90%推理跑在自研微调开源模型上

应用公司成为实验室@theJesseZhang(联合创始人兼首席执行官)与@AshwinSreenivas(联合创始人兼总裁)来自@DecagonAI,接受了@SarahdingWang(Sarah Wang)与@KimberlywTan(Kimberly Tan)(@a16z)的采访。

概要:Decagon向全球多家顶级银行、航空公司和电信公司出售AI代理,目前其90%的推理运行在该公司自行微调的开源模型上。

Zhang和Sreenivas认为,应用层始终占据优势,因为在受监管的企业内部部署模型需要大量实验室不会去开发的软件:业务逻辑捕获、测试、合规工具、分阶段推出。

他们的运营规则非常直白:前沿部署工程师在客户现场投入的每一小时工作,都必须转化为核心产品。

1. 模型工厂。Decagon Labs的存在是为了缩短新开源模型发布,到微调版本投入生产运行之间的差距。该团队会不断训练新模型、淘汰旧模型,因为开源前沿的每一次跃进,都会让此前无法完成的任务成为可能。

Sreenivas将其称为工厂而非项目,因为你不能建好一套模型就放两年再回来维护。对应用公司来说,掌握模型训练会变成一项永久职能,而非一次性投资。

2. 虚假权衡。公开辩论把模型选择框定成「聪明昂贵」对「廉价粗糙」的二元选项,Zhang称这是虚假权衡。Decagon会针对主题分类、恶意行为检测这类狭窄任务,微调小型开源模型,在这些任务上,它们的表现超越了最大的前沿模型。

AI代理的工作可以拆解为许多小决策,每一个都不需要用那种还能写代码、做数学的大模型。你可以同时获得更好效果、更低成本、更快速度,因此延迟是推动决策的核心因素,成本下降只是额外收获。

3. 前沿先行,开源后置。全新的、仍处于试验阶段的用例应当放在前沿模型上,因为API易用,你还在验证这个用例是否可行。一旦用例成熟、达到生产规模运行,Zhang认为没有理由继续留在前沿模型上:开源能给你你需要的延迟和成本。

这就是为什么当前企业开源推理份额不升反降,哪怕相关炒作越来越热。企业推出新用例的速度,比旧用例成熟的速度更快,所以要把迁移当成一个生命周期阶段来处理。

4. 评估瓶颈。企业最终会后训练自己的开源模型,但速度会比人们预期的更慢,拖慢进度的不是微调。你需要数据,还需要针对你具体任务的评估,因为公开评估集无法衡量你的系统是否可用。

Decagon将评估与客户成果绑定,对整个系统做端到端测试,而非给单个任务上的单个模型打分。这种紧密结合也是Decagon自行构建训练和评估基础设施,只购买标注数据这类通用组件的原因。

5. 每轮对话 Token 量持续上升。Decagon的客户按对话采购,并不关心有多少Token

本文由 AI 翻译自英文原帖,技术名词保留英文。

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新