AI Pulse
📡 X 信号

作者分享后训练方向6家硅谷公司案例

Post-training 一个很实际的目标,就是让小模型在某个特定场景,把业务做好、做便宜。这是我相当看好的方向。那硅谷工业界已经在做什么?

了解这些,对我们选方向、做项目都有指导意义。这次挑了 6 家我觉得很值得关注的公司 它们代表了后训练及相关工具的几条前沿方向,业务有重叠,但各有侧重。1. Thinking Machines Lab / Tinker:把训练基础设施交给平台 你自己写训练逻辑,Tinker 通过 API 帮你完成计算、更新模型和保存进度,省掉管理 GPU 集群的工作。

比如 Glean 用它训练了专门负责找资料的 Waldo,再把资料交给大模型组织答案。官网: Glean 案例: 2. Fireworks AI:把训练到上线的工程流程接起来 它把模型训练和上线运行放在同一个平台,还提供接入 coding agent 的工具,帮你研究训练方法、估成本、启动实验和排查失败。适合希望把训练、调试和部署连起来的团队。

官网: 训练 Agent Skills: 3. Prime Intellect:让模型在任务里反复尝试、打分、学习 你提供任务、可调用的工具和评分规则,它把模型尝试、评测和强化学习训练的过程跑起来。比如 Ramp 用它训练 FastAsk,专门学习在财务表格里找对单元格、调用 Python 算数,供主 agent 使用。官网: Ramp 案例: 4. Osmosis:工程师和客户一起把模型练出来 如果你连训练目标、reward 怎么设计都拿不准,它会派工程师和你一起把业务问题变成训练任务,再完成训练和上线。

它提供的是 平台加专业人员交付,客户买到的也包括训练经验。官网: 5. Bespoke Labs:给 AI 搭接近真实工作的训练环境 它给模型实验室和企业搭建包含真实代码库、微服务、多步骤工作流的训练环境,让 agent 有地方练习实际工作。它更关注 模型拿什么练、怎么验收,这些环境和配套基础设施就是它提供的产品。

官网: 6. Weco:让 AI 自动改方案、跑实验、比较结果 你给它代码和衡量效果的评测脚本,它用大模型加树搜索,反复修改、测试,继续尝试更有希望的方案。它自动化的是 做实验这件事,改进对象可以是 prompt、算法或训练代码,未必需要训练模型权重。官网: 工作方式: 我觉得对个人和小团队的启示很直接:先找到自己懂的具体场景,把“怎样才算做好”定义清楚,再借这些工具验证,能不能做得更好、更便宜

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新