AI Pulse
📡 X 信号

Miles v0.1 开源后,企业训专属大模型不用烧钱了

Miles v0.1 开源后,企业训专属大模型不用烧钱了

Miles v0.1 开源了:一套现成的“大模型训练流水线”,让企业自己训专属模型这件事,从烧钱赌博变成工程问题,属于SGLang 系那帮人做的开源 RL 后训练框架。

以前想让模型学会干你公司的活(写代码、操作软件、处理客服),要么找大厂定制,要么自己养一支底层团队从零搭,Miles 把这套东西打包好了,Docker 一键起,换上你的数据和任务就能训。

记得三个月前我预测未来每家公司都会拥有自己的模型,否则就是模型公司的养料,miles能帮企业往前更进一步:

1、能训练“干活的”模型,不只“会聊天的” 它的重点是 agentic RL——让模型在真实环境里反复试错,学会用工具、操作终端、完成多步任务——你想要的是一个能替你干活的 AI 员工,不是一个话痨

2、大模型也能在这个框架上跑 paper里提到:744B参数的 GLM-5.2,跑编程任务,64 张卡,每一步训练 4 分多钟。这个开源框架已能支撑训练千亿级模型,这在以前是大厂专利。

3、训练过程不容易崩 大规模 RL 最痛的是跑到一半挂掉,几十万电费打水漂。Miles 在稳定性上下了很多功夫,Modal 也是它的客户,评价是“长时间运行一直很稳”。

4、一套框架搞定所有训练类型 SFT(喂数据)、RL(试错学习)、蒸馏(大模型教小模型)、LoRA(省钱的轻量训练),一套代码全包不用东拼西凑。

5、数据本地化 跑在本地机���,数据、模型模型权重、训练记录全在自己手里,对金融、医疗、政府这类客户,这是刚需。

6、支持主流模型 DeepSeek、Qwen、GLM、Kimi、Gemma、Nemotron 都有现成配方,新模型发布当天就支持,N 卡、AMD 卡都能跑。

7、被真实客户验证过 Periodic Labs 用它在几千张卡上训万亿参数模型,Modal、IBM、Decagon、Nebius 都在生产环境用,不是实验室玩具。

两年前企业“训自己的模型”是幻想,一年前是烧钱的赌博,现在是一个工程问题,Miles 这类框架就是把这个工程问题标准化的基础设施。

创业公司:可以认真考虑做垂直模型了。

大企业:私有化训练的成本和风险都可控。

AI 服务商:帮企业训模型,或许对于从业者或fde来说是一个新的市场和机会。

#强化学习框架 #rl框架

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新