看好做训练的数据公司,得先验证数据质量才行
我看好开始着手训练工作的数据公司,数据供应商显然需要去了解他们的数据,并通过训练验证数据实际上是不是优质的。
我非常怀疑这些“数据实验室”会发布任何有用或是有意思的训练成果,但我预计未来几个月会出现一些和数据相关的有趣研究,哪怕是对内的。训练团队花了大量时间去弄清楚该用什么数据训练,以及模型正在学习哪些能力,这类工作数据供应公司比我们更清楚。
[注:任何将训练外包给第三方的数据供应商都是蠢材,因为大部分价值都存在于训练过程本身。其次,针对GLM/Kimi难完成任务的训练,和当前前沿正在做的事情完全不同;如果你认为Anthropic/OpenAI在训练Mythos/Astra的方法上相对于开源没有优势,那你错了]
我看好能做好这件事的公司:
- Preference Model
- Fleet
- Proximal
- Mercor*
*Mercor 正在这方面大力推进,我预计他们会产出一些有意思的东西,但我仍持怀疑态度,因为他们之前大部分工作都很糟糕。
我不看好能做好这件事的公司:
- Afterquery
- Handshake
- Datacurve
- Surge
- 其他所有YC强化学习环境相关公司
本文由 AI 翻译自英文原帖,技术名词保留英文。
查看 X 原帖