Harvey披露Tenet模型训练新进展
@harvey 的模型训练工作进展更新。我们完成了一个名为 Tenet 的模型后训练:
- 在 LAB 上实现了 SOTA
- 能泛化到第三方法律基准测试
- 使用子代理实现特定领域能力
Tenet 以 Kimi K3 为底座,与 @FireworksAI_HQ 合作完成后训练:
- 在全网络上应用 Rank-64 LoRA
- 带重要性比率掩码的 GSPO
- 用 134 张 B300 GPU 训练了 2 个月
尽管我们没有在第三方法律数据集上训练 Tenet,它仍在以下任务上取得了提升:
- @mercor 的 Apex Agents
- 公司法
- @crosbylegal 的 Redline Bench
- LegalBench
Tenet 还学会了如何使用特定领域子代理(独立的后训练模型)处理复杂任务:
- 并购尽职调查:在 RLM 框架中针对长周期任务训练(合作方 @baseten)
- 表格审阅:用于批量结构化数据提取的专家模型(合作方 @appliedcompute)
- 律所知识库:参数化记忆与结构化笔记,实现更高效的企业搜索(合作方 @engram)
这些结果表明我们可以大幅扩大训练规模,我们计划:
- 大幅扩容人工数据和合成数据,将训练规模扩展到 1000 张 GPU,之后再到 10000 张 GPU
- 该规模将支持我们转向全参数微调,训练更大的模型
- 我们现已启动在生产框架中进行模型后训练
- 后训练其他开源基座模型,为客户提供更多模型选择
如果这些问题你也觉得有意思,我们的后训练团队正在招人。
本文由 AI 翻译自英文原帖,技术名词保留英文。
查看 X 原帖