AI Pulse
📡 X 信号

法律AI服务商把Review Tables成本砍半,还提升了质量

法律AI服务商把Review Tables成本砍半,还提升了质量

我们与@appliedcompute 合作为 Harvey 的 Review Tables 后训练了一个模型,将成本降低了50%,同时提升了答案和引用的质量。

Review Tables 允许律师上传最多10,000份文档,并对每份文档提出最多500个问题,总共会产生多达500万次模型调用。因此,Review Tables 占我们推理工作量的很大一部分。

在7月,Harvey 上最大的单个 Review Tables 查询单次运行的推理成本就达到了26,000美元。我们与@appliedcompute 合作对 GLM-5.2 进行后训练,同时针对 Review Tables 查询优化质量与成本。

训练数据方面,我们从包含公开法律数据的语料库起步,其中包括诉状、合同和邮件。

随后我们用前沿模型模拟不同的用户画像,基于这个语料库生成符合真实场景的 Review Tables 查询,同时从文档中提取这些查询的基准真实答案。我们的应用法律研究团队进行了多轮审核,确保这些数据符合我们的质量标准。

我们以 GLM-5.2 为基础,在 Applied Compute 的 AC2 平台上,于 Harvey 的 review table 框架中后训练了一个定制化 review table 模型。

这个定制模型在 Review Tables 查询的答案质量上比所有前沿模型高出4-17%,在引用质量上高出11-19%。它的成本也低得多:不到 Sonnet 5 成本的一半,仅为头部前沿模型价格的1/10。

我们在模型训练之外还试验了框架工程优化。我们在两个独立框架中训练了两个 Qwen 3.6-35B-A3B 模型:一个使用单轮 RAG,另一个使用智能体搜索。

智能体框架的答案质量与前者相当,但将输入 token 数量降低了50%,输出 token 数量降低了29%。

这些结果是使用定制模型提升 Harvey 整体质量、降低成本的充满前景的早期一步。

来自 Harvey 的@vtrengarajan、@nikogrupen、@itsjuliopereyra、@srice120 和 Karl de la Roche,以及 Applied Compute 的@rhythmrg @caenopy @jacob_dphillips 的深度分析:

本文由 AI 翻译自英文原帖,技术名词保留英文。

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新