AI Pulse
📡 X 信号

他们造了一家合成律所,专门训练法律AI

我们正与 @EngramLab 合作训练能够理解律所知识的模型。

律所的核心差异化竞争力很大一部分来自该所完成过的所有过往工作。当一名 junior 律师处理新交易时,他们可以查阅律所几十年来完成的同类交易,而这份工作的一大重点就是知道如何有效利用这些知识。

但这类数据中很大一部分要么是客户数据,要么衍生自客户数据,这意味着你不能简单地把所有数据都放进单个模型训练,因为那样就会破坏保密协议。

为了将研究问题和数据隐私、部署问题分开,我们构建了一家合成律所。

@ItsJulioPereyra 写了一篇很棒的文章,介绍了这个数据集、相关任务,以及创建大型律所典型数据合成版本的方法。

这家合成律所拥有 46 名客户、266 项客户事务,每项客户事务都包含你在律所文档管理系统检索中能找到的工作产出、版本、邮件、草稿等等内容。

这个数据集让我们可以探索智能体在超大型知识语料库(1 亿+ token)上的推理能力,这类场景还要求复杂的多跳推理。

比如说,要回答「在同类交易中,我们是如何构建陈述与保证条款的」这类查询,模型需要先理解哪些因素让交易相似,再检索所有过往交易找到对应案例。

我们发现,用于这类推理的通用智能体方法成本高昂,而且无法覆盖所有情况,还有很大的改进空间。

我们很激动即将开源这个数据集,也会很快分享更多研究结果。

本文由 AI 翻译自英文原帖,技术名词保留英文。

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新