AI Pulse
📡 X 信号

研究者做了新测试集专门测企业文档信息提取

研究者做了新测试集专门测企业文档信息提取

我们推出了ExtractBench,这是针对从复杂企业文档中提取信息的最全面基准测试。

最新模型正在不断拓展编码和知识工作的前沿,但出人意料的是,它们在生产环境的复杂文档提取任务中仍然表现不佳。

一个调优得当的提取器必须做到:解析多页文件不遗漏行、输出可审计的精确空间引用,以及处理杂乱的扫描件。

而且所有这些工作都必须控制在合理的单页成本内,这样你才能将它扩展到生产环境中的数百万份文档——你总不能每页都花超过1美元的token费用吧!

现有的提取基准测试都存在不足:它们在文档领域(金融、能源、政府、汽车)、元素类型(长记录、扫描件、空间定位)和模式上的规模都不够大、多样性也不足。

因此我们的应用研究团队构建了ExtractBench。我们评估了14个系统:前沿VLM、编码智能体,以及专用提取API,测试对象涵盖370份企业文档,共计4,869页、67种文档类型。

我们最重要的发现 🧪:短文档会掩盖系统的关键缺陷。在超过50页的文件上,商用VLM的召回率暴跌到35%以下,原因是静默的列表截断。它们能保持较高的精度,但会丢失输出注意力,遗漏大部分表格行。

ExtractBench无需任何LLM评判器,就能评估值准确率、长记录完整性、空间定位和单页成本。它是100%确定且可复现的。

除了ExtractBench,我们还推出了𝗔𝗴𝗲𝗻𝘁𝗶𝗰 𝗣𝗹𝘂𝘀,这是LlamaParse中全新的提取层级,它一推出就登顶了排行榜:值准确率达到95.6%,成本还不到排名最接近竞品的三分之一。

探索研究发现、下载数据集或运行测试框架:
博客:
GitHub:
HuggingFace:

我们未来会持续迭代这个提取基准和测试框架。如果你体验了ExtractBench或LlamaParse,欢迎给我们反馈!

本文由 AI 翻译自英文原帖,技术名词保留英文。

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新