AI Pulse
📡 X 信号

llama_index发布双阶段文档处理工具套件(50+)

llama_index发布双阶段文档处理工具套件(50+)

当前 agent 框架(Codex、Cowork)最新的 RAG 趋势是,针对文档数据室中的知识工作任务,采用两阶段文档处理:

1️⃣ 快速轻量阶段,通常使用免费/开源文档解析工具。这种方式可以低成本处理10到数万份文件,让 agent 能够执行检索(例如 grep、语义检索)找到相关上下文子集。

2️⃣「即时」基于VLM的处理阶段。一旦 agent 找到相关上下文页面,就会对文档截图,调用自身VLM(或编写代码)拆解页面。

如果只在海量的客户临时文件转储上使用基于VLM的OCR工具,问题在于速度慢、成本高。使用即时VLM OCR能让 agent 廉价过滤数据,同时仍能保留任务所需上下文的准确性。

这些 agent 框架默认使用现成工具做两阶段文档处理:第一阶段用 pdf2text,第二阶段用自身(Opus 5)。

你可以观看下方视频,观看 Cowork 处理一堆PDF,回答 Kimi k3 论文中一张基准测试图相关问题的过程。

这些 agent 提供的「开箱即用」文档处理主要存在以下问题:
* Opus 5 并不是最适合OCR的VLM。大规模使用成本过高,且缺乏 grounding 能力
* pypdf、pdf2text这类开源工具,作为第一阶段处理通用性可能不足
* agent 会编写大量一次性代码,重写OCR工具本就开箱提供的功能,例如图表处理、 bounding box、置信度评分,这会增加成本、拖慢速度

我们在@llama_index 中已经准备好了所有工具,能帮助任何agent实现两阶段文档处理,精度更高、成本更低。

1️⃣ 我们的第一阶段处理有 liteparse——一款用Rust编写的免费开源解析器,比其他开源解析器更快、更准确,支持50+种文档类型
2️⃣ 我们的第二阶段处理有 LlamaParse——一款智能文档引擎,结合VLM+框架在各类文档解析和提取任务上实现了精度和成本的SOTA。它可以作为MCP或技能从任何agent框架调用。

它以页码作为输入,因此agent可以选择只对文档子集运行LlamaParse,作为「放大查看」阶段,无需处理完整文档。

快来体验吧!
LiteParse:
LlamaParse:
所有相关文档,包括MCP,都在这里:

本文由 AI 翻译自英文原帖,技术名词保留英文。

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新