做GraphRAG不用大模型,小模型反而效果更好
最新一篇论文指出,“构建GraphRAG(从文本文档构建知识图谱来做检索的RAG进阶形态)需要大尺寸LLM”其实是一种错误认知(https://arxiv[.]org/html/2607.11683v1)。
论文提出,LLM在管线中负责的工作,也就是从文本中抽取人名、产品名等实体,或是从上下文推理实体关系,这些都属于“语言技能”,和“世界知识(模型掌握各类常识事实的多少)”是两回事。
世界知识会随着模型尺寸增大持续提升,但语言技能在相对较小的模型上就会早早达到瓶颈。
实际测试中,将Qwen2.5系列从0.5B扩展到72B,世界知识问答的F1得分提升了21.1个百分点,而所有答案都明确写在上下文里的任务,得分只提升了4个百分点。
基于这一发现做了专属微调的7B模型「Meno-Lite-0.1」,在知识图谱构建任务的总得分上比32B的Qwen2.5-32B高出12.5%,而它的参数量还不到对方的四分之一。
同期发布的GraphRAG引擎RAGU采用了分离设计,将实体提取和整合处理(去重、摘要、对图谱做语义分块的社区检测)分开,能够构建噪声更少的知识图谱。
在医疗领域基准测试中,它完整覆盖答案依据的比例(证据召回率)在所有难度下都拿到了最高分(最高84%,现有方法为76%)。在简单问答任务上,现有方法HippoRAG2表现更好,但在需要整合大范围上下文的生成任务上,RAGU实现了反超。
另一个有趣发现来自多跳QA(需要串联多个信息才能作答的问题)测试中观察到的假象。使用原生生成提示时,现有方法看起来完胜,但原因只是回答格式差异:正确答案是短文,RAGU的回答却更容易变长。
统一要求回答简洁后,在BioASQ基准测试上RAGU以微弱优势反超(72.9对72.4),在2WikiMultiHopQA上的差距也从19.3个百分点缩小到了5.5个百分点。
RAGU可以在单GPU上运行,处理单份文档成本仅0.001美元,是使用商业API的现有方法(单文档0.10美元)的百分之一。目前已经以MIT许可证开源,可通过pip install graph_ragu安装。
本文由 AI 翻译自英文原帖,技术名词保留英文。
查看 X 原帖