Anthropic发布Claude构建知识图谱官方指南
Anthropic 发布了使用 Claude 构建知识图谱的官方指南。
当答案不存在于单一文档中时,你就需要构建知识图谱。比如:谁和参与过项目 X 的人共事过?哪些供应商接触过这起事件?
检索只能给你最相近的文本块,而关系链不存在于任何单个文本块中。在过去,这意味着你需要在自己的领域上训练实体识别器、训练关系分类器,还要手动编写合并规则。这三件事都需要维护,而且随着数据变化,三者都会很快过时。
在这份指南里,每一步都只用提示词完成。用便宜的模型做抽取。你只需要描述一次输出格式,所有文档就能输出符合要求的定型实体和三元组。
模型还会为每个实体写一句话描述,这个功能看起来没用,下一步就会派上用场。然后由更智能的模型合并重复实体,旧方案恰恰在这里失效。编辑距离可以匹配 NASA 和美国国家航空航天局,但对 Edwin Aldrin 和 Buzz Aldrin 完全没用——这两个名字没有共享字符,却是同一个人。大模型可以读取那一行行描述,按语义合并。
查询的逻辑正好反过来。提取一个节点周围的邻域,把原始三元组交给 Claude,答案里的每一个断言都会指向它来源的边。
这套方案还自带黄金标准数据集和评分器,所以你修改抽取提示词的一行内容后,重新运行就能看到准确率的变化。
完整拆解见下方文章,收藏这篇推⽂。
完整官方指南
本文由 AI 翻译自英文原帖,技术名词保留英文。
查看 X 原帖