烛夜
烛夜
发布于 2026-07-28 / 19 阅读
0
0

RAG 学习专题 Day 5 —— 当神经科学进入 RAG

今天来研读《HippoRAG: Neurobiologically Inspired Long-Term Memory for Large Language Models

开源实现:HippoRAG


1. 为什么要引入 HippoRAG ? 过往的研究有什么不足?

哺乳动物在数百万年的进化中形成了强大的长期记忆,能持续整合新经验以形成长期记忆系统。但对于 LLM 而言,想要获取这种持续更新知识,构建长期记忆系统的能力,目前最常用的做法是 RAG 。然而,传统 chunk-based RAG 将每个文本块独立编码,而真实世界的很多任务(如文献综述、法律案例分析、医学诊断、多跳问答)需要将分散在不同文档中的信息串联起来

为了解决跨文档推理,现有的 RAG 尝试采用多步/迭代检索(Multi-step / Iterative Retrieval)的方式,其代表是 IRCoT 。然而作者指出,即便是完美执行的多步 RAG,面对复杂的寻路型多跳问题(Path-finding multi-hop questions)依然会失效。

作者从神经科学领域著名的海马体记忆索引理论中获取了灵感。海马体记忆索引理论认为,人类基于上下文持续更新的强大记忆系统依赖于两大系统的协作:

  • 新皮层 (Neocortex):负责处理和存储具体的记忆内容(语义、感知信息)。

  • 海马体 (Hippocampus):它维持一个 索引结构,指向新皮层中的记忆单元,并存储它们之间的关联

基于此,作者提出了 HippoRAG ,它的架构大致可以概括为:

  • 无模式知识图谱 (Schemaless KG):由 LLM 从文本中自动提取三元组建立(不依赖预设的固定 Schema),作为人工海马体索引。

  • 检索寻路机制 (Personalized PageRank, PPR):当用户提出新 Query 时:

    1. LLM 识别 Query 中的关键概念(抽取 Seed Nodes)。

    2. 以这些 Seed Nodes 为起点,在 KG 上运行 Personalized PageRank (PPR) 算法

    3. 能量在图网络中激活扩散,顺着关系边探索潜在路径,在单次检索(Single-step)中定位到最相关的子图。

HippoRAG 取得了很亮眼的成果:

① 检索精度显著提升

  • 在两个极具挑战的多跳问答数据集 MuSiQue2WikiMultiHopQA 上,相比于现有 RAG 方法提升了 3 ~ 20 个百分点

② 效率与成本优势很大

  • 相比于像 IRCoT 这样的传统迭代式/多步检索 方法,成本便宜 10 到 30 倍,速度快 6 到 13 倍,在单步检索下就达到了与多步迭代检索相当甚至更高的精度。

③ 良好的兼容性

  • HippoRAG 与 IRCoT 不冲突。把 HippoRAG 嵌入到 IRCoT 中,能够在原有数据集上再提升 4% ~ 20% 的性能,并且在相对简单的 HotpotQA 数据集上也取得了额外收益。

最后,作者给出了一个案例研究,探讨 HippoRAG 在解决前面提到的 “寻路型多跳问题” 上的潜力。

2. HippoRAG 是如何诞生的?

2.1 海马体索引理论

大脑在处理记忆时,必须同时满足两个需求:

  • 模式分离(Pattern Separation):确保不同经历的表征是独特且可区分的(避免不同记忆混为一谈,造成混淆)。

  • 模式完成(Pattern Completion):能够“以局部推全貌”。哪怕只给你一个不完整的线索或刺激(Partial Stimulus),也能检索出完整的相关记忆。

为了达成这两个需求,大脑利用三个组件完成了两个阶段的工作:

① 记忆编码过程(Memory Encoding)—— 实现“模式分离”

  1. 新皮层(Neocortex) 接收外界感知刺激,并将其转化为高阶特征。

  2. 这些特征通过海马旁区(Parahippocampal Regions, PHR) 被路由传输到海马体。

  3. 海马体(Hippocampus) 提取出最显著的信号,在海马体索引(Hippocampal Index)中注册,并建立起这些信号之间的关联连接。

② 记忆检索过程(Memory Retrieval)—— 实现“模式完成”

  1. 当海马体通过 PHR 管道接收到一个不完整的感知信号(例如你提出了一个只涉及部分背景知识的问题)时,启动“模式完成”。

  2. 海马体利用其内部密集的神经元网络(特别是 CA3 亚区),在索引网络中寻找完整的关联记忆。

  3. 最后,海马体将检索出的索引信息通过 PHR 传回新皮层,在新皮层中重现(Simulation)出完整的记忆。

人脑在学习新知识时,不需要重构整个新皮层表征,而只需要更新海马体中的索引网络。

2.2 HippoRAG 概述

受到海马体索引理论中 “三组件两阶段” 流程的启发,作者在 HippoRAG 中做了一一映射:

三组件在 HippoRAG 中分别对应:

脑区

人脑功能

HippoRAG 组件

作用与功能

新皮层 (Neocortex)

处理感知输入、提取高阶语义特征

Instruction-tuned LLM

负责抽取文本/Query 中的实体与三元组

海马体 (Hippocampus)

存储关联索引结构,通过神经通路完成模式补全

无模式知识图谱 (Schemaless KG) + PPR 算法

作为人工海马体索引,通过算法在网络中漫游扩散能量

海马旁区 (PHR)

连接新皮层与海马体的路由桥梁

Dense Retrieval Encoder(稠密检索编码器)

计算词组语义相似度,为相近实体建立同义/模糊关联边

记忆编码过程在 HippoRAG 中对应 “离线索引阶段” ,分为三步:

  1. 信息抽取 (LLM -> OpenIE)

    • 强大的指令微调 LLM 作为人工新皮层,从检索语料库(Passages)中抽取知识图谱三元组。该知识图谱是无模式的,采用开放信息抽取(OpenIE)方法。

    • 实现“模式分离”:OpenIE 方法抽取的不是整体稠密向量(Dense Vector),而是离散的名词短语(Noun Phrases)。这保证了不同的经验表征足够精细且独立。

  2. 构建海马体索引 (Open KG):

    • 将这些三元组连成一张全语料库共享的无模式知识图谱(Schemaless KG),它就是人工海马体索引

  3. 建立 PHR 关联(Semantic Edges)

    • 为了解决“同义词”或“相似表达”无法连通的问题,利用预训练好的稠密检索编码器(Retrieval Encoders)计算图中节点之间的向量相似度。

    • 如果两个名词短语语义非常接近但又不完全相同,就在它们之间连接一条额外的 “语义边” ,这可以辅助后续的模式补全。

记忆检索过程在 HippoRAG 中对应 “在线检索阶段”,分为四步:

  1. 抽取 Query 实体(新皮层):LLM 读入用户问询(Query),从中提取出最关键的命名实体,称之为问询命名实体(Query Named Entities)

  2. 锚定种子节点(PHR 路由):利用检索编码器计算 Query 实体与图谱节点的语义相似度,将它们映射到图谱中的特定节点上,这些节点称为问询节点(Query Nodes)问询节点可以视作一种 “部分感知信号” ,因此人工海马体能够对其执行 “模式完成” 。

  3. 模式补全与激活扩散(海马体):Query Nodes 为起点(Seed Nodes),在 KG 上运行 Personalized PageRank (PPR) 算法。概率(能量)顺着图中的实体边和语义边向外扩散,自动探索潜在的推理路径。

  4. 概率聚合与文档重排(反馈新皮层):将 PPR 算法收敛后各个节点获得的概率得分,反向聚合归向它们所对应的原始文档,并对文档进行最终重排,输入给 LLM 做深度阅读。

Personalized PageRank (PPR) 算法是 PageRank 算法的一种版本。它只需要用户定义一组 “源节点” ,就能在图上传播概率。

2.3 详细方法论

这一节详细介绍 HippoRAG 的方法论。

2.3.1 离线索引阶段

离线索引阶段的主要任务是:通过一个指令微调的 LLM(称为 L )和一个检索编码器(称为 M ),对一组文章(称为 P )进行处理。

  1. 首先,用 L 对 P 中的每一篇文章提取一组名词短语节点 N 和一组关系边 E(利用 OpenIE 方法)。作者在这里采取了两阶段提取法:

    • 先用提示词(Prompting)让 LLM 提取每篇文章中的命名实体(Named Entities)

    • 再把提取出的实体拼接入第二个 OpenIE Prompt,抽取更丰富的三元组(包含实体和概念短语)。

    • 设计目的:在通用性(Generality)与对命名实体的偏好(Bias)之间取得恰当的平衡。

  2. 接着,对于节点集 N 中的两个节点,如果它们的向量表示的余弦相似度超过某个阈值 τ ,就给这两个节点添加一条语义边,以此丰富网络通路。这一步由检索编码器 M 完成。

  3. 最后,定义 Passage 映射矩阵 P

    • 构造一个尺寸为 |N| * |P| 的矩阵 P

    • 矩阵元素 Pij 表示名词短语节点 i 在原始文章 j 中出现的次数。

2.3.2 在线检索阶段

在线检索将 Query 映射到图上,并通过 PPR 扩散得到最终的文档排序:

  1. 确定 Seed 节点 (Rq)

    • 使用 LLM 从 Query q 中提取命名实体 Cq = {c1, c2 ,.., cn} 。

    • 利用检索编码器 M 计算语义相似度,找出节点集 N 中与 Cq 相似度最高的一组节点作为 Query Nodes (Rq)

  2. 定义个性化初始分布 n 并运行 PPR

    • 构造一个概率向量 n ,使得所有 Seed 节点平均分摊初始概率,非 Seed 节点的概率为 0。

    • 在 2.3.1 阶段得到的图上运行 PPR 算法,得到收敛后的节点概率分布 n′

  3. 反向映射与文档打分

    • 将收敛后的节点概率分布 n′ 与离线生成的矩阵 Pij 相乘:得到的向量 p 即为各原始文章(Passage)的最终得分,按此得分降序排列并输出,即可用于检索。

2.3.3 节点特异性

节点特异性的引入是为了在不依赖全局词频统计信息的前提下,完成对 “稀有概念” 更高权重的分配。

在传统的信息检索中,IDF(逆文档频率)能有效抑制高频通用词(如“The”, “People”)的干扰。但从神经生物学角度看,人脑不可能在每次检索时去全脑统计全局 IDF(那会导致海马体神经元连接过载)。

因此,作者提出了一种仅依赖本地信号(Local Signals)的生物学可行替代方案——节点特异性

节点 i 的特异性得分定义为:si = |Pi|−1 ,其中 |Pi| 表示提取出节点 i 的文档数量(即该节点关联的文档数)。节点出现的文档越少,si 越高,代表其信息量越大。

使用方式:在运行 PPR 之前,将初始 Query 节点的概率 n 乘以其对应的特异性系数 s (逐元素乘积)。

例如在某个语料集 P 中,“Stanford”(斯坦福)在很多文档中都出现过,其概率权重就会缩小;而 “Alzheimer's”(阿尔茨海默病)出现的文档较少,特异性高,概率权重就会变大,从而将更多的概率流引导给稀有关键概念的领域。

3. 实验与数据

3.1 数据集

本文选择了三个主流的多跳问答数据集:

数据集

难度与特性

作者的评测态度

MuSiQue (answerable)

极具挑战性、推理链条长且严格

主战场:能够真实反映跨文档推理与复杂寻路能力。

2WikiMultiHopQA

包含复杂的实体关系推理路径

主战场:重点考察图结构与多路径跳跃。

HotpotQA

传统经典数据集,但存在很多“伪快捷路径(Spurious Signals)”

补充对比:虽然常用,但因存在不需多跳推理就能靠表面匹配猜出答案的漏洞,因此仅作完整性参考。

为了保证实验的严谨性并控制开销,作者做了以下方案:

  • 从每个数据集的验证集(Validation Set)中随机抽取 1,000 个问题,这与业内主流基准(如 IRCoT)保持一致,既控制了评估的计算成本,又具备足够的统计显著性。

  • 遵循 IRCoT 的设定,将每个数据集中 1,000 个问题所对应的所有支持文档以及干扰文档全部合并,为每个数据集构建出一个检索语料库。

详细信息如下表所示:

3.2 Baseline

3.2.1 传统与经典单步检索基线(Single-step Baselines)

作者选择了四个不同技术维度的经典检索器作为基础对比:

  • BM25:传统的稀疏检索(Sparse Retrieval)代表,依赖词频与逆文档频率(TF-IDF 变体)做精确关键词匹配。

  • Contriever:基于对比学习(Contrastive Learning)训练的无监督密集检索器(Dense Retriever)

  • GTR (Generalizable T5 Retriever):基于双塔架构(Dual-Encoder)和预训练 T5 模型的有监督双塔密集检索器,泛化能力强。

  • ColBERTv2:著名的细粒度晚期交互(Late Interaction)模型,保留了 Query 和 Document 词级别的 Token 向量交互,效果通常显著优于传统单塔/双塔 Dense 模型。

3.2.2 新兴的大模型增强型检索基线(LLM-augmented Baselines)

为了证明 HippoRAG 的图关联机制优于现有的“LLM 增强文本”方案,作者对比了两个最新的改进型 RAG:

  • Propositionizer:将冗长复杂的 Passage 利用 LLM 拆解并重写成独立、原子化的命题(Propositions),以此提高文本检索的精度。

  • RAPTOR:通过对文档进行递归聚类和总结,构建树状的摘要节点(Summary Nodes),帮助大模型从长文本中抽取高层语义。

3.2.3 多步/迭代检索基线(Multi-step Baseline)

  • IRCoT (Iterative Retrieval-guided Chain-of-Thought)

    • 机制:把思维链(Chain-of-Thought)和检索结合起来,交替让 LLM 生成推理步骤,并拿生成的中间步骤作为 Query 去反复检索更多文档(多步循环)。

    • 意义:这是目前处理多跳问答(Multi-hop QA)的强劲基线。HippoRAG 将与它对比单步 vs 多步在“精度、速度、成本”上的全方位表现。

3.3 实验环境

3.3.1 核心模型选择

  • 大模型 L:默认使用 GPT-3.5-turbo-1106,并将 temperature 设为 0 以保证输出确定性。用于离线抽取三元组(OpenIE)以及在线抽取 Query 实体。

  • 检索编码器 M :对比测试了两种类型:Contriever(密集向量检索器)vs ColBERTv2(细粒度晚期交互检索器)。用于计算实体节点的语义相似度建立同义边 E',以及在线匹配 Query 节点。

3.3.2 两个关键超参数调优

作者从 MuSiQue 的训练集中抽取了 100 个样本 以完成对 HippoRAG 两个超参数的微调:

超参数

设定值

物理/算法含义

同义边阈值 τ

0.8

当两个节点向量的余弦相似度 ≥0.8 时,在海马体索引图中添加同义关联边 E' 。

PPR 阻尼系数

0.5

决定 PPR 随机游走时继续顺着图游走还是跳回 Seed 节点重新开始的概率。较小的阻尼系数(0.5)意味着游走更加聚焦于 Seed 节点的局部邻域(局部搜索),符合海马体联想激活的特性。

作者发现,HippoRAG 的性能对超参数的变化相当鲁棒。因此上述调参过程只采取 100 个样本是可以接受的。

3.4 评价指标与实验结果

3.4.1 检索性能指标(Retrieval Metrics)

  • Recall@k (R@2 / R@5)

    • 含义:在检索系统返回的前 k(此处 k=2 或 k=5)个文档(Passages)中,包含的真值支持文档(Ground-truth Supporting Passages)占所有真值文档的比例

实验数据在下表中给出:

单步检索实验结果:

  • 主要数据集(MuSiQue & 2WikiMultiHopQA)

    • HippoRAG 的表现超越了所有对比方法(包括 Propositionizer 和 RAPTOR 等新兴的 LLM 增强型 Baseline)。

    • 2WikiMultiHopQA:提升非常显著,Recall@2(R@2)和 Recall@5(R@5)分别提升了约 11%20%

    • MuSiQue:获得了约 3% 的性能提升。

    • 归因解释:作者指出,这两个数据集的提升差异,部分原因是 2WikiMultiHopQA 采用了以实体为中心的设计,这种设计特别契合 HippoRAG 的架构。

  • 次要数据集(HotpotQA)

    • HippoRAG 取得了具有竞争力的表现,但相比主数据集优势没那么大。

    • 归因解释:作者解释主要有两个原因:

      1. HotpotQA 本身对知识整合的要求较低

      2. 存在概念-上下文权衡(concept-context tradeoff)问题(作者在附录中提出了集成技术来缓解此问题)。

多步检索实验结果:

将 HippoRAG 与多步检索方法 IRCoT 结合使用(即用 HippoRAG 作为 IRCoT 的底层检索器):

  • 互补性:实验证明 IRCoT 与 HippoRAG 具有很强的互补性

  • 具体 R@5 提升

    • MuSiQue:R@5 持续带来了约 4% 的额外提升。

    • 2WikiMultiHopQA:R@5 带来了约 18% 的显著额外提升。

    • HotpotQA:R@5 带来了额外 1% 的提升。

3.4.2 问答生成性能指标(QA Performance Metrics)

将检索出的前 k 个文档送入 LLM 生成最终答案后,评估答案质量:

  • Exact Match (EM, 完全匹配率)

    • 含义:模型生成的答案字符串与标准答案(Ground Truth)完全一致(忽略大小写和标点符号等差异)的比例。这是一个非常严格的硬指标。

  • F1 Score (F1 值)

    • 含义:计算生成答案与标准答案在词级别(Token-level)的精准率(Precision)和召回率(Recall)的调和平均数。相比于 EM,F1 能更宽容地评估语义相近或包含额外细节的回答。

实验数据在下表中给出:

问答实验结果:

作者对比了 HippoRAG、最强检索基线 ColBERTv2、多步检索基线 IRCoT,以及将 HippoRAG 作为底层检索器融入后的 IRCoT(即 IRCoT + HippoRAG)。所有方法均使用同一个 QA 阅读器(QA Reader):

  • F1 得分全线提升

    • 2WikiMultiHopQA:F1 得分提升最高,达到了 17%

    • MuSiQue:F1 得分提升了约 3%

    • HotpotQA:F1 得分提升了约 1%

  • 现象与归因:正如预期的那样,单步与多步检索性能的增强,直接转化为了最终 QA 生成质量的显著提升。

此外,作者强调了单步 HippoRAG 对比传统多步 IRCoT 的效率优势:

  • 仅靠单步检索,HippoRAG 的端到端 QA 效果就能与需要反复迭代的 IRCoT 相当甚至更好。

  • 在线检索开销大幅降低,成本便宜 10 到 30 倍,速度快 6 到 13 倍。(该数据也在附录中展示)

4. 讨论

4.1 HippoRAG 何以成功?

4.1.1 OpenIE 抽取模型

具体实验结果参见 Table 5 的 2 - 4 行。

这一实验的目标是回答以下问题:

  • 建图时是否必须依赖闭源大模型(如 GPT-3.5)?开源模型或专用端到端小模型能否胜任?

实验结论:

传统端到端 OpenIE 模型(REBEL)

  • 数据表现:使用专用端到端 OpenIE 模型 REBEL 替代 GPT-3.5 抽取三元组建图,导致检索性能出现大幅下降

  • 现象与数据归因

    • GPT-3.5 抽取出的三元组数量是 REBEL 的 2 倍

    • REBEL 倾向于避免生成包含通用概念(General Concepts)的三元组,从而遗漏了许多有用的关联

    • 结论:体现了使用 LLM 进行开放信息抽取的灵活性优势。

开源大模型(Llama-3.1 8B & 70B)

作者引入了开源权重模型 Llama-3.1 的指令微调版(8B 和 70B):

  • Llama-3.1-8B

    • 除了在 2WikiMultiHopQA 数据集上有较明显的下降外,在其余数据集上的表现均与 GPT-3.5 相当。

  • Llama-3.1-70B

    • 在三分之二(2 个)的数据集上超越了 GPT-3.5,且在 2Wiki 数据集上也保持了竞争力。

  • 实践价值:Llama-3.1-70B 的强劲表现以及 8B 模型的可用性令人鼓舞,因为它为大规模语料库的离线建图与索引提供了一种更便宜的替代方案

OpenIE 的内在质量评估(Intrinsic Evaluation)

为了更深入理解 OpenIE 质量与最终检索性能的关系,作者进行了小规模内在评测:

  • 实验设计:从 MuSiQue 训练集的 20 个样本中人工标注/提取了 239 个标准三元组(Gold Triples),并使用 CaRB 框架进行评估。

  • 评测结果

    • 两款 Llama-3.1-Instruct 模型在此项内在评估中的表现略逊于 GPT-3.5

    • 所有 LLM 的表现均大幅超越 REBEL

上述实验告诉我们:HippoRAG 并不强依赖闭源 LLM API ,完全可以使用开源的 Llama-3.1-70B(甚至 8B)在本地以更低成本完成图谱构建,且效果几乎不受影响。

4.1.2 PPR 算法有效性

具体实验结果参见 Table 5 的 5 - 6 行。

这一实验的目标是回答以下问题:

  • HippoRAG 的优异表现到底有多少归功于 PPR 算法本身的图扩散机制?如果不用 PPR,只做简单的局部扩展行不行?

作者设计了两个不使用 PPR 的简单 Baseline:

  • 仅使用 Query 节点(Row 5)

    • 不在图上进行任何游走扩散,仅使用 Query 节点的初始概率 n 乘以节点特异性得分。

  • 仅扩展 1 阶直接邻居(Row 6)

    • 在 Row 5 的基础上,将一小部分概率简单分发给 Query 节点的直接邻居节点

实验结论:

  • 在所有三个数据集上,PPR 算法的检索效果均远优于上述两个简单的 Baseline,证明了 PPR 在引入关联信息以辅助检索方面的有效性。

  • 一个有趣的发现:在不用 PPR 的情况下,直接将概率分给 1 阶邻居,表现反而比 “仅使用 Query 节点本身” 还要差!

4.1.3 节点特异性与同义边的消融实验

具体实验结果参见 Table 5 的 7 - 8 行。

这一实验的目标是验证节点特异性与同义边这两大组件各自的作用。

实验结论:

节点特异性的消融分析

  • 数据表现

    • MuSiQueHotpotQA 数据集上,引入节点特异性带来了相当可观的性能提升

    • 2WikiMultiHopQA 数据集上,节点特异性带来的性能变化微乎其微

  • 归因解释:这可能是因为 2WikiMultiHopQA 依赖命名实体,而这些命名实体在词项权重上的差异非常小。

语义同义边的消融分析

  • 数据表现

    • 移除/保留同义边,对 2WikiMultiHopQA 数据集的影响最为显著。

  • 归因解释

    • 这表明当大多数相关概念都是命名实体时,带噪声的实体标准化/同义对齐是非常有用的

    • 作者同时提出:未来如果能改进同义词/近义词检测的精度,将有望在其他数据集上带来更强大的性能提升。

4.2 HippoRAG 的优势:单步多跳检索

4.2.1 全召回率对比实验

作者进一步对比了 HippoRAG 与强基线 ColBERTv2 在 2WikiMultiHopQA 数据集上的全召回率(All-Recall, AR)。

注意,全召回率与召回率不同。譬如对于一个有 4 篇真值支撑文档的问询,如果系统给出的 5 篇 “支撑文档” 中,有 2 篇确实是真值支撑文档,那么对该问询计算的 R@5 = 2 / 4 = 0.5 ;然而全召回率衡量的是真值支撑文档是否被全部召回。由于该问询还存在 2 篇真值支撑文档没被成功召回,因此 AR@5 = 0 。显然,All-Recall 比起 Recall 更加严格。

为什么要引入 All-Recall 这个指标呢?因为在多跳问答场景下,LLM 需要集齐所有真值支撑文档才能得出正确的推理链,其中但凡缺了一篇没找到,都相当于在正确的推理链上“缺了一环”,而不完整的推理链是无法得出并支撑最终的正确答案的。

实验数据如下:

可以发现,当评估指标从标准的普通 Recall@5 切换到更严格的 All-Recall@5 (AR@5) 时,HippoRAG 对比 ColBERTv2 的领先优势显著扩大:

数据集

普通 Recall@5 的领先差距

All-Recall@5 (AR@5) 的领先差距

MuSiQue

领先 3%

领先拉大到 6%

2WikiMultiHopQA

领先 20%

领先拉大到 38%

作者指出,这种领先差距的翻倍扩张表明,HippoRAG 的巨大性能提升主要来自于为单条 Query 完整找齐了“全套支撑文档”,而不是仅仅在更多问题上做到了“部分召回”。

4.2.2 案例研究

作者在这个案例研究中比对了两种任务类型(路径追踪/路径寻找)下的 HippoRAG 与 baseline 的具体表现。

路径追踪型问答:

案例背景 (Table 7 第一行)

  • 问题"In which district was Alhandra born?"(Alhandra 出生于哪个区?)

  • 推理逻辑:这是一条确定性、线性发展的单路径:Alhandra 出生于 Vila de Xira ,而 Vila de Xira 属于 Portugal

方法

检索出的 Top-3 文档/实体

运行表现与机理解析

ColBERTv2(传统单步向量检索)

1. Alhandra

2. Dimuthu Abayakoon

3. Ja'ar

失败

只能检索到直接包含 "Alhandra" 的文档。由于描述 Vila de Xira 的段落中完全没有出现 "Alhandra" 这个词,基于文本相似度的向量匹配检索到了无关文档(Dimuthu 等)。

IRCoT(多步/迭代 LLM 检索)

1. Alhandra

2. Vila de Xira

3. Póvoa de Santa Iria

成功但效益较低

IRCoT 依靠 LLM 逐步推理:第一步查到 Alhandra 出生于 Vila de Xira,第二步生成新的 Query 搜索 Vila de Xira。虽然能查对,但需要多次调用 LLM,耗时比 HippoRAG 慢 6~13 倍,开销贵 10~30 倍

HippoRAG(基于海马体索引的单步检索

1. Alhandra

2. Vila de Xira

3. Portugal

单步成功且极快

无需多次调用 LLM 迭代。HippoRAG 在离线索引时就已经通过 KG 建立了 Alhandra --(born in)--> Vila de Xira 的关联边。在线检索时通过 PPR 概率扩散,在单步内激活并定位到了 Vila de Xira 的文档。

寻路型问答:

案例背景 (Table 7 第二行)

  • 问题"Which Stanford professor works on the neuroscience of Alzheimer’s?"(哪位斯坦福大学教授从事阿尔茨海默病的神经科学研究?)

  • 推理逻辑:涉及两个散落在不同地方的终点概念(Stanford ProfessorNeuroscience of Alzheimer's)。

  • 难点:世界上有许多位 Stanford 教授,也有许多位研究 Alzheimer's 的科学家。如果盲目搜索,存在无数条可能的探索路径(Exploration Paths),必须找到两者之间的一条正确的路径(Thomas Südhof)。

方法

检索出的 Top-3 文档/实体

运行表现与机理解析

ColBERTv2(传统单步向量检索)

1. Brian Knutson

2. Eric Knudsen

3. Lisa Giocomo

失败

返回的都是 Stanford 的普通教授(如 Brian Knutson),但这些教授并不研究 Alzheimer's,无法建立跨文本的交集。

IRCoT(多步/迭代 LLM 检索)

1. Brian Knutson

2. Eric Knudsen

3. Lisa Giocomo

失败

在第 1 步时,IRCoT 无法预知应该挑哪一位教授,只能随机或基于表面相关性选择一位 Stanford 教授(例如 Brian Knutson)。一旦第 1 步选错了分支路径,后续的迭代检索就会在错误的道路上越走越远。

HippoRAG(基于海马体索引的单步检索

1. Thomas Südhof

2. Karl Deisseroth

3. Robert Sapolsky

正确命中并成功寻路

HippoRAG 将 "Stanford" 和 "Alzheimer's" 同时作为 PPR 的种子节点(Seeds),能量从两侧同时向外扩散。由于 Thomas Südhof 节点同时连接着这两个概念,双向汇聚的概率流使该节点获得了最高得分,从而在单步之内精准定位到了 Thomas Südhof 教授。

5. 结论与展望

在本研究中,作者提出了一种基于神经生物学原理的方法 HippoRAG ,在克服标准 RAG 系统固有局限性的同时保留了 RAG 相比于参数化记忆的优势。HippoRAG 具备出色的知识整合能力(这通过其在路径追踪型多跳问答上的强劲表现以及在寻路型多跳问答上的巨大潜力得到了证明),结合其极其显著的效率提升和持续更新的特性,使其成为介于标准 RAG 方法与参数化记忆之间的一个强大折中框架,并为大语言模型(LLM)的长期记忆提供了一个极具吸引力的解决方案。

然而,未来的工作中仍有一些局限性需要解决,以使 HippoRAG 能够更好地实现这一目标:

  • 作者注意到 HippoRAG 的所有组件目前都是现成开箱即用的,没有经过任何额外的微调训练。因此,通过对特定组件进行定向微调,HippoRAG 在实际应用中的可行性还有很大的提升空间。

  • 作者注意到在简单 PPR 算法的基础上还有数条改进途径,例如允许“关系(Relations)”直接引导图的遍历过程

  • 如何提高 OpenIE 在较长文档中的抽取一致性,仍需展开更多研究工作。

  • HippoRAG 的可扩展性仍需要进一步验证。尽管作者证明了开源的 Llama-3.1 可以取得与闭源模型相当的性能从而大幅降低成本,但当人工海马体索引的规模增长到远超现有基准测试的级别时,其效率与有效性仍有待进行实证检验。


评论