微信扫码
添加专属顾问
SeedER 将检索变为推理,从种子节点出发结构化探索,让知识图谱检索更精准高效。 核心内容: 1. 传统检索方法在知识图谱多跳查询中的瓶颈 2. 从种子节点出发进行结构化探索的新范式 3. SeedER 系统的核心机制与优势
知识图谱是一类非常适合承载结构化知识的数据形式。节点可以表示疾病、药物、基因、论文、作者、商品等实体;边则表示实体之间的关系,例如“药物治疗疾病”“基因参与通路”“论文引用论文”“商品属于某品牌”。
但作者指出,知识图谱检索的真正难点在于:
答案节点往往并不和查询文本直接相似,而是隐藏在一条关系路径之后。
例如,一个用户提出问题:
哪些药物通过胆碱能通路治疗阿尔茨海默病?
真正的答案可能是 Donepezil、Galantamine 等药物。它们和查询文本未必有明显词面重合,但它们可以通过类似下面的路径被找到:
Alzheimer’s disease → ACHE gene → cholinergic signaling pathway → Donepezil drug
这说明,知识图谱检索不是简单地把“查询”和“节点文本”做语义相似度匹配,而是需要沿着图中的关系进行多跳推理。
目前常见的检索方法是 dense retrieval,也就是把查询和每个节点都编码成向量,然后按照余弦相似度或内积排序。
这种方式在普通文本检索中很有效,但作者认为它不适合处理知识图谱中的多跳组合查询。
原因很直接:
Dense Retrieval 试图用一次向量比较,完成一整条关系路径的推理。
这就会带来两个问题。
第一,语义相似度可能找得到起点,却找不到终点。比如查询中出现“阿尔茨海默病”,dense retriever 很可能能找到疾病节点;但真正的答案药物节点并不一定和查询文本直接相似。
第二,把节点邻域、关系描述、结构信息都塞进节点文本中,也只能缓解一部分问题。因为这种方式本质上还是局部增强,无法真正表示任意长度的多跳关系组合。
作者在理论部分给出一个重要判断:
对某些关系追踪型知识图谱查询,如果只依赖固定的查询向量和节点向量来判断相关性,dense retrieval 需要接近图规模的表示容量;而一个局部迭代式策略只需要学习每一步如何沿边走。
换句话说,dense retrieval 的问题不是“模型还不够大”那么简单,而是它的检索范式本身不适合多跳组合推理。
既然 dense retrieval 不擅长直接找到最终答案,那它是否仍然有价值?
作者的答案是:有价值,但应该把它当成“起点发现器”。
也就是说,dense retrieval 可以先找出和查询最相似的一小批节点,例如疾病节点、论文主题节点、品牌节点等。然后系统再从这些种子节点出发,沿着知识图谱的边进行扩展。
但朴素的 K-hop 扩展会立刻遇到一个严重问题:
图的邻域增长太快,扩展两三跳之后,候选节点数量可能暴涨到数万甚至接近整个图。
为了解决这个问题,作者先构造了一个简单但有效的基线方法:K-hop-with-filtering。
它的做法是:
这个方法已经比纯 dense retrieval 更好,尤其能提升 Hit@Any 和 Recall@Any 这类关注“是否把答案捞进候选集”的指标。
虽然 K-hop-with-filtering 能控制候选规模,但作者指出,它仍然是一个贪心策略。
它的问题在于:每一步都偏向选择当前看起来最相关的节点。
但在知识图谱中,正确路径可能需要先经过一个“看起来不相关”的中间节点,之后才能到达真正有用的答案区域。
这就产生了所谓的 delayed reward 问题:
有些节点短期看没有收益,但长期看是通往答案的桥梁。
例如,一个中间基因节点或通路节点,单看文本可能和查询不够相似,但它正好连接着最终答案药物。贪心方法可能会跳过它,从而永远到不了答案节点。
作者因此提出:知识图谱检索中的扩展过程应该被看作一个序列决策问题。
这正是强化学习适合处理的场景。
于是,SeedER 的核心思想出现了:
不再固定地、贪心地扩展邻居,而是训练一个 query-conditioned 的图感知策略,让模型学习“下一步应该扩展哪些 frontier 节点”。
SeedER 的名字本身就说明了它的主要流程:Seed + Expand + Rank。
作者首先使用轻量的 dense retrieval 找到一小批核心种子节点。
这些节点不一定是最终答案,但它们通常和查询强相关,可以作为后续图搜索的语义锚点。
例如,在医学知识图谱中,查询中提到某种疾病,dense retrieval 往往能找到疾病节点;之后真正的答案可能需要沿着疾病—基因—通路—药物的路径继续扩展。
直接在完整知识图谱上训练强化学习策略成本太高,因为一跳邻居可能很多,多跳后候选空间更大。
因此,作者先用 K-hop-with-filtering 从种子节点出发,构造一个中等规模的 query-specific subgraph,通常包含约 100–200 个节点。
这个子图相当于强化学习策略的“局部环境”。
这样做的好处是:
在局部子图中,SeedER 迭代地选择 frontier 节点。
每一步,模型都会构造当前已选节点和候选 frontier 节点组成的诱导子图,并用 GNN 生成 query-conditioned node embedding。随后,一个轻量 policy head 给每个 frontier 节点打分。
训练时,模型从策略分布中采样节点,以鼓励探索;推理时,则选择分数最高的节点。
最后,SeedER 还会用一个 scoring head 对已选候选节点重新排序,让真正答案尽可能排在前面。
SeedER 的训练目标由两部分组成。
第一部分是强化学习策略损失。作者使用一种 group-centered REINFORCE 训练方式。对于同一个查询,模型会采样多条扩展轨迹,在实验中每个查询采样 8 条轨迹。每条轨迹的奖励来自 Recall@Any,也就是看它是否在候选集合中覆盖了更多真实答案。
这里的重点是:
强化学习策略不直接优化最终排序,而是优化“能不能把答案节点找进候选集”。
第二部分是监督排序损失。作者使用 BPR loss,让最终 scoring head 学会把正样本答案节点排在负样本节点前面。
因此,SeedER 的分工非常清晰:
作者在 STARK benchmark 的三个数据集上评估 SeedER:
STARK-PRIME:医学知识图谱检索任务,基于 PrimeKG,包含疾病、药物、基因、通路等实体。这个数据集节点较少,但关系更密集、更复杂,适合检验多跳结构推理能力。
STARK-MAG:学术论文检索任务,包含 paper、author、institution、field_of_study 等实体,查询往往同时包含文本条件和关系条件,例如某领域、某作者、某机构、引用关系等。
STARK-AMAZON:商品检索任务,包含 product 和 brand 两类实体,以及 also_bought、also_viewed、has_brand 等关系。查询更接近真实用户商品搜索,且很多问题有多个正确答案。
作者使用的主要指标包括:
主实验使用 MiniLM-L6-v2 作为文本编码器,对比了 dense retrieval、G-Retriever、SubgraphRAG、Beam Search、A* Search、PPR、PPR+MMR、K-hop-with-filtering 等方法。
结果显示,SeedER 在三个数据集上都取得了最好的整体表现。
在 STARK-PRIME 上,SeedER 相比 dense retrieval 提升非常明显:
这说明 SeedER 不只是把答案“捞进来”,也能通过 GNN scoring head 改善排序质量。
在 STARK-MAG 上,SeedER 同样优于所有一阶段检索基线,Recall@20 达到 0.449。
在 STARK-AMAZON 上,dense retrieval 本身已经比较强,因此图扩展带来的提升较小,但 SeedER 仍然取得最好的 Hit@1、Hit@5、MRR 和 Recall@20。
作者还测试了更强的节点编码器。使用 OpenAI text-embedding-ada-002 时,SeedER 在 STARK-PRIME 上将 Recall@20 从 dense retrieval 的 0.360 提升到 0.570。使用 Qwen3-Embedding-4B 时,SeedER 进一步达到 0.310 Hit@1、0.582 Hit@5、0.429 MRR 和 0.647 Recall@20。
这说明 SeedER 并不是替代强 embedding 模型,而是可以和强 embedding 模型互补:embedding 越强,种子节点和初始特征越好;SeedER 的学习式扩展仍然能继续带来结构推理收益。
作者进一步将 SeedER 与 LLM-based agentic graph retrieval 方法进行比较,例如 ToG、SFT、PRM 和 GraphFlow。这些方法通常使用大语言模型逐步探索图结构,有些还加入 LLM reranking。它们表达能力强,但推理成本也高。
SeedER 的定位不同。它并不试图替代完整的 LLM 推理系统,而是作为轻量级 first-stage retriever,先用较低成本产出高覆盖率候选集,再交给后续 reranker 或生成模型处理。
在效率比较中,SeedER 只有约 1.1M 可训练参数,而 GraphFlow 使用的是 8B 参数级别的 LLM。作者指出,SeedER 参数量约为 GraphFlow 的 1/8000,并且每个查询的推理速度快得多,同时仍能获得很大一部分性能收益。
消融实验也证明了 SeedER 的设计不是简单堆叠模块,而是各部分都有贡献:
这说明 SeedER 的提升来自两个方面的结合:
学习式候选发现 + 监督式最终排序。
作者还在附录中分析了训练稳定性。10 个随机种子的训练曲线显示,BPR loss 稳定下降,训练 reward 和验证/测试 Recall@20 在早期提升后进入平台期。验证集和测试集指标相关性也很高,说明模型选择信号比较可靠。
总结:
总体来看,SeedER 的核心贡献可以概括为三点。
第一,作者明确指出了知识图谱检索中的范式问题:多跳组合查询很难仅靠一次 dense embedding 匹配解决。答案节点可能和查询文本并不相似,但它们可以通过图结构中的关系路径被找到。
第二,作者提出了一种轻量、可控的 seed-and-expand 框架。SeedER 先用 dense retrieval 找到语义锚点,再在局部子图中用强化学习策略选择值得扩展的 frontier 节点,最后用 GNN scoring head 重新排序候选节点。
第三,作者通过理论分析、主实验、强编码器对比、LLM agent 对比、消融实验和训练稳定性分析证明:SeedER 是一种介于“便宜但浅层的 dense retrieval”和“强大但昂贵的 LLM 图探索”之间的实用方案。
它最适合扮演的角色,是知识密集型系统中的第一阶段检索器:
先用较低成本找出紧凑、高覆盖率的候选节点,再交给更强的 reranker 或 LLM 完成最终推理。
对于知识图谱 RAG、医学知识检索、学术检索、商品图谱搜索等场景,这种思路都具有现实意义。
SeedER 的价值在于,它把知识图谱检索从“全局相似度排序”改造成“局部结构化探索”:不是问哪个节点最像查询,而是学习下一步该沿哪条图关系走向答案。
53AI,企业落地大模型首选服务商
产品:场景落地咨询+大模型应用平台+行业解决方案
承诺:免费POC验证,效果达标后再合作。零风险落地应用大模型,已交付160+中大型企业
2026-04-19
2026-05-07
2026-04-23
2026-06-03
2026-04-22
2026-04-23
2026-05-26
2026-05-28
2026-05-23
2026-06-10
欢迎您使用【53AI 官方网站】(以下简称“本网站”或“我们”)。本《会员服务协议》(以下简称“本协议”)是您(以下简称“会员”或“用户”)与【深圳市博思协创网络科技有限公司】之间关于注册、登录及使用本网站会员服务所订立的法律协议。
在您注册或登录前,请务必审慎阅读、充分理解各条款内容,特别是免除或限制责任的条款、知识产权条款、争议解决条款等。此类条款将以加粗形式提示您注意。 当您通过微信公众号授权、手机验证码验证或其他方式成功登录本网站时,即视为您已完全理解并同意接受本协议的全部内容。
一、 定义
本网站:指由【深圳市博思协创网络科技有限公司】运营的,域名为【53ai.com】的网站及相关移动端页面。
会员服务:指本网站向注册会员提供的知识库文章查阅、内容检索及其他相关增值服务。
知识库内容:指本网站发布的包括但不限于文字、图表、数据、研究报告、行业分析等数字化内容资源。
二、 账号注册与登录
登录方式:本网站支持以下登录方式,您可根据实际情况选择:
微信公众号授权登录:您同意将您的微信OpenID信息授权给本网站,用于创建或关联会员账号。
手机验证码登录:您需提供真实有效的手机号码,并通过短信验证码完成身份验证与登录/注册。
账号安全:您的账号仅限您本人使用,禁止赠与、借用、租用、转让或售卖。因您保管不善导致的账号被盗、密码泄露等损失,由您自行承担。
实名认证:根据相关法律法规要求,我们可能要求您在特定功能下完成实名认证。如您拒绝提供,可能无法使用部分或全部服务。
未成年人保护:若您未满18周岁,请在法定监护人的陪同下阅读本协议,并在征得监护人同意后使用本服务。
三、 服务内容与规范
知识库查阅权限:会员登录后,有权按照其会员等级对应的权限范围,在线浏览、检索本网站知识库中的相关文章及内容。
服务变更:我们有权根据业务发展需要,调整、变更或终止部分服务内容,并将以网站公告、公众号消息等方式提前通知。
禁止行为:您在使用服务时不得实施以下行为:
利用技术手段批量爬取、下载、转存知识库内容;
将知识库内容用于商业目的或未经授权地向第三方传播;
干扰本网站正常运行或侵犯其他用户合法权益;
发布违法违规信息或从事违反公序良俗的活动。
四、 知识产权声明
权利归属:本网站知识库中的排版设计、软件代码等内容的知识产权均归【公司全称】或原权利人所有,受《中华人民共和国著作权法》等法律保护。
有限许可:本网站授予会员一项非独占、不可转让、不可转授权的普通许可,仅限于个人学习、研究之目的在线查阅知识库内容。
侵权追责:未经书面许可,任何单位或个人不得以任何形式复制、转载、摘编、镜像、汇编或以其他方式使用上述内容。一经发现,我们保留追究其法律责任的权利。
五、 个人信息保护
我们重视对您个人信息的保护。关于我们如何收集、使用、存储和保护您的个人信息,请单独阅读 《隐私政策》。
您通过微信公众号授权或手机号验证所提供的信息,我们将严格按照《个人信息保护法》的规定处理,仅用于身份识别、服务提供及安全验证等必要用途。
您可以随时通过网站设置或联系客服行使查阅、更正、删除个人信息及撤回授权同意的权利。
六、 免责声明
内容准确性:知识库内容仅供参考,不构成专业建议。我们不对其完整性、准确性、时效性作任何明示或暗示的保证,您应自行判断并承担使用风险。
不可抗力:因自然灾害、政策法规变化、网络故障、第三方平台接口异常(如微信接口维护、运营商短信通道故障)等不可抗力导致的服务中断或延迟,我们不承担违约责任。
第三方链接:本网站可能包含指向第三方网站的链接,该等网站的内容和服务不受我们控制,请您自行甄别风险。
七、 违约责任
如您违反本协议约定,我们有权视情节采取警告、限制功能、暂停服务、注销账号等措施,并保留要求赔偿损失的权利。
如因您的违约行为导致我们遭受行政处罚、第三方索赔或商誉损失,您应承担全部赔偿责任(包括但不限于罚款、赔偿金、律师费、公证费等)。
八、 法律适用与争议解决
本协议的订立、执行和解释均适用中华人民共和国大陆地区法律。
因本协议产生的或与本协议有关的任何争议,双方应友好协商解决;协商不成的,任何一方均可向【公司所在地】有管辖权的人民法院提起诉讼。
九、 其他
本协议构成双方就本服务达成的完整协议,取代此前任何口头或书面约定。
本协议任一条款被认定为无效或不可执行的,不影响其他条款的效力。
我们对本协议享有最终解释权,并在法律允许的范围内保留随时修改的权利。修改后的协议一经公布即生效,继续使用服务即视为同意修订内容。