2026年7月16日 周四晚上19:30,报名腾讯会议了解“如何构建自进化的动态知识库(Brain)”(限30人)
免费POC, 零成本试错
FDE知识库

FDE知识库

学习大模型的前沿技术与行业落地应用


收藏

一键把杂乱文档变成结构化知识图谱!开源 Hyper-Extract:LLM驱动的超强知识提取神器,Hypergraph + 时空图全支持

发布日期:2026-06-10 09:42:20 浏览次数: 1817
作者:如此才是

微信搜一搜,关注“如此才是”

推荐语

Hyper-Extract:一键将海量非结构化文档转化为清晰的知识图谱,支持复杂关系与时空分析,极大提升信息利用效率。

核心内容:
1. 八大强类型知识结构,从简单列表到超图、时空图全覆盖
2. 十多种开箱即用的提取引擎,包括多种RAG增强方法
3. 声明式YAML模板,零代码即可定义提取逻辑,覆盖多领域

杨芳贤
53AI创始人/腾讯云(TVP)最具价值专家

一键把杂乱文档变成结构化知识图谱!Hyper-Extract:LLM驱动的超强知识提取神器

每天面对海量非结构化文本:研究报告、新闻文章、合同、病历、历史资料……阅读容易,真正“理解”和“利用” 很极难。传统工具难以应对复杂关系,而大语言模型(LLM)虽强大,却缺乏系统化的结构化输出能力。

Hyper-Extract(yifanfeng97/Hyper-Extract)一个智能的、LLM驱动的知识提取与演进框架,以一条命令 将高度非结构化的文本转化为持久化、可预测、强类型的 Knowledge Abstracts(知识摘要)。从简单列表到复杂知识图谱、超图(Hypergraph),甚至时空图(Spatio-Temporal Graph),全部支持。

✨ 核心功能全解析

Hyper-Extract 的设计是拥抱复杂性,同时极大简化使用。核心特性包括:

1.8 大 Auto-Types(强类型知识结构)

框架输出数据结构基础,基于 Pydantic 实现类型安全、可序列化、支持增量合并和可视化操作。分为两大类:

Record Types(记录型,无实体关系)

AutoModel:提取单个结构化对象(如公司财报摘要、产品规格)。输出为固定字段的 Pydantic 模型。

AutoList:有序集合(排行榜、步骤序列)。保持原始顺序。

AutoSet:去重集合(关键词、唯一实体列表)。自动消除重复。

Graph Types(图结构,带实体关系)

AutoGraph:二元关系知识图谱(实体-关系-实体)。经典 KG 结构。

AutoHypergraph:超图,支持多实体(3+)参与的复杂关系(如多方协作、合同多方当事人)。支持扁平列表或嵌套角色分组。

AutoTemporalGraph:时序图,在关系上附加时间维度(事件时间线)。

AutoSpatialGraph:空间图,附加地理位置信息。

AutoSpatioTemporalGraph:时空图,同时支持时间 + 空间,实现完整“谁、何事、何时、何地”上下文。

2.10+ Extraction Engines(提取引擎)

开箱即用多种先进方法:

RAG-based:GraphRAG、LightRAG、Hyper-RAG、HypergraphRAG、Cog-RAG 等,支持检索增强生成,提升大规模文档处理准确性。

Typical:KG-Gen、iText2KG、iText2KG* 等传统知识图谱生成方法。

用户可通过模板或 API 灵活选择最适合的引擎。

3.Declarative YAML Templates(声明式 YAML 模板)

零代码定义提取逻辑。内置 80+ 预设模板,覆盖 6 大领域:Finance(金融)、Legal(法律)、Medical(医学)、TCM(中医)、Industry(工业)、General(通用)。

模板包含:语言、名称、类型、描述、output schema(字段定义)、guideline(提取指引、规则)、identifiers(唯一标识规则)、display(可视化标签)。

支持自定义模板,详见 DESIGN_GUIDE.md。

4.Incremental Evolution(增量演进)

核心亮点之一:已提取的 Knowledge Abstract 支持 feed 新文档 持续扩展,无需重新处理全部数据。知识可持久化、搜索和演化。

5.CLI + Python API 双模式

CLI(he 命令):适合快速处理、批量操作。

Python SDK:深度集成,支持自定义 pipeline。

其他实用功能:多语言支持(en/zh 等)、搜索查询知识摘要、可视化(he show 或 ka.show())、配置管理(API Key 等)、序列化保存/加载。

安装方法

推荐使用 uv(现代 Python 包管理器)

CLI 全局安装(推荐大多数用户):

uv tool install hyperextract

安装后即可全局使用 he 命令。

作为 Python 库安装

uv pip install hyperextract

从源码安装(开发/最新版)

bash
git clone https://github.com/yifanfeng97/Hyper-Extract.git
cd Hyper-Extract
uv sync          # 安装依赖
cp .env.example .env
# 编辑 .env 填入 OPENAI_API_KEY 和可选的 OPENAI_BASE_URL

项目使用 pyproject.toml + uv.lock 管理,兼容性强。

使用方法

CLI (默认使用 gpt-4o-mini + text-embedding-3-small):

bash
# 配置 API Key
he config init -k YOUR_OPENAI_API_KEY

# 提取(使用 biography_graph 模板)
he parse examples/en/tesla.md -t general/biography_graph -o ./output/ -l en

# 查询
he search ./output/ "What are Tesla's major achievements?"

# 可视化
he show ./output/

# 增量补充
he feed ./output/ examples/en/tesla_question.md
he show ./output/

Python API 示例

python
import os
from dotenv import load_dotenv
from hyperextract import Template

load_dotenv()

ka = Template.create("general/biography_graph", language="en")

with open("examples/en/tesla.md""r", encoding="utf-8") as f:
    text = f.read()

result = ka.parse(text)      # 提取
ka.show(result)              # 可视化
ka.feed(result, new_text)    # 增量

支持批量处理、自定义方法选择等高级用法。详见 examples/ 目录和官方文档。

技术原理、架构与实现方式

Hyper-Extract 采用 三层架构,清晰解耦,便于扩展:

1.Layer 1: Auto-Types(数据层)

核心是 8 个强类型类(位于 hyperextract/types/),继承自 base.py。

使用 Pydantic 验证字段、支持 JSON 序列化。

内置方法:search()visualize()save()merge() 等。

Graph 类型实现节点/边/超边管理,Temporal/Spatial 添加专用字段和标识逻辑(identifiers 中的 time_field、location_field)。

2.Layer 2: Methods(算法层)

hyperextract/methods/ 下分 rag/ 和 typical/ 子目录。

RAG 方法利用检索增强,提升长文档上下文处理和准确性(GraphRAG 等经典范式)。

Typical 方法聚焦直接提示工程 + 结构化解析。

通过 registry.py 注册和管理引擎,用户可切换或扩展。

3.Layer 3: Templates(配置层)

YAML 驱动,hyperextract/templates/presets/ 提供领域模板。

Schema vs Guideline 分离:output 定义“提取什么”(字段、类型),guideline 定义“如何高质量提取”(规则、避免常见错误)。

identifiers 确保实体/关系唯一性(e.g., relation_id 模板字符串)。

display 控制可视化标签生成。

DESIGN_GUIDE.md 详细说明设计流程、决策树、类型特定最佳实践和 QA 检查列表。

数据流:文档 → Template(加载 YAML + Prompt 构建)→ Method(LLM 调用)→ Auto-Type 实例(验证 + 后处理)→ 可持久化 Knowledge Abstract。支持增量是因为 Auto-Types 设计为可合并的。

项目Python 实现,依赖 LLM API(OpenAI 兼容)。可视化可能集成 NetworkX 或类似库生成图谱。

复杂结构支持(Hypergraph、时空)、开箱即用模板CLI 便利性 和 增量演进 上具有显著优势。适合研究者、开发者、分析师、企业知识管理等场景。


—— 如此才是

把复杂的技术,讲成你真正能用上的生产力

53AI,企业落地大模型首选服务商

产品:场景落地咨询+大模型应用平台+行业解决方案

承诺:免费POC验证,效果达标后再合作。零风险落地应用大模型,已交付160+中大型企业

联系我们

售前咨询
186 6662 7370
预约演示
185 8882 0121

微信扫码

添加专属顾问

回到顶部

加载中...

扫码咨询

扫码登录
登录即表示您同意《53AI网站服务协议》
服务协议

欢迎您使用【53AI 官方网站】(以下简称“本网站”或“我们”)。本《会员服务协议》(以下简称“本协议”)是您(以下简称“会员”或“用户”)与【深圳市博思协创网络科技有限公司】之间关于注册、登录及使用本网站会员服务所订立的法律协议。

在您注册或登录前,请务必审慎阅读、充分理解各条款内容,特别是免除或限制责任的条款、知识产权条款、争议解决条款等。此类条款将以加粗形式提示您注意。 当您通过微信公众号授权、手机验证码验证或其他方式成功登录本网站时,即视为您已完全理解并同意接受本协议的全部内容。

一、 定义

本网站:指由【深圳市博思协创网络科技有限公司】运营的,域名为【53ai.com】的网站及相关移动端页面。

会员服务:指本网站向注册会员提供的知识库文章查阅、内容检索及其他相关增值服务。

知识库内容:指本网站发布的包括但不限于文字、图表、数据、研究报告、行业分析等数字化内容资源。

二、 账号注册与登录

登录方式:本网站支持以下登录方式,您可根据实际情况选择:

微信公众号授权登录:您同意将您的微信OpenID信息授权给本网站,用于创建或关联会员账号。

手机验证码登录:您需提供真实有效的手机号码,并通过短信验证码完成身份验证与登录/注册。

账号安全:您的账号仅限您本人使用,禁止赠与、借用、租用、转让或售卖。因您保管不善导致的账号被盗、密码泄露等损失,由您自行承担。

实名认证:根据相关法律法规要求,我们可能要求您在特定功能下完成实名认证。如您拒绝提供,可能无法使用部分或全部服务。

未成年人保护:若您未满18周岁,请在法定监护人的陪同下阅读本协议,并在征得监护人同意后使用本服务。

三、 服务内容与规范

知识库查阅权限:会员登录后,有权按照其会员等级对应的权限范围,在线浏览、检索本网站知识库中的相关文章及内容。

服务变更:我们有权根据业务发展需要,调整、变更或终止部分服务内容,并将以网站公告、公众号消息等方式提前通知。

禁止行为:您在使用服务时不得实施以下行为:

利用技术手段批量爬取、下载、转存知识库内容;

将知识库内容用于商业目的或未经授权地向第三方传播;

干扰本网站正常运行或侵犯其他用户合法权益;

发布违法违规信息或从事违反公序良俗的活动。

四、 知识产权声明

权利归属:本网站知识库中的排版设计、软件代码等内容的知识产权均归【公司全称】或原权利人所有,受《中华人民共和国著作权法》等法律保护。

有限许可:本网站授予会员一项非独占、不可转让、不可转授权的普通许可,仅限于个人学习、研究之目的在线查阅知识库内容。

侵权追责:未经书面许可,任何单位或个人不得以任何形式复制、转载、摘编、镜像、汇编或以其他方式使用上述内容。一经发现,我们保留追究其法律责任的权利。

五、 个人信息保护

我们重视对您个人信息的保护。关于我们如何收集、使用、存储和保护您的个人信息,请单独阅读 《隐私政策》。

您通过微信公众号授权或手机号验证所提供的信息,我们将严格按照《个人信息保护法》的规定处理,仅用于身份识别、服务提供及安全验证等必要用途。

您可以随时通过网站设置或联系客服行使查阅、更正、删除个人信息及撤回授权同意的权利。

六、 免责声明

内容准确性:知识库内容仅供参考,不构成专业建议。我们不对其完整性、准确性、时效性作任何明示或暗示的保证,您应自行判断并承担使用风险。

不可抗力:因自然灾害、政策法规变化、网络故障、第三方平台接口异常(如微信接口维护、运营商短信通道故障)等不可抗力导致的服务中断或延迟,我们不承担违约责任。

第三方链接:本网站可能包含指向第三方网站的链接,该等网站的内容和服务不受我们控制,请您自行甄别风险。

七、 违约责任

如您违反本协议约定,我们有权视情节采取警告、限制功能、暂停服务、注销账号等措施,并保留要求赔偿损失的权利。

如因您的违约行为导致我们遭受行政处罚、第三方索赔或商誉损失,您应承担全部赔偿责任(包括但不限于罚款、赔偿金、律师费、公证费等)。

八、 法律适用与争议解决

本协议的订立、执行和解释均适用中华人民共和国大陆地区法律。

因本协议产生的或与本协议有关的任何争议,双方应友好协商解决;协商不成的,任何一方均可向【公司所在地】有管辖权的人民法院提起诉讼。

九、 其他

本协议构成双方就本服务达成的完整协议,取代此前任何口头或书面约定。

本协议任一条款被认定为无效或不可执行的,不影响其他条款的效力。

我们对本协议享有最终解释权,并在法律允许的范围内保留随时修改的权利。修改后的协议一经公布即生效,继续使用服务即视为同意修订内容。


已查阅