2026年7月9日 周四晚上19:30,报名腾讯会议了解“如何构建自进化的动态知识库(Brain)”(限30人)
免费POC, 零成本试错
FDE知识库

FDE知识库

学习大模型的前沿技术与行业落地应用


收藏

ThinkParse 1.1.0 开源发布:把文档解析,做成可扩展的企业级服务

发布日期:2026-07-04 07:56:43 浏览次数: 1520
作者:大卫数智话

微信搜一搜,关注“大卫数智话”

推荐语

文档解析如何从单机工具升级为高可用服务?ThinkParse 1.1.0 开源发布,提供稳定、可扩展的解析层,让知识库与RAG应用构建更轻松。

核心内容:
1. 企业级文档解析服务 ThinkParse 的定位与核心价值
2. 1.1.0版本的关键升级:品牌统一与引擎强化
3. 生产级架构解析:API与Worker解耦带来的稳定性与可扩展性

杨芳贤
53AI创始人/腾讯云(TVP)最具价值专家

开源、异步、可扩展——Think 系列文档解析层,Docker 部署即可上线

RAG、知识库、智能问答,第一步往往是把 PDF、Word、扫描件变成结构化 Markdown。

MinerU 的解析质量有目共睹,但直接在生产环境跑 MinerU,我反复碰到这几类问题:

  • 大文件一解析就 OOM,几百页 PDF 直接卡死
  • 同步 HTTP 请求超时,批量任务没法排队
  • API 和 Worker 绑在一起,扩容、升级、故障恢复都很痛苦
  • 本地磁盘存结果,多机部署时文件对不上

ThinkParse 要补的就是这一层:在 MinerU 之上,提供稳定、可扩展、可运维的 HTTP 解析服务。

项目地址:https://github.com/wzdavid/ThinkParse


一、ThinkParse 是什么?

ThinkParse 是 Think 系列产品中的开源文档解析层,与 ThinkWiki(个人知识库)、ThinkDoc(企业知识库)、ThinkExtract(数据抽取平台)并列。

定位很清晰:可插拔后端 + 稳定 HTTP API。当前内置 MinerU 3.4 作为解析引擎,后续计划支持 Docling 等;上层业务只对接 ThinkParse,不跟具体引擎耦合。

核心架构是 API / Worker 完全解耦:

客户端 → FastAPI(轻量 API)→ Redis 队列 → Celery Worker(MinerU / MarkItDown)→ 本地或 S3 存储
  • API 服务
    接收文件、提交任务、查询状态
  • Worker 服务
    专注文档解析,可独立水平扩展
  • Redis
    消息队列 + 结果缓存
  • 存储抽象
    本地文件系统或 S3/MinIO,支持分布式部署

MIT 开源,Docker 一键部署,Python 3.10+。


二、新版本升级了什么?

ThinkParse 1.1.0(2026-06-24)是项目从 MinerU-API 正式更名为 ThinkParse 后的首个版本发布,重点在品牌统一、引擎升级和生产稳定性。

1. 归入 Think 系列,品牌统一

项目从 MinerU-API 更名为 ThinkParse,与 ThinkWiki、ThinkDoc、ThinkExtract 形成同一产品族。Docker 服务名(mineru-apimineru-worker 等)保持不变,现有部署配置可直接沿用。

2. 解析引擎升级到 MinerU 3.4.0

解析内核从 MinerU 2.x 升级到 3.4.0,带来新一代 OCR 模型(如 PP-OCRv6)和更优的版面分析。公式识别、表格识别、多语言(中/英/日/韩等)继续开箱即用。升级后需重建 Worker 镜像(cd docker && sh build.sh),模型会在构建过程中自动下载。

3. 生产环境兼容性修复

修复 MinerU 3.4.0 在子进程场景下重载 worker/tasks.py 时触发的 MINERU_DEVICE_MODE KeyError,避免 Worker 在特定部署模式下异常退出。


三、生产级部署会用到哪些能力

以下能力随 ThinkParse 1.0.0 起即已提供,1.1.0 在 MinerU 3.4 引擎之上继续可用。

1. 大 PDF 自动分页解析

超过阈值(默认 100 页)的大 PDF,Worker 会自动分块解析再合并结果,降低内存溢出风险。阈值和分块大小可配置,也支持 API 参数显式开关:

curl -X POST "http://localhost:8000/api/v1/tasks/submit" \
  -F "file=@large_document.pdf" \
  -F "backend=pipeline" \
  -F "lang=ch" \
  -F "enable_pagination=true"

几百页的合同、年报、论文,不必再赌一把「能不能跑完」。

2. 双 API,兼容两种集成方式

同步 API/file_parse)兼容 MinerU 官方格式,提交即等结果,适合脚本、小文件、快速验证:

curl -X POST "http://localhost:8000/file_parse" \
  -F "files=@document.pdf" \
  -F "backend=pipeline" \
  -F "lang_list=ch" \
  -F "return_md=true"

异步队列 API/api/v1/tasks/*)提交任务拿 task_id,轮询或回调获取结果,适合生产批量、长任务、高并发:

# 提交
curl -X POST "http://localhost:8000/api/v1/tasks/submit" \
  -F "file=@document.pdf" -F "lang=ch"

# 查询
curl "http://localhost:8000/api/v1/tasks/{task_id}"

两种接口并存,现有 MinerU 客户端可无缝迁移。

3. 运维与扩展

  • 优先级队列
    紧急任务优先调度
  • 任务重试与故障恢复
    Worker 挂了,任务不丢
  • 队列监控
    /api/v1/queue/stats 实时看积压
  • 自动清理服务
    过期输出定期回收,磁盘不会越堆越满
  • S3 兼容存储
    MinIO / AWS S3,API 和 Worker 可分机部署
  • CPU / GPU Worker
    开发用 CPU,生产上 GPU,COMPOSE_PROFILES 一行切换

4. 多格式全覆盖

类型
引擎
格式
PDF、图片
MinerU
PDF, PNG, JPG 等
Office、网页、纯文本
MarkItDown
Word, Excel, PPT, HTML, TXT 等

一套 API,PDF 扫描件和 Office 文档都能走。


四、谁适合用 ThinkParse?

  • RAG / 知识库开发者
    ThinkDoc、ThinkExtract 的上游解析层,文档入库前统一走 ThinkParse
  • AI 应用团队
    需要稳定的文档→Markdown 微服务,不想自己维护 MinerU 进程
  • 数据处理 / 中台团队
    批量解析合同、研报、标书,异步队列 + S3 存储正好匹配
  • 个人开发者 / 研究者
    Docker 四步启动,本地调试 MinerU 能力,零配置上手

五、只需四步启动,5 分钟跑通

前置: Docker + Docker Compose(GPU 环境需 NVIDIA 驱动)

# 1. 复制配置
cp .env.example .env
cd docker && cp .env.example .env

# 2. 选择 Worker 类型(docker/.env)
COMPOSE_PROFILES=redis,mineru-cpu   # 开发推荐 CPU
# COMPOSE_PROFILES=redis,mineru-gpu # 生产推荐 GPU

# 3. 构建镜像
cd docker && sh build.sh

# 4. 启动
docker compose up -d

# 验证
curl http://localhost:8000/api/v1/health

浏览器打开 Swagger 交互文档,地址 http://localhost:8000/docs ,可直接试 API。

完整部署指南:https://github.com/wzdavid/ThinkParse/blob/main/docs/DEPLOYMENT.zh.md


六、和 Think 生态怎么配合?

ThinkParse 是 Think 系列的解析基础设施:

原始文档 → ThinkParse(结构化 Markdown)→ ThinkDoc(知识库)/ ThinkExtract(数据抽取)→ Agent 对话 / 检索

文档解析这一环开源、标准化之后,上层知识库产品可以专注入库、图谱、Agent 交互,而不是重复造 MinerU 部署的轮子。


七、开源共建

ThinkParse 基于 MinerU,并参考了 mineru-tianshu 构建,站在优秀开源项目之上,MIT 协议发布。

  • 项目:https://github.com/wzdavid/ThinkParse
  • 文档:中英文 README + 部署、配置、API 示例、故障排除全套文档

如果你在做文档智能、知识库或 RAG,欢迎 Star、Fork,或在 Issue 里提需求。Docling 等新后端的支持已在路线图中。


53AI,企业落地大模型首选服务商

产品:场景落地咨询+大模型应用平台+行业解决方案

承诺:免费POC验证,效果达标后再合作。零风险落地应用大模型,已交付160+中大型企业

联系我们

售前咨询
186 6662 7370
预约演示
185 8882 0121

微信扫码

添加专属顾问

回到顶部

加载中...

扫码咨询

扫码登录
登录即表示您同意《53AI网站服务协议》
服务协议

欢迎您使用【53AI 官方网站】(以下简称“本网站”或“我们”)。本《会员服务协议》(以下简称“本协议”)是您(以下简称“会员”或“用户”)与【深圳市博思协创网络科技有限公司】之间关于注册、登录及使用本网站会员服务所订立的法律协议。

在您注册或登录前,请务必审慎阅读、充分理解各条款内容,特别是免除或限制责任的条款、知识产权条款、争议解决条款等。此类条款将以加粗形式提示您注意。 当您通过微信公众号授权、手机验证码验证或其他方式成功登录本网站时,即视为您已完全理解并同意接受本协议的全部内容。

一、 定义

本网站:指由【深圳市博思协创网络科技有限公司】运营的,域名为【53ai.com】的网站及相关移动端页面。

会员服务:指本网站向注册会员提供的知识库文章查阅、内容检索及其他相关增值服务。

知识库内容:指本网站发布的包括但不限于文字、图表、数据、研究报告、行业分析等数字化内容资源。

二、 账号注册与登录

登录方式:本网站支持以下登录方式,您可根据实际情况选择:

微信公众号授权登录:您同意将您的微信OpenID信息授权给本网站,用于创建或关联会员账号。

手机验证码登录:您需提供真实有效的手机号码,并通过短信验证码完成身份验证与登录/注册。

账号安全:您的账号仅限您本人使用,禁止赠与、借用、租用、转让或售卖。因您保管不善导致的账号被盗、密码泄露等损失,由您自行承担。

实名认证:根据相关法律法规要求,我们可能要求您在特定功能下完成实名认证。如您拒绝提供,可能无法使用部分或全部服务。

未成年人保护:若您未满18周岁,请在法定监护人的陪同下阅读本协议,并在征得监护人同意后使用本服务。

三、 服务内容与规范

知识库查阅权限:会员登录后,有权按照其会员等级对应的权限范围,在线浏览、检索本网站知识库中的相关文章及内容。

服务变更:我们有权根据业务发展需要,调整、变更或终止部分服务内容,并将以网站公告、公众号消息等方式提前通知。

禁止行为:您在使用服务时不得实施以下行为:

利用技术手段批量爬取、下载、转存知识库内容;

将知识库内容用于商业目的或未经授权地向第三方传播;

干扰本网站正常运行或侵犯其他用户合法权益;

发布违法违规信息或从事违反公序良俗的活动。

四、 知识产权声明

权利归属:本网站知识库中的排版设计、软件代码等内容的知识产权均归【公司全称】或原权利人所有,受《中华人民共和国著作权法》等法律保护。

有限许可:本网站授予会员一项非独占、不可转让、不可转授权的普通许可,仅限于个人学习、研究之目的在线查阅知识库内容。

侵权追责:未经书面许可,任何单位或个人不得以任何形式复制、转载、摘编、镜像、汇编或以其他方式使用上述内容。一经发现,我们保留追究其法律责任的权利。

五、 个人信息保护

我们重视对您个人信息的保护。关于我们如何收集、使用、存储和保护您的个人信息,请单独阅读 《隐私政策》。

您通过微信公众号授权或手机号验证所提供的信息,我们将严格按照《个人信息保护法》的规定处理,仅用于身份识别、服务提供及安全验证等必要用途。

您可以随时通过网站设置或联系客服行使查阅、更正、删除个人信息及撤回授权同意的权利。

六、 免责声明

内容准确性:知识库内容仅供参考,不构成专业建议。我们不对其完整性、准确性、时效性作任何明示或暗示的保证,您应自行判断并承担使用风险。

不可抗力:因自然灾害、政策法规变化、网络故障、第三方平台接口异常(如微信接口维护、运营商短信通道故障)等不可抗力导致的服务中断或延迟,我们不承担违约责任。

第三方链接:本网站可能包含指向第三方网站的链接,该等网站的内容和服务不受我们控制,请您自行甄别风险。

七、 违约责任

如您违反本协议约定,我们有权视情节采取警告、限制功能、暂停服务、注销账号等措施,并保留要求赔偿损失的权利。

如因您的违约行为导致我们遭受行政处罚、第三方索赔或商誉损失,您应承担全部赔偿责任(包括但不限于罚款、赔偿金、律师费、公证费等)。

八、 法律适用与争议解决

本协议的订立、执行和解释均适用中华人民共和国大陆地区法律。

因本协议产生的或与本协议有关的任何争议,双方应友好协商解决;协商不成的,任何一方均可向【公司所在地】有管辖权的人民法院提起诉讼。

九、 其他

本协议构成双方就本服务达成的完整协议,取代此前任何口头或书面约定。

本协议任一条款被认定为无效或不可执行的,不影响其他条款的效力。

我们对本协议享有最终解释权,并在法律允许的范围内保留随时修改的权利。修改后的协议一经公布即生效,继续使用服务即视为同意修订内容。


已查阅