微信扫码
添加专属顾问
告别传统文档解析的低效串行模式,PaddleOCR推出HPD-Parsing技术,实现团队协作式并行处理,解析效率大幅领先。 核心内容: 1. 传统自回归解析的瓶颈与HPD-Parsing的并行解析机制 2. 在OmniDocBench评测中实现吞吐量三倍以上提升,解析精度保持领先 3. 文档越长,其并行处理的效率优势越显著,代码与模型已开源
面对一份文档,基于视觉语言模型的统一式文档解析模型通常沿单一自回归序列逐 token 生成整页内容:即使正文段落、公式和表格彼此独立,也要按顺序等待。这种串行的流水线式的工作模式十分低效。更高效的方式应当像团队协作:先完成全局规划,再让不同成员并行处理相对独立的任务,最后有序汇总。
受此启发,PaddleOCR 团队提出 HPD-Parsing(Hierarchical Parallel Document Parsing,层级并行文档解析)技术。这种解析模式下,主线布局分支负责统一理解页面结构,并将不同区域动态分发至多个内容分支进行并行解析,同时结合渐进式多 token 预测,进一步减少各分支解码步骤,整体实现多层级高度并行解析。
HPD-Parsing将1B参数的基线模型Token吞吐大幅拉升至3倍以上,单卡NVIDIA A800 GPU实测,OmniDocBench v1.6评测集TPS(Tokens Per Second,每秒 Token 生成量)达4,752.1,解析精度保持行业第一梯队的同时,解析效率实现大幅领先。
HPD-Parsing的代码和权重已经开源至Github和HuggingFace,欢迎大家下载使用。
Github:
https://github.com/PaddlePaddle/PaddleOCR
HuggingFace:
https://huggingface.co/PaddlePaddle/HPD-Parsing
ArXiv论文地址:
https://arxiv.org/abs/2607.18839
1、层级并行解析机制
2、大幅拉升基线吞吐,解析效率新SOTA:
OmniDocBench v1.6评测集512并发测试,传统自回归基线Token吞吐(TPS)为 1554.8、页吞吐(PPS)为1.02,引入HPD(层级并行解码)技术后,Token吞吐和页吞吐分别提升至4,752.1和2.68,领跑一众模型。
3、解析效率优势随文档长度显著提升:
OmniDocBench v1.6测试集按长度等间隔划分,结果显示,随着输出序列增长,HPD-Parsing相对自回归模型的优势持续扩大,解码步数最高实现18.04倍压缩、批量请求吞吐最高实现3.67倍提升、单并发推理时延最高下降5.8倍。
HPD-Parsing 带来的并非固定比例的性能提升,而是从解码机制上缓解了传统自回归解析中“文档越长、等待越久”的结构性瓶颈。页面越复杂,可并行解析的区域越多,其效率优势也越明显。
4、解析精度保持行业第一梯队:
扫描场景完成技术可行性验证,OmniDocBench v1.6指标达94.91%,文本识别、公式、表格和阅读顺序等关键能力上均保持了有竞争力的表现。
是什么在拖垮解析效率:
真正的瓶颈不在“看”,而在“写”
我们对一个经典的1B参数规模的统一式自回归模型统计了视觉编码器和语言解码器的耗时,结果显示,视觉编码时间相对稳定,而解码耗时会随输出长度快速增长。尤其是在长文档场景中,解码时间可接近视觉编码时间的500倍。
这意味着,对于长文档而言,模型主要不是慢在“看完整张图片”,而是慢在“逐token写出结果”。换一种更直观的说法:文档模型已经可以快速看完整页,但仍然被迫地一个字一个字地进行抄写。
仔细思考其中的奥秘:页面结构的确需要全局理解——例如标题层级、多栏布局、区域位置和阅读顺序,但某个文本段落、公式或表格的具体内容解析,往往只依赖于对应区域图像和必要的上下文,并不需要等待其他区域的全部内容生成完毕。
因此,文档需要整体理解,却不需要整体串行生成。
HPD-Parsing:
让文档解析像团队抄书一样高效协作
第一层并行:全局布局协调,局部并行解析
HPD-Parsing 将传统的单一解码序列重构为具有层级关系的并行生成过程。主布局分支负责识别页面中的区域类别、位置与阅读顺序;当一个区域的边界和类型确定后,模型便动态创建相应的内容分支,并行生成该区域中的正文、公式或表格内容。
不同于传统 Pipeline 通过多个独立模块分阶段完成版面分析与内容解析,HPD-Parsing 将区域级并行直接融入统一模型的解码过程。各内容分支共享整页视觉上下文,主布局分支持续维护区域关系与阅读顺序,并依据全局布局结构组织最终输出。因此,模型无需割裂页面上下文,即可将不同区域的内容生成转化为并发执行。
换句话说,HPD-Parsing 并非先将页面拆分为彼此独立的局部任务,而是在全局统一协调下并行生成不同区域的内容。
并且,分工不等于重复工作!HPD-Parsing采用了共享前缀KV Cache复用机制:新分支可直接复用已计算的视觉信息和布局前缀,无需重新编码整页图像,也无需重复执行完整的 Prefill 过程。
第二层并行:每个分支一次预测多个token
基于布局理解的动态分支解码,使不同文档区域可以并行生成,但每个分支内部仍保留逐token解码带来的串行路径。
为进一步减少主布局分支和各个内容分支的解码步数,HPD-Parsing进一步集成了PaddleOCR团队在ECCV 2026中提出的P-MTP(Progressive Multi-Token Prediction,渐进式多Token预测)技术。
P-MTP 能够在一次解码迭代中预测并验证多个后续 token,并将验证通过的 token 直接纳入输出。HPD-Parsing 平均每个解码步骤可接收 6.6 个 token,使布局分支与内容分支能够以更少的解码步数完成生成,不再只能逐步向前推进。
P-MTP的模型结构、渐进式训练方式与推理验证机制,可参见此前的专题介绍:【ECCV 2026】P-MTP:让文档解析模型「一次读N个字」,推理提速5×。
两级并行,同时缩短区域间等待与区域内解码
由此,HPD-Parsing形成了两个相互补充的并行维度:
分支间并行:不同文档区域同时解码;
分支内并行:每条分支一次推进多个token。
前者减少区域之间的相互等待,后者减少单个区域内部的解码步数。二者协同作用,使整页内容不再沿着一条冗长的序列逐步生成,而是能够在不同区域之间并行展开,并在每个区域内部更快向前推进,从区域间和区域内两个层面共同缩短整体解析过程。
让模型分阶段快速适配HPD机制:
少量数据实现解码范式迁移
兼顾效率与精度
首先,HPD-Parsing构建了一套标准化的数据生产引擎。该引擎首先对原始文档进行特征提取、聚类与代表性采样,以扩大数据覆盖范围并减少重复样本;随后结合 PaddleOCR-VL-1.5、MinerU-2.5 Pro 等模型生成伪标签,并依据中间阶段模型与伪标签之间的解析差异,将样本划分为简单、中等和困难三个等级。对于困难样本,引入更强的视觉语言模型进行多轮检查、生成与纠正;最后从难度等级、文档类型以及文本、表格、公式和复杂版式等属性维度进行分布平衡,形成兼具多样性、可靠性和针对性的训练数据。
基于这一数据引擎,我们进一步构建了三阶段训练数据,用于支撑分阶段的 HPD 机制适配,使模型从传统全页生成逐步过渡到层级并行解码:
第一阶段,模型首先基于280万条全页样本进行训练,建立通用文档解析能力,并同步初始化P-MTP的多token预测能力。
第二阶段,在已有解析能力的基础上,使用十万级别难度分布均衡的分支训练样本,完成解码范式迁移。
第三阶段,进一步选取百级别代表性难例,通过强化训练进行针对性优化。
HPD-Parsing 通过三阶段训练逐步完成能力初始化、解码范式迁移与难例强化,并配合自动化难度感知数据构建,持续发现和补强模型的薄弱环节。
布局与内容监督的分解,使不同解析能力可以得到更有针对性的优化,而统一模型框架仍保留了对整页上下文和页面结构的整体建模能力。
结语
HPD-Parsing将文档解析机制从“一条序列从头写到尾”,转变为“全局协调、局部并行”的模式,在有限的适配数据下,做到了精度可靠的同时摆脱了完整页面串行生成的约束。值得说明的是,这种解析机制的革新,与视觉Token压缩、注意力交互长度压缩等加速手段并不冲突,而是可以相互协同,实现更强的推理效率。
当然,它的意义不只在于一个更高的TPS数字,更在于提供了一种新的解码方式:
页面结构需要全局协调,区域内容则可以局部并行。
未来,这种结构化并行的思路有望进一步扩展到其他具有明确层级结构的生成任务中。
FAQ
Q: HPD-Parsing 和 PaddleOCR-VL系列有什么关系?
A: HPD-Parsing是PaddleOCR团队面向文档解析推理加速提出的最新技术研究成果,建议应用场景聚焦在扫描文档场景且对于推理效率存在强需求的用户可以部署体验,对于解析效果存在强需求的用户,我们仍然建议使用PaddleOCR-VL系列作为第一选择。
53AI,企业落地大模型首选服务商
产品:场景落地咨询+大模型应用平台+行业解决方案
承诺:免费POC验证,效果达标后再合作。零风险落地应用大模型,已交付160+中大型企业
2026-09-11
谷歌正式推出 Google Pics:做图,终于不用开盲盒了
2026-09-10
GPT Images 2.5 突发上线!网友的「灵魂画作」一个比一个离谱
2026-09-09
技术解读|复杂人声干扰下,如何让 ASR “听对人”
2026-09-01
我用一段说话声,让 AI 完整翻唱了一首歌
2026-08-31
从Vibe Coding到Vibe Worlding:AI开始自己“造世界”了
2026-08-27
GLM 5.3 Flash 这价格太离谱了,新的斩杀线
2026-08-26
扔个 PPT 进去,30 秒吐出一条视频:拆解阿里 Wan3.0
2026-08-26
Qwen3.8-Flash:全新架构,更强更稳更划算
2026-07-27
2026-07-15
2026-07-22
2026-06-28
2026-08-04
2026-08-04
2026-07-31
2026-07-15
2026-08-05
2026-07-23
2026-07-15
2026-07-08
2026-03-12
2025-12-31
2025-08-04
2025-05-26
2025-05-13
2025-04-08
欢迎您使用【53AI 官方网站】(以下简称“本网站”或“我们”)。本《会员服务协议》(以下简称“本协议”)是您(以下简称“会员”或“用户”)与【深圳市博思协创网络科技有限公司】之间关于注册、登录及使用本网站会员服务所订立的法律协议。
在您注册或登录前,请务必审慎阅读、充分理解各条款内容,特别是免除或限制责任的条款、知识产权条款、争议解决条款等。此类条款将以加粗形式提示您注意。 当您通过微信公众号授权、手机验证码验证或其他方式成功登录本网站时,即视为您已完全理解并同意接受本协议的全部内容。
一、 定义
本网站:指由【深圳市博思协创网络科技有限公司】运营的,域名为【53ai.com】的网站及相关移动端页面。
会员服务:指本网站向注册会员提供的知识库文章查阅、内容检索及其他相关增值服务。
知识库内容:指本网站发布的包括但不限于文字、图表、数据、研究报告、行业分析等数字化内容资源。
二、 账号注册与登录
登录方式:本网站支持以下登录方式,您可根据实际情况选择:
微信公众号授权登录:您同意将您的微信OpenID信息授权给本网站,用于创建或关联会员账号。
手机验证码登录:您需提供真实有效的手机号码,并通过短信验证码完成身份验证与登录/注册。
账号安全:您的账号仅限您本人使用,禁止赠与、借用、租用、转让或售卖。因您保管不善导致的账号被盗、密码泄露等损失,由您自行承担。
实名认证:根据相关法律法规要求,我们可能要求您在特定功能下完成实名认证。如您拒绝提供,可能无法使用部分或全部服务。
未成年人保护:若您未满18周岁,请在法定监护人的陪同下阅读本协议,并在征得监护人同意后使用本服务。
三、 服务内容与规范
知识库查阅权限:会员登录后,有权按照其会员等级对应的权限范围,在线浏览、检索本网站知识库中的相关文章及内容。
服务变更:我们有权根据业务发展需要,调整、变更或终止部分服务内容,并将以网站公告、公众号消息等方式提前通知。
禁止行为:您在使用服务时不得实施以下行为:
利用技术手段批量爬取、下载、转存知识库内容;
将知识库内容用于商业目的或未经授权地向第三方传播;
干扰本网站正常运行或侵犯其他用户合法权益;
发布违法违规信息或从事违反公序良俗的活动。
四、 知识产权声明
权利归属:本网站知识库中的排版设计、软件代码等内容的知识产权均归【公司全称】或原权利人所有,受《中华人民共和国著作权法》等法律保护。
有限许可:本网站授予会员一项非独占、不可转让、不可转授权的普通许可,仅限于个人学习、研究之目的在线查阅知识库内容。
侵权追责:未经书面许可,任何单位或个人不得以任何形式复制、转载、摘编、镜像、汇编或以其他方式使用上述内容。一经发现,我们保留追究其法律责任的权利。
五、 个人信息保护
我们重视对您个人信息的保护。关于我们如何收集、使用、存储和保护您的个人信息,请单独阅读 《隐私政策》。
您通过微信公众号授权或手机号验证所提供的信息,我们将严格按照《个人信息保护法》的规定处理,仅用于身份识别、服务提供及安全验证等必要用途。
您可以随时通过网站设置或联系客服行使查阅、更正、删除个人信息及撤回授权同意的权利。
六、 免责声明
内容准确性:知识库内容仅供参考,不构成专业建议。我们不对其完整性、准确性、时效性作任何明示或暗示的保证,您应自行判断并承担使用风险。
不可抗力:因自然灾害、政策法规变化、网络故障、第三方平台接口异常(如微信接口维护、运营商短信通道故障)等不可抗力导致的服务中断或延迟,我们不承担违约责任。
第三方链接:本网站可能包含指向第三方网站的链接,该等网站的内容和服务不受我们控制,请您自行甄别风险。
七、 违约责任
如您违反本协议约定,我们有权视情节采取警告、限制功能、暂停服务、注销账号等措施,并保留要求赔偿损失的权利。
如因您的违约行为导致我们遭受行政处罚、第三方索赔或商誉损失,您应承担全部赔偿责任(包括但不限于罚款、赔偿金、律师费、公证费等)。
八、 法律适用与争议解决
本协议的订立、执行和解释均适用中华人民共和国大陆地区法律。
因本协议产生的或与本协议有关的任何争议,双方应友好协商解决;协商不成的,任何一方均可向【公司所在地】有管辖权的人民法院提起诉讼。
九、 其他
本协议构成双方就本服务达成的完整协议,取代此前任何口头或书面约定。
本协议任一条款被认定为无效或不可执行的,不影响其他条款的效力。
我们对本协议享有最终解释权,并在法律允许的范围内保留随时修改的权利。修改后的协议一经公布即生效,继续使用服务即视为同意修订内容。