免费POC, 零成本试错
AI知识库

53AI知识库

学习大模型的前沿技术与行业应用场景


我要投稿

多模态文档解析模型进展:UNIREC-0.1B架构、数据情况、实际测试

发布日期:2026-01-09 12:29:03 浏览次数: 1560
作者:大模型自然语言处理

微信搜一搜,关注“大模型自然语言处理”

推荐语

探索轻量化多模态文档解析新方向:UNIREC-0.1B模型架构与性能实测。

核心内容:
1. UNIREC-0.1B模型架构解析:FocalSVTR视觉编码器+M2M100语言模型
2. 训练数据UniRec40M构成:3000万中英文混合样本
3. 实际测试表现与开源项目对比分析

杨芳贤
53AI创始人/腾讯云(TVP)最具价值专家

UNIREC是一个0.1B参数量的模型,整体pipline遵循layout(直接拿的paddleocr的layout模型)+ VLM OCR(UNIREC-0.1B)。从这个模型可以看一个趋势,VLM-OCR正在朝参数小进化。下面来看简单看下模型架构、数据情况、实际测试,性能实际测下来一般,仅供参考。模型结构

文档解析的开源项目模型技术方案都在《文档智能专栏》,如:

  • 再看两阶段多模态文档解析大模型-PaddleOCR-VL架构、数据、训练方法
  • 如何打造一个文档解析的多模态大模型?MinerU2.5架构、数据、训练方法
  • 端到端的多模态文档解析模型-DeepSeek-OCR架构、数据、训练方法...

模型架构

模型结构
  • 视觉编码器:FocalSVTR
  • 连接器:线性层
  • 语言模型:M2M100

特别的:最大宽度和高度分别限制在 960 和1408 像素。

数据

UniRec40M 的构成,该数据集包含近 3000 万英文样本和 1000 万中文样本。数据集包括 1900 万纯文本、1300 万仅含公式以及 800 万文本与公式混合的样本。

与paddleocr-vl、mineru等一样,训练UNIREC-0.1B时构造相关block(文本、公式、表格等)数据-UniRec40M(数据未开源)

实验性能

实际测试case

测试链接:https://modelscope.cn/studios/topdktu/OpenDoc-0.1B-Demo 笔者随便截取了tech report中的几页,效果如下(由于版式分析模型是使用的paddleocr的layout模型,测试主要关注下block的ocr format能力,测了两张不是特别好,就未压测):

case1
case2

识别如下:

53AI,企业落地大模型首选服务商

产品:场景落地咨询+大模型应用平台+行业解决方案

承诺:免费POC验证,效果达标后再合作。零风险落地应用大模型,已交付160+中大型企业

联系我们

售前咨询
186 6662 7370
预约演示
185 8882 0121

微信扫码

添加专属顾问

回到顶部

加载中...

扫码咨询