微信扫码
添加专属顾问
我要投稿
探索轻量化多模态文档解析新方向:UNIREC-0.1B模型架构与性能实测。 核心内容: 1. UNIREC-0.1B模型架构解析:FocalSVTR视觉编码器+M2M100语言模型 2. 训练数据UniRec40M构成:3000万中英文混合样本 3. 实际测试表现与开源项目对比分析
UNIREC是一个0.1B参数量的模型,整体pipline遵循layout(直接拿的paddleocr的layout模型)+ VLM OCR(UNIREC-0.1B)。从这个模型可以看一个趋势,VLM-OCR正在朝参数小进化。下面来看简单看下模型架构、数据情况、实际测试,性能实际测下来一般,仅供参考。
文档解析的开源项目模型技术方案都在《文档智能专栏》,如:
特别的:最大宽度和高度分别限制在 960 和1408 像素。
与paddleocr-vl、mineru等一样,训练UNIREC-0.1B时构造相关block(文本、公式、表格等)数据-UniRec40M(数据未开源)。
测试链接:https://modelscope.cn/studios/topdktu/OpenDoc-0.1B-Demo 笔者随便截取了tech report中的几页,效果如下(由于版式分析模型是使用的paddleocr的layout模型,测试主要关注下block的ocr format能力,测了两张不是特别好,就未压测):
识别如下:
53AI,企业落地大模型首选服务商
产品:场景落地咨询+大模型应用平台+行业解决方案
承诺:免费POC验证,效果达标后再合作。零风险落地应用大模型,已交付160+中大型企业
2026-05-25
罗福莉说的“伪多Agent”,我试了OmniWork后发现,真全干专家长这样
2026-05-19
从画稿到代码,AI Agent 正在吃掉产品设计的中间环节
2026-05-16
PDF解析折腾半年,最后靠这套方案搞定了
2026-04-27
一个神奇的视频生成 Skills,实测,狂喜
2026-04-26
你的一人公司品牌部,带着Image-2模型的lovart中文版来了
2026-04-22
MNN-Sana-Edit-V2:端侧运行的图像漫画风编辑大模型
2026-04-22
刚刚!Codex 居然能直接画图了,OpenAI 凌晨甩出 Image 2.0
2026-04-21
PaddleOCR 3.5 发布:Web 端直用、文档一键转 Markdown,生态交互新体验
2026-04-22
2026-04-01
2026-03-05
2026-04-02
2026-02-27
2026-03-11
2026-03-18
2026-03-29
2026-03-15
2026-04-21
2026-03-12
2025-12-31
2025-08-04
2025-05-26
2025-05-13
2025-04-08
2025-04-05
2025-03-30