微信扫码
添加专属顾问
我要投稿
英伟达开源多模态文档解析利器,轻松处理复杂版式与表格识别。 核心内容: 1. 模型架构解析:基于ViT-H和mBart的vision-encoder-decoder设计 2. 核心功能展示:支持9类文档元素识别与表格提取 3. 开发者资源:提供HuggingFace预训练权重并兼容vLLM推理
模型整体架构与mBART类似,遵循vision-encoder-decoder架构,这点和之前字节开源的dolphin架构类似。
版式分析识别的标签:标题、节、图例、索引、脚注、列表、表格、参考文献、图像
权重(已支持vllm推理):https://huggingface.co/nvidia/NVIDIA-Nemotron-Parse-v1.1
53AI,企业落地大模型首选服务商
产品:场景落地咨询+大模型应用平台+行业解决方案
承诺:免费POC验证,效果达标后再合作。零风险落地应用大模型,已交付160+中大型企业
2026-01-25
GLM-4.7-Flash无审查版发布:30B MoE模型,仅3B激活参数
2026-01-25
48 个专家级技能包!这个开源库让你的 Claude 瞬间进化,营销、代码、管理样样精通!
2026-01-25
阿里开源 Qwen3-TTS 全家桶!语音设计、克隆、生成全打包,开源 2 天 3K Star!
2026-01-24
当 AI 学会"造沙箱":OpenSandbox 如何让大模型安全地执行代码
2026-01-24
Claude Code 重磅升级:Task 正式取代 Todo,专治多会话、长周期大工程
2026-01-23
国内外主流AI Agent开发框架与平台深度解析
2026-01-23
为什么你一定要用OpenCode
2026-01-23
阿里云为何要将数据采集开发套件开源
2025-11-19
2025-10-27
2025-10-27
2025-12-22
2025-11-17
2025-12-10
2025-11-07
2025-10-29
2025-12-23
2026-01-06
2026-01-21
2026-01-21
2026-01-20
2026-01-16
2026-01-02
2025-12-24
2025-12-22
2025-11-12