微信扫码
添加专属顾问
我要投稿
英伟达开源多模态文档解析利器,轻松处理复杂版式与表格识别。核心内容: 1. 模型架构解析:基于ViT-H和mBart的vision-encoder-decoder设计 2. 核心功能展示:支持9类文档元素识别与表格提取 3. 开发者资源:提供HuggingFace预训练权重并兼容vLLM推理
往期相关:
模型整体架构与mBART类似,遵循vision-encoder-decoder架构,这点和之前字节开源的dolphin架构类似。
版式分析识别的标签:标题、节、图例、索引、脚注、列表、表格、参考文献、图像
权重(已支持vllm推理):https://huggingface.co/nvidia/NVIDIA-Nemotron-Parse-v1.1
53AI,企业落地大模型首选服务商
产品:场景落地咨询+大模型应用平台+行业解决方案
承诺:免费POC验证,效果达标后再合作。零风险落地应用大模型,已交付160+中大型企业
2025-12-09
豆包手机不用买了?能操作手机的AutoGLM开源
2025-12-09
今天,AutoGLM开源:让人人都可构建手机Agent
2025-12-09
11K+ Star!NotebookLM 最强开源平替来了,支持私有化部署!
2025-12-08
Docker+vLLM内网离线部署Qwen3教程
2025-12-08
Claude Code的最强记忆外挂来了!
2025-12-08
微软开源轻量级实时TTS模型!VibeVoice-Realtime-0.5B:实现多角色自然对话!
2025-12-06
100万亿Token画出AI版图|Claude吃掉编程60%,DeepSeek吃掉开源一半
2025-12-05
FluidMarkdown 正式发布 HarmonyOS 开源 Markdown 渲染引擎,为 AI 流式交互而生
2025-10-20
2025-11-19
2025-10-27
2025-10-27
2025-10-03
2025-09-17
2025-09-29
2025-10-29
2025-09-29
2025-11-17
2025-11-12
2025-11-10
2025-11-03
2025-10-29
2025-10-28
2025-10-13
2025-09-29
2025-09-17