微信扫码
添加专属顾问
我要投稿
英伟达开源多模态文档解析利器,轻松处理复杂版式与表格识别。 核心内容: 1. 模型架构解析:基于ViT-H和mBart的vision-encoder-decoder设计 2. 核心功能展示:支持9类文档元素识别与表格提取 3. 开发者资源:提供HuggingFace预训练权重并兼容vLLM推理
模型整体架构与mBART类似,遵循vision-encoder-decoder架构,这点和之前字节开源的dolphin架构类似。
版式分析识别的标签:标题、节、图例、索引、脚注、列表、表格、参考文献、图像
权重(已支持vllm推理):https://huggingface.co/nvidia/NVIDIA-Nemotron-Parse-v1.1
53AI,企业落地大模型首选服务商
产品:场景落地咨询+大模型应用平台+行业解决方案
承诺:免费POC验证,效果达标后再合作。零风险落地应用大模型,已交付160+中大型企业
2026-04-28
实测了 DeepSeek V4 后,我的评价是...
2026-04-26
Linux基金会背书 Goose:全能型本地 AI Agent 杀手,一键接管你的所有工作流!
2026-04-26
今天起,DeepSeek V4成OpenClaw默认模型!
2026-04-26
初识OpenSpec
2026-04-25
DeepSeek V4报告太详尽了!484天换代之路全公开
2026-04-24
阿里云 AI 网关支持 DeepSeek V4
2026-04-24
一手实测 DeepSeek V4,代码能力真的很强
2026-04-24
DeepSeek-V4 终于来了!1M上下文,开源模型新王登基
2026-01-30
2026-01-29
2026-01-28
2026-03-30
2026-04-03
2026-03-23
2026-03-31
2026-04-09
2026-02-14
2026-02-18
2026-04-22
2026-04-21
2026-04-15
2026-04-09
2026-04-01
2026-03-17
2026-03-13
2026-03-02