我要投稿

一个新开源框架，视觉RAG系统的4层境界！

发布日期：2024-09-29 17:28:09 浏览次数： 2061

作者：探索AGI

微信搜一搜，关注“探索AGI”

今天给大家分享一个开源框架，之前分享过一个使用QwenVL来构建的RAG系统脚本。这2天刷网页，看到一个仓库囊括了以视觉出发的RAG几层境界，并且都开源了相关colab notebook可执行代码，所以再次安利给家人们~

Level 1：Simple RAG (with OCR)

与naive RAG系统类似，不过多了OCR环节，因此它可以应付扫描件之类的pdf场景。

Level2: Vision RAG

一种比较常见的模式，使用一些跨模态的向量模型如Clip，文本和图像都被编码到共享向量空间中。检索回相关的图片之后，可以使用VL模型分析，或者解析成文本均可。

Vision RAG 对于文档分析任务特别有用，因为一些视觉组件（如图形、图表）与文本内容同样重要。

Level3: ColPali RAG

ColPali RAG 是一个新方法，利用了 Google 的视觉大模型 PaliGemma，将整个文档页面编码为香莲，将页面布局和视觉元素视为检索过程的一部分。

通过在用户query和文档patchs之间使用token级匹配来增强检索。这种方法确保了较高的检索准确性，同时还保持了合理的索引和查询速度。

它对于富含视觉效果的文档特别有用，例如信息图表、表格和复杂布局，而传统的基于文本的检索方法在这些文档中比较难处理。

当然ColPali的性能也是非常慢的

Level4: Hybrid ColPali RAG

这个是本项目命名的一个名字，他将Level2的向量检索进行粗召回，利用Level3的Colpali进行交互式精排。使得整个系统的推理耗时得到保证，当文档包含复杂的视觉信息和文本混合时，这种方法比较有用，允许系统利用这两种内容类型进行高度准确的文档检索。

53AI，企业落地大模型首选服务商

产品：场景落地咨询+大模型应用平台+行业解决方案

承诺：免费POC验证，效果达标后再合作。零风险落地应用大模型，已交付160+中大型企业

相关资讯

2025-07-31

Coze开源文档资料清单

2025-07-31

手把手教你本地部署！京东JoyAgent全攻略：从零拥有一个企业级的AI Agent

2025-07-31

扣子罗盘（Coze Loop）开源版本地部署，构建一站式AI Agent调试、评估、监控平台

2025-07-31

Github 2.3k star 太牛x，京东（JoyAgent‑JDGenie）项目来得太及时啦，端到端多智能体神器！

2025-07-31

字节打响 Agent 平台战！Coze扣子、n8n、Dify谁是终点？

2025-07-31

Coze开源后，我用LLM+OCR做了一个文档智能问答Agent

2025-07-31

字节开源“扣子”，企业数字化转型的新机遇！

2025-07-31

一个不卷大模型的清华学霸，率先用AI赚到了钱

了解更多

160+中大型企业正在使用53AI

立即咨询预约演示

把握AI发展的机遇，共同探索、共同进步

2025-01-22

如何打造基于GenAI的员工服务机器人

2025-01-22

热点资讯

实测Qwen3-Coder，这就是目前最强的开源编程模型

2025-07-23

看大厂PM，如何玩转多个智能体开发平台

2025-06-17

53AI Hub重磅开源！让99%的智能体开发者赚到钱！

2025-06-17

Qwen3-Coder开源：面向世界的智能编程引擎

2025-07-23

Kimi K2详测，Claude国产平替有了

2025-07-14

Kimi K2 详测｜超强代码和Agent 能力！内附Claude Code邪修教程

2025-07-12

刚刚，DeepSeek开源新版R1，媲美OpenAI最高o3模型

2025-05-29

字节重磅开源！Coze Studio + Coze Loop 助力AI Agent开发与运维一体化

2025-07-27

豆包电脑版不讲武德降维打击本地部署AI知识库的开源选手

2025-05-12

事实证明千问qwen3小模型才是企业的生产力，他究竟能做什么呢？

2025-05-14

大家都在问

字节打响 Agent 平台战！Coze扣子、n8n、Dify谁是终点？

2025-07-31

更强的 Qwen3-Coder 来了，都用上了吗？

2025-07-30

Coze扣子开源后，还有好用的智能体Agent开发平台吗？

2025-07-30

扣子（Coze）开源了！你发现了哪些商业机会？

2025-07-30

GLM-4.5 发布，六大主流模型混战测评，谁能一键生成“ 真·可用 ”的应用？

2025-07-29

Coze既可开源也能本地部署，n8n和coze哪家强？

2025-07-29

AI Agent 新选择：Coze Studio 开源上手实录，能替代 Dify 吗？

2025-07-28

Coze 开源了，对公安/政务行业用户的潜在影响和机会？

2025-07-28

热门标签

内容创作大模型技术个人提效 langchain llamaindex 多模态技术 RAG技术智能客服知识图谱模型微调 RAGFlow coze Dify Fastgpt Bisheng Qanything AI+汽车 AI+金融 AI+工业 AI+培训 AI+SaaS 提示词框架提示词技巧 AI+电商 AI面试数字员工 ChatBI 知识管理开源大模型智能营销智能硬件智能化改造 AI+医疗 MaxKB