微信扫码
添加专属顾问
告别“垃圾进,垃圾出”!这套RAG知识库清洗流程,让你的文档价值翻倍。 核心内容: 1. RAG知识库的瓶颈与“垃圾进,垃圾出”问题解析 2. 文档格式转换与预处理的关键步骤 3. 高效构建知识库的完整工作流与工具推荐
最近大家关注dify的进展的话,应该知道它的版本更新直接从1.8.0--->2.0.1了。跨越了一个大的版本。它本次的主要更新就在于知识库构建的知识流水线。
我认为Dify2.0以后的知识流水线会极大地降低了构建知识库的门槛,未来也许能高效处理 80% 的相对标准的文档。
但是,仍然会有20%,还是要依赖于我们人来手动处理。
我们都知道,现阶段来说,对于知识库,仍然是一个垃圾进垃圾出的状态,因此,在构建知识库之前我们需要对知识文档做很多的预处理。
今天这篇文章的分享,其实也是想给大家分享下我们自己手工处理文档的数据清洗思路。
知识库的质量不取决于模型,而取决于“垃圾进,垃圾出”的铁律。真正的瓶颈是ETL(抽取、转换、加载)过程,尤其是从非结构化源文档到结构化知识块(Chunks)的转换过程。
我们每个公司其实私有的数据量,私有的文档是非常庞大的,而它的内容又是千奇百怪的。针对一个合同,就可能有几十几百种格式,所以指望一套流程来完成这个非结构化源文档到RAG知识库的转变基本是不可能的。
我们如果想偷懒直接将某个文档上传到RAG知识库,就希望他回答的100%准确,那是不可能的。因为用户的问题是多种多样的,而所谓的知识库检索过程,说到底就是一个取一个数据库里面,找与问题最相似的文本内容。但是,你要知道,这极有可能是找不到的。
就像原来的bert,为什么当时一个标准问后面要跟着那么多的相似问,就是因为怕只根据一个相似问,找不到对应的标准问。因为相似问和标准问在文字上可能其实没什么关系。
在Dify2.0的知识流水线出来以前,其实我自己已经构建了一套初版的RAG知识库构建流程。整体的思路,大概是下图中的流程。
下面我想重点和大家聊聊我这套流程的整体思路。这套流程,本质上其实也是为了避免垃圾进垃圾出。
这里为什么要将类似于pdf文件或者docx格式的文件转换为markdown格式呢。
主要的原因就是大模型对于md格式或者json等相关的格式,在识别上有天然的优势。
而且md格式,本身对于图表,图片的处理也相对比较优雅(一般对话聊天窗口的前端都是支持对markdown格式进行渲染的,所以图文混排会比较好实现。)。
在这里,其实我面临的问题是有大量的docx文档,其实他们的格式相对比较统一,所以我就和AI去讨论,我应该怎么将他们转换为md文档。
AI其实推荐了4种工具:pandoc,python-docx库,unstructured,MinerU。
最后我选择了瑞士军刀pandoc,因为它相对来说没有那么麻烦,而且已经可以解决我的问题。
Pandoc :https://pandoc.org/
大家有兴趣的话可以去官网看下它的介绍,他还是非常强大的。
当然,因为我这里是批量转换,所以使用它的时候,需要写一个脚本,也是需要一点点的代码基础的,不过我不会,但是我们可以让AI来搞。
我的需求就是让AI帮我写一个win的shell脚本,可以将同步路中的docx文件输出到一个指定的文件夹。很快AI就可以写完这个代码。
我们使用国内的Trae可以很轻松的完成这个任务。
脚本相对比较长,我就不全都贴出来了。大家有兴趣的话可以联系我交流一下。
因为本身我的文档每个内容不是特别多,基本不会超过5000字,但是数量又特别多,而原始文档,其实很多人都没有很好的用word的样式对标题等进行格式化。且有的语义相对比较乱,所以我在这里使用大模型帮我对文档的格式进行了进一步的整理。
这一步,本身的目的是为了为后续构建RAG知识库的父子分块做准备。
我统一去掉了一级目录,计划使用二级目录##和三级目录###,分别作为知识库的父块和子块。
大模型对md格式理解相对是比较深的,所以我们这一步使用大模型来做这件事,其实是ok的。
这里我用了一个格式整理节点,和一个内容缺失校验的节点。来保证它整理结果的正确性。当然,我们在他整理完成以后,抽查一下,更加稳妥。
毕竟模型存在幻觉。
无论是什么样类型的文档,只要是计划做类似于智能客服类型的服务,QA问答对,是保证回复正确性的一个神器。
尤其是对于保险公司内部的核保助理、合规咨询助理、人力行政助理等等相关场景的落地。
这里我们可以继续使用大模型来帮我们做这件事。和上面的工作流类似:
我们还是使用一个大模型节点来生成问答对,另外一个节点来进行检查,这样可以尽可能的降低错误概率。
当然,这一步和上一步,相对来说是比较重要的,每次完成以后,最好是可以人工来进行一下审核。
当然,上面的准备工作完成以后,这一步,应该是做知识库的导入及构建。
这块就没有什么特别特殊的内容了,我就不详细说了。因为本文主要讲的还是思路。
对于我们构建的咨询助手来说,即便知识库非常强大了,也是难免会有遗漏的地方,所以我们还需要进行充分的测试。
在2022年以前,我们的测试工作,相对来说还是以人为主,冷启动的时候,一般都是找公司内部人员,抽时间让他们大量使用,然后进行人工标注,优化,训练,来完成内部智能助理或客服的系统升级,提高他们回复问题的正确率。
但是现在其实,我们可以让大模型帮我们完成80%的工作。
所以这里,我使用Trae又写了一个批量的chatflow测试脚本。这个脚本已经被我开源在了Github,目前的话,流式模式是好使的,Block模式还是需要继续优化。
它的主要功能如下:
批量测试执行: 从 Excel 文件读取测试用例,批量执行测试
多轮对话支持: 自动管理 conversation_id,支持连续的多轮对话测试
中文字段支持: 完全支持中文字段名(对话ID、轮次、用户问题、期待回复)
实时结果写入: 每完成一个测试用例立即写入结果,避免数据丢失
智能重试机制: 所有类型的API错误都会自动重试3次,每次间隔5秒
灵活的配置管理: 通过配置文件管理 API 参数、日志设置等
详细的结果记录: 自动保存测试结果到 Excel 文件,包含响应时间、错误信息等
进度显示: 实时显示测试进度和统计信息
错误处理: 完善的错误处理和日志记录机制
性能监控: 记录 API 响应时间和执行统计有需要的话,大家自取,如果不会访问github,也可以联系我。
项目地址:https://github.com/Wangshixiong/dify_chatflow_batch
我们以dify知识流水线的QA生成为例,可以看到基本整体思路与我们前面所说的是一样的。但是它还只是一个样例,不具备生产落地性,我们还要在这个基础上做一些其他校验。
如果大家,掌握了我之前讲的RAG清洗和构思的思路的话,相信可以很快的理解Dify2.0版本中知识流水线的设计理念。
相信随着Dify的进一步迭代,知识库这里会越来越好用。这个版本,大家仔细看的话,就会发现官方其实发布了很多新的专门设计的插件,来为知识库的构建服务。包括但不限于:
目前2.0版本还处于beta阶段。
关于如何升级的内容,大家可以自行去网上搜索,或者阅读dify的github内容。
随着Dify的发展,也许未来不需要我们自己在线下这么折腾知识库的准备工作,完全可以把这个工作交给业务人员。
但是目前而言,还是需要的。
其实即便是我们自己折腾,最终目标也是让业务人员维护,因为IT维护,懂业务的人太少,时间成本太高。
但是万变不离其宗,产品的发展是为了更好用、易用。从头到尾,设计的整体思路,永远围绕着这个核心进行的。
AI时代,有事儿没事儿多和AI聊一聊,总有一些收获。
53AI,企业落地大模型首选服务商
产品:场景落地咨询+大模型应用平台+行业解决方案
承诺:免费POC验证,效果达标后再合作。零风险落地应用大模型,已交付160+中大型企业
2026-07-10
千万文档级 RAG 如何逼近零幻觉
2026-07-09
字节跳动开源AI Agent「上下文数据库」,2.6万星,比传统RAG好用太多了
2026-07-09
企业级 RAG 的知识分层:实体、关系、属性与规则如何落库
2026-07-09
大模型负责聪明,本体负责靠谱
2026-07-08
企业AI三件套:语义层、动力层、决策层——少一件都做不出AI原生
2026-07-08
拆解2.8万Star开源项目Cognee:如何基于知识图谱做RAG和Agent记忆
2026-07-07
顶级AI 检索服务商Exa ,如何用 Zilliz Cloud服务Agent 检索需求
2026-07-07
知识库分块不是越小越好——改了分块大小,准确率跳了18%
2026-04-27
2026-04-23
2026-05-27
2026-04-20
2026-04-22
2026-05-14
2026-04-27
2026-04-30
2026-05-11
2026-05-11
2026-07-04
2026-06-23
2026-06-23
2026-06-15
2026-06-10
2026-06-10
2026-05-20
2026-05-18
欢迎您使用【53AI 官方网站】(以下简称“本网站”或“我们”)。本《会员服务协议》(以下简称“本协议”)是您(以下简称“会员”或“用户”)与【深圳市博思协创网络科技有限公司】之间关于注册、登录及使用本网站会员服务所订立的法律协议。
在您注册或登录前,请务必审慎阅读、充分理解各条款内容,特别是免除或限制责任的条款、知识产权条款、争议解决条款等。此类条款将以加粗形式提示您注意。 当您通过微信公众号授权、手机验证码验证或其他方式成功登录本网站时,即视为您已完全理解并同意接受本协议的全部内容。
一、 定义
本网站:指由【深圳市博思协创网络科技有限公司】运营的,域名为【53ai.com】的网站及相关移动端页面。
会员服务:指本网站向注册会员提供的知识库文章查阅、内容检索及其他相关增值服务。
知识库内容:指本网站发布的包括但不限于文字、图表、数据、研究报告、行业分析等数字化内容资源。
二、 账号注册与登录
登录方式:本网站支持以下登录方式,您可根据实际情况选择:
微信公众号授权登录:您同意将您的微信OpenID信息授权给本网站,用于创建或关联会员账号。
手机验证码登录:您需提供真实有效的手机号码,并通过短信验证码完成身份验证与登录/注册。
账号安全:您的账号仅限您本人使用,禁止赠与、借用、租用、转让或售卖。因您保管不善导致的账号被盗、密码泄露等损失,由您自行承担。
实名认证:根据相关法律法规要求,我们可能要求您在特定功能下完成实名认证。如您拒绝提供,可能无法使用部分或全部服务。
未成年人保护:若您未满18周岁,请在法定监护人的陪同下阅读本协议,并在征得监护人同意后使用本服务。
三、 服务内容与规范
知识库查阅权限:会员登录后,有权按照其会员等级对应的权限范围,在线浏览、检索本网站知识库中的相关文章及内容。
服务变更:我们有权根据业务发展需要,调整、变更或终止部分服务内容,并将以网站公告、公众号消息等方式提前通知。
禁止行为:您在使用服务时不得实施以下行为:
利用技术手段批量爬取、下载、转存知识库内容;
将知识库内容用于商业目的或未经授权地向第三方传播;
干扰本网站正常运行或侵犯其他用户合法权益;
发布违法违规信息或从事违反公序良俗的活动。
四、 知识产权声明
权利归属:本网站知识库中的排版设计、软件代码等内容的知识产权均归【公司全称】或原权利人所有,受《中华人民共和国著作权法》等法律保护。
有限许可:本网站授予会员一项非独占、不可转让、不可转授权的普通许可,仅限于个人学习、研究之目的在线查阅知识库内容。
侵权追责:未经书面许可,任何单位或个人不得以任何形式复制、转载、摘编、镜像、汇编或以其他方式使用上述内容。一经发现,我们保留追究其法律责任的权利。
五、 个人信息保护
我们重视对您个人信息的保护。关于我们如何收集、使用、存储和保护您的个人信息,请单独阅读 《隐私政策》。
您通过微信公众号授权或手机号验证所提供的信息,我们将严格按照《个人信息保护法》的规定处理,仅用于身份识别、服务提供及安全验证等必要用途。
您可以随时通过网站设置或联系客服行使查阅、更正、删除个人信息及撤回授权同意的权利。
六、 免责声明
内容准确性:知识库内容仅供参考,不构成专业建议。我们不对其完整性、准确性、时效性作任何明示或暗示的保证,您应自行判断并承担使用风险。
不可抗力:因自然灾害、政策法规变化、网络故障、第三方平台接口异常(如微信接口维护、运营商短信通道故障)等不可抗力导致的服务中断或延迟,我们不承担违约责任。
第三方链接:本网站可能包含指向第三方网站的链接,该等网站的内容和服务不受我们控制,请您自行甄别风险。
七、 违约责任
如您违反本协议约定,我们有权视情节采取警告、限制功能、暂停服务、注销账号等措施,并保留要求赔偿损失的权利。
如因您的违约行为导致我们遭受行政处罚、第三方索赔或商誉损失,您应承担全部赔偿责任(包括但不限于罚款、赔偿金、律师费、公证费等)。
八、 法律适用与争议解决
本协议的订立、执行和解释均适用中华人民共和国大陆地区法律。
因本协议产生的或与本协议有关的任何争议,双方应友好协商解决;协商不成的,任何一方均可向【公司所在地】有管辖权的人民法院提起诉讼。
九、 其他
本协议构成双方就本服务达成的完整协议,取代此前任何口头或书面约定。
本协议任一条款被认定为无效或不可执行的,不影响其他条款的效力。
我们对本协议享有最终解释权,并在法律允许的范围内保留随时修改的权利。修改后的协议一经公布即生效,继续使用服务即视为同意修订内容。