我要投稿

大模型RAG实战｜对接Streamlit实现类似ChatGPT的流式输出

发布日期：2024-08-17 06:54:14 浏览次数： 3558

作者：大卫THINK

微信搜一搜，关注“大卫THINK”

ThinkRAG大模型RAG实战系列文章，带你深入探索使用LlamaIndex框架，构建本地大模型知识库问答系统。本系列涵盖知识库管理、检索优化、模型本地部署等主题，通过代码与实例，讲解如何打造生产级系统，实现本地知识库的快速检索与智能问答。

前文讨论了实现混合检索的方法。当我们把检索到的内容，发送给大模型生成回答时，希望能够快速得到响应。

类似ChatGPT的流式（streaming）输出可以提升用户的体验。

特别是当我们要求大模型输出长文本时，例如：生成一篇2000字文章，用户无需等待生成完毕，即可开始阅读生成的内容。

现在的大语言模型（LLM）基本都支持流式输出。在LlamaIndex中实现方式很简单：我们在构建问答引擎（Query Engine）时，只需要明确设置参数streaming=True即可。

代码实例如下：

from llama_index.core.query_engine import RetrieverQueryEnginequery_engine = RetrieverQueryEngine.from_args(retriever=retriever,text_qa_template=text_qa_template,refine_template=refine_template,node_postprocessors=node_postprocessors,        response_mode="simple_summarize",verbose=True,streaming=True,)

这时，我们通过query_engine的query方法向大模型提问：“流程有哪三个特征”，该方法会返回一个response对象。

prompt = "流程有哪三个特征？"response = query_engine.query(prompt)
response_text = st.write_stream(response.response_gen)

我们将response对象的reponse_gen方法，对接到Streamlit的write_stream方法，就可以接收大模型生成的流式输出，并同步在前端显示了。

该方法的返回值response_text，则是此次流式输出的全文，可以进一步处理或保存到对话记录中。

目前，ThinkRAG已采用流式输出。如果你运行ThinkRAG进行提问，可以看到系统的响应速度非常快，软件记录的时间为0.05秒。

效果如下：

如果，你的LlamaIndex应用不是通过Streamlit输出，而是在终端（console）输出，那么我们直接调用print_response_stream方法即可。

response.print_response_stream()

如果你自行开发软件前端，需要对流式输出进行手动处理，那么可以参考以下方法实现。

for text in response.response_gen:# do something with text as they arrive.pass

文中代码实例，可参考开源项目ThinkRAG。

https://github.com/wzdavid/ThinkRAG

ThinkRAG是基于LlamaIndex框架，前端使用Streamlit开发的大模型本地知识库RAG系统，可在笔记本电脑上部署和离线运行。

53AI，企业落地大模型首选服务商

产品：场景落地咨询+大模型应用平台+行业解决方案

承诺：免费POC验证，效果达标后再合作。零风险落地应用大模型，已交付160+中大型企业

相关资讯

2026-02-03

使用 Agent Skills 做知识库检索，能比传统 RAG 效果更好吗？

2026-02-03

告别向量数据库！PageIndex：让AI像人类专家一样阅读长文档

2026-02-02

OpenViking：面向 Agent 的上下文数据库

2026-02-02

别再迷信向量数据库了，RAG 的“大力出奇迹”该结束了

2026-01-29

告别黑盒开发！清华系团队开源 UltraRAG：用“搭积木”的方式构建复杂 RAG 流程

2026-01-28

RAG优化不抓瞎！Milvus检索可视化，帮你快速定位嵌入、切块、索引哪有问题

2026-01-28

今天，分享Clawdbot记忆系统最佳工程实践

2026-01-28

Fusion GraphRAG：超越 GraphRAG 的多模态企业级 AI 问答

联系获取

160+中大型企业正在使用53AI

立即咨询预约演示

把握AI发展的机遇，共同探索、共同进步

2025-01-22

如何打造基于GenAI的员工服务机器人

2025-01-22

热点资讯

RAG 深度解读：检索增强生成如何改变人工智能

2025-12-04

大模型RAG入门宝典｜从AI搜索到实战搭建，小白&程序员必收藏的检索增强指南

2025-12-03

RAGFlow v0.22.0 发布：数据源同步、变量聚合、全新管理界面与多项重大更新

2025-11-13

企业级 AI Agent规模化落地的避坑指南，就藏在这四大趋势里

2025-12-02

5步构建企业级RAG应用：Dify与LangChain v1.0集成实战

2025-11-13

2026 年你需要了解的 RAG 全解析

2026-01-15

Embedding模型选型思路：相似度高不再代表检索准确（文末附实战指南）

2025-12-07

RAG已经过时了？试试CAG，缓存增强生成技术实战大揭秘！

2025-11-06

如何用NotebookLM，把枯燥的财报解读成精美的PPT？

2026-01-02

为什么Claude Code不用RAG？

2025-12-23

大家都在问

使用 Agent Skills 做知识库检索，能比传统 RAG 效果更好吗？

2026-02-03

为什么 RAG 越用越慢？如何反向调优？

2026-01-19

NotebookLM如何在48小时内分析2万份论文？

2026-01-12

都有混合检索与智能路由了，谁还在给RAG赛博哭坟？

2026-01-08

如何用NotebookLM，把枯燥的财报解读成精美的PPT？

2026-01-02

为什么Claude Code不用RAG？

2025-12-23

终于，NotebookLM 和 Gemini 合体了。这是什么神之更新？

2025-12-21

Apple 入局 RAG：深度解析 CLaRa 框架，如何实现 128x 文档语义压缩？

2025-12-10

热门标签

内容创作大模型技术个人提效 langchain llamaindex 多模态技术 RAG技术智能客服知识图谱模型微调 RAGFlow coze Dify Fastgpt Bisheng Qanything AI+汽车 AI+金融 AI+工业 AI+培训 AI+SaaS 提示词框架提示词技巧 AI+电商 AI面试数字员工 ChatBI AI知识库开源大模型智能营销智能硬件智能化改造 AI+医疗 MaxKB Palantir Glean