微信扫码
添加专属顾问
Qwen3.8-27B多模态大模型落地轻量化部署,结合OpenVINO实现本地快速推理,支持复杂任务与Intel硬件集成。 核心内容: 1. Qwen3.8-27B多模态核心能力(图像视频理解、思考控制) 2. OpenVINO通过vlm-chatbot示例助力快速体验部署 3. Herdsman平台实现模型与Intel硬件本地集成
过去一年,多模态大模型的发展速度越来越快。开发者不再只满足于让模型“会聊天”,而是希望模型能够看懂图片、理解复杂指令、完成视觉问答、辅助代码生成,甚至成为智能体应用中的核心大脑。
Qwen3.8 系列在代码编写、专业工作、科学研究及长流程 Agent 任务方面提供顶尖性能。阿里巴巴千问大模型团队最新发布的Qwen3.8-27B模型将这些技术提升落地于轻量化、易部署的稠密模型:它是一款原生多模态视觉-语言模型,具备图像与视频理解能力,并支持灵活的思考控制(Thinking Control),专为以更高可靠性完整执行复杂的跨步骤任务而设计。
我们借助 OpenVINO notebooks 中的 vlm-chatbot 示例,带大家快速上手体验 Qwen3.8-27B。 同时,Flowy公司推出的Herdsman(牧马人)本地模型推理平台,也已经实现了与模型和英特尔硬件平台的集成,下载安装后即可快速运行Qwen3.8-27B。
为什么 Qwen3.8 值得开发者关注?
如果说早期的大语言模型主要解决“文本理解与生成”,那么 Qwen3.8 更进一步,把多模态能力作为模型能力的一部分来构建。
它们的价值主要体现在
•Agentic 智能体执行力: 更强大的自主规划与环境反馈应对能力,实现更高可靠性的端到端任务交付。
•可控思考机制: 提供可开关的思考模式,并支持自定义推理深度(Reasoning Depth)。
•多模态视觉理解: 原生集成图像与视频理解,全面覆盖 STEM 图表、复杂文档及长视频分析。
而 OpenVINO的价值,就是让这些模型不仅“能用”,而且更适合在 Intel 平台上本地部署、优化运行和集成到真实应用中。
OpenVINO:让 Qwen3.8 更容易跑在本地
OpenVINO 一直关注的核心问题是:如何让 AI 模型更高效地运行在真实硬件上。
对于开发者来说,从 Hugging Face 上拿到一个模型,只是第一步。真正要把模型做进应用,还需要解决很多实际问题:模型如何转换为高效推理格式?如何降低显存和内存占用?如何在 CPU / GPU 上稳定运行?如何支持 streaming 输出?如何快速搭建一个可交互 demo?
如何进一步封装成自己的本地智能体或 AI PC skill?这正是 OpenVINO notebooks 中 vlm-chatbot 示例(https://github.com/openvinotoolkit/openvino_notebooks/tree/latest/notebooks/vlm-chatbot)想解决的问题。
这个 notebook 展示了一个完整的 VLM chatbot 工作流:先安装依赖,然后选择模型和压缩精度,再通过 Optimum Intel 将模型导出为 OpenVINO IR 格式,并利用 NNCF 完成 INT8 或 INT4 权重量化压缩,最后用 OpenVINO GenAI 的 VLMPipeline 运行图文推理,并通过 Gradio 搭建交互式界面。
Qwen3.8-27B在英特尔锐炫™ Pro B70和Herdsman(牧马人)的实测效果展示
Herdsman(牧马人)是Flowy公司推出的本地模型推理平台,基于英特尔XPU平台及OpenVINO优化,快速部署主流 LLM(本地文生图、合成音频等),支持端云混合算力,数据留存本地。开发者下载并安装后即可运行 qwen3.8 本地推理,几十种大模型一键部署(Qwen3.6 / DeepSeek / GLM-4.7 / Llama 等)。同时,牧马人为开发者提供类 OpenAI API,配好 Base URL 直接用,协议兼容零迁移。
看完 Demo 去哪找、怎么用?
下载地址:https://www.flowyaipc.cn/ai-engine
1. 打开上方链接,下载安装牧马人本地推理引擎,支持 Qwen3.6 / DeepSeek / GLM-4.7 / Llama 等几十种大模型,一键完成部署
2. 对话界面可直接体验 qwen3.8 本地推理;文生图、图生图、多语种翻译等能力开箱即用
3. 牧马人引擎提供与 OpenAI兼容的 API,配好 Base URL 直接用(无需额外配置)
4. 前端 flowyaipc 已内置模型管理,一键切换模型、查看推理参数
5. 开发者可调 API 接入自己的应用,协议与 OpenAI API一致,零迁移成本
下面我们就以 Qwen3.8-27B 为例,走一遍核心流程。
第一步:准备运行环境
打开一个终端窗口,使用如下命令创建一个虚拟环境
python -m venv ov-qwen36
激活虚拟环境(Windows操作系统):
ov-qwen36\Scripts\activate
激活虚拟环境(Linux / macOS操作系统):
source ov-qwen36/bin/activate
然后安装 OpenVINO nightly-build、OpenVINO GenAI nightly-build、Optimum Intel、NNCF 以及 VLM 推理所需依赖:
pip install -U openvino openvino-tokenizers openvino-genai --extra-index-url https://storage.openvinotoolkit.org/simple/wheels/nightlypip install -U "git+https://github.com/huggingface/optimum-intel.git"pip install -U nncf torch accelerate datasets gradio huggingface-hubpip install -U opencv-python-headless einops timm sentencepiece qwen-vl-utils transformers_stream_generator
需要特别注意:Qwen3.8 相关模型需要匹配更新版本的 Transformers。Notebook 中为这个系列提供了单独选项:
pip install --no-deps "transformers==5.2"
如果你是在 notebook 中运行,可以按照 notebook 的交互控件选择 Qwen3.8 对应的 Transformers 版本。
第二步:选择模型和压缩精度
在 vlm-chatbot notebook 中,你可以通过交互控件选择模型、语言、目标设备和压缩精度。
这里我们以Qwen/Qwen3.8-27B作为示例模型。
由于这是一个 27B 级别的多模态大模型,如果直接使用原始 BF16 / FP16 权重,对本地设备的显存和内存压力会非常大。因此,在 AI PC 或本地工作站上部署时,推荐使用 INT4 权重量化。
OpenVINO notebook 中提供了多种压缩选项:
FP16
INT8
INT4
INT4 AWQ
INT4 NPU-friendly
对于 Qwen3.8-27B这类大模型,我们推荐优先尝试 INT4。它可以显著降低模型体积和显存占用,同时保持可接受的生成质量,非常适合在本地设备上进行 demo、原型验证和开发者体验展示。
第三步:下载并导出 OpenVINO IR 模型
魔搭社区上已经提供了预转换的 OpenVINO 模型,可以直接使用 notebook 中的 “Use preconverted models” 选项,跳过本地转换过程。
https://www.modelscope.cn/models/OpenVINO/Qwen3.8-27B-int4-ov
https://www.modelscope.cn/models/OpenVINO/Qwen3.8-27B-int8-ov
如果希望自己完整复现模型优化流程,可以使用 Optimum CLI 将模型导出为 OpenVINO IR 格式,并在导出过程中完成 INT4 权重量化。
示例命令如下:
optimum-cli export openvino \--model Qwen/Qwen3.8-27B \--task image-text-to-text \--trust-remote-code \--weight-format int4 \--group-size 128 \--ratio 1.0 \ov_models/qwen3.8-27b-int4
这里的关键参数包括:
--model
指定 Hugging Face 模型 ID。
--task image-text-to-text
指定这是一个图像到文本 / 图文对话任务。
--weight-format int4
在导出过程中对模型权重进行 INT4 压缩。
--group-size 128
控制量化分组大小,通常可以在模型大小、推理性能和精度之间取得较好平衡。
--ratio 1.0
表示尽可能对线性层使用 INT4 权重量化。
需要提醒的是,27B 级别模型的转换本身会消耗较多系统内存和时间。如果只是想快速体验,建议优先使用已经转换好的 OpenVINO INT4 模型;如果你希望验证完整优化流程,再选择本地导出。
第四步:选择推理设备
OpenVINO 可以自动检测可用设备,并允许你选择 CPU、GPU 等目标设备。
对于 Qwen3.8-27B INT4 这样的模型,如果你的机器配备了 Intel GPU,建议优先尝试:
device = "GPU"
如果想先验证模型是否能正确加载和运行,也可以使用:
device = "CPU"
不过对于 27B 级别模型来说,GPU 通常能带来更好的交互体验,尤其是在需要 streaming 输出、图文理解和连续对话时。
第五步:使用 OpenVINO GenAI 创建 VLM 推理管线
OpenVINO GenAI 提供了更高层的生成式 AI API,可以让开发者不用手动处理复杂的 tokenization、模型调用和 generation loop。
对于 VLM 模型,可以直接使用 VLMPipeline:
import openvino_genai as ov_genaiimport openvino as ovimport numpy as npfrom PIL import Imageimport sysimport time model_dir = "ov_models/qwen3.8-27b-int4"device = "GPU" load_start = time.time()pipe = ov_genai.VLMPipeline(model_dir, device)print(f"Model loaded in {time.time() - load_start:.2f}s") cfg = ov_genai.GenerationConfig()cfg.max_new_tokens = 256 def streamer(subword):print(subword, end="", flush=True)sys.stdout.flush()return False image_path = "demo.jpg"image_tensor = ov.Tensor(np.array(Image.open(image_path).convert("RGB"))) prompt = "请用中文描述这张图片,并总结其中最重要的信息。" print("Generating...")gen_start = time.time() pipe.generate(prompt,image=image_tensor,generation_config=cfg,streamer=streamer,) print(f"\n\nInference time: {time.time() - gen_start:.2f}s")
这段代码完成了几个关键动作:
首先,从 OpenVINO IR 模型目录加载 Qwen3.8-27B INT4 模型。
然后,创建 OpenVINO GenAI 的 VLMPipeline。
接着,将图片转换为 OpenVINO Tensor。
最后,调用 pipe.generate() 完成图文理解,并通过 streamer 实时输出生成结果。
这也是 notebook 中最值得大家关注的部分:模型一旦被转换和优化为 OpenVINO 格式,后续推理代码就非常简洁,适合继续集成到自己的 Gradio demo、桌面应用、Web 服务、本地智能体或 AI PC skill 中。
第六步:搭建 Gradio Chatbot Demo
完成基础推理后,就可以进一步用 Gradio 搭建交互式界面。
Notebook 已经提供了 Gradio helper,支持图片上传、文本输入和模型输出展示。你可以基于它快速构建一个本地多模态聊天机器人。
一个典型的 demo 体验可以是:
上传一张图片。
输入一个问题,例如:“请分析这张图片中的主要对象,并判断它可能适合什么应用场景。”
模型在本地完成图像理解和中文回答。
你还以继续追问,让模型基于同一张图片进行多轮分析。
大模型本地部署并不一定意味着必须准备高端服务器,也不一定必须依赖云端 GPU。通过 OpenVINO 的模型转换、权重量化和 Intel 平台优化,你可以在本地 AI PC 上完成越来越多真实可用的 GenAI 应用探索。
开发者可以基于这个示例继续做什么?
完成这个 notebook 后,你可以继续做很多扩展。
你可以把它封装成一个本地图片理解助手,用于识别截图、海报、产品图、工业图像或文档图片。
你可以把它接入自己的 Agent 框架,让 Qwen3.8 作为多模态理解模块,为智能体提供视觉输入能力。
你可以将 Gradio demo 改造成 Web API,让前端应用、桌面应用或企业内部工具调用本地模型。
你也可以进一步结合 OpenVINO Model Server,把模型服务化,提供更标准的部署接口。
如果你正在构建 AI PC skill,还可以把这个多模态能力封装成一个可被智能体调用的本地 skill。例如:图片信息提取、截图理解、商品图分析、文档页面解释、视觉问答等。
从 notebook 到 demo,再从 demo 到应用,这正是 OpenVINO 对开发者最直接的价值。
小结
Qwen3.8 代表了新一代多模态大模型的发展方向:更强的原生视觉语言能力,更适合智能体应用,更高效的模型结构,以及更广泛的本地部署潜力。
OpenVINO 对这个系列模型的新增支持,让开发者可以更方便地将它们部署到 Intel 平台上。借助 Optimum Intel、NNCF 和 OpenVINO GenAI API,开发者可以完成从模型下载、OpenVINO IR 转换、INT4 压缩,到本地图文推理和 Gradio demo 的完整流程。
更重要的是,我们已经可以在 32GB 内存的 本地AI PC上运行经过 OpenVINO INT4 优化的 Qwen3.8-27B。对于 AI PC 开发者来说,这不是一个“未来才会发生”的方向,而是现在就可以上手验证的能力。
现在就动手试试
如果你正在关注多模态大模型、本地智能体、AI PC 应用,或者希望把大模型能力部署到更靠近用户的数据和设备侧,那么现在就是尝试 OpenVINO + Qwen3.8 的最佳时机。
53AI,企业落地大模型首选服务商
产品:场景落地咨询+大模型应用平台+行业解决方案
承诺:免费POC验证,效果达标后再合作。零风险落地应用大模型,已交付160+中大型企业
2026-09-11
谷歌正式推出 Google Pics:做图,终于不用开盲盒了
2026-09-10
GPT Images 2.5 突发上线!网友的「灵魂画作」一个比一个离谱
2026-09-09
技术解读|复杂人声干扰下,如何让 ASR “听对人”
2026-09-01
我用一段说话声,让 AI 完整翻唱了一首歌
2026-08-31
从Vibe Coding到Vibe Worlding:AI开始自己“造世界”了
2026-08-27
GLM 5.3 Flash 这价格太离谱了,新的斩杀线
2026-08-26
扔个 PPT 进去,30 秒吐出一条视频:拆解阿里 Wan3.0
2026-08-26
Qwen3.8-Flash:全新架构,更强更稳更划算
2026-07-27
2026-07-15
2026-07-22
2026-06-28
2026-08-04
2026-08-04
2026-07-31
2026-07-15
2026-08-05
2026-07-23
2026-07-15
2026-07-08
2026-03-12
2025-12-31
2025-08-04
2025-05-26
2025-05-13
2025-04-08
欢迎您使用【53AI 官方网站】(以下简称“本网站”或“我们”)。本《会员服务协议》(以下简称“本协议”)是您(以下简称“会员”或“用户”)与【深圳市博思协创网络科技有限公司】之间关于注册、登录及使用本网站会员服务所订立的法律协议。
在您注册或登录前,请务必审慎阅读、充分理解各条款内容,特别是免除或限制责任的条款、知识产权条款、争议解决条款等。此类条款将以加粗形式提示您注意。 当您通过微信公众号授权、手机验证码验证或其他方式成功登录本网站时,即视为您已完全理解并同意接受本协议的全部内容。
一、 定义
本网站:指由【深圳市博思协创网络科技有限公司】运营的,域名为【53ai.com】的网站及相关移动端页面。
会员服务:指本网站向注册会员提供的知识库文章查阅、内容检索及其他相关增值服务。
知识库内容:指本网站发布的包括但不限于文字、图表、数据、研究报告、行业分析等数字化内容资源。
二、 账号注册与登录
登录方式:本网站支持以下登录方式,您可根据实际情况选择:
微信公众号授权登录:您同意将您的微信OpenID信息授权给本网站,用于创建或关联会员账号。
手机验证码登录:您需提供真实有效的手机号码,并通过短信验证码完成身份验证与登录/注册。
账号安全:您的账号仅限您本人使用,禁止赠与、借用、租用、转让或售卖。因您保管不善导致的账号被盗、密码泄露等损失,由您自行承担。
实名认证:根据相关法律法规要求,我们可能要求您在特定功能下完成实名认证。如您拒绝提供,可能无法使用部分或全部服务。
未成年人保护:若您未满18周岁,请在法定监护人的陪同下阅读本协议,并在征得监护人同意后使用本服务。
三、 服务内容与规范
知识库查阅权限:会员登录后,有权按照其会员等级对应的权限范围,在线浏览、检索本网站知识库中的相关文章及内容。
服务变更:我们有权根据业务发展需要,调整、变更或终止部分服务内容,并将以网站公告、公众号消息等方式提前通知。
禁止行为:您在使用服务时不得实施以下行为:
利用技术手段批量爬取、下载、转存知识库内容;
将知识库内容用于商业目的或未经授权地向第三方传播;
干扰本网站正常运行或侵犯其他用户合法权益;
发布违法违规信息或从事违反公序良俗的活动。
四、 知识产权声明
权利归属:本网站知识库中的排版设计、软件代码等内容的知识产权均归【公司全称】或原权利人所有,受《中华人民共和国著作权法》等法律保护。
有限许可:本网站授予会员一项非独占、不可转让、不可转授权的普通许可,仅限于个人学习、研究之目的在线查阅知识库内容。
侵权追责:未经书面许可,任何单位或个人不得以任何形式复制、转载、摘编、镜像、汇编或以其他方式使用上述内容。一经发现,我们保留追究其法律责任的权利。
五、 个人信息保护
我们重视对您个人信息的保护。关于我们如何收集、使用、存储和保护您的个人信息,请单独阅读 《隐私政策》。
您通过微信公众号授权或手机号验证所提供的信息,我们将严格按照《个人信息保护法》的规定处理,仅用于身份识别、服务提供及安全验证等必要用途。
您可以随时通过网站设置或联系客服行使查阅、更正、删除个人信息及撤回授权同意的权利。
六、 免责声明
内容准确性:知识库内容仅供参考,不构成专业建议。我们不对其完整性、准确性、时效性作任何明示或暗示的保证,您应自行判断并承担使用风险。
不可抗力:因自然灾害、政策法规变化、网络故障、第三方平台接口异常(如微信接口维护、运营商短信通道故障)等不可抗力导致的服务中断或延迟,我们不承担违约责任。
第三方链接:本网站可能包含指向第三方网站的链接,该等网站的内容和服务不受我们控制,请您自行甄别风险。
七、 违约责任
如您违反本协议约定,我们有权视情节采取警告、限制功能、暂停服务、注销账号等措施,并保留要求赔偿损失的权利。
如因您的违约行为导致我们遭受行政处罚、第三方索赔或商誉损失,您应承担全部赔偿责任(包括但不限于罚款、赔偿金、律师费、公证费等)。
八、 法律适用与争议解决
本协议的订立、执行和解释均适用中华人民共和国大陆地区法律。
因本协议产生的或与本协议有关的任何争议,双方应友好协商解决;协商不成的,任何一方均可向【公司所在地】有管辖权的人民法院提起诉讼。
九、 其他
本协议构成双方就本服务达成的完整协议,取代此前任何口头或书面约定。
本协议任一条款被认定为无效或不可执行的,不影响其他条款的效力。
我们对本协议享有最终解释权,并在法律允许的范围内保留随时修改的权利。修改后的协议一经公布即生效,继续使用服务即视为同意修订内容。