我要投稿

炸裂！最强开源模型新王通义千问2.5 72B被我用4GB老显卡本地跑通了！

发布日期：2024-09-21 11:47:47 浏览次数： 2934

作者：AI统治世界计划

微信搜一搜，关注“AI统治世界计划”

炸裂！最强开源模型一夜之间易主。

阿里发布千问2.5模型，72B版本在MMLU、MATH、MBPP等大部分评测指标上都超过了Llama3 405B，甚至一些指标也超过了GPT4o。正式加冕最强开源模型新王！

今天要挑战用我的4GB老显卡不做量化、不做压缩，看看能不能跑起来这个72B模型。

X上边各个国家也都爆发了关于Qwen模型的讨论：

01

我的4GB老显卡还能用吗？

A100，H100暂时还没有购入，主要的原因是穷。

目前主力显卡是一个4GB的老显卡：

4GB显卡直接尝试运行时，是这个画风：

02

72B的千问有多大？

72B的千问用18T个token训练而成，有80层。加载这个模型大概需要37块我这样的4GB显卡。差得不多。还差36块。

因此需要想一个办法。

03

分层推理

解决方案就是分层推理，每次只80层中的一层进显存：

04

开源

代码全部开源到了开源项目AirLLM中，可以在github找到。

除了QWen2.5，AirLLM也支持Llama3 400B，Mixtral等模型。

叠个甲：4GB能跑但是速度肯定不会太快（4GB的卡还要啥自行车啊？）因此不适合chatbot等实时场景，仅适合异步数据处理等场景。

推理过程只需要几行代码：

from airllm import AutoModel
MAX_LENGTH = 128model = AutoModel.from_pretrained("Qwen/Qwen2.5-72B-Instruct")
input_text = ['What is the capital of United States?',]
input_tokens = model.tokenizer(input_text,return_tensors="pt", return_attention_mask=False, truncation=True, max_length=MAX_LENGTH, padding=False)
generation_output = model.generate(input_tokens['input_ids'].cuda(), max_new_tokens=20,use_cache=True,return_dict_in_generate=True)
output = model.tokenizer.decode(generation_output.sequences[0])
print(output)

53AI，企业落地大模型首选服务商

产品：场景落地咨询+大模型应用平台+行业解决方案

承诺：免费POC验证，效果达标后再合作。零风险落地应用大模型，已交付160+中大型企业

相关资讯

2025-12-17

llama.cpp Server 引入路由模式：多模型热切换与进程隔离机制详解

2025-12-17

小米MiMo-V2-Flash开源：3090亿参数大模型能否改写AI行业规则!

2025-12-17

ollama v0.13.4 发布——全新模型与性能优化详解

2025-12-17

n8n 悄悄发布了 v2.1.

2025-12-16

阿里重磅开源 0.5B TTS + 0.8B ASR，支持跨语种音色克隆、说唱识别！

2025-12-15

智谱手机 Agent 开源一周，iOS 版就来了

2025-12-15

OpenEvals下一代AI模型评估标准

2025-12-15

AutoGLM：推倒那面墙

了解更多

了解更多

160+中大型企业正在使用53AI

立即咨询预约演示

把握AI发展的机遇，共同探索、共同进步

2025-01-22

如何打造基于GenAI的员工服务机器人

2025-01-22

热点资讯

DeepSeek又开源，这次是OCR模型！附论文解读！

2025-10-20

全新AI编程工具 Google Antigravity 实测，特别适合产品经理

2025-11-19

发现一个超神的Github开源OCR项目，国产多模态杀疯了

2025-10-27

MiniMax悄悄发布M2，8%价格打出Claude级性能

2025-10-27

如愿以偿！Qwen3-VL再开源30B-A3B，附实测！

2025-10-03

DeepSeek-V3.2背后的国产算子编程语言TileLang是什么？如何保持性能领先的同时减少6倍代码量？

2025-09-29

n8n如何调用最近爆火的deepseek OCR？

2025-10-29

让白宫“破防”的阿里千问，我替你们测了...

2025-11-17

DeepSeek-V3.2-Exp开源，附论文细节解读！

2025-09-29

最强开源0.9B级OCR模型！PaddleOCR-VL本地一键部署，私密性拉满【喂饭级教程】

2025-11-07

大家都在问

我们为什么选择 Spring AI 开发智能体，而不是 Dify？

2025-11-12

开源安全审核模型终极PK：Qwen3Guard、OpenAI-SafeGuard、Llama4-Guard谁才是王者？

2025-11-10

DeepSeek-OCR到底厉害在哪？

2025-11-03

n8n如何调用最近爆火的deepseek OCR？

2025-10-29

小红书入局AI智能体开源DeepAgent，在计划什么更新？

2025-10-28

埃森哲的大裁员，向市场发出了什么信号？

2025-10-13

DeepSeek-V3.2背后的国产算子编程语言TileLang是什么？如何保持性能领先的同时减少6倍代码量？

2025-09-29

Qwen3-Next 首测！Qwen3.5的预览版？但为什么我的测试一塌糊涂？

2025-09-17

热门标签

内容创作大模型技术个人提效 langchain llamaindex 多模态技术 RAG技术智能客服知识图谱模型微调 RAGFlow coze Dify Fastgpt Bisheng Qanything AI+汽车 AI+金融 AI+工业 AI+培训 AI+SaaS 提示词框架提示词技巧 AI+电商 AI面试数字员工 ChatBI AI知识库开源大模型智能营销智能硬件智能化改造 AI+医疗 MaxKB

应聘简历请发送至： ceo@53ai.com

联系我们

售前咨询

预约演示

微信扫码

添加专属顾问

回到顶部