微信扫码
添加专属顾问
微信Agent「小微」如何用低成本实现十亿级用户覆盖?答案在于精准的工程判断与场景化模型设计。 核心内容: 1. 破除AI成本误区:任务复杂度决定模型选择,并非越强越好 2. WeLM模型定位:为微信生态定制,专注低延迟、长上下文与极致成本控制 3. Hidden Decoding技术:内部推理提升质量,外部直接输出保障体验
作者按:这篇文章试图回答一个具体问题——微信把 AI 助手铺开到十亿用户量级,这笔推理成本在商业上是否站得住脚。答案不只是"能"或"不能",而是要搞清楚它为什么能,以及这个方案背后有什么真实代价。
讨论 AI 成本,很多人下意识往最强模型上靠——似乎不用 GPT-5.5、不用 Claude Code 就算"凑合",用了才算认真。这个直觉在研究场景里可能没错,但放到产品部署里,就容易出问题。
现实中,任务本身的复杂度差异极大。查快递单号、询问今日天气、让 AI 帮忙拟一句回复,这类请求对模型能力的要求,跟"帮我做一套完整的财务分析报告"完全不在同一个量级。前者不需要大脑,后者才需要。人类社会里,公司不会让首席分析师去接前台电话;模型调度也一样,用什么模型干什么活,本身就是一个工程判断问题,不是"谁强用谁"。
微信 Agent 的技术路线,正是建立在这个判断上的。
WeLM 不是通用大模型,它是腾讯专门为微信生态打造的模型,设计目标很明确:低延迟、低成本、在微信场景下准确理解用户意图。它不对外开放,不参与通用模型的能力评测排行,也不打算跟 GPT 或 Claude 卷谁的推理更强。
这个定位听起来像妥协,但实际上是个清醒的工程选择。
场景决定需求。 微信里的 AI 交互有几个特殊约束,别的产品不一定有:
第一,用户在微信里不接受等待。 你可以忍受 Perplexity 或者 WorkBuddy 处理复杂问题时转几秒,但如果微信的"小微"回复你一条消息要思考 8 秒,体验就崩了。这不是主观感受问题,是微信作为即时通讯产品的产品基线。
第二,微信天然是长上下文场景。 群聊历史、朋友圈动态、公众号收藏、好友对话记录——用户问小微"帮我总结一下最近群里讨论了什么",这个上下文是自动存在的,不需要用户去上传、授权或者手动喂材料。通用模型要做到这点,需要接外部工具;WeLM 生长在这个环境里,上下文已经是它的一部分。
第三,微信的日活决定了成本敏感性没有上限。 日活超 10 亿,AI 功能如果全量开放,每天的推理请求量是天文数字。单次成本哪怕高出一点点,乘以量级之后账就完全不同了。
WeLM V4 的架构选择,是混合专家(MoE),总参数 80B,但每次推理实际激活的参数量约 3B。这个数字是理解整个成本结构的关键。
大模型的推理质量通常跟"思考过程"正相关——让模型把中间步骤展示出来(Chain-of-Thought),答案往往更准。但展示思考过程有两个成本:时间成本和 token 成本。在微信场景里,这两个成本都是不可接受的。
WeLM 的解法叫 Hidden Decoding:模型在内部走推理过程,但不把这个过程呈现给用户,用户看到的是直接输出的结果。
这个设计的取舍值得说清楚:Hidden Decoding 不是"不推理",它是"推理但不展示"。它保留了一部分推理质量的提升,同时把用户侧的等待时间压缩下来。代价是,推理过程本身的深度受到约束——如果一道题真的需要很长的思维链才能做对,Hidden Decoding 的收益是有天花板的。
这也是为什么需要 DeepSeek 来兜底——后文会讲。
MoE 架构的推理成本,业内通常用激活参数量作为粗略标尺:模型每次推理时实际用到多少参数,大致决定了算力消耗。WeLM V4 的激活参数约 3B,对比几个主要模型:
| 模型 | 激活参数/Token | 相对 WeLM V4 的成本倍数 |
|---|---|---|
| WeLM V4(小微主力模型) | ~3B | 基准 = 1× |
| WeLM V3(上代版本) | ~22B | ≈ 7× |
| 腾讯混元 Hy3 Preview | ~21B | ≈ 7× |
| DeepSeek V4 Flash | ~13B | ≈ 4.3× |
| DeepSeek V3 / V4 Pro | ~37B–49B | ≈ 12–16× |
注:MoE 模型的显存占用取决于总参数(需要加载所有专家权重),但推理算力消耗和实际吞吐主要由激活参数决定。WeLM V4 的 80B 总参数,比 DeepSeek-V3 的 671B 小得多,所以显存压力也更低。
换一个角度看:同样一批 GPU,WeLM V4 能撑起的并发请求量,大约是混元 Hy3 的 7 倍,是 DeepSeek V4 Flash 的 40 倍以上。
对于一个日活十亿的产品,这个差距不是性能参数,是账单的数量级差距。
前面说到 WeLM 在复杂推理上有天花板,小微的方案是:对这部分任务,路由给 DeepSeek 做兜底。
这个决策值得多想一层。
为什么选 DeepSeek? 首先是能力。DeepSeek 系列在长文本、复杂推理任务上的表现有目共睹,放在国内模型里算第一梯队。其次是成本——这一点经常被忽略。
DeepSeek 自身的推理成本,在业内就是出了名的低。DeepSeek-V3 在发布时,API 定价相比同期主流模型低了一到两个数量级;DeepSeek-R1 的推理成本,比 OpenAI o1 便宜了约 96%。DeepSeek 的成本优势来自两个地方:一是 MoE 架构的稀疏激活;二是工程层面对 KV Cache 和并行推理的深度优化,使得单位算力能处理的 token 量远高于同代产品。
也就是说,小微在兜底这条路上,选的是"本身就是成本杀手"的模型。用 DeepSeek 做兜底,不是无奈之举,而是在接受更高单次成本的同时,把这个成本控制在业内已知最低的那个方案上。
频率控制是关键变量。 兜底逻辑能不能成立,核心要看有多少比例的请求会真正触发 DeepSeek。如果 80% 的请求都走 DeepSeek,那整体成本还是起来了。WeLM 的路由设计是:简单意图(占绝大多数)走 WeLM,只有长文本、多轮深度推理、需要较强外部知识整合的场景,才上 DeepSeek。从日常微信使用场景的分布来看,真正属于"复杂推理"的请求,在全量请求中占比应该是少数——大多数用户和小微的交互,还是停留在信息查询、内容摘要、简单问答这些层面。
当然,这个比例的实际数字,腾讯内部有准确监控,外部无从得知。这也是整个成本分析里不确定性最大的部分。
上面的分析总体上支持"成本可控"的判断,但有几个地方值得留意,不应该被乐观情绪遮掉。
用户行为的漂移。 随着小微功能的推广,用户的使用习惯会变。早期用户可能只是"试试",后期深度用户可能真的把小微当工作工具用,拿来做复杂文档分析、跨多轮对话的推理任务。如果这类用户比例增长,DeepSeek 路由的触发频率也会随之上升,整体成本结构会改变。这不是假设,是用户增长的一般规律。
WeLM 能力边界带来的体验风险。 WeLM V4 在简单任务上够用,但"够用"本身是一个会随时间变化的标准。今天用户觉得"回答质量可接受",六个月后,当他们用过更强的模型之后,标准会拉高。届时 WeLM 处理的任务范围可能需要收窄,或者 WeLM 本身要迭代。这不是威胁,但是个需要持续投入的成本。
路由判断本身的失误成本。 一个任务该走 WeLM 还是 DeepSeek,这个判断本身有出错的概率。如果路由系统把一个需要 DeepSeek 的请求错判给了 WeLM,用户得到的是质量不达标的回答,体验受损;如果反过来,把本该 WeLM 处理的任务路由给了 DeepSeek,成本就白白高了一截。路由准确率是这套混合系统的隐性成本中心。
微信 Agent 的成本方案,逻辑上是自洽的。核心思路是:用激活参数极低的专属模型(WeLM V4)处理绝大多数请求,用 Hidden Decoding 在不牺牲用户体验的前提下压缩推理延迟,再用 DeepSeek 这个业内成本最低的强模型处理真正复杂的少数情况。
这个方案不是"便宜没好货",也不是"能力打折换来的低成本"。它是基于微信场景特性,对任务分布做了正确判断之后的一个工程结论——大多数任务不需要最强的模型,那就不用最强的,把钱省在该省的地方,把能力留给真正用得上的地方。
更值得注意的一点:这套方案的核心竞争力不在于 WeLM 本身有多强,而在于它扎根微信生态的信息优势——群聊、朋友圈、收藏夹这些上下文,是任何外部模型接入都无法轻易复制的,而这恰好是准确理解用户意图的关键。
成本可控,但前提是用户的使用深度不要大幅偏离当前假设,路由系统足够准确,WeLM 的迭代跟得上用户预期的变化。这三个条件目前基本成立,未来是否持续成立,要看产品和技术团队的持续投入。
53AI,企业落地大模型首选服务商
产品:场景落地咨询+大模型应用平台+行业解决方案
承诺:免费POC验证,效果达标后再合作。零风险落地应用大模型,已交付160+中大型企业
2026-08-19
爆火插件让DeepSeek V4 Pro 0813性能拉满,全面超越 Fable 5!
2026-08-18
迈向生产级 AgenticOps:STAROps 如何构建可泛化的根因定位能力
2026-08-18
DeepSeek Harness 能力 Seams 全景:可替换能力清单与三角色
2026-08-18
让 Coding Agent 开始「记住过去」:MemoraX Code 的长期记忆系统
2026-08-18
1M的AI生命 - 解读context
2026-08-17
研究了 DeepSeek Harness 之后,我发现它是冲着干翻 VS Code 来的
2026-08-17
软件僵死,Harness is alive
2026-08-17
DeepSeek 做 Harness → WorkBuddy 的窗口期还能有多久?
2026-06-04
2026-06-10
2026-05-21
2026-05-28
2026-06-22
2026-05-21
2026-05-28
2026-05-27
2026-06-12
2026-06-07
2026-08-17
2026-08-13
2026-08-13
2026-08-06
2026-08-05
2026-08-05
2026-07-31
2026-07-30
欢迎您使用【53AI 官方网站】(以下简称“本网站”或“我们”)。本《会员服务协议》(以下简称“本协议”)是您(以下简称“会员”或“用户”)与【深圳市博思协创网络科技有限公司】之间关于注册、登录及使用本网站会员服务所订立的法律协议。
在您注册或登录前,请务必审慎阅读、充分理解各条款内容,特别是免除或限制责任的条款、知识产权条款、争议解决条款等。此类条款将以加粗形式提示您注意。 当您通过微信公众号授权、手机验证码验证或其他方式成功登录本网站时,即视为您已完全理解并同意接受本协议的全部内容。
一、 定义
本网站:指由【深圳市博思协创网络科技有限公司】运营的,域名为【53ai.com】的网站及相关移动端页面。
会员服务:指本网站向注册会员提供的知识库文章查阅、内容检索及其他相关增值服务。
知识库内容:指本网站发布的包括但不限于文字、图表、数据、研究报告、行业分析等数字化内容资源。
二、 账号注册与登录
登录方式:本网站支持以下登录方式,您可根据实际情况选择:
微信公众号授权登录:您同意将您的微信OpenID信息授权给本网站,用于创建或关联会员账号。
手机验证码登录:您需提供真实有效的手机号码,并通过短信验证码完成身份验证与登录/注册。
账号安全:您的账号仅限您本人使用,禁止赠与、借用、租用、转让或售卖。因您保管不善导致的账号被盗、密码泄露等损失,由您自行承担。
实名认证:根据相关法律法规要求,我们可能要求您在特定功能下完成实名认证。如您拒绝提供,可能无法使用部分或全部服务。
未成年人保护:若您未满18周岁,请在法定监护人的陪同下阅读本协议,并在征得监护人同意后使用本服务。
三、 服务内容与规范
知识库查阅权限:会员登录后,有权按照其会员等级对应的权限范围,在线浏览、检索本网站知识库中的相关文章及内容。
服务变更:我们有权根据业务发展需要,调整、变更或终止部分服务内容,并将以网站公告、公众号消息等方式提前通知。
禁止行为:您在使用服务时不得实施以下行为:
利用技术手段批量爬取、下载、转存知识库内容;
将知识库内容用于商业目的或未经授权地向第三方传播;
干扰本网站正常运行或侵犯其他用户合法权益;
发布违法违规信息或从事违反公序良俗的活动。
四、 知识产权声明
权利归属:本网站知识库中的排版设计、软件代码等内容的知识产权均归【公司全称】或原权利人所有,受《中华人民共和国著作权法》等法律保护。
有限许可:本网站授予会员一项非独占、不可转让、不可转授权的普通许可,仅限于个人学习、研究之目的在线查阅知识库内容。
侵权追责:未经书面许可,任何单位或个人不得以任何形式复制、转载、摘编、镜像、汇编或以其他方式使用上述内容。一经发现,我们保留追究其法律责任的权利。
五、 个人信息保护
我们重视对您个人信息的保护。关于我们如何收集、使用、存储和保护您的个人信息,请单独阅读 《隐私政策》。
您通过微信公众号授权或手机号验证所提供的信息,我们将严格按照《个人信息保护法》的规定处理,仅用于身份识别、服务提供及安全验证等必要用途。
您可以随时通过网站设置或联系客服行使查阅、更正、删除个人信息及撤回授权同意的权利。
六、 免责声明
内容准确性:知识库内容仅供参考,不构成专业建议。我们不对其完整性、准确性、时效性作任何明示或暗示的保证,您应自行判断并承担使用风险。
不可抗力:因自然灾害、政策法规变化、网络故障、第三方平台接口异常(如微信接口维护、运营商短信通道故障)等不可抗力导致的服务中断或延迟,我们不承担违约责任。
第三方链接:本网站可能包含指向第三方网站的链接,该等网站的内容和服务不受我们控制,请您自行甄别风险。
七、 违约责任
如您违反本协议约定,我们有权视情节采取警告、限制功能、暂停服务、注销账号等措施,并保留要求赔偿损失的权利。
如因您的违约行为导致我们遭受行政处罚、第三方索赔或商誉损失,您应承担全部赔偿责任(包括但不限于罚款、赔偿金、律师费、公证费等)。
八、 法律适用与争议解决
本协议的订立、执行和解释均适用中华人民共和国大陆地区法律。
因本协议产生的或与本协议有关的任何争议,双方应友好协商解决;协商不成的,任何一方均可向【公司所在地】有管辖权的人民法院提起诉讼。
九、 其他
本协议构成双方就本服务达成的完整协议,取代此前任何口头或书面约定。
本协议任一条款被认定为无效或不可执行的,不影响其他条款的效力。
我们对本协议享有最终解释权,并在法律允许的范围内保留随时修改的权利。修改后的协议一经公布即生效,继续使用服务即视为同意修订内容。