7月24日消息,据《微信 AI 》公众号搜一搜 AI 问答已用 WeLM-V4 后训练版本承接全部线上流量。原生助手「小微」自 6 月起小范围灰度,主模型同样是 WeLM,复杂任务常调 DeepSeek 兜底。WeLM的目标是在微信生态里把成本、延迟和可控性压到能扛亿级调用。
此外,7月22日清华与微信团队公开 DynamicRubric 论文(arXiv: 2607.20083),今年以来团队密集公开自研大模型 WeLM 的技术路径,并把能力边界推到用户可感知的产品层。
WeLM :一条为微信场景定制的模型线
微信 AI 长期覆盖语音识别与合成、自然语言处理、计算机视觉和工业级推荐,能力落在微信翻译、视频号、看一看、微信读书、输入法、搜一搜等业务,并外溢到王者荣耀、腾讯视频、QQ 音乐等产品。大模型阶段,团队走出的是另一条线:2022 年前后起步的 WeLM,经多代迭代到以稀疏 MoE 为主的 V4,当前生产侧常被点名的基座是 WeLM-V4-80B-A3B,约 80B 总参数、约 3B 激活。技术博客称,该系列在不足约 14T tokens 的语料上训练,并配合 KV-Mirror、多 Token 预测等工程手段,优先压低单次推理成本。
定位上,WeLM 偏微信内专用。小微产品自述与多家媒体实测都指向同一分工:日常生态交互走 WeLM,长尾硬推理由外部模型补充。这解释了为何微信最显眼的 AI 入口没有默认挂混元。
2026 年公开加速:从稀疏 MoE 到 Hidden Decoding
今年以来,WeLM 官方博客连续放出预训练、后训练与 scaling 方法。1 月复盘以适度资源构建高效稀疏 MoE,并以 WeLM-V3-258B-A22B 为例谈后训练;3 月提出 Hidden Decoding,在不增加 Transformer 主体参数的前提下,沿序列维扩展有效计算;7 月进一步写到 Hidden Decoding at Scale,训练出 WeLM-HD4-80B 与 WeLM-HD4-617B,称在完全对齐对照下超过各自自回归基线,并借助 Stream-Factorized Attention 把扩展开销压到可训、可服务区间。这些结果多为团队自测与早期 SFT-only 设定,不宜直接读成对外部前沿模型的全面胜负,但方向清楚:在参数与激活预算受限时,继续找“不算主干参数、仍能抬能力”的扩展轴。
后训练侧,清华与微信团队公开 DynamicRubric:让策略模型与评价体系共同进化,避免强模型阶段评价分差塌缩。论文称,基于 WeLM-V4-80B-A3B 的版本已在搜一搜 AI 问答全量上线,日请求量级达数千万;相对同基座上一代生产模型,总搜索量、用户时长和正向用户行为等指标取得统计显著提升。
场景分成两层:底座能力与对话入口
第一层是已经铺进业务的能力面:翻译与同声传译、语音输入、内容分发与推荐、搜索与阅读辅助。用户未必看到 WeLM 品牌,但微信 AI 的能力早在这些模块里运转。
第二层是 2026 年才真正露脸的对话入口。搜一搜 AI 问答让用户在顶部搜索框直接提问,是目前可核验的 WeLM 全量生产场景,也是 DynamicRubric 的落地证明。小微则更接近原生 Agent:发消息、打电话、调设置、总结群聊与朋友圈、在公众号和视频号里追问内容,并尝试调起小程序完成挂号、外卖、打车等服务。实测报道显示,支付、代发朋友圈等动作仍有明确边界,灰度痕迹明显。对开发者,微信也在推进 AI 生态接入指引,方向是自然语言调度小程序与服务,而不只是聊天框问答。
真正的变量是调用经济学,不是榜单名次
容易误读的地方,是把 WeLM 写成“腾讯又一个追榜模型”。公开技术选择更接近另一套约束:十亿级日活下,单次推理成本与延迟决定产品能否全量;微信数据与链路可控,决定模型必须留在微信体系内。稀疏激活、Hidden Decoding、共同进化后训练,都服务于同一问题:如何在可承受的成本下持续变好。需要克制的是,小微仍在灰度,能力边界随版本变化;HD 系列评测与 DynamicRubric 线上涨幅均缺少完整第三方复现;WeLM 与混元是否更深整合,公开材料也未给出时间表。
接下来要看小微何时全量,以及 WeLM 能否走出搜一搜
短期观察点是小微从灰度到更大流量的节奏,以及它在小程序调度、支付闭环上的真实完成度。中期看 WeLM 是否从搜一搜问答扩展到更多高频入口,HD 变体是否进入生产配方。对行业而言,若这条“生态专用、成本优先”的路线在微信里跑通,意义不在多一个开源权重,而在证明:超大规模消费级 App 可以不靠对外通用模型,也能把自研栈做成可迭代的生产基础设施。