7月24日消息,蚂蚁集团 inclusionAI 发布混合推理 MoE 模型 Ling-3.0-flash,总参数 124B、每 token 仅激活 5.1B,支持思考与非思考模式无缝切换,原生上下文 256K、可扩展至 100 万,面向智能体长程工作流。官方称该模型以旗舰 1T 模型约 1/8 的总参数和约 1/12 的激活参数,在其所示的大多数基准测试中与旗舰持平或超越,最高推理速度可达每秒 1000 token。模型目前在 OpenRouter 限时免费至 8 月 3 日,也已上线 Vercel AI Gateway 等渠道,但权重尚未开源——这与蚂蚁百灵系列一贯发布即开源的做法不同。 激活参数压到 5.1B,agent 场景的效率账
Ling-3.0-flash 的核心数字是激活比例:124B 总参数中每个 token 只激活 5.1B,约 4%。作为参照,蚂蚁上一代 Ling-2.6-flash(2026 年 4 月发布)为 104B 总参数、7.4B 激活;再往上,旗舰 Ling-2.6-1T 总参数约 1T、激活约 63B。三个月内,flash 线的激活参数又削掉了约三成。
低价是这一定位的直接结果。第三方渠道给出的定价为输入每百万 token 0.06 美元、输出 0.18 美元。对需要长链推理、多轮工具调用的智能体工作流,激活参数和单价共同决定运行成本,这是该模型瞄准的账。
从迁移式到原生混合线性,还用上了 Kimi 的 KDA
架构上,官方文档称 Ling 3.0 系列"从迁移式混合线性架构走向原生混合线性设计":KDA 与 MLA 层以 5:1 的比例堆叠,KDA 负责对长程记忆的细粒度控制,MoE 部分的专家激活率为 1/64。KDA(Kimi Delta Attention)是月之暗面 2025 年 10 月开源的 Kimi Linear 架构中的核心线性注意力模块,蚂蚁在自家旗舰系列中采用同行提出的模块,说明这一组件已经跨公司复用。
百灵系列的架构演进有清晰的时间线:2025 年 10 月发布首个万亿参数模型 Ling-1T;2026 年 2 月开源首个混合线性架构万亿思考模型 Ring-2.5-1T,采用 1:7 的 MLA 加 Lightning Linear Attention 配比;4 月的 Ling-2.6-flash 把混合线性下放到 104B 档位;本次 Ling-3.0-flash 则是原生混合线性设计的首个产物。
官方演示围绕长链条任务展开
官方发布的演示明显围绕 agent 场景设计。在 Blender MCP 演示中,模型编写 Python 代码搭建包含高架道路和摩天大楼的城市、设定摄像机路径并渲染出航拍视频。多智能体演示中,模型协调科学家、数据分析师、交叉验证员、档案管理员和撰稿人等角色,从形成假设、检索文献到解决分歧,最终产出一篇论文和配套幻灯片。Office MCP 演示覆盖了读取并格式化 Word 提案、用 SUMIF 函数和数据透视表核查 Excel 财务数据、导出成稿的全流程。另一个演示通过 OpenClaw 连接完成日程闭环:检查日历、识别空闲时段、回复选项、发送确认并更新日历。这些演示共同指向的卖点是长链条工具调用的稳定性,而非单次问答质量。
混合注意力正在从可选项变成必答题
Ling-3.0-flash 不是孤立动作。Qwen3-Next 用了 Gated DeltaNet 混合方案,DeepSeek V3.2 引入稀疏注意力 DSA,阿里 Qwen3.5-397B-A17B 与月之暗面 Kimi Linear 在 2026 年 2 月不约而同收敛到 3:1 的线性与全注意力层配比。驱动力很现实:长上下文和 agent 长任务下,全注意力的 KV 缓存和计算开销是硬成本,混合方案可削减约 75% 缓存、在长上下文下带来数倍解码提速。
代价同样有文献支撑。2026 年 2 月的一项理论研究从复杂度上证明,全注意力在表达能力上严格优于混合架构。效率与能力上限的交换是否划算,最终要靠各家的实测数据回答,而不是架构论文。
1T 对标和开源留白,都要等第三方数据
这次发布有两个需要验证的点。一是"持平或超越 1T 旗舰"的官方说法:这一对标只针对自家旗舰,且官方未公布完整基准表,与 Qwen3.5、Kimi 等同档效率模型的横向比较完全缺失,在第三方实测出现之前只能按厂商自述对待。二是开源状态:百灵系列此前的招牌是发布即开源权重,这次 HuggingFace 和 ModelScope 上均无权重页面,只有 API。如果权重长期不放出,说明蚂蚁对这一代模型的策略从生态优先转向了服务优先;如果随后开源,则现在的 API 限时免费只是冷启动。接下来值得看的就是权重是否放出、第三方实测数据,以及 100 万 token 上下文在真实 agent 负载下的可用性。