7月9日消息,Cognition 发布迄今训练过的最强模型 SWE-1.7,并称其以更低成本接近前沿智能,推动成本—性能帕累托边界。官方称,该模型以已经过多轮强化学习后训练的 Kimi K2.7 为基座,再叠加 Cognition 自有 RL 流程,并直接在 Devin 环境中训练长周期异步任务。SWE-1.7 已在 Devin 的 Web、桌面与 CLI 上线,经 Cerebras 部署,推理速度达每秒 1000 Token。公司同步给出的商业数字是:在自建 FrontierCode Main 上,单任务成本约 1.97 美元。评测与成本数字均来自官方自述,第三方独立复测尚未出现。
分数接近前沿,官方强调的是单位成本
在 Cognition 自建的 FrontierCode 1.1 Main 上,SWE-1.7 通过率为 42.3%,高于基座 Kimi K2.7 Code 的 30.1%,接近 GPT-5.5 的 43.0%,仍低于 Claude Opus 4.8 的 46.5%。Terminal-Bench 2.1 上为 81.5%,SWE-Bench Multilingual 上为 77.8%。相较上一代 SWE-1.6 的 9.4%、39.7% 与 58.3%,提升幅度很大。
这组结果的含义很直接。SWE-1.7 并没有宣称全面超越最强闭源模型,而是把竞争点放在“差几个点、便宜一个量级”的可部署区间。对 Devin 这类按任务消耗计费的编程代理产品,单位成本比榜首分数更决定规模化能力。评测方法上,官方称所有模型均在最大推理力度下测试;Terminal-Bench 使用内部框架,Anthropic 模型走 Claude Code、OpenAI 模型走 Codex、其余走 Devin CLI,超时时间为 4 小时;SWE-Bench Multilingual 在有自评时采用自评,否则用 Devin CLI 复测。 训练故事的核心,是“后训练还有空间”
Cognition 明确挑战一个流行判断:开源基座在充分后训练后,继续做 RL 的收益会迅速见顶。SWE-1.7 的基座 Kimi K2.7 本身已经过多轮 RL,但官方称自有训练仍带来大幅增益。技术路径被概括为四块。
第一是训练稳定性。长周期异步 RL 容易遇到熵崩塌,以及训练与推理之间的数值漂移。团队用 top-p 采样抑制低概率坏轨迹,再用采样分布回放把 rollout 时的 keep-set 掩码送回 trainer 重归一化,使熵大致保持稳定、训练—推理分歧受控;同时采用 Muon 优化器,并尽量消除 trainer 中的非确定性操作。
第二是多集群训练。官方称 RL 天然适合拆分:trainer 需要高带宽单集群,rollout 推理引擎则可分布各地。SWE-1.7 的训练跨越三大洲四个数据中心,自有 GPU 之外还接入 Fireworks 等推理算力;权重更新不传全量,而是每隔若干步发送压缩后的权重增量,传输量可降逾 99%。对约 1T 参数模型,跨洲权重更新端到端约 1 到 2 分钟,推理侧仅短暂暂停约 3 到 4 秒。故障容忍上,推理节点挂掉只损失在途会话;trainer 节点则靠本地逐步检查点与分片复制,在秒级重建状态。
第三是数据质量。官方强调 verifier 的假阳性与假阴性都会污染学习信号,因此用自动执行测试筛题,保留模型只能解出较低比例的难题,并限制沙箱联网、剥离 git 历史与参考产物、隔离评分路径;一旦检测到作弊尝试,无论是否成功,轨迹奖励一律记为 0。
第四是面向长周期任务的自压缩。当 agent 接近上下文上限时,模型先总结工作状态,再从自写摘要恢复;训练中同时学习“写更好的摘要”和“更好地使用摘要”。配合交替长度惩罚——无约束阶段只优化任务成功,预算阶段则惩罚 Token、轮次与工具调用时间超标——官方称训练中的 rollout 最长可达约 6 小时,且简单任务上的回复会更短,困难任务上的长程行为得以保留。
行为变化:更愿意先查,也更容易改多
官方称,经过大量 RL 后,SWE-1.7 的行为与基座 Kimi K2.7 Code 明显不同。配套博文称其对齐与可信度高于 K2.7 及其他前沿开源模型。推理风格上,首段思维链的功能词比例更低,平均句长接近减半,官方将其归因于预算阶段的长度惩罚。与此同时,模型在动手改代码前会做更多工具调用、文件读取与搜索;修 bug 时更倾向追根因、补边界条件、用小脚本探测歧义语义,而不是直接猜测。
代价也被写明。FrontierCode 的理想解法应尽量少动无关文件,但 SWE-1.7 推理变强后,往往会多写测试、多改文件。官方承认这是行业共性,也是后续要压的方向。换句话说,它更像一个更勤快、也更“爱扩 scope”的工程代理,而不是只会贴最小补丁的模型。
真正重要的不是又一个编程模型,而是应用公司开始自训近前沿模型
单独看分数,SWE-1.7 是一次正常的能力升级。放回产业位置看,更值得注意的是:一家以 Devin 产品为中心的应用公司,已经能在开源强基座上继续 RL,并给出接近闭源前沿、但成本显著更低的专用模型。这意味着编程代理竞争,正在从“谁接入最强外部模型”转向“谁能把模型、环境和数据飞轮收拢到自己手里”。
边界同样清楚。FrontierCode 是 Cognition 自建评测,SWE-Bench 系列近期也因任务质量问题受到行业审视;因此不宜把官方数字直接写成“已经追平闭源前沿”。更稳妥的表述是:在官方口径下,它进入了与 GPT-5.5、Opus 4.8 同一讨论区间,且把成本当成主叙事。1.97 美元的单任务成本,也只对应 FrontierCode Main 这一套评测设定,不能直接外推到所有客户仓库。
下一步看真实仓库任务,而不是继续盯着自建榜
后续最该观察的,是 SWE-1.7 在真实、未进入训练分布的仓库任务中,能否维持接近官方榜单的完成率,以及约 1.97 美元量级的单任务成本能否在更长 horizon 下保持。如果成本优势只在自建评测上成立,叙事会很快回落;如果在客户生产环境里也成立,编程代理市场的定价锚点会被继续下移。另一个观察点是改动范围:若模型继续“想得更多、改得更广”,完成率上升未必等于可合并率上升。