7月21日消息,第 67 届国际数学奥林匹克(IMO)在上海落幕当天,Menlo Ventures 合伙人 Deedy Das 在社交媒体发布了多款 AI 模型在本届 IMO 真题上的独立测试结果。据其数据,Anthropic 的 Claude Fable 5、OpenAI 的 GPT-5.6 Sol(xhigh 档位)和月之暗面的 Kimi K3 三款模型均在全部六道证明题上取得满分 42/42。形式化定理证明器 AxiomProver 也完成了全部六题的 Lean 4 机器验证证明。作为对照,2020-2026 年七届 IMO 共有 4347 名人类选手参赛,其中仅 30 人取得满分,占比 0.69%。一年前的 2025 年 IMO,AI 模型刚首次达到金牌水平(35/42,解出五题中的五题但第六题零分),今年直接跳到满分。这些结果均为模型在公开题目上的独立运行,不是 IMO 官方评判的参赛成绩,且部分模型在单题上使用了多次尝试。
Claude Fable 5 六题均一次通过,GPT-5.6 Sol 成本最低
据 Deedy Das 发布的数据,Claude Fable 5 是唯一在全部六题上均以单次尝试通过的模型,总耗时约 2.5 小时(实际求解时间约 1.8 小时),总成本约 51 美元。GPT-5.6 Sol(xhigh 档位)总耗时约 3.8 小时,成本约 21 美元,是三款满分模型中最便宜的,但在 P2 上需要第二次尝试。Kimi K3 总耗时显著更长(约 17.4 小时),成本约 31 美元,在 P3 上需要四次尝试才通过,输出 Token 量约为 Claude Fable 5 的二十倍以上。
人类选手有两天共 9 小时的考试时间(每天 4.5 小时解三道题)。Claude Fable 5 和 GPT-5.6 Sol 均在 4 小时内完成全部六题,不到人类赛时的一半。
同一测试中,GPT-5.6 Sol 的默认档位只拿到 28/42,Meta Muse Spark 1.1 拿到 26/42,xAI Grok 4.5 拿到 13/42。满分不是每款前沿模型都能达到的结果,它取决于模型的推理能力上限和推理时的算力投入档位。 从单题难度看,P3 和 P6 是最难的两道题,其次是 P2。Claude Fable 5 在 P6 上花了 150 分钟(仍为一次通过),GPT-5.6 Sol 在 P6 花了 231 分钟,Kimi K3 在 P3 上花了 491 分钟且需要四次尝试。这一难度分布与 IMO 传统一致:Day 1 的第三题和 Day 2 的第三题通常是全场最难的题目。
从银牌到满分:三年跨越四个台阶
AI 在 IMO 上的表现正以年为单位刷新纪录。2024 年,Google DeepMind 的 AlphaProof 和 AlphaGeometry 2 联合系统拿到 28/42(银牌水平),但需要人工将题目翻译成形式化语言,且求解时间超出 4.5 小时赛时限制。2025 年,Google DeepMind 的 Gemini Deep Think 和 OpenAI 的一款实验性推理模型——两者均为未公开发布的内部版本——各自拿到 35/42(金牌水平),均在 4.5 小时内以自然语言端到端完成。据 Reuters 报道,Gemini Deep Think 的成绩经 IMO 官方评委认证。两者都在最难的第六题上拿了零分。据 Gary Marcus 当年的分析,2025 年 IMO 的 P6 仅有 5 名人类选手(总计 630 人)拿到满分。 2026 年的变化在于最后那道"最难的题"被解出了。28/42 → 35/42 → 42/42 的跨越分别只用了一年时间。且 2026 年取得满分的不再是各实验室的未公开实验模型,而是三款已上线可调用的商用产品。
AxiomProver 提供了另一个维度:机器可验证的形式化证明
与通用大语言模型给出自然语言解答不同,Axiom Math 开发的 AxiomProver 是一个基于 Lean 4 的自主多智能体定理证明器。据其 GitHub 仓库(AxiomMath/IMO2026),AxiomProver 将全部六题转化为形式化陈述并生成了完整证明,代码可通过 Lean 编译器和 Axiom 的 AXLE 验证引擎独立验证。
Q3 是 AxiomProver 耗时最长的题目(869 分钟,4229 行 Lean 代码),Q1 最快(24 分钟,521 行)。AxiomProver 此前已在 2025 年 Putnam 竞赛上解出全部 12 题,并在 2026 年初声称解决了四个此前未解的数学猜想。形式化证明的意义在于其正确性是机器可验证的,不依赖人工评判。但 AxiomProver 的求解时间远超赛时限制(Q3 单题近 15 小时),它解决的是"能不能证"而非"能不能在赛时内证"的问题。
多次尝试、利益关联和非官方性质:这些满分的含义边界
这些结果需要在三个层面上谨慎解读。
首先是测试性质。Deedy Das 的测试是在 IMO 题目公开后用 API 独立运行模型的结果,不是 IMO 官方组织的参赛或评判。IMO 官方不验证 AI 参赛成绩,官方成绩仅针对人类选手。2025 年 Google DeepMind 的成绩之所以被广泛认可,是因为经过 IMO 官方评委的逐题评分认证。今年的测试没有经过这一流程。
其次是尝试次数。人类选手在 IMO 赛场上每道题只有一次机会,没有"重试"。在 Deedy Das 的测试中,模型在单题上允许多次尝试。Claude Fable 5 的六题均为一次通过,但 Kimi K3 在 P3 上尝试了四次。"多次尝试后满分"和"一次通过满分"代表着不同水平的能力确认。
第三是测试者的利益关联。Deedy Das 是 Menlo Ventures 合伙人,该基金是 Anthropic 的早期投资方之一,并与 Anthropic 共同运营 1 亿美元的 Anthology Fund。Deedy Das 同时领投了 OpenRouter。这不意味着数据不可靠——测试方法和结果是公开的,其他人可以复现——但在评估"Claude Fable 5 表现最优"这一结论时,应注意测试者与模型厂商之间的财务关联。 数学竞赛作为 AI 基准正在触及天花板
IMO 满分的达成不等于 AI 的数学能力"超越"了人类数学家。IMO 题目是有标准答案的竞赛题,属于"验证容易、求解难"的类型,与开放性数学研究的本质不同。但作为衡量 AI 推理能力的基准,IMO 的区分度正在快速消失。2024 年还只有一个联合系统勉强拿到银牌,2026 年已有三款通用模型和一个专用证明器达到满分。GPT-5.6 Sol 的默认档位就拿到了 28/42——与 2024 年全年最好的 AI 成绩持平——这说明曾经的"里程碑级表现"已经成为前沿模型的基础能力。
后续最值得观察的是两件事:是否有模型方将 2026 年的结果提交 IMO 官方评委认证(如 2025 年 Google DeepMind 所做的那样),以及社区是否能在单次尝试、赛时限制内独立复现这些满分结果。如果多个独立测试者在受控条件下确认满分,"AI 首次完全攻克 IMO"这一定性将成立。在此之前,它仍然是一个高度可信但尚待最终确认的里程碑。