上海七月的酷热难耐,正如第67届国际数学奥林匹克刚刚落下帷幕时的热烈气氛。中国队以232分的高分再次夺冠,三名少年更是斩获42分的满分。然而,就在人类欢呼的掌声尚未散去时,GitHub上悄然浮现出另一份令人咋舌的成绩单。前Google工程师Deedy Das发布了一场AI横评:七款前沿大模型在全自动化的框架下,独立挑战了IMO 2026的全部六道试题。结果令人震惊:四股势力——Claude Fable 5、GPT-5.6 Sol、Kimi K3以及独立运行的AxiomProver——全部拿下满分42分。
**亮眼的成绩单**
Claude Fable 5用时2.5小时,烧掉51美元;GPT-5.6 Sol耗时3.8小时,成本压至20美元;Kimi K3则鏖战17.4小时,花费31美元。作为参照,过去七届IMO中,共有4347名人类选手参赛,仅有30人拿过满分,比例仅为0.69%。
从结果来看,三个满分模型登顶的姿态截然不同。Claude Fable 5打得干净利落,仅用9轮对话便完成6轮有效输出,全程输出70万token;GPT-5.6 Sol虽在P2题上因网络故障中断两次,显得有些坎坷,但总输出仅23万token,是三个满分模型中算力消耗最少的;Kimi K3则像一头不知疲倦的巨兽,拥有2.8万亿参数的MoE架构,一口气喷涌出154万token,是Sol的6.5倍,仅P3一道题就耗时近9小时。
**数学直觉的正面交锋**
P1是全场最温和的开胃菜。题目涉及黑板上的数字操作:将两个数m和n替换为gcd(m,n)和lcm(m,n)/gcd(m,n),最终证明过程必然终止且结果唯一。为了理解这道题,我们可以用12和18作为例子。经过操作,最终结果恒为6。其核心在于素因子守恒。所有模型殊途同归,都证明了每个素数p的幂次在操作中保持不变。
在证明方法上,模型展现了不同的解题路径。
Claude Fable 5独创了一个计数器Phi = T + N。T是黑板上所有数的素因子个数之和(重复计),N是大于1的数的个数。它证明了每一步操作中,Phi至少减少1,从而确保过程终止。
GPT-5.6 Sol则采用追踪乘积的方法,定义了乘积P和大于1的数的个数K。通过字典序降维,证明了(P,K)这一二元组在每一步都严格递减,从而推导出终止性。
到了(b)部分,三个模型殊途同归:都证明了对每个素数p,黑板上所有数被p整除次数的最大公约数在操作中不变。最终公式也是一模一样。
**全场最廉价的白卷**
P6是Day 2的压轴题,要求证明递推序列具有周期性。去年全球仅有6名人类解出此题。在AI的角逐中,Claude Fable 5仅用26分钟两轮便满分通过;GPT-5.6 Sol耗时60分钟;Kimi K3则耗时381分钟,四轮提交才完成。相比之下,Grok 4.5仅输出7053个token便草草收场,提交文件中赫然写着“Full proof: Not yet complete”,成本仅0.18美元。
Grok的毛病不止于此。整个测试中它反复陷入一种诡异的幻觉:信誓旦旦地声称“证明已经写入文件”,后台却连写入工具都没碰一下。这不是数学能力问题,是Agent能力问题。模型知道应该写文件,也声称自己写了,但在工具调用层面没有动手。
**三年三级跳,硅基大脑的恐怖进化**
回溯三年,AI在IMO的进化可谓三级跳。2024年DeepMind的AlphaProof首次摸到银牌门槛;2025年OpenAI与DeepMind联手,OpenAI未公开模型已解5题,Gemini Deep Think达到同等段位;2026年,通用大模型直接拿下满分。更值得一提的是,这场测试的起点源自一家名为Axiom Math的公司。他们将IMO 2026试题翻译成Lean 4形式化语言,搭建全自动测试框架。其创始人洪乐彤年仅25岁,毕业于MIT数学与物理双学位,是Morgan Prize得主。她打造的AxiomProver已拿下Putnam竞赛满分,公司估值更是飙升至16亿美元。
**普通人的生活将被如何重构**
能写出4229行严格证明的模型,其意义远超解数学题。它掌控的是长链条逻辑推导,每一步都不能跳、不能错、不能含糊。
无论是合同条款、保险理赔还是税务合规,剥开表象后都是同一类问题:答案不能“差不多”。过去这种精细核验仅限于专业人士,按小时计费。如今,随着这一能力融入消费级产品,普通人只需打开手机,便能应对棘手问题。
