上海的七月热浪滚滚。第67届国际数学奥林匹克刚刚落下帷幕,中国队以232分的高分摘得桂冠,三名中国少年更是全员拿下42分的满分。然而,现场掌声尚未散去,GitHub上却悄然浮现出另一份令人瞩目的成绩单。前Google工程师Deedy Das发起了一场AI横评:七个前沿大模型全自主挑战IMO 2026的全部6道题目。

结果令人咋舌:Claude Fable 5狂揽42分满分,耗时仅2.5小时,成本51美元;GPT-5.6 Sol的xhigh版本也拿下满分,用时3.8小时,成本仅20美元;Kimi K3紧随其后,耗时17.4小时,花费31美元。再加上独立交卷的AxiomProver,四方势力全部登顶满分。作为参照,过去七届IMO共有4347名人类选手参赛,仅有30人拿到满分,比例仅为0.69%。AI的表现呈现出断层式的碾压。

满分与第四名(28分)之间横亘着14分的鸿沟,而三个满分模型的解题路径也截然不同。Claude Fable 5打得干净利落,9轮对话中6轮有效输出,全程输出70万token,单趟最长耗时73分钟(P3题)。GPT-5.6 Sol则显得有些坎坷,P2题上耗时106分钟跑4轮,中途还因网络故障中断两次,但其算力控制堪称恐怖,总输出仅23万token,是三个满分模型中最省的。Kimi K3则像一头不知疲倦的巨兽,2.8万亿参数的MoE模型一口气喷涌出154万token,是Sol的6.5倍,光P3题就发起6次冲锋,鏖战491分钟。

这是数学直觉的正面交锋。P1题作为全场最温和的开胃菜,所有模型均在几分钟内搞定,人类选手也几乎无一失手。题目大意是:黑板上写着2026个大于1的正整数。每一步,选两个数m和n,擦掉,换上gcd(m,n)和lcm(m,n)/gcd(m,n)。反复操作直到无法继续。证明:过程一定会终止,最终恰好剩一个大于1的数M;以及M的值不依赖于操作顺序。为便于理解,我们先做一个微缩实验:黑板只有12和18。12等于2的平方乘以3,18等于2乘以3的平方。第一步:gcd(12,18)等于6,lcm(12,18)除以6等于6,黑板变成[6,6]。第二步:gcd(6,6)等于6,lcm(6,6)除以6等于1,黑板变成[6,1]。只剩一个大于1的数,游戏终止,M等于6。无论操作顺序如何打乱,M永远是6。为什么?答案藏在素因子里。对每个素数p,取所有数被p整除次数的最大公约数,再把这些素数幂乘起来——这个值从第一步到最后一步都一直不变。

Claude Fable 5直接生造了一个每步必定缩水的计数器。它定义了一个量Phi等于T加N。T是黑板上所有数的素因子个数之和(重复计),N是大于1的数的个数。比如黑板[12,18],12的素因子是2、2、3共3个,18的是2、3、3共3个,T等于6,N等于2,Phi等于8。然后它证明了:每执行一步操作,Phi至少减少1。分两种情况——如果gcd(m,n)大于1,素因子总数T会减少;如果gcd(m,n)等于1,T不变但大于1的数少了一个,N减1。Phi是正整数,每步至少减1,过程必须在有限步内终止。单一计数器,一刀斩断。

GPT-5.6 Sol则采取追踪乘积、字典序降维的策略。Sol看的则是两个量:P等于所有数的乘积,K等于大于1的数的个数。每步操作,如果gcd(m,n)等于d大于1,新的两个数的乘积是mn除以d,比原来小,全局乘积P严格变小。如果d等于1,P不变,但K减少1。(P,K)这个二元组在字典序下严格递减:要么P变小,要么P不变但K变小。正整数的字典序不可能无限递减,因此终止。两条截然不同的路径攻克了同一个问题的第一部分。到了第二部分,三个模型殊途同归:都证明了对每个素数p,黑板上所有数被p整除次数的最大公约数在操作中不变。最终公式也是一模一样。回到例子验算:12和18。对p等于2,v2(12)等于2,v2(18)等于1,gcd等于1,贡献2的1次方。对p等于3,v3(12)等于1,v3(18)等于2,gcd等于1,贡献3的1次方。M等于2乘以3等于6,和手算分毫不差。

P6题是Day 2的压轴,要求证明递推序列最终具有周期性。去年IMO 2025全球仅有6人解出。Claude Fable 5:26分钟,两轮,满分。GPT-5.6 Sol:60分钟,两轮,满分。Kimi K3:381分钟,四轮,满分。Grok 4.5在P6上只挤出7053个token,全场垫底。提交文件里赫然写着一句:Full proof: (Not yet complete.) 0.18美元,全场最廉价的白卷。Grok的毛病不止于此。整个测试中它反复陷入一种诡异的幻觉:信誓旦旦地声称证明已经写入文件,后台却连写入工具都没碰一下。这不是数学能力问题,是agent能力问题。模型知道应该写文件,也声称自己写了,但在工具调用层面没有动手。

这是硅基大脑的三年三级跳。2024年,DeepMind的AlphaProof首次在IMO级别摸到银牌门槛。2025年,OpenAI和DeepMind同时出手,OpenAI未公开的模型解出5题拿下35分金牌,Gemini Deep Think也达到同等段位。2026年,三个通用大模型直接拿下满分。这次,它们不仅没有经过任何专项数学训练,而且所有人都能用上,甚至还有一个是开源的。

整场测试的起点,是一家叫Axiom Math的公司。他们将IMO 2026的全部6道考题,逐字逐句翻译成了机器能够理解的Lean 4形式化题面。有了这套机器可读的题目,AI才能直接输出Lean证明,由编译器自动判分,不再需要人类评委阅卷。拿到题面后,Deedy Das迅速搭建起全自动化的测试框架。各大模型在赛道上各自狂奔,跑完了全部6道关卡,AxiomProver也独立斩获了满分。值得一提的是,Axiom Math的创始人洪乐彤年仅25岁。她出生于广州,仅用三年便横扫MIT数学与物理双学位,更是Morgan Prize的得主。去年底,她一手打造的AxiomProver拿下了Putnam数学竞赛的满分,这是该项赛事98年历史上的第6个满分奇迹。今年3月,这家公司完成了2亿美元A轮融资,估值直冲16亿美元。

能写4229行严格证明的模型,手里握着的不只是解数学题的能力。它真正掌控的是长链条逻辑推导,每一步不能跳、不能错、不能含糊。合同条款有没有漏洞、保险理赔条件满不满足、税务方案合不合规,剥开表象都是同一类问题:答案不能差不多对。过去这种逐条核验只有专业人士能做,按小时计费。如今,随着这个能力铺进消费级产品,遇到棘手问题,只需打开手机就行了。

最新快讯

2026年07月23日

09:46
鼓狮财经7月23日消息,韩国股市全线走强,基准指数Kospi一度大涨3.6%,实现连续第三个交易日上涨。受Alphabet计划增加资本支出消息提振,内存芯片制造商SK海力士和三星电子股价显著上扬,分别录得5.7%和4.8%的涨幅。韩国创业板Kosdaq指数也一度飙升3.4%。市场方面,近期外资抛售潮有所缓和,海外投资者重新恢复对韩国Kospi指数成分股的净买...
09:46
7月23日,国家发展改革委与国家能源局联合印发《可再生能源发展“十五五”规划》。该规划明确了未来五年及2030年的主要发展目标与技术重点。 **一、 主要发展目标** **1. 总量目标** 到2030年,可再生能源消费总量预计达到约18亿吨标准煤。 **2. 发电目标** 到2030年,可再生能源发电总装机容量将达35亿千瓦左右,年发电量约6万亿千瓦时。其...
09:14
资本永不眠,但成为超级天才的机会只有三次。而马斯克这三次都成功抓住了机会。2026年6月,SpaceX以1.77万亿美元估值完成IPO,刷新人类商业史纪录。媒体狂欢,投资者沸腾,“太空+AI”叙事如日中天。同一时间,马斯克两家上市公司账面上合计超过1500亿美元现金,安静地看着这一切。这是他的第三次在泡沫最高峰拿到融资,全身而退。要知道,今天的OpenAI和...
09:14
122关税将于7月24日到期,301关税或成为主要替代手段。中信证券分析认为,这本质上是关税框架的“换轨”与接替,而非全面升级。随着《国际紧急经济权力法》(IEEPA)的关税权力被最高法院推翻,特朗普政府正试图建立一套新的常规贸易权力框架,即“一套模式、三种手段”。这与此前“大开大合”式的“对等关税”打法有所不同。整体来看,新一轮关税调整对全球的冲击预计有限...
09:14
**特朗普:美国政府预计9月将停摆** 当地时间7月22日,美国总统特朗普在佐治亚州发表演讲时表示,由于共和党与民主党在支出优先事项上存在分歧,美国联邦政府预计将在9月份陷入“停摆”。同日,特朗普在社交媒体发文警告伊朗。他表示,一旦伊朗在霍尔木兹海峡向船只开火,无论使用何种武器(包括导弹、火箭弹、无人机等),美国都将采取报复行动,摧毁伊朗境内的桥梁或发电厂。...
09:14
在港股市场,大多数公司的日常融资行为通常不会对外公告,只有当交易规模触及上市规则的披露门槛时才需要披露。7月21日,粤港湾智算(01396.HK)披露了一笔融资租赁安排:其附属公司深圳鸿睿与浦银金融租赁签署了两笔售后回租协议,合计金额约为11.85亿元。由于合并适用百分比率超过5%,触发了强制披露义务。公告中特别提到,此次披露仅因合规要求达到门槛,并不代表集...
09:14
据鼓狮财经7月23日报道,特朗普政府正在研究在联邦管辖海域建设核能项目的可行性。当地时间7月22日周三,政府宣布将评估在联邦水域建设核能项目,作为扩大国内能源生产及加速先进核技术部署计划的一部分。 据悉,美国内政部下属的海洋矿产管理局已与美国核管理委员会达成合作协议,旨在协调对潜在近海核电项目的监管,并评估水下核电站落地的合规性。海洋矿产管理局指出,目前联邦...
08:50
刚刚落幕的世界人工智能大会(WAIC)上,“超节点”成为了全场焦点,其热度甚至盖过了备受瞩目的大模型。所谓“超节点”,指的是在物理上由多个计算节点——如AI加速卡、NPU或GPU——通过高效互联协议紧密连接,从而具备“一台计算机”特征的计算系统。随着AI大模型对算力需求的爆发式增长,算力架构正从传统的“单机八卡”向“万卡”乃至“十万卡”的集群模式演变。在算力...
08:42
华裔科学家、哈佛大学教授刘如谦团队近期在《自然》杂志发表最新研究成果。该团队证明,通过人工智能驱动的蛋白质重新设计结合实验室连续进化技术,可以获得针对非天然靶点、同时具备高稳定性、高催化效率和高特异性的蛋白酶。 论文链接:https://www.nature.com/articles/s41586-026-10820-0 具体而言,研究团队首先利用 AI 蛋...
08:42
最近与多家 AI 实验室和数据公司交流时,我们明显感觉到一个趋势:real-world data,也就是企业真实工作流中产生的数据,正在成为新的训练需求。相比于已经被充分挖掘的互联网数据,这仍是一座尚未开采的矿藏,淘金者才刚刚进场。这个市场的有趣之处在于,数据和利用数据的能力恰好分布在两端:模型公司通常是 MLE(机器学习工程师)过剩,而数据稀缺;企业则完全...
08:42
美股科技巨头财报季拉开帷幕。美东时间7月22日盘后,特斯拉发布了最新财报。本季度业绩呈现出显著的“冰火两重天”景象:营收创下三年最高增速,交付量大幅超出市场预期;然而,盈利能力却不及预期,引发资本市场担忧。财报发布后,特斯拉股价盘后下跌4.32%,报收357.85美元,总市值维持在1.4万亿美元。 **营收高增但利润承压** 特斯拉第二季度总营收达到282....
08:18
Gemini似乎正在逐渐演变成一个“大号豆包”。昨夜,万众期待的Gemini 3.5 Pro并未现身,谷歌却端上了三道“配菜”。 首先是Gemini 3.5 Flash-Lite。它定位高吞吐、低延迟,速度达到每秒350个token,输入成本0.3美元、输出成本2.5美元/百万token。与3月发布的3.1 Flash-Lite相比,Terminal-Ben...