一页纸,攻克了一道曾让数学界耗费44页顶刊论文的硬骨头。1991年,《数学年刊》刊载了József Beck的44页长文,成功解答了埃尔德什问题库中编号119的难题。Beck是组合数学界的泰斗,Beck-Fiala定理的提出者,1985年Fulkerson奖得主,1986年国际数学家大会受邀报告人,也是差异理论的奠基人之一。他证明了:在单位圆上选取复数作为零点构成多项式,其模 $M_n$ 在无穷多个 $n$ 处超过 $n$ 的 $c$ 次方。这道题在当时被公认为极难。如今,这一殊荣被AI领走。
AI即GPT-5.6 Sol。Thomas Bloom,曼彻斯特大学研究员,erdosproblems.com网站维护者,也是追踪埃尔德什问题的第一站。他在社交媒体上评价GPT-5.6 Sol是“数学上最有意思的新模型”,并强调其证明全部正确且包含有趣想法。Greg Brockman转发此推文,称这是数学发展的分水岭时刻,感觉通往科学医学突破的路径已近在咫尺。
埃尔德什留下的100美元悬赏,如今由GPT-5.6 Sol与数学家Korsky瓜分。1957年,埃尔德什提出该问题,并悬赏100美元求解第三问。Beck在1991年解决了第二问。如今AI用一页纸完成了第三问。Bloom指出,AI在Korsky提示下,仅用简单的调和分析技巧,就证出了比Beck44页Annals论文更强的结果。
Bloom透露了关键技巧:将非负函数做卷积并平移,使表达式变光滑。这是分析学常用的招数。他评价Beck当年的论文虽有重要想法,但未用到这道题上。更意外的是,没人算过具体常数,可能非常小,Beck当年也没算,如果值得算,他不会遗漏。
这不是AI推翻了顶刊,而是发现了一条人类本可少走的弯路。对数学家而言,这比单纯解出一道题更刺激:工具反过来纠正了使用者。人类遇到难题会耸耸肩放弃,AI则不会情绪化止损,继续尝试变体。
GPT-5.6 Sol Ultra在7月9日全面开放,7月10日便解开了Cycle Double Cover猜想。这道猜想由Szekeres和Seymour在70年代提出,悬而未决五十年。模型分配8小时,实际不到1小时,采用64个智能体并行。Bloom评价该证明“短、初等、1980年代本可以被发现”,推测关键一步存在一个反直觉的小拐弯。人类数学家会先试自然做法,失败后放弃;AI则会不断变体尝试。
今年4月,GPT-5.4 Pro在80分钟内解掉Erdős 1196,Jared Lichtman耗时七年,陶哲轩感叹人类集体走偏。人类直觉是效率工具,但也可能省略不该省的那一次尝试。
去年10月,Bloom曾公开质疑OpenAI声称解决10个未解问题的说法,称其为“戏剧性的误导”,因为“Open”仅代表他不知道文献,不等于没人解决。Sébastien Bubeck后来承认AI只是找到了已有解的文献。
关于AI数学能力的争论。唱衰派认为AI撞墙,因CritPT评测停滞,大模型本质是静态token生成器。反击派指出CritPT是物理测试,GPT-5.6在FrontierMath等测试有提升。实战派old-bielefelder报告GPT-5.6改进了Pintz 2018年的指数(0.72至0.7195)。
Bloom提出“现代数学是一座巨大的教堂”的隐喻。大模型以超人效率在“地基”上工作(ARC-AGI-3上7.8% vs 人类90%+),流动智力被地基掩盖。但当流动智力压过地基时,突破将肉眼可见。
争论的焦点在于如何定义“难”。数学史上悬而未决的问题,有的源于问题本身,有的源于人类耐心的边界。过去两者混为一谈,现在开始能区分。有些题目未解,可能只因没人肯尝试第30次。
