本周末,OpenAI与Anthropic两大AI巨头在数学前沿展开了短兵相接的较量。
8月1日,OpenAI研究员Sébastien Bubeck宣布,其未公开的下一代主力模型“Astra”一口气攻克了10项前沿数学难题,并甩出了10份Lean证书与解题思路复盘。别小看这10道题,它们大多沉寂了十几年甚至几十年,是货真价实的开放难题。Epoch AI负责人Elliot Glazer直言,仅“非索菲克群”这一篇,就足以发表在数学界顶刊《Annals of Mathematics》。
这一下,AI圈沸腾了,有人甚至喊出“数学奇点已至”。Anthropic迅速接招,不到24小时,研究员Levent Alpöge便在Bubeck的帖子下回应:“我用Fable完成了一半。”他补充道,自己做出来的是OpenAI榜单上的第4至第8题,共5项。Levent强调实验条件干净,全程无网络,且做了防泄露防护。若属实,OpenAI利用未发布模型抢得的首发先机,仅保鲜了24小时。
网友调侃,这更像是一场“互相验货”而非单纯的刷榜。过去,数学成果的优先权以年计算,如今却缩水至24小时。OpenAI透露,跑通这10个解法的边际成本不到2000美元,但这仅是成功案例的token费用,未包含训练、调试及人工整理等巨额投入。
Fable并非只会蹭热度,它也能解新题(如推翻Jacobian猜想)。但质疑声随之而来:既然有实力,为何不直接解新题?事实上,这场较量的核心在于“验证”。两个模型在隔绝环境下独立推导同一结论,测的是结果的可靠性与可复现性,这更接近同行评审。
然而,绝大多数人无法理解这些成果。正如Ethan Mollick所言,这超出了大众的理解范围,我们只能依赖专业数学家的判断。数学家Thomas Bloom也提醒,不能简单将其描述为“AI取代数学家”,关键在于证明是否提供了新知识。
当AI能低成本批量生产前沿证明时,真正的考验才刚刚开始。最稀缺的能力,正从“做出证明”转向“看懂并验收证明”。证明造得越快,我们的验证速度能否跟上?
