**AI数学巅峰对决:OpenAI首发十题,Anthropic24小时后半数回敬**
本周末,OpenAI与Anthropic两大AI巨擘,在数学的前沿阵地展开了一场短兵相接的较量。8月1日,OpenAI研究员Sébastien Bubeck宣布,其未公开的下一代主力模型“Astra”,一口气证明了10项前沿数学成果,并附上了10份Lean证书和逐题思路复盘。
这10道题看似不起眼,实则分量极重。它们的主要结论至少10年无人推动,不少甚至搁置了几十年,是货真价实的开放难题。Epoch AI旗下FrontierMath的负责人Elliot Glazer直言,光是“非索菲克群”这一篇,就足以入选数学界公认的权威期刊《数学年刊》。这一消息在AI圈引发轰动,有人当场惊呼“数学奇点已经到来”。
面对挑战,Anthropic反应迅速。不到24小时,研究员Levent Alpöge在Bubeck的帖子下回应:“我用Fable完成了一半。”他补充称,复现的是OpenAI榜单上的第4至8项,共5项。实验条件十分严格:完全自主、通用提示词、全程无网络,并特意加设了防护以防止OpenAI的解法泄露进上下文。虽然Levent尚未放出Fable的完整证明细节,但若属实,OpenAI凭借未公开模型抢得的首发优势,仅保住了24小时。而追上来的Fable,却是Anthropic早已公开、人人可调用的模型。
**01、首发“保鲜期”缩至24小时**
网友Chubby转发评论道:“公开可用的Fable,复现了Astra一半成果。”有人调侃,OpenAI似乎只抢到了一个“首发”。过去,数学成果的优先权之争通常以年为单位,从构思到发表,中间隔着漫长的投稿与审稿周期。如今,Astra在未正式发布前公布的成果,在24小时内便被一个公开模型追平了一半。首发的含金量依然存在,但保质期已大大缩短。不少网友已高呼“数学奇点”已至,两大巨头也紧紧咬住了彼此。
**02、2000美元背后,是更昂贵的研发账单**
OpenAI还披露了一个数字:找到这10项解法的成本不到2000美元。研究员Noam Brown解释,这对应的是成功运行所需的token,按Sol API价格折算的边际推理成本。但这只是冰山一角。在这之外,还有Astra本身的训练研发、无数试错失败的问题、人类将论证整理成249页论文的工时、将每个证明形式化成Lean的成本,以及最后外部数学家审查的成本。Noam也承认,他们尝试过其他重大问题,甚至千禧年大奖难题一个都没拿下。即便如此,2000美元仍将AI解出一道前沿难题的边际成本打到了地板。有人甚至调侃,OpenAI是不是明天会再公布10项数学突破,或者等到下周一次性发100项。
**03、从“刷榜”到“互相验货”**
Fable重做Astra的同一批题目,比普通的“刷榜”更有意义。刷榜测的是已知答案,比谁分高;而这两个模型在无网络、防泄漏的条件下,各自独立抵达同一个前沿结论,测试的是完全不同的东西:这个结果到底可不可靠,能不能被独立复现。这更像是一场同行评审。目前Levent只是在社交媒体上“作出声明”,尚未放出那5项证明的PDF、提示词、运行日志或Lean证书。
网友Haider质疑:就算是真的,为什么要用Fable去复现Astra,而不是直接拿它去解新的开放问题?事实上,Fable并非只会蹭热度,它也会解新题。7月,Levent就用Fable给出了Jacobian猜想的三维反例,事后还有专人写了一份7页的代数验证材料,确认那个显式映射确实推翻了三维及更高维的猜想。
**04、绝大多数人看不懂的成果,谁来验收?**
这10项成果到底有多重要,绝大多数人很难判断。Ethan Mollick一语道破:对地球上几乎每一个人来说,这不只是超出能力,而是超出理解范围。我们只能相信专业数学家告诉我们它厉不厉害。代码、图片、聊天,普通人还能亲手体验AI强在哪。可非索菲克群的存在、Connes刚性猜想的反例、量子平行重复定理,这些只有极少数专家看得懂。AI能力越往科学前沿走,公众能依靠的就越不是亲身体验,而是一条长长的信任链。
数学家Thomas Bloom提醒,这些成果用的是上百年积累的数学理论、数学家亲手搭好的形式化系统,把它简单描述成“AI取代了数学家”,并不诚实。他给出的标准是:这份证明,有没有教给我们关于这个问题的新东西?所以真正的问题来了:当AI能低成本、批量地生产前沿数学证明,我们到底该拿什么衡量它的成果?答案也许不在它的产出端,而在验收端:一份证明能不能被读懂、被核对、被判断出分量,才能最终决定它的真实价值。
最稀缺的能力,正在从“做出证明”转向“看懂并验收证明”。当AI一夜之间就能证出十道难题,真正的考验才刚开始:证明造得越快,我们的验证,还追得上吗?
