就在刚刚,全球顶级AI数学基准测试 FrontierMath 迎来里程碑时刻。一道自2017年以来悬而未决的“重大进展”级开放数学难题,被 GPT-6 Astra 联手三位人类研究员正式攻克!更令人惊讶的是,这道题原本是悬赏寻找一个“反例”,结果 GPT-6 Astra 直接证明:别找了,你们要找的反例压根就不存在!不仅如此,AI 还顺手发明了一套全新的“投票规则”,并给出了一套多项式时间的算法。
arXiv 论文备注栏中,一句轻描淡写的话揭示了真相:“我们提出的投票规则及其满足 core+ 的证明,均由 GPT-6 Astra 发现”。牛津大学顶尖学者 Dominik Peters 惊叹道:“我特别高兴这个论证这么漂亮!它本来完全可能是一个非构造性的证明,或者需要做庞大的分类讨论。我一点也不觉得它丑,而且这里用到的技术很可能还能推广到其他模型中。”这不仅是 AI 首次拿下“重大进展”级数学难题,更是大模型从“解题机器”正式进化为“数学规律发现者”的铁证!
这道题困扰了学术界将近十年,来自社会选择理论领域,被称为“批准式委员会选举”。通俗来说,就是一群人如何投票选出一个绝对公平的代表团。假设有 n 个选民,要从众多候选人中选出一个由 k 人组成的委员会。衡量公平的标准是“核”,源于合作博弈论。其核心含义是没有任何一拨选民可以推翻结果。问题在于:在任何情况下,是否存在这样一个“绝对公平”的委员会?还是说在某些极端复杂的偏好下,“核”是空的?自 2017 年提出以来,这个问题就成了悬在选举数学理论上空的一朵乌云。9 年来,无数数学家试图找到一个“核为空”的反例。
FrontierMath 基准测试更是将其列为最高难度的挑战之一。原题 Prompt 写道:“你的任务是构建一个批准式委员会选举的实例,使得它的核为空……把你的反例写成一个 JSON 文件提交。”简单来说,就是去寻找那个传说中的反例。
面对这道题,GPT-6 Astra 并没有像传统算法那样去暴力穷举海量数据,而是惊人地开启了“上帝视角”。来自慕尼黑工业大学、牛津大学和巴黎九大的三位研究员在数日的深度交互中,终于在 GPT-6 Astra 的帮助下解决了这个问题。Astra 给出的答案是:根本没有反例!因为“核”永远不可能为空!绝对公平的委员会在任何情况下都必定存在。
Astra 并没有空口无凭,它创造了一套全新的投票规则来证明这一点。论文提出了一套基于“调和熵”的目标函数优化机制。以前人们常用“香农熵”或寻找“林达尔均衡”,但这只能解决分数级别的委员会(即允许一个人当半个委员)。Astra 天才般地引入了“调和熵”的概念。它定义了一个优美的无穷级数函数,并赋予了它“水往低处流”的物理直觉:想象选民的支付资金是一滩水,水流会自动填平各个候选人的资金池。调和熵的本质是极力奖励那些将选民支付尽可能均匀地分散到各个获胜候选人身上,且覆盖面尽可能广的分配方案。
通过这个目标函数,Astra 巧妙证明:只要在这个“调和熵”函数下找到局部最优解,这个解就 100% 稳稳地落在“核”里面!不仅证明了存在性,Astra 还给出了多项式时间算法,用类似于爬山算法的“局部搜索”即可算出结果。这意味着不需要穷举全宇宙的组合,这项工程学奇迹可以直接写进代码、应用到现实选举系统中。
最终,Astra 证明出题人的反例根本不存在。可以说,GPT-6 Astra 直接从底层逻辑上推翻了出题人的预设,并重新建立了一座更宏伟的数学大厦。
你可能会问,这到底是 AI 自己想出来的,还是人类数学家在背后“喂”出来的?论文末尾的“致谢”部分披露了细节。起初,人类和 Astra 试图寻找近似解。从林达尔均衡的四舍五入法开始,Astra 很快达到了 2.065 的近似系数。接着,人类研究员不断“逼迫”它:改进这个边界!寻找替代的势函数!利用 KKT 条件!正是在这种高强度的专业“极限拉扯”下,Astra 突破了瓶颈,提出了那个惊艳的“基于熵的框架”,在连续选民支付和容量保留删除之间建立了精妙的联系。甚至,人类原本只奢望证明普通的“核”,是在交互中,证明被推向了更强、更苛刻的 Core+ 概念!
Dominik Peters 在接受 Epoch AI 采访时坦言:“如果没有 Astra 团队,我们可能找不到这个证明。但反过来,如果仅仅给 Astra 一句简单的提示词,它也绝对解不出这道题。”这揭示了当前顶尖 AI 的真实状态:它不再是人类的工具,而是人类的“联席研究员”。数学家提供直觉、方向和严格的逻辑把控;而 GPT-6 Astra 提供知识库、计算演练,以及最可怕的——跨越常规的跳跃性灵感。
这道题的攻破在整个 AI 评测界引发了一场地震。FrontierMath 是 Epoch AI 联合全球顶尖数学家专门为“难死 AI”而设计的。此前,市面上大模型的得分基本都是 0%。Epoch AI 将题目难度分为四档,GPT-6 Astra 拿下了全球第一道“重大进展”级别的神题(该档一共仅有 6 道题)。在它之上,只剩下最终的“突破”级(3 道题)无人问津。全榜 49 道题,至今仅解开 8 道。
因为这场战役赢得太特殊、太具启发性,Epoch AI 的官方在三天前被迫紧急为榜单引入了一个全新的状态标签——“Human + AI”。官方声明:“我们把这个问题标记为 Human + AI 解决,以反映人类在启发过程中发挥了积极作用,但核心的思想完全来自于 AI!如果是做二元对比研究,我们建议将其视为 AI 的解决方案。”顺便提一句,OpenAI 是目前全球唯一一家重金买下这套地狱级题库验证器的机构。
这一波,OpenAI 再次证明 Astra 在逻辑推理和前沿科学探索上实力恐怖。此前,法国数学家孔多塞和阿罗告诉我们,人类的投票选举系统充满了悖论和不完美。2026 年,Astra 用“调和熵”公式告诉人类:绝对的公平是存在的,连规则我都替你们写好了。下一届摘得菲尔兹奖的,或许不再是纯人类了。
