就在刚刚,全球顶级AI数学基准测试 FrontierMath 迎来里程碑时刻。一道自2017年以来悬而未决的“重大进展”级开放数学难题,被 GPT-6 Astra 联手三位人类研究员正式攻克!更令人惊讶的是,这道题原本是悬赏寻找一个“反例”,结果 GPT-6 Astra 直接证明:别找了,你们要找的反例压根就不存在!不仅如此,AI 还顺手发明了一套全新的“投票规则”,并给出了一套多项式时间的算法。

arXiv 论文备注栏中,一句轻描淡写的话揭示了真相:“我们提出的投票规则及其满足 core+ 的证明,均由 GPT-6 Astra 发现”。牛津大学顶尖学者 Dominik Peters 惊叹道:“我特别高兴这个论证这么漂亮!它本来完全可能是一个非构造性的证明,或者需要做庞大的分类讨论。我一点也不觉得它丑,而且这里用到的技术很可能还能推广到其他模型中。”这不仅是 AI 首次拿下“重大进展”级数学难题,更是大模型从“解题机器”正式进化为“数学规律发现者”的铁证!

这道题困扰了学术界将近十年,来自社会选择理论领域,被称为“批准式委员会选举”。通俗来说,就是一群人如何投票选出一个绝对公平的代表团。假设有 n 个选民,要从众多候选人中选出一个由 k 人组成的委员会。衡量公平的标准是“核”,源于合作博弈论。其核心含义是没有任何一拨选民可以推翻结果。问题在于:在任何情况下,是否存在这样一个“绝对公平”的委员会?还是说在某些极端复杂的偏好下,“核”是空的?自 2017 年提出以来,这个问题就成了悬在选举数学理论上空的一朵乌云。9 年来,无数数学家试图找到一个“核为空”的反例。

FrontierMath 基准测试更是将其列为最高难度的挑战之一。原题 Prompt 写道:“你的任务是构建一个批准式委员会选举的实例,使得它的核为空……把你的反例写成一个 JSON 文件提交。”简单来说,就是去寻找那个传说中的反例。

面对这道题,GPT-6 Astra 并没有像传统算法那样去暴力穷举海量数据,而是惊人地开启了“上帝视角”。来自慕尼黑工业大学、牛津大学和巴黎九大的三位研究员在数日的深度交互中,终于在 GPT-6 Astra 的帮助下解决了这个问题。Astra 给出的答案是:根本没有反例!因为“核”永远不可能为空!绝对公平的委员会在任何情况下都必定存在。

Astra 并没有空口无凭,它创造了一套全新的投票规则来证明这一点。论文提出了一套基于“调和熵”的目标函数优化机制。以前人们常用“香农熵”或寻找“林达尔均衡”,但这只能解决分数级别的委员会(即允许一个人当半个委员)。Astra 天才般地引入了“调和熵”的概念。它定义了一个优美的无穷级数函数,并赋予了它“水往低处流”的物理直觉:想象选民的支付资金是一滩水,水流会自动填平各个候选人的资金池。调和熵的本质是极力奖励那些将选民支付尽可能均匀地分散到各个获胜候选人身上,且覆盖面尽可能广的分配方案。

通过这个目标函数,Astra 巧妙证明:只要在这个“调和熵”函数下找到局部最优解,这个解就 100% 稳稳地落在“核”里面!不仅证明了存在性,Astra 还给出了多项式时间算法,用类似于爬山算法的“局部搜索”即可算出结果。这意味着不需要穷举全宇宙的组合,这项工程学奇迹可以直接写进代码、应用到现实选举系统中。

最终,Astra 证明出题人的反例根本不存在。可以说,GPT-6 Astra 直接从底层逻辑上推翻了出题人的预设,并重新建立了一座更宏伟的数学大厦。

你可能会问,这到底是 AI 自己想出来的,还是人类数学家在背后“喂”出来的?论文末尾的“致谢”部分披露了细节。起初,人类和 Astra 试图寻找近似解。从林达尔均衡的四舍五入法开始,Astra 很快达到了 2.065 的近似系数。接着,人类研究员不断“逼迫”它:改进这个边界!寻找替代的势函数!利用 KKT 条件!正是在这种高强度的专业“极限拉扯”下,Astra 突破了瓶颈,提出了那个惊艳的“基于熵的框架”,在连续选民支付和容量保留删除之间建立了精妙的联系。甚至,人类原本只奢望证明普通的“核”,是在交互中,证明被推向了更强、更苛刻的 Core+ 概念!

Dominik Peters 在接受 Epoch AI 采访时坦言:“如果没有 Astra 团队,我们可能找不到这个证明。但反过来,如果仅仅给 Astra 一句简单的提示词,它也绝对解不出这道题。”这揭示了当前顶尖 AI 的真实状态:它不再是人类的工具,而是人类的“联席研究员”。数学家提供直觉、方向和严格的逻辑把控;而 GPT-6 Astra 提供知识库、计算演练,以及最可怕的——跨越常规的跳跃性灵感。

这道题的攻破在整个 AI 评测界引发了一场地震。FrontierMath 是 Epoch AI 联合全球顶尖数学家专门为“难死 AI”而设计的。此前,市面上大模型的得分基本都是 0%。Epoch AI 将题目难度分为四档,GPT-6 Astra 拿下了全球第一道“重大进展”级别的神题(该档一共仅有 6 道题)。在它之上,只剩下最终的“突破”级(3 道题)无人问津。全榜 49 道题,至今仅解开 8 道。

因为这场战役赢得太特殊、太具启发性,Epoch AI 的官方在三天前被迫紧急为榜单引入了一个全新的状态标签——“Human + AI”。官方声明:“我们把这个问题标记为 Human + AI 解决,以反映人类在启发过程中发挥了积极作用,但核心的思想完全来自于 AI!如果是做二元对比研究,我们建议将其视为 AI 的解决方案。”顺便提一句,OpenAI 是目前全球唯一一家重金买下这套地狱级题库验证器的机构。

这一波,OpenAI 再次证明 Astra 在逻辑推理和前沿科学探索上实力恐怖。此前,法国数学家孔多塞和阿罗告诉我们,人类的投票选举系统充满了悖论和不完美。2026 年,Astra 用“调和熵”公式告诉人类:绝对的公平是存在的,连规则我都替你们写好了。下一届摘得菲尔兹奖的,或许不再是纯人类了。

最新快讯

2026年09月20日

15:01
谷歌似乎真的要彻底翻身了。这几天,一个伪装成“Gemini 3.8 Flash”的神秘模型出现在大模型竞技场 Arena 上。在多轮盲测中,AI 圈瞬间沸腾:这毫无疑问就是谷歌的“隐藏款”——Gemini 4 Pro。随之而来的是一系列令人震撼的 Demo。就在今天,Gemini 4 Pro 生成的机械蝴蝶刷屏全网,它仅用十分钟就完成了渲染,而竞争对手 Fa...
15:01
**“大零号湾・源创加速营”结业DEMO活动圆满落幕,赋能硬科技企业跨越成长鸿沟** 9月10日至11日,以“源创未来・智汇硬核”为主题的首期“大零号湾・源创加速营”结业DEMO活动在上海大零号湾科创成果转化中心圆满举行。本次活动由上海市科委、闵行区人民政府、上海交通大学、华东师范大学共同指导,闵行区科委、上海大零号湾投资发展(集团)有限公司、上海闵行金融投...
15:01
上海,2026年9月18日——在华为全联接大会2026现场,华为与中数睿智隆重举行联合创新解决方案发布仪式。双方携手发布面向油气行业的创新方案,依托华为算力底座与中数睿智动态本体技术,推动产业智能从技术验证迈向核心生产环节。 此次发布的解决方案直击产业AI落地生产的痛点。油气行业具有数据海量、工况复杂、安全严苛等特征,对AI提出了极高要求:不仅要具备稳定的训...
14:27
就在今天,整个硅谷都被Jev刷屏了!发布仅三天,它就被Vercel、Cloudflare和LangChain等主流平台迅速集成,有人说,我们即将迎来自动化智能的大爆发!而这场狂欢的主角,竟然是一个不会说话的大模型。9月16日,ChatGPT核心发明人之一、InstructGPT论文第四作者Diogo Almeida连发长推,直接向行业开炮,...
14:26
2026世界制造业大会于9月20日在安徽合肥隆重开幕。工业和信息化部副部长辛国斌在致辞中强调,工信部将坚定不移地把新一代智能制造作为主攻方向,全面提升制造业的创新力、竞争力和综合实力,致力塑造中国制造的新优势。具体举措包括: 一是提升产业创新体系的效能。聚焦原始创新与关键核心技术攻关,强化企业在科技创新中的主体地位,优化产业创新平台的布局,加速推动科技创新成...
13:56
近日,AI 领域涌现出一个新名字:Jev。自 TypeSafe AI 发布以来,它在社交媒体、GitHub 以及 Agent 开发者圈层中迅速走红。从 40 秒内分析 724 条实时广告,到接入 Claude Code 进行上下文清理,再到作为 Agent 的验收裁判以及浏览器 Agent 的决策核心,Jev 展现了惊人的应用潜力。甚至连 LangChain...
13:56
9月20日,上纬新材旗下的消费级具身智能品牌启元机器人宣布与腾讯WorkBuddy达成战略合作。启元Q1与T1两款机器人正式接入WorkBuddy平台,能够直接调用其中上万种Skill。这一合作将AI的理解与推理能力与机器人的语音及运动能力深度融合,构建起从“听懂指令”到“思考行动”再到“反馈结果”的完整智能交互闭环。 以往,机器人往往只能执行单一的预设动作...
13:56
Claude Code终于不再固执己见。就在刚刚,Claude Code团队核心工程师Thariq在社交媒体上发帖,短短一小时浏览量便突破百万。自2.1.277版本上线以来,如果项目文件夹中缺少CLAUDE.md,Claude会自动寻找并读取AGENTS.md。这一改动在GitHub的更新日志首行便已明确记录。 这条更新,开发者们已经苦苦等待了一年多。在Gi...
13:56
大模型做数学题做到「颅内高潮」,你见过吗?在大多数人的印象里,AI解题总是四平八稳、逻辑严密。即便是当前顶尖的推理模型,其思维链也无非是一段段机械的自语:第一步,设 x 为未知数;第二步,将两边同时平方……但今天这款谷歌大模型,彻底颠覆了人类对 AI 的认知。 近日,知名科技博主与爆料人 Lyra 在社交平台上晒出了数张谷歌内部评测模型的卡片截图。截图中,一...
13:55
鼓狮财经9月20日讯瑞银目前预计,2026年人工智能资本开支将接近1万亿美元,2027年进一步攀升至约1.4万亿美元,而这一增长背后的最主要原因是内存成本大幅上涨。 全球AI资本开支还将继续飙升 瑞银最新测算结果显示,今年全球AI资本开支总额为9980亿美元,几乎是2025年5060亿美元的两倍;预计明年支出将继续增长至1.447万亿美元,同比增幅达到约44...