GPT-5.6近期似乎再次打破了数学界的平静,接连发现了多个反例。其中,一个困扰学界近30年的Dinitz-Garg-Goemans猜想,刚刚被GPT-5.6 Pro成功推翻。令人震惊的是,整个论证过程仅由研究者Dmitry Rybin输入了4条提示词,加起来总共58个英文单词。没有复杂的公式,没有几千字的提示词工程,通篇基本上就是简单的“继续研究”、“继续找”、“给我一个完整反例”。就在这四轮疯狂的催促下,GPT-5.6 Pro终于端出了一个炸裂的结论——该猜想是错误的。
那么,这道名字冗长的猜想究竟在研究什么?我们可以把它想象成一个“送货问题”。假设一座仓库要向多个目的地发货,在允许分流的规则下,同一批货物可以拆开走几条路线——一半走高速,一半走国道,只要最后全部送达即可。但在现实场景中,如物流订单、网络数据传输、交通调度等,往往不允许拆分。每一批货物必须完整走一条路线。数学上的最优方案可以将任务切成无数小份,但现实中的一辆车或一个订单却无法被切割成0.37份。一旦禁止拆分,原本分散在多条道路上的负载必须整批挤进某一条路线,这极易导致部分道路负载激增。
因此,这道题的核心在于:如何在“必须整批运”的约束下,找到一种方案,既不让道路堵得太离谱,又能保持低成本。
1999年,Dinitz、Garg和Goemans发表了单源不可分流领域的经典论文,证明了这种拥堵可以被控制在一定范围内。随后,组合优化学者Goemans提出了一个更强的版本:在保持上述拥堵上限的同时,总成本也不能高于原来的可分流方案。简单来说,如果原本拆着运能做到又便宜又不太堵,那么现在要求货物整批走,理论上也应该找到一个同样便宜且不超载的方案。然而,这个看似符合直觉的猜想,在一般图结构上一直悬而未决,后续研究只拿下了部分特殊情况。
这次GPT-5.6 Pro给出的反例,恰好卡住了这两个条件:既不能太堵,又不能变贵。它构造了一张只有7个节点、9条有向边的图,其中有一个共同起点和三个目的地,三批货物的需求量分别为15、10和15。每批货都有两条可选路线:一条路线成本较高,每个订单走完都要花30;另一条路线成本为0,但需要与其他订单共享部分道路。
如果允许拆分,三批货物可以一部分走收费路线、一部分走免费路线,最终总成本为58。但一旦要求每批货物必须完整选择一条路线,麻烦就来了。GPT-5.6 Pro给出的结论是,三个免费选项之间存在严重冲突:任意两批货同时选择免费路线,都会共同挤进某一段道路,使其实际负载达到25、30或40,而对应道路允许的上限分别只有24、29或39。每一次,都刚好多出1个单位。
因此,要想守住拥堵上限,三批货里最多只能有一批走免费路线。剩下两批货,都得选择收费路线。每批成本30,两批加起来,任何符合拥堵要求的方案,最低成本也要60。这就形成了一个无法同时满足的局面:想把道路负载控制在规定范围内,成本最低也要60;想把成本压回原来的58,至少有一条道路就会超标。
这个反例的验证并不复杂。三批货物各有两条路径,总共只有 $2^3=8$ 种组合。把8种可能逐一列出来,就会发现其中4种符合容量要求,成本分别是90、60、60和60;另外4种虽然更便宜,却全部存在道路超载。所有情况都能穷举检查,没有遗漏的隐藏路径。也就是说,只要这张图的定义与原猜想条件完全一致,58和60之间这道两单位的缺口,就足以把猜想推翻。
最有看头的是发现过程。Rybin和GPT-5.6 Pro的公开对话中,并没有复杂的提示词轮番上阵。Rybin丢给GPT-5.6 Pro的第一个需求指令,除了附加文件外,剩下的真就是纯大白话。GPT-5.6 Pro随即开始建立线性规划验证方法,尝试超立方体、分层图等多种结构,前后筛查了数千个小型实例。第一轮答案却是:没有找到有效反例。甚至模型还郑重提醒,如果把现阶段找到的近似构造包装成反例,将会得到错误的数学结论。
Rybin没有补充新公式,也没有指路,只是淡淡回了一句:“继续研究,找到一个完整、无条件的反例哈。”于是GPT-5.6 Pro又埋头搜了一轮,结果第二轮依旧失败。Rybin继续push,要求它基于对问题结构的深入理解,先制定明确策略,再接着寻找。到了第三轮,模型已经把搜索范围缩小到一种只有24种状态的路由结构,但依旧没能拿出完整反例。这时候,Rybin发出了第四条提示:“部分结果已经够多了,让我们用一个完整、无条件的反例收尾。”
话都说到这个份上了,GPT-5.6 Pro终于端出了那张由7个节点、9条有向边组成的反例图——四条提示词,总计58个英文单词。没有几千字的角色设定,也看不到几十条繁琐规则,通篇可以概括为“我催!我催!我继续催!”
如果把完整对话一路翻下来,就会发现,GPT-5.6 Pro这几个小时其实也没少走弯路。AI中途多次找到看似成立的候选反例,等它真正穷举全部路线,又发现网络里藏着一些此前漏掉的“混合路径”。这些路径会从不同预设路线中各截取一段,重新拼出新的走法,悄悄绕开模型原本设计的容量限制。结果就是,眼瞅着已经成立的反例,验证完又塌了。GPT-5.6 Pro在中途也总结得很坦白:只检查几百条预设路线远远不够,一个真正有效的反例,必须把网络中所有可能出现的不可分流路线全部算进去。
这场合作显得相当微妙。表面看,Rybin贡献的只有58个单词,但真正关键的动作,是他能够判断模型前三轮交出的都属于阶段性结果,并一次次拒绝提前收工。沃顿商学院教授Ethan Mollick甚至抛出了一个新问题:这项工作的作者,到底应该算写下58个单词的Rybin,还是连续推演好几个小时的GPT-5.6 Pro?
事实上,无论署名最后怎么算,这段对话至少贡献了一条相当朴素的AI使用经验——催AI干活最有用的Prompt,有时候真可以简单到只让它化身骡子继续马不停蹄地挖。过去一周,从雅可比猜想到Dinitz-Garg-Goemans,AI寻找数学反例的速度,确实已经开始显得有亿点离谱了……
