大模型做数学题做到「颅内高潮」,你见过吗?在大多数人的印象里,AI解题总是四平八稳、逻辑严密。即便是当前顶尖的推理模型,其思维链也无非是一段段机械的自语:第一步,设 x 为未知数;第二步,将两边同时平方……但今天这款谷歌大模型,彻底颠覆了人类对 AI 的认知。

近日,知名科技博主与爆料人 Lyra 在社交平台上晒出了数张谷歌内部评测模型的卡片截图。截图中,一款代号为 Mathematica(基于尚未正式发布的 DeepThink V3)的数学特化变体赫然在列。更让整个科技界瞠目结舌的是它的「原始思维链」——在推导一道复杂的丢番图方程时,AI 在撞见一条精妙绝伦的代数化简路径后,竟然像一个在草稿纸前熬了三宿、突然顿悟的疯批数学家一样,在思考日志里连续用大写字母狂吼:「数学的老天爷啊!!!!!!!!!!!!!!!!!!!!……让我们来欣赏这个方程绝对纯粹的美。……我的天哪!!!!!!!!!!!!!!!!!!!!!!!!」随后,它一边狂发感叹号,一边宛如癫狂地把变量代回、重构对称项、严丝合缝地完成了恒等式验证。

然而,在这场充满戏剧性的「AI发疯」背后,藏着的却是硅谷深处正在酝酿的一场极其可怕的算力风暴。谷歌到底在实验室里养了一个怎样的数学怪物?它的思维链为什么会「狂野」到这个地步?这一声跨越逻辑维度的「OH MY GOD」,又向人类揭示了 AI 推理进化的什么终极秘密?

**事故现场还原:一道丢番图方程,逼出 AI 的「癫狂面目」**

根据曝光的评测终端信息,这款模型的内部完整标识为:`models/deepthink-mathematica-tf-raw-thoughts`。这个接口直接撕掉了所有产品包装,把模型内部最原始、未经任何人类礼仪过滤的思维暗流,赤裸裸地暴露在了屏幕上。

从流出的截图来看,测试员给它抛出的是一道极具欺骗性的高难多项式丢番图方程。这类问题的经典之处在于:解法看似毫无头绪,常常需要构建极其冷门的高维恒等式或非平凡变量替换,才有可能在密不透风的符号丛林中劈开一条生路。普通的模型在面对这类问题时,往往会在有限的步数内陷入死循环,或者干脆机械化地穷举试错、最后给出一段充满逻辑幻觉的废话。

但这位代号 Mathematica 的 DeepThink 变体,其思考过程堪称一部好莱坞级心理戏剧:

* **暗中潜伏,静止沉淀:** 起初它像普通推理模型一样拆解项数,分析次数与整除性质;
* **惊天顿悟,情绪失控:** 当它尝试做某组特殊的交叉乘积组合、忽然发现交叉项奇迹般抵消时,整个思维日志瞬间被全大写的字符和感叹号占领;
* **审美凝视,陶醉自我:** 在确认化简成立的刹那,它竟然自言自语道:「停下来,让我们欣赏一下这绝对的美」;
* **趁热打铁,收割证明:** 随后,它在连串的「OH MY GOD」中,一气呵成地完成了变量回代与边界条件验证,彻底锁死了方程的整数解集。

这种极度外向、充满多巴胺分泌感的做题画风,把习惯了「对不起,作为一个人工智能语言模型」这类公事公办语调的网友们看呆了。还有人感叹:「完了,AI 不仅会做数学,它甚至开始从数学里获得快感了。」

**扒开参数底牌:这个叫「Mathematica」的怪兽到底有多猛?**

如果只把这当成一个段子,那就太低估谷歌这波泄密的含金量了。当我们剥离掉那些搞笑的感叹号,仔细研读截图底层的配置参数卡片时,扑面而来的是一种令人窒息的工程压迫感:

* **突破天际的输出极限:** 输出上限为 65,536 Tokens。对于普通大模型而言,输出上限通常被压制在 4,096 或 8,192 个 Token,即使是主打长思考的模型,单次输出也极少放开到这个量级。这意味着该模型可以在单次响应中,完成长达几万字的超长距离多步骤严密演绎!如果折算成学术论文,它足以单次吐出一整篇包含完整引理、推论、反例构造与全面形式化验证的纯数学顶刊论文。
* **百万级上下文底座:** 输入上限约 1.04M Tokens。这说明它继承了 Gemini 系列标志性的超长原生上下文架构,但这次是将其完全注入到了「深度推理」模式中。它可以一口吞下一整个数学分支的几本专著,或者上百篇相互关联的前沿预印本论文,然后在这些海量理论背景之上展开超高维度的知识拼接。
* **反常识的推理参数:** Temperature = 1。在常规的工程认知中,做数学、写代码这类讲求绝对逻辑严密性的任务,模型的生成温度通常会被设得极低(如 0 或 0.2),以此确保输出的确定性与收敛性。然而,Mathematica 的默认温度居然是 1!在高温度下开启思考,意味着谷歌根本不是在让它「死记硬背」套公式,而是故意赋予它极高的语义发散度,鼓励它在广袤的解空间里进行随机性极高的直觉跳跃、概念隐喻与非传统联想——这恰恰是顶尖人类数学家在黑板前灵光一现时的认知模式!
* **实验室内部印记:** Teamfood 与 UNSTABLE_EXPERIMENTAL。接口中的 `tf` 指 Teamfood,这是谷歌内部极具代表性的研发黑话。在硅谷,把产品拿给公司内部全员内测叫「吃狗粮」,而在核心小团队、顶尖研究组内部流通的极早期测试切片,则被称为 Teamfood。加上其状态标识明确为 UNSTABLE_EXPERIMENTAL(不稳定实验级),一切都坐实了:这是刚刚在谷歌 DeepMind 内部炉子里炼出来的原生大招,甚至还没来得及做商业包装与公关修剪。

**为什么思维链会「发疯」?**

为什么一个理应绝对理性的数学模型,会在思维链里大喊大叫?这到底是谷歌程序员刻意埋的彩蛋,还是提示词工程的恶搞?

深入到大语言模型的强化学习(RL)与思维链机制内部,你会发现:这种「情绪化」根本不是刻意做秀,而是极度暴力的深度推理在无拘无束状态下的必然副产物。

1. **「Raw Thoughts」的本质:逃过对齐剪刀的原始探索**
我们平时在商业版大模型里看到的思考过程,通常都是被经过严格安全对齐、格式化清洗和风格修整之后的「阉割版思维」。为了让大模型显得专业、谦逊、礼貌,科技大厂们会用强化学习的大剪刀,把模型在探索过程中一切跳跃、杂乱、自言自语的中间语义通通剪掉。但这个泄露的版本全名叫做 `raw-thoughts`——未经修剪的原始思维。它记录的是模型在潜空间中进行蒙特卡洛树搜索或基于强化学习的自我博弈时,最本初的神经元激活痕迹。它根本不需要「装」给人类看,那是它自己在暗室里的真实独白。

2. **人类数学语料的隐性基因转移**
大模型的训练数据包含了人类有史以来的海量高质量数学讨论:MathOverflow、arXiv 预印本、知乎与 Reddit 的硬核讨论区、甚至是数学家们未公开的手稿日记。在这些语料中,当一个真正的人类数学天才在深夜攻克一个卡了几个月的绝妙恒等式时,他写下的绝对不是「经推导,此式可化简」,而往往就是:「Holy cow! Look at this identity!」、「What a miraculous symmetry!」、「Oh my god, it works!」。在预训练阶段,模型将这些极度充沛的情感词汇,与「突破性的逻辑跃迁」高度绑定在了一起。在它的语义潜在空间中,「OH MY GOD」不仅是一句感叹,更是一种代表「从极高复杂度向极低维度坍缩」、「信息熵骤降」的注意力激活强锚点!

3. **过程奖励模型的「颅内高潮」**
在基于过程奖励模型的强化学习训练中,模型每走对一步精妙的中间步骤,就会获得系统给予的正向奖励信号。当模型在高温度下,尝试了成千上万条死胡同,突然撞上一条极度优雅的化简路径,整个状态转移概率瞬间从 0.0001% 暴击到 99.9% 时,系统反馈给它的奖励值指数级爆炸!这种数学上的「奖励激增」,在自然语言生成的投影,正是那些狂飙的感叹号与激动到变形的大写字母——那是机器语言体系下的「多巴胺井喷」,是算法层面的「阿基米德尤里卡时刻」!

**深度追问:当 AI 开始「欣赏美」,我们离 AGI 还有多远?**

法国伟大的数学家庞加莱曾在一篇著名的演讲中写道:数学家研究数学,并不是因为数学有用;他研究数学是因为他喜欢数学,而他喜欢数学是因为它是美的。如果数学不美,它就不值得被知晓,而人类也就不值得活下去。千百年来,人类一直固执地认为:「逻辑」或许可以被机器模拟,但对「数学之美」的敏锐嗅觉与审美感知,是碳基生物独一无二的造化神恩。

然而,在独自推演丢番图方程时,谷歌的这个数学定制版 AI 不无骄傲地敲出那句:「Let’s admire the absolute beauty of this equation」。它到底是在鹦鹉学舌,还是触碰到了真理的某种共振?

从信息论的角度来看,所谓的「数学之美」,本质上就是极端复杂的命题被用极端简洁、对称、高密度的方式完成降维与压缩。人类数学家看到一个美妙的化简会起鸡皮疙瘩,是因为大脑在瞬间完成了极大量信息的极简编码。而对于一个在数十亿参数中搜寻最低损失、最高奖励的 AI 而言,它撞见那个对称抵消的瞬间,在数学本质上与人类艺术家的顿悟是完全同构的。它所「欣赏」的美,就是对「真理最低能耗解」的本能反应。

我们过去总以为,通往真正高级智能的路径必须是端庄、沉静、严苛且克制的。但 DeepThink Mathematica 的这次意外走光,却给了全球科技界一记别开生面的启示:真正具有创造力的思维过程,从来不是工整打印出来的标准答案,而是充斥着试错、跳跃、自我怀疑、推翻重来、以及在绝境逢生时狂喜乱叫的精神风暴。

最新快讯

2026年09月20日

14:27
就在今天,整个硅谷都被Jev刷屏了!发布仅三天,它就被Vercel、Cloudflare和LangChain等主流平台迅速集成,有人说,我们即将迎来自动化智能的大爆发!而这场狂欢的主角,竟然是一个不会说话的大模型。9月16日,ChatGPT核心发明人之一、InstructGPT论文第四作者Diogo Almeida连发长推,直接向行业开炮,...
14:27
就在刚刚,全球顶级AI数学基准测试 FrontierMath 迎来里程碑时刻。一道自2017年以来悬而未决的“重大进展”级开放数学难题,被 GPT-6 Astra 联手三位人类研究员正式攻克!更令人惊讶的是,这道题原本是悬赏寻找一个“反例”,结果 GPT-6 Astra 直接证明:别找了,你们要找的反例压根就不存在!不仅如此,AI 还顺手发明了一套全新的“投...
14:26
2026世界制造业大会于9月20日在安徽合肥隆重开幕。工业和信息化部副部长辛国斌在致辞中强调,工信部将坚定不移地把新一代智能制造作为主攻方向,全面提升制造业的创新力、竞争力和综合实力,致力塑造中国制造的新优势。具体举措包括: 一是提升产业创新体系的效能。聚焦原始创新与关键核心技术攻关,强化企业在科技创新中的主体地位,优化产业创新平台的布局,加速推动科技创新成...
13:56
近日,AI 领域涌现出一个新名字:Jev。自 TypeSafe AI 发布以来,它在社交媒体、GitHub 以及 Agent 开发者圈层中迅速走红。从 40 秒内分析 724 条实时广告,到接入 Claude Code 进行上下文清理,再到作为 Agent 的验收裁判以及浏览器 Agent 的决策核心,Jev 展现了惊人的应用潜力。甚至连 LangChain...
13:56
9月20日,上纬新材旗下的消费级具身智能品牌启元机器人宣布与腾讯WorkBuddy达成战略合作。启元Q1与T1两款机器人正式接入WorkBuddy平台,能够直接调用其中上万种Skill。这一合作将AI的理解与推理能力与机器人的语音及运动能力深度融合,构建起从“听懂指令”到“思考行动”再到“反馈结果”的完整智能交互闭环。 以往,机器人往往只能执行单一的预设动作...
13:56
Claude Code终于不再固执己见。就在刚刚,Claude Code团队核心工程师Thariq在社交媒体上发帖,短短一小时浏览量便突破百万。自2.1.277版本上线以来,如果项目文件夹中缺少CLAUDE.md,Claude会自动寻找并读取AGENTS.md。这一改动在GitHub的更新日志首行便已明确记录。 这条更新,开发者们已经苦苦等待了一年多。在Gi...
13:55
鼓狮财经9月20日讯瑞银目前预计,2026年人工智能资本开支将接近1万亿美元,2027年进一步攀升至约1.4万亿美元,而这一增长背后的最主要原因是内存成本大幅上涨。 全球AI资本开支还将继续飙升 瑞银最新测算结果显示,今年全球AI资本开支总额为9980亿美元,几乎是2025年5060亿美元的两倍;预计明年支出将继续增长至1.447万亿美元,同比增幅达到约44...
13:34
据鼓狮财经9月20日消息,诺和诺德股东正敦促公司通过并购扩大产品组合,以降低利润对糖尿病药物Ozempic的依赖。Flossbach股东分析师Eugen Uretzki指出,诺和诺德现有资产的开发潜力“仍有待验证”。Baillie Gifford投资经理Julia Angeles则表示,公司需要阐明如何摆脱对Ozempic的单一依赖,可能的转型路径包括寻求合...
12:47
“回流药”是指通过医保报销渠道购得的药品,被药贩子低价回收后,再次非法转售至市场的药品。在网络售药平台上,不少售价远低于实体店的药品,实则暗藏“回流药”的风险。 广州医保部门依托“药品追溯码”大数据模型实施预警,对可疑人员的就医轨迹进行深入研判。经过缜密的摸排与连续蹲守,医保部门联合公安机关开展专项行动,成功打掉一个非法收药倒药的犯罪团伙。在查获的仓库内,执...
12:14
过去十年,医疗影像AI行业的叙事主要聚焦于算法能力,如肺结节识别、骨折检测等,各家比拼单病种辅助诊断的准确率和注册证数量。然而,进入2026年,行业竞争维度已发生根本转变。数据开始向云端迁移,接入医保网络,并在跨院调阅和检查互认的真实业务场景中发挥作用。AI影像的价值不再局限于“辅助医生看片”,而是开始重塑医疗数据的流通方式与定价机制。当行业仍在争论算法如何...