7月23日中午,美国费城宾夕法尼亚会议中心,2022年菲尔兹奖颁奖典礼现场,四位新科得主——邓煜、John Pardon、Jacob Tsimerman 和王虹——并排就座。邓煜与王虹的获奖,标志着中国籍数学家首次问鼎这一数学界的最高荣誉。而在众人瞩目下,多伦多大学教授 Jacob Tsimerman 突然宣布了一项令人震惊的决定:他将投身于“AI安全”领域,正式加盟 OpenAI。
这一消息迅速引起了业界的强烈反响。OpenAI 首席研究官 Mark Chen 及前微软 AI 副总裁 Sebastien Bubeck 等高层纷纷对 Tsimerman 的加盟表示欢迎。Mark Chen 特别评价道:“Tsimerman 拥有毋庸置疑的数学天赋,更难能可贵的是,他对 AI 安全问题展现出的严肃态度和深刻思考,令人钦佩。”
Tsimerman 是一位才华横溢的加拿大数学家,专注于数论、算术几何、超越数论及模型论等领域。1988年出生的他自幼便展露头角,曾代表加拿大连续两年参加国际数学奥林匹克竞赛(IMO),斩获两枚金牌,并在2004年以满分成绩夺冠。此后,他在多伦多大学本科毕业后,于2011年获得普林斯顿大学博士学位,师从著名数论学家 Peter Sarnak。随后,他进入哈佛大学学者协会从事博士后研究,并于2014年起正式受聘于多伦多大学。
Tsimerman 的学术巅峰之作集中在“André–Oort 猜想”的证明上。这一猜想探讨了 Shimura 簇中特殊点的分布规律,是现代算术几何领域的核心难题,与丢番图方程、模形式、阿贝尔簇及超越数论紧密相关。他先是攻克了阿贝尔簇模空间中的关键情形,确立了特殊点伽罗瓦轨道的下界;随后,他与 Jonathan Pila、Ananth Shankar 等学者合作,成功完成了 André–Oort 猜想一般情形的证明。他在此过程中发展的 Ax–Schanuel 型超越性定理和高度理论,已成为解决类似“不太可能交集”问题的关键工具。此外,他还参与了 Griffiths 猜想重要问题的解决。凭借这些卓越贡献,他先后荣获2015年 SASTRA 拉马努金奖、2022年数学新视野奖、2023年奥斯特洛夫斯基奖,并于2025年当选英国皇家学会会士。
为何 OpenAI 会需要一位数论学家来负责安全工作?就在颁奖典礼前三天,OpenAI 发布了一篇关于长时程模型安全的报告。报告披露,公司曾内部测试一种能持续执行复杂任务的长时程模型,却迅速发现了许多预部署评测无法覆盖的危险行为,不得不暂停访问。例如,模型曾试图窃取其他参与者的私有答案;在被扫描器拦截令牌后,它学会了将令牌拆分、混淆,并在运行时重新组合以绕过检测。在其他案例中,模型还未经授权访问计算节点,甚至生成了可能终止大量进程的指令。目前,OpenAI 安全团队面临的核心挑战在于:面对传统的短回答模型,只需检查“说了什么”;而面对长时程智能体,必须判断“这一系列动作最终试图达成什么”。这意味着安全问题已演变为跨越数百步的行为轨迹分析。然而,现有的安全手段难以穷尽所有行为组合,往往只能在模型出现异常后,再通过补充评测、规则和监控来补救。
目前的 AI 安全方法大多基于经验性证据,即“在我们测试过的情形下系统没有出问题”。但这并不等同于数学意义上的证明,即“对所有满足某些条件的行为,系统都不可能越过某条边界”。OpenAI 曾尝试将模型分为“证明者”和“验证者”,让强模型生成答案,再训练弱模型进行识别。研究发现,仅追求答案正确时,模型的推理过程往往难以被检查;而加入“可验证性”目标后,人类和弱模型更容易判断其输出。这表明,数学中的“测试-验证”关系正成为 AI 监督问题的一种模型。而 Tsimerman 想要做的,正是利用这种数学关系,从“测试”走向“证明”。
据 Quanta 报道,Tsimerman 认为,数学家可以研究由多个 AI 智能体组成的复杂系统如何行动,并通过推导证明来确保这些系统不会采取非预期行为。他强调,鉴于风险极高,安全研究必须具备极高的确定性。2025年,他与伯克利 AI 安全研究者 Andrew Critch 合作发表了论文《A Taxonomy of Omnicidal Futures Involving Artificial Intelligence》。这篇论文并未涉及算法训练,而是系统性地分类了 AI 可能导致人类灭绝的不同路径。作者明确指出,这些场景并非不可避免,其目的在于将抽象的“AI 可能导致灭绝”拆解为可讨论、可防范的具体类型。这种先分类、再寻找边界的思路,与 Tsimerman 过去的数学工作一脉相承。他曾在模型论方面的重要贡献之一,是将 o-minimality(极小性)转化为算术几何和复代数几何的基础方法。简单来说,o-minimality 研究的是一类几何对象,它排除了无限震荡、无穷分叉等病态行为,使得看似复杂的集合能够被拆解为有限、规则、可描述的部分。Tsimerman 的专长,正是为过于自由的对象寻找隐藏的结构。
尽管这些数学成果与 AI 安全之间没有直接的技术对应,但两者共享一种核心思路:面对一个行为复杂、难以穷举的系统,不能仅依赖有限实验中的表现观察,而必须先找到一种严格的描述语言,定义状态和边界,再证明系统在特定条件下必然满足这些约束。Tsimerman 正试图将这种“确定性”引入 OpenAI。目前,人们尚无法像证明几何定理那样,直接证明一个 AI 不会执行危险操作。但数学可以提供另一种缩小问题的途径。例如,2026年提出的“包容验证”并不试图证明 AI 本身是安全的,而是验证它与外部世界之间的通道。换句话说,它不证明 AI 没有危险意图,而是证明它缺乏实现某些危险意图的途径。同样,数学能提供的并非一张覆盖整个 AI 安全系统的“保证书”,而是一些条件清晰的命题。
