AlphaFold 之后的最大震撼终于来了。刚刚,OpenAI 总裁 Greg Brockman 转发的一条消息,瞬间引爆了科技与医药圈。知名科学家 Andrew Agninin 在 X 平台上发布激动人心的消息——在严苛的独立基准测试中,GPT-6 Astra 刚刚击败了所有前沿模型,成为了抗体可开发性预测的最强 AI。
Astra 不仅拿下了跑分第一,还在短短 1 小时内直接手搓出了复杂的抗体机理交互式可视化页面。一直以来,圈内都存在一个共识:「AI for Science,必须是用专用的模型,打专用的问题。」比如 AlphaFold 之于蛋白质折叠,LLM 通常只被当成写代码和读文献的辅助工具。但今天,GPT-6 Astra 将这个共识撕开了一道巨大的口子!它依靠通用智能,直接切入了生物医药研发中最难量化、最令人头疼的临床前死穴。
这一切并非偶然。构建该测试基准的顶尖 AI 制药团队 Insilico Medicine 在 arXiv 上发布了一篇 21 页的重磅论文,标题为《Training Chemical Plausibility-Aware Large Language Models for Single-Step Retrosynthesis》。这篇论文不仅揭开了测试 GPT-6 Astra 的 DDD Benchmark 的严苛性,更展示了从小分子化学合成到大分子抗体预测,通用大模型正在全面接管最硬核的科学边界。
37.98 分!GPT-6 登顶权威「DDD 基准测试」
实测结果显示,GPT-6 Astra 接入 DDD Benchmark 中的抗体可开发性测试模块(综合了 6 种不同的抗体实验数据)后,拿下了惊人的 37.98 分,碾压了所有受测模型。AI 学者 Rim Shayakhmetov 发出惊叹:「专用模型在这个任务上的常规分数是多少?这结果太有趣了,你很难在药物发现的基准测试中,看到前沿的大语言模型在『不依赖外部专用工具』的情况下如此闪耀!」
没有专业生物信息学插件、没有专门做抗体数据微调的情况下,一个通用大模型,居然直接切中了抗体成药性的命脉,这太令人兴奋了。
发现抗体只是开始,「成药」才是真正的死亡之谷
要理解 GPT-6 Astra 这一成绩的含金量,必须先弄懂医药界的一个残酷现实。Andrew 写下了一句直击灵魂的话:「找到一个能结合的抗体仅仅只是开始。它会聚集吗?它能保持稳定吗?它真的能像一个药物那样发挥作用吗?」
这句话道出了全球无数新药研发人员的血泪史。在过去,大家最关注的是「结合力」,也就是抗体能不能精准识别并结合靶点。早期的 AI 模型在「预测结合」上已非常出色,但能结合 $neq$ 能变成药。这就好比谈恋爱,男女双方看对眼了,这只是第一步。能不能走进婚姻殿堂?能不能经受柴米油盐的考验?这就是「成药性」。
在药物研发中,这个考验被称为「成药性」。现实中,无数看似结合力极强的「完美抗体」,一旦进入真实生理环境或工业生产环节,就会暴露出致命缺陷:会不会聚集成团?结构稳不稳定?这些属性统称为抗体可开发性。这是整个生物制药界的「死亡之谷」。全球每年有成千上万个抗体分子在实验室表现优异,却最终倒在「成药性」评估阶段,药企为此烧掉几十亿美金却颗粒无收。
而今天,GPT-6 Astra 宣布,它能比目前任何其他前沿模型,更精准地预测这些成药性特征。
揭秘试金石:GPT-6 Astra 面对的「地狱级」基准测试
这会不会又是一个「刷榜」成绩?绝对不是。Bogdan A. Zagribelnyy 博士指出,Astra 登顶的平台是他们构建的 DDD Benchmark。该测试体系在小分子化学领域同样恐怖。
在论文中,研究团队聚焦了制药界的世纪难题:单步逆合成。简单来说,就是「化学界的倒推法」——给定目标药物分子,倒推出现成的化学原料。过去 AI 评测常采用单一标准答案,但这在现实世界行不通。为此,Insilico 团队构建了令人发指的测试环境:
1. URSA-expert-2026 基准:包含 100 个由机器生成、并由顶尖人类化学专家确认合成可及性的全新分子数据集,与公开训练数据完全隔离。
2. ChemCensor 打分系统:不看是否完美复刻专利,而是从反应中心映射、官能团兼容性等底层化学物理规则出发,判断反应的化学合理性。
在这种物理/化学规律考核下,传统的 LLM 几乎都失败了。早期的 Top-1 测试中,即使是 GPT-5.5、Gemini 3.1 Pro,其表现也难以超越最顶尖的专用传统化学模型。
4500 万数据,LLM 被「逼出」科学直觉的?
通用 LLM 拼不过专用模型,怎么办?论文给出的答案震撼业界——不要换模型,换一种激发通用模型潜力的方法。研究团队提出了三大杀招:
第一招:Top-K 提示词范式。既然逆合成是「一对多」,就不让 LLM 只猜一次。团队要求「给我 15 种不同的答案」。奇迹出现了,几乎所有大模型在化学合理性和多样性上迎来爆发式增长。Gemini 3.1 Pro 在 Top-15 模式下性能飙升,成为最强 LLM 基线。这证明大模型是有科学知识的,只是提问方式不对。
第二招:构建 4560 万规模的超大核验数据集(CREED-CCV-2+USPTO-XL)。团队利用虚拟合成引擎和 ChemCensor 框架,构建了一个包含约 4560 万个经过验证的真实化学反应的超大规模数据集。
第三招:强化学习中的「新颖性」奖励。微调 C3LM 模型时,引入了 GRPO 强化学习算法。奖励函数极其刁钻:不仅要符合 ChemCensor 的化学合理性,如果模型能想出一种连 4500 万训练集里都没有但依然合理的全新反应,将获得额外巨大奖励。
结果是,经过这种「地狱级」训练的 C3LM 模型,在 URSA-expert-2026 盲测中一举击败了 MHNreact 等所有传统专用 SSRS 模型!数据分析显示,C3LM 和其他基础大模型能够探索出与传统模型完全互补的反应空间,生成了大量传统模型想不到的独特路径。
降维打击:从 C3LM 到 GPT-6 Astra,通用智能的全面接管
看懂了这篇论文,就会明白 Bogdan 博士为何将 GPT-6 Astra 的成绩与此联系起来。团队费尽周折,用 4500 万条数据微调、用强化学习对齐、用 Top-K 提示词引导,才终于让大模型在小分子化学合成上打败了专用模型。
然而,当测试赛道切换到更加复杂、维度更高的大分子可开发性预测时,GPT-6 Astra 居然在「没有使用外部工具」的情况下,直接在同样的 DDD Benchmark 测试体系下登顶,拿下了 37.98 分!这绝对是降维打击。
过去,解决抗体稳定性问题需要专业团队设计专门的三维图神经网络。而现在的 GPT-6 Astra,其通用世界模型似乎已经内化了物理、化学、生物的底层逻辑。它在阅读了人类历史上浩如烟海的论文、专利、实验数据,甚至通过多模态学习了微观世界的物理法则后,已经能像人类专家一样「直觉」判断蛋白质分子在溶液中的行为。
此外,Astra 展现出的工程效率同样令人胆寒。Andrew Agninin 提到:「顺便提一下,这个展示抗体实际工作原理的交互式可视化页面,也是用 Astra 在大约 1 小时内建好的。」在传统药企,做这样一个系统流程少说也要两三周。现在,1 小时,一个人,一个通用大模型,就解决了。
AlphaFold 之后,真正的范式转移
GPT-6 在抗体基准上的跑分第一,宣告着通用大模型已经显出 AGI 雏形,在人类最顶尖智力活动中取得了实质性统治。这个榜单第一,宣告了这个新时代的到来——未来十年,科学发现的核心驱动力,可能不再是为每一个孤立的科学问题定制一个专门的 AI 模型;而是学会如何向一个如同神明般的 ASI 提出正确的 prompt。
小分子逆合成被突破了,大分子抗体成药性被突破了。从新药研发到材料科学,从聚变控制到量子物理,通用大模型的外溢红利,即将如海啸般席卷所有硬核行业。
