AlphaFold 之后的最大震撼终于来了。刚刚,OpenAI 总裁 Greg Brockman 转发的一条消息,瞬间引爆了科技与医药圈。知名科学家 Andrew Agninin 在 X 平台上发布激动人心的消息——在严苛的独立基准测试中,GPT-6 Astra 刚刚击败了所有前沿模型,成为了抗体可开发性预测的最强 AI。

Astra 不仅拿下了跑分第一,还在短短 1 小时内直接手搓出了复杂的抗体机理交互式可视化页面。一直以来,圈内都存在一个共识:「AI for Science,必须是用专用的模型,打专用的问题。」比如 AlphaFold 之于蛋白质折叠,LLM 通常只被当成写代码和读文献的辅助工具。但今天,GPT-6 Astra 将这个共识撕开了一道巨大的口子!它依靠通用智能,直接切入了生物医药研发中最难量化、最令人头疼的临床前死穴。

这一切并非偶然。构建该测试基准的顶尖 AI 制药团队 Insilico Medicine 在 arXiv 上发布了一篇 21 页的重磅论文,标题为《Training Chemical Plausibility-Aware Large Language Models for Single-Step Retrosynthesis》。这篇论文不仅揭开了测试 GPT-6 Astra 的 DDD Benchmark 的严苛性,更展示了从小分子化学合成到大分子抗体预测,通用大模型正在全面接管最硬核的科学边界。

37.98 分!GPT-6 登顶权威「DDD 基准测试」

实测结果显示,GPT-6 Astra 接入 DDD Benchmark 中的抗体可开发性测试模块(综合了 6 种不同的抗体实验数据)后,拿下了惊人的 37.98 分,碾压了所有受测模型。AI 学者 Rim Shayakhmetov 发出惊叹:「专用模型在这个任务上的常规分数是多少?这结果太有趣了,你很难在药物发现的基准测试中,看到前沿的大语言模型在『不依赖外部专用工具』的情况下如此闪耀!」

没有专业生物信息学插件、没有专门做抗体数据微调的情况下,一个通用大模型,居然直接切中了抗体成药性的命脉,这太令人兴奋了。

发现抗体只是开始,「成药」才是真正的死亡之谷

要理解 GPT-6 Astra 这一成绩的含金量,必须先弄懂医药界的一个残酷现实。Andrew 写下了一句直击灵魂的话:「找到一个能结合的抗体仅仅只是开始。它会聚集吗?它能保持稳定吗?它真的能像一个药物那样发挥作用吗?」

这句话道出了全球无数新药研发人员的血泪史。在过去,大家最关注的是「结合力」,也就是抗体能不能精准识别并结合靶点。早期的 AI 模型在「预测结合」上已非常出色,但能结合 $neq$ 能变成药。这就好比谈恋爱,男女双方看对眼了,这只是第一步。能不能走进婚姻殿堂?能不能经受柴米油盐的考验?这就是「成药性」。

在药物研发中,这个考验被称为「成药性」。现实中,无数看似结合力极强的「完美抗体」,一旦进入真实生理环境或工业生产环节,就会暴露出致命缺陷:会不会聚集成团?结构稳不稳定?这些属性统称为抗体可开发性。这是整个生物制药界的「死亡之谷」。全球每年有成千上万个抗体分子在实验室表现优异,却最终倒在「成药性」评估阶段,药企为此烧掉几十亿美金却颗粒无收。

而今天,GPT-6 Astra 宣布,它能比目前任何其他前沿模型,更精准地预测这些成药性特征。

揭秘试金石:GPT-6 Astra 面对的「地狱级」基准测试

这会不会又是一个「刷榜」成绩?绝对不是。Bogdan A. Zagribelnyy 博士指出,Astra 登顶的平台是他们构建的 DDD Benchmark。该测试体系在小分子化学领域同样恐怖。

在论文中,研究团队聚焦了制药界的世纪难题:单步逆合成。简单来说,就是「化学界的倒推法」——给定目标药物分子,倒推出现成的化学原料。过去 AI 评测常采用单一标准答案,但这在现实世界行不通。为此,Insilico 团队构建了令人发指的测试环境:

1. URSA-expert-2026 基准:包含 100 个由机器生成、并由顶尖人类化学专家确认合成可及性的全新分子数据集,与公开训练数据完全隔离。
2. ChemCensor 打分系统:不看是否完美复刻专利,而是从反应中心映射、官能团兼容性等底层化学物理规则出发,判断反应的化学合理性。

在这种物理/化学规律考核下,传统的 LLM 几乎都失败了。早期的 Top-1 测试中,即使是 GPT-5.5、Gemini 3.1 Pro,其表现也难以超越最顶尖的专用传统化学模型。

4500 万数据,LLM 被「逼出」科学直觉的?

通用 LLM 拼不过专用模型,怎么办?论文给出的答案震撼业界——不要换模型,换一种激发通用模型潜力的方法。研究团队提出了三大杀招:

第一招:Top-K 提示词范式。既然逆合成是「一对多」,就不让 LLM 只猜一次。团队要求「给我 15 种不同的答案」。奇迹出现了,几乎所有大模型在化学合理性和多样性上迎来爆发式增长。Gemini 3.1 Pro 在 Top-15 模式下性能飙升,成为最强 LLM 基线。这证明大模型是有科学知识的,只是提问方式不对。

第二招:构建 4560 万规模的超大核验数据集(CREED-CCV-2+USPTO-XL)。团队利用虚拟合成引擎和 ChemCensor 框架,构建了一个包含约 4560 万个经过验证的真实化学反应的超大规模数据集。

第三招:强化学习中的「新颖性」奖励。微调 C3LM 模型时,引入了 GRPO 强化学习算法。奖励函数极其刁钻:不仅要符合 ChemCensor 的化学合理性,如果模型能想出一种连 4500 万训练集里都没有但依然合理的全新反应,将获得额外巨大奖励。

结果是,经过这种「地狱级」训练的 C3LM 模型,在 URSA-expert-2026 盲测中一举击败了 MHNreact 等所有传统专用 SSRS 模型!数据分析显示,C3LM 和其他基础大模型能够探索出与传统模型完全互补的反应空间,生成了大量传统模型想不到的独特路径。

降维打击:从 C3LM 到 GPT-6 Astra,通用智能的全面接管

看懂了这篇论文,就会明白 Bogdan 博士为何将 GPT-6 Astra 的成绩与此联系起来。团队费尽周折,用 4500 万条数据微调、用强化学习对齐、用 Top-K 提示词引导,才终于让大模型在小分子化学合成上打败了专用模型。

然而,当测试赛道切换到更加复杂、维度更高的大分子可开发性预测时,GPT-6 Astra 居然在「没有使用外部工具」的情况下,直接在同样的 DDD Benchmark 测试体系下登顶,拿下了 37.98 分!这绝对是降维打击。

过去,解决抗体稳定性问题需要专业团队设计专门的三维图神经网络。而现在的 GPT-6 Astra,其通用世界模型似乎已经内化了物理、化学、生物的底层逻辑。它在阅读了人类历史上浩如烟海的论文、专利、实验数据,甚至通过多模态学习了微观世界的物理法则后,已经能像人类专家一样「直觉」判断蛋白质分子在溶液中的行为。

此外,Astra 展现出的工程效率同样令人胆寒。Andrew Agninin 提到:「顺便提一下,这个展示抗体实际工作原理的交互式可视化页面,也是用 Astra 在大约 1 小时内建好的。」在传统药企,做这样一个系统流程少说也要两三周。现在,1 小时,一个人,一个通用大模型,就解决了。

AlphaFold 之后,真正的范式转移

GPT-6 在抗体基准上的跑分第一,宣告着通用大模型已经显出 AGI 雏形,在人类最顶尖智力活动中取得了实质性统治。这个榜单第一,宣告了这个新时代的到来——未来十年,科学发现的核心驱动力,可能不再是为每一个孤立的科学问题定制一个专门的 AI 模型;而是学会如何向一个如同神明般的 ASI 提出正确的 prompt。

小分子逆合成被突破了,大分子抗体成药性被突破了。从新药研发到材料科学,从聚变控制到量子物理,通用大模型的外溢红利,即将如海啸般席卷所有硬核行业。

最新快讯

2026年09月11日

18:08
鼓狮财经9月11日讯,中巨芯公告披露,公司计划动用自有资金1亿元,联合外部投资者共同向参股公司晶恒希道进行增资。本次增资总额达2.8亿元,定价标准为每元注册资本1.3025元。由于公司董事、总经理陈刚担任晶恒希道董事长,此次交易被界定为关联交易。增资完成后,中巨芯在晶恒希道的持股比例将由44.75%下调至不低于36.9554%,公司仍将保持参股地位。目前,该...
18:08
据鼓狮财经9月11日消息,恒瑞医药(600276.SH)发布公告披露,其子公司苏州盛迪亚生物医药有限公司研发的注射用瑞康芦泽妥塔单抗,已正式被国家药监局药审中心纳入突破性治疗药物名单。 该药物拟定的适应症为联合贝伐珠单抗,用于治疗EGFR突变引起的局部晚期或转移性非鳞状非小细胞肺癌。作为一种以HER3为靶点的抗体药物偶联物,该药在全球范围内尚无同类获批产品,...
18:08
鼓狮财经9月11日讯,黄山旅游(600054.SH)发布公告,公司董事长章德辉因职务变动原因,向董事会提交了书面辞职报告。根据该报告,章德辉辞去公司第九届董事会董事长、董事及董事会下设各专门委员会的相关职务。鉴于此次辞职未导致公司董事会成员低于法定人数,且不影响董事会的正常运作,辞职报告自送达董事会之日起正式生效。
18:08
鼓狮财经9月11日报道,天通股份(600330.SH)发布公告,为推进全球化战略布局,公司正筹划在香港联交所主板发行H股并上市。截至公告披露时,相关具体细节尚未确定,此次上市不会导致控股股东及实际控制人发生变更。 后续,该方案需经公司董事会及股东会审议,并获得证监会、香港联交所等监管机构的批准或备案。最终能否落地实施,仍存在不确定性。
17:53
去年10月28日,OpenAI刚完成营利实体重组,奥特曼和首席科学家Jakub Pachocki开了一场直播。奥特曼在直播里撂下一句话:与其天天吵AGI到底怎么定义,倒不如定两个能真正兑现的日子。紧接着,Pachocki就把日子报了出来:2026年9月,自动化AI研究实习生上岗。2028年3月,自动化AI研究员就位。十个多月过去,第 一个日...
17:53
当地时间9月10日,也门胡塞武装发言人宣布将展开重大军事行动。据法新社报道,胡塞武装在夺取红海战略要地后,已完全控制曼德海峡。曼德海峡连接红海与亚丁湾,是通往印度洋、苏伊士运河和欧洲的关键海上通道,全球约10%的贸易均需经由此处。这意味着全球能源运输正面临来自阿拉伯半岛两端的压力:伊朗在霍尔木兹海峡的干扰威胁着波斯湾航线,而胡塞武装对曼德海峡的掌控,则为经红...
17:22
2026年,随着Vibe Coding工具的普及,绝大多数AI应用仍被困在流量闭环之中。普通开发者制作的软件多局限于小圈层传播,难以触达更广泛的大众用户。分发,始终是横亘在AI应用赛道前的一道结构性难题。这一局面正被几家内容平台共同打破。抖音内测“AI工坊”,将AI应用直接推入首页推荐流;小红书允许AI工具挂载于笔记下方;腾讯旗下的“吐司”则打通了从生成应用...
17:22
最近,互联网巨头之间刮起了一阵关于AI的“反思风”。在最近的一次会议上,美团CEO王莆中承认内部AI推广存在浪费,单日算力成本最高冲到一千万元,模型产出的谬误反而干扰了真实经营。与此同时,腾讯集团高级执行副总裁汤道生在内部文章中反思,WorkBuddy的前身CodeBuddy曾差点因降本增效被砍掉,他庆幸项目得以保留,表示“熬得久比起得早更重要”。一边是反思...
16:58
**世界模型:通往物理智能的核心基建与争议** 香港大学计算与数据科学学院副院长、副教授罗平在外滩大会上表示:“世界模型或许不是通往物理智能唯一的门票,但它绝对是目前人类赋予机器空间想象力、常识推演与行动预测最具希望的核心基建。”作为连接数字空间与物理世界的一把钥匙,世界模型被寄予厚望的同时,也面临着诸多争议,包括定义模糊、数据规模、架构设计以及商业化可持续...