谷歌的AI科学家,也开始探索物理世界了!
近日,谷歌Google DeepMind发布了旗下AI科研多智能体助手Co-Scientist的全新扩展版本的预印本《Accelerating Scientific Research with Gemini in the Real-World》(arXiv 2608.26701)。
此次升级聚焦在执行层面,原有的Co-Scientist已经能生成假设,而新版本开始从代码层面、在实验室中运行这些假设。
并且它还能对照原始的实验日志审核自己的手稿,并成功地将严重的方法学幻觉从基线模型的100%降低到24%。
并在材料科学(AI输出方案+人类执行)、生物学(人类+AI协作)、计算机科学(AI自主)、论文研究(AI自主)四个领域完成了验证。
01、一小时完成实验任务 刷榜战胜GPT-5
在今年五月发布的初版中,Co-Scientist就已经在提出假设的环节表现相当优秀,能自主生成假设、验证、完善结果等全科研流程。
这部分能力被集成为了三大智能体系统中的Ideation(构思 / 假设生成),此次更新的主要亮点在新增的Experimentation(实验执行)环节,以及Paper Writing(论文撰写)对幻觉率的大幅降低。
实验执行环节的*亮点是,Co-Scientist不仅能输出实验室设备可运行的Python等代码,还成功输出了实验室设备可读取的硬件指令。
*的例子来自于材料科学,被AI接管的是一台半自动化学气相沉积(CVD)炉。
在真实的实验室中,参数受到设备个体差异影响。同样的温度、气体、前驱体参数,换一台炉子就会得出迥异的成果,研究人员往往需要用几个月时间反复调参。
Co-Scientist主要就接管了这个调参数的工作,只需要把设备、位置、气体流量和温度曲线等参数提供给AI,让他直接输出数字参数去控制硬件。
结果是在寻找二维材料MXenes的任务中,AI成功在实验人员的协助下,提出了一条有科学意义的候选合成路线;而另一组关于二维半导体MoS₂、MoSe₂和WS₂的实验中,AI接管下仅用一次实验、总用时一小时就成功长出了单层晶体。
在生物学方面,Co‑Scientist基于有限的成像数据,预测了经过改造的大肠杆菌集群表型,结果与湿实验室结果基本吻合,有望减少大量重复湿实验筛选工作量。
计算科学的自主化程度最高,Co‑Scientist 直接自主写出了一个名为Agent H的医疗AI智能体,在HealthBench Hard和Professional评测中击败了包括Gemini 3.1 Pro 和GPT-5在内的六款前沿模型。
不过值得注意的是,这个智能体在医生盲评中评价不算高,计算开销也很大,只是特别擅长于Benchmark分数的刷榜。
论文撰写环节则是绑定了之前实验阶段完整执行日志作为事实证据源,加入一整套可靠性校验机制,有效解决AI科研写作幻觉、剽窃、图表质量差的问题。
02、三家AI龙头 打响基础设备争夺战
一周内,三家AI龙头密集发布了将AI4S推向物理世界的新战略及新成果。
Anthropic拿出了模型硬件标准(Model Hardware Standard,简称 MHS)探索用AI Agent驱动的自主实验室。
该标准旨在把AI和硬件设备之间的通信统一成一套通用语言,这样任何设备都能被理解和调用,而不需要为每台设备单独写”翻译程序”。
OpenAI则交出了Rosalind Workbench,一款专门为生命科学研究者打造的AI工作台。
它基于Rosalind模型的智能与一系列新的生命科学插件和工具相结合,将 Codex 转变为真正的AI科学家。
如今谷歌对旗下Co-Scientist的升级也瞄准了同一个终点,那就是让AI不止步于提出科学猜想,分析实验数据,而是能够直接指挥真实世界里的实验设备。
三家公司切入的路径并不相同,但方向高度一致。AI4S的下一场竞争,已经不只是模型之间的竞争,而是围绕“AI如何进入物理世界”展开的基础设施争夺战。
而与之相关的硬件接口、实验设备,到自动化实验室、标准化协议,再到能够理解实验意图并完成设备调度的Agent,都将成为这一基础设施层的关键拼图。
