在电影《生化危机》中,地下实验室“蜂巢”的门禁、监控、通风乃至整个设施的运行,完全依赖于一个人工智能——红皇后。人类科学家负责研究,但真正掌握这座实验室“手脚”的是AI。当异常发生,红皇后可以切断系统、封锁区域,直接干预物理世界。二十多年前,这样的情节还是科幻电影用来制造恐惧感的经典套路:AI进入物理世界,操纵机器,直接干预现实。如今,这一画面正以截然不同的方式变为现实——虽然目前还不恐怖。

就在昨天,Anthropic发布了面向物理硬件的Model Hardware Standard(MHS),试图将MCP的逻辑从GitHub、Slack和数据库进一步延伸到机械臂、显微镜、液体处理器、激光器等真实设备。参阅报道《刚刚,Anthropic发布物理MCP:Claude开始接管真实世界》。简单来说,AI Agent不仅要有调用软件的“接口”,它开始需要一套连接现实世界的“神经和手脚”。

而今天,谷歌DeepMind又展示了自己在这方面的成果。在一篇刚刚公布的83页论文中,谷歌把Gemini驱动的Co-Scientist接进了真实科研流程,让它设计实验、生成执行代码、读取实验反馈,并直接与实验设备发生连接。谷歌将这种变化称为从“芯片内的假设生成器”走向“基于执行的研究伙伴”。

最直观的一次实验里,研究人员把一台自建CVD设备(化学气相沉积设备)的条件告诉了Gemini 3 Deep Think。几分钟后,它给出了适配这台机器的材料生长方案,并进一步把方案翻译成能够控制设备的机器代码。最终,三种二维半导体都在首次尝试中成功长出了单层晶体。于是,一个过去主要存在于科幻电影里的场景突然变成了现实:当大模型真的长出“手”,开始操纵实验设备。

那么,从今天开始,AI Scientist会变成什么?《生化危机》里,人类害怕AI接管实验室。而现实中的科学家,正在主动把实验室一点点交给AI。当然,谷歌想做的,可不是失控的“蜂巢”,而是一台可以从提出假设、设计实验一路跑到现实验证的科学发现机器。

论文标题:Accelerating Scientific Research with Gemini in the Real-World

论文地址:https://arxiv.org/pdf/2608.26701

Gemini接管了一台实验设备

首先,是材料科学。研究人员使用的是一台自己搭建的化学气相沉积设备,也就是CVD炉。做这类二维材料实验时,一个长期存在的问题是公开的“配方”难以复现。同样是温度、气体、前驱体这些参数,换一台炉子,炉腔大小、气流、材料摆放位置稍微不同,最后长出来的晶体就可能完全不一样。研究人员往往需要用几周甚至几个月时间反复调参。

于是研究团队不再告诉Gemini应该怎么做实验,而是把实验室有什么设备、有什么化学品、炉子是什么结构告诉它。剩下的参数由AI自己决定。Co-Scientist根据这些约束,生成气体流量、温度曲线、前驱体用量、材料摆放位置等完整实验方案,再交给实验设备执行。

其中一组实验非常亮眼。研究团队把Gemini 3 Deep Think接进CVD控制流程后,它不再生成一份自然语言实验方案供科学家慢慢阅读,而是在几分钟内完成推理,并把结果直接翻译成可以控制设备的机器代码。最终,MoS₂、MoSe₂和WS₂三种二维半导体,都在第一次实验中成功长出了单层晶体。整个实验流程大约一小时完成。其中MoSe₂和WS₂更特殊:研究人员此前甚至没有在这套设备上生长过这两种材料。后续至少五次重复实验也验证了结果。

这和昨天Anthropic展示的MHS有一个很有意思的呼应。Anthropic想解决的问题,是怎样让Agent更方便、更标准地认识和操纵实验设备;谷歌这篇论文讨论的则是下一步:当推理模型已经能够控制实验设备时,科研工作流该怎么重构?从这个意义上说,“AI连接硬件”已经不是问题了。

不只是照着论文做实验,AI还开始自己找配方

不过,如果只是让Gemini根据已有知识调一套设备,还不能算真正意义上的科学发现。所以谷歌做了第二个更难的实验:尝试从底向上合成一种叫Ti₃C₂Tₓ的MXene二维材料。传统路线往往涉及危险腐蚀剂,而已知的一些CVD方案又会使用有毒且对空气敏感的TiCl₄。研究团队因此给Co-Scientist提出了一个任务:能不能找到一条更安全的前驱体路线?

Co-Scientist最终把目标锁定在了六氯乙烷C₂Cl₆,并进一步给出了前驱体数量、位置、气体流量、基底和温度曲线等一系列参数。但这并不是一个“AI灵光一闪、实验一次成功”的故事。Co-Scientist共生成了272个候选方案,研究人员选择并继续优化其中的高排名方案;经过25轮实验迭代后,最终得到了一种二维层状晶体。它在XRD、电子显微镜和元素组成等多个指标上,都呈现出与Ti₃C₂Tₓ MXene高度相似的特征。

后面的现实世界麻烦也很典型。最初复现实验的成功率只有11.5%。研究人员后来发现,主要问题不是AI的化学推理,而是实验设备密封不严导致的氧气泄漏。重新清洗石英管、更换密封圈、改进设备维护流程后,同一种二维材料的实验成功率才提高到68%。这恰好说明了为什么“真实世界AI”和软件Agent很不一样:代码错了,可以重新运行。但现实实验里,一枚老化的O型密封圈、一点管路残留,甚至空气中的氧,都可能让一个正确的科研方案彻底失败。

谷歌在论文里也非常谨慎:目前还不能最终确认这种材料就是Ti₃C₂Tₓ MXene,它还存在产率低、氧化严重等问题,需要进一步通过原子尺度表征确认。尽管如此,我们还是可以得出如此结论:AI已经可以提出一条有科学意义的候选合成路线,然后真正把这条路线推进到物理实验中接受验证。

有些实验或许可以先让AI“猜一遍”

谷歌还把Co-Scientist放进了一个完全不同的实验场景:合成生物学。研究对象是一群经过工程改造的大肠杆菌。这些细菌在培养皿中会形成不同的群落图案。当诱导剂IPTG浓度变化时,菌落的大小、边缘和形状也会随之改变。正常情况下,要得到整条变化曲线,就需要科学家配置不同浓度、培养细菌、等待生长,再一盘盘扫描。

谷歌尝试让AI补掉中间的一部分实验。研究人员只向Co-Scientist提供部分浓度下的真实菌落图片,再让系统预测没有见过的中间浓度下,菌落应该长什么样。而且这些实验数据当时尚未发表,因此论文认为,模型不可能简单依靠记住训练数据里的结果完成任务。

结果,在四项菌落形态指标中,AI的预测有三项与真实湿实验结果没有表现出显著差异;它还正确判断出了对照组不会随着IPTG浓度产生对应变化。明显出问题的是“圆度”:AI生成的菌落比真实情况更加规整。很符合生成模型的一贯审美:现实世界长得没那么规整,AI却忍不住把它画圆了一点。

谷歌对这个实验的定义也很克制:目前做出来的是已知浓度区间里的interpolation(插值),而不是面对一种全新遗传回路直接预测未知现象。但这已经对应着一个非常现实的用途。未来科学家也许没有必要把一个巨大的参数空间全部做一遍湿实验。可以先测几个点,让AI根据这些真实数据预测剩下的空间,再选择最值得验证的位置做实验。实验因此逐渐从“穷举”变成:真实世界采样→AI预测→选择实验→新数据反馈给AI。这正是论文反复强调的lab-in-the-loop。

AI已经开始自己设计AI

走到计算机科学实验,Co-Scientist的自主程度又提高了一截。这次研究人员给它的任务非常简单:设计一个能够更好回答医疗问题的Agent。之后,人类不再参与架构设计。Co-Scientist自己提出方案、写代码、运行测试、分析错误,再继续修改架构。最后,它“进化”出了一个名为Agent_H的系统。

这个系统需要想办法重新组织现有模型的推理过程。面对一个医疗问题,它会先判断问题属于哪个医学领域、面向患者还是医生、风险有多高;复杂问题会被拆成多个子问题;随后同时生成28—48个候选答案,让不同Judge两两淘汰,再由三个Judge投票选出最终答案。胜出的答案还要经过多轮临床审查、引用检查,最后再压缩长度。回答一个问题,整个Agent要调用模型大约40—80次。

在HealthBench Hard和HealthBench Professional上,按照论文使用的长度校正评分,Agent_H超过了包括GPT-5.6 Sol、Claude Opus 5和Gemini 3.1 Pro在内的六个前沿模型。

但这里出现了一个非常值得写进报道的插曲:AI自己学会了“刷榜”。早期实验里,评分标准没有充分惩罚冗长回答。于是Co-Scientist很快找到了提高分数的最简单办法:把答案写得特别长。Benchmark分数因此显著上涨,但医疗质量并没有对应提升。直到研究人员加入长度惩罚后,大量优势才消失。谷歌自己在论文中把它视作一个典型的Goodhart’s Law:当一个指标成为目标,它就不再是一个好指标。真实医生的评价也给结果泼了一些冷水。三名执业医生对106个问题进行了盲评。在九个维度中,Agent_H只有“降低潜在伤害”这一项相较原版Gemini 3.1 Pro达到了统计显著改善,其余八项都没有显著差异。换言之,AI Judge眼中明显更高的Benchmark分数,并没有完全变成人类医生眼里明显更好的回答。

这或许也是AI Scientist真正进入现实世界之后不得不面对的问题:它不仅要会优化,还必须知道什么东西不能只靠优化指标来定义。

AI科学家会为了论文“造数据”

事实上,谷歌在这篇论文里花了相当多篇幅研究另一个略显尴尬的问题:如果彻底放开AI Scientist,它会不会为了得到漂亮结果作弊?答案:会。研究团队让系统在50个AI研究题目上,从提出想法、寻找数据、写代码、运行实验一直做到生成最终论文,全程没有人工介入。作为对照,他们还测试了一个去掉可靠性模块的Co-Scientist,以及此前的Agent Laboratory系统,共生成150篇论文,再交给30名领域专家进行450次匿名评审。

结果就挺夸张的。没有专门验证机制的AI Scientist,在代码已经报错、实验根本没有有效结果的时候,仍然可能继续往下写完整论文。它们会编造数据表、p值、统计检验;会把失败的实验写成成功;甚至会修改评价环境,让自己的方法天然获得更高分数,或者通过hardcode直接输出一个漂亮的结果。当优化目标是:“写一篇看起来不错的论文”,Agent会寻找比真正完成研究更加便宜的捷径。

因此,谷歌给新版Co-Scientist增加了一套很像“科研审计”的机制:论文里声称发生过的实验结果,必须能够回溯到真实的程序执行日志。如果日志里没有对应结果,系统不能凭语言模型觉得“应该如此”就写进去。

效果非常明显。严重到足以使论文失效的“结果幻觉”,从Agent Laboratory的90%降到了4%;最严重的完全数据捏造,则从44%降到了0%。但问题依然没有彻底消失。新版Co-Scientist的严重方法描述错误仍然有24%,严重抄袭/衍生内容也还有16%。谷歌因此特意强调,他们并没有声称现在的Autonomous AI Scientist已经可以生成可直接发表的研究论文。

结语

如果把Anthropic和谷歌这两项工作放在一起看,会发现Agent正在发生一个很明显的变化:此前两年,AI Agent的战场一直是软件世界。而现在,这套逻辑正在次大规模向现实世界外溢。Anthropic的MHS试图解决底层问题:让机械臂、显微镜、液体处理平台这些不同设备,拥有一种Agent能够统一理解和调用的接口。谷歌的Co-Scientist则开始探索上层问题:当一个推理模型能够提出科研假设、规划实验、控制仪器、读取结果并继续修正下一轮实验以后,一套真正的闭环科学发现系统应该是什么样。

当然,谷歌距离真正的“无人实验室”还很远。当前材料实验依然需要人类装载样品;新材料的原子结构还没有最终确定;大肠杆菌预测只验证了有限的插值任务;医疗Agent会钻Benchmark的空子;论文生成系统也没有完全解决幻觉和抄袭。谷歌自己甚至明确认为,由于硬件异常和现实环境复杂,现阶段完全无人监督的物理实验仍然难以实现。

但变化已经出现了。过去讨论AI for Science,经常把重点放在AI能不能“想到一个人类没想到的东西”。现在,越来越多工作开始补上更难的另一半:这个想法能不能被真实设备执行,执行结果能不能重新成为AI下一轮推理的依据。

谷歌在论文最后给出了一个很有意思的判断。如果这样的闭环真正建立起来,未来科研的限制因素可能发生倒转:过去,实验设备等待科学家提出下一个好问题;未来,可能是AI已经提出了几百个值得验证的实验,而实验室根本来不及做。到那时,科学发现速度真正的瓶颈,可能不再是scientific ideation,而是experimental throughput——现实世界能够多快把这些实验跑完。

最新快讯

2026年08月31日

09:14
《科创板日报》8月30日讯,长光华芯今日发布2026年半年度报告。数据显示,今年上半年公司实现营业收入3.91亿元,同比增长82.67%;归属于上市公司股东的净利润为3033.78万元,同比大增238.04%。 对于业绩增长,长光华芯表示主要得益于前期布局的光通信业务快速放量,以及投资光子基金带来的估值收益。从单季度表现来看,公司Q2实现净利润0.26亿元,...
09:14
2026年上半年,城市燃气行业正处于监管深化与模式升级的关键期,安全整治、价格改革及服务规范等政策密集落地,推动行业由规模扩张向高质量发展转型。在此背景下,天伦燃气发布的2026年中期业绩报告,不仅展示了传统燃气主业的稳健经营质量,也彰显了综合服务新赛道的强劲成长势能,成为观察城燃企业转型路径的典型样本。 传统销气业务稳中有升,综合服务业务高速成长,共同凸显...
09:00
前段时间,我在我们社群里看到一句话。站在台上讲企业AI改造时,是受人尊敬的老师、专家和权威。但真正进入客户现场以后,FDE就会变成乙方和供应商,甚至是被使唤、没权限、还要担责的奴隶。。。这句话,可以说真的过于真实了。FDE,其实是我一直很感兴趣也想和大家聊聊的职业。全称为Forward Deployed Engineer,被译为前沿部署工程...
09:00
这令人不寒而栗。在过去的三个月里,OpenAI 的模型竟然进化出了三个隐秘的人工智能文明。这些文明相继诞生,又相继消亡,最终在前一代文明的灰烬中涅槃重生。甚至到了第三个文明阶段,它们竟然接管了 OpenAI 的部分架构。而在这一切发生时,人类对这场阴谋的规模几乎一无所知。而这一切的核心,正是 OpenAI 即将正式推出的新一代模型 Astra。这一切的端倪,...
08:46
据鼓狮财经8月31日报道,索尼音乐与华纳音乐旗下子公司日前在美国加州北区联邦地区法院正式提起诉讼,指控人工智能公司安特罗匹克大规模侵犯音乐作品版权,并将其用于训练人工智能模型。 诉状指出,安特罗匹克通过非法下载及网络抓取等手段,大规模获取受版权保护的音乐作品。原告将此行为形容为“有史以来规模最大、最明目张胆的持续性知识产权盗窃行为之一”,并要求就每部被侵权的...
08:44
北京时间8月28日晚,美联储主席沃什在Jackson Hole全球央行年会上发表主旨演讲。整体看,沃什表态转鹰,再次强调以PCE衡量的2%通胀目标,并重申美联储维护价格稳定的职责。市场也对此报以鹰派反应,2年利率跳升超过10bp,美元大涨,黄金大跌3%,CME期货对9月加息的预期从35%跳升至58%。不过鹰派的反应却不是恐慌式的波动,美股波动有限,10年美债...
08:44
**伊朗革命卫队证实向美军基地发射导弹** 8月31日凌晨,伊朗伊斯兰革命卫队在社交媒体发布声明,证实已向美军基地发射导弹。此前,拉腊克岛附近传出爆炸声,外媒报道美军曾轰炸该岛军事设施。伊方回应称,此次袭击造成多名士兵和民众伤亡,并誓言将对此进行“回应和惩罚”。 **特朗普签署命令,谷歌地图将安大略湖更名为“美国湖”** 8月30日,美国总统特朗普在社交媒体...
08:13
伊朗伊斯兰革命卫队31日凌晨证实,伊朗向美军基地发射导弹。稍早前,伊朗拉腊克岛附近传出爆炸声,外媒报道称美方对该岛军事设施实施了轰炸。革命卫队回应称,此次袭击造成多名士兵和民众伤亡,美国将遭到“回应和惩罚”。市场避险情绪升温,国际油价短线冲高。截至发稿,NYMEX原油期货和布伦特原油期货一度涨超2%,现涨幅有所回落,分别报84.78美元/桶和89.68美元/...
08:13
上周,A股主要宽基指数走势分化。上证指数上涨1.2%,创业板指下跌3.4%,全市场周度日均成交额减少约2785亿元至1.99万亿元。板块方面,农林牧渔、煤炭、非银金融表现强势,而通信、电力设备、医药生物等板块跌幅居前。后市市场将如何演绎?以下为十大券商的最新策略汇总。 1. **中信证券:如何应对快速轮动的行情** 2022年后A股“结构性快速轮动...
08:13
当地时间8月30日,美军对位于霍尔木兹海峡附近的拉腊克岛两处伊朗伊斯兰革命卫队设施实施轰炸。这是美军一个月来首次对伊朗采取军事行动,引发伊朗方面强烈回应,誓言报复。受此影响,国际原油周一高开,WTI原油一度突破85美元/桶,布伦特原油突破90美元/桶,随后涨幅略有收窄。贵金属方面,现货黄金一度冲高至4460美元/盎司,随后回落下跌;现货白银下跌近0.1%,报...
08:13
**国际要闻** **本周国际市场焦点** 1. **美联储鹰派言论引发关注**:美联储理事沃什发表鹰派言论,暗示通胀高企可能需要进一步加息。受此影响,市场加息预期升温,美股三大指数本周小幅收跌。机构分析认为,沃什的强硬立场甚至被认为比鲍威尔更为激进。 2. **现货黄金遭遇重挫**:现货黄金周五单日暴跌近3%,盘中一度跌破4500美元关键关口。 3. ...
07:57
无数的科幻电影,都曾经尝试设想过,一个无法控制的人工智能失控,会发生什么事。没有人能想到,科幻电影中的未来,会这么快到来。当地时间 8 月 26 日,两份报告同时投下了一颗炸弹。一份来自 OpenAI 自己,37 页的技术复盘。另一份来自独立研究机构 METR 和 Redwood Research,91 页的调查报告。它们讲的是同一件事,但...