**Scaling Law在原子操作中遭遇瓶颈:AI for Science亟需转向“Action Scaling”**

大模型在材料科学领域虽然展现了惊人的“理解力”,却在原子操作任务上遭遇了明显的瓶颈。尽管模型能够解析材料知识,却难以精准操控原子结构。最新发布的一项研究指出,传统的“Scaling Law”(缩放定律)在涉及空间逻辑的任务中效果有限,这提示AI for Science需要从单纯的“语言缩放”转向“行动缩放”,以提升模型在真实科研操作中的能力。

**“理解”不等于“操作”:Scaling Law的边界**

过去几年,Scaling Law被视为大模型领域的“黄金法则”:只要模型足够大、数据足够多,能力就会涌现。然而,由中科大苏州高等研究院、新南威尔士大学等机构联合在ICML 2026发布的AtomWorld基准测试,给这种“大力出奇迹”的乐观情绪带来了新的视角。

AtomWorld通过一系列受物理规则约束的原子实操任务发现:在文本理解、知识归纳等场景表现稳定的Scaling Law,一旦落地到原子实操任务,往往达不到预期效果。

**从知识预测到空间操控的鸿沟**

目前,大模型在科学领域已能胜任阅读文献、预测材料性质、解析晶体结构等工作。例如,Google DeepMind的GNoME能生成数百万个候选晶体结构,Anthropic的Claude Science也能显著提升综述写作等环节的效率。这导致行业普遍认为,既然模型能“看懂”材料,自然也能完成原子搭建等实操任务。

但真实的科研操作远非简单的选择题。它涉及高度具象化的三维空间指令:构建特定材料的表面、在晶格定点掺杂、在间隙位置嵌入原子等。这些任务要求模型具备符合物理定律的三维空间操控能力,而非仅依赖文本推理。

为了客观量化这一能力,研究团队构建了AtomWorld评测框架。该框架依托材料晶体学信息,自动生成原子结构-自然语言配对数据,通过对比模型输出与标准结构,精准评估模型在原子排布调整上的表现。

**模型规模与三维能力的脱节**

实验结果显示,Scaling Law在原子操作任务中的适用性存在明显边界。虽然模型规模扩大确实能提升部分规则清晰的任务(如原子替换、移动)的成功率,但在面对旋转、区域删除、扩超胞等需要三维空间理解和几何规划的操作时,性能提升并不稳定。

以“绕原子旋转”这一最具挑战性的任务为例,即便是Claude Opus 4.6、GPT-5.4等顶尖模型,成功率也仅维持在12%左右。Qwen系列模型在4B到32B的扩容中,虽在简单规则任务上有所进步,但在复杂空间任务上仍表现出明显的几何误差和逻辑瓶颈。这说明,问题不在于模型不够大,而在于通用大模型普遍缺乏稳定的三维空间行动能力。

**从“Language Scaling”到“Action Scaling”**

AtomWorld的核心价值在于将“材料智能体不会建模”这一模糊痛点,拆解为一系列可测量、可追踪的原子操作能力。它揭示了当前科学智能体的症结:现有的Scaling Law主要基于海量文本语料,而材料原子建模所需的“操作指令—坐标变化”高质量成对训练样本极度匮乏。

尽管行业常通过对接pymatgen等专业工具库来弥补短板,但AtomWorld的对照测试表明,外挂工具只能提升强坐标计算类任务(如原子插入),却无法替代模型做“原子该放哪”、“哪些属于目标区域”这类核心的空间决策。如果模型本身缺乏三维感知,工具只会将错误的意图执行得更精准,导致“建模逻辑错误”。

因此,AtomWorld呼吁AI for Science重新思考“该缩放什么”。除了基于文本的Language Scaling,未来更需要关注Action Scaling——即系统性地规模化可执行动作数据、动作基元拆解、模拟器反馈及物理约束验证,让模型在可验证的科学操作中迭代真实行动能力。

**结语**

AtomWorld不仅是一套评测基准,更是一面观测镜,直观展现了当前AI for Science的关键问题:大模型可以解释材料结构,并不意味着它能够可靠修改结构;可以读懂元素周期表,并不意味着能在三维空间中稳定执行原子级操作。

科学研究从来不是纯文本工作,而是由提出假设、设计实验、调整参数、排查错误等一系列行动构成的闭环。未来,AI若想真正参与科研,就不能只会“解释知识”,还必须学会“执行动作”。只有当模型同时具备知识理解能力和行动能力,科学智能体才能从“会回答问题的百科全书”,进化为“能完成任务的实验助手”。

最新快讯

2026年09月04日

16:27
鼓狮财经9月4日讯(记者 罗祎辰)近日,一款名为Microduck(下称“机器鸭”)的AI玩具一经发布迅速走红,不仅带火了瑞芯微(603893.SH)和矽递科技(Seeed Studio)等供应商,也引发了市场对AI玩具这一细分赛道的关注。 四款不同配色的Microduck 图片来源:Pollen Robotics公司官网 机器鸭带火国内机器人供应链 公开...
16:27
近期,粮食板块出现过一波涨幅。摩根大通此前警告称,下一轮全球粮食危机可能正在酝酿之中,或于明年爆发。据联合国粮食及农业组织的数据,过去70年全球人口增长超过50亿人,预计到2050年全球人口将达到97亿人。但随着气候变化带来土地的荒漠化、城市化及工业化占用耕地等导致耕地流失,全球人口不断增加与可耕地面积有限的矛盾将日益激化。而病虫草害是导致农作物减产的主要因...
16:27
美国劳工统计局(BLS)将于北京时间今晚20:30公布8月非农就业报告。目前市场主流预期,美国8月非农新增就业将从7月减少2.3万人的低谷中反弹至增加5.5万人,失业率则预计维持在4.1%。然而,华尔街对于这份数据的分歧极为显著——预测区间高端看至+12.5万人(万神殿宏观),低端则下探至-2.5万人(Fifth Third Bank),上下相差多达15万人...
16:12
据鼓狮财经9月4日消息,奥本海默分析师蒂莫西·霍兰将SpaceX的目标价由250美元上调至280美元。结合当前约150美元的股价,这一预测意味着约85%的上涨潜力。 霍兰此次上调评级,核心在于看好SpaceX成长为真正的AI巨头,认为其AI业务推进顺利,并相应上调了长期营收预期约10%。他特别强调,收购Cursor对包括Grok在内的AI平台迭代升级具有“变...
16:12
鼓狮财经9月4日报道,法国交通部长菲利普・塔巴罗特周五宣布,在欧盟将于10月就特斯拉全自动驾驶技术的落地许可作出最终决议前,法国已先行开展了相关车辆测试工作。塔巴罗特强调,推动测试的初衷是利用该技术改善交通状况,提升安全水平并减少事故,绝非作秀。他特别提到了车速控制和驾驶员分心(如使用手机)等亟待解决的问题。据悉,塔巴罗特本周早些时候曾与特斯拉首席执行官埃隆...
15:56
**高盛预警:韩国散户离场潮汹涌,企业回购“安全垫”恐于10月耗尽** 鼓狮财经9月4日讯,上半年曾强力推动KOSPI指数翻倍的韩国散户,近期正加速离场,导致市场托底重任暂时落在三星电子与SK海力士的巨额回购之上。然而,高盛最新报告指出,这道回购“安全垫”或在10月提前耗尽,届时外资动向将成为决定韩股走势的关键。 **散户抛售加剧,交易策略转向避险** 媒体...
15:55
鼓狮财经9月4日讯,工业和信息化部办公厅近日印发《人工智能中小企业创业支持计划(2026-2028年)》。该计划旨在通过三年时间,聚焦行业应用、数据服务、智能算力等重点领域,培育一批创新活力强、成长潜力大的人工智能创业企业。计划提出,将新培育科技和创新型中小企业1万家以上,专精特新“小巨人”企业突破2000家,并涌现出一批瞪羚企业和独角兽企业。同时,将高标准...
15:55
全球市场在过去两年中,除了备受瞩目的AI板块,还有一个古老而传统的行业同样熠熠生辉。在芯片、光模块、存储和算力领域,科技公司不断刷新市值纪录,资金疯狂追逐更快的增长和更远的未来。然而,在聚光灯之外,另一场慢牛盛宴已经悄然持续了数年。主角既不是大模型,也不是爆款产品,更没有激动人心的故事——作为资本市场典型的“老牌银行股”,却走出了独特的慢牛步伐。 9月1日,...
15:55
8月以来,“创新高”成为银行股的主旋律。国有大行方面,工商银行、建设银行、中国银行股价先后突破历史极值。9月2日,工行盘中最高触及8.29元,建行最高达11.11元,中行A股与H股双双刷新上市纪录。股份制银行中,中信银行股价持续走高,8月下旬多次刷新历史高点;城商行梯队同样亮眼,江苏银行、南京银行、成都银行、青岛银行等陆续创下历史新高,其中江苏银行在8月26...
15:55
9月4日,A股主要指数高开低走,整体表现疲软。上证指数收跌0.3%,报3930.12点;深证成指跌0.79%;创业板指跌0.78%;北证50跌0.1%;科创50跌幅较大,下挫2.1%。两市成交额达到20510亿元,较前一交易日显著放量2708亿元,但全市场超过2900只个股下跌。 盘面来看,消费类板块表现活跃,其中猪肉概念股领涨,罗牛山、新希望、新五丰等多股...
15:39
鼓狮财经9月4日报道,品浩集团一位备受瞩目的基金经理近日押注,人工智能热潮的下一批赢家将不会是美国拥挤的大型科技公司,而是转向亚洲设备供应商、中国金融及医疗保健板块。 该基金经理Emmanuel Sharef负责管理PIMCO的旗舰60/40策略平衡收益基金。该基金资产规模近190亿美元,过去三年业绩表现优异,击败了97%的同类基金。Sharef指出,随着A...