“AI的下半场——从现在开始——将把重心从解决问题转向定义问题。”

这是姚顺雨去年4月在博客《The Second Half(下半场)》中写下的判断。他认为,当一套通用训练方法能够越来越快地解决现成任务,更重要的问题将变成:AI到底该做什么,什么又算真正的进步?

他尤其强调评估(Evaluation)。继续造更难的基准测试(Benchmark)已经不够了,他更关心的是,基准测试上的高分,最后能不能转化为真实工作中的能力。

去年12月,姚顺雨加入了腾讯。今年6月,姚顺雨以腾讯首席AI科学家、腾讯混元大语言模型及AI Infra负责人的身份畅谈了“腾讯AI下半场”。提到Agent,他先强调“环境的重要性:“如果没有好的环境,Agent就没办法去做各种各样的事情。”

「甲子光年」梳理发现,近半年腾讯混元发布了6篇与“环境”相关的论文。从可执行任务供给,到长时任务、手机环境、自动生成与训练闭环,再到环境随模型能力进化,混元正在系统性构建Agent的训练世界。

图片来源:「甲子光年」整理

巧合的是,另一家大厂也在同一时期走向了这个坐标。

今年7月,阿里通义联合浙大、北大的论文《Towards General Agentic Intelligence via Environment Scaling》发表于ACL 2026 Findings,直接把“Environment Scaling”写进标题,作者中包括阿里巴巴首席科学家周靖人。

不仅是腾讯与阿里,字节跳动Seed、以及太平洋对岸的OpenAI和 Anthropic,都在涌入同一个战场。

对Agent来说,环境既是考场,也是训练场。

排查一个软件故障,可能起初只有一句简单的任务描述。但要判断Agent是否真的具备工作能力,就不能只给它一道考题,还得给它代码仓库、运行工具、状态变化和结果验证,搭出一个足够接近真实业务的“世界”。

姚顺雨说的“AI下半场”,正在多出一个越来越重要的变量:环境。

1.混元至少4拨人,在给Agent“造世界”

参与过腾讯混元研发的研究人员李非(化名)告诉「甲子光年」,他们从今年2月前后开始明显关注Environment Scaling。一个很直接的信号来自招聘:当时,OpenAI和Anthropic开始专门招募强化学习环境(RL Environment)的人。

“他们要招这样的人,那就说明这个方向是有价值的。”李非说。

在他看来,算法逐渐稳定,扩充训练材料是一条收益相对可预期的路。但面对Agent,只靠静态网页和语料,已经不足以覆盖它需要学习的交互过程。它要调用工具、更改数据库、经历一长串操作并拿到即时反馈。

数据没有消失,只是从文档变成了可以交互的“世界”。

4月,混元发布SkillSynth,规模化生成终端任务,其中一部分后来被用于Hy3 Preview训练。

几个月后,新问题出现了。同一批环境,模型刷上几个版本就彻底摸透了,有效的学习信号越来越少。训练环境也有“保质期”。

9月3日,混元公开《Environment Evolution for Terminal Agents》。一作依然是香港科技大学博士生范致远,12位作者中有11位与4月的原班人马重合。

不同的是,这次他们不再从零造环境,而是让已有环境进化。原本Agent只需写个静态页面,升级成从前端到后端部署、动态维护等更复杂的任务。

但这并不是混元一支团队研究的方向。「甲子光年」梳理发现,仅今年4月至9月,混元至少4组研究人员,围绕“造环境”发布了6篇论文,累计76人次署名。混元的几组研究也在不断向纵深推进:

把任务做长:混元大模型前沿团队科学家史淯城等人,推出Long-Horizon-Terminal-Bench,把终端任务从几分钟拉长到数小时;紧接着又通过15轮递归生成了超3.7万个长程任务,平均一个任务的造价压到了5美分。

把环境搬上手机:混元视觉团队发布HyMobileAgent,搭建了包含34个模拟App、超3.4万项任务的PhoneWorld,从在腾讯健康预约疫苗到跨App调度,让环境与数据协同扩展(Co-Scaling)。

把环境接进管线:8月发布的UI-Mate,直接把任务生成、搭建沙箱、验证器连接,将Environment接入后训练的在线强化学习流水线。

Agent模拟在豆瓣上搜索腾讯视频热播电视剧,图片来源:混元视觉团队论文《HyMobileAgent: Data-Environment Co-Scaling for Efficient GUI Agents》

与此同时,混元也发生了一轮大的组织调整。

HyMobileAgent论文中的项目负责人是胡瀚。他曾担任腾讯混元多模态理解负责人,并向姚顺雨汇报。今年4月,两人还共同署名了HY-Embodied-0.5。

7月23日,胡瀚离职创业。原大语言模型部和多模态模型部合并为基础模型部,由姚顺雨统一负责,“强化学习及Agent能力”被明确写进新部门职责。

李非表示,他所在项目由负责人组织,团队最初很多选题是研究人员的自主驱动;对于更高层是否存在统一的Environment规划,他并不了解。

但从产出结果来看,水面下的分散支流,正汇聚成同一条大河。

2.Environment Scaling正在加速

混元对于环境的重视不是个例。

不久前,宾夕法尼亚大学教授、OpenAI研究员苏炜杰在接受「甲子光年」采访时打过一个比方:Scaling就像一个“什么都能往里扔的篮子”。模型是个高维函数,预训练的收益放缓了,研究者不断寻找新的变量,只要找到一个新的变量求导大于零,就能继续看到收益。

“Scalling law还没有撞墙,一个变量放缓并不影响大局。”苏炜杰认为。

阿里通义联合北大、浙大的团队,直接把这个新变量命名为“Environment Scaling”,周靖人也在作者名单中。论文认为,训练时见过的环境越丰富,Agent之后能处理的工具和任务也越多。

今年以来,多项公开工作已经把训练环境扩展到千级、万级甚至更大规模。

Ai2与华盛顿大学发布的TMax包含14,600个终端Agent训练环境;Qwen与浙江大学团队的SWE-Universe,则从真实GitHub项目中构建了807,693个可验证的软件工程环境。

但在“把世界做大”的过程中,所有人都遇到了同一个现实:高质量的环境难造。

混元团队准备训练材料时,曾从Hugging Face和GitHub收集47678个公开终端环境。按照环境质量、可解性和难度等要求筛选后,最后只留下127个。

47678个环境,最终只有127个合格——淘汰率高达99.7%。

李非举例,任务要求和检测标准如果不一致,对小模型影响不大,“因为小模型本来就不会”;但到了大模型,“如果一个任务的质量不够,它会很明显地直接被hack掉”。

“我们不能误导Agent,也不能靠加Bug把环境变难,故意让Agent做不对。” 李非认为,好的环境不仅要没有Bug,还得足够难,难到当前Agent确实还做不出来。

类似的问题也出现在OpenAI和Anthropic。今年7月,OpenAI重新审计SWE-Bench Pro,发现731个公开任务中,约30%存在不同程度的问题,包括测试过严、提示不完整、测试覆盖不足等。

Anthropic发现,即使模型、任务和Harness都不变,只调整运行环境的CPU、内存等资源配置,Terminal-Bench 2.0在最严格与最宽松设置之间也能相差6个百分点。

这意味着,环境首先得足够可靠,质量之外,还有时效性的问题。

模型能力不断进化,另一类研究想让环境跟着模型一起进化。比如,字节Seed与中国人民大学团队的Agent-World已经搭出超过2000个环境、1.9万个工具,并根据Agent暴露出的能力缺口继续生成新任务,让训练环境跟着模型一起变化。

模型越强,真正还能让它学到新东西的环境越难找。训练场不只要造,还得一直翻新。Environment Scaling需要一种持续的供给。

一旦某种资源变得稀缺且昂贵,一门全新的基础设施生意就会应运而生。

在大模型时代,训练数据需求把Scale AI推到了超过290亿美元的估值。那么在Agent时代,谁会成为下一个掌握“训练世界”的Scale AI?

3.下一个Scale AI会出现吗?

新的供给需求,已经长出生意。

李非观察到,一些创业公司正在组织人手构建高质量环境,再向模型公司提供。他提到,团队也尝试过使用模型直接合成环境:“量可以很快上来,但是它的质量很差。”完全依赖人工,开销又会明显增加。

资本已经投入。9月11日,据媒体报道,阿里正在洽谈领投AI训练与评测公司UniPat AI的新一轮融资,规模约3亿美元,对应估值约25亿美元;腾讯、红杉等现有投资者也可能参与。交易仍在磋商中。

UniPat并不是一家纯粹的“造环境”的公司。创始人李宽此前在阿里通义DeepResearch团队从事Agent后训练、数据合成和强化学习,是WebSailor等工作的核心作者;联合创始人兼CTO陈亮是北京大学计算语言学研究所博士生。

他们今年推出的Terminal-X、Vibe-Coding Arena等系统,做的正是把任务设计、沙箱环境与评测标准打包的一体化基建。

海外的整合走得更为激进。今年3月拿到a16z领投4300万美元的Deeptune,专门通过复刻Salesforce、Slack等真实软件环境提供“Agent健身房”。仅仅4个月后,它就被数据平台Mercor闪电收购——前者懂得怎么造环境,后者懂得怎么组织行业专家制定裁判标准。

Mercor CEO Brendan Foody也是Deeptune A轮的天使投资人。他告诉媒体,当初投资,很大程度上就是为了给收购铺路。

连Scale AI自己,都在今年开辟了强化学习环境(RL Environments)业务,并披露新增训练项目中接近一半已经涉及强化学习环境。

Environment的需求还不只停留在训练阶段。

9月的外滩大会上,周靖人谈到Agent真正进入业务时,专门提到了另一类“环境”:安全沙箱、权限管控、授权、追溯,以及Harness和Agent Framework层的安全执行环境。他认为,Agent要真正进入业务,这些基础设施必须一起补上。

这里的执行环境并不等同于前文的训练环境,但两者都指向同一个变化:模型越从“会说”走向“会做”,围绕它的环境越需要被单独建设。

但在中国市场,战局远没有那么简单。

腾讯、阿里、字节都在自建环境。原因在于,环境与后训练效果直接相关,头部模型厂很难把核心环境全部外包。而环境运行所需的庞大沙箱、即时隔离与高并发重置,本身又需要依托云基础设施。

对想成为“下一个Scale AI”的公司而言,这个赛道很窄。大厂模型团队懂模型缺什么,云平台懂机器调度,但谁真正懂金融机构、律所或一家医院里错综复杂的真实业务流?

姚顺雨在去年预判,AI下半场的重心将“从解决问题转向定义问题”。当大厂和资本开始花大力气给Agent“造世界”,这个抽象的判断,变成一个具体的产业落点。

一年后,答案还在进化,世界也被重新搭建。

*应受访者要求,李非为化名

最新快讯

2026年09月18日

12:00
真是深藏不漏!这一次,谷歌终于把底牌扔出来了。就在这两天,大模型竞技场Arena悄然杀入一款新模型,名字竟挂着「gemini-3.8-flash」。上手实测的AI大佬和开发者交手几轮后,几乎倒吸一口气——这极有可能是谷歌DeepMind,悟了整整半年的下一代旗舰Gemini 4 Pro!一张疯传全网的基准图,简直堪称「恐怖」。Gemini ...
12:00
Claude Code 如今能自己组建一支 AI 团队了。就在不久前,Anthropic 官宣了重新设计的 Projects 功能,首站便落地 Claude Code。 用户只需在一个对话框中清晰说明任务,Claude 便会将其拆解为多条线程,在云端并行开工。即便合上电脑,任务仍在继续。只有遇到需要拍板的关键节点,它才会回来寻求指示。用户在通勤途中,也能通过...
12:00
Anthropic 官宣了一位新任高管,他是清华校友 Sihao Huang。此次加入,他出任前沿计算战略负责人,直接搭档联合创始人兼首席算力官 Tom Brown,也一举成为了 Anthropic 公开职级最高的华人。 Sihao Huang 年仅二十多岁,将负责 Anthropic 的基础设施扩张、合作联盟建设以及应对前沿 AI 指数级演进的长期算力规划...
12:00
9月17日,地平线与中国汽车技术研究中心有限公司(以下简称“中汽中心”)正式签署战略合作协议。双方将秉持优势互补、讲求实效、共同提高及实现双赢的原则,建立长期战略合作伙伴关系,围绕产业政策、行业标准、测试评价及检测认证等方向开展深度协同,共同推动中国智能汽车产业的高质量发展。此次合作,是智能驾驶核心技术企业与国家级产业技术服务权威平台之间的一次深度融合。 双...
12:00
9月18日上午,A股科技板块延续强势走势。截至发稿时,科创50指数放量上涨2.99%,科创芯片类ETF集体领跑涨幅榜。 其中,科创芯片设计方向领涨,国泰、华宝、鹏华、天弘、永赢等多只相关ETF涨幅均超过4%。科创半导体设备ETF(鹏华)、科创半导体设备ETF(华泰柏瑞)、集成电路ETF(嘉实)等同步涨超4%。科创人工智能ETF(华宝、国泰、银华)涨幅也超过3...
12:00
9月18日,鼓狮财经报道,在美国硅谷关于人工智能发展前景的争论愈演愈烈之际,美东时间周三,被誉为“华尔街一哥”的美国最大商业银行摩根大通首席执行官杰米戴蒙发表了他的见解:支持由联邦层面实施“轻度监管”模式,反对地方监管,理由是各州法律不一将增加AI商业落地的复杂性。 戴蒙呼吁对AI实施轻度监管。尽管戴蒙历来不热衷于加强监管,但他在最新讲话中明确表示,AI行业...
11:29
据鼓狮财经9月18日报道,美国国务院于17日宣布,已批准一项可能向沙特阿拉伯出售48架F-35战斗机及相关设备的对外军售方案,预计总金额高达243亿美元。根据声明内容,这笔交易涵盖48架战机、49台配套发动机,以及通信设备、备件、培训及各类保障设备。据悉,该军售案还需经过美国国会审批,即便最终获批,首批战机的交付也需数年时间。
11:29
鼓狮财经9月18日电,非洲疾病预防控制中心主任卡塞亚17日在线上发布会上指出,现有数据尚不足以证实刚果(金)本轮埃博拉疫情已达到峰值,疫情传播并未得到持续控制。他指出,尽管当前疫情曲线总体略有下降,但这一趋势仍不稳定。 卡塞亚呼吁有关部门进一步厘清传播链条,加强社区监测工作,并采取有效措施防止疫情向新地区扩散。根据刚果(金)卫生部发布的最新报告,截至9月15...
11:29
鼓狮财经9月17日报道,继Anthropic首席执行官阿莫德伊上周呼吁业界放缓AI发展步伐引发震动后,该公司周四公布了三项新指标,旨在帮助人工智能公司监测自身发展进度。其中一项披露显示,Anthropic旗下大模型Claude目前已在公司内部主导了26%的AI研发工作。 该公司在周四的博客文章中介绍了这三个维度的进展,并分享了相关方法论,鼓励其他组织效仿。文...
11:29
9月11日,康宁宣布对全球日元计价的显示玻璃基板产品提价15%以上,新价格将于2026年第四季度生效。调价原因是日元持续走弱,叠加关键原材料、贵金属、能源及物流成本上涨,企业已难以内部消化。此前,TCL华星于9月10日率先向下游客户发出电视面板涨价函,直指上游原材料成本压力。京东方紧随其后发布调价通知,惠科也向客户发出了涨价函,三星、LG及索尼均已收到相关函...
11:29
**电力需求的“悖论”与基建的硬约束** 9月,高盛在AI主题播客节目中抛出一组极具冲击力的数字。尽管AI模型与芯片效率持续提升,数据中心电力需求仍在加速增长。高盛将美国2030年数据中心电力需求预测从83吉瓦上调至108吉瓦,全球数据中心用电较2025年的增幅预期从117%上升至170%。从2024年初到2030年底,AI新增用电规模相当于整个日本全年的用...