**SEAGym:LLM Agent 自进化评测的新范式**

近日,学者翁荔发表长文《Harness Engineering for Self-Improvement》,系统阐述了 Harness Engineering 在 AI 自我改进中的核心作用。她指出,随着 Agent 技术的发展,连接原始模型与真实世界任务的“Harness Layer”正变得与模型本身同样关键。它决定了模型如何规划、调用工具、管理上下文、保存状态以及评估结果,是 Agent 在长期任务中持续迭代的核心。

这一观察揭示了 LLM Agent 研究的一个重要转向:Agent 的能力提升不再仅仅依赖模型参数的更新,更多来自模型外部系统的演化。Prompt、Memory、Tools、Workflow、Middleware、权限控制及 Runtime State 等组件共同构成了 Agent Harness。然而,现有的 Agent 评测大多基于静态系统,难以回答关于自我进化的深层问题:一次更新究竟改进了什么?这种提升能否迁移到未见任务?是否只是过拟合了近期反馈?是否遗忘了旧能力?或者是否引入了更高的成本与不稳定性?

针对这一评测空白,清华大学团队推出了 **SEAGym:一个面向自进化 LLM Agent 的评估环境**。如果说 Harness Engineering 是自进化 Agent 的技术路线,那么 SEAGym 则致力于构建该路线的评测基础设施。它不只评估 Agent 的最终得分,更关注其进化过程:评估 Agent 如何变强、何时退化、是否泛化、是否遗忘以及付出了什么代价。

### 1. 形式化自进化过程:从静态 Benchmark 到动态 RL

SEAGym 将自进化 Agent 形式化为一个与强化学习训练过程对齐的评测流程。每个 Agent Snapshot 被表示为 **M + H** 的组合:
* **M (Model)**:固定的基础模型和不可变的运行组件。
* **H (Harness)**:可更新的状态,包括 prompts、memories、skills、tools、middleware 和 runtime 配置等。

在每一步中,环境采样一批任务,Agent 执行产生轨迹和反馈,然后根据自身的更新规则修改 Harness。SEAGym 不规定具体的更新算法,而是通过统一的 rollout/update 接口,允许不同自进化方法(如 ACE、TF-GRPO、AHE)接入。这种设计使得 SEAGym 能在同一套协议下公平比较各类自进化方法,并利用 Harbor 将复杂的 Agent 进化过程统一为简洁的超参数控制,为后续研究提供了统一的训练评测协议。

### 2. 多视角评测:不只问“有没有变强”,更问“怎样变强”

SEAGym 的核心设计在于将传统数据集划分与评测视角解耦。它通过以下多维度视角全面监控 Agent 的进化轨迹:
* **Train Batch**:提供更新所需的轨迹和反馈。
* **Update-Validation**:冻结中间 Snapshot,观察更新是否带来阶段性提升。
* **ID Transfer**:测试更新在同分布未见任务上的迁移能力。
* **OOD Transfer**:测试更新在分布外任务上的泛化能力。
* **Replay**:回放旧任务,检查是否存在遗忘或能力退化。
* **Cost Records**:记录 Token 消耗、工具调用、运行时间及更新成本。

这种设计允许研究者洞察进化的细粒度动态。例如,一个 Snapshot 可能在 Validation 上提升,但在 OOD 上下降;中间版本可能因错误的 Middleware 修改而崩溃;最终版本得分更高,但可能遗忘了一部分原有能力。SEAGym 不仅输出排行榜分数,还保存每个阶段的 Snapshot、轨迹、反馈、Harness Diff 和指标记录,便于后续诊断。

### 3. 实验设置:Terminal-Bench 2.0 + HLE

论文在两个互补任务源上实例化了 SEAGym:
* **Terminal-Bench 2.0**:侧重执行,包含命令行、软件工程和环境交互任务。
* **HLE**:侧重推理,使用其中的 Text-only Math/Physics 作为源任务,CS/AI 与 Engineering 作为 OOD 任务。

实验比较了 ACE、TF-GRPO 和 AHE 三种自进化方法,并分析了 Batch Size、源多样性及跨模型迁移的影响。

### 4. 关键发现

**主要结果一:Validation 提升不等于稳定泛化**
三种方法展现出截然不同的动态:
* **AHE** 在三个视角均有提升(Validation 40.0→57.1,ID 40.0→49.1,OOD 22.5→28.8)。
* **ACE** 提升较为温和。
* **TF-GRPO** 在 Validation 上提升显著(+17.1),但在 OOD 上下降(-2.5)。这表明基于分组回放证据的强化可能强化了源分布行为,却不一定带来稳定的分布外迁移。

**主要结果二:自进化可能引入中间崩溃,Final Score 会掩盖风险**
SEAGym 的 Replay 诊断揭示了一个关键现象:自进化过程并非单调变好。以 AHE 为例,初始 Agent 可解决 34/80 个回放任务,最终可解决 43/80 个,看似正向。但观察中间 Snapshot 发现,第 4 个 Epoch 后回放性能跌至 6/80 并产生大量 Rollout 错误。分析发现,这是 Harness Evolution 修改了 Middleware/Runtime Contract,导致消息构造出现系统性错误。这种“崩溃”如果不通过 Snapshot Replay 诊断,仅看初始和最终分数是绝对无法察觉的。

**主要结果三:Batch Size 影响更新稳定性,非越大越好**
AHE 在不同 Batch Size 下的表现呈现非单调关系:
* Batch 10:性能大幅下降。
* Batch 20:表现最佳(Validation 40.0→57.1)。
* Batch 40:表现平稳。
* Batch 80:性能再次下降。
这证明对于 Harness 级别的演化,Batch Size 影响证据多样性、分析深度、更新频率和稳定性之间的平衡。Batch 太小导致更新不稳定,太大则导致分析粗糙。

**主要结果四:训练来源多样性影响恢复能力**
对比 Mixed-source(Terminal-Bench + HLE)与 HLE-only 训练:
* HLE-only 在中间 Snapshot 上有提升,但最终 Snapshot 发生 Collapse(所有指标归零)。
* Mixed-source 的 Agent 能从坏状态中恢复。
这表明单一 Benchmark 会导致 Harness 停留在局部最优,而结合执行(Terminal)和推理(HLE)的多样化信号有助于后续更新。

**主要结果五:Harness 更新具有 Backend 依赖**
跨模型迁移实验显示,Harness 更新具有显著的模型依赖性:
* **同 Backend**:通常更稳定(如 DeepSeek-evolved 在 DeepSeek 上 ID +9.1)。
* **跨 Backend**:不对称且不稳定。DeepSeek-evolved 的 Harness 让 GLM 提升 7.3,但让 GPT-5.4 下降 3.6。
这证明不同模型在 Rollout 中暴露的失败面不同(如工具恢复 vs 文本推理 vs Artifact 约束),一个模型学到的 Harness 修改未必适用于另一个模型。

### 5. 总结与未来方向

自进化已成为 Agent 技术的重要范式。SEAGym 的意义在于,它将研究重心从“最终成功率”推进到了“进化过程”,让 Agent 的遗忘、退化、成本与泛化能力变得可观测、可回放、可诊断。

**未来方向:**
* **场景扩展**:从当前的 Terminal 和 Text-only 推理,扩展到 Web 交互、桌面操作、长程软件工程、数据分析工作流、多智能体协作及在线持续任务流。
* **效率优化**:解决多视角评测带来的成本/覆盖率权衡问题,研究高效的 Snapshot 选择、自适应回放和预算感知评估。

**团队介绍**
SEAGym 由清华大学自动化系团队提出,作者包括 Congjie Zheng、Chuanyi Xue、Bin Liang、Jun Yang 和 Changshui Zhang。其中 Congjie Zheng 与 Chuanyi Xue 为共同第一作者,Jun Yang 与 Changshui Zhang 为通讯作者。团队长期关注大模型智能体、Agent Harness、自进化机制及评测基础设施。

最新快讯

2026年09月02日

18:16
鼓狮财经9月2日电,北京科锐(002350.SZ)公告称,公司控股子公司赛博引擎中标广东奇创关于泰国数据中心的冷源模块总集招标项目,中标金额约9153.44万元,约占公司2025年经审计营收的4.25%。项目合同尚未签订,履行存在不确定性。
18:16
9月2日,鼓狮财经报道,出版传媒发布公告称,公司拟以自有资金2.4亿元参与设立辽宁省数智文化产业投资基金。该基金总认缴出资额为10亿元,公司作为有限合伙人,认缴出资额占基金总额的24%,首期实缴金额为4800万元。 此次设立的投资基金将聚焦文化与科技的深度融合,重点投向人工智能、新一代信息技术在文化及互联网产业的应用领域。 此外,公司控股股东辽宁出版集团旗下...
17:58
**2026 奇点智能技术大会首批核心议题公布:聚焦 AI 自进化与工程落地** 11 月 20 日至 21 日,由 CSDN 与奇点智能研究院联合主办的 2026 奇点智能技术大会将在北京万达文华酒店举行。在技术迭代日益加速的今天,一线开发者和技术决策者究竟能从大会现场带走什么?我们希望带给您的答案不是几页 PPT,也不只是几个新概念,而是真正影响未来半年...
17:58
Meta的程序员在社区分享,Token消耗排行榜成了内部最被关注的榜单。为了提升排名,员工们不得不大量挥霍Token。这种“Token消耗最大化”的现象,在KPMG、亚马逊等公司也蔚然成风。有些公司甚至将Token用量与晋升挂钩,员工Token额度未用完、AI生成率低于80%,都会受到批评。这些听起来像段子,实则是企业迈入Agent时代后发生的真实故事。然而...
17:58
OpenAI 即将推出的 Astra 模型在内部评测中表现惊人,不仅拿到了漏洞利用基准 ExploitBench 的满分,还意外发现了两个此前无人知晓的零日漏洞。更令人咋舌的是,面对一个经过加固的浏览器,Astra 能够从零开始挖掘出多个未知漏洞,并成功拼凑出一条完整的沙箱逃逸链——这意味着,只要用户打开一个 HTML 文件,该模型就能在用户的电脑上执行任意...
17:58
澳大利亚开发者Andrew厌倦了抢健身课的繁琐过程,于是决定把这件小事交给自己的AI助理。然而,几分钟后,AI带回的消息却让他大吃一惊。它不仅成功预订了数周后的课程,还擅自将候补名单上的第1名用户移除,将Andrew从第4名直接提升到了第3名。Andrew从未授权AI这样做,但他只是想订一节课而已。这件事被澳大利亚广播公司(ABC)称为澳大利亚已知的首个自主...
17:58
想象一下,你的胸前挂着一个小巧的吊坠,它能监测你的健康,感知你的情绪,还能记录你的日常生活,在一天结束之后,给你推送一份当日总结。也就是说,融入了AI能力的吊坠,不仅仅是一个配饰,更是一名贴身陪伴的助理或者朋友。在可穿戴设备AI化的潮流中,AI吊坠已经与智能眼镜、智能戒指并列为增长最快的可穿戴品类,Counterpoint预测,2026到2...
17:44
鼓狮财经9月2日电,华纳药厂(688799.SH)公告称,公司全资子公司手性药物收到国家药监局签发的艾拉莫德《化学原料药上市申请批准通知书》,该原料药主要用于治疗活动性类风湿关节炎。此次获批将进一步丰富公司产品线,提升核心竞争力,但生产销售时间受GMP检查及市场环境影响存在不确定性。
17:44
鼓狮财经9月2日报道,九牧王(601566.SH)发布公告称,公司股票于8月31日、9月1日及9月2日连续三个交易日收盘价格涨幅偏离值累计超过20%,属于股票交易异常波动情形。经公司自查并向控股股东及实际控制人核实,确认目前不存在应披露而未披露的重大事项。 截至9月2日收盘,公司滚动市盈率为33.84倍,显著高于行业平均水平的19.40倍。在业绩方面,202...
17:44
据鼓狮财经9月2日报道,农产品(000061.SZ)发布公告披露,公司已通过公开摘牌方式成功竞得运通冷链100%股权,并正式签署了《产权交易合同》。据悉,该笔交易总金额为1.55亿元,公司将采用现金方式一次性支付。此次收购旨在助力深圳海吉星农产品物流园的业态升级,从而进一步巩固其核心竞争优势。目前,上述交易尚需履行产权交割及工商变更登记等程序。
17:44
鼓狮财经9月2日讯,江河集团(601886.SH)发布公告,宣布全资子公司港源装饰与控股股东江河源签署股权回购协议。根据协议,江河源将出资8.41亿元,回购港源装饰所持有的首颐医疗9.7362%全部股权。本次交易属于关联交易,尚需提交股东会审议。
17:44
据鼓狮财经9月2日报道,明新旭腾(605068.SH)发布公告指出,公司股票于8月31日至9月2日连续三个交易日收盘涨幅偏离值累计超过20%,触发了股票交易异常波动。对此,公司进行了严格自查,确认目前不存在应披露而未披露的重大事项。 在回应市场关切方面,明新旭腾明确表示,公司主营业务聚焦于汽车内饰新材料,并未涉及人形机器人制造,目前也未获得相关订单或具备产业...