从模糊目标中寻找正确方向并实现自我进化,是 Self-Developing Agents 领域的研究重点。字节跳动 Seed、TokenWave 等机构的研究人员在相关博客中提出,应当让智能体像人类学习新技能那样,在没有现成题库和评分标准的情况下,根据自身水平决定补足哪些知识、学习什么理论或掌握何种方法。其核心目标是让智能体在工作中逐步胜任角色,并将处理实际问题的经验转化为可复用的能力。这构成了递归式自我改进中尚未完全覆盖的闭环。相比之下,当前常见的“半环 RSI”模式依赖外部 Golden Verifier 提供判断和指引,而完整的闭环则要求智能体自主处理前期的判断逻辑、中期的经验积累以及后期的迭代优化。具体而言,模糊的目标需要转化为具体的行动(如训练或 Harness 修改),不完整的反馈需要被提炼为可用经验,经过验证的改动则需进入模型、记忆或执行系统以持续迭代。ASPIRE、S³Gym 和 HarnessDev 三个基准研究分别聚焦于“如何从模糊目标中学习”、“能否从经验中学习”以及“改进能否保留”这三个问题。
ASPIRE 研究智能体如何从模糊目标中确定学习内容。相比于“提高某套数学测试的分数”这种明确的优化对象,“提高数学推理能力”这类目标留出了更多决策空间:先补哪类短板、找什么数据、用什么方法训练、又如何验证训练效果。ASPIRE 的实验设定中,智能体只能看到自然语言描述的能力方向,必须自主选择学习材料、更新方法和验证方式。研究者利用覆盖多类能力的专家原创题进行检查,题目、答案和逐题反馈均不向智能体开放。该基准包含 6 个能力目标、520 道专家编写的隐藏评测题,以及一个支持权重和 Harness 更新的最小交互环境,还提供了 48 对“模糊目标/明确任务”匹配的运行轨迹及可审计记录。实验结果显示,目标越模糊,智能体越容易陷入“忙于想而无效训练”的困境。智能体通常能完成数据收集、训练和评测,但最终保留下来的能力收益很少。困难在于学习任务与原始需求之间的错配:在预算固定的情况下,智能体将更多时间用于解释目标和选择代理指标,留给实际训练与评测的时间被压缩。这表明决策时间的增加并不代表目标选对了,完成更新也不一定意味着目标能力真正提高。在 ASPIRE 的 30 个单元中,仅有 1 个增益被保留。面对模糊目标,决策时间增加,主动训练与评测时间减少,LoRA 使用率从 24.1% 升至 89.8%。这说明搜索过程虽然改变了,但目标仍未得到有效验证。
S³Gym 研究智能体在缺乏老师逐步打分的情况下,如何通过自我测试、自我判断和自我改进来学习。该研究将这三个环节放入七个文字游戏中进行考察。探索阶段,智能体能观察环境变化,但看不到程序验证器给出的真实步骤奖励和最终得分;随后会用更严格的条件和另一组随机种子检验其表现。值得注意的是,测试记录不会回流为学习材料。研究发现,智能体“知道自己做得好不好”的能力较弱。一个重要结论是,自我判断的准确程度与后续收益之间没有稳定的对应关系。智能体或许能判断当前行动的优劣,却未必能据此调整下一次行动。论文将判断质量与后续表现分别测量,发现两者关联很弱。这并不代表自我判断无用,而是说明它尚未被可靠地转化为学习收益。此外,经验也没有一种通用的保存方式。在所测模型和游戏中,原始历史与摘要记忆各有优劣,同一种方法在不同环境下可能失效。轨迹分析表明,有些经验可概括为可重复使用的策略,有些则依赖精确的状态和操作细节。摘要保留了前一类信息,却可能遗漏后一类信息。更新模型参数能让部分经验进入模型,但也可能损害原有能力。例如,同一条训练轨迹中,模型在信任博弈上取得了收益,在植物大战僵尸中却持续退步。因此,S³Gym 强调必须将经验的价值放到后续行动中检验,分别检查复盘是否准确、经验保存形式是否得当、以及下一次是否做得更好,不能用一份看似合理的总结完全替代学习效果。
HarnessDev 旨在让模型创建并持续修改自己的执行系统,观察这些改动能否在后续任务中持续发挥作用。研究区分了模型本身的能力与执行系统带来的效果,将开发系统的模型与执行任务的模型分离,并在执行模型固定、权重不变的条件下观察改动。除了任务表现,研究还追踪新机制是否实际参与运行,例如写入代码的记忆和状态保存是否真的被调用。该过程分为创建阶段和演化阶段:创建阶段从基础程序构建可用系统,演化阶段则根据运行反馈继续修改系统,各正式版本冻结后再进行评测。实验表明,让智能体“持续自我修改”容易导致过拟合。在固定 Gemini 执行的 Qwen、DeepSeek 轨迹中,选定版本在可见反馈上都有改善,但在隐藏任务表现上却都出现了下降。这些隐藏分数在开发结束后才计算,未返回给创建者,从而揭示了开发反馈未能反映真实问题。此外,系统修改还可能破坏原有功能。论文中提到的消息清理、上下文压缩等改动曾打乱合法的工具消息序列,部分修改随后被回滚。因此,对于当前任务有帮助的调整是否适合长期保留,需要额外检查。HarnessDev 强调对持久改动的验证:新机制必须在运行中生效,改进要能迁移到未参与开发的任务,必要时还能回滚到先前版本。目前这些演化观察主要来自代码任务,隐藏评测覆盖 SWE-Pro,各配置为单条轨迹,尚不足以判断长期收益是否稳定。
Self-Developing Agents 从目标形成、经验吸收和系统演化三个层面,系统探讨了智能体如何从“被动执行任务”走向“持续自我改进”。ASPIRE、S³Gym 和 HarnessDev 的实验共同表明,当前智能体已经具备一定的自我训练、自我总结和自我修改能力,但真正的瓶颈并不在于“能不能改”,而在于能否准确判断“该改什么、什么经验值得吸收,以及改完之后是否真的变好了”。现阶段最突出的问题是代理目标与真实目标之间的错配,以及对局部反馈和可见指标的过拟合。未来,Self-Developing Agent 的核心可能不再只是更强的模型或更复杂的 Harness,而是建立更可靠的目标形成、验证和保留机制,使智能体能够在长期运行中持续筛选有效经验,并将真正可泛化的改进沉淀为稳定能力。
