AI完成任务之后,究竟留下了什么?北京航空航天大学、香港中文大学和新加坡国立大学的研究团队近期推出了 OmniHarness,提出了一条新路径:让视觉智能体主动练习、自我检查,并将验证通过的流程固化下来。面对新的需求时,AI 手中便能多一份经过实战检验的方法。
论文全文:https://arxiv.org/abs/2609.16057
项目主页:https://omniharness.github.io
代码与运行说明:https://github.com/OmniHarness/OmniHarness
在创意任务测试中,OmniHarness 达到了 95% 的解决率,比表中最优的 SymbOmni 高出 27.5 个百分点。当采用 Codex 和 GPT-4o 配置时,总体解决率为 92.5%。表中的 “Pass” 衡量流程是否可执行,”Resolve” 衡量输出是否满足要求。OmniHarness 的两种配置在 Pass 和 Resolve 上均表现出色,其中 Pass 达到 100%。ComfyMind 和 SymbOmni 也能做到 Pass 100%,但 OmniHarness 在 Resolve 上更胜一筹,展示了其可运行流程中能产出多少合格结果。
当推理骨干同为 GPT-4o 时,OmniHarness 总体解决率为 89.5%,ComfyMind 为 83%;在创意任务上,两者分别为 95% 和 57.5%。这表明,除了模型本身的推理能力,经验如何调用、工具如何组织,也是决定成败的关键因素。采用 Codex 进行规划后,总体解决率从 89.5% 提升至 92.5%,复杂任务解决率从 76.7% 升至 83.3%。不同的规划配置对应着不同的多步任务表现。其优势范围有限,复杂任务的 83.3% 仍未超过 ComfyMind 的 85%,并非所有子集都领先。
这些成绩在具体画面中是如何体现的?输入可以简单到一张花朵涂鸦。系统将其重绘为写实红花,再利用这种风格生成一片花田,两次生成通过中间图像连接起来。任务换成四格漫画,就是要把整个周日早晨的故事讲完:从醒来、看手机、发现是周日,到继续躺平,动作与文字都要服务于剧情。换成海报和书封,主题、标题、版式构成一组需要同时满足的要求。餐桌编辑则更为细致:需要移除叉子或替换成勺子,同时尽量保留周围的食物、杯子和桌面布局。
创作需求千变万化,红花可能换成其他主体,重绘后可能还要调整布局。一次成功如何助力下一次?OmniHarness 采用符号策略学习,将验证成功的流程整理成可复用的策略。以花田任务为例,花朵与颜色可以替换,但“先重绘草图,再借参考生成新画面”的连接方式,可以成为可调整的方法。保存的策略包含工作流模板、适用条件和资源依赖,而具体的图片和描述等实例输入则被抽离。后续调用时,先检查策略是否适用,再绑定新输入,按要求调整步骤或组合多条策略。
出题、检查、积累经验,这套系统是如何运转的?
第一步,把练习选在值得探索的地方。自主练习发生在下游任务明确之前。只做熟悉的题目难以补齐空缺,挑战太远又缺少方法支撑。系统结合练习记录与现有能力,让探索有迹可循。每轮默认生成 10 道候选题,以新颖性和能力边界的乘积决定练习哪一道。候选任务组成集合,衡量是否少有练习,反映当前能力是否为探索提供适度支撑。同类情境练得越多,新颖性得分越低。图生图以源图区分情境,文生图共享一个标记。得分按所需能力取平均,避免能力项过多导致自然占优。每项能力由适用、未停用流程中的最高可靠性提供支持;可靠性用 95% Wilson 置信区间下界估计。整道题的能力估计取最低值,这相当于先看短板:大部分步骤熟练,一处缺少可靠方法,仍会拖累整体完成。随后把能力估计转成选题分数,得分在 0.5 时达到最高,估计值趋近 0 或 1 时得分都会下降,练习因而偏向有基础但仍有挑战的任务。
第二步,让检查跟上每次执行。系统安排步骤和依赖,将代码编译成 ComfyUI 工作流,再检查流程能否运行、各步效果及最终目标是否达成。以花田任务说明:假如红花已偏离要求,下一步继续沿用,偏差也可能进入新画面。失败后,系统定位问题并局部修复,尽量保留已验证部分;需要时请子智能体协助,在重试预算内再次检查。
第三步,让成败都成为下一次的依据。验证成功的流程被抽象入库,失败则记录证据、原因与修正方法。等价流程会合并,可靠性随调用更新,经验继续影响选题和执行。策略还要接受后续检验,新的成败记录继续影响它的可靠性与调用优先级。
经验换个使用者还管用吗?团队把自主练习后的策略库冻结,再适配到其他智能体的知识接口。宿主保留原有控制流程,模型也不微调。交付的内容既有成功流程模板,也有失败证据与修正办法。其他智能体通过自身的检索、规划和执行机制使用它们。同一份经验,让三个系统的总体解决率都提高了:ComfyAgent 由 32.5% 升至 57.0%,ComfyMind 从 83.0% 提高到 88.0%,SymbOmni 则由 86.0% 达到 89.0%。对应的创意任务增幅依次为 27.5、17.5 和 10 个百分点。创意任务的提升均超过各自总体增幅。面对新要求,已有流程和纠错经验仍能为不同系统提供帮助。
还有更深层的迁移:只练过图像任务的冻结策略库,被用于视频工作流。视频总体解决率为 85.9%,高于表中最优对照 5.1 个百分点;视频到视频达到 80.0%,高出 13.3 个百分点。其中,图像策略负责内容构建、参考保持等操作,时序处理仍交给视频专用组件,二者需经适配与组合。
一次任务结束,经验的使用才刚刚开始。这条路径同样需要付出计算成本:自主练习、多轮验证和修复都会增加开销,检索效率与推理预算仍有优化空间。OmniHarness 展示了一种积累方式:模型参数不变,可调用的方法随实践更新。今天留下的经验,有机会成为明天处理新需求的起点。
