AI完成任务之后,究竟留下了什么?北京航空航天大学、香港中文大学和新加坡国立大学的研究团队近期推出了 OmniHarness,提出了一条新路径:让视觉智能体主动练习、自我检查,并将验证通过的流程固化下来。面对新的需求时,AI 手中便能多一份经过实战检验的方法。

论文全文:https://arxiv.org/abs/2609.16057
项目主页:https://omniharness.github.io
代码与运行说明:https://github.com/OmniHarness/OmniHarness

在创意任务测试中,OmniHarness 达到了 95% 的解决率,比表中最优的 SymbOmni 高出 27.5 个百分点。当采用 Codex 和 GPT-4o 配置时,总体解决率为 92.5%。表中的 “Pass” 衡量流程是否可执行,”Resolve” 衡量输出是否满足要求。OmniHarness 的两种配置在 Pass 和 Resolve 上均表现出色,其中 Pass 达到 100%。ComfyMind 和 SymbOmni 也能做到 Pass 100%,但 OmniHarness 在 Resolve 上更胜一筹,展示了其可运行流程中能产出多少合格结果。

当推理骨干同为 GPT-4o 时,OmniHarness 总体解决率为 89.5%,ComfyMind 为 83%;在创意任务上,两者分别为 95% 和 57.5%。这表明,除了模型本身的推理能力,经验如何调用、工具如何组织,也是决定成败的关键因素。采用 Codex 进行规划后,总体解决率从 89.5% 提升至 92.5%,复杂任务解决率从 76.7% 升至 83.3%。不同的规划配置对应着不同的多步任务表现。其优势范围有限,复杂任务的 83.3% 仍未超过 ComfyMind 的 85%,并非所有子集都领先。

这些成绩在具体画面中是如何体现的?输入可以简单到一张花朵涂鸦。系统将其重绘为写实红花,再利用这种风格生成一片花田,两次生成通过中间图像连接起来。任务换成四格漫画,就是要把整个周日早晨的故事讲完:从醒来、看手机、发现是周日,到继续躺平,动作与文字都要服务于剧情。换成海报和书封,主题、标题、版式构成一组需要同时满足的要求。餐桌编辑则更为细致:需要移除叉子或替换成勺子,同时尽量保留周围的食物、杯子和桌面布局。

创作需求千变万化,红花可能换成其他主体,重绘后可能还要调整布局。一次成功如何助力下一次?OmniHarness 采用符号策略学习,将验证成功的流程整理成可复用的策略。以花田任务为例,花朵与颜色可以替换,但“先重绘草图,再借参考生成新画面”的连接方式,可以成为可调整的方法。保存的策略包含工作流模板、适用条件和资源依赖,而具体的图片和描述等实例输入则被抽离。后续调用时,先检查策略是否适用,再绑定新输入,按要求调整步骤或组合多条策略。

出题、检查、积累经验,这套系统是如何运转的?

第一步,把练习选在值得探索的地方。自主练习发生在下游任务明确之前。只做熟悉的题目难以补齐空缺,挑战太远又缺少方法支撑。系统结合练习记录与现有能力,让探索有迹可循。每轮默认生成 10 道候选题,以新颖性和能力边界的乘积决定练习哪一道。候选任务组成集合,衡量是否少有练习,反映当前能力是否为探索提供适度支撑。同类情境练得越多,新颖性得分越低。图生图以源图区分情境,文生图共享一个标记。得分按所需能力取平均,避免能力项过多导致自然占优。每项能力由适用、未停用流程中的最高可靠性提供支持;可靠性用 95% Wilson 置信区间下界估计。整道题的能力估计取最低值,这相当于先看短板:大部分步骤熟练,一处缺少可靠方法,仍会拖累整体完成。随后把能力估计转成选题分数,得分在 0.5 时达到最高,估计值趋近 0 或 1 时得分都会下降,练习因而偏向有基础但仍有挑战的任务。

第二步,让检查跟上每次执行。系统安排步骤和依赖,将代码编译成 ComfyUI 工作流,再检查流程能否运行、各步效果及最终目标是否达成。以花田任务说明:假如红花已偏离要求,下一步继续沿用,偏差也可能进入新画面。失败后,系统定位问题并局部修复,尽量保留已验证部分;需要时请子智能体协助,在重试预算内再次检查。

第三步,让成败都成为下一次的依据。验证成功的流程被抽象入库,失败则记录证据、原因与修正方法。等价流程会合并,可靠性随调用更新,经验继续影响选题和执行。策略还要接受后续检验,新的成败记录继续影响它的可靠性与调用优先级。

经验换个使用者还管用吗?团队把自主练习后的策略库冻结,再适配到其他智能体的知识接口。宿主保留原有控制流程,模型也不微调。交付的内容既有成功流程模板,也有失败证据与修正办法。其他智能体通过自身的检索、规划和执行机制使用它们。同一份经验,让三个系统的总体解决率都提高了:ComfyAgent 由 32.5% 升至 57.0%,ComfyMind 从 83.0% 提高到 88.0%,SymbOmni 则由 86.0% 达到 89.0%。对应的创意任务增幅依次为 27.5、17.5 和 10 个百分点。创意任务的提升均超过各自总体增幅。面对新要求,已有流程和纠错经验仍能为不同系统提供帮助。

还有更深层的迁移:只练过图像任务的冻结策略库,被用于视频工作流。视频总体解决率为 85.9%,高于表中最优对照 5.1 个百分点;视频到视频达到 80.0%,高出 13.3 个百分点。其中,图像策略负责内容构建、参考保持等操作,时序处理仍交给视频专用组件,二者需经适配与组合。

一次任务结束,经验的使用才刚刚开始。这条路径同样需要付出计算成本:自主练习、多轮验证和修复都会增加开销,检索效率与推理预算仍有优化空间。OmniHarness 展示了一种积累方式:模型参数不变,可调用的方法随实践更新。今天留下的经验,有机会成为明天处理新需求的起点。

最新快讯

2026年09月18日

10:58
《科创板日报》9月18日讯 今日上午,工信部、国家发改委等十部门联合发布《医药工业发展“十五五”规划》(简称“规划”)。其中提出到2030年的发展目标:生物医药研发应用稳居世界前列,创新驱动效能充分释放,重点领域关键核心技术实现系统性突破。 规划围绕产业规模效益、创新发展等提出预期性指标,具体包括: 规模以上医药工业企业营业收入超过3.5万亿元,创新药产业规...
10:58
《科创板日报》9月18日讯 当地时间周四,Marvell(迈威尔)宣布扩大与GlobalFoundries(格芯)的合作关系。 此次扩大后的协议建立在双方现有量产合作的基础上。根据此次合作,格芯和迈威尔将共同扩大前者位于美国佛蒙特州伯灵顿晶圆厂的硅锗(SiGe)晶圆产能,以满足下一代光互连日益增长的需求。 SiGe可用于近封装光学(NPO)和共封装光学(CP...
10:58
Anthropic近日首次公开了其核心研发指标,这一举动无异于揭开了一张底牌:三万个AI正在研发“下一代自己”,并正在经历疯狂的自我进化。这是Anthropic首次毫无保留地披露其内部三大研发指标。起初,我们以为这只是一份常规报告,但细读之下,这更像是一条“AI物种进化”的进度条。从头至尾,报告中的数据都在传递一个事实——研发智能体(RSI)真的来了。它正在...
10:58
“AI的下半场——从现在开始——将把重心从解决问题转向定义问题。”这是姚顺雨去年4月在博客《The Second Half(下半场)》中写下的判断。他认为,当一套通用训练方法能够越来越快地解决现成任务,更重要的问题将变成:AI到底该做什么,什么又算真正的进步?他尤其强调评估(Evaluation)。继续造更难的基准测试(Benchmark)...
10:58
「如果我想当数学家,看来大概只剩两周了。」开这句玩笑的,是一个13岁的小女孩。她的父亲Scott Aaronson是德州大学奥斯汀分校的理论计算机科学教授,也曾是OpenAI对齐团队的访问研究员。9月15日,Aaronson将女儿的这句话写进了一篇长博文中。同一篇博文里,他还列出了一份清单:过去一个月内,被AI证明或协助证明的长期开放问题——包括雅可比猜想的...
10:58
关于前沿人工智能研发速度的争论愈演愈烈。周三,Meta首席执行官马克·扎克伯格在社交平台X上首次公开表态,回应了这一争议。他认为,AI实验室应当引入独立的评估机构和外部顾问,并将安全审查纳入日常开发流程,这被视作“行业的最佳实践”。这一观点与Anthropic首席执行官达里奥·阿莫代伊此前提出的“适度放缓”思路存在差异。阿莫代伊上周末呼吁适当放慢最先进AI系...
10:58
9月18日,国务院新闻办公室举行了“开局起步‘十五五’”系列主题新闻发布会。 会上,住房和城乡建设部房地产市场监管司司长张雪涛指出,当前房地产市场正经历“两个转变”:一是供求关系发生重大变化,二是正式迈入存量时代。数据显示,二手房交易占比已从2020年的27%攀升至2025年的46%,且今年前8个月已达到52%。这一数据突破50%的关口,标志着房地产市场已全...
10:27
鼓狮财经9月18日讯当地时间周四,人工智能软件公司Palantir的首席执行官Alex Karp呼吁制定人工智能(AI)监管的“合理准则”,但他表示,由于该技术“无限风险”带来的责任,可能需要实行国有化。 “我认为这些企业必须国有化,因为如果不国有化,我的每一个客户都会起诉我,”他在接受最新采访时表示。 在上述采访中,Karp反复提及构建这项强大技术所带来的...
10:26
Nebius宣布将于10月1日起全面上调旗下GPU云服务定价,平均涨幅约20%。叠加英伟达发布强劲季度财报,推动该股盘后大涨近7%,AI算力供需格局持续偏紧的市场判断进一步获得印证。此轮提价覆盖H100、H200、B200及B300多款芯片型号,是Nebius今年5月以来的第二轮涨价。市场将此解读为AI算力需求持续过热、供给仍然紧张的强烈信号,受此提振,Co...
10:26
英伟达、谷歌与Emerald AI强强联手,旨在从根本上变革数据中心与电网的互动模式,将AI基础设施从传统的被动用电方转变为具备灵活调度能力的电网资源。三方于2026年9月16日正式宣布成立“AI能源管理联盟”(AEMA),核心使命是推动数据中心依据电网实时状况动态调整用电负荷。目前,英伟达与Emerald AI正联合能源及基础设施领域的合作伙伴,共同开发能...
10:26
当AI狂写代码,最 先扛不住的,竟是自家的CI!就在今天,Anthropic在一篇博客中,披露了一组极为震撼的内部真实数据——全公司80%的代码,直接由Claude编写!工程师平均每季度交付的代码量,达到2021—2025年平均水平的整整8倍。更离谱的是,Claude不仅负责疯狂堆代码,还在PR的代码审查、合并批准环节承担了大量主力工作。写...
10:26
对于Claude用户而言,近期有一个值得期待的好消息:未来处理复杂任务时,无需再纠结是留在聊天窗口还是切换到Cowork模式。Anthropic已将这两者整合至同一个入口。用户只需向Claude描述意图,至于是一句简单的回答,还是启动工具、处理文件或执行长任务,皆由Claude自行判断。此外,Claude Docs、Claude Slides和Claude ...