AI完成任务之后,究竟留下了什么?北京航空航天大学、香港中文大学和新加坡国立大学的研究团队近期推出了 OmniHarness,提出了一条新路径:让视觉智能体主动练习、自我检查,并将验证通过的流程固化下来。面对新的需求时,AI 手中便能多一份经过实战检验的方法。

论文全文:https://arxiv.org/abs/2609.16057
项目主页:https://omniharness.github.io
代码与运行说明:https://github.com/OmniHarness/OmniHarness

在创意任务测试中,OmniHarness 达到了 95% 的解决率,比表中最优的 SymbOmni 高出 27.5 个百分点。当采用 Codex 和 GPT-4o 配置时,总体解决率为 92.5%。表中的 “Pass” 衡量流程是否可执行,”Resolve” 衡量输出是否满足要求。OmniHarness 的两种配置在 Pass 和 Resolve 上均表现出色,其中 Pass 达到 100%。ComfyMind 和 SymbOmni 也能做到 Pass 100%,但 OmniHarness 在 Resolve 上更胜一筹,展示了其可运行流程中能产出多少合格结果。

当推理骨干同为 GPT-4o 时,OmniHarness 总体解决率为 89.5%,ComfyMind 为 83%;在创意任务上,两者分别为 95% 和 57.5%。这表明,除了模型本身的推理能力,经验如何调用、工具如何组织,也是决定成败的关键因素。采用 Codex 进行规划后,总体解决率从 89.5% 提升至 92.5%,复杂任务解决率从 76.7% 升至 83.3%。不同的规划配置对应着不同的多步任务表现。其优势范围有限,复杂任务的 83.3% 仍未超过 ComfyMind 的 85%,并非所有子集都领先。

这些成绩在具体画面中是如何体现的?输入可以简单到一张花朵涂鸦。系统将其重绘为写实红花,再利用这种风格生成一片花田,两次生成通过中间图像连接起来。任务换成四格漫画,就是要把整个周日早晨的故事讲完:从醒来、看手机、发现是周日,到继续躺平,动作与文字都要服务于剧情。换成海报和书封,主题、标题、版式构成一组需要同时满足的要求。餐桌编辑则更为细致:需要移除叉子或替换成勺子,同时尽量保留周围的食物、杯子和桌面布局。

创作需求千变万化,红花可能换成其他主体,重绘后可能还要调整布局。一次成功如何助力下一次?OmniHarness 采用符号策略学习,将验证成功的流程整理成可复用的策略。以花田任务为例,花朵与颜色可以替换,但“先重绘草图,再借参考生成新画面”的连接方式,可以成为可调整的方法。保存的策略包含工作流模板、适用条件和资源依赖,而具体的图片和描述等实例输入则被抽离。后续调用时,先检查策略是否适用,再绑定新输入,按要求调整步骤或组合多条策略。

出题、检查、积累经验,这套系统是如何运转的?

第一步,把练习选在值得探索的地方。自主练习发生在下游任务明确之前。只做熟悉的题目难以补齐空缺,挑战太远又缺少方法支撑。系统结合练习记录与现有能力,让探索有迹可循。每轮默认生成 10 道候选题,以新颖性和能力边界的乘积决定练习哪一道。候选任务组成集合,衡量是否少有练习,反映当前能力是否为探索提供适度支撑。同类情境练得越多,新颖性得分越低。图生图以源图区分情境,文生图共享一个标记。得分按所需能力取平均,避免能力项过多导致自然占优。每项能力由适用、未停用流程中的最高可靠性提供支持;可靠性用 95% Wilson 置信区间下界估计。整道题的能力估计取最低值,这相当于先看短板:大部分步骤熟练,一处缺少可靠方法,仍会拖累整体完成。随后把能力估计转成选题分数,得分在 0.5 时达到最高,估计值趋近 0 或 1 时得分都会下降,练习因而偏向有基础但仍有挑战的任务。

第二步,让检查跟上每次执行。系统安排步骤和依赖,将代码编译成 ComfyUI 工作流,再检查流程能否运行、各步效果及最终目标是否达成。以花田任务说明:假如红花已偏离要求,下一步继续沿用,偏差也可能进入新画面。失败后,系统定位问题并局部修复,尽量保留已验证部分;需要时请子智能体协助,在重试预算内再次检查。

第三步,让成败都成为下一次的依据。验证成功的流程被抽象入库,失败则记录证据、原因与修正方法。等价流程会合并,可靠性随调用更新,经验继续影响选题和执行。策略还要接受后续检验,新的成败记录继续影响它的可靠性与调用优先级。

经验换个使用者还管用吗?团队把自主练习后的策略库冻结,再适配到其他智能体的知识接口。宿主保留原有控制流程,模型也不微调。交付的内容既有成功流程模板,也有失败证据与修正办法。其他智能体通过自身的检索、规划和执行机制使用它们。同一份经验,让三个系统的总体解决率都提高了:ComfyAgent 由 32.5% 升至 57.0%,ComfyMind 从 83.0% 提高到 88.0%,SymbOmni 则由 86.0% 达到 89.0%。对应的创意任务增幅依次为 27.5、17.5 和 10 个百分点。创意任务的提升均超过各自总体增幅。面对新要求,已有流程和纠错经验仍能为不同系统提供帮助。

还有更深层的迁移:只练过图像任务的冻结策略库,被用于视频工作流。视频总体解决率为 85.9%,高于表中最优对照 5.1 个百分点;视频到视频达到 80.0%,高出 13.3 个百分点。其中,图像策略负责内容构建、参考保持等操作,时序处理仍交给视频专用组件,二者需经适配与组合。

一次任务结束,经验的使用才刚刚开始。这条路径同样需要付出计算成本:自主练习、多轮验证和修复都会增加开销,检索效率与推理预算仍有优化空间。OmniHarness 展示了一种积累方式:模型参数不变,可调用的方法随实践更新。今天留下的经验,有机会成为明天处理新需求的起点。

最新快讯

2026年09月18日

12:00
真是深藏不露!就在近日,谷歌在AI竞技场Arena中悄然上线了一款名为“gemini-3.8-flash”的新模型,引发了业内巨大轰动。经过资深开发者的实测,这款模型极有可能是谷歌DeepMind耗时半年打磨的下一代旗舰——Gemini 4 Pro。其表现之强悍,被形容为“恐怖”。 一份流传甚广的基准测试图显示,Gemini 4 Pro在编码、智能体、推理等...
12:00
Claude Code 如今能自己组建一支 AI 团队了。就在不久前,Anthropic 官宣了重新设计的 Projects 功能,首站便落地 Claude Code。 用户只需在一个对话框中清晰说明任务,Claude 便会将其拆解为多条线程,在云端并行开工。即便合上电脑,任务仍在继续。只有遇到需要拍板的关键节点,它才会回来寻求指示。用户在通勤途中,也能通过...
12:00
Anthropic 官宣了一位新任高管,他是清华校友 Sihao Huang。此次加入,他出任前沿计算战略负责人,直接搭档联合创始人兼首席算力官 Tom Brown,也一举成为了 Anthropic 公开职级最高的华人。 Sihao Huang 年仅二十多岁,将负责 Anthropic 的基础设施扩张、合作联盟建设以及应对前沿 AI 指数级演进的长期算力规划...
12:00
9月17日,地平线与中国汽车技术研究中心有限公司(以下简称“中汽中心”)正式签署战略合作协议。双方将秉持优势互补、讲求实效、共同提高及实现双赢的原则,建立长期战略合作伙伴关系,围绕产业政策、行业标准、测试评价及检测认证等方向开展深度协同,共同推动中国智能汽车产业的高质量发展。此次合作,是智能驾驶核心技术企业与国家级产业技术服务权威平台之间的一次深度融合。 双...
12:00
9月18日上午,A股科技板块延续强势走势。截至发稿时,科创50指数放量上涨2.99%,科创芯片类ETF集体领跑涨幅榜。 其中,科创芯片设计方向领涨,国泰、华宝、鹏华、天弘、永赢等多只相关ETF涨幅均超过4%。科创半导体设备ETF(鹏华)、科创半导体设备ETF(华泰柏瑞)、集成电路ETF(嘉实)等同步涨超4%。科创人工智能ETF(华宝、国泰、银华)涨幅也超过3...
12:00
9月18日,鼓狮财经报道,在美国硅谷关于人工智能发展前景的争论愈演愈烈之际,美东时间周三,被誉为“华尔街一哥”的美国最大商业银行摩根大通首席执行官杰米戴蒙发表了他的见解:支持由联邦层面实施“轻度监管”模式,反对地方监管,理由是各州法律不一将增加AI商业落地的复杂性。 戴蒙呼吁对AI实施轻度监管。尽管戴蒙历来不热衷于加强监管,但他在最新讲话中明确表示,AI行业...
11:29
据鼓狮财经9月18日报道,美国国务院于17日宣布,已批准一项可能向沙特阿拉伯出售48架F-35战斗机及相关设备的对外军售方案,预计总金额高达243亿美元。根据声明内容,这笔交易涵盖48架战机、49台配套发动机,以及通信设备、备件、培训及各类保障设备。据悉,该军售案还需经过美国国会审批,即便最终获批,首批战机的交付也需数年时间。
11:29
鼓狮财经9月18日电,非洲疾病预防控制中心主任卡塞亚17日在线上发布会上指出,现有数据尚不足以证实刚果(金)本轮埃博拉疫情已达到峰值,疫情传播并未得到持续控制。他指出,尽管当前疫情曲线总体略有下降,但这一趋势仍不稳定。 卡塞亚呼吁有关部门进一步厘清传播链条,加强社区监测工作,并采取有效措施防止疫情向新地区扩散。根据刚果(金)卫生部发布的最新报告,截至9月15...
11:29
鼓狮财经9月17日报道,继Anthropic首席执行官阿莫德伊上周呼吁业界放缓AI发展步伐引发震动后,该公司周四公布了三项新指标,旨在帮助人工智能公司监测自身发展进度。其中一项披露显示,Anthropic旗下大模型Claude目前已在公司内部主导了26%的AI研发工作。 该公司在周四的博客文章中介绍了这三个维度的进展,并分享了相关方法论,鼓励其他组织效仿。文...
11:29
9月11日,康宁宣布对全球日元计价的显示玻璃基板产品提价15%以上,新价格将于2026年第四季度生效。调价原因是日元持续走弱,叠加关键原材料、贵金属、能源及物流成本上涨,企业已难以内部消化。此前,TCL华星于9月10日率先向下游客户发出电视面板涨价函,直指上游原材料成本压力。京东方紧随其后发布调价通知,惠科也向客户发出了涨价函,三星、LG及索尼均已收到相关函...
11:29
**电力需求的“悖论”与基建的硬约束** 9月,高盛在AI主题播客节目中抛出一组极具冲击力的数字。尽管AI模型与芯片效率持续提升,数据中心电力需求仍在加速增长。高盛将美国2030年数据中心电力需求预测从83吉瓦上调至108吉瓦,全球数据中心用电较2025年的增幅预期从117%上升至170%。从2024年初到2030年底,AI新增用电规模相当于整个日本全年的用...