提示工程已成为提升语言模型性能的关键手段。当前的一个共识是:只要模型的输入空间足够丰富,就存在通过优化输入来获得更好下游性能的机会。那么,这一原理是否仅适用于语言模型,还是同样可以推广到其他模态,比如视觉领域?在 Google DeepMind 提出的最新论文中,团队提出了“视觉提示工程”,成功将提示工程扩展到了视觉领域。实验结果显示,视觉提示工程方法能在多个任务上提升视频推理性能,且对视频模型来说,该方法有时比经典的文本提示工程或 test-time scaling 更有效。正如文本提示工程能系统性地提升语言模型性能一样,视觉提示工程也可以作为一种简单、计算高效的方法,用来激发视频模型更好的视觉推理表现。

视觉提示工程:在新的视觉场景中处理同一问题

视觉提示工程是针对视频模型视觉输入的提示工程方法,在不改变任务逻辑的前提下,将原始图像转换为模型更容易理解和推理的视觉形式,让模型能在新的视觉场景中处理同一问题。例如,抽象的球和斜坡示意图可以改为写实的台球和木板场景,关键空间关系需保持一致。

具体流程如下:

构想器:负责提出图像该怎么改。它会根据任务样本和约束,生成一段自然语言编辑指令。指令里会明确哪些任务相关元素必须保留,比如物体数量、位置、朝向和相对关系。

编辑器:根据编辑指令修改原图,生成一个或多个候选图。这个步骤可以由图像编辑模型完成,也可以由人工编辑完成。

筛选器:可选步骤。当编辑器生成多个候选图时,筛选器会从中选出更合适的版本。筛选器会优先选择图像质量更好、同时保留了原图任务关键信息的候选版本。

比文本指令更有效

研究团队在 VPCT 物理推理任务上进行测试并验证自动化视觉提示工程。整体而言,视觉提示工程能提升视频模型的视觉推理表现,且优化视觉上下文通常比优化文本指令更有效。

真正驱动性能提升的是视觉真实感

使用视觉提示工程后,Veo 3.1 准确率从 41.3% 提升到 59.3%,Omni Flash 从 56.3% 提升到 67.5%,视频模型系统性地偏好照片级真实上下文而非抽象输入。

既可以自动化,也能作为有效的测试时扩展策略

视觉提示工程的自动化流程由视觉-语言模型生成改写指令,图像编辑模型生成候选图,自动评分器负责筛选或反馈迭代。研究团队比较了自由形式构想和原子概念编辑两条路线,结果显示两种方法都能自动生成更好的改写图像;自由形式视觉提示工程在部分任务上把错误率降低超过 75%。ACE 在 Sort 3 Numbers 上,如果按样本选择最佳视觉版本,错误率可以降为 0。

优化视觉上下文往往比优化文本指令更有效

以 Sort 3 Numbers 为例,最优文本提示和最优图像提示的准确率分别为 86% 和 76%。对于视频模型而言,视觉提示工程可能比文本提示工程更有效。

没有系统性提升原生图像生成模型的推理表现

研究团队测试了 Nano BananaPro、Nano Banana 2 等模型,结果显示,把输入换成照片级真实图像后,图像模型的推理性能并没有稳定提升。这可能是因为原生图像生成模型覆盖了更多视觉风格,对抽象草图和真实图像都更熟悉。

有效的图像改写通常具备三类特征

这类改写能够把抽象草图转换成更接近真实世界的视觉场景,从而减少抽象输入与视频模型熟悉视觉表征之间的差距。例如在 VPCT 任务上,将草图改写为照片级真实场景后,Veo 3.1 的准确率提升到 59.3%。因此,当同一任务可以转换为更真实的视觉场景时,应优先使用真实场景版本。

局限性与展望

当然,当前的方法也存在一定的局限性。例如,当前的视觉提示工程方法依赖图像编辑模型的质量,如果编辑器改变任务信息或引入伪影,下游视频模型可能无法解决原始任务。未来,如果图像编辑模型能更稳定地保留任务信息,额外的筛选和质量控制可能就不再需要。同时,视觉提示工程也会带来额外成本。不过,图像编辑通常比视频生成便宜得多,因此这项成本在实践中也可能转化为优势。一次便宜的图像编辑调用,可以降低一次昂贵视频生成失败的概率。

最新快讯

2026年07月31日

20:32
据鼓狮财经7月31日报道,日本熊本县灾害对策本部发布的最新统计数据显示,此次地震的遇难人数已攀升至36人。截至31日下午,熊本县境内的供电设施已基本恢复正常。据中国地震台网正式测定,当地时间7月28日16时27分(北京时间15时27分),日本九州岛发生6.8级地震,震源深度10公里。消息来源为央视新闻。
20:32
据鼓狮财经7月31日报道,克利夫兰联储主席哈玛克指出,当前的政策立场缺乏足够的紧缩力度。她认为,通胀压力不仅源于供给侧,需求端同样不容忽视。她并不相信通胀会自行回落至2%的目标水平。通胀持续的时间越长,最终降低通胀的成本就会越高。
20:19
过去几年,科技巨头们不断向员工灌输一个理念:拥抱 AI,才能提升生产力。然而,现实却给企业泼了一盆冷水:如果 AI 运用不当,不仅无法省钱,反而可能沦为吞噬预算的“黑洞”。近日,亚马逊内部曝光了多起 AI 项目成本失控事件,其中最令人咋舌的一起,涉及一笔高达 180 万美元的账单。 该项目旨在利用 Anthropic 的 Claude Sonnet 模型,自...
20:19
7月29日,华盛顿国会山。萨姆·奥特曼结束了一场与参议员的闭门会议,刚走出大门便被记者团团围住。面对关于闯入Hugging Face的未发布模型现状的追问,他仅甩出两个字:“永久停用”。紧接着,针对是否还有其他系统遭黑,他并未否认,只是含糊表示“有可能”。 事实上,就在前一天,OpenAI刚刚发布了一份与Hugging Face联合发布的调查报告,澄清了事件...
20:19
关于 Claude Code 是否存在浪费 Token 的现象,大家众说纷纭,究竟差距有多大?近日终于有了具体的测算数据。 Composio 团队进行了一项有趣的对比实验,他们使用同一模型 Kimi K3,分别在 Claude Code、Hermes 和 Kimi Code 三个 Agent 框架中运行了 28 个完全相同的任务。 结果显示,三个框架在任务成...
20:19
前段时间,米哈游一名工程师在测试多Agent协作时,因忘记设置熔断机制,导致几十个Agent陷入死循环调用。直到13个小时后账单出炉,金额高达200万。大洋彼岸的Uber也没好到哪去,给5000名工程师开放AI编程工具,仅用4个月就烧穿了2026年的全年预算。Token价格不是已经下降了99%吗?为什么还能烧得这么狠?这个疑问问得好。就在刚刚,DeepSee...
20:19
01 猎杀天才 2026年7月30日,美联储宣布维持利率不变。消息一出,Nebius股价暴涨29%,SanDisk上涨22%,CoreWeave上涨20%。整个AI硬件板块单日集体飙升,市场一片欢腾。“定时炸弹已被拆除”,前一天还在疯狂抛售的资金,此刻反手疯狂买入。 如果有人的持仓能再撑24小时——不需要追加资金,不需要做任何操作——他不仅不会破产,还会单日...
19:42
7月最后一个交易日,全球AI科技资产终于上演深V反击。纳指100涨3.36%、费城半导体暴涨8.19%、DRAM指数飙升16.70%。存储链集体逼空:闪迪、西数、希捷、SK海力士ADR、美光全涨超15%。VIX重挫17.28%回到17附近。今天亚洲紧随其后:韩国SK海力士30%涨停(南方两倍做多海力士最高暴涨超70%)、三星涨近27%,韩综、日经、台股全线大...