prompt工程已死?Google DeepMind提出“视觉提示工程”新范式:比文本指令更有效
提示工程(prompt engineering)已成为提升语言模型性能的关键手段。当前的一个共识是:只要模型的输入空间足够丰富,就存在通过优化输入来获得更好下游性能的机会。
那么,这一原理是否仅适用于语言模型,还是同样可以推广到其他模态,比如视觉领域?
在一篇最新论文中,Google DeepMind 提出了“视觉提示工程”(visual prompt engineering,VIPE),将提示工程成功扩展到了视觉领域。

论文链接:https://arxiv.org/abs/2607.25537
实验结果显示,视觉提示工程方法能在多个任务上提升视频推理性能,且对视频模型来说,该方法有时比经典的文本提示工程或 test-time scaling 更有效。
正如文本提示工程能系统性地提升语言模型性能一样,视觉提示工程也可以作为一种简单、计算高效的方法,用来激发视频模型更好的视觉推理表现。
研究团队表示,视觉提示工程指向了一种新的范式,即“视觉提示本身也可以像文本提示一样被优化”。随着前沿视频模型接收更丰富的多模态上下文,视觉提示工程或许会从单张图像编辑,扩展到多张参考图像甚至视频。
视觉提示工程:在新的视觉场景中处理同一问题
视觉提示工程是针对视频模型视觉输入的提示工程方法,在不改变任务逻辑的前提下,将原始图像转换为模型更容易理解和推理的视觉形式,让模型能在新的视觉场景中处理同一问题。例如,抽象的球和斜坡示意图可以改为写实的台球和木板场景,关键空间关系需保持一致。

图|视觉提示工程从一个视觉提示开始,例如一张球和斜坡的草图图像,以及“球沿着……滚下,最后落入其中一个桶里”这样的文本提示。
具体流程如下:
1.构想器:负责提出图像该怎么改。它会根据任务样本和约束,生成一段自然语言编辑指令。指令里会明确哪些任务相关元素必须保留,比如物体数量、位置、朝向和相对关系
2.编辑器:根据编辑指令修改原图,生成一个或多个候选图。这个步骤可以由图像编辑模型完成,也可以由人工编辑完成。
3.筛选器:可选步骤。当编辑器生成多个候选图时,筛选器会从中选出更合适的版本。筛选器会优先选择图像质量更好、同时保留了原图任务关键信息的候选版本。
比文本指令更有效
研究团队在 VPCT 物理推理任务上进行测试并验证自动化视觉提示工程。整体而言,视觉提示工程能提升视频模型的视觉推理表现,且优化视觉上下文通常比优化文本指令更有效。
真正驱动性能提升的是视觉真实感
使用视觉提示工程后,Veo 3.1 准确率从 41.3% 提升到 59.3%,Omni Flash 从 56.3% 提升到 67.5%,视频模型系统性地偏好照片级真实上下文而非抽象输入。

图|视觉提示工程提升了 VPCT 上的物理推理能力。
既可以自动化,也能作为有效的测试时扩展策略
视觉提示工程的自动化流程由视觉-语言模型(VLM)生成改写指令,图像编辑模型生成候选图,自动评分器负责筛选或反馈迭代。研究团队比较了自由形式构想和原子概念编辑(ACE)两条路线,结果显示两种方法都能自动生成更好的改写图像;自由形式视觉提示工程在部分任务上把错误率降低超过 75%。ACE 在 Sort 3 Numbers 上,如果按样本选择最佳视觉版本,错误率可以降为 0。

图|自动化视觉提示工程在多种任务上都能提升性能。
在小球滚落物理推理任务中,未使用视觉提示工程时,Veo 3.1 通过多次采样从 41.3% 提升到 50.0%;加入视觉提示工程后,单次采样准确率就达到 59.3%。如果在视觉提示工程改写后的视觉提示上继续进行多次采样,准确率可达 68.0%。

图|视觉提示工程还可以与测试时扩展结合,进一步提升性能。
优化视觉上下文往往比优化文本指令更有效
以 Sort 3 Numbers 为例,最优文本提示和最优图像提示的准确率分别为 86% 和 76%。

图|对于视频模型而言,视觉提示工程可能比文本提示工程更有效。
没有系统性提升原生图像生成模型的推理表现
研究团队测试了 Nano BananaPro、Nano Banana 2 等模型,结果显示,把输入换成照片级真实图像后,图像模型的推理性能并没有稳定提升。这可能是因为原生图像生成模型覆盖了更多视觉风格,对抽象草图和真实图像都更熟悉。

图|原生图像生成模型在 VPCT 上的结果,报告每种配置下的最佳提示结果。
有效的图像改写通常具备三类特征:场景更真实、目标更突出、语义更直接
这类改写能够把抽象草图转换成更接近真实世界的视觉场景,从而减少抽象输入与视频模型熟悉视觉表征之间的差距。例如在 VPCT 任务上,将草图改写为照片级真实场景后,Veo 3.1 的准确率提升到 59.3%。因此,当同一任务可以转换为更真实的视觉场景时,应优先使用真实场景版本。

图|向真实感迈出的每一步都会提升生成一致性。
当然,当前的方法也存在一定的局限性。
例如,当前的视觉提示工程方法依赖图像编辑模型的质量,如果编辑器改变任务信息或引入伪影,下游视频模型可能无法解决原始任务。未来,如果图像编辑模型能更稳定地保留任务信息,额外的筛选和质量控制可能就不再需要。
同时,视觉提示工程也会带来额外成本。不过,图像编辑通常比视频生成便宜得多,因此这项成本在实践中也可能转化为优势。一次便宜的图像编辑调用,可以降低一次昂贵视频生成失败的概率。
本文来自微信公众号 “学术头条”(ID:SciTouTiao),作者:学术头条,36氪经授权发布。
相关推荐
Agent下半场!比Prompt更重要的是「上下文工程」,Anthropic首次系统阐述
OpenAI官方的Prompt工程指南:你可以这么玩ChatGPT
2026年玩AI必备技能:不是提示词,是循环工程
OpenAI 发布 GPT 提示词工程指南
「Loop 工程」火了:从写提示词,到让 AI 自动干活!
斯坦福新论文:微调已死,自主上下文当立
Google DeepMind成立,OpenAI怕了没?
月薪4万的“关键”新兴岗位:研究如何向AI发出专业提问
神州问学论文发布:提出企业级大模型智能体规划新范式“Routine”
我从顶级的提示词工程团队那里学到了什么?
网址: prompt工程已死?Google DeepMind提出“视觉提示工程”新范式:比文本指令更有效 https://www.xishuta.cn/newsview152087.html
推荐科技快讯
- 1问界商标转让释放信号:赛力斯 95792
- 2报告:抖音海外版下载量突破1 25736
- 3人类唯一的出路:变成人工智能 25175
- 4人类唯一的出路: 变成人工智 24611
- 5移动办公如何高效?谷歌研究了 24309
- 6华为 nova14深度评测: 13155
- 7滴滴出行被投诉价格操纵,网约 11888
- 82023年起,银行存取款迎来 10774
- 9五一来了,大数据杀熟又想来, 9794
- 10手机中存在一个监听开关,你关 9519
