<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
    <channel>
        <title>Prompt Engineering on LeoDreamer</title>
        <link>https://LeoDreamer2004.github.io/tags/prompt-engineering/</link>
        <description>Recent content in Prompt Engineering on LeoDreamer</description>
        <generator>Hugo -- gohugo.io</generator>
        <language>zh-cn</language>
        <lastBuildDate>Mon, 03 Aug 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://LeoDreamer2004.github.io/tags/prompt-engineering/index.xml" rel="self" type="application/rss+xml" /><item>
            <title>论文阅读 - 提示词工程</title>
            <link>https://LeoDreamer2004.github.io/p/paper-reading/prompt-engineering/</link>
            <pubDate>Mon, 03 Aug 2026 00:00:00 +0000</pubDate>
            <guid>https://LeoDreamer2004.github.io/p/paper-reading/prompt-engineering/</guid>
            <description>&lt;p&gt;视频生成模型并不只接收文字。对于图生视频模型，输入图片既是首帧，也是物体、空间关系和物理约束的主要载体。既然文字 Prompt 可以优化，为什么不能直接优化视觉 Prompt？论文 &lt;a class=&#34;link cite-VIPE&#34;&gt;[&lt;span class=&#34;material-index&#34;&gt;&lt;/span&gt;]&#xA;    &lt;span class=&#34;material-name&#34;&gt;Unknown-material&lt;/span&gt; &#xA;&lt;/a&gt; 因此提出一个相当自然的问题，把这种方法称为 &lt;strong&gt;视觉提示词工程 (Visual Prompt Engineering, VIPE)&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;&lt;img alt=&#34;VIPE 整体流程&#34; class=&#34;gallery-image&#34; data-flex-basis=&#34;371px&#34; data-flex-grow=&#34;154&#34; height=&#34;939&#34; loading=&#34;lazy&#34; sizes=&#34;(max-width: 767px) calc(100vw - 30px), (max-width: 1023px) 700px, (max-width: 1279px) 950px, 1232px&#34; src=&#34;https://LeoDreamer2004.github.io/p/paper-reading/prompt-engineering/vipe-overview.png&#34; srcset=&#34;https://LeoDreamer2004.github.io/p/paper-reading/prompt-engineering/vipe-overview_hu_608c77897c8352f2.png 800w, https://LeoDreamer2004.github.io/p/paper-reading/prompt-engineering/vipe-overview.png 1454w&#34; width=&#34;1454&#34;&gt;&lt;/p&gt;&#xA;&lt;h2 id=&#34;把输入图片视为-prompt&#34;&gt;把输入图片视为 Prompt&#xA;&lt;/h2&gt;&lt;p&gt;一个视频推理样本记为 $(x_i,t_i)$，其中 $x_i\in\mathcal{X}$ 是视觉 Prompt，$t_i\in\mathcal{T}$ 是文字 Prompt。视频模型以二者为条件生成视频，并通过视频中的状态变化给出任务答案。&lt;/p&gt;&#xA;&lt;p&gt;VIPE 只把原图 $x_i$ 替换为一个更适合模型推理的视觉变体 $v_i^*$。完整流程包含三个角色：&lt;/p&gt;&#xA;&lt;ol&gt;&#xA;&lt;li&gt;&lt;strong&gt;构思器 (Ideator)&lt;/strong&gt;：提出应该如何改图；&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;编辑器 (Editor)&lt;/strong&gt;：按照指令生成若干视觉变体；&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;筛选器 (Filter)&lt;/strong&gt;：可选, 检查变体质量以及它是否忠实于原任务。&lt;/li&gt;&#xA;&lt;/ol&gt;&#xA;&lt;p&gt;构思器 $I$ 接收一组任务样本 $X=\{(x_i,t_i)\}_{i=1}^k$ 和构思要求 $t_{\mathrm{ideate}}$，生成编辑指令：&lt;/p&gt;&#xA;$$&#xA;t_{\mathrm{edit}}\sim I(X,t_{\mathrm{ideate}}).&#xA;$$&lt;p&gt;编辑器 $E$ 根据这条指令为每张图片采样 $m$ 个候选变体：&lt;/p&gt;&#xA;$$&#xA;V_i=\{v_{i,j}\}_{j=1}^m,\qquad&#xA;v_{i,j}\sim E(x_i,t_{\mathrm{edit}}).&#xA;$$&lt;p&gt;最后，筛选器用评分函数 $S$ 同时衡量图片质量和任务一致性：&lt;/p&gt;&#xA;$$&#xA;v_i^*=\arg\max_{v\in V_i}S(v,x_i).&#xA;$$&lt;p&gt;这里真正困难的是在改动材质、背景和语义包装的同时，严格保持物体数量、位置、方向和任务规则不变。&lt;/p&gt;&#xA;&lt;div class=&#34;math-block math-algo&#34;&gt;&#xA;    &lt;p class=&#34;math-title&#34;&gt;算法&lt;span class=&#34;math-subtitle&#34;&gt;视觉提示词工程 (VIPE)&lt;/span&gt;&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong class=&#34;algo-input&#34;&gt;输入 &amp;gt; &lt;/strong&gt; 原始图片 $x_i$，文字指令 $t_i$，构思要求 $t_{\mathrm{ideate}}$，候选数 $m$，视频模型 $M$。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong class=&#34;algo-output&#34;&gt;输出 &amp;gt; &lt;/strong&gt; 视频模型生成的任务解答及其评分。&lt;/p&gt;&#xA;&lt;ol&gt;&#xA;&lt;li&gt;构思器根据任务规则生成视觉编辑指令 $t_{\mathrm{edit}}$，并显式列出不可改变的对象和空间约束。&lt;/li&gt;&#xA;&lt;li&gt;编辑器对原图执行 $m$ 次随机编辑，得到候选集合 $V_i$。&lt;/li&gt;&#xA;&lt;li&gt;筛选器比较候选图与原图，删除物体缺失、位置变化或任务语义被破坏的样本。&lt;/li&gt;&#xA;&lt;li&gt;选择得分最高的 $v_i^*$ 作为新视觉 Prompt。&lt;/li&gt;&#xA;&lt;li&gt;将 $(v_i^*,t_i)$ 输入视频模型，生成任务演化视频。&lt;/li&gt;&#xA;&lt;li&gt;用任务专用评分器判断视频是否完成任务。&lt;/li&gt;&#xA;&lt;/ol&gt;&#xA;&lt;/div&gt;&#xA;&lt;h2 id=&#34;实验效果&#34;&gt;实验效果&#xA;&lt;/h2&gt;&lt;p&gt;&lt;img alt=&#34;VPCT 上的写实化效果&#34; class=&#34;gallery-image&#34; data-flex-basis=&#34;619px&#34; data-flex-grow=&#34;258&#34; height=&#34;573&#34; loading=&#34;lazy&#34; sizes=&#34;(max-width: 767px) calc(100vw - 30px), (max-width: 1023px) 700px, (max-width: 1279px) 950px, 1232px&#34; src=&#34;https://LeoDreamer2004.github.io/p/paper-reading/prompt-engineering/vpct-results.png&#34; srcset=&#34;https://LeoDreamer2004.github.io/p/paper-reading/prompt-engineering/vpct-results_hu_b24f7d082d1090b5.png 800w, https://LeoDreamer2004.github.io/p/paper-reading/prompt-engineering/vpct-results.png 1479w&#34; width=&#34;1479&#34;&gt;&lt;/p&gt;&#xA;&lt;p&gt;有怀疑是：提升究竟来自写实，还是单纯来自把二维草图做成了有深度感的三维物体？作者又制作了一组拥有三维结构、却使用棋盘格等怪异材质的图片。多数模型在这组图片上与原始草图没有显著区别，说明只增加 3D 外观并不够，符合真实世界分布的材质与场景才是主要因素。&lt;/p&gt;&#xA;&lt;h2 id=&#34;自动搜索视觉-prompt&#34;&gt;自动搜索视觉 Prompt&#xA;&lt;/h2&gt;&lt;p&gt;手动把草图改成台球场景依赖人的先验，我们不一定知道什么视觉包装更适合模型。论文比较了两种自动构造方法。&lt;/p&gt;&#xA;&lt;h3 id=&#34;自由构思&#34;&gt;自由构思&#xA;&lt;/h3&gt;&lt;p&gt;最简单的方法是让 VLM 直接提出一个新的视觉语境。论文使用 Gemini 3.1 Pro 负责构思，Nano Banana 2 负责编辑，再由 Gemini 从五张图里选一张。构思器只知道任务规则，不接收下游视频得分，因此这是一个开环方法。&lt;/p&gt;&#xA;&lt;h3 id=&#34;原子概念编辑&#34;&gt;原子概念编辑&#xA;&lt;/h3&gt;&lt;p&gt;另一条路线是论文 &lt;a class=&#34;link cite-ACE&#34;&gt;[&lt;span class=&#34;material-index&#34;&gt;&lt;/span&gt;]&#xA;    &lt;span class=&#34;material-name&#34;&gt;Unknown-material&lt;/span&gt; &#xA;&lt;/a&gt; 提出的 &lt;strong&gt;原子概念编辑 (Atomic Concept Editing, ACE)&lt;/strong&gt;。自由构思一次改变整个场景，ACE 则每次只添加、删除或替换一个概念，例如：原图、背景改为深色、增加物体尺寸、给目标添加粗边框、把平面圆形改成磨砂黏土球。&lt;/p&gt;&#xA;&lt;p&gt;ACE 从原图开始建立搜索树，由 VLM 提议原子编辑，图片模型生成子节点，再根据视频评分器反馈继续扩展。这是一个闭环搜索过程，代价更高，但能逐步确认究竟是哪一种修改产生了提升。&lt;/p&gt;&#xA;&lt;p&gt;&lt;img alt=&#34;自动视觉提示词工程&#34; class=&#34;gallery-image&#34; data-flex-basis=&#34;372px&#34; data-flex-grow=&#34;155&#34; height=&#34;936&#34; loading=&#34;lazy&#34; sizes=&#34;(max-width: 767px) calc(100vw - 30px), (max-width: 1023px) 700px, (max-width: 1279px) 950px, 1232px&#34; src=&#34;https://LeoDreamer2004.github.io/p/paper-reading/prompt-engineering/automated-vipe.png&#34; srcset=&#34;https://LeoDreamer2004.github.io/p/paper-reading/prompt-engineering/automated-vipe_hu_ebbc687f17470041.png 800w, https://LeoDreamer2004.github.io/p/paper-reading/prompt-engineering/automated-vipe.png 1452w&#34; width=&#34;1452&#34;&gt;&lt;/p&gt;&#xA;&lt;p&gt;论文从成功节点中归纳出三个常见模式：&lt;/p&gt;&#xA;&lt;ul&gt;&#xA;&lt;li&gt;真实材质：把抽象元素变成磨砂黏土、粉笔板、金属轨道等有明确物理属性的物体，改善对象恒常性；&lt;/li&gt;&#xA;&lt;li&gt;高对比目标隔离：使用深色背景、粗边框和清晰色块，引导模型关注任务对象；&lt;/li&gt;&#xA;&lt;li&gt;语义简化：减少抽象修饰，把 “same-colored” 换成 “matching”、把 “the two” 换成 “both” 等更直接的表达。&lt;/li&gt;&#xA;&lt;/ul&gt;&#xA;&lt;p&gt;值得注意的是，成功变体往往同时使用多种策略。这意味着 VIPE 在把图片变写实的同时，还共同调整材质先验、视觉注意力和任务语义。&lt;/p&gt;&#xA;&lt;h2 id=&#34;视觉-prompt-也是-test-time-scaling&#34;&gt;视觉 Prompt 也是 test-time scaling&#xA;&lt;/h2&gt;&lt;p&gt;传统测试时扩展会对同一个 Prompt 多生成几次，再用多数投票或评分模型选答案。以 Veo 3.1 的 VPCT 实验为例，对原始草图采样 20 次并进行自一致性投票 &lt;a class=&#34;link cite-Self-Consistency&#34;&gt;[&lt;span class=&#34;material-index&#34;&gt;&lt;/span&gt;]&#xA;    &#xA;&lt;/a&gt;，准确率从 41.3% 提升到 50.0%；而只用一次人工设计的 VIPE Prompt，就能达到 59.3%。&lt;/p&gt;&#xA;&lt;p&gt;二者并不冲突。在 VIPE 图片上继续采样 20 次，最终可以达到 68.0%。&lt;/p&gt;&#xA;&lt;p&gt;&lt;img alt=&#34;VIPE 与传统测试时扩展&#34; class=&#34;gallery-image&#34; data-flex-basis=&#34;439px&#34; data-flex-grow=&#34;183&#34; height=&#34;355&#34; loading=&#34;lazy&#34; sizes=&#34;(max-width: 767px) calc(100vw - 30px), (max-width: 1023px) 700px, (max-width: 1279px) 950px, 1232px&#34; src=&#34;https://LeoDreamer2004.github.io/p/paper-reading/prompt-engineering/test-time-scaling.png&#34; width=&#34;650&#34;&gt;&lt;/p&gt;&#xA;&lt;p&gt;成本也是论文很强调的一点。实验时生成一段 Veo 3.1 视频约需 3.20 美元，而包含五次图片编辑和筛选的一组 VIPE 变体约需 0.40 美元。也就是说，在固定预算下，与其反复对同一张图生成视频，不如先搜索更多便宜的视觉变体，再为每个变体生成少量视频。&lt;/p&gt;&#xA;&lt;p&gt;这个结论可以写成一个简单的预算分配问题。若生成 $n$ 个视觉变体、每个变体采样 $a$ 段视频，总成本近似为：&lt;/p&gt;&#xA;$$&#xA;C(n,a)=n\left(c_{\mathrm{VIPE}}+a\,c_{\mathrm{video}}\right).&#xA;$$&lt;p&gt;由于当前 $c_{\mathrm{VIPE}}\ll c_{\mathrm{video}}$，论文实验中的最优策略通常倾向增大 $n$ 而不是增大 $a$。这相当于把测试时计算从“重复尝试同一表示”转移到“探索不同表示”。&lt;/p&gt;&#xA;&lt;h2 id=&#34;谁更重要&#34;&gt;谁更重要？&#xA;&lt;/h2&gt;&lt;p&gt;视频模型同时接收文字和图片，二者都可以被优化。作者保持一侧不变，分别让构思器提出 20 个文字变体或视觉变体，再比较最好的候选：&lt;/p&gt;&#xA;&lt;table&gt;&#xA;&#x9;&lt;thead&gt;&#xA;&#x9;&#x9;&#x9;&lt;tr&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;th&gt;任务&lt;/th&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;th style=&#34;text-align: right&#34;&gt;原始 Prompt&lt;/th&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;th style=&#34;text-align: right&#34;&gt;最佳文字变体&lt;/th&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;th style=&#34;text-align: right&#34;&gt;最佳视觉变体&lt;/th&gt;&#xA;&#x9;&#x9;&#x9;&lt;/tr&gt;&#xA;&#x9;&lt;/thead&gt;&#xA;&#x9;&lt;tbody&gt;&#xA;&#x9;&#x9;&#x9;&lt;tr&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;VPCT 子集&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td style=&#34;text-align: right&#34;&gt;57%&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td style=&#34;text-align: right&#34;&gt;62%&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td style=&#34;text-align: right&#34;&gt;&lt;strong&gt;73%&lt;/strong&gt;&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&lt;/tr&gt;&#xA;&#x9;&#x9;&#x9;&lt;tr&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;Conjunctive Search&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td style=&#34;text-align: right&#34;&gt;4%&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td style=&#34;text-align: right&#34;&gt;12%&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td style=&#34;text-align: right&#34;&gt;&lt;strong&gt;62%&lt;/strong&gt;&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&lt;/tr&gt;&#xA;&#x9;&#x9;&#x9;&lt;tr&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;Sort 3 Numbers&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td style=&#34;text-align: right&#34;&gt;4%&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td style=&#34;text-align: right&#34;&gt;&lt;strong&gt;86%&lt;/strong&gt;&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td style=&#34;text-align: right&#34;&gt;76%&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&lt;/tr&gt;&#xA;&#x9;&#x9;&#x9;&lt;tr&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;Connect the Dots&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td style=&#34;text-align: right&#34;&gt;3%&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td style=&#34;text-align: right&#34;&gt;&lt;strong&gt;35%&lt;/strong&gt;&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td style=&#34;text-align: right&#34;&gt;8%&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&lt;/tr&gt;&#xA;&#x9;&lt;/tbody&gt;&#xA;&lt;/table&gt;&#xA;&lt;p&gt;总结说视频模型存在两个相互作用的 Prompt 空间，任务瓶颈在哪个模态，就应该优先搜索哪个模态。&lt;/p&gt;&#xA;&lt;h2 id=&#34;为什么写实场景更容易推理&#34;&gt;为什么写实场景更容易推理？&#xA;&lt;/h2&gt;&lt;p&gt;作者认为 VIPE 主要弥合了输入表示和训练分布之间的差距。视频模型大概率见过大量真实视频，却没有见过同等规模的几个圆沿虚线移动视频。在抽象场景中，物体容易随机出现、消失、变形或交换身份；一旦初始条件都无法保持，后续推理自然无从谈起。&lt;/p&gt;&#xA;&lt;p&gt;论文还让 Nano Banana 自己承担推理任务，直接生成“球落入某个桶”的结果图片。此时 VIPE 不再稳定有效：&lt;/p&gt;&#xA;&lt;ul&gt;&#xA;&lt;li&gt;Nano Banana Pro 图像输出只从 45% 提升到 50%；&lt;/li&gt;&#xA;&lt;li&gt;Nano Banana 2 图像输出反而从 37% 降到 21%；&lt;/li&gt;&#xA;&lt;li&gt;Nano Banana 2 直接输出文字标签时，原始草图达到 58%，高于 VIPE 的 50%。&lt;/li&gt;&#xA;&lt;/ul&gt;&#xA;&lt;p&gt;同一个模型在文字输出上明显强于图片输出，说明模型可能知道答案，却无法稳定地把答案渲染成正确图片。论文把它称为 &lt;strong&gt;渲染瓶颈 (rendering bottleneck)&lt;/strong&gt;。同时，这也表明写实偏好并非所有视觉模型共有的定律，更可能是特定模型训练分布与输入表示不匹配的结果。&lt;/p&gt;&#xA;</description>
        </item></channel>
</rss>
