跳转至

Tiled Prompts: Overcoming Prompt Misguidance in Image and Video Super-Resolution

会议: ECCV 2026
论文: ECCV 原文
项目: https://bryanswkim.github.io/tiled-prompts/
领域: 图像生成
关键词: 图像超分辨率, 视频超分辨率, 扩散模型, 视觉语言模型, 瓦片提示

一句话总结

针对高分辨率图像与视频超分辨率在潜空间分块(Latent Tiling)推理中单一全局提示词引起的语义误导问题,本文提出 Tiled Prompts 框架,利用视觉语言模型为每个局部瓦片生成强相关的专属提示词,在信息论与分数匹配视角下严格约束局部后验分布,以极低计算开销显著抑制伪影与语义幻觉。

研究背景与动机

基于扩散模型与流匹配(Flow Matching)等生成先验的图像与视频超分辨率(SR)技术,近年来通过引入文本提示词作为语义锚点取得了令人瞩目的感知复原效果。然而,当输入图像或视频分辨率扩展至 2K、4K 乃至 8K 等超高分辨率时,显存占用的二次方增长迫使现代超分推理管线普遍采用潜空间分块策略(Latent Tiling),将整图或整段视频划分为网格状的局部瓦片(Tiles)分别进行去噪与超分辨率重建,最后通过加权高斯羽化拼接还原。

在这种分块推理范式下,传统方法普遍将描述整图的单一粗粒度全局文本提示词广播复制给所有局部瓦片,由此引发了严重的“提示词误导”(Prompt Misguidance)现象。这种语义偏离在真实重建中表现为两类核心矛盾:一是“无中生有”(Errors of Commission),即全局提示词中包含其他区域的实体描述(例如全图提示词中的“蓝天白云”被强加给路面或建筑局部瓦片),导致分类器无关引导(CFG)的得分梯度强行注入不相干语义;二是“细节遗漏”(Errors of Omission),即粗粒度全局提示词往往忽略局部特有的高频文本、特定标志或微观纹理,在高度不适定的局部反演问题中使模型因缺乏语义锚点而退化为模糊或胡乱猜测。在视频超分辨率(VSR)中,这一矛盾更进一步演变为空间与时序双重误导,静态全局文本完全无法描述局部动态物体的运动轨迹与状态演变。

面对分块推理与全局文本语义错配的天然冲突,直接微调超分辨率大模型成本高昂且难以兼顾任意分辨率。本文的核心 idea 是:抛弃一刀切的全局文本广播,直接利用轻量视觉语言模型(VLM)针对每个局部低分辨率瓦片自适应生成致密、精准的专属局部提示词(Tiled Prompts),从信息论互信息差上界直接压低提示词误导向量,实现无须重新训练底模的即插即用式高质量超分。

方法详解

整体框架

Tiled Prompts 针对单图像超分辨率(SISR)与视频超分辨率(VSR)构建了统一的分块局部提示生成与潜空间去噪管线。对于输入低分辨率图像或视频序列,系统首先将其在潜空间分割为具有重叠边缘的局部几何瓦片(图像为空间网格,视频为时空立方块)。随后,利用预训练视觉语言模型针对各局部瓦片提取高度对齐的文本提示词。在扩散反向去噪的每一步中,各局部瓦片在自身专属提示词与低分辨率特征的双重条件约束下计算去噪预测,并通过高斯窗口加权聚合,最终解码输出高保真高分辨率结果。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["低分辨率输入<br/>图像或视频序列"] --> B["潜空间时空分块切片<br/>重叠网格切分"]
    B --> C["局部提示词自适应提取<br/>VLM瓦片级密集语义描述"]
    C --> D["局部文本条件扩散去噪<br/>CFG轨迹校正与得分导引"]
    D --> E["高斯重叠加权羽化融合<br/>无缝拼接为高分辨率潜变量"]
    E --> F["高分辨率输出<br/>清晰逼真重建图像/视频"]

关键设计

1. 提示词误导的信息论形式化与上界约束:从数学本质证明局部提示的必要性 为深入揭示单一全局提示词 \(c_{\mathrm{global}}\) 对局部重建的破坏机制,论文首先在分数匹配框架下建立了理想局部条件 \(c^* \sim p^*(c^*|x_L^{(i)})\) 与实际条件 \(c\) 之间的偏离向量 \(\delta_i(c) := \Delta_t^{(i)}(c) - \Delta_t^{(i)}(c^*)\)。在分类器无关引导(CFG)系数为 \(s\) 时,扰动项 \(s\delta_i(c)\) 将生成轨迹系统性推离最优后验。论文通过引理严格证明,该误导向量在不同预测目标(\(x_0\) 预测、\(\epsilon\) 预测与速度 \(v\) 预测)下均可统一定义为基于得分函数差异的加权项: $$ \delta_i(c) = w(t) \left( \nabla_{x_t^{(i)}} \log p_{\theta,t}(x_t^{(i)} \mid x_L^{(i)}, c) - \nabla_{x_t^{(i)}} \log p_{\theta,t}(x_t^{(i)} \mid x_L^{(i)}, c^*) \right) $$ 进一步地,论文从信息论视角将该误差与互信息差 \(\Delta I := I(\hat{x}_H^{(i)}; c^* \mid x_L^{(i)}) - I(\hat{x}_H^{(i)}; c \mid x_L^{(i)})\) 建立桥梁,证明了 \(\Delta I\) 正好等于后验概率间的 KL 散度,并直接作为整个扩散时序上累积提示词误导范数的严格下界: $$ \Delta I \le \frac{1}{2} \int_0^T \lambda(t) \mathbb{E} \left[ |\delta_i(c)(t)|^2 \right] dt $$ 根据命题,由于局部提示词 \(c_{\mathrm{local}}^{(i)}\) 的语义覆盖紧密贴合局部瓦片,其对应的互信息差满足 \(\Delta I_\ell \le \Delta I_g\)。这在数学上证明了专属局部提示词能够直接压低误导误差的理论下界,从根源上消除了“张冠李戴”(commission)引起的语义污染与“要素遗漏”(omission)引起的不确定性。

2. 图像自适应瓦片提示提取机制:像素级细粒度语义注入 在图像超分辨率任务中,由于每个局部瓦片对应的物理视野被大幅放大,全局提示词无法刻画瓦片内部特定的招牌文字、建筑线条与微观结构。本设计利用预训练的高效视觉语言模型(如 Qwen2.5-VL-7B)担任瓦片提示词提取器 \(Y_{\mathrm{VLM}}\)。对于网格裁剪出的低分辨率瓦片 \(x_L^{(i)}\),直接提取具有强判别力的专属提示词 \(c_{\mathrm{local}}^{(i)} = Y_{\mathrm{VLM}}(x_L^{(i)}; \eta_i)\)。这一过程在去噪循环开始前离线并行完成一次,文本长度紧凑而语义密度极高,彻底解决了传统超分辨率模型在局部高频区域“凭空捏造乱码”的顽疾。

3. 全局-局部上下文联合的视频瓦片提示架构:化解时空运动歧义 将分块策略拓展至视频超分辨率(VSR)时,单纯裁剪局部时空块进行提示词提取会遭遇严重的“时空盲区”——VLM 面对视野极窄的时空切片,往往无法推断出全局物体的真实物理运动与场景变化(例如难以从局部几个像素的旋转辨别出是车辆在行驶还是反光扰动)。为攻克该难题,本设计构建了双重上下文输入机制: $$ c_{\mathrm{local}}^{(i)} := Y_{\mathrm{VLM}}(x_L^{(i)}, x_L; \eta_i) $$ 通过在系统提示词与查询指令中明确约束,让 VLM 结合完整的全景低分辨率视频序列 \(x_L\) 作为全局背景参照,同时将注意力焦距精准锁定在特定瓦片 \(x_L^{(i)}\) 的动态演变上。这种设计使得提取出的提示词不仅具备高空间精度,还能赋予精准的时序动态标签(例如准确描述“局部车轮高速旋转”而非泛泛的“一辆汽车”),同时消除了空间误导与时序误导。

一个完整示例

以一段分辨率为 512×512 放大至 2048×2048 的城市街景图像超分辨率为例: 1. 分块与提示词生成:输入被划分为 25 个大小为 64×64(重叠度 16)的潜空间瓦片。位于图像右上角包含店铺招牌的瓦片,若采用传统全局提示词,其接收到的文本为“城市街道俯瞰,包含行人、道路与远方建筑物”,模型去噪时招牌区域被泛化为模糊几何色块;而采用 Tiled Prompts 时,VLM 针对该瓦片生成“咖啡店木质招牌,清晰雕刻字母 COFFEE 与金色边框”。 2. 局部条件去噪与融合:去噪扩散过程从 \(t=T\)\(t=0\) 执行,在每个时间步 \(\tau_m\),第 \(i\) 个瓦片将专属提示词与局部潜特征送入 DiT4SR 骨干网络计算噪声估计 \(\hat{e}^{(i)}\)。 3. 加权聚合:通过预先计算的高斯权重窗口 \(w_i\) 将各瓦片的估计值累加至全局噪声缓冲器中并做归一化,重叠区域过渡极其平滑,最终解码出字符轮廓锐利且完全符合真实语义的 2048×2048 街景。

实验关键数据

主实验

论文在真实图像超分辨率基准(LSDIR1K、Urban100、OST300,4× 放大至 2048×2048)与真实视频超分辨率基准(VideoLQ、RealVSR、MVSR4x)上进行了全面评测。基础模型分别选用 DiT4SR(图像)与基于 I2VGen-XL 的 STAR(视频)。

数据集 提示词配置 NIQE↓ MUSIQ↑ MANIQA↑ CLIPIQA↑ CLIP Score↑ ImageReward↑ HPSv2↑
LSDIR1K 无提示词 (Null) 3.4537 62.2188 0.6126 0.6346
全局提示词 (Global Baseline) 2.9427 63.8677 0.6373 0.6886 25.3348 -1.5901 0.1589
全局 + 局部 (Global + Local) 2.9418 64.0749 0.6379 0.6932 25.7925 -1.4775 0.1719
局部瓦片提示 (Local, 本文) 2.9040 63.9731 0.6350 0.6917 27.2274 -0.6771 0.2011
URBAN100 全局提示词 (Global Baseline) 3.6156 53.1372 0.6668 0.6715 25.9807 -1.1688 0.1780
局部瓦片提示 (Local, 本文) 3.5001 54.9203 0.6618 0.6780 27.4044 -0.5193 0.2092
OST300 全局提示词 (Global Baseline) 2.9547 66.3813 0.6536 0.6799 25.1512 -1.6638 0.1418
局部瓦片提示 (Local, 本文) 2.9007 66.7233 0.6518 0.6943 26.8594 -0.7881 0.1838

在视频超分辨率任务中(VideoLQ 数据集),局部提示词同样带来跨越式提升:NIQE 从 4.8016 改善至 4.5913,MUSIQ 从 43.9160 提升至 45.7662,视频质量评价指标 FAST-VQA 从 0.7507 提升至 0.7643,DOVER 从 53.5704 升至 54.4158,图文对齐指标 VQAScore 更从 0.3987 暴涨至 0.5542

消融与推理开销分析

下表展示了在高分辨率参考图像集上的客观指标对比(Table 3),以及生成瓦片提示带来的额外推理耗时(Table 4):

数据集 / 评估项目 提示词配置 PSNR↑ SSIM↑ LPIPS↓ DISTS↓ FID↓ 推理耗时 (秒)
LSDIR2048 (参考对比) 全局提示词 (Global) 22.55 0.5973 0.3000 0.1462 17.09
全局 + 局部 (Global+Local) 22.54 0.5980 0.2967 0.1445 17.98
局部瓦片提示 (Local, 本文) 22.63 0.6011 0.2900 0.1400 16.42
SEPE8K (参考对比) 全局提示词 (Global) 23.00 0.6358 0.2852 0.1324 26.00
局部瓦片提示 (Local, 本文) 22.96 0.6335 0.2809 0.1276 24.16
DiT4SR 推理耗时 原始基线 (全局提示) 162.58s
(25 tiles) + 局部瓦片提示 (本文) 166.15s (+2.2%)
STAR 视频推理耗时 原始基线 (全局提示) 1273.9s
(12 blocks) + 局部瓦片提示 (本文) 1348.3s (+5.8%)

关键发现

  • 纯局部提示词优于全局+局部拼接:实验发现直接将全局提示词与局部提示词拼接(Global + Local),其效果普遍弱于仅使用局部提示词(Local)。在 LSDIR1K 上 ImageReward 从 -1.4775 跃升至 -0.6771。这证实了复原增益并非来源于堆砌更多文本 token,而是来自于过滤掉无关全局概念后的高语义相关性。
  • CFG 引导尺度越大,增益越显著:超参数消融表明,随着分类器无关引导系数 \(s\) 的增大,全局提示词由于误导项 \(s\delta_i(c)\) 的线性放大,生成结果的伪影和结构扭曲急剧恶化;而 Tiled Prompts 能够使扩散轨迹牢牢锚定在真实语义流形上,在高 CFG 下展现出更明显的质量领先优势。
  • 极高的计算效率收益比:对于 25 个图像瓦片,VLM 提取提示词仅增加了约 3.57 秒(增幅仅 2.2%);在视频超分辨率中开销增幅也仅为 5.8%,对于超分后处理而言完全可以忽略。

亮点与洞察

  • 理论严密的误导边界建模:巧妙地将分数匹配去噪轨迹的偏差与条件互信息差建立数学等价关系,不仅在直觉上揭示了分块推理中文本广播的内在弊病,而且给出了严格的信息论误差下界证明。
  • 兼顾全局视角的时空提示抽取:敏锐捕捉到了视频局部块在运动认知上的局限性,通过向 VLM 注入全景序列与局部切片的协同提示指令,破解了局部块动态模糊这一核心瓶颈。
  • 完全免训练的即插即用泛化性:该方案不改变底层任何超分辨率扩散模型的权重,亦不需要昂贵的配对微调,可直接赋能现有的任意图像与视频分块超分辨率管线。

局限与展望

  • 对前端 VLM 视觉理解鲁棒性的强依赖:当输入的低分辨率瓦片发生极度退化、重度噪声或失焦模糊时,VLM 自身可能产生严重的幻觉或识别错误,进而产生次级提示词误导。
  • 复杂密集文字与极微小目标的辨识上限:通用 VLM 在处理极端微小字体或罕见符号时仍存在 OCR 能力短板,未来可探索专用的退化鲁棒局部描述提取器。
  • 未来方向:探索分块提示词在去噪时间步上的动态调度策略,例如仅在前期高层语义结构形成阶段启用局部文本引导,后期聚焦纯细节去噪以进一步节省时间。

相关工作与启发

  • vs SUPIR / SeeSR: SUPIR 与 SeeSR 依赖全图级的大模型或专用提示提取器(DAPE)生成整图文本,在进入 Latent Tiling 后依然退化为全局广播模式;本文直接聚焦于分块切片级别的局部文本特异性,填补了全图描述与局部瓦片间的语义鸿沟。
  • vs MultiDiffusion / Mixture of Diffusers: MultiDiffusion 等工作主要研究如何通过优化和加权融合不同瓦片的潜变量以解决拼缝问题,关注点在于几何与分布的重叠一致性;本文则从条件控制的语义源头切入,解决了提示词本身的不匹配。
  • vs Upscale-A-Video / STAR: 现有生成式视频超分基准高度依赖文本先验但普遍使用单一简短描述,忽略了长视频局部的时空动态差异;本文的双重上下文抽取机制为长序列分块视频复原提供了崭新范式。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 首次系统性提出并形式化了分块超分中的提示词误导问题,理论论证极其优美扎实。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖图像与视频两大领域、多个真实数据集与跨维度客观/主观评估指标,论证充分。
  • 写作质量: ⭐⭐⭐⭐⭐ 逻辑严密,数学推导与实验设计层层相扣,问题定义非常清晰。
  • 价值: ⭐⭐⭐⭐⭐ 为大模型时代的超高清生成式图像/视频恢复提供了轻量且极具实用价值的通用推理方案。