跳转至

ScrollScape: Unlocking 32K Image Generation With Video Diffusion Priors

会议: ECCV 2026
论文: ECCV 原文
领域: 图像生成
关键词: 极端宽高比生成、视频扩散先验、旋转位置编码、潜空间超分辨率、全景图像合成

一句话总结

ScrollScape 将极端宽高比(如 8:1)超高分辨率全景图像与长卷合成重构为连续视频平移扫描任务,利用视频扩散模型的时序一致性充当全局结构约束,并结合扫描位置编码(ScanPE)与滚动超分辨率(ScrollSR),首次将生成分辨率无缝扩展至 32K 且彻底消除了局部重复与拼缝伪影。

研究背景与动机

文本引导的扩散模型在常规尺寸图像生成中已达到照片级保真度,但在合成极端宽高比(Extreme Aspect Ratio, EAR,如 8:1、1:8)的超宽自然全景或中国传统水墨长卷时,几乎所有前沿基线都会遭遇灾难性的结构崩溃。由于静态文本到图像(T2I)基础模型主要在常规比例和中等分辨率的数据集上训练,模型内部固化了静态视口的局部空间先验,缺乏跨越超大尺度画布的长程空间依赖建模能力。

为了拓展生成尺寸,现有方案通常采取两类妥协:一类是像 SyncDiffusion、MultiDiffusion 和 Tiled Diffusion 这样将目标画布划分为重叠局部窗口的分块扩散方法,这类方法缺乏统揽全局的宏观结构先验,导致画面频繁出现语义断裂和拼接痕迹;另一类是像 ScaleCrafter、DyPE 等通过空洞卷积扩张或位置编码插值修改内部表示的免训练外推方法,虽然增大了感受野,但由于打破了原有的坐标注意力分布,极易在画卷中反复生成多个太阳、多组重复树丛或建筑,造成严重的语义模式循环(semantic looping)。

这一技术困境的核心矛盾在于:静态图像扩散模型本质上依赖固定视角的局部空间相关性,无法在缺乏显式位移控制的情况下自发维持数万像素尺度的全局空间叙事。本文的切入视角跳出了静态图像的固有框架:超长画卷的水平延展在感知逻辑上天然等价于摄像机沿单一维度的连续平移扫描,而预训练视频扩散模型(如 Wan2.1)历经海量动态数据训练,其时序自注意力天然蕴含着强大的前后连贯性物理约束。核心 idea:将极端宽高比超宽画布的静态空间生成重构成时序维度的平移视频生成,借助视频先验的时序连续性约束长程空间结构,并通过动态重构全局坐标与潜空间逐帧超分实现高达 32K 的无缝长卷合成。

方法详解

整体框架

ScrollScape 将超高分辨率长卷生成转化为潜空间中的时序扫描与超分流水线。给定目标超大画布,模型首先将其在潜在空间分解为一组沿扫描轨迹重叠移动的局部视窗序列,利用 ScanPE 赋予每个视窗动态的全局绝对空间坐标,并驱动预训练视频扩散 Transformer(基于 Wan2.1-T2V-1.3B)生成低分辨率潜变量序列;随后,ScrollSR 模块利用视频超分辨率先验在潜空间内进行高分辨率特征精细化;最后,通过坐标对齐的 3D VAE 解码与基于中值特征共识的加权斜坡融合,将局部瓦片无缝拼合为高达 32K 像素的完整全景。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入文本提示词与扫描轨迹参数"] --> B["视窗轨迹分解与全局坐标锚定"]
    B --> C["扫描位置编码 ScanPE<br/>时空三轴解耦 RoPE 映射"]
    C --> D["时序视频扩散 DiT 生成<br/>低分辨率连续潜变量序列"]
    D --> E["滚动超分辨率 ScrollSR<br/>潜空间时序超分精细化"]
    E --> F["坐标对齐 3D VAE 解码<br/>分组锚点与中值共识筛选"]
    F --> G["全景帧融合 Panoramic Fusion<br/>斜坡加权生成 32K 终图"]

关键设计

1. 空间延展到时序扫描的数学映射:以视频平移取代分块拼接 传统分块生成方法各窗口独立或仅依赖局部交叉引导,极易丢失宏观走势。ScrollScape 将整个目标画布在潜空间中表示为 \(z \in \mathbb{R}^{H \times W \times C}\),将其沿时序轴分解为包含 \(T\) 个局部视窗的序列 \(\mathcal{S} = \{z_t\}_{t=1}^T\),每个视窗尺寸为 \(h \times l \times C\)。每个视窗 \(t\) 在全局画布上绑定一个起始锚点位置 \(O_t\): $\(O_t = P_{\text{init}} + \sum_{k=1}^{t-1} \Delta \cdot \mathbf{d}_k\)$ 其中 \(P_{\text{init}}\) 为画布起始坐标,\(\Delta\) 为扫描步长,\(\mathbf{d}_k \in \{(\pm 1, 0), (0, \pm 1)\}\) 为各步扫描方向。对于常规 8:1 水平全景,\(\mathbf{d}_k = (0, 1)\),第 \(t\) 步的水平偏移直接简化为 \((t-1)\Delta\);而在需要覆盖二维不规则画布时,方向序列可周期性折返构成蛇形(snake-like)扫描轨迹。这种设定彻底改变了生成机制,使模型从固定视窗的“瓦片贴图”转变为移动摄像机的“连续平移拍摄”。

2. 扫描位置编码 ScanPE:解除固定视口绑定的动态坐标系 标准视频 DiT 采用的 3D-RoPE 假定所有帧都在同一静态相机视口下捕获,各帧中处于相同索引位置的 token 被赋予完全相同的空间旋转编码,若直接平移采样会导致坐标失配或严重的语义重复。ScanPE 破除了这一限制,将视窗 \(t\) 内的局部 token 坐标 \(p_{\text{loc}} = (h_{\text{loc}}, w_{\text{loc}})\) 显式映射到全局画布坐标 \(P_g(t, p_{\text{loc}}) = p_{\text{loc}} + O_t = (H_g, W_g)\)。在进行旋转位置编码时,将每个注意力的通道维度解耦切分为时序、垂直和水平三个子空间,分别施加一维旋转变换后拼接: $\(\mathcal{R}(t, H_g, W_g) = \Theta_t(t; \theta^t) \oplus \Theta_h(H_g; \theta^h) \oplus \Theta_w(W_g; \theta^w)\)$ 如此一来,不同扫描时间步进入自注意力运算的 token 不再混淆为静态网格上的重复点,而是严格依照其在全局全景画布上的绝对物理位置交互,从而赋予了模型全局的空间长程布局感知。

3. 滚动超分辨率 ScrollSR 与坐标对齐解码:突破 32K 显存瓶颈并消除接缝 直接在像素空间或单步扩散中一次性生成 32K 像素会引发灾难性的显存爆炸(OOM),且标准 3D VAE 逐帧解码长序列时极易因各窗口外观剧烈变化产生边缘闪烁与接缝割裂。ScrollSR 首先在潜空间利用视频超分辨率先验(基于修改版 FlashVSR)对低分辨率潜变量序列逐帧精细化,在保持显存开销平稳的同时传递连续的高频细节。随后在 3D VAE 解码时引入坐标对齐分组机制:以全局锚点 \(O_t\) 为基准将潜变量分组,利用锚点块提供稳定上下文,避免解码上下文漂移。

4. 基于中值共识的帧融合:抑制解码离群值与拼接伪影 在最终将解码得到的图像瓦片拼合成 32K 全景图时,重叠区域往往存在多视窗微小解算差异。对于第 \(t\) 个视窗产生的 \(F\) 个候选解码切片 \(\{I_{t,i}\}_{i=1}^F\),ScrollScape 先提取各切片的通道特征统计量 \(f(I_{t,i})\) 并计算通道级中值特征向量 \(\mathbf{m}_t = \operatorname{Median}_{k=1}^F f(I_{t,k})\),通过选取与中值特征欧氏距离最小的候选切片: $\(i_t^* = \arg\min_{i \in \{1,\ldots,F\}} \|f(I_{t,i}) - \mathbf{m}_t\|_2, \quad I_t = I_{t, i_t^*}\)$ 筛选出最具共识性的瓦片,有效滤除瞬态斑块与伪影;最后利用距离引导的线性斜坡权重遮罩(ramp mask)\(M_t\) 进行加权无缝融合,生成过渡平滑且细节锐利的超大图。

损失函数 / 训练策略

虽然视频扩散模型蕴含强大的动态时空先验,但其预训练分布与静态超高分辨率长卷依然存在领域差距。ScrollScape 采用条件流匹配(Conditional Flow Matching)进行轻量对齐微调。在噪声样本与数据样本之间构造线性插值轨迹: $\(z_\tau = (1 - \tau)\epsilon + \tau z^{\text{data}}, \quad \tau \in [0, 1]\)$ 模型优化目标为预测由噪声驱动至真实数据的速度场: $\(\mathcal{L}_{\text{FM}} = \mathbb{E}_{z^{\text{data}}, \epsilon, \tau} \left\| v_\theta(z_\tau, \tau, c, \mathcal{R}) - (z^{\text{data}} - \epsilon) \right\|_2^2\)$ 其中 \(c\) 为文本提示词,\(\mathcal{R}\) 为 ScanPE 编码。训练基于 Wan2.1-T2V-1.3B 初始化,仅需在收集的 3,000 张高质量全景数据(2,000 张 \(\ge 6:1\) 自然全景与 1,000 张 6:1 中国水墨长卷)上使用 2 张 A100 GPU、批大小为 4、学习率 \(1 \times 10^{-5}\) 的 AdamW 优化器微调 10,000 步即可完成对齐,展现出极高的数据与算力效率。

实验关键数据

主实验

为了公平评测极端宽高比下的生成质量并避免全局缩放带来的几何形变偏差,实验采用 Patch-based 评测策略:将 8:1 全景图切割为无重叠的 1:1 正方形网格,在网格尺度评测局部保真度(FID、KID)与文本对齐度(CLIP);通过网格间风格损失(Style-L)衡量拼接连贯性;并特别提出了全局结构多样性(Global Structural Diversity, GSD)指标——分别利用 LPIPS(感知纹理变化,越高越多样)和 DINOv2 余弦相似度(语义去冗余,越低越无重复)检测长程画布上的模式循环与内容复制。在 8:1 宽高比(短边 1024)的定量对比见原论文 Table 1。

方法 (Method) FID ↓ CLIP ↑ KID ↓ \((\times 10^{-2})\) Style-L ↓ \((\times 10^{-3})\) GSD ↑ (LPIPS) GSD ↓ (DINOv2)
FLUX-Krea 333.7 20.9 20.4 6.0 0.174 0.822
FLUX-Krea+Fill 281.4 19.1 4.9 13.5 0.293 0.841
DyPE 248.1 24.6 4.7 5.5 0.569 0.682
MultiDiffusion 261.7 29.7 3.7 5.0 0.658 0.902
SyncDiffusion 245.2 26.5 3.2 4.7 0.618 0.895
Tiled Diffusion 241.2 27.3 3.0 4.5 0.591 0.901
ScrollScape (本文) 214.7 30.0 2.0 4.0 0.674 0.670

此外,在 100 组多样化提示词、20 位独立评测者的盲测用户研究(原论文 Table 2)中,ScrollScape 在结构连贯性、内容丰富度与图像质感三项维度上对所有基线均形成压倒性优势(相比 DyPE 分别获得 92%、89%、87% 的偏好胜率;相比 Tiled Diffusion 分别获得 76%、85%、74% 的偏好胜率)。

消融实验

消融实验深入验证了 ScanPE、对齐训练阶段、潜变量解码策略以及 ScrollSR 模块各自的关键作用。结果记录于原论文 Table 3。

配置 (Config) FID ↓ CLIP ↑ KID ↓ \((\times 10^{-2})\) Style-L ↓ \((\times 10^{-3})\) GSD ↑ (LPIPS) GSD ↓ (DINOv2) 说明 (Note)
Wan2.1 (原始基线) 246.5 25.9 4.7 2.0 0.303 0.975 虽 Style-L 极低,但实因产生严重相同图样重复
w/o Training (无对齐训练) 272.0 24.6 6.3 7.6 0.569 0.858 ScanPE 打破了重复,但纹理杂乱、噪声严重
Vanilla latents (朴素潜变量解码) 231.6 25.6 3.2 6.0 0.469 0.730 缺乏坐标对齐与共识筛选,相邻视窗模糊退化
w/o ScrollSR (无滚动超分) 218.8 26.5 2.4 4.9 0.668 0.671 虽宏观结构连贯,但前背景高频质感明显模糊
ScrollScape (完整模型) 214.7 30.0 2.0 4.0 0.674 0.670 各项指标最佳,完美兼顾保真度与全局结构多样性

关键发现

  • 视频先验成功打破语义模式死循环:原始 Wan2.1 在长卷外推下由于缺少移动坐标引导,生成内容呈现机械性自复制(DINOv2 高达 0.975);引入 ScanPE 能够迫使模型分配全局空间实体,将 DINOv2 重复度大幅压缩至 0.670,同时感知多样性 LPIPS 提升至 0.674。
  • 超轻量对齐微调是画质落地的质变节点:未经微调的 w/o Training 变体尽管能维持结构发散,但 FID 劣化至 272.0,说明通用视频动态噪声先验必须经由高质量静态长卷数据的流匹配微调,才能将时序连续性顺畅收敛为静态高保真几何纹理。
  • 潜空间超分显著优于直接外推:ScrollSR 不仅规避了直接生成 32K 像素的显存墙,还将 FID 从无超分时的 218.8 进一步压降至 214.7,定性放大图(如荷花花瓣与甲虫纹理)表明其恢复了极为锐利的微观边缘。

亮点与洞察

  • 将空间延展等价于时序平移的降维解法:巧妙将二维超宽静态图像的全局一致性难题转化为一维平滑流动的视频时序约束。利用预训练视频模型原本用于抵御帧间闪烁的时间注意力,反向充当了超长画布上的宏观空间防撕裂约束。
  • 轻巧解耦的 ScanPE 坐标重映射:无需重构复杂的长序列注意力架构,仅通过分解 RoPE 为时间、行、列三向独立旋转算子并叠加全局偏移量,即零额外参数地将“静止视口”升级为“动态扫描摄影机”。
  • 可复用的潜空间串行流水线:低分辨率扫描生成、潜空间 VSR 逐帧超分与坐标对齐中值融合三步解耦,使得普通显卡在有限显存下也能端到端输出工业级 32K 全景长图,为超高分辨率生成设计了标准化范式。

局限与展望

  • 复杂语义流动的长程提示词控制仍较单一:目前模型主要依据单一全局提示词进行整体画风调控,对于长卷不同区段需要呈现不同故事剧情或跨场景叙事(如《清明上河图》从郊野逐渐过渡到集市繁华)的精细化局部语义渐变控制尚显不足。
  • 扫描方向主要局限于单向轴线:目前实验主要验证了水平平移或规整折返扫描,对于更具任意性的自由曲面、非欧几何展开或复杂环形全景相机的连续推拉摇移,仍需探索更通用的自适应轨迹编码策略。
  • 未来方向:探索与多模态大语言模型(MLLM)结合,由 Agent 动态规划全景各区域的分段叙事脚本并自适应注入局部交叉注意力,实现兼具 32K 物理保真度与宏大叙事深度的长卷故事生成。

相关工作与启发

  • vs SyncDiffusion / MultiDiffusion / Tiled Diffusion:分块扩散方案在重叠区域进行平均或基于梯度的同步,但由于缺乏对全局连贯性的高阶先验感知,面对 8:1 极端比例时不可避免地暴露出接缝切片感与大面积结构雷同;ScrollScape 从生成机理上采用连续平移视频流先验,从源头杜绝了拼缝断层。
  • vs DyPE / ScaleCrafter:免训练位置插值与空洞卷积外推方法强行改变静态注意力和感受野,严重偏离了静态 T2I 的原分布,导致重复目标成倍激增;ScrollScape 保持原有视频模型注意力机制完好,仅替换为带全局物理偏移的 ScanPE,在微量微调下实现了极佳的泛化稳定性。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 巧妙跳出静态图像视框,首次系统性将极端宽高比长卷生成重构为时序视频平移,并打通 32K 潜空间超分。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 8:1 横纵长卷的全面定性对比、精细的 Patch 定量评测、专门设计的 GSD 多样性指标以及完备的消融和盲测。
  • 写作质量: ⭐⭐⭐⭐⭐ 动机阐述深刻,方法各阶段公式与逻辑严密清晰,图表呈现扎实直观。
  • 价值: ⭐⭐⭐⭐⭐ 为超宽全景图像合成、数字文化长卷复原与工业级 32K 超清生成提供了极具启发性的技术路线。