跳转至

VERTIGO: Visual Preference Optimization for Cinematic Camera Generation

会议: ECCV 2026
论文: ECCV 原文
项目: http://vertigo.magic-lab.tech/
领域: 对齐/RLHF(亦属视频生成/计算摄影)
关键词: 相机轨迹生成、视觉偏好优化、直接偏好优化 (DPO)、计算电影摄影、视听语言一致性

一句话总结

首个将视觉偏好优化引入相机轨迹生成的后训练框架 VERTIGO,利用实时图形引擎(Unity)将 3D 相机路径渲染为 2D 预览帧,通过经过电影语料微调的 VLM 进行逆向描述与嵌入相似度打分,并借助 DPO 对齐镜头语言意图与构图质量,将拍摄目标脱幅率从 38.7% 骤降至 0.8%。

研究背景与动机

电影摄影的核心不仅在于依据剧本生成平滑的物理机位运动,更在于摄影指导(Cinematographer)与导演(Director)之间的双向闭环协同:摄影指导依据剧本操控相机运动与构图,而导演则在监视器前对画面的构图平衡、视觉美感与叙事匹配度进行即时审校与裁决。近年来,随着生成式 AI 的发展,以 GenDoP、DIRECTOR 和 CCD 为代表的文本条件相机轨迹生成系统取得了长足进步,能够根据自然语言描述自动生成多样化的连续 3D 相机位姿序列。然而,这些纯几何生成的系统严重欠缺一个“监视器前的导演”角色——它们仅从轨迹分布的角度学习相机运动,无法感知机位变换在最终二维画幅中实际呈现的视觉效果,导致生成运动虽然符合几何运动分布,但在构图上极易出现主体偏离画幅中心、角色出画失焦以及视觉美学崩塌等关键缺陷。

将强化学习或偏好微调(如 RLHF、DPO)引入轨迹生成模型面临两大核心壁垒:第一,相机轨迹本质上是连续的高维 3D 位姿参数序列(位移与旋转矩阵),其本身不包含任何像素与图像语义,常规的基于图像/视频的奖励模型无法对其直接评估;第二,影视运镜评估具有高度的主观性与多维性,景别(Shot Scale)、视线方向、构图法则以及动态节奏极难用显式的几何启发式规则度量,而通用的开源视觉语言大模型(VLM)直接打分又极易发生数值坍缩与领域漂移。

针对上述难题,本文提出将实时图形引擎(Unity)充当 3D 虚拟拍摄片场,将生成的连续相机轨迹实时转化为 2D 渲染预览序列,从而跨越从“几何轨迹空间”到“视觉图像空间”的鸿沟。核心 idea:利用实时渲染引擎生成视觉预览作为奖励载体,结合领域微调 VLM 的逆向生成式描述一致性评分构建成对偏好,在 DPO 下闭环微调相机轨迹生成器,让纯几何轨迹学习获得视觉构图感知的“导演级”后训练对齐。

方法详解

整体框架

VERTIGO 将计算电影摄影流程解构为三大协同阶段:轨迹采样与片场实例化、VLM 驱动的逆向语义偏好打分、以及轨迹生成器的 DPO 后训练对齐。给定包含电影运镜意图的自然语言提示词 \(p\),生成器采样出候选相机位姿轨迹,随后在 Unity 引擎预建的三维场景中实时渲染为 2D 镜头预览序列。接着,经过电影运镜先验微调的视觉语言模型充当“虚拟导演”,对预览视频进行逆向运镜属性解构与图生文描述,并通过微调语义嵌入空间计算与原始提示词的余弦相似度得出偏好排序。最后,以直接偏好优化(DPO)损失函数对原始相机策略进行微调,使其在保持物理合理性的同时,显著增强镜头构图与文本条件的视觉依从性。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["剧本提示词 p + 场景布局 c"] --> B["相机轨迹生成器 π_θ<br/>采样多条候选轨迹 {τ_i}"]
    B --> C["Unity 实时渲染引擎<br/>3D 空间投射生成 2D 预览帧 I_i"]
    C --> D["逆向电影推理与图文一致性打分<br/>VLM 提取运镜描述并计算嵌入相似度"]
    D --> E["构建成对偏好数据对 (τ_w, τ_l)"]
    E --> F["DPO 偏好后训练优化<br/>对齐视觉构图意图,抑制分布偏移"]
    F -->|更新参数 θ| B
    F --> G["高质量构图相机轨迹<br/>输出至 CG 渲染或 C2V 扩散视频生成"]

关键设计

1. 渲染即反馈(Render-in-the-Loop):以实时引擎弥合几何轨迹与视觉空间鸿沟

纯几何轨迹生成模型(如基于扩散或自回归的位姿序列模型)无法优化画面美感的根本原因在于其损失函数仅约束坐标误差,与成片构图完全脱节。为此,VERTIGO 部署了一个轻量化的实时 Unity 引擎管线,利用预置的高质量三维场景与资产,将候选轨迹参数即时渲染为 2D 预览视频序列 \(I_i = \{I^t_i\}_{t=1}^T\)。此外,为支持这一整套运镜微调,研究团队程序化构建了 LenScript 数据集,利用 Unity 合成了具备景别、运动模式、连续焦距控制以及真实剧本描述的成套轨迹,并在局部坐标系下对齐 RealEstate10k 规范。由于图形引擎的渲染开销远低于扩散模型视频生成(快几个数量级),该设计使得高频度、大批量的强化学习在线采样与反馈构造成本几乎可以忽略不计。

2. 逆向语义一致性评分:从离散打分坍缩走向连续隐空间对齐

在获得渲染帧序列后,如何让多模态大模型准确裁决“哪一个镜头拍得更好”是奖励建模的核心挑战。团队对比了三种机制:标签命中率(Tag-consistency,对景别/运动/角度等 5 个维度离散打标统计)、直接标量回归(Direct Scalar Regression,通过 RAFT 式辅助损失回归 0-9 分),发现前两者存在严重的评分粒度不足与模式坍缩(Mode Collapse)问题,大模型打出的离散分数往往集中在狭窄区间,无法提供高质量的偏好序。受循环一致性(Cycle Consistency)启发,VERTIGO 最终确立了逆向生成式描述一致性机制(Caption-based Consistency Scoring):首先让以 ShotBench 为底座并在 Unity 渲染领域轻量微调的 Qwen2.5-VL 逆向观察预览画面 \(I_i\),生成一段详尽概括画面相机行为与主体景别的自然语言文本 \(\hat{p}_i\);随后,采用在 LenScript 电影专业语料上通过 LoRA 对比学习微调的 E5 语义嵌入编码器 \(\phi(\cdot)\) 分别提取初始意图 \(p\) 与逆向描述 \(\hat{p}_i\) 的稠密表征,以其余弦相似度作为连续偏好得分:

\[s_{\text{sem}}(I_i, p) = \frac{\phi(p) \cdot \phi(\hat{p}_i)}{\|\phi(p)\| \, \|\phi(\hat{p}_i)\|}\]

这种基于自然语言逆向重构的打分机制,完全规避了让大模型直接评判数值时的标度不准与方差过小问题,对光照、场景样式具有极强的泛化鲁棒性。

3. 相对偏好正则化:无显式奖励模型的轨迹级 DPO 对齐

直接采用强化学习策略梯度(如 PPO)优化复杂的自回归连续轨迹生成器极易导致轨迹剧烈抖动或动作失真。VERTIGO 将文本条件下的候选轨迹按语义得分高低两两配对,构造三元组 \((p, \tau_w, \tau_l)\)(其中 \(s_w > s_l\)),采用直接偏好优化(Direct Preference Optimization, DPO)进行后训练。通过引入相对隐式奖励 \(r_\theta(\tau | p) = \log \frac{\pi_\theta(\tau | p)}{\pi_{\text{ref}}(\tau | p)}\),DPO 目标函数定义为:

\[\mathcal{L}_{\text{DPO}}(\theta) = -\mathbb{E}_{(p, \tau_w, \tau_l)} \left[ \log \sigma \left( \beta \left( \log \frac{\pi_\theta(\tau_w \mid p)}{\pi_{\text{ref}}(\tau_w \mid p)} - \log \frac{\pi_\theta(\tau_l \mid p)}{\pi_{\text{ref}}(\tau_l \mid p)} \right) \right) \right]\]

其中 \(\pi_{\text{ref}}\) 为冻结的预训练生成器参数,\(\beta\) 为控制发散程度与 KL 正则强度的标量超参。该损失直接提升高质量构图轨迹相对于参考基准的对数几率,在无需额外训练外置奖励网络的前提下,牢固锚定了原模型的物理运动分布先验,彻底杜绝了模型为迎合单一视觉奖励而产生不自然机械跳变的“奖励黑客(Reward Hacking)”行为。

损失函数 / 训练策略

除基线监督微调(SFT)阶段利用自回归或扩散均方误差保留几何物理规律外,后训练核心仅依赖上述 DPO 损失进行端到端对齐。实验表明,超参数 \(\beta = 0.1\) 能够取得构图依从度与轨迹平滑度之间的最佳权衡;过小的 \(\beta\)(如 0.01)会导致正则约束不足、目标脱幅率反弹,而过大的 \(\beta\)\(\ge 0.5\))则过度拘泥于初始策略,无法有效吸收视觉偏好信号。全部采样、渲染与微调流程在两块 NVIDIA RTX 5880 Ada GPU 上即可高效收敛。

实验关键数据

主实验

评估在几何层面采用 CLaTr 评测指标(涵盖轨迹分布距离 FCD、语义匹配分 CS、精确率 P、召回率 R、密度 D、覆盖率 C),在视觉层面采用基于 Unity 渲染及下游 Wan 2.2 VACE 视频生成转换的 VBench 指标,重点追踪目标脱幅率(Missing Rate, MisR,即目标出画或位于画面边缘 20% 外围的帧占比)、时序一致性(Cons.)与美学评分(Aes.)。

原论文 Table 1 完整定量对比结果如下:

方法 轨迹 FCD ↓ 轨迹 CS ↑ 轨迹 P ↑ 轨迹 R ↑ 轨迹 D ↑ 轨迹 C ↑ 渲染 MisR ↓ 渲染 Cons. ↑ 渲染 Aes. ↑ 视频 Cons. ↑ 视频 Aes. ↑
CCD [21] 104.60 30.03 0.58 0.01 0.41 0.10 0.999 0.820 0.460 0.901 0.296
DIRECTOR [2] 26.28 32.20 0.87 0.29 0.79 0.44 0.803 0.892 0.464 0.908 0.293
GenDoP [6] 4.17 67.98 0.92 0.72 0.93 0.78 0.387 0.904 0.515 0.967 0.722
VERTIGO (本文) 4.22 68.40 0.92 0.73 0.93 0.78 0.008 0.908 0.518 0.969 0.735

消融实验

消融实验深入验证了不同的偏好评分策略、DPO 正则参数 \(\beta\) 以及在非静态动态角色(Animated Characters)场景下的泛化表现。

原论文 Table 2 消融数据汇总如下(均在 Unity 渲染序列上由 VBench 评测):

实验组别 具体配置 目标脱幅率 MisR ↓ 时序一致性 Cons. ↑ 美学评分 Aes. ↑ 说明
基线参考 GenDoP Baseline 0.387 0.904 0.515 未经视觉偏好微调的纯几何生成
打分策略消融 Tag-consistency (5维标签) 0.327 0.902 0.516 离散分数过粗,对细微构图区分度不足
Direct Regression (RAFT标量) 0.286 0.906 0.515 连续值预测方差收窄,存在模式坍缩
Caption Consistency (本文默认) 0.008 0.908 0.518 逆向图生文与隐空间对齐,脱幅大幅消除
DPO \(\beta\) 调节 \(\beta = 0.01\) 0.097 0.897 0.482 正则过弱导致轨迹抖动与失真
\(\beta = 0.1\) (本文最优) 0.008 0.908 0.518 构图约束与原始先验的最佳平衡点
\(\beta = 0.5\) 0.132 0.905 0.517 正则过强,偏好优化受到过度抑制
\(\beta = 0.9\) 0.414 0.901 0.515 几乎无法偏离初始策略,优化失效
动态角色泛化 GenDoP (动态角色) 0.387 0.876 0.479 角色运动时基线跟踪丢失严重
VERTIGO (动态角色) 0.008 0.902 0.488 局部坐标系与构图直觉成功泛化至动态主体

关键发现

  • 构图脱幅率断崖式下降:在 Unity 渲染场景中,GenDoP 的脱幅率高达 38.7%,早期方法 CCD 更是近乎完全丢失(99.9%);而经过 VERTIGO 优化后,脱幅率骤降至 0.8%(降幅达 97.9%),且完全保留了前序最优的几何运动真实度(FCD 保持在 4.22 vs 4.17,CLaTr-Score 由 67.98 提至 68.40)。
  • 语言逆向一致性打分显著优于直接标量打分:消融表明,Tag 打分与标量回归打分的脱幅率仍高达 32.7% 与 28.6%,证明 VLM 直接输出数字存在固有的感知对齐缺陷,而借助逆向自然语言图生文和对比嵌入模型计算相似度,能提供判别力极强且平滑的偏好梯队。
  • 用户主观实验全面领先:在 34 名测试者(含 11 名专业摄影师)参与的 Best-of-4 评测中,VERTIGO 在构图、时序一致性、文本遵从度及美学评分上均大幅胜出,综合胜率达到 52.4%(构图维度 51.8%、指令遵从维度 53.9%)。

亮点与洞察

  • 将“虚幻/Unity片场+VLM”组合化为可微分级的偏好采样子系统:巧妙避开了端到端可微渲染器在复杂长视频场景中计算不可行、显存爆炸的瓶颈,以黑盒无导数采样配合 DPO,走出了一条兼顾渲染效率与强化学习梯度的优雅落地路线。
  • “逆向影视推理(Inverse Cinematic Reasoning)”化解了多模态打分盲区:不强求多模态模型直接做打分器(Scorer),而是让其发挥强大的“多模态描述器(Captioner)”长项,将视觉构图重构为文字后在语义空间比对,这一解耦模式对其他视听内容对齐任务具有极高启发价值。
  • 局部坐标系解耦与动态泛化:相机轨迹在主体局部坐标系下建模,使得在静态场景下学到的视听构图偏好先验可无缝迁移到奔跑、行走等非静态复杂角色的跟踪构图中,表现出出色的动作无关构图泛化力。

局限与展望

  • 受限于 VLM 教师模型的感知上限:VLM 扮演的是判决者而非生成者,一旦多模态模型对极端光影、复杂遮挡或特殊镜头透视产生幻觉或误判,形成的错误偏好标注将直接限制 DPO 的优化上限。
  • 镜头语言集中于基础模式,未涉及复合长镜头调度:当前合成数据集 LenScript 主要覆盖推、拉、摇、移、跟等标准基础镜头,尚未探索好莱坞级包含多角色交替视线切分的复杂长镜头(One-take sequence)。
  • 纯轨迹驱动视频生成的几何失真风险:作者指出单纯利用相机位姿控制扩散模型(如 Trajectory-only Video Gen)在执行大角度旋转镜头(Rotate)时容易出现主体结构撕裂与扭曲,因而当前仍推荐采用视频到视频(V2V / VACE)的预演迁移方案。

相关工作与启发

  • vs GenDoP [63] / DIRECTOR [2]: GenDoP 采用自回归建模相机位姿序列,DIRECTOR 采用扩散模型联合文本与几何,但二者完全脱离了成片视觉画面,处于“盲拍”状态导致脱幅率奇高(38.7% 与 80.3%);VERTIGO 在保持二者优秀几何运动平滑度的基础上,通过渲染级偏好对齐彻底补全了构图闭环。
  • vs VideoDPO [33] / Control-A-Video [4]: 视频领域的 DPO 多聚焦于像素级扩散模型的整体帧画质与运动一致性,参数量巨大且无法直接操控相机外参;VERTIGO 将偏好优化下沉至底层轻量级相机位姿策略,运算极度轻巧,且能无缝桥接进入下游影视制作引擎与生成扩散管线。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 首次打通图形引擎渲染视差、VLM 逆向图生文打分与相机轨迹 DPO 的闭环。
  • 实验充分度: ⭐⭐⭐⭐⭐ 兼顾 CLaTr 几何指标、VBench 视觉/渲染指标、动态角色消融与 34 人双盲主观测试。
  • 写作质量: ⭐⭐⭐⭐⭐ 动机立足影视工业核心痛点,逻辑链条严密,三类打分方案对比透彻。
  • 价值: ⭐⭐⭐⭐⭐ 真正推动自主虚拟摄影机从“只能动”走向“懂构图”,具有重大的工业级预演与 AIGC 协同落地价值。