跳转至

From Evaluation to Enhancement: Benchmarking and Improving Think-with-Video Reasoning for Video Generative Models

会议: ECCV 2026
论文: ECCV 原文
代码: https://huggingface.co/datasets/KlingTeam/VWG-Bench
领域: 多模态VLM / 视频理解 / LLM推理
关键词: 视频生成, 视觉逻辑推理, VWG-Bench基准, 提示词增强, 强化学习对齐

一句话总结

针对视频生成模型擅长感知渲染却欠缺物理与符号推理的核心矛盾,本文提出了覆盖9大维度38项子任务的 VWG-Bench 基准及三级解耦评测协议,并设计了通过纯文本奖励驱动强化学习的通用提示词推理器 Vid-PRE,无需改动下游生成器架构即可大幅提升长程视频推理精度。

研究背景与动机

连续时空信号中的推理能力是智能体理解真实物理世界的核心标志。随着大语言模型通过思维链(Chain-of-Thought, CoT)实现“以文本思考”(Think with Text),以及多模态大模型在静态图像中展现出视觉拓扑链式推演(Think with Images),以 Sora-2、Veo-3 和开源 Wan 系列为代表的扩散与自回归视频生成大模型,正将前沿推向“以视频思考”(Think with Video)的崭新境界。这类模型不仅需要输出高保真、时间连续的像素流,更被寄予成为物理规律世界模拟器的厚望。然而,现有视频模型究竟是真正掌握了物理因果、几何演变与规则约束,还是仅仅依托海量预训练数据的表面统计共现拼凑出看似合理的视觉幻象,学术界长期缺乏系统深入的诊断体系。

深入剖析该领域目前的评测基准,可以发现两大根本痛点。其一,任务覆盖碎片化严重,主流基准如 VR-Bench、TiViBench 或 V-ReasonBench 往往仅针对迷宫寻路、简单空间变换或特定几类物理规则,无法全景式覆盖符号逻辑、具身行动、人机交互与社会常识的完整认知图谱;其二,评测协议通常将视频渲染质量、过程约束追踪与最终任务达成度压缩为一个单一的综合评分或二值成功率。这种耦合评测极易产生假阳性——模型可能生成了一段光影平滑但完全违反刚体不可穿透定律的视频,并在整体美学分数的掩盖下被误判为具备推理能力。更关键的是,模型在下游面临复杂时空规划时,往往只接收到简略模糊的自然语言指令,由于缺乏显式的空间拓扑与逻辑约束指引,生成轨迹极易陷入累积误差与结构性坍塌。

本文的核心洞察在于:视频生成模型的核心瓶颈并非底层的连续动态渲染能力,而是其在自然语言指令到空间动力学规划之间的认知推理断层。因此,既需要一套将视觉流畅度、任务级规则一致性与样本级目标达成度正交分离的诊断体系,也需要将复杂的时空推理重担从下游渲染器中剥离出来。核心 idea:构建覆盖9大维度与38项细粒度任务的 VWG-Bench,采用三级解耦的 VLM-as-Judge 诊断协议揭示渲染与推理的断层;进而提出模型无关的提示词推理增强器 Vid-PRE,通过拒绝采样监督微调与纯文本奖励驱动的 GRPO 强化学习,将认知推理转化为结构化约束提示词赋能下游视频生成。

方法详解

整体框架

本文构建了从评测诊断到能力增强的完整闭环。在评测端,VWG-Bench 定义了包含 9 个核心认知维度的任务全景,并配套多粒度规则字典与自动化生成管线,由多模态大模型(VLM)担任评测裁决者,实施视频级、任务级、样本级的三级独立诊断打分。在增强端,Vid-PRE 确立了“认知推理与视觉渲染严格分工”的设计哲学:利用专用的多模态大语言模型作为认知前端,接收初始帧图像 \(I\) 与用户原始指令 \(P_{\text{user}}\),通过内部显式思维链(CoT)推理出满足物理规律与因果路径的空间约束,并将其蒸馏重写为高度可执行的优化提示词 \(P_{\text{opt}}\),直接驱动下游任意冻结的视频生成模型(如 Wan2.2、Wan2.6、Veo3.1 等)。

整个 Vid-PRE 增强与 VWG-Bench 评测管线的数据流向与处理流程如下图所示:

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入:首帧图像 I + 原始指令 P_user"] --> B["阶段一:拒绝采样思维链监督微调<br/>Qwen3-VL-8B 学习格式规范与显式因果推理"]
    B --> C["阶段二:纯文本多维奖励 GRPO 对齐<br/>意图/空间/正确性/格式四维文本奖励强化优化"]
    C --> D["输出:约束感知显式提示词 P_opt<br/>解耦认知推理与下游生成器视觉渲染"]
    D --> E["下游视频生成器执行渲染<br/>Wan2.2 / Wan2.6 / 闭源商业模型无缝接入"]
    E --> F["三级解耦评测协议诊断<br/>视频级质量 / 任务级规则 / 样本级目标独立判分"]

关键设计

1. 拒绝采样思维链监督微调:打牢结构化因果与格式底座

现有的图生视频提示词改写方法多停留在扩写画面美学风格或增加动作细节描写,缺乏针对逻辑谜题或空间拓扑的显式推演能力。直接学习从 \((I, P_{\text{user}})\)\(P_{\text{opt}}\) 的映射容易导致模型在没有推导基础的情况下胡乱猜测终局状态。Vid-PRE 引入显式思维链作为中间潜变量,建立自回归联合概率分布 \(P(\text{CoT}, P_{\text{opt}} \mid I, P_{\text{user}})\)。为构建约 20K 条高质量四元组训练数据 \(\{I, P_{\text{user}}, \text{CoT}, P_{\text{opt}}\}\),系统设计了四步全自动过滤机制:首先程序化定义严格的真实最终状态或中间目标 \(G_{\text{truth}}\);其次调用前沿专有 API 解析视觉场景与意图生成 CoT 和候选题词;接着由独立评估器严格审查视觉一致性(禁止无中生有的虚假实体与方向错误)以及推演路径能否在逻辑上收敛至 \(G_{\text{truth}}\),仅保留综合打分 \(\ge 4\) 分的高保真样本;最后针对长程极难任务引入“难度补丁”(Difficulty Patching),在推导失败时提供 \(G_{\text{truth}}\) 作为局部线索进行纠偏重算。该阶段使用 Qwen3-VL-8B 作为骨干,最大图像 token 限制为 1,024,混合通用多模态对话数据完成暖启动。

2. 纯文本多维奖励驱动的 GRPO 策略对齐:消除视觉幻觉与长程逻辑漂移

尽管监督微调使模型具备了格式与推理骨架,但在面对高度受限的物理与空间逆序推理时,模型仍存在微小的空间方位臆造或逻辑链断裂。针对强化学习阶段,Vid-PRE 做出了关键的架构决策:采用纯文本奖励系统替代直接使用下游视频生成模型进行端到端渲染打分。这一设计巧妙避开了当前视频生成器因美学随机抖动对正确逻辑产生的奖励抑制(奖励方差大),消除了昂贵的在线视频合成算力瓶颈,同时确保了优化后的提示词重写器具备完全的模型通用性(Model-Agnostic)。策略模型针对每个样本采样组大小为 \(G\) 的输出候选序列 \(\{o_1, \dots, o_G\}\),基于 Gemini-3.0-Pro 构建四维文本奖励: - 意图保持度 (\(r_{\text{intent}}\)):校验 \(P_{\text{opt}}\) 是否在不偏离原始核心任务目标的前提下细化实体动态; - 视觉空间一致性 (\(r_{\text{image}}\)):严格审核文本中所述的相对方位(如“右下角绿色滑块”)是否与首帧图像 \(I\) 严密吻合,对空间幻觉施加严厉负反馈; - 求解正确性 (\(r_{\text{correct}}\)):核验提示词中规划的操作序列与关键因果步骤能否准确推导出目标 \(G_{\text{truth}}\); - 格式规范度 (\(r_{\text{format}}\)):确保模型输出严格符合指定标签与结构模板。

综合奖励 \(r_k = w_1 r_{\text{intent}} + w_2 r_{\text{image}} + w_3 r_{\text{correct}} + w_4 r_{\text{format}}\) 经组内均值与方差归一化计算优势 \(\hat{A}_k = (r_k - \mu_G) / \sigma_G\),通过 GRPO 损失函数结合针对参考策略的 KL 散度约束,促使模型学会在最紧凑的字数内输出空间坐标精准、步骤明确的强约束视频引导词。

3. 三级解耦评测协议与多粒度规则标注:正交分离视听流与认知准确性

传统的二值评测或感知审美指标完全无法洞察视频生成模型失败的深层机理。VWG-Bench 将认知诊断解耦为三级正交层次,并均采用 1–5 分的细粒度整数标度: - 视频级(Video-Level):作为基础质量过滤器,评估视频整体视觉保真度与时间平滑度,严厉惩罚剧烈镜头晃动、伪影噪点、时间闪烁或大面积静止帧,确保模型基础渲染的有效性; - 任务级(Task-Level):依据预定义的领域规则字典进行严格约束核验。其中“过程一致性”(Progress Consistency)重点审查前景操作对象的合法状态演进,并要求背景无关区域保持严格的静态不变性;“隐式规则遵循”(Implicit Rule Following)强力约束物理规律,严禁物体发生网格相互穿透(Mesh Interpenetration)、反重力悬浮或刚体非自然软化变形; - 样本级(Sample-Level):评估语义与因果里程碑的精准落地。“过程目标”(Progress Goal)抽检中间关键帧,验证“起点 \(\to\) 中间态 \(\to\) 终点”的连贯转移;“尾帧目标”(Last-Frame Goal, \(G_{\text{last}}\))比对终态视频帧与标准答案的匹配度(如数独是否填对、算术结果是否正确)。

该评测协议由统一的 VLM 裁决者依照详细评分量表执行,在抽样 100 条提示词、200 个视频的人机一致性校验中,评测结果与 3 位人类专家的打分取得了高度一致(Spearman 相关系数 \(\rho\) 达到 0.69~0.80,平均绝对误差 MAE \(\le 0.54\))。

损失函数 / 训练策略

Vid-PRE 采用分阶段递进优化策略:

  1. 第一阶段:SFT 训练
    采用标准自回归序列交叉熵损失函数: $\(L_{\text{SFT}}(\theta) = -\mathbb{E}_{(I, P_{\text{user}}, \text{CoT}, P_{\text{opt}}) \sim \mathcal{D}_{\text{SFT}}} \left[ \log P_\theta(\text{CoT}, P_{\text{opt}} \mid I, P_{\text{user}}) \right]\)$ 在 20K 筛选推理数据上训练 3 个 epoch,批大小设为 128,采用 8 张 NVIDIA H100 GPU 及 DeepSpeed ZeRO-3 框架。

  2. 第二阶段:GRPO 强化学习对齐
    基于首阶段表现最差的 10 个高难度任务挑选出的 1.5K 提示词展开优化。对于每个输入查询 \(x = (I, P_{\text{user}}, G_{\text{truth}})\),策略网络 \(\pi_\theta\) 生成 \(G\) 个候选响应 \(o_k = (\text{CoT}_k, P_{\text{opt}, k})\)。计算组内标准化优势 \(\hat{A}_k\),最大化目标函数: $\(J(\theta) = \mathbb{E}_{x \sim \mathcal{D}_{\text{RL}}, o \sim \pi_{\theta_{\text{old}}}} \left[ \frac{1}{G} \sum_{k=1}^G \frac{\pi_\theta(o_k \mid x)}{\pi_{\theta_{\text{old}}}(o_k \mid x)} \hat{A}_k - \beta D_{\text{KL}}(\pi_\theta \parallel \pi_{\text{ref}}) \right]\)$ 其中 \(\pi_{\text{ref}}\) 为冻结的 SFT 模型参数。训练进行约 3K 个优化步,超参数 \(\beta\) 控制策略漂移。

实验关键数据

主实验

在基线诊断方面,作者在 VWG-Bench 上评测了开源与商用共 6 款代表性模型(无外挂提示词增强),揭示出“渲染强而认知弱”的普遍现象;在增强对比方面,Vid-PRE 分别在主基准 VWG-Bench 以及外部开源基准 V-ReasonBench(满分100)和 MME-CoF(满分5)上验证了跨生成器的通用有效性。

表 1:VWG-Bench 基准诊断与模型基线表现(1–5 分制)

模型 视频质量 (Video Quality) 过程一致性 (Prog. Consist.) 规则遵循 (Rule Follow.) 过程目标 (Prog. Goal) 终帧目标 (Last Goal) 综合评分 (Overall)
Wan2.2 (开源) 2.32 2.33 1.56 2.45 1.98 2.13
Wan2.5 2.70 2.86 3.14 2.48 2.56 2.75
Wan2.6-Flash 2.73 2.92 3.23 2.50 2.62 2.80
Kling-2.5-Turbo-Pro 2.95 3.12 3.38 2.62 2.78 2.97
Sora2 3.45 3.68 3.79 3.32 2.98 3.44
Veo3.1 3.54 3.78 3.95 3.45 3.05 3.55

表 2:Vid-PRE 提示词增强模块在 VWG-Bench 与 V-ReasonBench 上的提升效果

基座生成器 提示词方案 VWG-Bench 综合分 (1-5) VWG 规则遵循 (1-5) VWG 终帧目标 (1-5) V-Reason 平均分 (0-100) V-Reason 空间认知 (0-100)
Wan2.2 原始指令 (None) 2.13 1.56 1.98 26.65 1.32
Wan2.2 Vid-PRE (本文) 2.51 (+17.8%) 2.12 (+35.9%) 2.35 (+18.7%) 44.48 (+66.9%) 36.25 (+2646%)
Wan2.5 原始指令 (None) 2.75 3.14 2.56 31.34 20.05
Wan2.5 原生 Wan PE 2.99 3.35 2.74 41.06 38.25
Wan2.5 Vid-PRE (本文) 3.19 (+16.0%) 3.55 (+13.1%) 2.93 (+14.5%) 51.19 (+63.3%) 42.35 (+111.2%)
Wan2.6-Flash 原始指令 (None) 2.80 3.23 2.62 32.10 20.71
Wan2.6-Flash 原生 Wan PE 3.04 3.45 2.86 39.50 29.18
Wan2.6-Flash Vid-PRE (本文) 3.26 (+16.4%) 3.62 (+12.1%) 3.02 (+15.3%) 52.57 (+63.8%) 43.78 (+111.4%)

消融实验

作者针对训练阶段展开了严格消融,分别验证了 SFT 与 GRPO 强化学习在外部认知基准 MME-CoF 与 V-ReasonBench 上的增益演进:

表 3:Vid-PRE 训练阶段消融分析

基座生成器 训练配置 MME-CoF 综合分 (1-5) V-ReasonBench 平均准确率 (0-100) 说明
Wan2.2 Base (无增强) 1.72 26.65 缺乏时空引导,极易产生空间幻觉
Wan2.2 + Vid-PRE (仅 SFT) 2.44 40.26 建立 CoT 结构化推导,显著修复基本逻辑
Wan2.2 + Vid-PRE (SFT + RL) 2.58 44.48 文本多维奖励消除空间幻觉,实现长程稳定对齐
Wan2.6-Flash Base (无增强) 2.69 32.10 基础推理有限
Wan2.6-Flash + Vid-PRE (仅 SFT) 2.97 45.96 规则明确化带来大幅飞跃
Wan2.6-Flash + Vid-PRE (SFT + RL) 3.09 52.57 进一步拉开与通用 PE 的差距

关键发现

  • 生成模型的“表象繁荣与逻辑溃败”:在 VWG-Bench 评测中,所有模型在视频质量(Video Quality)上的表现均显著高于规则遵循(Rule Following)与目标达成(Last Goal)。例如 Wan2.2 的视觉质量为 2.32 分,但隐式规则遵循跌至 1.56 分;即使是强大的 Sora2 和 Veo3.1,终帧目标完成度也仅有 2.98 和 3.05 分。这证实了视频生成模型若无显式语义约束,本质上只是“视觉自洽的表面统计插值者”。
  • 通用提示词扩写(PE)无法解决认知任务:官方自带的 Wan PE 在通用美学上有微弱提升,但在复杂逻辑与空间认知上,往往会加入无意义的环境细节(如光照、镜头旋转描述),反而冲淡了核心因果约束。Vid-PRE 在 V-ReasonBench 空间认知维度上将 Wan2.2 从 1.32 暴拉至 36.25 分,展现出结构化显式指令对底层物理交互生成的决定性作用。
  • 纯文本 RL 信号的高效正向迁移:消融实验表明,在第二阶段完全无需渲染视频帧,仅靠纯文本多维奖励指导 GRPO,模型即可精准学会抑制方位幻觉与步骤丢失。这不仅避免了昂贵的视频生成在线渲染成本,且使得训练出的重写器可以直接热插拔至未见过的视频生成底座。

亮点与洞察

  • 解耦认知与渲染的优雅分工:本文没有盲目尝试去端到端微调庞大而脆弱的视频扩散骨干网络,而是通过外挂轻量专用 VLM 充当“大脑推理器”,让下游视频生成器专注充当“动作执行与渲染器”,以极小的训练代价实现了质的推理提升。
  • 纯文本闭环驱动视频强化的创新机制:传统强化学习优化视频生成必须在线采样生成视频并调用复杂时空判别器,稳定性极差且耗资巨大。本文证明了针对首帧图像和物理规则的纯文本评估(Intent/Image/Correctness/Format)足以反哺出高度严谨的物理时空规划指令。
  • 诊断维度的系统性解耦:VWG-Bench 提出的视频级(质量)、任务级(时序过程与隐式物理规则)和样本级(因果目标)三层量表,有效破除了传统二值评测的黑盒困境,为后续视频世界模型的细粒度归因提供了权威标尺。

局限与展望

  • 首帧依赖性较强:当前 Vid-PRE 的推理完全建立在首帧静态图像 \(I\) 与初始文本指令上,属于“开环单次规划”;若下游生成器在中间帧发生严重漂移或不可逆的物理崩溃,外挂提示词无法进行“测试时动态闭环重规划”。
  • 极难符号长程任务的推理上限:对于高阶数独(9x9)或超复杂迷宫,轻量级 Qwen3-VL-8B 自身的 CoT 推理也可能出错(这也是作者在构建数据时引入 Difficulty Patching 的原因),外挂模型的认知上限在一定程度上决定了提示词的上限。
  • 未来方向:探索与多阶段分段视频生成相结合的“边想边生、实时监控更正”的闭环反馈机制,以及将离线纯文本 RL 扩展至轻量关键帧潜空间指导。

相关工作与启发

  • 对比传统视频评测(VBench / VBench++):VBench 侧重于单项感知指标(背景连贯性、美学、动作平滑度等),缺乏对深层认知、规则执行与反事实推理的考查;VWG-Bench 弥补了这一短板,构建了 9 大核心维度的认知推演体系。
  • 对比特定推理基准(VR-Bench / RULER-Bench / V-ReasonBench):VR-Bench 仅关注迷宫空间寻路,RULER-Bench 局限于 6 类规则,V-ReasonBench 侧重尾帧可验证任务;VWG-Bench 整合了多粒度规则字典与三级解耦诊断,覆盖范围更广且能区分过程失败与终局失败。
  • 对比通用视频提示词增强(Prompt-A-Video / VPO / RAPO):既有视频提示词优化主要追求文本与画面风格的对齐和视觉美感,而 Vid-PRE 专门针对逻辑规则、空间坐标与物理因果链条进行显式强化,开创了面向推理型视频生成的提示词工程先河。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 首次全面提出“以视频思考”系统评测基准 VWG-Bench 与纯文本 RL 驱动的提示词推理增强范式。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 6 款主流生成器在 3 个 benchmark 上的全方位诊断、人类专家一致性评定与完整的消融分析。
  • 写作质量: ⭐⭐⭐⭐⭐ 逻辑严密,图表清晰,问题意识明确,技术细节叙述详实规范。
  • 价值: ⭐⭐⭐⭐⭐ 为推动视频生成从“视觉滤镜”走向真正的“物理世界模拟器”提供了坚实的评测基石与即插即用的实用增强方案。