DeforM: Reasoning-Guided Physics-Aware Video Generation via Spatial-Temporal Masking¶
会议: ECCV2026
Paper: https://eccv.ecva.net/virtual/2026/poster/3443
PDF: https://media.eventhosts.cc/Conferences/ECCV2026/pdfs/1472.pdf
作者: Yunyi Li, Yu Qiao, Yaohui Wang, Xinyuan Chen
领域: 视频生成
关键词: 物理感知生成、形变动态、视觉语言推理、时空掩码、注意力调制
一句话总结¶
DeforM 将“什么物体应当发生形变”的视觉语言推理转成时空掩码,通过免训练注意力调制或可训练双注意力注入引导 Wan2.2 视频生成,在形变测试集上将同底座的物理综合评分从 3.49 提高到 4.40,但这代表评估模型认可的物理合理性,而非物理定律的硬保证。
研究背景与动机¶
视频模型能生成纹理精细的画面,却未必让物体按指令发生合理变化。对融化、挤压、断裂、拉伸和切割而言,难点不仅是物体往哪里移动,还包括形状、体积外观、接触关系以及碎片如何随时间变化。用刚体轨迹或少量边界框表达平移相对容易,用同样的控制信号完整描述蜡块融化或海绵压扁则明显不足。显式模拟器需要场景资产与重建,数据训练和奖励优化又分别受限于数据覆盖与奖励设计。
本文进一步将问题定位到语义与空间之间的断层:提示词说了“融化”,模型却没有把该词对应的变化集中到正确物体上。作者观察到基础模型的相关交叉注意力散布在整幅画面中,示例里蜡块不融化,或者液体出现在不相关的位置。因此,他们先问一个比“重新学习全部物理规律”更局部的问题:如果明确指出哪里需要变化,底座中已有的动态知识能否被调用出来?免训练分支就是对此的机制实验,而训练分支进一步补充单纯重分配注意力无法提供的形变能力。
核心 idea:让视觉语言模型先识别应当形变的对象并规划其时空范围,再用掩码改变生成器检索文本语义和传播视频内部特征的方式,把学习与生成的重点放到物理关键区域。
方法详解¶
整体框架¶
输入为初始图像与描述物理动作的文本,输出为后续视频。共同入口 DeforM-Reason 使用 Qwen2.5-VL-7B 推理目标对象,再由开放词汇检测器 LLMDet 定位,形成与视频潜变量对齐的时空掩码。掩码是“哪里应当重点生成”的区域先验,不是形变求解器,也没有直接规定材料的应力或速度场。
随后选择两条替代分支之一:DeforM-Free 在推理时调制交叉注意力查询,不更新预训练参数;DeforM-Injection 使用稠密掩码调制器和 LoRA 训练,同时向交叉注意力与自注意力注入特征。两者不是先 Free 再 Injection 的串联流程,后者也不需要先生成一段 Free 视频作为输入。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
Input["初始图像 + 动作文本"] --> Reason["DeforM-Reason<br/>对象推理与时空定位"]
Reason --> Mask["与潜变量对齐的<br/>时空掩码"]
Mask -->|免训练分支| Free["DeforM-Free<br/>交叉注意力调制"]
Mask -->|训练分支| Injection["DeforM-Injection<br/>双注意力注入"]
Free --> Output["流匹配采样与视频解码"]
Injection --> Output
关键设计¶
1. DeforM-Reason:从动作语义得到形变区域,而不是只重写提示词
视觉语言模型联合读取首帧和文本,先识别与形变最相关的对象,例如融化场景中的蜡块,而不是承载蜡块的勺子。输出的对象语义交给 LLMDet,检测器负责把名字对应到图像中的边界框。这里推理和检测承担不同职责:前者选对“该变什么”,后者回答“它具体在哪里”。若只让检测器寻找所有可见物体,就无法保证选中的区域与物理动作有关。
训练时存在真实后续视频,可以逐帧检测目标,获得随实际形变变化的边界框序列。推理时只能检测首帧,因此由视觉语言模型根据首帧框和文本外推后续框。这个区别非常重要:测试时没有使用未来真实帧,但训练提供的区域先验比推理阶段可靠,存在规划误差引起的分布差异。论文没有给出足以复现外推过程的完整规划提示或运动约束细节,不能把这一步描述为已知精确物理轨迹。
每帧框内置为 1、框外置为 0,得到尺寸为 \(T\times H\times W\) 的二值时空掩码,再下采样到潜变量的 \(T'\times H'\times W'\) 尺度。它是边界框填充区域,不是像素级轮廓分割;背景可能被包含在框内。时间维的变化使掩码能覆盖对象逐渐扩张、压缩或变化的位置,但框本身不决定内部纹理、裂缝和接触行为,这些仍要由生成模型实现。
2. DeforM-Free:用交叉注意力调制检验空间定位是否有用
在交叉注意力中,视频潜变量提供查询,文本嵌入提供键和值。作者把掩码展平并插值到视频 token 序列,再用大于 1 的聚焦系数调制目标区域的查询,实验采用 \(\alpha=1.4\)。这样改变的是视频位置对文本信息的检索,而不是把蜡块的运动轨迹或融化过程写死在像素上;预训练权重完全不变,因此特别适合判断底座是否已有可被更准确调用的形变知识。
缓存中原式 (5) 的运算符与尾项提取不完整,无法可靠判断完整门控表达式及掩码外区域的精确处理,故不补写一个看似标准的公式。正文可确认的是目标区域查询缩放与注意力聚焦。进一步说,缩放查询并非数学上必然提高某个指定物理词的概率,其效果依赖原有查询与文本键的相似度;论文的注意力可视化和视频示例提供的是经验支持,而不是对任意输入的保证。
这一分支也有明确上限:如果底座缺乏某类复杂断裂或流动的表示,放大注意力不会凭空补上该知识,甚至可能强化错误。它在消融中优于普通 SFT,说明定位具有独立价值,但不能据此说训练数据或基础模型能力已经不重要。
3. DeforM-Injection:让掩码同时影响语义检索与视频内部关联
训练分支不再把掩码仅作为标量开关,而是用稠密掩码调制器将它编码为高维特征。调制器包含三维卷积和尺度对齐,输出三条解耦的偏移流,分别用于自注意力键、自注意力值和交叉注意力查询。末端线性层零初始化,使训练起点不立即破坏原模型的注意力行为,再逐步学出有用的区域条件。缓存在掩码下采样描述上未给出逐层张量尺寸,不能推断具体卷积层数、步长或通道数。
依据原文对注入位置的文字说明,可将偏移关系整理如下;这是对原式 (6) 的可确认关系重排,不是逐字符恢复受损公式:
交叉注意力查询偏移使目标区域更好地从文本中获取“挤压”“融化”等信息;自注意力键和值偏移则改变视频内部位置之间的信息匹配与传递,帮助形成局部形变的时空关联。只控制文本语义仍可能缺少连续合理的内部变化,只调整视频内部关联又未必按文本发生指定动作,这解释了同步注入的动机。消融支持两者互补,但没有把三条偏移流逐一拆开,因此不能单独归因到某一条键或值分支。
一个完整示例¶
以论文图 3 的场景为例,初始画面是铜勺中的两块蓝色方形蜡,文本要求其融化。DeforM-Reason 选择蜡块作为对象,检测首帧区域,并在推理时规划后续应发生变化的区域;它不借用真实融化视频来生成测试掩码。
选择 DeforM-Free 时,掩码直接调制对应潜变量位置的文本检索。作者展示的基础模型没有发生融化,而调制后蜡块周围出现蓝色液体。选择 DeforM-Injection 时,同一类区域条件经学习的三维特征编码影响文本检索和视频内部传播,模型利用训练中学到的动态完成生成。这里复述的是论文定性示例,不能从示意帧反推出融化速率、守恒误差或逐帧边界框坐标。
损失函数 / 训练策略¶
底座为 Wan2.2-TI2V-5B,采用流匹配而非噪声预测:把真实视频编码为潜变量,以数据到高斯噪声的插值路径训练速度预测,目标速度是噪声潜变量与数据潜变量之差;推理时从噪声端反向积分到数据端后解码。缓存中原式 (2)、(3) 的排版也有损坏,因此此处用明确的文字说明训练对象,不补写完整期望与范数定义。
DeforM-Injection 联合优化掩码调制器与 Transformer 中的 LoRA 参数,LoRA rank 为 256,batch size 为 64,LoRA 学习率为 \(1\times10^{-6}\),调制器学习率为 \(2\times10^{-6}\)。训练数据是从 WISA-80K 筛选的约 6k 个高质量真实形变视频及其文本描述。
优化同时考虑全潜变量序列的流匹配损失与强调掩码区域误差的区域敏感损失,平衡参数 \(\lambda_{\mathrm{mask}}=0.3\)。原式 (7) 在缓存中缺损,且没有足够信息确定区域项的归一化方式,不能把它擅自改写成“全局损失直接加上 0.3 倍局部损失”。这项设计强调学习预算投向形变区域,而不是把背景训练完全丢弃。训练轮数、硬件时长和完整采样配置在可读正文中未报告。
实验关键数据¶
主实验¶
视觉评测使用独立的 320 个测试样本,物理评测从测试样本中随机选取 160 个;测试样本不进入训练集。视觉指标基于 VBench,但排除了主体一致性与背景一致性,因为明显形变本身会改变这些属性。Quality Score 是论文报告的视觉综合分,当前缓存未说明重新聚合这些指标的具体权重,不能假定为简单平均。
物理评估由 Qwen3-VL-32B 根据生成视频和文本给出 1 到 5 分:PC 是全局物理常识,SA 是语义遵循,LDF 是局部形变保真度。Physical Score 的定义明确为三者算术平均,而不是人工实验测出的物理误差:
下表摘录原表 1,全部指标越高越好。本文训练底座是 5B,而横向比较的 Wan2.2 是 14B;这些模型的训练条件不同,不能把对比当作参数规模受控实验。
| 方法 | 动态程度 | Quality Score | PC | SA | LDF | Physical Score |
|---|---|---|---|---|---|---|
| CogVideoX1.5-I2V | 48.32 | 71.40 | 4.07 | 3.62 | 3.24 | 3.64 |
| Hunyuan-I2V | 27.74 | 67.50 | 3.86 | 3.34 | 3.01 | 3.40 |
| Wan2.2-I2V-14B | 46.07 | 71.18 | 4.28 | 3.91 | 3.65 | 3.95 |
| MAGI-1 | 28.03 | 67.26 | 3.93 | 3.39 | 3.01 | 3.44 |
| DeforM-Injection | 54.74 | 73.17 | 4.59 | 4.46 | 4.16 | 4.40 |
相比 Wan2.2-I2V-14B,LDF 增加 0.51,约为 14.0% 的相对提升;Physical Score 增加 0.45,Quality Score 增加 1.99。以上差值由表内数据计算。不能概括为所有视觉子指标均领先:原表中 Hunyuan-I2V 的时间抗闪烁和运动平滑度分别为 99.30、99.54,高于本文的 97.24、98.40;但其动态程度也显著较低。
消融实验¶
下表摘录原表 2,使用 Wan2.2 5B 系列底座。W/O DeforM-Reason 的实际操作是换成随机时空掩码,不是完全移除掩码条件。
| 配置 | 动态程度 | Quality Score | LDF | Physical Score |
|---|---|---|---|---|
| Vanilla Wan2.2 | 42.61 | 70.65 | 3.19 | 3.49 |
| SFT | 44.77 | 70.93 | 3.41 | 3.76 |
| W/O DeforM-Reason | 47.58 | 71.40 | 3.45 | 3.82 |
| DeforM-Free | 51.57 | 71.99 | 3.53 | 3.89 |
| DeforM-Injection | 54.74 | 73.17 | 4.16 | 4.40 |
相对随机掩码,完整方法的 Physical Score 高 0.58;免训练分支比 SFT 高 0.13,完整训练分支又比免训练分支高 0.51。这支持“定位本身有效,但学习区域条件还能进一步提高”的解释,不支持“只靠 VLM 推理就足够”的结论。
下表摘录原表 3,检验交叉注意力与自注意力的互补性。
| 注入方式 | Quality Score | PC | SA | LDF | Physical Score |
|---|---|---|---|---|---|
| DeforM-Cross | 72.64 | 4.42 | 4.01 | 3.83 | 4.09 |
| DeforM-Self | 72.83 | 4.22 | 3.73 | 3.33 | 3.76 |
| DeforM-Injection | 73.17 | 4.59 | 4.46 | 4.16 | 4.40 |
关键发现¶
- 定位消融中,随机掩码比完整方法的 LDF 低 0.71,说明掩码语义与位置确实重要。不过它没有区分对象选择错误、检测误差与时间外推误差各自的贡献。
- 单独自注意力注入的 Quality Score 略高于单独交叉注意力注入,但 SA 和 LDF 更低;视觉质量提高不能替代动作正确性验证,联合注入才同时改善这些维度。
- 原文没有提供 \(\alpha\)、区域损失权重或 LoRA rank 的敏感性曲线,也未报告多次运行方差。现有消融可以验证组件组合,却不足以确定超参数鲁棒性或收益的统计显著性。
亮点与洞察¶
- 将“看起来不懂物理”进一步拆成“没有把动作施加到正确位置”和“确实缺少形变知识”。免训练与训练分支分别探查这两个瓶颈,比单纯扩大训练规模更有解释力。
- 掩码并不尝试完整描述材料动力学,而是作为语言推理与视频潜变量之间的低带宽接口。这降低了显式场景建模负担,同时保留了生成器对纹理和细节的自由度。
- 区分语义检索与时空内部关联,给出了可迁移的控制思路。对于局部编辑或交互视频,可以借鉴双注意力注入,但是否保持非目标区域不变仍需单独测试。
局限与展望¶
- 作者明确承认:复杂场景中的定位误差会产生不理想的时空掩码;依托 LoRA 的方法也受基础模型的生成质量与场景多样性限制。
- 训练使用真实逐帧检测,测试使用首帧加规划,存在条件质量差异。可进一步比较静态掩码、规划掩码与真实后续框的上界,评估遮挡、多对象交互及新材料上的泛化,而非只与随机框比较。
- 物理得分依赖一个 VLM 评估器,缓存没有提供人工盲测、评估器间一致性或守恒量检测。不能将评分提高等同于质量、能量或接触约束得到满足。
- 测试来自专门的形变子集,且视觉评测删去了主体和背景一致性。应增加非目标区域保持度与跨分布测试,以排除“形变更明显,但场景其他部分变差”的可能。
- 可读缓存没有完整保留若干公式,也缺少足够的掩码规划、区域损失归一化和训练成本信息。复现前需要原 PDF 或实现核验,本文笔记不填补这些未知项。
相关工作与启发¶
- vs PhysGen / PhysMotion / WonderPlay:这些工作依赖物理模拟或场景结构,约束来源更显式;DeforM 通过掩码调用生成先验,减少资产建模要求,但不提供数值物理保证。
- vs VLIPP / PhyRPR:论文将这些方法概括为利用 VLM 规划运动轨迹,主要面向刚体动态。DeforM 不以框轨迹作为完整形变描述,而将其作为区域条件,再由生成模型学习局部形态变化。
- vs WISA / 普通 SFT:DeforM 使用 WISA-80K 的数据子集,却额外提供定位条件、双注意力调制和区域训练重点。同底座的 SFT 消融表明,收益不能只用“进行了领域微调”解释。
- 后续研究启发:可将掩码不确定性显式传给调制器,并用接触事件或局部守恒检查约束生成。这是根据本文局限提出的研究方向,不是论文已经验证的能力。
评分¶
- 新颖性: 4/5。把形变的语义定位问题转成可分析的注意力控制,并给出双注意力训练扩展;基础组件本身较成熟。
- 实验充分度: 3/5。有跨模型比较、随机掩码和注入位置消融,但缺少人工评测、统计误差、超参数敏感性及分布外验证。
- 写作质量: 4/5。问题、机制分析与训练扩展衔接清楚;精确复现仍需补足规划与损失实现细节,缓存公式缺损不归因于原稿排版。
- 价值: 4/5。对局部形变视频的区域控制有实用启发,但应定位为物理合理性增强,而非可替代模拟器的物理世界模型。