Natural Language Camera Movement Understanding¶
会议: ECCV 2026
论文: ECCV 2026
代码: https://1yuwen.github.io/ACaM-Project-Page/
领域: 视频生成
关键词: 相机运动理解, 视觉语言模型, 电影摄影运镜, 视频基准评测, 指令微调
一句话总结¶
针对主流视觉语言模型(VLM)混淆旋转与平移、左右反向以及把前景运动错判为运镜的本质缺陷,本文提出包含 17 类运镜的两级电影摄影分类学与 ACaM 双域基准,并通过多源数据整合与物理运动增强微调出大幅超越商用前沿模型的专用 VLM。
研究背景与动机¶
运镜控制已成为现代文本到视频生成(T2V)模型走向专业影视创作的关键能力,创作者越来越倾向于使用“缓慢横摇(slow pan)”或“推镜头(dolly in)”等电影摄影专业自然语言指令来精确调度生成场景。为了训练具备可控运镜能力的生成模型,学术界与工业界迫切需要海量高质量的“视频-运镜文本”配对数据;同时,在评估生成模型时,自动化判定生成视频是否忠实执行了运镜提示词,也成为基准评测不可或缺的基础设施。然而,传统的几何位姿估计(如 SLAM 或 SfM)输出的是抽象坐标位姿,不仅计算开销巨大、依赖相机内参,而且无法理解以物体为中心的语义运镜(如环绕追踪);视觉语言模型(VLM)虽然具备天然的跨模态语义表达潜力,但现有通用 VLM 在视频运动感知上却表现出惊人的脆弱性。
深入剖析通用 VLM 评测失败的核心矛盾可以发现,模型严重欠缺对 3D 物理空间与相机运动力学(cinematographic mechanics)的本质建模。具体而言,当前 VLM 普遍存在五大失效模式:一是对细微帧间位移极度迟钝,常将弱运动误判为静止(Static);二是混淆物理平移(Translation)与机身旋转(Rotation),误将横摇看作平移,反之亦然;三是方向感知混淆,频繁出现左右反向;四是无法区分透视视差驱动的光学推拉(Dolly)与焦距缩放(Zoom);五是极易将显著前景物体的自主运动误判为相机运镜(如赛车冲刺被错判为推镜头)。现存运动评测基准要么仅包含实拍片段、缺少合成视频评估,要么将运镜淹没在通用细粒度动作中,缺乏针对纯粹原子运镜的系统性基准与训练集。
为了打破这一困境,本文明确将自然语言相机运动理解确立为独立的学术研究任务。核心 idea:构建涵盖 17 种原子运镜的两级电影摄影分类学与包含真实/合成双域的 ACaM 基准,并利用几何运动数据增强平衡多源长尾分布,指令微调出具备真实 3D 视差辨别力的专用运镜 VLM。
方法详解¶
整体框架¶
本文构建了从“分类学建立与失败模式剖析 → 真实与合成双域基准(ACaM)构建 → 多源多模态指令微调数据工程与物理运动增强 → 模型微调”的完整闭环。整体系统以 17 类专业电影摄影运镜为基石,在基准端兼顾高质量影视数据与 Veo 3.1 闭环生成的合成视频;在模型端,针对原始视频库严重的“推镜头独大、滚转与缩放极端长尾”分布,设计了空间动态裁剪、时序反转、水平翻转与仿射旋转四类物理保真度增强算子,最终在 Qwen3-VL 架构上完成高效指令微调。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["多源原始视频池<br/>45K 视频片段"] --> B["17类电影摄影运镜分类学<br/>平移/旋转/变焦/静止/主体向"]
B --> C["双域 ACaM 评测基准构建<br/>实拍影视清洗 + Veo 3.1 闭环生成"]
C --> D["针对性物理运动增强<br/>裁剪变焦/时序倒放/水平翻转/仿射旋转"]
D --> E["平衡指令微调数据集<br/>27K 严格对齐多选题"]
E --> F["Qwen3-VL 模型指令微调<br/>LoRA 高秩自适应优化"]
F --> G["运镜理解模型输出<br/>自然语言运镜精准判别"]
关键设计¶
1. 两级电影摄影分类学与五大 VLM 失败模式剖析:确立运镜感知的几何与语义边界
针对现有模型将运镜与一般物体动作混淆的痛点,本文严格参考经典电影摄影理论,将镜头运动系统划分为 5 大主干维度与 17 种互斥的原子运镜类别。一级类别覆盖物理平移(Translation:包含 Dolly In/Out 纵向平移、Truck Left/Right 横向平移、Boom Up/Down 升降平移)、角度旋转(Rotation:包含 Pan Left/Right 水平摇镜、Tilt Up/Down 俯仰摇镜、Roll 顺逆时针滚转)、焦距变化(Focal Length Change:Zoom In/Out 光学变焦)、静止镜头(Static)以及以主体为中心的复合运动(Object-centric:Tracking 跟随、Arc 弧形环绕)。在评估中,本文揭示了 VLM 的五大失效根源:帧间差分感知钝化、平移旋转混淆、左右方向颠倒、变焦与物理推拉混淆,以及前景物体自主位移干扰全局背景推断。
2. 真实影视与闭环合成双域基准(ACaM)构建:兼顾影视数据保真度与视频生成评测需求
为同时满足大规模视频数据清洗与前沿视频生成模型评测的双重需求,ACaM 基准首创了真实与合成双轨评测体系。在真实视频域,整合 CameraBench、ShotBench、CineTechBench、MotionBench 与 FavorBench,剔除复合运镜与前景干扰项,并通过专业影视背景研究生双盲核验补齐 YouTube 边缘类别,得到 1,423 个视频片段与 1,464 个原子问答对。在合成视频域,采用 Gemini-3-Pro 提取真实运镜的结构化提示词,交由顶尖视频生成模型 Veo 3.1 生成 4 秒视频,再经人工质量检验分流:合格则收录,运镜漂移则修正重归类,模糊或退化片段由 Gemini 重新改写提示词进入第二轮生成迭代,最终构建出全球首个具备人类表现参照的原子运镜基准。
3. 物理保真度定向运动增强:解决多源长尾偏置与运动感知捷径
多源汇聚的 45.3K 原始训练数据呈现出极端的长尾偏置(推镜头 Dolly In 与静态镜头泛滥,而光学缩放、滚转和横移严重匮乏),直接微调会导致 VLM 习得强烈的先验捷径。为此,本文设计了四种精准保持物理几何一致性的视频数据变换算子:针对极度稀缺的光学变焦,利用静态高分辨率画面的连续动态居中裁剪与重采样合成真实 Zoom In(扩增约 1K 片段);针对 Dolly 类别不平衡,利用时间轴反转(Temporal Reversal)将 Dolly In 转换为严格保真的 Dolly Out(扩增约 2K 片段);针对平移方向偏置,使用水平镜像翻转(Horizontal Flipping)实现 Truck 左右运动变换(扩增约 1.7K 片段);针对样本最罕见的滚转镜头,通过对静态图像施加连续仿射旋转合成物理滚转动力学。最终将数据池洗练为 27K 高均衡性、纯原子性的指令微调集。
4. 针对 3D 运动感知的 VLM 指令微调:打通视觉表示到空间几何力学的推理通路
为赋予通用底座模型解析 3D 摄像机运动力学的能力,本文以 Qwen3-VL(4B 与 8B)为基础架构开展指令微调。不同于过往空间模型(Spatial-MLLM)单纯关注静态物体 3D 空间关系的建模,本方案将多帧时序图像序列直接映射至标准多选题(MCQ)输出空间,迫使注意力机制聚焦背景视差流动与透视透视缩放比率。在训练策略上,实验证明高秩 LoRA(如 \(r=256\))能显著释放多模态底座对微弱几何变形与复杂 3D 视差的表征容量,使轻量化 8B 模型展现出超越百亿级商用闭源多模态模型的几何判别力。
损失函数 / 训练策略¶
模型训练采用标准自回归下一 Token 预测交叉熵损失函数: $$ \mathcal{L}{\text{SFT}} = - \sum) $$ 其中 }^{T} \log P(y_t \mid y_{<t}, \mathbf{V}, \mathbf{X}_{\text{prompt}\(\mathbf{V}\) 表示采样的视频帧序列(默认 8~32 帧),\(\mathbf{X}_{\text{prompt}}\) 为包含选择题格式与运镜选项的指令提示词,\(y_t\) 为真实选项字母及解析。采用 LoRA 高秩微调方案,学习率设为适度余弦退火策略,训练集由 27K 均衡视频问答样本构成。
实验关键数据¶
主实验¶
在 ACaM 真实世界视频(Real-World Videos)评测集上的多选问答(MCQ)准确率对比(随机猜测基线约为 24.37%):
| 模型 | 静态 (Static) | 旋转 (Rot.) | 平移 (Trans.) | 缩放 (Zoom) | 弧形 (Arc) | 追踪 (Track) | 总体准确率 (Overall) | 类别平均 (Avg) |
|---|---|---|---|---|---|---|---|---|
| 随机猜测 (Random Guess) | 24.50 | 24.28 | 24.00 | 24.54 | 24.78 | 25.00 | 24.27 | 24.37 |
| 人类表现 (Human Performance) | 99.00 | 93.07 | 90.39 | 90.83 | 97.10 | 96.97 | 93.44 | 93.14 |
| Mega-SaM (Visual Geometry) | 89.55 | 74.94 | 54.16 | – | – | – | – | – |
| ViPE (Visual Geometry) | 61.81 | 49.71 | 73.17 | – | – | – | – | – |
| Spatial-MLLM (Spatial VLM) | 59.00 | 16.98 | 31.72 | 41.67 | 24.29 | 77.27 | 34.22 | 29.68 |
| Qwen3-VL-8B (General VLM) | 85.00 | 65.84 | 39.50 | 61.67 | 79.71 | 74.24 | 58.27 | 55.25 |
| Qwen3-VL-32B (General VLM) | 92.00 | 64.11 | 47.93 | 64.17 | 57.97 | 86.36 | 61.95 | 58.66 |
| GPT-5 (Proprietary VLM) | 61.50 | 66.58 | 54.55 | 61.67 | 68.12 | 80.30 | 61.20 | 61.54 |
| Gemini-3.1-Pro (Proprietary VLM) | 83.92 | 63.34 | 64.00 | 62.39 | 76.81 | 95.38 | 68.44 | 67.73 |
| CameraModel-7B (Specialized VLM) | 55.50 | 68.81 | 47.93 | 45.83 | 91.30 | 98.48 | 58.88 | 60.56 |
| ShotVL-7B (Specialized VLM) | 91.00 | 60.40 | 51.07 | 32.50 | 68.12 | 98.48 | 60.52 | 57.09 |
| 本文 SFT Qwen3-VL-4B | 76.00 | 71.53 | 64.13 | 76.67 | 78.26 | 93.94 | 70.83 | 72.27 |
| 本文 SFT Qwen3-VL-8B | 85.50 | 70.05 | 64.13 | 84.17 | 84.06 | 96.97 | 72.75 | 74.28 |
在 ACaM 合成视频(Synthetic Videos,由 Veo 3.1 生成)评测集上的多选问答(MCQ)准确率对比:
| 模型 | 静态 (Static) | 旋转 (Rot.) | 平移 (Trans.) | 缩放 (Zoom) | 弧形 (Arc) | 追踪 (Track) | 总体准确率 (Overall) | 类别平均 (Avg) |
|---|---|---|---|---|---|---|---|---|
| 人类表现 (Human Performance) | 98.88 | 97.72 | 98.04 | 96.15 | 100.00 | 97.62 | 98.05 | 97.61 |
| Qwen3-VL-8B (General VLM) | 90.50 | 62.39 | 45.10 | 80.77 | 55.56 | 83.33 | 61.92 | 60.91 |
| Qwen3-VL-32B (General VLM) | 91.62 | 68.95 | 55.77 | 82.69 | 51.85 | 67.86 | 67.01 | 64.17 |
| Gemini-3.1-Pro (Proprietary VLM) | 92.07 | 62.00 | 74.07 | 69.23 | 55.56 | 85.37 | 73.01 | 69.58 |
| ShotVL-7B (Specialized VLM) | 96.09 | 69.80 | 63.62 | 63.46 | 29.63 | 98.81 | 71.33 | 64.49 |
| 本文 SFT Qwen3-VL-4B | 82.68 | 74.36 | 66.67 | 78.85 | 68.52 | 84.52 | 73.28 | 74.40 |
| 本文 SFT Qwen3-VL-8B | 94.41 | 72.36 | 74.51 | 82.69 | 68.52 | 91.67 | 78.20 | 77.44 |
消融实验¶
针对有针对性的数据重采样(Sampling)、物理运动增强(Augmentation)以及 LoRA 秩(Rank)在 Qwen3-VL 上的消融结果:
| 重采样 (Sampling) | 运动增强 (Augmentation) | LoRA Rank | 模型基座 | 真实视频平均准确率 (Real Avg.) | 合成视频平均准确率 (Syn Avg.) | 说明 |
|---|---|---|---|---|---|---|
| ✗ | ✗ | \(r=64\) | 4B | 48.42% | 58.56% | 直接在原始 45K 不均衡数据上微调 |
| ✓ | ✗ | \(r=64\) | 4B | 63.78% | 72.07% | 类别频率均衡重采样显著提升泛化性能 |
| ✓ | ✓ | \(r=64\) | 4B | 70.88% | 75.03% | 加入针对性几何增强消除长尾盲区 |
| ✓ | ✓ | \(r=128\) | 4B | 71.88% | 75.20% | 适度增加低秩适配容量 |
| ✓ | ✓ | \(r=256\) | 4B | 72.27% | 74.40% | 4B 模型下高秩增益趋于平缓 |
| ✓ | ✓ | \(r=256\) | 8B | 74.28% | 77.44% | 8B 结合高秩与双策略达到最佳效果 |
关键发现¶
- 数据均衡与针对性增强是性能飞跃的核心催化剂:仅通过类别频率重采样,4B 模型在合成集上的平均准确率便从 58.56% 骤升至 72.07%;叠加时序反转、动态裁剪等物理增强后,进一步提升至 75.03%,绝对增益达 16.47%,证明消除训练集的统计偏置远比堆叠模型参数更有效。
- 空间感知 MLLM 对动态摄像机运镜完全失效:先前的 Spatial-MLLM 和 G2VLM 虽然引入了点云或 3D 几何重构先验,但在运镜基准上的综合准确率甚至低于随机猜测(仅 5%~34%),因为它们学习的是场景静态内容的局部几何拓扑,并未建立观察者视点运动(Camera Trajectory)与时空光流场的对应关系。
- 商用超大模型在物理平移与变焦判别上仍严重偏科:即使强大如 Gemini-3.1-Pro,在真实视频的平移(64.00%)与变焦(62.39%)分类上仍与人类表现(>90%)存在巨大鸿沟;本文微调的 8B 模型在真实集(74.28% vs 67.73%)和合成集(77.44% vs 69.58%)平均准确率上全面显著超越 Gemini-3.1-Pro。
亮点与洞察¶
- 将运镜理解升格为独立研究原语:不再将运镜粗暴包裹在动作识别或粗略视频问答中,而是从专业电影摄影出发抽象出 17 个原子类别,为生成模型自动化打分和影视数据自动化标注奠定了标准化基准。
- 以纯几何直觉破除长尾合成难关:用时序反向合成拉镜头、用静态画面动态裁剪模拟无视差光学变焦,既不破坏视频自然纹理,又在零人工标注成本下精确修补了长尾动作空间。
- 揭示了 VLM“目标跟踪器偏向”的技术根因:定量证明了当前 VLM 在观察视频时过度依赖前景移动显著度、忽略背景视差流动,为后续开发融合光流先验或外极几何引导的多模态大模型架构指明了方向。
局限与展望¶
- 当前基准仅限于单镜头原子运镜:评测集与训练集刻意约束为每个片段仅包含一个主导运镜,未能涵盖专业电影中复杂的复合运镜(如边推镜头边水平摇镜 Dolly-Pan,或希区柯克式的滑动变焦 Vertigo Effect)。
- 长尾复杂运动合成仍受限于视频生成器能力:在利用 Veo 3.1 闭环生成基准数据时,诸如顺时针滚转(Roll Clockwise)和精准光学变焦等指令仍经常出现生成退化与偏向,导致部分极端冷门类别的基准规模仍然偏小。
- 未来改进路径:将原子运镜扩展至时序时段定位(Temporal Camera Movement Grounding),并探索端到端解耦背景运动场与前景动态流的专用视觉编码器。
相关工作与启发¶
- vs CameraBench & ShotBench: CameraBench 引入了超 50 种细粒度运动图元但缺乏合成生成视频评测且训练集很小;ShotBench 侧重专业影视问答但未解耦复合运镜。本文的 ACaM 专注 17 种清晰互斥的原子运镜,首次打通真实与 AI 生成双域评测,并补齐了人类基准线。
- vs SLAM / SfM 视觉几何方法 (Mega-SaM / ViPE): 传统视觉几何方法能够输出精确连续轨迹,但对无视差变焦、环绕追踪等缺乏语义理解,且在复杂动态物体场景下易跟踪丢失;本文的 VLM 方案具备极高语义泛化力与自然语言交互友好性。
评分¶
- 新颖性: ⭐⭐⭐⭐ [首次系统化确立自然语言运镜理解任务,分类学与双域基准完备]
- 实验充分度: ⭐⭐⭐⭐⭐ [横跨几何模型、空间模型、通用大模型及专用模型,评测维度深入严谨]
- 写作质量: ⭐⭐⭐⭐⭐ [失败模式剖析深刻入微,动机连贯,图表统计清晰详实]
- 价值: ⭐⭐⭐⭐⭐ [对可控视频生成的数据工程标注与自动化客观评测具有直接的工业落地价值]