跳转至

MAVIN: Multi-Shot Audio-Visual Generation with Customized Narrative Control

会议: ECCV 2026
论文: ECCV 原文
领域: 视频生成
关键词: 音视频联合生成、多镜头叙事控制、边界感知注意力、身份感知传播、扩散模型

一句话总结

针对复杂叙事电影中多镜头音视频联合生成存在的时序错位、多角色外貌音色难以定制以及脚本时序线索匮乏三大瓶颈,MAVIN 提出了结合分层脚本的多智能体编剧管线、边界感知注意力机制与身份感知传播机制,首次实现了具备精准分镜切换、对话起止时间戳控制和多角色音色/外貌一致性的多镜头音画联合生成。

研究背景与动机

近年来,基于扩散变换器(DiT)的视频生成模型取得了突破性进展,能够合成高逼真度的单镜头视频画面。为了迈向真实的电影制作流程,学术界和工业界逐渐将研究重点拓展到长程叙事规划、分镜生成以及音画联合生成等前沿方向。然而,现有的单片段音视频生成模型往往依赖单一全局文本提示词,无法支持专业电影制作中跨多个镜头(shots)、包含复杂转场、多角色对话交替与环境音效的结构化叙述。

当前多镜头生成方案主要面临三项核心矛盾:首先,在时序对齐维度上,标准跨注意力机制将全局文本均匀暴露给所有潜变量时空位置,导致镜头间语义泄漏,无法精确控制角色动作与对白事件的严格起止时间(temporal misalignment);其次,在角色可控性维度上,现有定制化模型主要聚焦单一或多个主体的视觉外貌一致性,对于音频维度的主体特征(如特定角色的音色 timbre)缺乏联合绑定机制,多角色场景极易发生音画错位与身份串扰;最后,现有多智能体编剧工具仅输出视频视效提示词,完全忽视了对话时间戳、画外音与环境音效等音频叙事线索。

针对上述挑战,MAVIN 提出从分层语义解耦与时空掩码路由两个维度重构双塔音画生成流程。核心 idea:构建包含全局、分镜与角色三级解耦的分层脚本,在双塔 DiT 内部通过边界感知注意力将音画隐变量严格限定在各自的时间窗口与对话区间内,并配合解耦音色与外貌的身份感知传播机制,实现兼具高精度硬切转场与多角色音画一致性的多镜头生成。

方法详解

整体框架

MAVIN 整体架构基于双塔 Diffusion Transformer(以 OVI 为基座),分别对视频与音频潜变量进行流匹配(Flow Matching)联合建模。输入包括自由文本提示词,以及可选的目标角色参考图像与参考音频片段。整个生成管线首先通过轻量级多智能体编剧管线将用户粗糙提示词转化为三层分层脚本;随后通过视频/音频 VAE 将连续视频隐变量和稀疏对话音频隐变量映射到潜空间;在堆叠的 DiT 块内部,模型通过分层文本交叉注意力施加边界感知路由,并在自注意力层与跨模态注意力层注入身份感知传播特征,最后经由 ODE 求解与 VAE 解码输出时序严格对齐的多镜头音视频。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}, 'subGraphTitleMargin': {'top': 8, 'bottom': 16}}}%%
flowchart TD
    A["用户自由提示词 + 可选参考图/音频"] --> B["多智能体编剧管线<br/>结构解析→身份对齐→叙事精炼"]
    B --> C["分层脚本生成<br/>全局背景 + 镜头事件 + 角色外貌音色"]
    C --> D["双塔潜空间映射<br/>连续视频分段 + 稀疏音频区间划分"]
    D --> E["边界感知注意力<br/>非对称时间路由矩阵严格约束可见性"]
    E --> F["身份感知传播<br/>音色解耦嵌入 + 角色专属可见性掩码"]
    F --> G["联合预测与解码输出<br/>流匹配速度场预测 → 多镜头音画同步成品"]

关键设计

1. 多智能体编剧管线:将自由文本转化为结构化分层脚本 为解决用户自由输入缺乏精确镜头划分与音频线索的痛点,MAVIN 设计了由三个专业大模型智能体串联构成的编剧系统。结构解析智能体(Structure Parser)基于预设模板从自由提示词中解析全局场景属性,解构每个镜头的绝对时间边界、离散角色集合以及角色各自的对话时间区间;身份对齐智能体(Identity Aligner)将检测出的角色实体与用户上传的参考图像、参考音频进行语义锚定;叙事精炼智能体(Narrative Refiner)补充各镜头内的精细化动作事件、机位运镜语言与精确对话台词,最终生成包含全局脚本 \(\mathcal{C}^\mathrm{global}\)、镜头脚本 \(\{\mathcal{C}^\mathrm{shot}_i\}\) 与角色脚本 \(\{\mathcal{C}^\mathrm{role}_j\}\) 的三级分层语义描述。

2. 边界感知注意力:非对称隐变量划分与动态令牌路由 针对跨镜头生成中全局跨注意力机制造成的镜头间内容渗透与音画起止错位,MAVIN 提出边界感知注意力(Boundary-Aware Attention)。由于视频画面具有时间连续性,模型依据转场切片将视频潜变量按镜头时间区间 \(\mathcal{T}^\mathrm{s}_i\) 划分为分块片段;而人类对白通常是稀疏且事件驱动的,音频潜变量则严格按角色对白的起止时间戳 \(\mathcal{T}^\mathrm{r}_j\) 进行划分。在 DiT 的文本交叉注意力层中,引入动态二进制路由掩码 \(\mathbf{M}\),将注意力计算重构为:

\[\mathbf{Z}^r = \mathrm{softmax}\left(\frac{\mathbf{Q}\mathbf{K}_{\mathcal{C}}^\top}{\sqrt{d}} \odot \mathbf{M}\right)\mathbf{V}_{\mathcal{C}}\]

其中对于处于时间戳 \(\tau(k)\) 的视频隐变量令牌 \(k\),其可见性掩码明确规定:全局脚本始终可见;镜头级文本仅在 \(\tau(k) \in \mathcal{T}^\mathrm{s}_i\) 时可见;角色级文本仅在当前镜头包含该角色且处于对应时间窗时激活;音频隐变量令牌则仅在 \(\tau(k)\) 命中角色对白区间 \(\mathcal{T}^\mathrm{r}_j\) 时才对该角色的音效/音色文本开放。该设计完全消除了镜头间语义混叠,确保角色只在指定时间开口发声。

3. 身份感知传播:音色解耦嵌入与多层独立可见性掩码 在多角色音画联合生成中,直接拼接参考音频容易导致音色与原本的语义、语速及语调发生纠缠,且跨镜头间易发生面部与声音的身份漂移。MAVIN 提出解耦与隔离并行的传播策略:首先,针对输入的参考音频,利用预训练音色编码器(Pretrained Timbre Encoder)提取纯净的音色表征 \(\mathbf{e}_j\),将其投影后与音频隐变量及可学习角色 ID 嵌入 \(\mathbf{p}_j^\mathrm{a}\) 融合;视觉分支则将参考图像隐变量与视觉 ID 嵌入 \(\mathbf{p}_j^\mathrm{v}\) 融合,形成角色专属的定制令牌。其次,设计身份感知掩码(Identity-Aware Mask)在四大注意力层全流程防护:视频自注意力层仅允许当前镜头令牌与同镜头出场角色的视觉锚点交互;音频自注意力层仅允许当前时间发言角色与其实际音频锚点交互;文本注意力层建立专属角色描述与对应音画锚点的强绑定;跨模态交叉注意力层则严格限定只有同一角色的视觉锚点与音频锚点才能互相注视。这彻底阻断了不同主体之间的外貌与声线串扰。

损失函数 / 训练策略

模型采用三阶段渐进式对齐训练策略,避免多种约束信号联合训练时的梯度冲突:第一阶段(Stage 1)仅针对分层文本驱动进行基础文本-音视频生成优化;第二阶段(Stage 2)引入单模态身份锚点,分别微调视觉与音频参考输入的注入分支;第三阶段(Stage 3)冻结基础编码器,进行整合分层文本、视觉锚点与解耦音色锚点的全量联合微调。全阶段均采用流匹配目标函数进行优化,基于速度场均方误差回归真实音频与视频流分布。

实验关键数据

主实验

评估在包含 1,000 个精选样本的 MAVINSet 评测基准上进行(全部为未见过的全新多镜头场景,且基线测试时不提供参考参考图以保证公平性对比)。模型分别与级联多镜头方案(T2V + V2A,如 VideoGen-of-Thought, MovieAgent, EchoShot, CineTrans, IC-LoRA+Wan, StoryDiffusion+Wan)以及端到端音画联合生成模型(JavisDiT, UniVerse-1, OVI, LTX-2)进行了系统评测。

方法分类 模型 视频质量 FVD ↓ 音频质量 FAD ↓ 唇形同步 Sync ↑ 语音时序对齐 TAMS ↑ 镜头转场精度 STA ↑ 跨镜头角色一致性 CISC ↑
级联生成 (T2V + V2A) VideoGen-of-Thought 418.7 13.2 2.278 - - 0.6195
级联生成 (T2V + V2A) MovieAgent 395.3 15.9 1.913 - - 0.4872
级联生成 (T2V + V2A) EchoShot 276.3 12.3 2.095 - 0.6002 0.6104
级联生成 (T2V + V2A) CineTrans 254.2 11.9 1.892 - 0.5820 0.6073
联合生成 (T2AV) JavisDiT 512.6 21.3 3.734 0.1012 - -
联合生成 (T2AV) UniVerse-1 356.9 11.2 3.851 0.2892 - -
联合生成 (T2AV) OVI (基座) 318.4 8.3 4.231 0.4432 0.4992 0.6121
联合生成 (T2AV) LTX-2 289.7 8.6 4.365 0.5343 0.5733 0.6015
本文方法 MAVIN (Ours) 231.6 6.8 6.032 0.8104 0.9897 0.6319

注:级联模型因前序 T2V 缺乏细粒度唇动导致下游 V2A 无法生成清晰对白,故 WER 与 TAMS 指标不适用(-)。

消融实验

消融实验在带参考图与参考音频的定制化生成设定下开展,验证各核心组件的独立贡献。

配置变体 视频 FVD ↓ 音频 FAD ↓ 唇形对齐 Sync ↑ 语音时序 TAMS ↑ 镜头转场 STA ↑ 跨镜头角色一致 CISC ↑ 说明
完整模型 (MAVIN) 241.9 6.9 6.057 0.793 0.9886 0.6397 具备全部模块
w/o BTR (无边界感知令牌路由) 268.4 7.6 5.830 0.582 0.5580 0.5520 镜头与对话边界失控,STA与TAMS断崖式下跌
w/o IM (无身份感知掩码) 256.9 7.3 5.970 0.787 0.8010 0.5710 多角色特征发生跨镜头串扰,CISC明显下降
w/o PTE (无预训练音色编码器) 242.5 7.0 6.010 0.792 0.9460 0.6240 音频参考音色与语义纠缠,跨模态同步受损
w/o MAP (无多智能体编剧管线) 261.1 7.5 5.910 0.569 0.6230 0.5900 粗糙输入导致镜头切分与事件起止精度崩塌

关键发现

  • 转场与时间戳控制的核心支柱:边界感知路由(BTR)对转场准确率(STA 从 0.5580 飙升至 0.9886)与语音时间对齐(TAMS 从 0.582 提升至 0.793)起到了决定性作用。缺少显式时序掩码时,模型会将不同镜头的事件在时间上糊成一片。
  • 防止多角色身份串扰:身份感知掩码(IM)是多角色场景下保持角色一致性(CISC 从 0.5710 提升至 0.6397)的关键,避免了角色 A 的外观或声音渗入角色 B。
  • 主观偏好碾压级优势:在用户主观评测(AMT)中,MAVIN 在音画叙事契合度(ANA/VNA)上获得了超过 64% 的最高首选率,远超 OVI(4.6%/4.4%)和 EchoShot(5.2%/5.4%)。

亮点与洞察

  • 音画物理特性的非对称建模:敏锐地捕捉到了视频流在时间上的连续性与语音信号的稀疏事件性,分别采用连续镜头划分与离散区间掩码进行非对称路由,极为契合电影语言逻辑。
  • 解耦音色与语义的多角色声线定制:通过引入预训练音色编码器与可学习角色 ID 嵌入,成功将主体的声线特征从参考音频的语篇语调中剥离,解决了长期困扰视频生成的“多角色声音打架”难题。
  • 从自由输入到可控生成的闭环:多智能体编剧管线有效弥合了普通用户自然语言描述与底层扩散变换器严苛时空时间戳之间的鸿沟,为可交互式影视创作工具树立了范式。

局限与展望

  • 生成时长与角色数量上限:当前模型单次推理上限为 15 秒(1-6 个镜头),且最多支持 3 个定制角色。对于长篇电影级别复杂场景,仍需外部分段拼接。
  • 对初始分镜脚本的敏感性:底层渲染极度依赖上游编剧管线输出的时间戳准确性;若编剧代理生成了不切实际的语速与时间分配,画面唇动与语调可能出现轻微拉伸。
  • 未来方向:探索结合更强基础 DiT 模型(如扩展至更大参数规模)实现分钟级电影生成,并引入交互式故事板可视化编辑界面。

相关工作与启发

  • vs OVI / LTX-2: OVI 等端到端联合生成模型具备较好的单镜头音画同步,但缺乏分镜硬切与时序控制机制,遇到多镜头描述时背景与角色频繁漂移(STA 仅约 0.5);MAVIN 通过引入边界感知注意力与分层脚本,将转场准确率提升至 98.9% 以上。
  • vs MovieAgent / EchoShot / CineTrans: 现有分镜生成方案多为“先生成多镜头视频,再用音频生成模型配音”的级联架构;由于视频模型生成时没有唇动音频感知,下游音频模型无法精准对口型(WER 与 TAMS 无法评测);MAVIN 实现了双塔端到端联合去噪,音画同步(SyncNet 达 6.032)远超级联模型。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ [首次完整解决多镜头场景下音视频联合生成的时序边界对齐与多角色音色/外貌联合定制]
  • 实验充分度: ⭐⭐⭐⭐⭐ [自建 800K 规模 MAVINSet 与 1K 精细基准,覆盖 13 项客观指标及多维度用户主观评测]
  • 写作质量: ⭐⭐⭐⭐⭐ [动机叙述逻辑极为严密,图表清晰易读,方法推导与实验消融闭环扎实]
  • 价值: ⭐⭐⭐⭐⭐ [直击 AIGC 电影工业化落地痛点,为专业化 AI 影视工作流提供了开创性基础框架]