跳转至

Precise Video-to-Audio Generation with Cross-Modal Alignment in Latent Space

会议: ECCV 2026
论文: ECCV 2026 Poster
代码: https://flowley-v2a.github.io
领域: 音频/语音
关键词: 视频转音频 / 流匹配 / 渐进式跨模态注意力 / 音画同步 / 声音感知字幕生成

一句话总结

针对视频转音频(V2A)中多阶段训练开销大、时序对齐依赖额外预训练模块等问题,本文提出基于流匹配的端到端单阶段框架 Flowley,利用无额外参数的渐进式软掩码跨模态注意力(PSCA)实现精准音画时序同步,并配合即插即用的声音感知字幕器 SoundCap 显著提升语义保真度与生成质量。

研究背景与动机

音效设计是影视与多媒体制作中讲好故事的核心支撑,其中拟音(Foley)环节要求音效与屏幕动作严格同步。传统的拟音师依靠专用道具与物理交互实现实时声画合拍,费时费力;近年来文本生成音频(T2A)技术虽然取得了飞速进展,能够依据文本描述合成多样化声音,但创作者依然必须手动精修时间线才能将其与视频动作贴合,无法达到自动化拟音的效率诉求。

为了摆脱手动时序对齐的枷锁,视频生成音频(V2A)近年来成为学术界与工业界关注的热点。然而现存的主流方案存在两大约束:第一类方法选择将无声视频先由视觉编码器或视觉大模型转译为简略文本描述,再直接复用现成的预训练 T2A 模型生成声音(如 V2A-Mapper 等),这导致视频中微观、高频的时序动态在文本抽象过程中不可避免地丢失;第二类方法则采用复杂的“多阶段训练”策略,先借助对比学习预训练音视频对齐网络(如 Diff-Foley、MMAudio),或引入额外的能量回归、起始点(onset)检测器(如 FoleyCrafter、Mel-QCD),再将其冻结拼接入生成底模中。这种多阶段管线不仅带来高昂的计算代价与多阶段训练误差累积,而且由于传统 V2A 数据集(如 VGGSound)极度匮乏详细且聚焦声音的文本描述,导致生成声音的声画语义一致性与逼真度始终受限。

本文的切入视角是:时序同步能力不应依赖外部专用的预训练对齐网络或两阶段管线,而完全可以在流匹配的潜空间交互中内生形成;同时数据集内“只描述视觉目标、不描述声学事件”的粗糙标注亦可通过跨模态大模型进行即插即用的听觉感知重写。核心 idea:构建单阶段端到端流匹配框架 Flowley,在潜空间中设计无需外部对齐网络的渐进式软掩码跨注意力(PSCA)实现从粗到精的内生时序对齐,并提出基于视听大模型的声音感知字幕生成器 SoundCap,以高质量双模态伪标签显著提升声学语义保真度。

方法详解

整体框架

Flowley 接收无声视频序列与对应的文本提示作为条件,在潜空间中通过流匹配(Flow Matching)ODE 求解器逐步去噪并生成目标音频的梅尔频谱图,最后经由神经网络声码器(BigVGAN)重建为高保真音频波形。整个架构由轻量级文本/视觉特征提取器、多流交叉融合模块、单流音频精炼模块(内嵌渐进式软掩码注意力 PSCA)以及 ODE 求解器串联而成。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入:无声视频帧 + 文本提示 + 初始高斯噪声潜变量"] --> B["多流向单流解耦网络<br/>N1 个多流块多模态联合自注意 + N2 个单流块音频精炼"]
    B --> C["渐进式软掩码跨模态注意力<br/>硬窗加软衰减衰减核 + 随层数递减的感受野掩码 M"]
    C --> D["正切采样调度与速度方向监督<br/>Tangent-based 调度避免端点塌陷 + 余弦方向损失 Lvel"]
    D --> E["声音感知字幕生成器<br/>AV-LLM 生成声学富文本 + 微调 VLM 零音频推理"]
    E --> F["输出:ODE 求解生成梅尔谱图并由 BigVGAN 重建高保真波形"]

关键设计

1. 多流向单流解耦网络:兼顾多模态早期交互与音频流针对性精炼 针对以往生成模型在多模态特征融合时要么早期强行拼接导致参数开销爆炸、要么后期粗暴 cross-attention 导致模态交互不深的问题,Flowley 采用了“多流联合交互 + 单流专属精炼”的两阶段分层骨干结构。模型首先利用 FLAN-T5 提取文本嵌入 \(f_{\text{txt}} \in \mathbb{R}^{L_{\text{txt}} \times D_{\text{txt}}}\),并以 8 FPS 对视频采样后经 CLIP 提取帧级视觉表征 \(f_{\text{vis}} \in \mathbb{R}^{L_{\text{vis}} \times D_{\text{vis}}}\)。在前端的 \(N_1 = 5\) 个多流块(Multi-stream Block)中,视觉、文本和加噪音频潜变量通过 QK-Norm 与 RoPE 旋转位置编码进行联合注意力机制交互,促成深层语义融合;随后,音频潜变量单独流入后端的 \(N_2 = 10\) 个单流块(Single-stream Block)进行声学专用特征精炼,每一层分别通过可学习权重 \(\alpha^{(\ell)}\) 融合文本跨注意力与视觉跨注意力,既保证了多模态表征的交互充分性,又大幅节省了整体参数量(核心参数仅 169M)。

2. 渐进式软掩码跨模态注意力:无额外代价的内生局部时序对齐 在传统跨模态注意力中,音频 query 对视频 key 的全图无偏注意力极易出现跨时间段的注意力弥散,使原本短暂的声响错误地对齐到无关的远端视频帧上;而以往方法为此引入笨重的预训练音视频同步模块或能量分类器。Flowley 提出了渐进式软掩码跨模态注意力(Progressive Soft-masked Cross-Attention, PSCA),直接在注意力权重矩阵中叠加距离感知与层深度感知的衰减掩码:

设音频帧 \(i\) 对应的视觉对齐中心帧为 \(j_c(i) = \min(\lfloor \frac{r_v}{r_a} i \rfloor, L_{\text{vis}} - 1)\),帧间索引绝对距离为 \(d_{ij} = |j - j_c(i)|\)。在第 \(\ell\) 个单流块中,衰减系数由浅到深受控于深度递减因子 \(\beta_\ell = 1 - \frac{\ell}{N_2 - 1}\),对应掩码定义为:

\[M_{ij}^{(\ell)} = \begin{cases} 1, & d_{ij} \le \omega \\ \beta_\ell \cdot \frac{1}{2} \left[ \cos\left(\frac{\pi (d_{ij} - \omega)}{\delta}\right) + 1 \right], & \omega < d_{ij} \le \omega + \delta \\ 0, & d_{ij} > \omega + \delta \end{cases}\]

其中 \(\omega\) 为完全注意力的硬窗口边界(实验中设为 0),\(\delta\) 为平滑衰减区间(实验中设为 4)。浅层网络通过较大的 \(\beta_\ell\) 允许模型吸收周边相邻动作的上下文视觉动态;而在靠近输出的深层网络中,掩码随 \(\beta_\ell \to 0\) 自动收敛为严格的局部窄窗口,迫使模型在最终速度场预测时精准对准发生动作的视觉瞬间。整个过程完全可微且计算零冗余。

3. 正切采样调度与速度方向监督:保证端点平滑度与流矢量准确性 流匹配训练常规采用的 logit-normal 时间步采样在端点 \(t=0\)\(t=1\) 处的概率密度坍缩为 0,导致模型在接近纯高斯先验和接近真实数据边界处的去噪能力退化。Flowley 引入正切采样调度(Tangent-based schedule):

\[t = 1 - \frac{1}{\tan\left(\frac{\pi}{2} u\right) + 1}, \quad u \sim \mathcal{U}[0, 1]\]

该函数赋予中间去噪步与端点区间更平衡的采样密度。此外,在经典的流匹配均方误差损失 \(\mathcal{L}_{\text{FM}}\) 基础上,针对流矢量在高维流形中容易出现“大小接近但方向偏差”的问题,引入了基于余弦相似度的速度方向损失:

\[\mathcal{L}_{\text{vel}} = 1 - \text{sim}\big(v_\theta(x_t, t, c), (x_1 - x_0)\big)\]

总体目标函数形如 \(\mathcal{L} = \mathcal{L}_{\text{FM}} + \lambda \mathcal{L}_{\text{vel}}\)(取 \(\lambda = 0.5\)),并结合数据噪声对齐(Data-Noise Alignment)与无分类器引导(CFG),显著加速了收敛速度并保证了流矢量生成的几何稳定性。

4. 声音感知字幕生成器:消除听觉偏置的双模态伪标注管线 传统视频转音频数据集中的文本多为简短粗略的视觉动作类别,缺少声音纹理甚至包含场外噪声。若简单使用分离式的音频或视频大模型转译文本,极易发生模态幻觉(例如在复现 Sound-VECaps 时,声学模型常把汽车轰鸣误判为狮吼)。SoundCap 设计了一条两阶段生成管线:首先离线调用联合视听多模态大模型 video-SALMONN,根据视频与原始音频共同推断出高度详尽、兼顾屏内动作与屏外音效的高质量声学字幕,并引入显式抗噪 Prompt 指令排除不相关的背景杂音与人声干扰;随后以此真值字幕微调纯视觉-语言模型(Qwen2.5-VL)。在推理时仅运行该 VLM,在仅有无声视频输入时即能推断出细腻的声音事件提示词,为 Flowley 注入丰满的声学语义引导。

损失函数 / 训练策略

训练阶段首先通过预训练 VAE 将 16 kHz 降采样的梅尔频谱压缩至潜空间。条件注入采用自适应层归一化(adaLN),训练时以 10% 的独立概率对视觉特征或文本特征进行随机遮蔽(Dropout),以支持推理阶段的无分类器引导(CFG 强度设为 \(s = 7.5\))。流匹配推断时仅需 25 步欧拉法(Euler ODE solver)即可高效完成高质量积分求解。

实验关键数据

主实验

在标准的大规模基准数据集 VGGSound(20 万条 10 秒视频片段,截取前 8 秒)上,Flowley 与一系列主流 SOTA 模型在四项关键维度上进行了全面量化评测(下表数据来自原文 Table 1)。

方法 参数量 KAD ↓ FAD ↓ KL ↓ IS ↑ IB-Score (×100) ↑ LB-Score (×100) ↑ Align Acc ↑
Frieren 159M 1.27 12.80 2.82 12.02 22.45 19.09 97.13
FoleyCrafter 1.22B 1.54 19.17 2.19 15.09 25.75 24.66 77.15
V2A-Mapper 229M 1.34 11.73 2.50 12.43 22.38 22.32 79.08
MDSGen 131M 5.33 39.68 2.85 6.87 17.75 19.05 91.70
Mel-QCD 859M 1.53 19.17 2.09 10.32 23.79 23.80 73.85
VinTAGe 1.32B 1.08 17.88 2.15 17.34 21.10 21.51 67.11
MMAudio 157M 0.57 7.89 1.91 12.68 28.09 21.98 89.73
MMAudio + SoundCap 157M 0.39 7.09 1.56 14.68 28.85 22.64 90.53
Flowley (本文) 169M 0.42 7.65 1.57 18.25 29.32 24.87 89.37
Flowley + SoundCap (本文) 169M 0.39 7.52 1.56 19.68 30.07 25.33 90.02

注:Frieren 与 MDSGen 在 Align Acc 偏高是由于评测特征提取器与模型本身的预训练特征重叠存在一定评测偏置,人工主观评估中 Flowley 获得压倒性胜率。

消融实验

为验证单流网络中各注意力模块与 PSCA 机制的必要性,论文在单流模块配置(Table 3)及 PSCA 窗口参数(Table 2)上展开了详细消融分析。

单流块配置序号 文本 CA (\(\text{CA}_t\)) 视觉 CA (\(\text{CA}_v\)) 渐进软掩码 (\(\text{PSCA}_v\)) KAD ↓ IS ↑ IB-Score (×100) ↑ Align Acc ↑
1 (Vanilla DiT) 0.44 16.99 27.38 86.26
2 (仅文本) 0.44 17.29 28.93 87.43
3 (仅标准视觉) 0.40 17.58 28.02 87.04
4 (仅 PSCA 视觉) 0.40 17.69 28.51 88.72
5 (文本 + 标准视觉) 0.40 18.15 28.74 87.61
6 (Flowley 完整设置) 0.42 18.25 29.32 89.37

另外,在层级渐进参数 \(\beta\) 的消融中(Table 4),移除 \(\beta\) 后 IS 从 18.25 下滑至 17.78,Align Acc 从 89.37% 下降至 88.62%,证明由浅至深的聚焦机制对音质与时序对齐均具有增益。在 SoundCap 去噪条件的消融中(Table 5),缺失噪声提示的字幕使得 Flowley 的 IS 指标骤降 16.9%(从 18.25 降至 15.16),证明了在野生数据集构建伪标签时过滤背景杂音的关键作用。

关键发现

  • PSCA 带来了时序对齐的无痛跃升:在不增加额外网络参数、不依赖任何外部音视频同步预训练模块的前提下,仅依靠渐进式软掩码衰减机制,模型在单流块中的 Align Acc 即从 87.61% 提升至 89.37%,显著优于依靠 onset 模块的 FoleyCrafter (77.15%) 与 Mel-QCD (73.85%)。
  • 参数效率与质量极高:Flowley 仅包含 169M 核心生成参数,却在生成质量得分(IS = 18.25)与分布拟合度(KAD = 0.42)上全面超越了参数量高达 1.32B 的 VinTAGe(IS = 17.34, KAD = 1.08)。
  • 零样本跨域鲁棒性极强:在极具挑战的合成基准 MovieGen Audio Bench 零样本迁移测试中,仅用 400 小时训练数据的 Flowley + SoundCap 取得了 8.18 的 IS 得分,击败了由 Meta 训练、拥有 130 亿(13B)参数且在百万小时级数据上训练的闭源巨型模型 Movie Gen Audio(IS = 8.01)。

亮点与洞察

  • 将时序先验注入注意力矩阵而非堆砌网络模块:以往工作为了音画同步,往往外挂时序分类器、能量检测器或引入昂贵的多阶段对齐预训练;Flowley 则巧妙利用音视频物理时序对应关系,将高斯窗衰减核与网络层深单调衰减结合,零额外参数、零多余显存开销地在注意力算子内部完成了同步偏置注入。
  • 视听大模型反哺纯视觉字幕推断的闭环设计:SoundCap 敏锐捕捉到现有 V2A 数据集文本粗糙的痛点,采用“AV-LLM 生成双模态 Ground-Truth \(\to\) 微调纯 VLM \(\to\) 零音频推理”的路径,不仅解决了训练集声学描述匮乏的卡点,更打破了以往分立式抽取时常发生的跨模态语义幻觉。

局限与展望

  • 极端复杂场景下的长尾声音泛化受限:虽然 Flowley 在零样本测试中质量逼近甚至超越 Movie Gen Audio,但在语义对齐分数(IB-Score 25.78 vs 35.86)上仍有明显差距,反映出仅在 VGGSound(约 400 小时)规模上训练使模型对现实世界罕见声学概念的泛化受限。
  • 对于画面外(off-screen)发声体的时序把控较弱:PSCA 假设音画动作具有严格的局部帧对应关系,但电影叙事中常有“画外音”、“延时回声”或“预见性声效”,这类声音不与画面当前帧强绑定,严格递减的局部软掩码可能在一定程度上抑制该类音效的自主发挥。

相关工作与启发

  • vs MMAudio: MMAudio 依赖预训练的音视频对齐模型提供监督特征,且同样采用多模态联合流设计;Flowley 的 PSCA 证明了单阶段内生软掩码即可在参数量相近(169M vs 157M)的情况下,在不使用外部预训练对齐模块的前提下取得更优的分布拟合度(KAD 0.42 vs 0.57)和生成质量(IS 18.25 vs 12.68)。
  • vs FoleyCrafter / Mel-QCD: 传统方法往往外置 onset 捕捉器或进行复杂的连续-离散谱图解耦,流水线复杂;Flowley 将流匹配、正切采样与潜空间渐进注意力统一为单阶段训练,管线更加简洁稳定。

评分

  • 新颖性: ⭐⭐⭐⭐ [渐进式软掩码跨模态注意力巧妙化解了注意力弥散与时序错位,设计优雅无需外置模块]
  • 实验充分度: ⭐⭐⭐⭐⭐ [对比了 7 种主流基线、提供了四维度量化、大量消融实验及细致的人工 A/B 双盲评测]
  • 写作质量: ⭐⭐⭐⭐⭐ [逻辑层层递进,方法原理阐述清晰,图表完备详实]
  • 价值: ⭐⭐⭐⭐⭐ [为影视自动化 Foley 拟音与高保真音画同步生成提供了极具实用价值的轻量级 SOTA 范例]