VoCa: Unified Autoregressive Modeling for Talking Audio-Video Generation¶
会议: ECCV 2026
论文: ECCV 原文
领域: 视频生成 (亦可归入 音频/语音、多模态 VLM)
关键词: 统一自回归建模、说话人视频生成、音视频联合生成、扩散模型蒸馏、滚动窗口去噪
一句话总结¶
VoCa 提出了一种统一自回归框架,通过大语言模型直接将文本转化为兼具声学与语义的共享表征,并配合语音精炼器与因果扩散变换器的滚动窗口去噪蒸馏,实现了单张参考图与文本输入下高保真语音与说话人视频的严格时间对齐与流式联合生成。
研究背景与动机¶
传统的说话人视频生成系统大多采用音频驱动的级联流水线。在仅有文本台词的交互场景中,现有方案通常必须先调用文本转语音(TTS)模型生成音频波形,再将合成音频输入视频扩散模型来驱动人脸动画。这种级联结构存在显著的误差累积效应与较高的端到端延迟,更严重的是,生成模型仅以声学信号为条件,导致人物动作与文本语义之间出现脱节。近年来涌现的端到端音视频生成方法虽然尝试规避级联问题,但普遍采用双骨干(twin-backbone)设计,需要从头训练庞大的音频分支,训练开销巨大;且因缺乏内建的语言模型,在面对实际人机对话等交互任务时仍需在外层挂接额外的大语言模型(LLM),重新退化成了级联架构。
这种困局的核心矛盾在于:说话人合成既需要高阶语言理解与时序因果生成能力来支撑流式交互与语义对齐,又需要细粒度声学特征与空间视频扩散模型之间保持严格的毫秒级时序同步。然而,自回归大语言模型的表征天然偏向离散音频波形重建,与面部肌肉运动所需的音素理解信号存在语义鸿沟;同时,基于双向注意力的视频扩散变换器难以直接与自回归逐步生成机制兼容。
本文的切入角度是直接将预训练自回归大语言模型作为音视频生成的共享中枢,使其在生成离散音频 token 的同时输出富含语义的隐藏状态,并通过专用的语音精炼网络与因果时间窗去噪机制桥接扩散模型。核心 idea:构建以大语言模型为共享时序核心的统一自回归框架,利用语音精炼器蒸馏自监督语音语义以弥合模态鸿沟,并结合统一窗口切分与滚动窗口去噪蒸馏将双向扩散变换器改造为因果流式生成器,实现音视频零级联严格同步协同生成。
方法详解¶
整体框架¶
VoCa 接收文本台词和一张单人参考图像作为输入,通过逐时间步自回归推进的方式协同生成连续语音波形与对齐视频帧序列。系统主要由三个协同模块构成:基于 3B 参数的自回归大语言模型(LLM)、基于离散神经音频编码器的语音解码器(Speech Decoder),以及由语音精炼器(Speech Refiner)与因果扩散变换器(Causal Diffusion Transformer)构成的视频解码器。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["输入:文本台词 + 单张参考肖像"] --> B["大语言模型与共享表征生成<br/>生成离散音频Token与隐藏状态"]
B --> C["统一窗口切分机制<br/>划分固定长度滑动激活窗口与历史缓存"]
C --> D1["语音解码器流式重构<br/>RVQGAN时域波形合成"]
C --> D2["语音精炼器跨模态桥接<br/>时率插值+残差卷积+HuBERT语义蒸馏"]
D2 --> E["因果扩散变换器去噪<br/>定域音频交叉注意力+解耦身份保持"]
E --> F["滚动窗口去噪与DMD蒸馏<br/>逐块滑动推演与少步生成"]
D1 --> G["输出:严格同步的连续语音与高保真说话视频"]
F --> G
在推理流中,大语言模型逐步预测离散音频 token 与其对应的多层隐藏状态,两者共同构成共享多模态表征并推入定长的统一激活窗口中。语音解码器从激活窗口实时合成音频波形;视频分支中,语音精炼器对表征进行时率对齐、卷积增强与自监督语义投影,随后因果扩散变换器在维持全局与局部时序上下文 KV Cache 的前提下,通过紧凑的滚动去噪窗口逐块输出对齐的视频潜变量。
关键设计¶
1. 语音精炼器跨模态桥接:消除声学重建表征与面部肌肉动力学之间的语义鸿沟
LLM 生成的离散音频 token 主要是针对音频波形保真度重建而训练的,蕴含大量微观声学细节但相对匮乏音素与语言级的高阶语义,直接用来引导面部动作容易导致唇形模糊或误动。为解决该失配,语音精炼器首先通过线性插值将 LLM 表征对齐到视频帧的时序网格上,随后送入由一维卷积残差块堆叠而成的特征网络中,强化与唇形节律、重音高度相关的动态线索。在此基础上,精炼器将增强后的 token 特征与 LLM 原始音频隐藏状态(提供语篇级语义与非言语线索)进行通道拼接,并通过两层步长为 2 的时域卷积进行下采样,以匹配视频 VAE 潜变量的时序分辨率。
为了让精炼特征真正掌握音素级语音表征,模型在预训练阶段引入了辅助蒸馏损失 \(\mathcal{L}_{aux}\)。该损失以自监督语音模型 HuBERT 的均值池化层级特征 \(h_{target}\) 作为监督目标,强制对齐精炼器输出 \(h_{refiner}\):
配合视频潜变量流匹配(Flow Matching)损失 \(\mathcal{L}_{flow}\),精炼器不仅输出了严格时空同步的条件向量,还赋予了视觉生成分支深厚的音素判别与语意表现力。
2. 定域音频与解耦身份交叉注意力:实现严格因果时序对齐与高保真身份保持
视频扩散主干基于 Wan 架构改造,在潜空间中进行三维特征计算。在每个变换器块中,为了彻底避免未来音频信号泄漏破坏自回归因果性,并压降全序列注意力的高昂开销,模型设计了定域音频交叉注意力(Local Audio Attention):将当前帧的视频空间 token 网格限制为仅与语音精炼器在严格对应时间索引处的单个调节向量进行交叉注意力交互。这种一一映射消除了跨时间干扰,保证了声学驱动指令与面部动作之间确定性的一阶对应。
针对肖像身份与外貌几何的长时间稳定性,模型采用了双路解耦身份注意力机制。利用 DINOv2 视觉编码器提取全局外观特征(如发型、着装与全局色彩风格),同时利用 InsightFace 提取精密的人脸几何与面部结构嵌入。这两个分支在变换器内部通过两个独立的交叉注意力层分别与当前帧潜变量交互,并将两者的注意力输出直接相加。双特征解耦注入既避免了单编码器对局部微表情的平滑,又防止了动态大位移下肖像漂移。
3. 统一窗口切分与滚动去噪蒸馏:将双向扩散变换器重构为流式因果生成器
为了让通常依赖整段双向上下文的扩散变换器能够步进式跟随 LLM 自回归节奏,本文提出了统一激活窗口机制与基于 Distribution Matching Distillation (DMD) 的改进滚动窗口去噪策略。系统将视频潜变量序列划分为包含 \(K=3\) 个潜帧的非重叠 chunk。参考图像经 VAE 编码为初始 chunk \(B_0\)(时间步 \(t=0\)),与生成的首个运动 chunk \(B_1\) 一同作为不可变的全局上下文缓存,用以锚定长程身份与初始位姿;同时维持滑动局部历史缓存。
在推演阶段,当前活动的去噪窗口包含最多 \(M=5\) 个相邻 chunk,从左到右被分配由低到高的渐进噪声阶梯:最新进入的 chunk 从纯高斯噪声开始去噪,中间 chunk 从带噪缓存推进,最早的 chunk 则在完成预设步数去噪后固化写入干净 KV 缓存。学生生成器通过 DMD 对抗式伪分数与真实分数差异进行少步蒸馏:
通过对已经生成的干净上下文进行梯度掩码,模型仅针对新增运动潜变量优化,使扩散网络能够以与 LLM 音频相同的速率流式产出高质量视频块。
损失函数 / 训练策略¶
VoCa 的训练被系统性地划分为递进的三阶段: 1. 对齐预训练(Alignment Pretraining):冻结 LLM 和语音解码器,仅训练视频解码器。利用视频流匹配损失 \(\mathcal{L}_{flow}\) 与 HuBERT 辅助蒸馏损失 \(\mathcal{L}_{aux}\) 进行联合优化,目标函数为 \(\mathcal{L}_{pre} = \mathcal{L}_{flow} + \lambda_1 \mathcal{L}_{aux}\)(超参数 \(\lambda_1 = 1.0\))。 2. 联合微调(Joint Finetuning):冻结语音解码器,联合微调 LLM 与视频解码器。LLM 施加延迟模式(delay pattern)自回归预测离散音频 token,采用标准交叉熵损失 \(\mathcal{L}_{ce}\);视频端采用 teacher forcing 与分块因果注意力掩码,总损失为 \(\mathcal{L}_{ar} = \mathcal{L}_{flow} + \lambda_2 \mathcal{L}_{ce}\)(\(\lambda_2 = 0.25\))。 3. 分布匹配蒸馏(DMD Distillation):冻结 LLM、语音解码器以及真实分数模型 \(s_{\mathrm{real}}\),仅微调学生视频生成器与可训练伪分数网络 \(s_{\mathrm{fake}}\),实现少步因果滚动去噪加速。
训练使用 64 张 NVIDIA H800 GPU,批大小为 64,支持最高 \(832 \times 480\) 分辨率及 2-7 秒动态片段。训练中引入 5% 的独立条件丢弃与 5% 的全条件联合丢弃以强化无分类器引导与鲁棒性。
实验关键数据¶
主实验¶
在主流音频驱动肖像生成基准数据集(HDTF、CelebV-HQ、RAVDESS,各随机采样 300 条视频)上,评估身份一致性(IDC)、音唇同步性(Sync-C)、单帧视觉质量(FID)与时序连贯性(FVD)。
| 方法 | HDTF (IDC↑ / Sync-C↑ / FID↓ / FVD↓) | CelebV-HQ (IDC↑ / Sync-C↑ / FID↓ / FVD↓) | RAVDESS (IDC↑ / Sync-C↑ / FID↓ / FVD↓) |
|---|---|---|---|
| Hallo (2024) | 0.981 / 7.312 / 35.830 / 37.060 | 0.934 / 4.417 / 48.410 / 122.510 | 0.948 / 3.536 / 27.700 / 418.980 |
| AniPortrait (2024) | 0.978 / 3.607 / 36.100 / 71.270 | 0.938 / 1.804 / 50.000 / 110.600 | 0.935 / 2.364 / 23.800 / 505.040 |
| V-Express (2024) | 0.972 / 7.744 / 40.990 / 122.270 | 0.878 / 4.029 / 61.330 / 180.110 | 0.939 / 4.444 / 29.100 / 601.920 |
| Hallo3 (2024) | 0.976 / 6.898 / 35.550 / 42.850 | 0.930 / 4.173 / 44.750 / 91.410 | 0.949 / 4.948 / 24.520 / 54.330 |
| EchoMimicV3 (2025) | 0.976 / 2.573 / 35.570 / 58.380 | 0.930 / 2.134 / 49.880 / 92.540 | 0.965 / 2.494 / 15.090 / 44.360 |
| FantasyTalking (2025) | 0.969 / 3.836 / 37.360 / 46.600 | 0.930 / 2.797 / 47.220 / 106.810 | 0.952 / 3.803 / 29.350 / 57.820 |
| HunyuanAvatar (2025) | 0.970 / 7.584 / 35.570 / 106.270 | 0.915 / 4.494 / 46.550 / 97.800 | 0.957 / 5.214 / 19.760 / 99.490 |
| VoCa-1.3B (本文) | 0.981 / 6.082 / 33.620 / 39.630 | 0.927 / 3.620 / 48.040 / 95.870 | 0.970 / 4.585 / 14.070 / 55.190 |
| VoCa-5B (本文) | 0.982 / 8.054 / 33.020 / 36.930 | 0.936 / 4.769 / 44.480 / 91.170 | 0.970 / 5.636 / 13.160 / 48.710 |
(注:原论文 Table 1,VoCa 采用 Wan2.2-5B 主干,全方位刷新最佳成绩,尤其在唇形同步指标 Sync-C 上显著超越以往专用非自回归扩散方案)
消融实验¶
原论文针对 LLM 共享表征形式(Table 2)、辅助蒸馏损失权重 \(\lambda_1\)(Table 3)以及语音精炼器卷积层数(Table 4)进行了细致消融:
| 消融维度 | 配置变体 | IDC↑ | Sync-C↑ | FID↓ | FVD↓ | 核心说明 |
|---|---|---|---|---|---|---|
| 表征消融 (Table 2) | 仅离散音频 Token | 0.970 | 5.799 | 37.066 | 59.961 | 缺乏高阶上下文语义,非言语动态与动作流畅度受损 |
| 仅隐藏状态 Hidden | 0.973 | 3.773 | 36.124 | 56.256 | 严重缺乏细粒度声学细节,唇形同步严重劣化 (Sync-C -2.309) | |
| 二者结合 Both (默认) | 0.981 | 6.082 | 33.620 | 39.630 | 兼顾细粒度对齐与高阶动作连贯性,综合表现最优 | |
| 辅助损失 (Table 3) | \(\lambda_1 = 0\) (无 HuBERT 蒸馏) | 0.975 | 4.782 | 34.808 | 45.082 | 缺乏明确音素引导,音唇同步性能显著下滑 (Sync-C -1.300) |
| \(\lambda_1 = 1\) (默认配置) | 0.981 | 6.082 | 33.620 | 39.630 | 唇形对齐与生成保真度达到最佳均衡 | |
| \(\lambda_1 = 2\) (过大权重) | 0.963 | 6.003 | 36.916 | 64.509 | 语义监督过重,对视觉保真度和时序连贯性产生副作用 | |
| 精炼器深度 (Table 4) | 0 layers | 0.973 | 4.754 | 34.996 | 47.177 | 无特征精炼,表征无法充分提取节律重音 |
| 2 layers | 0.969 | 5.743 | 35.322 | 54.948 | 感受野与非线性受限,时序 FVD 偏高 | |
| 4 layers | 0.976 | 5.919 | 34.915 | 46.671 | 性能平稳回升 | |
| 6 layers (默认配置) | 0.981 | 6.082 | 33.620 | 39.630 | 音唇同步与画面质量达到峰值 | |
| 8 layers | 0.982 | 6.054 | 33.506 | 39.269 | 性能基本饱和,计算量增加 |
关键发现¶
- Token 与 Hidden 互补性:离散 token 奠定唇形微动与声学节律基础,而连续隐藏状态则控制头部摆动与情绪共话手势。若剥离离散 token,音唇同步分(Sync-C)从 6.082 暴跌至 3.773。
- 音素语义显式蒸馏不可或缺:无辅助蒸馏损失时(\(\lambda_1=0\)),Sync-C 仅为 4.782;加入 HuBERT 隐层平均池化蒸馏(\(\lambda_1=1\))后跃升至 6.082,证明自监督模型的高级音素表征有效弥补了自回归声学 token 的语义短板。
- 动态背景与极端特写鲁棒性:得益于定域音频交叉注意力与解耦身份约束,在雷雨、火焰等强烈背景动态干扰下,人物面部未发生漂移;在特写镜头下胡须肌理与牙齿微结构保持高保真,用户偏好调研得分达 4.46 / 5.0,大幅超越 EchoMimicV3 (4.02) 与 Hallo3 (3.64)。
亮点与洞察¶
- 去级联统一自回归架构:直接利用 LLM 的自回归生成能力驱动音视频双路解码,避免了传统 TTS \(\rightarrow\) Talking Head 级联带来的误差级联和额外延迟。
- 时间定域注意力约束:强制视频帧潜变量仅与当前时刻的音频调节特征发生交叉注意力交互,既杜绝未来音频泄漏保证了严格因果性,又大幅节省了注意力计算与显存占用。
- 滚动窗口 DMD 蒸馏迁移:将长视频扩散的滚动窗口去噪推演适配到图像驱动肖像生成中,结合锚定首块运动帧与参考帧的全局上下文机制,完美解决了流式自回归生成中的漂移问题。
局限与展望¶
- 单人说话人场景约束:当前模型专注于单说话人面部与半身生成,在多讲话人交叠、复杂对话轮替或背景人物交互场景下尚未建模。
- 计算资源开销与训练门槛:全流程涉及 3B 规模语言模型与 1.3B/5B 级扩散变换器的三阶段训练与蒸馏,依托 64 张 H800 GPU,中小规模团队复现与二次微调成本较高。
- 极端姿态下的微小瑕疵:当人物发生剧烈转身或大幅度俯仰时,基于二维参考肖像构建的外貌特征仍可能存在一定几何形变,未来可结合三维先验或轻量网格形变先验进行强化。
相关工作与启发¶
- vs OmniTalker / Ovi: OmniTalker 与 Ovi 采用独立并行的双扩散骨干,需要从零预训练整套音频扩散分支,数据与算力开销沉重,且交互时依然依赖外置 LLM。VoCa 创新地以成熟开源语音 LLM(Higgs-Audio)为内核,实现语言、语音与视频生成的一体化内生驱动。
- vs Hallo3 / EchoMimicV3 / FantasyTalking: 这类代表性肖像生成方法本质上是纯音频驱动的非自回归双向扩散模型,不支持流式交互生成,且必须先依赖高质量外部 TTS 供给语音。VoCa 通过引入因果掩码与滚动窗口 DMD 蒸馏,在匹配甚至超越其视觉与音唇对齐质量的同时,赋予了模型流式自回归生成的关键能力。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ [将自回归 LLM 共享表征与流式因果扩散滚动窗口去噪无缝融合,开创了音视频协同生成新范式]
- 实验充分度: ⭐⭐⭐⭐⭐ [在三大通用测试集、消融实验、极端特写与动态背景定性对比及用户偏好上评测十分详尽]
- 写作质量: ⭐⭐⭐⭐⭐ [逻辑架构清晰严密,从挑战、架构、三阶段训练到实验设计层层推进]
- 价值: ⭐⭐⭐⭐⭐ [为端到端实时流式数字人、智能语音助手身临其境对话提供了极具工程与学术价值的参考蓝图]