跳转至

Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length

会议: ECCV 2026
论文: ECCV 原文
代码: https://liveavatar.github.io/
领域: 人体理解 / 图像恢复
关键词: 音频驱动数字人、流式视频生成、无限长生成、扩散模型蒸馏、流水线并行

一句话总结

Live Avatar 针对 14B 参数大规模视频扩散模型,提出含噪历史缓存(History Corrupt)与时间步强迫流水线并行(TPP)的软硬件协同架构,首次实现了在 5 张 H100 上以 45.2 FPS 实时流式生成突破 10,000 秒且无漂移的超长高保真数字人视频。

研究背景与动机

音频驱动的数字人生成是交互式数字通信、虚拟现实与直播助手的核心技术。随着基于 DiT 架构的大规模扩散模型(如 Wan-S2V)在视频生成领域取得突破,合成肖像的视觉逼真度与微表情生动性达到了前所未有的高度。然而,面向低延迟人机双向交互的落地场景,必须同时满足三大严苛需求:实时吞吐率(\(\ge 24\) FPS)、即来即走的音频流式响应、以及无限时长下的长时间稳定性。现有扩散模型由于其固有的迭代去噪属性与自回归时序累积误差,在同时兼顾模型规模与长程推理时陷入了两难困境。

现存方案面临两大核心矛盾。第一是长程时序一致性与自回归累积误差的矛盾:主流流式视频生成通常将历史帧以自回归方式刷新至 KV Cache 中,模型不断以高频注意力关注先前生成的细节,导致微小伪影逐帧复合,在数分钟内便演变为毁灭性的身份漂移、颜色褪色或画面崩溃;即便是近期缓解曝光偏差的 Self-Forcing 技术,在长序列展开下仍会崩塌。第二是实时性与生成保真度的权衡:达到 14B 参数的大模型具备极其出色的视觉表现,但在单卡甚至普通并行下仅能达到 0.25 FPS,存在严重的顺序去噪时延瓶颈;而现存声称实时的系统大多通过将参数缩减至 0.2B 级别或放弃迭代去噪(采用简单面部拼接编辑),严重牺牲了画面动态与整体保真度。

面对这一矛盾,本文基于数字人交互场景下“人脸与背景相对静态、身份特征主要由参考肖像决定”的物理先验,提出了反直觉的关键洞察:长程自回归缓存并不需要保留精细的清晰纹理,而只需保留粗粒度的动态流。核心 idea:在自回归 KV Cache 中刻意保留含噪表征(History Corrupt)充当低通滤波器以切断误差累积,并借此解绑去噪时序依赖,提出时间步强迫流水线并行(TPP)将迭代采样重构为异步空间流水线,在 14B 大模型上实现 45.2 FPS 的无限长稳定生成。

方法详解

整体框架

Live Avatar 的整体方案涵盖两阶段模型适配算法(扩散强迫预训练与自强迫分布匹配蒸馏)以及推理期的系统级流水线并行。输入包含一段连续音频流与一张静态肖像参考帧(Sink Frame)。模型以 3 帧 Latent 为一个时序块(Block),在因果注意力机制下自回归地向前推进。在时序演进中,静态参考帧负责全局身份锚定,而滑动的 KV Cache 仅承载含噪运动线索。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入音频流 + 静态参考帧"] --> B["Stage 1: 动作帧脚手架预训练<br/>注入噪声辅助上下文解耦"]
    B --> C["Stage 2: 自强迫 DMD 蒸馏<br/>去噪步数压缩至4步"]
    C --> D["时序因果推理引擎"]
    D --> E["长程稳定性三支柱<br/>History Corrupt + AAS + Rolling RoPE"]
    E --> F["时间步强迫流水线并行 (TPP)<br/>GPU0-3 固定去噪步 + GPU4 异步VAE解码"]
    F --> G["45.2 FPS 实时流式高保真视频流"]

关键设计

1. 动作帧脚手架机制:两阶段低成本蒸馏加速 直接对 14B 扩散模型进行全时序 Rollout 的自强迫(Self-Forcing)蒸馏存在极高的显存开销与缓慢的收敛问题。作者发现 Stage 2 蒸馏中含噪 KV Cache 承载的运动引导作用,与前置运动帧在功能上高度对齐。因此在 Stage 1 扩散强迫预训练中,模型复用了 Wan-S2V 的冻结 FramePack 编码器,并对前序动作参考帧主动注入 Flow Matching 噪声作为脚手架训练信号。在 Stage 2 中直接撤除动作帧编码器并无缝替换为滑动 KV Cache,仅需 500 步 DMD 迭代即达到饱和,比无脚手架训练收敛速度提升了 5 倍。

2. 含噪历史缓存(History Corrupt):动态与身份的频域解耦 传统流式自回归生成依赖于每步生成后执行额外的干净前向刷新(Clean-Cache Refresh),将去噪后的清晰表征存入 KV Cache。然而,这恰恰是误差累积的元凶:微小的生成瑕疵被后续块的高频注意力捕捉并放大。Live Avatar 彻底摒弃干净缓存刷新,在 KV Cache 中全程维持含噪表征。高斯噪声在特征空间等效于低通滤波器,强力衰减了高频局部伪影的传播,同时保留了低频动作骨架。更重要的是,在高噪声能级下,潜变量边际分布 \(p_t(x_t)\) 收敛于高斯先验,位于紧致的特征空间中,天然杜绝了长程生成偏离真实流形的分布漂移。

3. 自适应注意力锚点与滑动 RoPE:消除长程偏置与坐标外推失真 为进一步支撑破万秒的超长生成,系统补充了两项关键设计: - 自适应注意力锚点(Adaptive Attention Sink, AAS):直接以现实拍摄的参考图像作为永久 Sink Frame 会带来真实数据分布与模型自身生成流形之间的微小分布偏差,长达数十分钟时会导致色彩褪色与灰化。AAS 在首个 Block 生成后,立即用模型自身合成的首个 Latent 替换原输入图作为持久 Sink,使条件输入与生成流形完美对齐。 - 滑动旋转位置编码(Rolling RoPE):长程推理会导致当前去噪块与参考帧之间的相对 RoPE 距离不断超出训练窗口。通过动态调整 Sink Frame 的相对时序偏移,使其与当前活动块的相对距离恒定在训练分布内,防止身份参考权重的逐渐脱水。

4. 时间步强迫流水线并行(TPP):打破顺序去噪瓶颈 针对 4 步少步数去噪 student 模型,传统并行方案由于单块序列较短,序列并行(SP)增益十分有限。本文基于“块与其索引的 KV Cache 保持同等噪声步数(Timestep-forcing)可彻底消除画面闪烁”的实验发现,提出了将时间步与物理硬件一一绑定的 TPP 架构。系统分配 4 张 GPU,每张卡永久绑定固定的去噪转换阶段 \(t_i \to t_{i-1}\),维持本地专享的含噪滑动 KV Cache,跨卡通信仅需传输极低带宽的压缩 Latent;第 5 张 GPU 专职承担带特征缓存的流式 3D VAE 解码。整个去噪链条演变为纯异步空间流水线,将推理吞吐由串行多步总耗时解绑为单步前向耗时,一举突破 45 FPS。

损失函数 / 训练策略

Stage 1 采用标准 Flow Matching 速度场回归损失: $\(\mathcal{L}_{\text{FM}} = \mathbb{E}_{x_0, t} \left\| v_\theta(x_t, t, c) - (x_1 - x_0) \right\|_2^2\)$ 在 Stage 2 中,采用基于分布匹配蒸馏(DMD)的对抗梯度引导: $\(\nabla_\theta \mathcal{L}_{\text{DMD}} = \mathbb{E}_{t, z} \left[ s_{\text{real}}(x_t) - s_{\text{fake}, \phi}(x_t) \right] \frac{\partial \hat{x}}{\partial \theta}\)$ 其中教师真实评分 \(s_{\text{real}}\) 与假样本判别评分 \(s_{\text{fake}, \phi}\) 均基于 14B Wan-S2V 权重初始化,学生生成器与假评分网络交替更新,通过 4 步离散采样轨迹上的随机中间态构造无偏蒸馏梯度。

实验关键数据

主实验

论文构建了包含短视频评测集 GenBench-ShortVideo(100 个 10 秒样本)与极富挑战的长视频评测集 GenBench-LongVideo(15 个 5 分钟以上样本,含真人、动漫、拟人非人及不同景深姿态)。指标涵盖图像美学(ASE)、感知质量(IQA)、音画同步性(Sync-C / Sync-D)、身份保持度(Dino-S)及吞吐率(FPS)。

数据集 模型 ASE ↑ IQA ↑ Sync-C ↑ Sync-D ↓ Dino-S ↑ FPS ↑
GenBench-ShortVideo Ditto [23] 3.31 4.24 4.09 10.76 0.99 21.80
Echomimic-V2 [32] 2.82 3.61 5.57 9.13 0.79 0.53
Hallo3 [6] 3.12 3.97 4.74 10.19 0.94 0.26
StableAvatar [40] 3.52 4.47 3.42 11.33 0.93 0.64
OmniAvatar [12] 3.53 4.49 6.77 8.22 0.95 0.16
WanS2V [13] (教师基座) 3.36 4.29 5.89 9.08 0.95 0.25
Live Avatar (本文) 3.44 4.51 7.03 8.30 0.96 45.20
GenBench-LongVideo Ditto [23] 2.90 4.48 3.98 10.57 0.97 21.80
Hallo3 [6] 2.65 4.04 6.18 9.29 0.83 0.26
StableAvatar [40] 3.00 4.66 1.97 13.57 0.94 0.64
OmniAvatar [12] 2.36 2.86 8.00 7.59 0.66 0.16
WanS2V [13] 2.63 3.99 6.04 9.12 0.80 0.25
Live Avatar (本文) 3.42 4.76 7.16 8.31 0.97 45.20

消融实验

1. 推理效率与系统流水线消融(Table 3 原文对应) 对比在单卡基线、序列并行(SP4)、时间步流水线并行(TPP)、独立 VAE 异步解码与底层算子优化(FP8、FA-3、编译加速)下的收益表现:

配置阶段 GPU 数 NFE 步数 FPS ↑ 首帧延迟 TTFF (s) ↓ 核心说明
基线原始模型 (WanS2V) 1 80 0.29 45.50 顺序全步长去噪,极慢
+ DMD 4步蒸馏 1 5 3.66 4.56 4步去噪 + 1步干净缓存前向刷新
+ 序列并行 (SP4) 4 5 4.50 3.94 块内序列过短,多卡收益微弱
+ TPP 并行 (本文) 4 4 10.16 4.73 消除刷新步 (NFE 5→4),去噪流水分摊
+ VAE 异步并行 5 4 20.88 2.89 剥离耗时大户解码算子
+ 算子级深度优化 (完整模型) 5 4 45.20 1.21 FP8量化 + FlashAttention-3 + Fused Kernels

2. 长程稳定性机制消融(GenBench-LongVideo,Table 4 对应)

消融配置 ASE ↑ IQA ↑ Sync-C ↑ Dino-S ↑ 视觉退化现象
完整模型 (Ours) 3.42 4.76 7.16 0.97 超过数千秒稳定清晰无漂移
去除 History Corrupt (使用干净缓存) 2.90 3.88 7.14 0.81 误差高频累积,面部结构几分钟内塌陷
去除 Rolling RoPE 3.38 4.82 7.29 0.86 相对位置外推失效,五官与发型剧烈漂移
去除 AAS (使用输入图像作为持久Sink) 3.13 4.68 7.25 0.96 真实图与模型流形偏差积累,出现泛灰掉色

关键发现

  • 含噪缓存打破了流式生成的魔咒:Table 4 显示,剥离 History Corrupt 会导致身份相似度 Dino-S 从 0.97 骤降至 0.81,IQA 从 4.76 崩塌至 3.88,证明干净缓存刷新带来的高频记忆累积正是自回归长程崩溃的最核心病灶。
  • 超长时段生成无损泛化(Train-Short-Infer-Long):模型仅在约 3 秒(84 帧)的短切片上训练,却能在推理期稳定外推突破 10,000 秒,且短视频与长视频的各维质量指标几乎无损(ASE 3.44 vs 3.42,Dino-S 0.96 vs 0.97)。
  • 时间步同频显著抑制频闪:如论文 Table 6 所示,相比于固定噪声或清晰缓存,将当前块去噪等级与它所引用的 KV Cache 噪声步数强制同频(Timestep-forcing),将时序闪烁度(T.Flicker)从 0.876/0.891 大幅提升至 0.971。

亮点与洞察

  • 反直觉的“劣质”特征优势:传统认知倾向于维护高精度的历史缓存以追求时序保真,而本文敏锐利用了人脸交互的静态强先验,证明注入高斯噪声的“有损”缓存反而能充当低通滤波器切断累积误差,这一物理直觉极具启发性。
  • 软硬件协同的优雅解耦:Timestep-forcing 不仅是一个提升时序平滑度的算法设计,更在工程上成为了完美的并行切分点——每张 GPU 维护本地专属的含噪 KV Cache,跨卡通信仅流转极小维度的 Latent,将串行算法成功映射为高吞吐空间流水线。
  • 极小代价的大模型蒸馏:借助动作帧脚手架(Scaffolding)机制,使 14B 参数庞大体量的 DMD 蒸馏仅需 500 步即可收敛饱和,大幅降低了大规模自回归视频模型的训练算力门槛。

局限与展望

  • 强依赖静态场景先验:论文提出的解耦机制建立在肖像面部运动、背景相对静止的前提下,难以直接迁移至涉及机位剧烈运镜、复杂全身动作或高动态场景的开放领域视频流式生成中。
  • 交互端到端首帧延迟仍有瓶颈:尽管吞吐率达到了充裕的 45.2 FPS,但首帧渲染耗时(TTFF)为 1.21 秒,加上网络传输与前端缓冲后整体往返延迟约 3 秒,对于超低延迟的双工口语对话互动仍有压降空间。

相关工作与启发

  • vs OmniAvatar / Wan-S2V:Wan-S2V 与 OmniAvatar 具备极强表征能力,但在长程序列下因误差累积,Dino-S 显著崩塌至 0.80 与 0.66,且生成速度不足 0.3 FPS;Live Avatar 不仅保持了满分级的长程保真度,还将推理帧率提升了两个数量级。
  • vs Ditto:Ditto 借助轻量化人脸变形网络实现 21.8 FPS,但缺乏全画面的自适应扩散生成能力,在音画同步率(Sync-C 4.09 vs 7.03)与背景动态融合上远落后于 Live Avatar。
  • vs Self-Forcing / CausVid:以往流式自回归蒸馏必须执行每步额外开销的干净缓存刷新(Clean-Cache Refresh),引入了 NFE 负担并不可避免地带来长程漂移;Live Avatar 的 History Corrupt 不仅免去了这一额外前向计算,更系统性消除了曝光漂移。

评分

  • 新颖性: ⭐⭐⭐⭐⭐(巧妙利用有损含噪缓存实现误差切断,协同设计了时间步固定流水线并行,思路开创性强)
  • 实验充分度: ⭐⭐⭐⭐⭐(自建五分钟以上超长合成测试集 GenBench,细致拆解长程三大退化病灶,系统消融与万秒验证完备)
  • 写作质量: ⭐⭐⭐⭐⭐(逻辑严密自洽,问题定义清晰,软硬件映射阐述极其明了)
  • 价值: ⭐⭐⭐⭐⭐(首次让 14B 级超大视频扩散模型落地于实时流式交互场景,对下一代实时具身数字人工业化部署具有重大指导意义)