跳转至

JAM-Flow: Joint Audio-Motion Synthesis with Flow Matching

会议: ECCV2026
论文: ECCV 原文
领域: 视频生成 / 音频语音
关键词: 音-动联合生成, 流匹配, 说话头生成, 零样本语音合成, 多模态扩散 Transformer

一句话总结

JAM-Flow 把 LivePortrait 的低维嘴部表情关键点与 F5-TTS 的梅尔谱当成同一个流匹配框架下两个可互相遮罩的模态,用半量共享注意力的双流 MM-DiT、RoPE 时序对齐和模态非对称注意力掩码联合训练,一个约 500M 的模型同时覆盖说话头生成、TTS、动作→音频与自动配音,20 秒视频在单张 RTX A6000 上 45 秒生成。

研究背景与动机

人脸视频合成与语音合成这两年各自都走得很远,却是两条几乎不相交的线。说话头生成一侧,GAN 系方法(SadTalker、LivePortrait)靠显式的运动表示和 warping 做到了近实时,扩散系方法(Hallo、AniPortrait、X-Portrait、OmniHuman)保真度更高,但代价是 20 秒视频要跑 7 到 30 分钟,且长序列容易出现时域闪烁。语音一侧,从 Tacotron 到非自回归的 FastSpeech、再到 VoiceBox 这样的扩散式零样本克隆,直到 F5-TTS 用流匹配把非自回归 TTS 的 WER 压到 2.42%,同样已经很成熟。问题在于,这两个方向的系统都是各自独立的 pipeline,中间靠一串音频文件或视频文件级联。

而真实说话这件事本身是双向耦合的:嘴唇、脸颊、下颌的运动并不只是"配上去的画面",它本身就是语言的一部分,语音的韵律也反过来由表情承载。现有做法里,说话头模型一律把音频当作单向条件(audio→visual),而 TTS 系统对面部动态完全无感。级联两套系统的代价不只是延迟叠加和误差累积,更关键的是这类架构根本表达不了反向的关系——给定一段已经拍好的口型动作去生成与之匹配的语音,传统 TTS 无从下手,因为它的条件里没有视觉这一路。

本文的切入角度是:不从零训一个统一的大视频生成模型,而是复用两个已经很强的单模态预训练模型,让网络集中去学它们之间那层耦合关系。LivePortrait 提供紧凑的隐式关键点表示和高效的 warping 渲染,F5-TTS 提供梅尔谱上的条件流匹配生成能力,两者用一套"inpainting 式"的随机遮罩监督焊在一起。核心 idea:把面部动作(只建模 LivePortrait 21 个表达维度中控制嘴型的 4 维)与梅尔谱都当成可遮罩的补全任务,用部分层融合的双流 MM-DiT 加模态非对称注意力掩码联合训练,使同一个模型在任意子集输入下互相条件地生成语音与口型。

方法详解

整体框架

目标是:给定文本、参考音频、参考动作这三路条件的任意子集,同时生成时间对齐的梅尔谱与面部运动。整体是一个双流扩散架构:Motion-DiT 在 LivePortrait 的表达形变空间里生成嘴部关键点 \(\mathbf{e}_{\text{mouth}} \in \mathbb{R}^{T_{\text{frame}}\times 4\times 3}\),Audio-DiT 生成梅尔谱 \(\mathbf{a}_{\text{mel}} \in \mathbb{R}^{T_{\text{mel}}\times d_{\text{mel}}}\);两路 token 只在部分 transformer 层通过联合注意力交换信息,其余层保持模态专属。训练时两路输入被随机遮罩,模型用条件流匹配(Conditional Flow Matching, CFM)去补全被遮掉的部分;推理时通过控制"哪些输入不被遮"来切换任务——只给文本是联合生成,给文本加参考音频是零样本克隆,给参考动作是动作→音频,给视频加文本就是自动配音。生成结果最后交给两个现成解码器:梅尔谱经 Vocos 解码成波形,嘴部关键点与固定身份、姿态特征一起送进 LivePortrait 解码器 warp 出视频帧。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["文本 / 参考音频 / 参考动作"] --> B["Inpainting 式联合监督<br/>随机遮罩 + 两阶段训练"]
    B --> C["低维嘴部关键点<br/>只生成 4 维嘴型形变"]
    B --> D["Audio-DiT<br/>梅尔谱 CFM 分支"]
    C --> E["半量联合注意力<br/>双流 MM-DiT"]
    D --> E
    E --> F["RoPE 时序对齐<br/>模态非对称注意力掩码"]
    F --> G["Vocos 解码器 / LivePortrait 解码器"]

关键设计

1. Inpainting 式联合监督:把两个模态都变成"补全任务",跨模态依赖由训练目标自己逼出来

最朴素的做法是分别训好两个单模态模型再级联,但那样跨模态信息只能在推理时通过一个接口单向传递,模型本身学不到联合分布。本文把 F5-TTS 里"语音生成即 mask-and-predict"的 inpainting 思路同时施加到两个模态上:训练时随机遮掉一段梅尔谱、随机遮掉一段动作序列,且遮罩模式是变化的——有时只遮动作、有时只遮音频、有时两者都遮,模型只能依靠剩余的上下文去补全。两路都用同一个条件流匹配目标:给定配对样本 \(x_0\)(先验端)与 \(x_1\)(数据端),在线性插值路径上回归目标速度 \(x_1-x_0\)

\[\mathcal{L}_{\text{CFM}}(\theta)=\mathbb{E}_{t,\,x_0,\,x_1}\left[\left\|v_\theta(x_t,t)-(x_1-x_0)\right\|^2\right],\qquad x_t=(1-t)\,x_0+t\,x_1\]

(原文式 (1)–(4) 在缓存里渲染有缺损,此处按正文对线性插值路径与目标速度的描述重建,⚠️ 以原文为准。)总损失是音频、动作两路 CFM 损失之和。

这样设计的直接后果是:想补全被遮掉的音频,模型必须去读没被遮的动作,反之亦然——"互相条件"不是额外挂上去的模块,而是被训练目标逼出来的行为。更实用的一点是,因为遮罩模式在训练时就是随机的,推理时"给定全部音频生成动作""只给动作生成音频""只给文本全生成"都落在同一个条件分布之内,不必为每个任务单独改架构或换 head。作者称这是第一个把 inpainting 式联合监督用在两个模态同时生成上的框架。

2. 低维嘴部关键点:先分析预训练表征,再把生成空间砍到 4 维

这条设计不是来自网络结构,而是来自对已有表征的观察。LivePortrait 的运动编码器为 21 个规范关键点输出 3D 表达形变 \(\mathbf{e}\in\mathbb{R}^{21\times 3}\),本文逐维可视化这个空间,发现其中约 4 个维度稳定地控制嘴部区域:只扰动这 4 维,唇形随之改变;把其余维度冻结,画面其他部分不动。于是 Motion-DiT 只负责生成这部分 \(\mathbf{e}_{\text{mouth}}\subset\mathbf{e}\)(4 维 × 3 个坐标),其余 17 维 \(\mathbf{e}_{\text{rest}}\) 当作已知条件直接喂进去,再与身份特征、姿态参数一起交给解码器渲染。

把"要生成的东西"从整帧图像降到这个小子空间,是它能近实时运行的根本原因:一段 25 fps、20 秒的视频,需要生成的量是 \(500\times 4\times 3=6000\) 个标量,而像素空间的扩散模型要在同样时长里生成 500 帧高分辨率画面。附带的收益是身份保持——视频帧是从源帧 warp 出来的,外观没有被重新生成,因此不会像像素扩散那样在长序列里漂移。作者在讨论中也提到,compact keypoint warping 不但省算力,还比 Hallo/Hallo3 这类扩散说话头方法更少闪烁。

3. 半量联合注意力的双流 MM-DiT:融合跨模态信息,又不让两路互相洗掉各自的先验

MM-DiT 的常见做法是每个模态一条 DiT 分支,在全部层上做对称的联合自注意力。本文只在 \(N_{\text{joint}}\) 层(实验中取总层数的一半,即 11 层)把两路 token 拼起来做联合注意力,并且融合层放在较浅的位置,其余层各算各的。这样 Audio-DiT 依然保留 F5-TTS 的语音先验、Motion-DiT 保留动作先验,跨模态信息只在浅层注入,两类表征不会被均匀地"混"成一种模态无关的表示。消融里全层联合(22 层)的数值略好(LSE-C 4.81 对 4.64),但训练不稳定、算力开销大得多,半量融合在几乎同等的质量下明显更实用。

这条设计还有一个同样重要的前置条件——两路分支的初始化。Audio-DiT 直接采用预训练的 F5-TTS;Motion-DiT 先在 CelebV-Dub 上按说话头生成的常规做法(把 wav2vec2 特征拼到动作输入)从零训到收敛,然后才接上联合注意力。作者的实验结论是:必须先在各自模态里训好,跨模态关系才学得动。而且联合阶段必须让 Audio-DiT 一起解冻微调——冻住它虽然 WER 略好(6.76% 对 7.28%),同步指标却明显变差,因为 Motion-DiT 只能单方面去迁就一个不动的音频分布,学不出真正的联合分布,只有两个模态通过共享注意力共同适应,才能得到既同步又连贯的输出。

4. RoPE 时序对齐与模态非对称注意力掩码:让两个长度不同、感受野不同的模态真正对上

这是全文最新颖的一处架构设计。两个难点叠在一起:其一,两路 token 数不同(梅尔谱按音频帧率、动作按视频帧率),位置索引的尺度不一致,直接做联合注意力时 query 和 key 的旋转角对不上;其二,两个模态各自的生成过程需要的感受野截然不同——面部运动几乎只取决于相邻几帧,而语音的韵律依赖整句话的上下文。以往的多模态 transformer 对两路用的是对称注意力,这里行不通。

本文对 RoPE 做了一个很轻的归一化对齐:位置索引 \(p\) 处的旋转角改写为

\[\phi(p,d)=\frac{p}{L}\cdot L_{\text{ref}}\cdot\theta_d,\qquad L_{\text{ref}}=\max(L_a,L_m)\]

其中 \(L\) 是本模态的序列长度。这样两个模态在同一时间步上落到可比的角度尺度上,尽管序列长度相差很大。作者说改动虽然朴素却不可或缺——去掉它联合训练完全不收敛,因此消融表里根本没有对应的一行。

掩码则按模态的功能角色分别定制:动作 token 只用局部窗口内的自注意力(对应"面部运动只依赖邻近帧"的归纳偏置),动作→音频的注意力同样限制在对应的局部窗口内,而音频→音频的自注意力在动作生成时被关掉;反过来,音频 token 保留贯穿整句的全局自注意力,跨模态注意力只允许看同一时间戳上的动作 token,动作→动作的自注意力被完全屏蔽。合起来的效果是:每个模态按最符合自己生成过程的方式去 attend,而跨模态的通道被严格限制在"同一时刻"。去掉这些掩码后唇同步质量会急剧下降,作者观察到模型常常根本学不出连贯的联合行为,输出出现时域漂移或不同步;据他们所知,还没有前人工作为联合注意力设计过这种非对称的、模态专属的掩码。

一个完整示例:一段无声驱动视频到带声配音

输入是一段 20 秒、25 fps 的无声说话视频(V2V 设置),文本是待配的台词。系统先逐帧抽出 17 个非嘴部表达关键点作为 \(\mathbf{e}_{\text{rest}}\),并把它当作"线索"(沿用 [79] 的做法)保持不被遮罩。前向过程里,动作分支在这 500 帧上跑 CFM,只生成每帧 \(4\times 3\) 维的嘴部形变,合计 \(500\times 4\times 3=6000\) 个标量;音频分支在同一条时间轴上跑 CFM 生成对应的梅尔谱。两路之间的联合注意力只发生在 11 个浅层,且音频 token 只能看到同一时间戳上的动作 token、动作 token 只能看到邻近窗口内的音频 token。生成结束后,嘴部形变与 \(\mathbf{e}_{\text{rest}}\)、身份特征、姿态参数一起送进 LivePortrait 解码器 warp 出 500 帧画面,梅尔谱交给 Vocos 解码成波形,整段流程在单张 RTX A6000 上约 45 秒。

损失函数 / 训练策略

训练分两阶段。Stage 1 准备单模态预训练模型:Audio-DiT 直接取 F5-TTS;Motion-DiT 从零训练,按说话头生成的常规做法以 wav2vec2 音频特征为条件。Stage 2 接上联合注意力层、施加 RoPE 对齐,两路一起训练,梯度通过共享注意力层跨模态流动;这一阶段 wav2vec2 特征不再使用——文本条件改由 Audio-DiT 注入,Motion-DiT 的输入变成 \(\mathbf{e}_{\text{rest}}\) 加音频分支的中间特征 \(f_{\text{audio}}\)

两个阶段都使用同一个 CFM 目标,总损失为音频与动作两路损失之和,训练时对两路输入施加随机遮罩(只遮动作 / 只遮音频 / 两者都遮)。作者没有采用任何扩散蒸馏,并认为推理速度还有继续压缩的余地。

实验关键数据

训练数据为 CelebV-Dub(由 CelebV-HQ 与 CelebV-Text 过滤而来),联合训练使用成对音视频数据;评测在 CelebV-Dub 测试划分与 HDTF 上进行。指标中 FID/FVD 衡量画面质量与时域一致性,LSE-C(越高越好)与 LSE-D(越低越好)是 SyncNet 给出的唇音同步置信度与距离,WER 为词错率,SIM-o 与 spkSIM 衡量生成语音与参考音色的相似度。

主实验

表 1 说话头生成对比(HDTF,推理时间按单卡 RTX A6000 生成 20 秒视频计)

方法 FID ↓ FVD ↓ LSE-C ↑ LSE-D ↓ 推理 (20s) ↓ 参数量
Ground Truth - - 8.70 6.597 - -
SadTalker 22.340 203.860 7.885 7.545 2.5 min(含 GFPGAN) ~200M
DreamTalk 78.147 890.660 6.376 8.364 - -
AniPortrait 26.561 234.666 4.015 10.548 7 min ~1B
Hallo 20.545 173.497 7.750 7.659 23 min 1–3B
Hallo3 20.359 160.838 7.252 8.106 30 min(H100) 1–3B
Ours-Stage1 18.372 194.27 7.138 7.947 - -
Ours (I2V) 17.571 192.30 7.324 7.777 45 sec ~500M(联合)
Ours (V2V) 11.633 25.07 8.086 7.181 45 sec ~500M(联合)

表 2 文本到语音(LibriSpeech-PC test-clean)

方法 WER ↓ SIM-o ↑
CosyVoice 3.59% 0.66
FireRedTTS 2.69% 0.47
E2 TTS 2.95% 0.69
F5-TTS 2.42% 0.66
MegaTTS 3 2.31% 0.70
Ours 4.91% 0.64

表 3 自动视频配音(CelebV-Dub)

方法 LSE-C ↑ LSE-D ↓ WER ↓ spkSIM ↑
Ground Truth 6.73 7.44 4.15% -
Zero-Shot TTS 2.78 11.68 3.83% 0.316
HPMDubbing 6.36 7.80 24.06% 0.146
StyleDubber 3.78 10.40 9.48% 0.264
VoiceCraft-Dub 6.05 8.33 7.01% 0.333
Ours 3.43 10.56 6.39% 0.410

表 4 消融:联合注意力层数、动作注意力掩码、Audio-DiT 是否微调

联合注意力层 注意力掩码 微调 Audio-DiT FID ↓ LSE-C ↑ LSE-D ↓ WER ↓ SIM-o ↑
22(全层) 5.759 4.81 8.40 6.88% 0.62
11(半量) 5.735 4.64 9.07 7.25% 0.62
11(半量) 5.748 6.44 7.99 7.93% 0.61
11(半量) 5.747 5.76 8.22 6.76% 0.63
11(半量) 5.662 6.45 7.73 7.28% 0.64

消融中的 LSE-C/LSE-D 用生成动作配真值音频计算(生成音频会让 SyncNet 指标不稳定),WER 与 SIM-o 则同时使用生成的音频和动作。

关键发现

  • 联合训练相比单向的 Stage-1 模型有实质增益。Ours-Stage1 是仅用 wav2vec2 条件、按常规音频驱动方式训练的单模态动作分支,其 FID 18.372 / FVD 194.27 与 I2V 的 17.571 / 192.30 接近,但 V2V 设置下 FID 降到 11.633、FVD 骤降到 25.07、LSE-C 升到 8.086——换用联合框架后同一模型在同步与画质上同时改善,这正是 inpainting 式联合监督价值的直接证据。
  • RoPE 对齐是"生死线"级别的设计。作者明确说去掉它联合训练完全不收敛,所以消融表里没有对应行;这不是"掉一两个点"的组件,而是训练能否进行的前提。
  • 注意力掩码的作用被数字低估了。表 4 中加上掩码(11 半量、✗微调 → ✓微调)使 LSE-C 从 4.64 升到 6.45,但作者强调在原始分数之外,去掉掩码时模型常常学不出连贯的联合行为,输出时序漂移——主观退化比数值退化严重得多。
  • 全层联合注意力不划算。22 层版本的 LSE-C 4.81 略高于半量的 4.64,但训练不稳定且算力开销大得多,作者选择半量融合作为性能与效率的折中。
  • Audio-DiT 必须解冻,但它带来一个 WER 与同步的权衡。冻结 Audio-DiT 时 WER 更好(6.76% 对 7.28%),但 LSE-C 从 6.45 掉到 5.76;解冻后两个模态可以共同适应共享注意力层,同步与连贯性明显更好。
  • TTS 指标落后可归因于监督数据而非容量。CelebV-Dub 的文本是 Whisper 生成的伪标注,而 Whisper-base 在 LibriSpeech-PC 上的 WER 就是 4.50%,与本文观测到的约 4.9% 十分接近,说明词错率主要由标签噪声而非模型能力决定;音轨本身还经过 Spleeter 源分离,带有标准 TTS 语料中不存在的伪影。
  • 联合训练带来了超出显式监督的涌现行为。作者观察到微笑的动作倾向于生成更亮、更高音调的语音(没有任何情绪监督),以及自然的停顿与语气转换,说明模型学到的不只是时间戳级别同步,还包括跨模态的韵律对齐。另一个有趣的现象是非对称适应:同时生成音频与动作时,模型倾向于保持视觉运动基本不动、而更大幅度地调整音频去匹配给定动作,这可能是视觉动作比音频更难改动的结果,实际效果是帮助维持身份一致性。
  • 在自动配音上拿到最高说话人相似度。在这个并非专门优化的任务上,本文的 WER 6.39% 优于 VoiceCraft-Dub 的 7.01%,spkSIM 0.410 是所有方法中最高的;但 LSE-C/LSE-D 与 Zero-Shot TTS 处于同一水平,明显弱于 HPMDubbing 和 VoiceCraft-Dub——作者提醒 SyncNet 类指标在编解码变化和 TTS 生成音频下不稳定,不宜过度解读。用户研究中本文相对 VoiceCraft-Dub 取得 62.6% 对 37.4% 的偏好,其他基线未获投票;HDTF 的用户研究里 V2V 与 I2V 两个变体被评为总体质量前两名。

亮点与洞察

  • 用"分析已有表征"来设计生成空间,是这篇论文最漂亮的一手。它没有动网络结构,而是先可视化 LivePortrait 的表达形变空间、确认 21 维里约 4 维控制嘴部,然后直接把 Motion-DiT 的生成目标砍到 \(4\times3\) 维。生成空间的维度是效率的前提,这个判断来自观察而非搜索,任何要复用预训练运动表征的工作都可以照搬这个流程。
  • 模态非对称掩码把"两个模态该怎么互相看"显式写进了归纳偏置。以前的多模态 transformer 默认两路对称 attend,这里指出运动只该看邻近窗口、语音该看整句、跨模态只该看同一时刻,三个约束各自对应一个生成过程的物理性质。这个思路可以迁移到任何两个采样率或时间尺度不同的模态对(视频+音频、视频+深度)。
  • "不训大模型,只学耦合"是一条被验证可行的替代路线。Audio-DiT 直接初始化自 F5-TTS、渲染交给 LivePortrait 的 warping 解码器,本文只新训了运动分支和一层薄薄的联合注意力,就拿到了 45 秒 / 20 秒的推理速度;这提示在多模态生成里,把算力花在"接口"上可能比堆在"主干"上更划算。
  • inpainting 式联合监督同时解决了训练信号和推理灵活性两个问题。随机遮罩让"部分输入缺失"成为训练分布内的常见情形,于是推理时不需要任何 task-specific 的架构改动或分支切换——一个模型天然支持文本生成、零样本克隆、动作驱动、视频配音四种用法。这种"用训练目标换来零成本多任务"的模式值得在其他条件生成任务里复现。

局限与展望

  • 作者承认的局限主要来自数据与算力:CelebV-Dub 的文本是 Whisper 伪标注、音轨来自源分离,错误直接进入监督信号;LivePortrait 把可建模的运动限制在面部区域,头部姿态与身体不在范围内。他们建议改用更干净的数据与更强的视频扩散主干来扩展框架。
  • 从评测本身看,表 1 里 V2V 的 FVD 25.07 与其他方法 160–890 的差距需要谨慎归因:V2V 是从驱动视频逐帧 warp 出来的,外观几乎全部来自源帧,与那些在像素空间从零合成的扩散方法(Hallo/Hallo3/AniPortrait)不同源,画质与一致性上的巨大优势里有多少来自生成能力、有多少来自"几乎没有生成",论文没有拆开。I2V 设置下 FVD 192.30 与 Hallo3 的 160.838 相比其实略逊,这个对比更接近同源比较。
  • 缺少一个严格意义上的对照实验:"联合模型"对比"分别训练 TTS 与说话头模型再级联"。表 1 的 Ours-Stage1 只是用 wav2vec2 条件训练的音频驱动单模态分支,既不是独立的 TTS 基线,也没有配对的级联系统,因此"联合训练优于分开训练"这一核心主张的直接证据仍然偏弱。
  • 表 2 与表 4 之间对 Audio-DiT 是否微调的结论需要 readers 自己对照:微调带来的 WER 退化(6.76%→7.28%)与本就在数据噪声下偏高的绝对 WER 叠加,使本文的 TTS 数字与专用系统(2.31%–3.59%)差距不小,论文用标签噪声解释这一差距,但没有训练一个在同样 Whisper 伪标注数据上的 F5-TTS 对照组来直接量化数据的贡献。
  • 文本→音频+动作这一主打的联合生成场景中,说话人身份是随机采样的,论文没有给出身份控制或身份一致性的定量评测;跨模态评测也高度依赖 SyncNet 类指标,而作者自己指出这些指标在生成音频上不稳定,等于主要结论的一部分落在了不可靠的度量上。
  • 可改进的方向包括:用人工转写或更干净的配音数据重训以释放 WER;把 warping 解码器换成轻量视频扩散主干以扩展面部以外的运动范围(代价是失去当前的实时性);对两路 CFM 做蒸馏以进一步压缩采样步数;把 inpainting 式联合监督推广到 depth+video、audio+video 等其它模态对。

相关工作与启发

  • vs F5-TTS:F5-TTS 是单模态 CFM 的零样本 TTS,也是本文 Audio-DiT 的初始化来源。本文沿用了它的 mask-and-predict 形式化,但把遮罩机制从音频内部扩展到"另一整个模态",并解冻它参与联合训练。代价是 WER 从 2.42% 退到 4.91%,换来的是同一模型具备了唇音同步与动作条件生成能力——这更像是一次能力交换而非纯性能改进。
  • vs MM-DiT(SD3 / Flux / CogVideoX):这些工作用每模态一条 DiT 分支加全层对称联合注意力做多模态生成,但都是"一侧生成、另一侧作为条件"或者图文这种天然非对称模态。本文把联合注意力改成部分层融合并加上模态专属的非对称掩码,且首次用 inpainting 式联合监督同时合成两个模态——这是它区别于既有 MM-DiT 路线的两个点。
  • vs 扩散说话头方法(Hallo / Hallo3 / AniPortrait / OmniHuman):它们在像素空间以音频为单向条件生成视频,质量高但推理需要 7–30 分钟,长序列还会闪烁。本文改在紧凑关键点空间生成、再用 warping 还原像素,因此推理快一个数量级、身份稳定;代价是运动被限制在 LivePortrait 能表达的范围内,复杂场景与大幅度表情的表现力不及扩散主干。
  • vs LivePortrait:LivePortrait 是视频驱动的重演框架,本身不产生音频,它在这里的角色是被复用的运动表示与渲染后端。本文对它的贡献是反过来的——证明它的表达形变空间里存在一个 4 维的嘴型子空间,这个子空间恰好小到可以被实时生成。
  • vs VoiceCraft-Dub / HPMDubbing 等自动配音工作:那类方法专注"给定视频合成对齐的语音",通常需要额外的时长或风格控制模块。本文没有为配音做任何专门优化,仅靠 inpainting 框架下"动作不被遮、音频被遮"这一自然配置就得到该能力,WER 与 spkSIM 表现不错,但唇音同步指标反而落后——说明这种涌现能力的可用边界还需要更可靠的评估手段来界定。

评分

  • 新颖性: ⭐⭐⭐⭐ [首个把 inpainting 式联合监督用于音频-动作同时生成的框架,模态非对称注意力掩码与 RoPE 长度归一化对齐是原创的架构贡献;但主干与解码器均复用已有模型]
  • 实验充分度: ⭐⭐⭐ [覆盖说话头、TTS、配音三条任务线并有消融,但缺少"联合 vs 分别训练+级联"的严格对照,配音任务的关键指标依赖作者自己都不信任的 SyncNet 度量]
  • 写作质量: ⭐⭐⭐⭐ [动机与设计动机交代清楚,对指标失效与数据噪声的讨论相当坦诚;部分公式在缓存/预印本渲染中缺损]
  • 价值: ⭐⭐⭐⭐ [给出了一条"复用预训练单模态模型 + 轻量耦合层"的实用路线,45 秒/20 秒的推理速度对实时数字人应用有直接意义]