跳转至

SignRefine: Adapting Foundational Video Models for Sign Language Generation

会议: ECCV 2026
论文: ECCV 原文
代码: https://cogvis-cvssp.github.io/papers/signrefine/
领域: 人体理解
关键词: 手语视频生成, 基础视频扩散模型, 局部空间适配器, 空间接地, NVSign数据集

一句话总结

针对通用视频扩散模型生成手语时手部和面部微小区域严重模糊失真的痛点,SignRefine 通过在冻结的 DiT 主干中引入带有 CoordConv 空间感知与注意力掩码机制的独立区域适配器,实现了高保真、可理解的手语视频生成。

研究背景与动机

手语是全球听障群体最主要的沟通工具,由于绝大多数手语缺乏广泛通用的文字书写体系,高质量的连续手语视频合成对于听障无障碍信息获取至关重要。近年来,基于 Diffusion Transformer(DiT)的基础视频生成模型取得了飞跃式进展,能够生成高度拟真且时空连续的人体运动视频。然而,现有通用视频扩散模型在直接应用于手语生成任务时几乎全部失效:手语对双手的精细指关节动作以及面部的细微表情(如口型、挑眉)有着极高的语义精确度要求,但这些关键发音器官在全画幅中所占像素比例往往不足 15%,在基于 VAE 的时空潜空间下被粗暴下采样压缩,其细粒度特征完全被全局均方误差重构目标淹没,即便引入全局骨骼姿态控制,也依然会合成出指节缺失、交叠粘连或面部瘫软的伪影,导致听障读者完全无法理解。

手语视频生成长期存在两难困境:传统专用手语生成模型(如基于 GAN 或小型扩散模型的方法)完全从头训练,严重依赖于单人机位或电视新闻手语翻译等人工受限数据集,不仅生成分辨率低、极易过拟合到特定说话人,而且无法泛化到真实复杂场景与多姿态视点;而开源的基础视频模型虽具备极强的视觉先验和泛化能力,却因训练集大多为口语日常视频而欠缺细粒度肢体动力学建模。更为根本的数据症结在于,过往主流手语数据集几乎全部来自录播棚同传手语,缺乏天然母语手语者在自然交际中的多方互动、语篇标记与视角切换,视觉环境单调乏味。

本文切入的角度是:不必推翻重训通用视频大模型,而是最大化保留基础 DiT 的强先验与泛化性,在冻结主干的同时显式拆分视觉发音通道,通过高分辨率局部空间适配器向潜空间精准注入引导信号。核心 idea:将手语的非手动(面部)与手动(双手)信号解耦为独立的高分辨率条件流,结合 CoordConv 绝对全局坐标感知与带 Sink Token 的注意力掩码机制,以区域加权扩散损失精准引导冻结 DiT 块的细粒度重构。

方法详解

整体框架

SignRefine 以参考图像(定义手语者外观)和全身 2D 骨骼关键点序列(定义全局运动)作为基础条件输入,驱动冻结的 Wan2.1-1.3B-Fun-Control DiT 主干网络。为了解决手部与面部细粒度解剖结构失真问题,系统从全局骨骼序列中分别裁剪出面部、左手和右手的高分辨率(\(256 \times 256\))局部关键点视频,并通过三路独立的局部条件编码器提取时空运动特征。为了赋予局部裁剪块对全局帧位置的感知,编码器输入阶段注入了基于 CoordConv 的归一化全局坐标通道。提取得到的区域运动特征随后通过交错布置的局部交叉注意力适配器(Local Adapters)注入到 DiT 骨干层的对应模块中。在注意力注入过程中,通过空间掩码与可学习的吸收标记(Sink Token)将背景 Latent Query 彻底隔离,防止手部与面部的高频特征向背景区域扩散泄露。整个生成流程由粗到精、由全局到局部协同演进。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入数据<br/>参考外观图 + 全身2D骨架序列"] --> B["解耦局部条件编码<br/>面部/左手/右手裁剪 + CoordConv坐标注入"]
    B --> C["局部空间接地交叉注意力<br/>交错注入DiT块 + 空间掩码与Sink Token隔离"]
    C --> D["区域加权扩散重构<br/>手部/面部大权重引导细粒度降噪"]
    D --> E["输出视频<br/>解剖学精准且语义可懂的连续手语视频"]

关键设计

1. 解耦局部条件编码与 CoordConv 空间感知:解决微小区域分辨率压缩与局部坐标歧义 手语语言学明确将发音通道划分为手动通道(左右手,负责高频细粒度的手形变换与快速运动)和非手动通道(面部,负责低频连续的唇形、眉眼与头部姿态变化)。若使用统一编码器混杂建模,极易发生通道干扰。SignRefine 对面部、左手、右手分别构建独立的 ResNet 式条件编码器,将 \(256 \times 256\) 的局部裁剪关键点图像下采样为 \(16 \times 16\) 空间网格,并采用因果 1D 卷积将时间维度由 \(T\) 压缩至 \(T/4\),以精确匹配 Wan 基础模型的潜空间时空分辨率,得到紧凑的区域运动向量 \(M \in \mathbb{R}^{(T/4) \times S \times d}\)。局部裁剪虽然显著放大了关键区域的分辨率,却完全剥离了该区域在全局画面中的绝对空间坐标。为此,模型在输入通道中拼接了两路 CoordConv 归一化动态坐标图: $\(x_{i,j} = \frac{2(x_1 + (x_2 - x_1) \cdot j / W)}{W_{\text{orig}}} - 1, \quad y_{i,j} = \frac{2(y_1 + (y_2 - y_1) \cdot i / H)}{H_{\text{orig}}} - 1\)$ 其中 \((x_1, y_1, x_2, y_2)\) 为局部边界框在原画幅中的像素坐标,\(W_{\text{orig}}, H_{\text{orig}}\) 为原图尺寸。这一机制让每个局部像素特征天然携带相对于全局画幅 \([-1, 1]\) 的几何位置,使后续适配器能够精准将高分辨率特征映射回原视频的相应解剖区域。

2. 局部空间接地交叉注意力与 Sink Token:实现靶向特征注入并抑制背景污染 提取出的高分辨率手部与面部特征必须定向注入 DiT 主干,且不能破坏通用大模型原本优异的躯干结构和背景先验。在包含 30 个 Transformer Block 的主干中,SignRefine 将面部交叉注意力适配器挂载在 blocks \(\{0, 6, 12, 18, 24\}\),而手部适配器则交错挂载在 blocks \(\{2, 8, 14, 20, 26\}\)。这种交错布置有效避免了单个 DiT 模块同时吸收多路残差带来的梯度竞争与表达饱和;左右手的条件特征则在注入前沿通道维度拼接,以显式建模双手交互与复杂遮挡。为了在潜空间实现绝对的空间隔离,模型将原图边界框映射至粗糙的 Latent 网格生成二值掩码 \(m \in \{0, 1\}^S\),并在运动特征序列尾部追加一个可学习的吸收标记(Sink Token)\(s \in \mathbb{R}^{1 \times d}\)。注意力权重路由机制设计如下: $\(A_{i,j} = \begin{cases} \text{softmax}\left(\frac{\mathbf{q}_i \cdot \mathbf{k}_j}{\sqrt{d}}\right), & \text{若 } m_i = 1 \text{ 且 } j \le N \text{(前景区域交互)} \\ \text{softmax}\left(\frac{\mathbf{q}_i \cdot \mathbf{k}_{\text{sink}}}{\sqrt{d}}\right), & \text{若 } m_i = 0 \text{(背景 Query 导入 Sink)} \end{cases}\)$ 前景 Latent 词元(\(m_i = 1\))专注于与局部的 \(N\) 个高分辨率运动词元交互,而背景 Latent 词元(\(m_i = 0\))的注意力 Query 全部被引导至 Sink Token。Sink Token 如同能量黑洞,安全吸收所有非目标区域的注意力权重,从数学机制上杜绝了面部或手部纹理向衣物或背景异常渗漏的伪影。

3. 区域加权扩散训练目标:扭转画幅面积不均衡带来的梯度饥饿 基础 DiT 在生成整幅画面时采用全局均方误差作为降噪损失。然而在潜空间中,面部与双手所占比例通常不足 15%,在全局均匀加权下获得的优化梯度微乎其微。SignRefine 利用局部边界框掩码将 Latent 划分为手部、面部与背景三类区域(交叠区域优先判定为手部),构建区域非均匀加权 MSE 损失: $\(\mathcal{L} = \frac{w_h N_h \mathcal{L}_h + w_f N_f \mathcal{L}_f + w_b N_b \mathcal{L}_b}{w_h N_h + w_f N_f + w_b N_b}\)$ 实验设置权重 \(w_h = w_f = 10\)\(w_b = 1\)。此举直接将手部与面部在总梯度中的占比大幅拉高,使适配器网络在训练初期就专注于解剖学微小结构的拓扑修正;同时保留约三分之一的有效背景梯度,确保躯干姿态稳定与人物身份一致性不发生漂移。所有适配器输出投影层均初始化为接近零权重,保障了训练阶段平滑冻结主干。

损失函数 / 训练策略

模型冻结 Wan2.1-1.3B-Fun-Control 的全部核心参数(文本 T5、图像 CLIP、3D VAE 以及 30 层 DiT 主干),仅训练面部与双手的条件编码器及交叉注意力层。为提高训练吞吐量,通用文本提示词的 Latent 被预先离线缓存。在硬件配置与优化上,采用 Adam 优化器,学习率设为 \(1 \times 10^{-4}\),梯度累积步数为 8,单卡 batch size 为 1,在 4 块 NVIDIA GH200 GPU 上采用混合精度训练 30,000 步。

实验关键数据

主实验

评估在三大基准上展开:NVSign(跨外观泛化独立测试集)、Phoenix14T(受限演播室德语手语)和 BSL Corpus(演播室母语英国手语),均采用 RTMPose-X 提取 133 个全身关键点计算 MPJPE 误差,并测试 LPIPS 与 SSIM。

数据集 方法 面部 MPJPE↓ 面部 LPIPS↓ 右手 MPJPE↓ 右手 SSIM↑ 左手 MPJPE↓ 左手 SSIM↑
NVSign SignGAN 10.424 0.564 24.774 0.388 21.852 0.384
SignViP 10.576 0.534 23.957 0.428 24.383 0.424
Wan-VACE 4.067 0.422 15.904 0.380 15.431 0.407
Wan-FC 1.835 0.197 9.565 0.583 9.341 0.597
Ours 1.770 0.194 6.602 0.629 6.638 0.640
Phoenix14T SignGAN 5.457 0.585 28.507 0.469 25.373 0.470
SignViP 7.194 0.456 10.345 0.425 14.405 0.376
Wan-VACE 2.162 0.383 11.717 0.367 13.214 0.299
Wan-FC 1.151 0.223 5.754 0.629 5.719 0.642
Ours 0.916 0.214 4.582 0.660 5.101 0.668
BSL Corpus SignGAN 9.415 0.634 22.726 0.406 16.858 0.390
SignViP 28.222 0.626 23.085 0.381 22.111 0.372
Wan-VACE 3.172 0.436 17.524 0.351 15.385 0.338
Wan-FC 1.790 0.221 8.232 0.559 7.002 0.563
Ours 1.524 0.222 6.314 0.608 5.406 0.607

同时,在包含 6 位流利手语者的跨语言真实可理解性实验中,根据 YouTube-SL-25 的 10 个视频盲测翻译结果:本文模型的关键词召回率(Keyword Recall)达到 0.54(Wan-FC 仅 0.30),BLEURT 达到 0.31(Wan-FC 仅 0.19),LLM 达意度打分达到 2.07(Wan-FC 仅 1.50),视频彻底无法理解的失败率(Failure Rate)从 0.27 骤降至 0.17

消融实验

配置 面部 MPJPE↓ 面部 LPIPS↓ 左手 MPJPE↓ 左手 LPIPS↓ 右手 MPJPE↓ 右手 LPIPS↓ 说明
Sparse conditions (完整模型) 1.770 0.194 6.638 0.321 6.602 0.330 稀疏2D关键点输入(默认)
Dense conditions (密集体素) 1.692 0.192 6.665 0.319 6.713 0.329 采用3D MANO+法线,手部无实质提升且推理成本高
w/o attention masking (无注意力掩码) 1.949 0.214 7.309 0.353 7.270 0.363 移除空间掩码与Sink Token,手部误差激增约10.1%
w/o regional coords (无CoordConv坐标) 1.847 0.202 6.926 0.335 6.888 0.344 失去全局归一化绝对位置,各指标一致恶化约4.3%

关键发现

  • 空间掩码与 Sink Token 是局部精细化的第一生命线:消融实验显示,一旦去掉注意力掩码和 Sink Token,手部关节误差立刻恶化超 10.1%。这证实无约束的全局交叉注意力会导致高频局部特征与背景噪声混叠,而强行约束背景 Query 汇聚到吸收标记能彻底锁死发音器官边界。
  • 高分辨率裁剪优于复杂 3D 几何先验:对比 Dense 条件发现,引入 3D MANO 骨网格和面部法线贴图仅使面部指标微弱提升(MPJPE 1.770 \(\rightarrow\) 1.692),但在手部上几乎毫无增益。原因在于预训练 DiT 主干自身已蕴含丰富的通用几何先验,决定手语质量的核心瓶颈是局部时空分辨率不足,而非缺乏 3D 结构网格。因此采用轻量纯 2D 稀疏骨架即可达成最优性价比,规避了推理时对三维稠密拟合模型的脆弱依赖。
  • 专用模型的灾难性领域坍塌:在 Phoenix14T 上训练的专用模型 SignViP 在跨入真实场景的 NVSign 时手部 MPJPE 激增超过一倍(10.345 \(\rightarrow\) 23.957),而 SignRefine 依托冻结的视频大模型先验,在三类完全不同的语料库中均展现出稳健的零样本适应性。

亮点与洞察

  • CoordConv + Sink Token 的微小结构注入范式:巧妙结合动态归一化坐标编码与注意力吸收汇,在不微调扩散主干的前提下实现了对极小敏感解剖区域的精准“手术刀式”修正。该范式可无缝迁移至人脸高精合成、精细工具交互、复杂微动作生成等任何存在“全局背景大、关键运动小”的扩散模型控制任务。
  • NVSign 母语交际级数据集填补长期生态空白:打破了过去几十年手语数据集被电视新闻与演播室翻译垄断的死板格局,首次向社区开源了包含 78.1 小时、2,184 位母语手语者、40% 双人交际对白以及多机位动态镜头的大规模多模态资源,为多方轮候交谈与复杂语篇标记研究奠定了基石。
  • 客观指标与主观聋人社群理解度的深度对齐:研究不仅跑通了基于骨架反向检测的几何精度评估,更直接设计了双人盲测翻译与 LLM 语义打分评测体系,以高达 80% 以上的偏好胜率和 17% 的低失败率,证明了视觉微观几何提升能够真实转化为无障碍语意可理解性。

局限与展望

  • 扩散模型高延迟难以满足实时同传:在旗舰级 GPU 上生成 81 帧手语视频仍需数分钟,距离无障碍实时视频交互或流式直播同传尚有显著工程距离,未来需要结合一致性蒸馏(Consistency Models)或轻量 Flow Matching 加速推理。
  • 高动态手势运动模糊继承:训练数据基于常规 25 fps 采集,在极快的手语手势连贯过渡(Co-articulation)中存在物理运动模糊,导致模型在快速甩手时仍偶发边缘涂抹。
  • 骨架估计器的误差级联:系统高度依赖 RTMPose 等前置姿态估计工具,当输入骨架自身存在严重手势自遮挡或误检时,生成的伪影会被放大并级联传递至最终画面。

相关工作与启发

  • vs SignGAN / SignViP: 传统专用模型完全从头训练且过度受限于演播室同传数据集,导致在新人物与跨域场景下严重崩溃;SignRefine 选择“站在巨人肩膀上”,直接冻结 1.3B 规模的通用视频 DiT 主干,通过轻量局部适配器继承底座强大的开放世界人物生成能力。
  • vs Animate Anyone / UniAnimate: 通用人体动画模型主要针对舞蹈与全身粗粒度运动,采用全图特征注入,在手部小区域存在严重的潜空间下采样失真;SignRefine 通过空间解耦与局部 \(256 \times 256\) 放大机制,在保持全身协调的同时突破了微小发音器官的清晰度天花板。

评分

  • 新颖性: ⭐⭐⭐⭐☆ 空间接地局部适配器设计巧妙,CoordConv 与 Sink Token 的结合直击潜空间微结构生成的本质痛点。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖三套主流数据集、两项消融实验,更配备了严密的手语母语者盲测与翻译语义召回分析。
  • 写作质量: ⭐⭐⭐⭐⭐ 逻辑层层推进,从语言学动机到工程架构阐述极为严谨自洽。
  • 价值: ⭐⭐⭐⭐⭐ 不仅大幅提升了手语生成的可懂度,更贡献了极具里程碑意义的 NVSign 母语手语大数据集。