Video-Text Alignment Model for Sign Language Translation¶
会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/junyi2005/vtamo
领域: 人体理解
关键词: 连续手语翻译, 无手语词监督, 跨模态对齐, 最优传输, 伪手语词
一句话总结¶
针对无手语词注释(gloss-free)连续手语翻译中手语时序与口语词序倒错、跨模态对齐完全依赖自回归解码器隐式学习的难题,VTaMo 提出多粒度显式对齐框架,利用带可学习 Null Token 的局部最优传输重排视觉特征,并结合全局正交几何校准与位置对比学习,在四大主流基准刷新 SOTA。
研究背景与动机¶
连续手语翻译(Sign Language Translation, SLT)致力于将连续手语视频转换为流利的口语文本,是消除听障群体与健听群体交流鸿沟的核心人工智能技术。近年来,免去昂贵人工手语词(gloss)标注的无手语词(gloss-free)方案成为主流研究趋势,该类方案直接采用预训练视觉编码器抽取连续视频表征,并借助自回归大型语言模型(如 Flan-T5 等)端到端解码口语目标句。然而,在脱离细粒度手语词时序切分与对齐监督的设定下,现有方法直接面临严重的模态不对齐与语序重构挑战。
这种困难的核心矛盾在于手语语法结构与口语词序的本质冲突,以及视觉帧流与离散文本 token 之间的粒度失配。自然手语通常采用不同于口语的语法规则,例如往往先打出核心实词手势,再补充空间关系或语法修饰,使得手语手势的时间出现顺序与目标口语词序严重倒错;加之口语中充斥着冠词、介词等无手势对应的功能虚词,连续手势之间还存在大量过渡(co-articulation)和复位动作。现有主流方法(如 SpaMo、Uni-Sign、ShuBERT 等)大多将视觉流按时间单向输入解码器,完全依赖自回归 Cross-Attention 隐式学习复杂的跨模态置换与翻译,导致交叉注意力分布弥散且极易陷入错误的词序预测。
针对上述瓶颈,本文的切入角度是打破对解码器隐式对齐的被动依赖,将视觉表征显式地重排为与目标语义序列一致的输入。为此,研究团队剥离无手势对应的虚词、构建实词伪手语词(pseudo-gloss),并在训练阶段通过最优传输建立细粒度帧-词映射与特征重排,在推断阶段则将语序规整转交纯文本恢复模型处理。核心 idea:引入基于可学习 Null Token 的局部熵正则最优传输显式构建帧-词映射并重排训练特征,结合保持向量空间几何特性的全局正交变换与位置对齐对比学习,将词汇级跨模态对齐与口语语序恢复彻底解耦。
方法详解¶
整体框架¶
VTaMo 的整体流程涵盖特征抽取、时序降采样、多粒度显式跨模态对齐、特征重排以及两阶段推断解码。给定一段连续手语视频,系统首先使用冻结的 CLIP-ViT-Large 提取多尺度帧级视觉特征,经过轻量级注意力时序编码器下采样后投影至文本潜空间;文本端则通过预训练词性标注器滤除虚词,提取目标句的伪手语词序列嵌入。在训练阶段,模型通过局部最优传输解算帧与伪手语词的软分配,利用非空匹配重排视觉窗口以拟合解码器的自回归序列,同时施加全局正交变换 EMD 损失与位置对齐对比损失;在测试阶段,视觉特征保持原始时间步直接解码出视频语序的伪手语词,最终交由离线训练的轻量纯文本恢复模型还原为流利口语句子。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}, 'subGraphTitleMargin': {'top': 8, 'bottom': 16}}}%%
flowchart TD
A["连续手语视频帧"] --> B["注意力时序编码与投影<br/>CLIP-ViT + 4×注意力下采样"]
C["目标口语文本文档"] --> D["离线过滤生成伪手语词<br/>保留实词,剔除虚词标点"]
subgraph S1 ["显式跨模态对齐系统"]
direction TB
B --> E["局部最优传输对齐<br/>Sinkhorn求解 + 可学习Null Token"]
D --> E
B --> F["全局正交变换校准<br/>注意力池化 + 记忆队列EMD"]
D --> F
E --> G["窗口特征重排与对比学习<br/>多帧聚合窗口对齐目标词序"]
D --> G
end
G --> H["LoRA Flan-T5 解码器<br/>训练期接收重排序列 / 测试期直解"]
H --> I["纯文本语序恢复模型<br/>测试期恢复口语语序与虚词"]
I --> J["最终流利口语翻译文本"]
关键设计¶
1. 局部最优传输对齐:以带可学习 Null Token 的 Sinkhorn 算法化解过渡动作与非一对一映射
针对手语视频中大量存在的过渡手势、回位动作以及动作停顿无法在文本中找到实体对应,导致强制完全对齐必然产生误导噪声的痛点,VTaMo 将细粒度帧-词匹配形式化为带 Null Token 的熵正则最优传输(Optimal Transport, OT)问题。在伪手语词特征序列最前端引入一个维度为 \(d_t\) 的可学习空标记 \(e_\varnothing\),形成增广文本集合。设视觉特征序列为 \(\mathbf{S} \in \mathbb{R}^{M \times d_t}\),增广文本嵌入为 \(\tilde{\mathbf{E}} \in \mathbb{R}^{K \times d_t}\)(其中 \(K = U + 1\))。传输代价矩阵定义为余弦距离,并引入可学习偏置 \(b_\varnothing\) 调节对 Null Token 的偏好:
其中 \(\bar{\mathbf{s}}_m, \bar{\mathbf{e}}_k\) 为 \(\ell_2\) 归一化向量。通过对偶变量在对数域进行迭代求解 Sinkhorn 算法,得到最优传输方案 \(\mathbf{A}^* \in \mathbb{R}^{M \times K}\)。为避免初始随机分配引发局部极小值,研究采用多阶段退火策略将熵正则参数 \(\varepsilon\) 逐步降低(0.12 \(\to\) 0.10 \(\to\) 0.03),促使匹配矩阵由平滑探索平稳过渡为清晰锐利的离散指派。
2. 全局正交变换校准:利用保持模态几何的旋转变换与记忆队列消除空间方向偏移
跨模态预训练视觉编码器与文本模型之间天然存在全局坐标系分布偏差(Orientation Mismatch),直接计算两者的相似度极易受各向异性或伪低代价匹配干扰。为了在句子级拉齐两模态分布且不破坏各自潜空间的局部几何与内积距离,VTaMo 设计了受正交约束的全局映射。系统通过注意力池化将视频序列与文本序列各自压缩为句子级表征 \(\mathbf{z}^\text{sign}, \mathbf{z}^\text{text} \in \mathbb{R}^{d_t}\),并引入可学习正交变换矩阵 \(\mathbf{T} \in \mathbb{R}^{d_t \times d_t}\) 作用于视觉句子向量:
为摆脱单 GPU 小 batch 下配对负样本匮乏的限制,架构维护了一个容量为 256 的 FIFO 记忆队列,跨 batch 缓存近期出现的文本与视觉句子向量。在整个记忆队列上求解句子级推土机距离(EMD)以实现全局对齐,同时严格惩罚偏离正交阵的程度:\(\mathcal{L}_\text{orth} = \|\mathbf{T}^\top \mathbf{T} - \mathbf{I}\|_F^2\)。这一正交约束确保了模态间的度量不会因为任意仿射拉伸而崩溃。
3. 窗口特征重排与对比学习:在对齐目标语序的同时固化单 token 判别表征
解码器的交叉熵损失严格遵循目标文本的从左至右自回归顺序,若视觉特征仍停留在原始手势发生顺序,梯度更新将与时间对齐目标剧烈冲突。VTaMo 提出了滑动窗口聚合重排机制:将 \(M\) 个视觉帧划分为 \(N_w = U + 2\) 个时序重叠窗口,统计各窗口在最优传输矩阵 \(\mathbf{A}^*\) 中投射至各个实词 token 的质量累加和,将窗口指派给累加质量最大的目标词(剔除主导为 Null 的无意义窗口)。按目标词序号遍历并将窗口按原始时间升序拼接,构成了语序重排后的视觉序列 \(\mathbf{R}\) 送入 LoRA Flan-T5。
为了确保模型在推断阶段无法获取目标语序、无法进行重排时仍能准确识别手势词义,VTaMo 引入位置对齐的 InfoNCE 对比学习。将每个词对应视觉窗口均值池化得到 token 级视觉表示 \(\mathbf{r}_u\),分别经过双层 MLP 投影头后,与对应的文本词嵌入 \(\mathbf{e}_u\) 进行实例级判别对比:
此处梯度单向流回视觉分支而阻断文本分支,保证预训练语言模型的语义锚点绝对稳定,使每个视觉片段在嵌入空间中紧紧锚定对应的词汇概念。
4. 纯文本语序恢复模型:将视觉-词汇接地与流利口语组织解耦
在推理阶段,目标口语词序完全未知,模型无法提前进行窗口重排。得益于位置对齐对比学习赋予的稳健词级判别力,解码器直接在原始手语时间步特征上执行贪婪或束搜索生成,产出遵循手势时序的伪手语词序列。最后一步由仅接收文本输入的轻量级恢复模型完成:该模型仅在单语纯文本语料上训练,训练时自动抽取真实句子的伪手语词并随机打乱其实词顺序,训练模型从打乱的无虚词序列中重建完整的正确语法和口语词序。这种解耦设计免去了让多模态模型同时兼顾手势感知与复杂口语重排的沉重负担,将自然语言语序还原完全交由擅长纯文本建模的模块解决。
损失函数 / 训练策略¶
VTaMo 采取两阶段训练流程。第一阶段冻结语言模型参数,仅激活视觉时序编码器、投影层及对齐模块,使视觉空间初步对齐文本潜空间;第二阶段解冻 Flan-T5 的 LoRA 适配层进行端到端联合微调。全任务联合训练损失函数为:
其中局部对齐损失 \(\mathcal{L}_\text{local} = \beta_\text{local} \mathcal{L}_\text{trans} + \beta_\text{tv} \mathcal{L}_\text{tv} + \beta_\text{null} \mathcal{L}_\text{null}\) 包含了最优传输代价 \(\mathcal{L}_\text{trans}\)、惩罚相邻帧突变的时序全变差正则项 \(\mathcal{L}_\text{tv}\) 以及防止 Null 偏置 \(b_\varnothing\) 过大导致全部匹配塌缩至 Null 的目标比例约束 \(\mathcal{L}_\text{null}\)。全局 EMD 权重 \(\lambda_g(t)\) 采用在前 4,000 步线性爬升的 Warm-up 策略,待局部匹配稳定后再介入全局调优。
实验关键数据¶
主实验¶
评估在四大公认手语基准的官方测试集上展开:德语天气预报数据集 Phoenix-2014T、中文日常交流数据集 CSL-Daily、大规模美语教学视频数据集 How2Sign 以及开放域美语数据集 OpenASL。模型仅基于 RGB 输入且不引入手语领域预训练,与现有 SOTA 方法对比结果如下:
| 数据集 | 设定 / 方法 | 输入模态 | 手语微调 | BLEU-1 | BLEU-4 | ROUGE-L | BLEURT |
|---|---|---|---|---|---|---|---|
| Phoenix-2014T | TS-SLT (SOTA Gloss-based) | RGB | 是 | 54.90 | 28.95 | 53.48 | — |
| Phoenix-2014T | SpaMo (Prev. SOTA Gloss-free) | RGB | 否 | 49.80 | 24.32 | 46.57 | — |
| Phoenix-2014T | VTaMo (本文) | RGB | 否 | 61.32 | 28.86 | 60.24 | — |
| CSL-Daily | Uni-Sign (Prev. SOTA Gloss-free) | Pose+RGB | 是 | 55.08 | 26.36 | 56.51 | — |
| CSL-Daily | SpaMo | RGB | 否 | 48.90 | 20.55 | 47.46 | — |
| CSL-Daily | VTaMo (本文) | RGB | 否 | 57.64 | 27.16 | 57.28 | — |
| How2Sign | Uni-Sign | Pose+RGB | 是 | 40.20 | 14.90 | 36.00 | 49.40 |
| How2Sign | SpaMo | RGB | 否 | 33.41 | 10.11 | 30.56 | 42.23 |
| How2Sign | VTaMo (本文) | RGB | 否 | 46.67 | 18.47 | 37.14 | 50.26 |
| OpenASL | Uni-Sign | Pose+RGB | 是 | 49.35 | 23.14 | 43.22 | 60.40 |
| OpenASL | SpaMo | RGB | 否 | 46.28 | 21.25 | 41.04 | 57.82 |
| OpenASL | VTaMo (本文) | RGB | 否 | 53.58 | 25.94 | 46.85 | 62.48 |
消融实验¶
在 Phoenix-2014T 测试集上逐一剔除核心组件的消融验证表明,三个层级的对齐目标各具不可替代的作用:
| 配置 | BLEU-1 | BLEU-4 | ROUGE-L | 说明 |
|---|---|---|---|---|
| 完整模型 (Full model) | 61.32 | 28.86 | 60.24 | 完整多粒度对齐架构 |
| w/o \(\mathcal{L}_\text{contra}\) (位置对比学习) | 51.23 | 22.56 | 50.14 | 掉点最多 (-6.30 B4),词级判别力削弱 |
| w/o \(\mathcal{L}_\text{local}\) (局部最优传输) | 52.62 | 23.77 | 51.29 | 掉点显著 (-5.09 B4),失去窗口重排基础 |
| w/o \(\mathcal{L}_\text{EMD}\) (全局正交校准) | 57.46 | 26.21 | 57.92 | 空间旋转失准,指标明显回落 (-2.65 B4) |
| w/o Null Token (局部对齐无空标记) | — | 27.60* | — | 强制匹配导致转移熵增,过渡帧污染词义 |
| w/o Memory Queue (全局无记忆队列) | — | 27.35 | — | 单 batch 负例多样性不足,收敛代数由 36 延缓至 68 |
| w/o 正交约束 (\(\mathcal{L}_\text{orth}\)) | — | 28.13 | — | 特征几何畸变,峰值性能降低且收敛变慢 |
(注:Null Token 消融在验证集上反映为传输熵由 0.18 恶化至 0.46,片段切换率由 0.12 恶化至 0.33)
关键发现¶
- 对比学习与最优传输高度互补:位置对齐对比损失 \(\mathcal{L}_\text{contra}\) 贡献最大(移除后 BLEU-4 骤降 6.30 点),证实将重排后的视觉表征紧密锚定到文本 token 嵌入空间是模型在推断阶段即使遭遇乱序输入仍能稳定识别词义的基石;而局部最优传输则提供了高质量的窗口边界与时序指派。
- 大词表与复杂域增益更明显:在词汇量较小、句式固定的天气预报数据集(Phoenix-2014T)上,VTaMo 首次在 gloss-free 设定下逼平甚至赶超了最强 gloss-based 模型(28.86 vs 28.95);而在词表超 10,000 词的开放域 OpenASL 与 How2Sign 上,相较于前代最强 RGB 方法 SpaMo,BLEU-4 分别激增 4.69 和 8.36 点,显著拉开差距。
- 外观与背景鲁棒性极强:通过 ControlNet 合成保持骨架手势姿态的背景替换(户外/厨房)与合成人物外观替换实验(衣服/体型与虚构身份),BLEU-4 下降幅度均在 0.42 以内,证明显式对齐学到的是纯粹的手部与肢体运动语义,而非场景偏置。
亮点与洞察¶
- Null Token 优雅化解模态不等长顽疾:以往基于动态时间规整(DTW)或注意力矩阵的硬对齐往往强行把过渡手势或停顿分配给实体词,造成严重特征污染;引入可学习空标记作为“吸收池”,让模型自发将无意义帧分流,显著提升了时序匹配矩阵的块对角特性。
- 受约束的正交变换兼顾校准与稳定性:在跨模态高维空间对齐中,任意线性变换极易为了最小化距离而坍缩特征维度;施加正交约束仅允许空间纯刚性旋转,在完美保全内积与相对角距离的前提下拉齐多模态分布,计算代价极小(全局 OT 仅增耗 <38ms)却能加速近一倍的收敛速度。
- 训练重排 + 推理直解的解耦范式可广泛迁移:通过“训练期重排降低语言模型拟合阻力 + 对比学习固化概念 + 推断期单模态文本模型整理语序”的三步策略,不仅适用于手语翻译,还可推广至视音频错位语音翻译、长视频动作步骤定位等弱对齐任务。
局限与展望¶
- 推断依赖离线文本恢复管道:当前语序还原高度依赖第二阶段纯文本模型的重构能力,若多模态解码器生成的视频序伪手语词存在漏词或错词,纯文本模型可能会产生级联幻觉或重排序错误。
- 实时与端侧部署受限:模型依赖多尺度 CLIP-ViT 特征提取与 Flan-T5-XL(3B),计算负载较大;论文主要聚焦离线翻译准确率,尚未探索在边缘设备或流式实时手语同传中的轻量化适配。
- 未来方向:探索端到端联合训练多模态解码与文本重排的闭环机制,并将骨架拓扑轻量先验融入局部传输代价,进一步压低推理延迟。
相关工作与启发¶
- vs SpaMo (NAACL 2025): SpaMo 引入空间配置与运动动力学做批次级对比学习,但未显式建模句子内部帧-词对应,解码器注意力依旧弥散;VTaMo 深入到句内做基于最优传输的显式细粒度对齐与窗口重排,在 How2Sign 上实现 +8.36 BLEU-4 的断层领先。
- vs Uni-Sign / SHuBERT (ICLR 2025 / ACL 2025): Uni-Sign 与 SHuBERT 依赖庞大的手语视频自监督预训练和复杂的 Pose+RGB 多模态输入;VTaMo 证明了无需特定手语预训练、仅利用冻结的通用 CLIP-ViT 与轻量对齐模块,就能在纯 RGB 条件下全面压倒依赖姿态与预训练的模型。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ 将带空标记的熵正则最优传输与正交变换优雅结合,突破了无手语词翻译中隐式注意力的瓶颈。
- 实验充分度: ⭐⭐⭐⭐⭐ 覆盖四大主流跨语言基准,主实验、模块消融、传输质量度量及生成式噪声鲁棒性分析完备翔实。
- 写作质量: ⭐⭐⭐⭐⭐ 逻辑严密,数学建模清晰,符号定义规范且对齐机制图示详尽。
- 价值: ⭐⭐⭐⭐⭐ 为无手语词手语翻译树立了新的 SOTA 范式,对弱对齐多模态时序序列生成具有重要参考价值。