跳转至

Q-BridgeNet: A Quantization Network for Cross-Lingual Sign Language Translation

会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/FengLiQ/Q-BridgeNet
领域: 人体理解
关键词: 手语翻译, 残差向量量化, 自适应时序分割, 多语言翻译, 大语言模型

一句话总结

针对多语种手语翻译中跨语种视觉差异引发的表征冲突与语义边界切分错位问题,Q-BridgeNet 提出通过自适应时序分割与“共享基底-私有残差”分层矢量量化构建离散 Q-unit 语义基元,并结合多语言大语言模型实现统一的多对多跨语种手语翻译。

研究背景与动机

全球有超过 3.6 亿人依靠手语进行日常交流。作为具有独立音系、句法与篇章结构的视觉语言,手语与口语存在根本性差异。绝大多数现有手语翻译(SLT)方法专注于单一的手语-口语对(例如美式手语 ASL-英语、德式手语 DGS-德语或中式手语 CSL-中文),通过神经网络建立连续骨骼动作姿态序列或视频到目标口语文本的映射。尽管单语种模型取得了显著进展,但真实交互场景往往需要跨越多种手语和多种口语的无障碍交流。这促使学术界转向支持多对多翻译的多语言手语翻译任务。

然而,现有跨语种手语翻译方法在构建统一样本表征时面临严峻的负迁移与表征冲突困境。当不同手语的连续视觉动作被强行映射到同一连续嵌入流形时,不同语种手势的物理运动幅度、执行速度和语法结构差异会严重争夺表征容量,导致共享流形坍缩。此外,手语表达具有高度不规则的时序节奏,传统量化方法普遍采用固定步长的降采样或切分,极易在语义词元内部或跨边界处生硬切断手势动作,使混合的手势模式与目标语言词法难以对齐。

为化解多语种视觉异构与时序异步的核心冲突,Q-BridgeNet 的切入角度是将手语动作解耦为跨语种共享的语义基元与语种专有的运动细节,并通过数据驱动的时序分割建立自适应语义单元。核心 idea:通过自适应时序分割与共享-私有残差矢量量化交替优化,将连续手语姿态分解为跨语种共享基元与语言特定细节组成的离散 Q-unit 序列,并在该离散单元空间中微调多语言 LLM 以消除跨语种负迁移。

方法详解

整体框架

Q-BridgeNet 建立了一个端到端的多对多手语翻译系统。整个框架主要包含两个阶段:第一阶段是基于交替迭代优化的离散手语单元发现,将连续手势骨骼序列切分为变长语义片段,并利用分层残差矢量量化(RQ-VAE)将其映射为离散的 Q-unit 符号流;第二阶段是多语言大语言模型重对齐,冻结前述量化网络,在多语言配对语料监督下以自回归自回归生成口语翻译文本。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入手语骨骼姿态序列<br/>79个关键点时序轨迹"] --> B["自适应时序分割<br/>动态规划寻找最优语义边界"]
    B --> C["共享-私有残差矢量量化<br/>共享基底码本与私有残差码本"]
    C --> D["块坐标下降交替优化<br/>码本更新与边界重切分收敛"]
    D --> E["多语言LLM重对齐<br/>Q-unit离散输入自回归解码口语"]
    E --> F["输出目标口语文本<br/>德语 / 英语 / 中文多对多翻译"]

关键设计

1. 自适应时序分割:动态规划消除固定窗口切分对语义边界的破坏

手语的表达节奏存在天然的不均衡性,固定时间窗切分往往横跨不同词汇或手势动作,导致切分片段包含异构运动模式。该设计通过全局重构误差最小化来寻找语义自洽的变长分段。对于包含 \(T\) 帧骨骼关节点轨迹的输入序列 \(\mathbf{P}=\{\mathbf{p}_1, \dots, \mathbf{p}_T\}\),分割目标是将时间轴划分为 \(N\) 个不重叠的半开区间 \(\mathcal{S}(\mathbf{P})=\{\mathbf{p}_{s_0:s_1}, \dots, \mathbf{p}_{s_{N-1}:s_N}\}\)(其中 \(s_0=1, s_N=T+1\),且单片段长度限制在 32 帧以内)。为避免组合爆炸,模型利用最优子结构性质建立动态规划状态转移方程:

\[ \mathcal{L}_{\text{global}}(\mathbf{p}_{s_0:s_N} \mid \mathbb{V}) = \min_{s_{N-1}} \Bigl[ \mathcal{L}_{\text{global}}(\mathbf{p}_{s_0:s_{N-1}} \mid \mathbb{V}) + \mathcal{L}_{\text{elem}}(\mathbf{p}_{s_{N-1}:s_N} \mid \mathbb{V}) \Bigr] \]

其中基底情况为 \(\mathcal{L}_{\text{global}}(\mathbf{p}_{0:1}\mid\mathbb{V})=\mathcal{L}_{\text{elem}}(\mathbf{p}_{0:1}\mid\mathbb{V})\),单片段代价 \(\mathcal{L}_{\text{elem}}\) 对应当前片段在量化自编码器下的重构误差。通过自底向上递推并回溯最优断点,序列被自适应解构为具备动作完整性的变长时序片段。

2. 共享-私有残差矢量量化:解耦跨语种通用基元与语种专有细节

将所有手语强行压缩到单一码本会导致跨语种表征干扰,而完全独立的码本又阻断了跨语种知识复用。模型为 \(L\) 种手语(ASL、CSL、DGS)构建了 \(L\) 组 RQ-VAE 模块。对于编码得到的潜在向量 \(\mathbf{z}=\mathcal{E}(\mathbf{p}_{s_n:s_{n+1}})\),量化过程通过 \(R+1\) 层有序残差迭代剥离:

\[ \mathbf{z}^r = \mathcal{Q}_i^r(\mathbf{r}^r), \quad \mathbf{r}^{r+1} = \mathbf{r}^r - \mathbf{z}^r \quad (r=0, \dots, R) \]

关键创新在于首层量化器 \(\mathcal{Q}_0\) 及其码本 \(\mathcal{Z}_0\)(包含 1024 个 96 维嵌入)由所有手语共享,专门捕捉跨语种不变的高层语义基元;而后序残差量化器 \(\{\mathcal{Q}_i^r\}_{r=1}^R\) 则采用语言私有的码本(每个语种 512 个嵌入),精细补偿特定手语的运动幅度和语系专有风格。最终将多层量化向量拼接得到离散单元 \(\hat{\mathbf{z}} = \mathbf{z}^0 \oplus \dots \oplus \mathbf{z}^R\),经解码器 \(\mathcal{D}_i(\hat{\mathbf{z}})\) 恢复骨骼姿态。

3. 块坐标下降交替优化:突破边界定位与码本表征的相互掣肘

精准的边界划分需要稳定的码本提供重构度量,而高质量码本的学习依赖于低内部方差的纯净片段。两者互为因果,联合优化难以直接微分。为此,该设计将联合目标函数显式建模为:

\[ \mathcal{J}(\mathcal{S}, \mathbb{V}) = \sum_{n=0}^{N-1} \Bigl( \|\mathbf{p}_{s_n:s_{n+1}} - \mathcal{D}_i(\hat{\mathbf{z}}_n)\|_2^2 + \beta \|\text{sg}[\mathbf{z}_n] - \hat{\mathbf{z}}_n\|_2^2 + \gamma \|\mathbf{z}_n - \text{sg}[\hat{\mathbf{z}}_n]\|_2^2 \Bigr) + \lambda N \]

其中 \(\lambda N\) 为片段数量正则项。系统采用块坐标下降策略,在固定当前分割 \(\mathcal{S}^t\) 时更新 RQ-VAE 码本参数 \(\mathbb{V}^{t+1}\),随后在固定新码本的前提下通过动态规划更新时序断点 \(\mathcal{S}^{t+1}\)。通过 5 轮交替迭代,目标函数严格单调递减并收敛至局部稳定点,实现了动作分割与符号量化的双向对齐。

4. 多语言 LLM 空间重对齐:借助大模型语言先验弥合手语到多目标口语鸿沟

在完成离散 Q-unit 空间建模后,冻结所有 RQ-VAE 模块。为了打通离散手势单元到多国口语的生成路径,框架引入预训练多语言大语言模型(Qwen3-1.7B),并基于 LoRA 进行端到端自回归翻译对齐。利用 GPT-5 将原始单语语料扩展为英、德、中三语平行对齐标注,生成包含任务提示前缀(如 Translate <DGS> to German)的输入指令。模型将整段手语序列转换成的离散符号序列 \(\hat{\mathbf{Z}}=(\hat{\mathbf{z}}_1, \dots, \hat{\mathbf{z}}_N)\) 作为输入,自回归最小化文本交叉熵损失:

\[ \mathcal{L}_{\text{SLT}} = -\sum_{k=1}^M \log P(\mathbf{x}_k \mid \mathbf{x}_{<k}, \hat{\mathbf{Z}}) \]

借由 LLM 强大的跨语言对齐先验,多语言手语输入在统一的 Q-unit 接口下直接映射为目标语系,无需针对每对语种单独设计复杂的跨模态对齐网络。

损失函数 / 训练策略

RQ-VAE 的量化训练采用 1000 个 epoch,超参数设为 \(\beta=1.0, \gamma=0.25\),码本维度设为 96 维。姿态数据由 OpenPose 提取并标准化为 79 个关节点,在训练阶段注入标准差为 0.002 的高斯白噪声以对抗关节点检测抖动。交替更新在随机初始切分下循环执行 5 次。LLM 微调阶段使用 4 块 NVIDIA RTX 4090 GPU,在扩展的三语配对数据集上基于 LoRA 训练 100 个 epoch。

实验关键数据

主实验

在三个标准手语基准数据集 PHOENIX14T(DGS)、How2Sign(ASL)和 CSL-Daily(CSL)上与主流方法进行评测对比,评价指标采用 BLEU-4(B-4)、BLEU-1(B-1)以及 ROUGE-L(RG)。

数据集 / 语种对 方法 B-4 B-1 RG 说明
How2Sign (ASL-EN) SL-Trans. (CVPR'20) 9.93 28.37 28.94 早期单模态基线
GloFE (ACL'23) 2.24 14.94 12.61 端到端无Gloss方案
YT-ASL (NeurIPS'23) 12.39 37.82 – 大规模预训练基线
Uni-Sign (ICLR'25) 14.50 40.40 34.30 统一多语言SLT模型
ShuBert (ACL'25) 16.20 – – 多流聚类表示学习前SOTA
Ours (ASL-EN 本地原生) 16.55 41.81 34.97 相比前SOTA显著领先
Ours (多语言平均) 16.44 41.73 35.20 涵盖跨语种目标均值
Ours (ASL-ZH 跨语种) 16.83 42.04 35.52 跨语种反超原生对
Ours (ASL-DE 跨语种) 15.96 41.34 35.11 零样本式跨语言泛化
CSL-Daily (CSL-ZH) SL-Trans. (CVPR'20) 14.15 39.72 38.44 基础 Transformer 基线
MMSLT (ICCV'25) 21.11 49.87 48.92 MLLM增强模型
ICTCA (COLING'25) 22.47 52.37 51.87 文本CTC对齐方法
MSKA (PR'25) 25.52 56.37 54.04 多流关键点注意力网络
Uni-Sign (ICLR'25) 25.61 53.86 54.92 多语言统一模型前SOTA
Ours (CSL-ZH 本地原生) 26.91 57.39 54.85 全指标刷新基准记录
Ours (多语言平均) 26.33 57.09 55.04 稳健多语言表征
Ours (CSL-EN 跨语种) 26.40 56.98 54.30 高质量非原生翻译
Ours (CSL-DE 跨语种) 25.68 56.89 55.97 跨欧亚语系表现强劲
PHOENIX14T (DGS-DE) SL-Trans. (CVPR'20) 19.45 43.72 45.44 经典两阶段框架
TwoStream (NeurIPS'22) 28.42 54.22 53.19 双流特征建模
CV-SLT (AAAI'24) 29.27 54.88 54.33 条件变分自编码器
SCOPE (AAAI'25) 32.84 61.74 60.06 LLM上下文嵌入前SOTA
Ours (DGS-DE 本地原生) 33.62 62.80 61.76 刷新该基准最高性能
Ours (多语言平均) 33.40 62.56 61.39 接近原生水平
Ours (DGS-ZH 跨语种) 33.36 62.67 61.67 远距离语系直接翻译
Ours (DGS-EN 跨语种) 33.20 62.21 60.73 跨语种BLEU-4突破33点

消融实验

消融实验全面验证了分层量化结构、交替优化策略、监督质量与骨干网络规模的影响。

配置变体 How2Sign (B-4 / B-1 / RG) CSL-Daily (B-4 / B-1 / RG) PHOENIX14T (B-4 / B-1 / RG) 说明
Full model (完整模型) 16.44 / 41.73 / 35.20 26.33 / 57.09 / 55.04 33.40 / 62.56 / 61.39 共享基底+私有残差+交替优化
Uni-codebook VQ (单全局码本) 7.23 / 21.61 / 18.09 16.18 / 33.97 / 35.12 21.38 / 42.34 / 39.22 跨语种表征冲突严重,性能腰斩
Non-shared VQ (无共享基底) 9.29 / 25.60 / 22.52 18.90 / 37.82 / 39.01 22.62 / 42.03 / 43.14 语种间完全隔离,丧失语义迁移能力
Non-residual VQ (无残差层叠) 12.04 / 31.48 / 27.75 21.49 / 41.44 / 44.32 27.32 / 50.98 / 52.45 并行扁平码本缺少由粗到细的误差剥离
Single-pass Seg. & RQ (单轮无交替) 13.39 / 33.24 / 31.56 24.11 / 46.47 / 47.36 28.61 / 52.03 / 49.46 缺少边界与码本的双向迭代反馈
GPT-5 翻译控制组 (先单语再机器翻译) 14.20 / 36.61 / 31.82 23.18 / 51.47 / 50.02 28.36 / 54.13 / 52.26 证实提升源于多模态表征而非后处理文本翻译
GPT-4.1 生成监督语料 15.58 / 41.36 / 34.07 26.30 / 55.92 / 54.48 33.07 / 62.34 / 60.79 性能略有微降,说明对翻译模型版本具有鲁棒性
Qwen3-0.6B 轻量骨干微调 15.64 / 41.01 / 34.20 25.84 / 55.41 / 53.54 32.25 / 60.76 / 59.01 参数量大幅减少但保持竞争力的翻译精度

关键发现

  • 分层解耦是多语言对齐的关键:去掉共享基底码本(Non-shared VQ)或退化为单全局码本(Uni-codebook VQ)均导致性能断崖式下跌,PHOENIX14T 上的 BLEU-4 分别狂跌 10.78 和 12.02。这充分证明了手语动作中“通用跨语种语义核心”与“特定语言动作风格”显式解耦的必要性。
  • 残差机制与交替更新提供稳定增益:采用残差量化相比并联扁平码本(Non-residual VQ)在 How2Sign 上提升了 4.40 点 BLEU-4;而交替坐标下降(5轮)相比单次粗切分提升了 3.05 到 4.79 点 BLEU-4,证明动作边界与语义码元存在强耦合依赖。
  • 跨语种迁移反哺原生语向:多语言统一模型的本地原生对性能全面超越了仅在原生数据上训练的单语种版本(例如 ASL-EN 从 14.35 升至 16.55,DGS-DE 从 30.16 升至 33.62),说明多语言的语义约束起到了优异的正则化作用,甚至在非原生目标(如 ASL 翻译为中文)上获得了超过原生英文的生成质量。
  • 无监督 Q-unit 涌现词法长尾分布:对学习到的私有 Q-unit 进行词频统计发现,其长尾衰减趋势与人工标注的真实 Gloss 频率分布高度拟合,且 t-SNE 聚类呈现出清晰的语义边界,表明离散量化成功捕捉了语言级的离散符号构词规律。

亮点与洞察

  • 共享与私有码本的残差解耦设计:创新性地利用首层共享码本锚定语言通用语义基元,后续私有残差码本吸收语种特定方差。这一架构极为巧妙地解决了多手语联合建模中的负迁移问题,兼顾了通用表征与差异化细化。
  • 自适应动作切分与符号量化的双向协同:摆脱了以往固定窗口粗暴截断骨骼流的弊端,将动态规划时序切分与残差量化纳入块坐标下降交替优化,使手语动作边界能自发适应词汇语义边界。
  • 轻量化离散表征与 LLM 解码器的高度解耦:将连续手语转化为离散 Q-unit 后,下游翻译可直接复用成熟大语言模型的通用语言理解与生成能力,甚至可在 0.6B 规模的小模型上保持强劲性能,极易迁移部署到其他低资源语言。

局限与展望

  • 依赖预提取骨骼关键点的输入质量:当前模型基于 OpenPose 等关键点检测结果,若原始视频中手部严重遮挡、动作过快或光照不佳导致关节点丢失,上游误差将直接传导至时序切分与量化阶段。
  • 跨语种多对多监督对合成口语标签的依赖:非原生语言的监督语料由大模型预先离线翻译生成,翻译文本中若存在文化意译偏差或语境误读,可能给跨语种微调引入微量噪声。
  • 向跨语种手语生成(SLP)双向扩展的潜力:作者指出当前仅聚焦于手语到口语的翻译(SLT)。未来极具价值的方向是利用 Q-unit 的离散符号空间实现口语文本到手语骨骼动作的逆向生成(SLP),构建真正双向对称的无障碍多语言桥梁。

相关工作与启发

  • vs Uni-Sign (ICLR'25):Uni-Sign 探索了多语言手语的大规模统一建模,但依然依赖于连续的视觉空间特征映射;Q-BridgeNet 则率先通过共享-私有残差量化与变长动作切分将手语解构为离散 Q-unit 符号流,从表征结构上杜绝了多语种特征空间的相互污染。
  • vs MMSLT (ICCV'25) / SCOPE (AAAI'25):此类方法通过多模态大语言模型或 LLM 嵌入增强单一手语的翻译能力;Q-BridgeNet 不仅突破了单语种限制,还通过离散 Q-unit 作为中间通用桥梁,赋予了预训练 LLM 免受视觉噪声干扰的纯净语义输入。
  • vs 传统基于 Gloss 的两阶段 SLT:传统管线依赖昂贵且稀缺的人工 Gloss 标注作为中间瓶颈;Q-BridgeNet 完全摆脱 Gloss 监督,自发涌现出具备 Gloss 类似长尾分布特性的 Q-unit,为完全无监督符号化手语理解提供了全新范式。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ [将共享-私有残差量化与变长时序自适应切分结合,开创了离散 Q-unit 多语种手语解耦新范式]
  • 实验充分度: ⭐⭐⭐⭐⭐ [在三大多语种手语基准上全面对比了主流基线、单语模型及丰富消融配置,提供了 t-SNE 与频率分布深度分析]
  • 写作质量: ⭐⭐⭐⭐⭐ [逻辑链路严密,方法推导清晰自洽,实验分析透彻详实]
  • 价值: ⭐⭐⭐⭐⭐ [极大推动了多语言无障碍手语交流技术的发展,为跨语种多模态离散表示学习提供了通用设计思路]