跳转至

RASA: Disentangled Spatial-Motional Priors for Cross-Identity Character Animation

会议: ECCV 2026
论文: ECCV 官方
代码: https://hidream-ai.github.io/RASA/
领域: 人体理解
关键词: 跨身份角色动画, 扩散变换器, 空间姿态校准, 3D运动先验, 解耦表征

一句话总结

针对跨身份角色动画中尺度与体态不一致导致的结构错位问题,RASA提出解耦的空间-运动先验分层注入架构,在去噪初始步通过空间先验校准器(SPC)消除2D几何偏差,并在DiT中间层注入SMPL运动语义向量(IMG)保障3D解剖一致性。

研究背景与动机

基于潜在扩散模型(LDMs)与扩散变换器(DiTs)的角色图像动画技术已成为数字人合成与互动内容生成的核心工具。然而,现有模型在实际跨身份驱动场景(Cross-Identity Character Animation)中普遍面临严重的性能瓶颈。驱动视频中的源人物与给定的参考图像角色之间往往存在显著的位置偏移、缩放尺度不一以及肢体骨骼比例悬殊等几何失配现象(即姿态-参考错位,pose-reference misalignment)。主流扩散生成管线大多隐式假设参考角色与驱动骨架在空间几何上保持一致,一旦输入出现悬殊的体态差异,极易在生成过程中引发严重的结构畸变、肢体拉伸甚至身份坍塌。

传统方案往往采用显式重定向(Retargeting)启发式预处理、姿态数据增强,或在去噪网络深层进行多模态晚期特征融合。然而,启发式几何重定向极易损失动作语义与末端轨迹细节;而在扩散网络中间层强行混杂姿态与外观特征,会导致结构几何校准与纹理着色过程相互纠缠,生成过程中出现不可逆的伪影累积。更本质的矛盾在于:跨身份动画实质上包含两类正交的先验需求——消除2D视平面上的尺度、位移和骨骼比例偏差(空间对齐),以及保持视角鲁棒、关节旋转物理合理的动态控制(运动控制)。现有方法将两者混为一谈,难以兼顾几何对齐与自然动态。

本文切入的角度是将空间几何映射与细粒度动作执行从生成机制上彻底解耦:在生成起始阶段以连续方式纠正2D空间错位,而在深层网络中提供与身份外形无关的深层3D动作引导。核心 idea:提出解耦空间与运动先验的角色动画框架 RASA,通过生成初始阶段的“空间先验校准器(SPC)”以帧级跨注意力纠正 2D 几何错位,并在 DiT 中间层引入“固有运动导引器(IMG)”分层注入 SMPL 运动语义,实现兼顾真实比例与解剖物理一致性的跨身份动画生成。

方法详解

整体框架

RASA 以开源视频生成模型 Wan2.1(1.3B DiT)为基础扩散骨干网络,采用流匹配(Flow Matching)架构建模视频潜变量生成过程。输入包括一张参考角色图像 \(I_r\) 及其 2D 姿态 \(P_r\)、包含 \(T\) 帧的源驱动姿态序列 \(P_d\) 以及对应的三维人体姿态参数 \(\theta\)。为了在训练阶段模拟剧烈的跨身份错位,系统首先对驱动姿态施加随机尺度缩放、平移偏移与肢体丢弃等空间变换扰动。随后,整个扩散过程通过解耦的双流机制协同驱动:空间先验校准器(SPC)在潜在表征输入 DiT 的每个去噪起始步,利用 2D RoPE 跨注意力将参考骨架结构对齐到驱动动作并直接累加到噪声潜变量中;固有运动导引器(IMG)则提取去除了身材形状(\(\beta\) 参数)的纯动作关节特征向量,经过运动编码器投影后,分层注入到 DiT 中间骨干层(Block 2 至 15)。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入:参考图像 $I_r$ 与驱动姿态 $P_d$"] --> B["扰动模拟与特征提取<br/>随机空间变换 + 共享轻量编码器"]
    B --> C["空间先验校准器(SPC)<br/>以驱动为 Query 的 2D RoPE 跨注意力"]
    C --> D["生成起始阶段几何校正<br/>对齐特征逐元素注入去噪初始潜变量"]
    B --> E["固有运动导引器(IMG)<br/>去除体型参数的 SMPL 关节旋转向量"]
    E --> F["中间层高阶运动语义注入<br/>分层多投影映射至 DiT Blocks 2-15"]
    D --> G["DiT 骨干网络速度场预测与 ODE 求解"]
    F --> G
    G --> H["输出:结构一致且保身份的高清动画视频"]

关键设计

1. 空间先验校准器(SPC):在生成初始步消除 2D 几何失配

以往晚期融合或启发式预处理常常在纹理生成中引入无法消除的骨骼伪影。SPC 将姿态对齐重塑为潜在空间中的自适应结构校准过程。针对带扰动的驱动姿态 \(\tilde{P}_d\) 与参考姿态 \(P_r\),轻量级共享编码器分别抽取参考潜在表征 \(z_r \in \mathbb{R}^{C \times H \times W}\) 与时序驱动潜在表征 \(z_d \in \mathbb{R}^{T \times C \times H \times W}\)。为了建立两具悬殊骨架之间的非局部对应关系,模块采用以驱动特征为查询、参考特征为键值的帧级空间跨注意力(Frame-wise Spatial Cross-Attention),并显式引入 2D 旋转位置编码(RoPE)维持拓扑空间几何关系:

\[ \hat{z}_{d,t} = z_{d,t} + \text{Attention}\left(\text{RoPE}(Q_t), \text{RoPE}(K), V\right) \]

其中 \(Q_t = z_{d,t}\) 展平为空间 token 序列,\(K=z_r, V=z_r\)。消融证实,以驱动特征作为 Query 能够有效利用动态驱动 token 去检索并迁移参考角色的几何尺度;若反向以参考图像为 Query 则会扼杀动作的动态传播。校准后的特征 \(\hat{z}_d\) 在 DiT 每一轮去噪前与带噪潜变量逐元素相加,从而在扩散反向演变起始点就牢牢锚定参考角色的身体比例与全局布局,阻断了几何误差的累积传递。

2. 固有运动导引器(IMG):中间层解剖学视角一致性注入

仅依赖 2D 空间对齐会受限于单目投影的深度多义性,在人体发生大幅度旋转或前后关节遮挡时极易发生肢体体积塌陷。IMG 模块通过 3D 参数化先验实现与身份外观彻底解耦的动态引导。利用 ScoreHMR 从驱动视频中反演 SMPL 姿态,并严格剥离特定人物的身材形状参数 \(\beta\),仅保留关节点相对旋转角、根节点线速度与脚部接触信号构成的纯运动向量 \(m \in \mathbb{R}^{T \times 263}\)。该向量经由预训练运动编码器投影为时序潜在向量 \(z_{\text{3Dm}} \in \mathbb{R}^{T \times D}\)。

不同于作用在输入端的 SPC,运动语义属于抽象的高阶动态信号。RASA 设置了 14 层可学习投影层,将其分层注入到 DiT 骨干网络的第 2 层至第 15 层中间块。该机制使模型在底层专注由 SPC 主导的 2D 空间与轮廓渲染的同时,在深层持续接受 3D 解剖物理约束的微调与视角补全,在确保与参考形象贴合的前提下赋予角色符合运动学原理的自然躯干形变。

3. 参考身份隔离与 CIM-Bench 真实错位评测体系

为了彻底切断静态外观与时序位移的混淆,模型在将参考图潜变量 \(z_r\) 沿时间轴拼接至视频潜变量序列时,显式为 \(z_r\) 施加了大幅度位置编码偏移(Positional Encoding Offset),让自注意力层在全局借调参考角色精细纹理的同时,不干扰后续动态流的时空演化。针对以往评测集仅通过仿射变换合成伪错位的局限,本文构建了真实跨身份基准 CIM-Bench。团队通过先进 T2I 模型生成多风格虚拟角色图像,并与真实人类肖像配对,借助商业视频模型生成不同角色执行同一动作的视频,最后以高质量人工清洗获得 656 组具有真实体型比例冲突但动作完全一致的成对测试集。

损失函数 / 训练策略

骨干网络采用流匹配条件速度场回归目标函数进行端到端优化:

\[ \mathcal{L} = \mathbb{E}_{z_0, z_1, t}\left[ \| v_\theta(z_t, t, c) - (z_1 - z_0) \|_2^2 \right] \]

其中控制条件 \(c\) 包含文本提示词、参考图像潜变量 \(z_r\)、SPC 校准结构先验 \(\hat{z}_d\) 以及 IMG 运动向量 \(z_{\text{3Dm}}\)。模型基于 8 张 NVIDIA A100 GPU 训练,采用 AdamW 优化器,学习率设为 \(1 \times 10^{-5}\)。训练阶段视频切片长度统一设为 41 帧,分辨率统一为 \(832 \times 480\),总训练周期约 2 天。

实验关键数据

主实验

在标准同源驱动数据集 TikTok 以及真实跨身份错位基准 CIM-Bench 上的对比结果如下所示。RASA 仅需 1.3B 参数量,在两套测试基准上均超越了现有 SOTA 方法,尤其在跨身份场景(CIM-Bench)下优势极为显著。

数据集 模型 PSNR ↑ SSIM ↑ LPIPS ↓ FID ↓ FVD ↓ FID-VID ↓ Sim-Arc ↑
TikTok MTVCrafter (5B) 19.37 0.784 0.217 19.46 140.60 6.98 -
TikTok One-to-All (14B) 18.07 0.812 0.254 50.49 297.94 13.93 -
TikTok RASA (Ours, 1.3B) 22.03 0.830 0.189 18.93 190.82 3.32 -
CIM-Bench Animate-X 14.05 0.426 0.474 105.14 1312.60 75.47 0.51
CIM-Bench MTVCrafter 14.19 0.431 0.457 85.21 1723.89 85.21 0.54
CIM-Bench Wan-Animate 11.29 0.372 0.585 178.58 1920.88 137.05 0.35
CIM-Bench One-to-All (1.3B) 13.75 0.383 0.471 96.70 1324.74 76.79 0.51
CIM-Bench RASA (Ours, 1.3B) 15.93 0.472 0.372 60.96 667.96 17.63 0.72

消融实验

在 TikTok / CIM-Bench 上的核心模块逐项消融分析证实了空间校准与运动导引的协同价值:

配置 PSNR ↑ (TikTok/CIM) SSIM ↑ (TikTok/CIM) LPIPS ↓ (TikTok/CIM) FID ↓ (TikTok/CIM) FVD ↓ (TikTok/CIM) FID-VID ↓ (TikTok/CIM) 说明
仅 SMS (随机姿态空间扰动) 18.90 / 14.60 0.799 / 0.453 0.209 / 0.393 23.04 / 80.96 316.45 / 737.48 10.77 / 30.93 缺乏显式 2D 对齐机制,CIM-Bench 表现低迷
仅 IMG (仅 3D 运动导引) 15.47 / 13.89 0.707 / 0.416 0.356 / 0.445 41.57 / 91.17 1567.03 / 1625.69 15.90 / 37.46 缺少 2D 轮廓几何锚定,图像保真度严重恶化
SMS + IMG 18.51 / 14.14 0.811 / 0.470 0.238 / 0.399 28.83 / 77.34 487.66 / 706.22 22.06 / 34.51 未做帧级跨注意力对齐,生成结构漂移严重
SMS + FCA (完整 SPC) 20.86 / 15.26 0.820 / 0.471 0.202 / 0.391 22.01 / 71.16 289.16 / 686.79 6.56 / 27.05 具备稳健 2D 校准,但缺乏 3D 时空动作先验
完整模型 (SPC + IMG) 22.03 / 15.93 0.830 / 0.472 0.189 / 0.372 18.93 / 60.96 190.82 / 667.96 3.32 / 17.63 空间校准与运动先验解耦协同,指标全面最优

关键发现

  • SPC 是解决几何形变的前提,IMG 是动作时间连续性跃升的核心:消融数据显示,仅加入 SPC(SMS+FCA)即可使 TikTok 上的 PSNR 从 18.90 跃升至 20.86;而在此基础上叠加 IMG 后,FVD 指标产生质的飞跃(TikTok 从 289.16 骤降至 190.82,CIM-Bench 从 686.79 降至 667.96,FID-VID 缩减一半),证明 3D 旋转先验是消除时序抖动和肢体卷曲的关键。
  • 高轻量化与极低推理开销:SPC 与 IMG 模块总计仅引入 19.78M 参数(不足 Wan2.1 骨干网络 1.3B 总量的 1.52%)。在单张 NVIDIA H100 GPU 上生成 41 帧 832×480 视频,相比 Baseline 仅增加 2 秒延迟(59 秒微增至 61 秒),显存占用仅 11.95 GB,相比 Wan-Animate 的 42.29 GB 显存大幅缩减。

亮点与洞察

  • 解耦式分层注入范式:将空间骨架校准置于去噪起始步,而将抽象的 3D 运动流引导下沉至 DiT 中间层,这种“外轮廓在入口对齐、动态流在深层注入”的分工从根源上避免了外观纹理与动作驱动的特征缠绕。
  • 去除 Shape 属性的纯净运动表征:彻底抛弃包含身材体态的 SMPL \(\beta\) 参数,仅提取关节旋转与相对速度 \(m \in \mathbb{R}^{T \times 263}\),使动作信号具备真正的跨物种/跨体态普适性。
  • 驱动为 Query 的反向结构检索机制:在 SPC 跨注意力中用动态驱动姿态主动“寻址”参考角色骨架,既精准拉伸了结构比例,又保留了原始动作的动态幅度。

局限与展望

  • 依赖严格的人形拓扑 1:1 映射:方法假设驱动者与参考角色共享一致的关节拓扑,对于非人多肢生物(如四足动物、八爪妖怪或无肢躯壳)会出现对应关系失效。
  • 手部与面部微表情建模依赖 2D 姿态:当前 SMPL 参数未显式建模手指(MANO)与复杂面容(FLAME),手部与面部动态仍依赖 DWPose 2D 引导,在极端视角下仍有伪影风险。
  • 未来方向:作者团队计划集成 SMPL-X/MANO 全身模型,并进一步探索面向异构非人形拓扑的通用角色动作迁移机制。

相关工作与启发

  • vs Champ / UniAnimate: Champ 依靠 SMPL 深度、法线等 5 种条件堆叠,计算复杂度与依赖过高;UniAnimate 仅采用启发式全局平移缩放粗略对齐。RASA 仅需 2D 姿态与轻量纯运动向量,通过潜在空间注意力学习非线性自适应校准,更具泛化性。
  • vs Animate-X / One-to-All: Animate-X 在大尺度错位下出现肢体断裂与外观畸变;One-to-All 依靠无对齐直接生成,易发生严重的身份漂移。RASA 的双重先验设计兼顾了严苛的身份保真度与大幅度动作迁移能力。

评分

  • 新颖性: ⭐⭐⭐⭐☆ 空间对齐与运动引导在扩散模型中的分层解耦机制清晰且设计巧妙。
  • 实验充分度: ⭐⭐⭐⭐⭐ 兼具真实人像与虚拟艺术角色的 CIM-Bench 测试严密,消融完备。
  • 写作质量: ⭐⭐⭐⭐⭐ 结构逻辑环环相扣,图表清晰,问题定义与解决路径极其明确。
  • 价值: ⭐⭐⭐⭐⭐ 为跨体态虚拟数字人驱动和 AIGC 角色动画提供了极具实用价值的工程参考。