跳转至

SOMA: From Surface Observations to Muscle Anatomy

会议: ECCV 2026
论文: ECCV 官方论文
项目主页: MPI SOMA
领域: 人体理解
关键词: 肌肉形变, 参数化人体模型, 生物力学数字人, 表面观测反演, 软组织动力学

一句话总结

针对传统人体模型仅停留在皮肤表层且有限元仿真开销巨大的痛点,SOMA 提出了首个基于多视角 RGB 视觉观测反演深层肌肉动态形变的数据驱动框架,结合定制 ArUco 紧身服捕获的 SKIM 高精度软组织形变数据集,利用解耦双层非线性混合形状与多物理几何先验,实现了仅凭骨骼姿态驱动真实、无自穿插的全身解剖级肌群动态生成。

研究背景与动机

构建高度逼真且可控的数字化身是计算机视觉与图形学的长期目标,在现代医学康复、体育科学和虚拟现实中具有关键价值。近二十年来,以 SMPL、GHUM 为代表的参数化人体模型通过低维姿态与形状空间标准化了人体表征,配合单目或多视角重建技术实现了高精度的表层几何捕获。然而,现有人体模型几乎全部停留在外表皮网格,无法洞察产生动作的深层生物力学结构。当数字化身的应用向生物力学仿真和高拟真动态深入时,单纯依赖表层网格驱动已暴露出明显的生理失真,亟需建立能够深入表皮之下、如实反映体内生理构造的解剖级数字人模型。

当前重建内部解剖结构的技术路径面临难以兼顾精度、动态与采集门槛的多重困境。启发式模板贴合方法基于简化几何假设,难以还原真实的肌群起止点与个体形态差异;基于医学影像(MRI、CT)的数据驱动方案虽然能够拟合高精度静态骨骼或局部组织,但高昂的采集成本、严苛的辐射/私隐限制,尤其是磁共振无法采集动态全身大范围动作的物理极限,使得深层动态肌群建模长期缺乏活体真值;而基于连续介质力学的有限元方法(FEM)或投影动力学仿真计算极其昂贵且高度依赖人工调参的物理参数,基于 OpenSim 的刚体肌骨模型又仅能模拟一维肌纤维发力而无法预测三维体积形变。因此,如何摆脱对昂贵医学影像与重型数值仿真的依赖,仅从可规模化获取的现实视觉信号中恢复深层肌肉动态,成为该领域亟待突破的反演难题。

本文打破了传统模拟与医学成像的思维定势,提出了从表皮动态视觉信号反演内部肌群形变的全新视角。研究团队认识到,人体表面在运动中的微小非刚性隆起、拉伸与滑动本质上正是深层肌肉收缩与脂肪体积守恒共同作用的外在投影。核心 idea:通过定制 ArUco 标记服构建高精度的表皮-解剖多视角动态数据集 SKIM,并提出解耦肌肉与表皮的非线性混合形状模型 SOMA,以规范空间表皮位移残差为监督信号,在多物理几何与体积守恒先验的正则化下,首次实现从骨骼姿态端到端推断全身解剖级动态肌肉形变。

方法详解

整体框架

SOMA 的目标是在给定任意全身骨骼姿态 \(\boldsymbol{\theta}\) 的条件下,端到端预测出解剖学合理、无几何自穿插的动态肌肉网格 \(\hat{\mathcal{M}}_{pred}\) 与皮肤表层网格 \(\hat{\mathcal{S}}_{pred}\),并进一步驱动高精度的各独立肌肉实体。方法首先在规范空间(T-pose)建立拓扑一致的骨骼 \(B_{bind}\)、全局肌肉 \(M_{bind}\) 与表皮 \(S_{bind}\) 三层几何模型,将姿态特征输入解耦的非线性网络,先后预测肌肉主动膨胀位移与皮肤被动残差位移;随后引入法向平滑、弯曲阻力、各向异性切向滑动以及三维棱柱体积守恒等物理先验,引导模型在稀疏标记点监督下收敛到解剖真实的形变状态;最后通过预计算的重心坐标绑定,将全局肌肉层的体积形变精确传递至数十块高精独立肌肉网格。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入:骨骼姿态特征 r*(θ)"] --> B["双层解耦混合形状预测<br/>U-Net级联生成肌肉与皮肤残差"]
    B --> C["规范空间残差场数据监督<br/>ArUco标记点非刚性偏差对齐"]
    C --> D["生物力学多物理几何正则<br/>Laplacian平滑/弯曲/切向滑动/棱柱等容"]
    D --> E["统一边界到独立肌群传播<br/>重心坐标绑定驱动高精解剖网格"]
    E --> F["输出:动态皮肤与解剖肌肉网格"]

关键设计

1. 双层解耦混合形状预测:解耦肌肉主动隆起与表皮被动滑动 传统姿态混合形状(Pose Space Deformation, PSD)多作用于单一外表面,无法表达软组织深浅层之间的差异化力学响应。为捕捉这一复杂动力学,SOMA 将形变解耦为两层级联表示。首先,深层肌肉网格负责捕捉由关节运动引起的初级结构形变(如肱二头肌、股四头肌的主动收缩隆起),模型采用以姿态相对旋转矩阵偏差 \(r^*(\boldsymbol{\theta}) \in \mathbb{R}^{9(J-1)}\) 为输入的 U-Net 网络 \(\Psi_M\),在规范空间直接回归肌肉顶点的三维形变场: $\(\hat{\mathcal{M}}_{pred}(\boldsymbol{\theta}) = \mathcal{M}_{bind} + \mathbf{D}_{musc}(\boldsymbol{\theta}), \quad \mathbf{D}_{musc} = \Psi_M(r^*(\boldsymbol{\theta}))\)$ 其次,表层皮肤不能刚性附着于肌肉之上,而必须在运动过程中沿组织发生相对滑动和法向缓冲,以保持皮下脂肪层的等容变形。SOMA 引入第二个级联 U-Net 网络 \(\Psi_S\),将皮肤总形变建模为肌肉形变与浅层残差位移之和: $\(\mathbf{D}_{skin}(\boldsymbol{\theta}) = \mathbf{D}_{musc}(\boldsymbol{\theta}) + \mathbf{D}_{res}(\boldsymbol{\theta}), \quad \mathbf{D}_{res} = \Psi_S(r^*(\boldsymbol{\theta}))\)$ 这一设计赋予了皮肤自由滑移和向内压缩的物理自由度,使外表面能够在关节屈曲受挤时自然褶皱或延展,彻底摆脱了单层模型在关节处的“糖果包装扭曲”(candy-wrapper)与局部体积塌陷。

2. 规范空间残差场数据监督:剔除刚性骨骼驱动与视角姿态干扰 直接在全局世界坐标系下监督网格顶点会不可避免地受到全局刚体运动、关节旋转累计误差的强烈干扰,导致网络难以专注微小的软组织非刚性隆起。SOMA 采用规范空间残差监督策略。利用定制 ArUco 紧身服追踪得到的稠密标记点多视角三维轨迹 \(\tilde{\mathbf{p}}_{k,t}^*\),首先通过带有预分配线性混合蒙皮(LBS)权重的规范标记点,利用前向骨骼运动学计算纯刚性骨骼驱动下的名义位置 \(\mathbf{p}_k(\boldsymbol{\theta}_t)\);随后通过逆混合蒙皮矩阵变换,将世界坐标系下的观测偏差逆变换回规范参考姿态,分离出纯粹的局部非刚性残差场 \(\boldsymbol{\delta}_{k,t}\): $\(\boldsymbol{\delta}_{k,t} = \left( \sum_{j=1}^J w_{k,j} \mathbf{R}_j(\boldsymbol{\theta}_t) \right)^{-1} \left( \mathbf{p}_{k,t}^* - \mathbf{p}_k(\boldsymbol{\theta}_t) \right)\)$ 网络在训练时,通过三角形重心坐标插值获取预测皮肤表面对应位置的形变位移 \(\hat{\boldsymbol{\delta}}_k(\boldsymbol{\theta})\),并在可见标记点子集上计算均方误差损失 \(E_{data}\)。这一设计从数学上完全剥离了全局位移与关节刚体转动的影响,迫使网络仅拟合随关节构型改变的局部肌肉膨胀与皮肤收缩。

3. 生物力学多物理几何正则:高阶弹性曲率与三维棱柱体积守恒 由于仅凭稀疏的表皮标记点去反演深浅两层连续形变场在数学上高度欠定,模型容易退化出高频噪声或错误的内部几何穿插。为此,SOMA 构筑了一套完备的差分几何与生物力学先验能量 \(E_{reg}\)。 在几何与平滑层面,引入基于 Voronoi 面积归一化的一阶拉普拉斯平滑项 \(E_{smooth}\) 与双调和(Biharmonic)二阶拉普拉斯弯曲阻力项 \(E_{bi}\),并在皮肤层施加远高于肌肉层的平滑权重(\(\lambda_{smooth}^\mathcal{S} \gg \lambda_{smooth}^\mathcal{M}\)),既有效抑制了皮肤表面的尖锐噪点与褶皱突起,又允许深层肌肉大范围平滑隆起;同时通过边长保持项 \(E_{stretch}\) 限制网格拉伸。针对组织滑移,设计各向异性切向约束 \(E_{tang}\),将切向滑动惩罚在肌肉层设为远大于皮肤层(\(\lambda_{tang}^\mathcal{M} \gg \lambda_{tang}^\mathcal{S}\)),确保肌肉在解剖骨骼基底上主要沿法向向外隆起而不会横向乱飘,同时放宽皮肤沿肌肉表面的滑移自由度。 在体积物理层面,针对人体软组织在毫秒尺度不可压缩的力学本质,SOMA 将皮下组织(皮肤到肌肉)及深层肌肉(肌肉到骨骼)离散为三维棱柱体集合 \(\mathcal{P}_l\),在非退化棱柱上施加等容约束损失: $\(E_{vol} = \sum_{l \in \{\mathcal{M}, \mathcal{S}\}} \lambda_{vol}^l \frac{1}{|\mathcal{P}_l^*|} \sum_{p \in \mathcal{P}_l^*} \frac{\big(\text{Vol}(p) - \text{Vol}(p_0)\big)^2}{|\text{Vol}(p_0)| + \epsilon}\)$ 其中体积采用两点高斯-勒让德求积(Gauss-Legendre Quadrature)精确计算有符号体积。值得注意的是,该损失将皮肤体积放在规范空间约束、将深层肌肉体积放在姿态驱动空间约束,迫使肌肉产生主动形变以直接抗衡传统 LBS 的几何体积挤压;更巧妙的是,由于计算的是有符号体积,一旦发生骨骼穿透肌肉或肌肉穿透皮肤的几何反转,体积将突变为负值并激发出巨大的能量惩罚,从而在无需重型碰撞检测算法的前提下,隐式杜绝了多层组织的自穿插与交叠。

4. 统一边界到独立肌群传播:基于重心坐标绑定的解剖实体驱动 在实际图形学动画与医学可视化应用中,仅有统一外包络网格往往无法满足对特定解剖肌群的观察与交互需求。为兼顾实时运算效率与独立解剖结构的高精度呈现,SOMA 提出了一种基于拓扑投影的形变传播机制。在初始静态重建阶段,通过从表皮向内沿法线投射光线,精确建立外部标记点、统一肌肉边界 \(M_{bind}\) 以及各块独立解剖肌肉 \(\{M_{bind}^m\}_{m=1}^{N_m}\)(包含休息状态下的各主要肌束几何)的对应映射 \(\phi(p_k)=m\)。在推理阶段,当非线性 U-Net 预测出统一肌肉层 \(M_{bind}\) 的顶点位移场后,系统利用预计算的三维重心坐标绑定权重,将连续位移场瞬时差值并传递至底层各独立肌肉网格的每一个顶点。该机制使得 SOMA 在保持统一轻量神经网络推理开销的同时,能够无缝导出符合生理结构的高分辨率独立解剖肌群动态,支持在标准渲染引擎中针对单块肌肉进行局部形变查询与孤立显示。

损失函数 / 训练策略

模型采用端到端联合优化,总目标函数定义为: $\(E_{total} = \lambda_{data} E_{data} + E_{reg}\)$ 其中正则项 \(E_{reg} = E_{smooth} + E_{bi} + E_{stretch} + E_{tang} + E_{vol}\) 全面涵盖上述物理先验。训练采用 Adam 优化器,在包含 5 位受试者、45 分钟多视角 RGB 动捕训练集的 SKIM 数据上进行优化,受试者穿戴定制 ArUco 紧身衣,由 120 台相机同步记录高帧率动态。在训练中,模型仅利用可见标记点进行反向传播,掩码机制过滤了因大幅度肢体自遮挡带来的噪声输入。

实验关键数据

主实验

实验在未见测试运动序列上评估全局追踪精度、大动态软组织区域误差、层间几何自穿插率以及体积变形保持率。对比基线包括标准运动学基线 LBS(对静态扫描施加线性混合蒙皮)以及目前最先进的非耦合隐式体积预测模型 HIT(基于 SMPL 拓扑)。

方法 全局均值误差 MPME (mm) ↓ 中位数误差 MedPME (mm) ↓ P90 误差 (mm) ↓ 动态区误差 DRE >25mm (mm) ↓ 穿插率 S→M (%) ↓ 穿插率 M→B (%) ↓ 体积变化率 ∆Vol S→M (%) ↓ 体积变化率 ∆Vol M→B (%) ↓
LBS(运动学基准) 13.11 15.64 26.03 134.28 0.85 0.93 N/A 18.81
HIT [27] (CVPR 2024) 115.34 50.15 354.80 151.65 7.61 N/A 2.99 1.95
SOMA (本文) 13.43 11.51 19.20 64.52 0.85 0.93 1.37 10.35

注:LBS 不具备表皮主动纠偏功能,皮下脂肪层体积无法定义变化(记为 N/A);LBS 穿插率看似较低是因为表皮与深层组织共用相似蒙皮权重发生同步挤压塌陷;HIT 缺失个体化比例匹配导致全局误差偏大,且缺乏物理耦合导致 S→M 穿插高达 7.61%。

消融实验

消融实验全面考察了网络架构选择与各项物理正则项对模型解剖形变能力的影响(测试集指标评估)。

配置 / 消融项 全局误差 MPME (mm) ↓ 动态区 DRE >25mm (mm) ↓ 穿插率 S→M (%) ↓ 穿插率 M→B (%) ↓ 体积变化率 ∆Vol S→M (%) ↓ 体积变化率 ∆Vol M→B (%) ↓ 说明
Full Model (U-Net) 13.43 64.52 0.85 0.93 1.37 10.35 完整模型:双层 U-Net + 全部物理先验
Linear Blendshapes 16.52 64.58 0.85 0.93 3.57 11.02 线性混合形状,难以表达复杂非线性肌肉隆起
MLP 架构 14.03 64.93 0.86 1.09 5.74 11.05 缺少局部空间权重共享,表皮体积保持劣化
w/o Physics (无物理先验) 13.71 64.93 0.87 0.95 9.37 13.54 缺少几何正则,内部体积出现严重畸变
w/o Vector (去向量平滑/滑动) 13.46 64.57 0.87 0.94 8.27 12.63 缺少切向限制导致顶点漂移,棱柱剪切畸变
w/o \(E_{bi}, E_{stretch}\) (去张力) 13.54 64.48 0.88 0.94 10.54 13.76 出现严重高频网格褶皱以投机满足体积约束
w/o \(E_{vol}\) (去体积守恒) 13.67 64.57 0.87 0.97 8.28 11.87 表皮体积误差由 1.37% 剧增至 8.28%

关键发现

  1. 动态大形变区域性能倍增:在软组织发生剧烈运动的非刚性区域(形变阈值 \(\tau > 25\) mm),SOMA 将追踪误差从经典 LBS 的 134.28 mm 降低至 64.52 mm,下降超过 51.9%,彻底解决了四肢屈伸时传统骨骼蒙皮引起的体积损失与关节塌陷。
  2. 物理先验是解耦欠定性的关键支柱:消融结果显示,去掉弯曲阻力与边长拉伸约束(w/o \(E_{bi}, E_{stretch}\))会导致浅层体积误差飙升至 10.54%,网格会退化出高频褶皱;而去掉了切向滑动约束(w/o Vector)则会导致表面顶点横向漂移并剪切棱柱体,间接瓦解了体积约束的效果。
  3. 深浅层力学权衡的物理真实性:完整模型中,浅层皮下脂肪层的体积变化仅为 1.37%,而深层肌肉到骨骼层保留了 10.35% 的体积形变。这是由于优化器在深层区域优先保证严格无自穿插(保持 0.93% 的极低穿插率),避免了深层肌肉因强行膨胀而严重刺穿骨骼网格,展现出符合生物力学现实的物理妥协。

亮点与洞察

  • 从表皮微观残差逆推深层解剖的全新反演范式:传统图形学视表皮褶皱为待消除的变形瑕疵,SOMA 反其道而行之,将其确立为内部肌群状态的高信噪比物理载荷,填补了计算机视觉从表层几何走向深层生理动力学的关键空白。
  • 有符号棱柱高斯积分与各向异性滑动的先验构建:在双层网格间构建有符号体积棱柱,通过 Gauss-Legendre Quadrature 快速积分;几何反转自动激发出负体积巨额惩罚,在不引入昂贵空间碰撞网格检测的前提下,原生杜绝了深浅组织的自相穿透。
  • 兼顾极简实时推理与高精解剖可视化的解耦传播设计:运行时仅需向前传递两个轻量 U-Net,随后利用重心坐标直接解耦投射至数十块独立肌群,不仅在 Viser 中达成了毫秒级实时交互,也为医学科普与运动康复提供了模块化肌束动力学观察窗口。

局限与展望

  • 依赖初始静态解剖模板拟合:目前框架依赖于基于表皮扫描的静态内部解剖初始估计(Komaritzan 等人的方法),若初始肌骨几何存在偏差,该偏差会被带入后续动态形变中;未来可探索将基底解剖结构与动态位移场进行端到端联合双向优化。
  • 标记紧身衣的数据获取依赖:虽然推理阶段仅需骨骼姿态输入,但训练数据高度依赖 ArUco 定制紧身衣在多相机棚内的标定与追踪;后续工作可利用本数据集训练自监督或无标记的表皮稠密对应点追踪网络,降低采集门槛。
  • 未建模等长收缩与自主肌电激活:当前形变完全由关节运动学姿态 \(\boldsymbol{\theta}\) 驱动,无法表达在关节角度保持静止时的肌肉主动发力、对抗收缩(co-contraction)或外部负重挤压;未来引入表面肌电信号(sEMG)或微型力传感器作为多模态输入将是重要的突破方向。
  • 个性化专人专模向通用大模型泛化:当前 SOMA 模型为特定受试者训练,跨体型、跨体脂率的泛化性有待拓展,未来构建涵盖多样体型的大规模通用解剖参数化模型具有广阔前景。

相关工作与启发

  • vs SMPL / GHUM 等表层参数化模型:传统表层模型使用线性混合蒙皮和唯象姿态修正,仅表达表皮轮廓且缺乏内部解剖层级;SOMA 突破了表皮限制,首次实现由姿态驱动且具备物理等容特性的双层表皮-肌肉立体结构生成。
  • vs HIT (CVPR 2024):HIT 基于通用 SMPL 拓扑利用隐式神经场预测体内组织静态占用率,由于未耦合显式边界力学约束且基于静态医学切片训练,在动态运动下表皮与组织穿插率高达 7.61%;SOMA 依托显式双层网格与多物理能量,将穿插率控制在 0.85% 以内,动态形变细节更加锐利逼真。
  • vs FEM 肌肉仿真与 OpenSim:FEM 物理仿真逼真但单帧运算耗时以分钟计且难以与真实受试者活体数据严格校准,OpenSim 侧重力矩与一维肌腱发力却无法生成三维外形;SOMA 属于数据驱动的实时神经形变场,兼具毫秒级前向渲染速度与真实活体动捕数据的生理保真度。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ [首创基于常规多视角 RGB 视觉观测与定制标记服反演深层动态肌肉形变的范式,立意极佳]
  • 实验充分度: ⭐⭐⭐⭐☆ [自建高质量多层 SKIM 数据集,软组织大动态区与几何等容消融充分,仅受限于受试者规模]
  • 写作质量: ⭐⭐⭐⭐⭐ [数学推导严谨,生物力学物理先验机理阐述清晰,图表逻辑自洽完整]
  • 价值: ⭐⭐⭐⭐⭐ [架起了计算机视觉表层人体与计算机图形学/生物力学深层生理化身之间的桥梁,应用前景广阔]