InclusiveHuman-10K: Towards Inclusive Human Parsing Beyond the Intact-Limb Assumption¶
会议: ECCV 2026
论文: ECCV 原文
领域: 医学图像
关键词: 人体解析 / 残疾包容性 / 残肢与假肢分割 / 基准数据集 / 边界感知评估
一句话总结¶
InclusiveHuman-10K(IH-10K)打破了传统人体解析中预设人人都具备完整健全肢体(intact-limb assumption)的认知盲区,构建了包含 10,555 张真实场景图像、14,939 个人体实例与 160,133 个高质量像素级掩码的人体解析基准,首次将残肢、三类假肢及行动辅助器具纳入标准语义体系并确立分组解耦评测协议。
研究背景与动机¶
人体解析作为以人为中心的计算机视觉底层基础任务,致力于对人体各个解剖学部位与服饰配件进行像素级语义标注,直接支撑着虚拟试衣、增强现实交互、具身交互以及动作与步态康复分析等关键下游应用。然而,长期主导该领域的经典基准数据集(如 LIP、CIHP、MHP v2 等)在标签体系设计上均隐式遵循“完整肢体假设”(intact-limb assumption),其类别仅覆盖头发、面部、对称的四肢完好部位以及外穿衣物,完全未对残疾群体的残肢、义肢或辅助器具进行语义定义。世界卫生组织(WHO)指导报告指出,全球随时有约 0.5% 的人群需要假肢或矫形器支持,涉及数千万人。在缺乏明确语义类别约束的现状下,现有 SOTA 人体解析算法在面对肢体残缺或佩戴假肢的个体时,系统性地将残肢与假肢粗暴归类为“背景”或错误强行映射至附近的健全肢体部位,导致弱势群体在学术基准与实际视觉应用中处于隐形与被排斥状态。
这一缺陷不仅关乎算法的公平性与伦理包容度,更直接制约了辅助诊疗、智能康复与日常交互系统在真实复杂场景中的可靠性。残疾个体的肢体解剖结构天然打破了标准骨骼对称性与拓扑连续性,残肢可能在任意解剖高度终止,义肢则涵盖跑刀、机械钩乃至带活动铰链的多自由度机械关节,且伴随接受腔与残肢皮肤之间的复杂接触与遮挡。现有模型由于从未在训练阶段接触这类非完整拓扑样本,无法学习残肢边界特征与机电辅助器具形态,导致下游系统无法对患者肢体进行精确分割与状态估计。
本文的目标是填补这一跨学科研究空白,消除因数据集盲区造成的算法偏差。核心 idea:打破完整肢体假设,构建首个以肢体缺失与假肢人群为核心的大规模人体解析基准 InclusiveHuman-10K,引入显式细粒度残肢、三层次假肢及辅助器具语义类别,并建立常规与残疾类别解耦的分组评测机制。
方法详解¶
整体框架¶
InclusiveHuman-10K(IH-10K)的方法论核心在于建立一套面向非完整肢体人群的系统化数据规范、标注协议与评测基准。数据构建与评估的整体流程涵盖四个主要阶段:多源真实场景多样化数据采集、基于解剖与假肢结构的三层级细粒度语义定义、严格的多轮交叉检验标注流程,以及涵盖常规与残疾子群的分组解耦评测基准。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}, 'subGraphTitleMargin': {'top': 8, 'bottom': 16}}}%%
flowchart TD
A["多源图像采集与候选清洗<br/>日常/体育/临床三大真实场景"] --> B["三层级包容性语义体系<br/>常规27类 + 残疾相关34类"]
B --> C["多轮交叉质检验收协议<br/>X-AnyLabeling多边形精标+全量审核+组长仲裁"]
C --> D["分组解耦与边界敏感评测协议<br/>All / Common / Disability-Related 分层评估"]
D --> E["基准模型评估与瓶颈诊断<br/>微调解析 / 语义分割 / 零样本开集模型"]
关键设计¶
1. 面向残缺解剖与辅助装置的三层级包容性语义体系:解决传统标签体系的结构性排斥
针对传统基准将残疾部位统摄为背景或误识别为完整肢体的核心痛点,IH-10K 在继承传统基准(LIP、CIHP)27 个常规通用类别(如头发、面部、健全上臂、健全小腿、上衣、裤子等)的基础上,系统性扩展了 34 个残疾相关专属语义标签。该体系分为三大核心维度:首先是残肢细粒度分段,为避免截肢端面与假肢接口处的语义混淆,根据解剖截肢水平细化为左/右上臂残肢、左/右前臂残肢、左/右大腿残肢、左/右小腿残肢共 8 个独立部位;其次是三层次假肢形态分类,参考临床假肢装配与康复工程规范,按机械复杂度划分为美容型假肢(Cosmetic,无活动铰链、以恢复外形为主)、功能性非关节假肢(Functional non-articulated,如用于跑步的高弹性储能碳纤维跑刀、被动机械挂钩)以及关节型假肢(Articulated,具备膝关节、踝关节或肘关节等机械铰链);最后是行动辅助器具,显式标注轮椅(Wheelchair)与拐杖(Crutch)。整套标签体系使模型必须显式学习残肢非对称拓扑结构与人-机耦合界面的像素级表征。
2. 闭环多轮交叉检验标注协议:确保非标准解剖边缘的像素级高精度
由于残肢截面、假肢接受腔(Socket)、机械支杆(Pylon)与人体肌肉皮肤交界处存在极大的形态多样性与局部模糊性,传统粗粒度或自动化标注容易产生严重的边缘漂移。IH-10K 制定了完备的标注规程:招募 25 名经过专业解剖学与假肢分类培训的标注员,基于 X-AnyLabeling 交互式标注工具手工绘制精细多边形掩码。对于发生衣物或支具遮挡的边缘,规程要求标注员严格以“最短解剖合理闭合轮廓”完成分割边界推断;若遇到视角遮挡严重导致假肢子类别无法确切分辨的极端情形,则遵循消歧机制不在区域中强行分配子类以防止噪声注入。在质控上实行三级递进流水线:初标完成后由第二名资深评审员执行全量盲审并批注修改意见,原标注员完成靶向修正后,再由质控组长进行跨批次一致性抽检与争议样本终审仲裁,全流程保留详尽的审计追踪日志。
3. 解耦子群与边界敏感的公平评测基准:揭示并量化弱势类别的长尾性能鸿沟
在评测机制设计上,论文针对标准指标容易被占绝大多数的健全常见类别主导、掩盖少数群体失败模式的问题,提出了分群评估协议。将评估结果严格划分为全体类别(All)、常见类别(Common)与残疾专属类别(Disability-Related)三个互补子群。在评价指标上,除汇报传统的均交并比(mIoU)、部位检测精度(APp50、APpvol)以及正确解析部位百分比(PCP)外,特别引入了边界交并比(Boundary IoU, BIoU):
其中 \(G\) 与 \(P\) 分别代表真实掩码与预测掩码,\(G_d\) 与 \(P_d\) 代表以边界为中心由宽度参数 \(d\) 确定的膨胀带区域。BIoU 专注于残肢末梢与假肢机械接合部狭长过渡带的重叠精度,对边缘漂移施加更强的惩罚,使得模型在残肢边缘、接受腔接缝处的亚像素级几何失效模式得以精确量化。
损失函数 / 训练策略¶
在基准验证实验中,所有监督学习模型均按照官方标准 7:1:2 划分(训练集 7,388 张图像、验证集 1,055 张、测试集 2,112 张)进行端到端微调。对于以 AIParsing 和 UniParser 为代表的人体解析网络,采用多任务损失函数(交叉熵解析损失配合边缘对齐或相关性关联损失);对于 FCN、SegFormer、Mask2Former 及 SegNeXt 等通用语义分割架构,采用加权交叉熵与 Dice / Mask 损失联合优化。开集模型(OVIS、OVSeg、PromptSeg)则保持预训练权重冻结,以评估其在开集文本提示或点/框提示下的零样本泛化能力。
实验关键数据¶
主实验¶
在 IH-10K 官方测试集上,专用人体解析模型及代表性语义分割基准的微调评测结果如下表所示。每个指标均汇报“全体得分(常见类别得分 / 残疾专属类别得分)”的细分表现。
| 架构 / 模型 | 骨干网络 | mIoU (All | Common / Disab.) | APp50 (All | Common / Disab.) | BIoU (All | Common / Disab.) | PCP (All | Common / Disab.) |
|---|---|---|---|---|---|
| AIParsing | ResNet50 | 30.97 (46.34 / 17.51) | 31.70 (46.51 / 6.93) | - | 35.92 (48.06 / 18.81) |
| AIParsing | ResNet101 | 31.49 (50.78 / 15.60) | 46.77 (59.73 / 13.37) | - | 48.81 (58.85 / 29.62) |
| UniParser | ResNet50 | 39.06 (56.55 / 25.18) | 43.08 (65.07 / 25.62) | - | 44.66 (65.16 / 28.38) |
| UniParser | ResNet101 | 41.43 (58.10 / 28.19) | 45.67 (67.77 / 28.11) | - | 47.11 (66.76 / 31.50) |
| FCN | ResNet101 | 21.14 (35.32 / 9.47) | - | 12.82 (19.53 / 7.29) | - |
| SegFormer | MIT-B5 | 24.54 (39.73 / 12.04) | - | 14.94 (22.23 / 8.94) | - |
| Mask2Former | Swin-L | 28.07 (45.05 / 14.09) | - | 19.41 (28.67 / 11.78) | - |
| SegNeXt | Mscan-l | 28.19 (45.01 / 14.34) | - | 17.78 (26.12 / 10.92) | - |
消融实验¶
为了进一步诊断零样本开集模型在残疾相关概念上的识别表征能力瓶颈,下表对比了不同开集实例分割(OVIS)、开集语义分割(OVSeg)以及交互式提示分割(PromptSeg)在有/无真实几何先验下的性能表现。
| 任务类型 | 算法模型 | 骨干网络 / 提示机制 | 全体 mIoU | 常见类别 mIoU | 残疾类别 mIoU | 核心分析说明 |
|---|---|---|---|---|---|---|
| OVIS (文本驱动) | Grounded-SAM | Huge / Text | 6.10 | 11.56 | 1.77 | 文本提示对残疾概念严重失灵 |
| OVIS (文本驱动) | Grounded-SAM2 | Large / Text | 4.69 | 8.97 | 1.30 | 文本检测端失效占比高达 85.26% |
| OVIS (文本驱动) | X-Decoder | Focal-L / Text | 1.04 | 1.37 | 0.79 | 假肢与残肢概念完全未对齐 |
| OVSeg (文本驱动) | CLIPSeg | - / Text | 2.68 | 5.81 | 0.19 | 残疾类别出现断崖式性能崩溃 |
| PromptSeg (点提示) | SAM2 | Large / Centroid Point | 23.63 | 19.66 | 26.78 | 单点提示引发大面积背景或相邻肢体泄露 |
| PromptSeg (真值框) | SAM2 | Large / Ground-Truth Box | 75.20 | 70.17 | 79.36 | 具备理想框先验时掩码追踪性能优异 |
| 级联系统 | Grounded-SAM2 + SAM2 | Large / 预测检测框输入 | 4.94 | 8.85 | 1.48 | 瓶颈根源在前端文本定位与识别 |
关键发现¶
- 专属类别鸿沟极其显著:在所有微调模型中,残疾相关类别的 mIoU 仅为常见类别的三分之一至二分之一(如 UniParser ResNet101 为 28.19 vs 58.10),而 APp50 下滑更剧烈(28.11 vs 67.77)。即便最先进的 Mask2Former-Swin-L 在残疾类别上也仅达到 14.09 mIoU。
- 边界与接口误差放大:引入边界敏感指标 BIoU 后,所有通用分割模型的得分较常规 mIoU 进一步暴跌约 35%~50%(如 Mask2Former 仅 11.78 BIoU),表明模型在接受腔接触面、断肢残端等强对比局部区域极易出现严重的几何漂移。
- 单纯缩放骨干网络无法弥合拓扑认知缺陷:从 ResNet50 扩大到 ResNet101,或从 Swin-T 扩大到 Swin-L,模型性能的提升绝大部分由常见类别贡献(Swin-T 到 Swin-L 常见类提升 1.93,残疾类仅提升 1.83),说明当前架构缺乏处理非完备人体拓扑的归纳偏置。
- 开集预训练存在严重的弱势表征盲区:以 CLIP 和 Grounding DINO 为代表的基础模型在文本提示下对残疾部位几乎完全失效(Disability AP 跌至 0.55 以下,文本未检出率达 85.26%),而 SAM2 在真值框提示下能够获得 79.36 mIoU,证明图像底层的边缘形态是可分割的,核心瓶颈在于开集视觉-语言预训练语料中严重缺乏对残疾与假肢解剖学概念的图文对齐。
亮点与洞察¶
- 填补基准空白的概念拓展:首次将人体解析的边界推向非健全肢体人群,将长期被忽视的残肢、三类形态假肢与辅助器具赋予第一类(first-class)像素级语义标签,推动学术界关注视觉技术的普惠与公平。
- 揭开开集基础模型的隐性偏见:实验深刻揭示了多模态大模型在弱势人群概念上的盲区——文本驱动的检测与分割完全崩溃,但纯视觉提示(如 Oracle Box)仍能准确分割,明确了未来研究应着力于视觉-语言概念对齐而非单一优化分割头。
- 边界解耦评测范式:提出的分组解耦机制(Common vs. Disability-Related)与边界交并比(BIoU)评估方案,有效防止了大类别均值掩盖长尾缺陷的问题,可推广至其他涉及物理辅助装置的人体感知任务。
局限与展望¶
- 作者承认的局限:数据集中行动辅助器具的类型仍主要集中于轮椅和拐杖,尚无法覆盖外骨骼(Exoskeleton)等更前沿的智能康复装备;此外假肢细分类别在复杂重度遮挡场景下存在一定的人工消歧困难。
- 审视发现的局限:数据集图像采集自现有公开库,视角中多包含运动或全身姿态,在近距离临床微距视角(如术后残肢红肿检测、接受腔压疮分析)下的图像较少,直接迁移到临床辅助诊断存在领域差距。
- 未来改进方向:探索结合人体骨骼拓扑动态重构的解析网络,设计针对接受腔界面的边界敏感损失函数,并利用视觉语言大模型构建富含假肢与残肢医学先验的开集文本提示池。
相关工作与启发¶
- vs 传统人体解析基准(LIP / CIHP / MHP v2):传统基准样本量大,但完全建立在健全人体假设之上,将所有假肢残肢混入背景或健全四肢;IH-10K 专门填补了这一伦理与技术空白,提供了首个细粒度非完整肢体解析基准。
- vs 残疾姿态估计基准(LDPose / InclusiveVidPose):LDPose 与 InclusiveVidPose 仅关注残肢关键点或粗粒度跟踪,无法提供轮廓细节;IH-10K 提供了高质量多边形像素掩码,能精确支持衣服试穿、义肢贴合与接触力学推断。
- vs 开放词表通用分割基准(COCO-Stuff / ADE20K):通用开集预训练数据几乎未包含残疾相关细粒度词汇;IH-10K 构成了极具挑战性的下游零样本长尾评测套件,可作为测试基础模型包容性与鲁棒性的试金石。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ 首次打破人体解析完整肢体假设,定义了包含残肢与假肢的全新语义标注空间。
- 实验充分度: ⭐⭐⭐⭐⭐ 涵盖微调人体解析、通用语义分割与零样本开集三大评估任务,评测模型超 10 种并设计了解耦评测协议。
- 写作质量: ⭐⭐⭐⭐⭐ 逻辑严谨,动机立意高远,图表规范详实。
- 价值: ⭐⭐⭐⭐⭐ 推动以人为中心的视觉系统走向包容与公平,对虚拟现实、具身智能与辅助康复技术具有极高实际价值。