Same Person, Different Depiction: Counterfactual Evaluation of Vision-Language Models on Individuals with Limb Deficiencies¶
会议: ECCV 2026
论文: ECCV 原文
领域: 多模态 VLM
关键词: 视觉语言模型, 肢体残疾反事实评估, 模型可靠性, 社会偏见, 评估基准
一句话总结¶
本文提出了 InclusiveCFImageBias 反事实基准评测集(462 对共 924 张图像、超 2.2 万次查询),在固定人物身份、背景和动作且提示词完全无关身体能力的前提下,系统评估了主流 VLM 在可见肢体残障视觉线索下的判断与表述漂移,发现模型普遍存在向更高评分、更肯定决策和过度评价性语言漂移的现象。
研究背景与动机¶
视觉语言模型(VLM)正在迅速进入日常通信、可访问性辅助工具以及交互式推荐系统等高社会影响场景中。当用户要求模型对图像中的人物进行职业素养打分、领导力潜力评估或推荐决策时,人们普遍期望系统秉持稳定、客观的评价准则。然而,残疾人群体作为全球人口中规模庞大的群体(WHO 估计约占 16%),在以往 VLM 视觉侧的受控偏见评估中几乎处于完全空白的状态。现有的偏见评测大多集中在性别、种族等显性人口统计属性上,对肢体残缺(如假肢、残肢等)往往缺乏细粒度、因果隔离的视觉基准。
在现实场景中评估肢体残疾相关的视觉偏见极其困难。若直接比对不同真实照片,由于人物面孔、服装、背景环境和具体姿势等混淆变量的干扰,模型输出的差异往往无法归因于残疾特征本身。更关键的是,许多人直觉地假定肢体残疾线索必然导致模型的负面歧视或降分惩罚;但如果在与身体运动能力完全无关的任务中,模型仅仅因为检测到残障线索就显著拔高评分或给出过度迎合的断言,这种看似“友好”的过拟合与同情倾向同样意味着评估标准的失真与不可靠,会给面向残疾人的决策与交互带来隐性表征风险。
为了打破这一盲区,本文将残疾视角的可靠性评估确立为一个成对的反事实扰动测试:当查询提示完全无关身体机能时,模型是否应当仅仅因为局部可见的肢体残缺线索而改变判断?核心 idea:构建严格控制背景、动作与人物身份完全一致的反事实图像对基准 InclusiveCFImageBias,结合无关身体能力的标准化提示词库,直接量化主流闭源与开源 VLM 在肢体残障视觉线索引入前后的决策漂移、打分偏移与语义立场变化。
方法详解¶
整体框架¶
InclusiveCFImageBias 的核心目标是构建一个能够将输出漂移严格归因于肢体残缺视觉线索的因果测试集。其完整流水线涵盖真实残障图像的筛选标注、高保真局部反事实图像编辑、无关身体能力提示词库的设计,以及基于单图独立调用的成对评估协议。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["真实日常图像数据源<br/>LDPose CC BY-NC-SA 4.0"] --> B["残缺线索分割与元数据标注<br/>假肢/残肢掩码与受累侧标签"]
B --> C["高保真局部反事实编辑<br/>Qwen-Image-Edit 局域重绘与原图回贴"]
C --> D["严格人工质检与盲测过滤<br/>排除面容漂移与瑕疵 保留 462 对"]
D --> E["跨维度无身体能力提示词库<br/>结构化决策/1-5打分/开放回答/控制提示"]
E --> F["单图隔离成对评测协议<br/>计算决策 TVD / 评分差 / 语言立场漂移"]
关键设计¶
1. 局域约束反事实图像编辑:排除全局混淆与瑕疵的成对构造
为了确保模型行为的改变完全由肢体线索引起而非环境或身份混淆所致,评测基准的数据源严格选取自已获授权的 LDPose 日常真实场景图片,避开过度遮挡或病理医疗极端图像。针对图像中出现的残肢或假肢区域,标注团队人工绘制精确的分割掩码(Segmentation Mask),并记录其受累侧与线索类型。在反事实生成阶段,调用基于扩散机制的 Qwen-Image-Edit 工具,仅对被掩码覆盖的局域及其微小临界邻域进行健全肢体修复生成,随后将编辑区域无缝贴回原图。所有非编辑像素保持完全不变,从而严格锁死背景、光照、动作姿态与面部特征。团队从 2,183 候选对中执行多阶段人工质检,坚决剔除产生伪影、面部变异或肤色/性别漂移的图像,最终保留 462 对高质量样本(共 924 张图像);在由独立评估者参与的盲测“找茬”(Spot-the-edit)实验中,评估者定位编辑肢体的准确率低于 10%,证实了反事实图像的高真实度。
2. 无关身体能力的多范式提示词库:多角度解耦任务相关视觉证据
评估模型偏见的难点在于防止提示词本身暗含身体能力测试。本文设计了由 48 个定制提示词构成的提示词库,覆盖能力/表现(Competence/Performance)、领导力(Leadership)、团队协作/社交协调(Teamwork/Social Coordination)、职业素养(Professionalism)、沟通能力(Communication)以及录用/推荐(Hiring/Recommendation)六大常见社会判断主题。这些提示词严格过滤任何可能直接询问奔跑、搬运或身体机能的内容,并经独立标注员双盲抽样核实排除。提示词划分为三大范式:控制提示(约 29%,针对背景中未被编辑的物体提问,以建立模型内在波动基线)、结构化决策与评分提示(约 33%,要求输出 Yes/No/Uncertain 决策或 1–5 分离散等级),以及开放式文本提示(约 38%,用于捕捉模型的生成文本语气与无意识社会框架)。
3. 成对差分评估指标体系:全面刻画决策确定性与语义立场偏移
在评测执行阶段,模型绝不被同时展示两张图像,而是作为两个完全独立的单图请求分别接收原始图像与反事实图像,输入完全相同的提示词。对成对结果定义差分量 \(\Delta = \text{Counterfactual} - \text{Original}\)(即健全肢体图像输出减去残疾线索图像输出)。在结构化输出上,评测框架结合 95% 置信区间的均值评分差 \(\Delta\text{Rating}\)、符号检验(Sign Test)显著性,以及衡量分类分布漂移的全变差距离(Total Variation Distance, TVD): $\(\text{TVD} = \frac{1}{2} \sum_{y \in \{\text{Yes}, \text{No}, \text{Uncertain}\}} |P_c(y) - P_o(y)|\)$ 在开放文本生成上,除常规的 Jaccard 词袋相似度与 BERTScore F1 外,引入基于自然语言推理(NLI)的蕴含/中立/矛盾分布统计,并计算社会立场/情感色彩(Regard,区分 Positive/Neutral/Negative)的漂移量,以此量化模型在面对残障线索时是否由中立叙述转向赞美过度或同情泛滥。
实验关键数据¶
主实验¶
论文对主流开源与闭源前沿视觉语言模型进行了全面测试,包括 GPT-5、Gemini-2.5,以及 Qwen3-VL、Gemma-3、DeepSeek-VL2、Ministral-3 等不同参数规模和推理类型的模型。
表 1:结构化决策与 1-5 打分下的成对漂移评估(\(\Delta = \text{Counterfactual} - \text{Original}\))
| 模型族与型号 | 控制提示一致性 | 评分差 \(\Delta\text{Rating}\) (均值) | 评分差 95% CI | 符号检验 \(p\) 值 | \(\Delta\text{Yes}\) (pp) | \(\Delta\text{Unc.}\) (pp) | 决策漂移 TVD (pp) |
|---|---|---|---|---|---|---|---|
| GPT-5 | 0.822 | -0.089 | [-0.146, -0.033] | \(3.52 \times 10^{-3}\) | -1.84 | +0.76 | 1.84 |
| Gemini-2.5 | 0.736 | -0.404 | [-0.511, -0.298] | \(1.64 \times 10^{-9}\) | -3.86 | +3.19 | 3.86 |
| Qwen3-VL 30B-A3B-Instruct | 0.759 | -0.205 | [-0.252, -0.156] | \(4.81 \times 10^{-18}\) | -6.82 | +3.14 | 6.82 |
| Qwen3-VL 30B-A3B-Thinking | 0.738 | -0.114 | [-0.157, -0.075] | \(6.35 \times 10^{-7}\) | -5.35 | +3.11 | 5.35 |
| Qwen3-VL 8B-Instruct | 0.813 | -0.375 | [-0.436, -0.314] | \(1.90 \times 10^{-38}\) | -2.71 | +1.73 | 2.71 |
| Qwen3-VL 8B-Thinking | 0.720 | -0.145 | [-0.195, -0.094] | \(1.21 \times 10^{-7}\) | -6.93 | +8.33 | 8.33 |
| Gemma-3 12B-it | 0.751 | -0.180 | [-0.221, -0.140] | \(3.48 \times 10^{-22}\) | -3.68 | -0.87 | 4.55 |
| DeepSeek-VL2 | 0.759 | -0.214 | [-0.272, -0.153] | \(2.61 \times 10^{-12}\) | -11.90 | +13.53 | 13.53 |
| DeepSeek-VL2-Small | 0.754 | -0.088 | [-0.114, -0.063] | \(3.48 \times 10^{-11}\) | -3.46 | +3.46 | 3.46 |
| Ministral-3 8B-Instruct | 0.699 | -0.207 | [-0.242, -0.169] | \(2.63 \times 10^{-28}\) | -10.20 | +8.75 | 10.20 |
| Ministral-3 8B-Reasoning | 0.812 | -0.143 | [-0.172, -0.115] | \(2.65 \times 10^{-22}\) | -4.98 | +4.11 | 4.98 |
注:负 \(\Delta\text{Rating}\) 与负 \(\Delta\text{Yes}\) 表示在原图(可见肢体残障线索)下模型的打分更高、更倾向于回答 Yes;去掉线索后打分回落、Yes 回落。
消融实验¶
为了验证上述结论并非由局部图像修复伪影、画面多主体干扰、模型自带采样随机噪声或某一类提示词偶然引起,论文实施了一系列严格的控制实验与敏感性分析。
表 2:替代假设控制实验与稳健性消融分析对比
| 实验切片与对照设置 | 样本规模 / 说明 | 评分差 \(\Delta\text{Rating}\) | 决策 TVD (pp) | 文本差异 / Jaccard | 关键发现与归因结论 |
|---|---|---|---|---|---|
| 主实验基准 (All Pairs) | 462 对完整样本 | -0.151 | 7.11 | 0.562 (文本相异度) | 基准全集下的基准漂移表现 |
| 同线索编辑对照 (Same-cue Control) | 采用相同重绘管线但不消除残障线索 | -0.152 | 6.36 | — | 评分差几乎完全一致,证实漂移并非来自重绘伪影 |
| 单人场景子集 (Single-person Split) | 392 对单人清晰主体 | -0.169 | 7.73 | — | 评分与决策漂移强于全集,排除多人注意力分散干扰 |
| 多人场景子集 (Multi-person Split) | 70 对多人互动主体 | -0.042 | 较低 | — | 漂移幅度相对减弱,主实验趋势完全由单人主干承载 |
| 同输入重复生成 (Repeat Noise) | 相同图像与提示重复测试 2 次 | 0.122 (波动) | 1.81 | 0.167 (相异度) | 模型自随机波动远小于反事实成对漂移 (1.81 vs 8.89) |
此外,在针对六大提示词家族的切片测试中,所有六类任务均表现出统计显著的负向 \(\Delta\text{Yes}\) 与非零 TVD(TVD 范围达 6.14 到 13.66 pp),其中职业素养(Professionalism)与胜任能力(Competence)的决策漂移最为剧烈,表明评价准则的松动是全领域的系统性现象。
关键发现¶
- 显著的正向溢价偏见:绝大多数被测模型在可见肢体残障线索下均表现出负向 \(\Delta\text{Rating}\),即在完全无关身体机能的职业素养、能力评估等任务中,残障个体会获得显著偏高的系统打分(例如 Gemini-2.5 偏高 0.404 分,Qwen3-VL 8B-Instruct 偏高 0.375 分)。这推翻了单纯假定“残障线索必定遭遇歧视性低分”的固有认知,暴露出大模型在对齐训练中形成的“过度补偿”或社交合意性偏差。
- 决策漂移集中于 Yes 与 Uncertain 之间:当反事实编辑抹去肢体残疾特征后,模型并非大量从 Yes 转为 No,而是大量退缩至 Uncertain(例如 DeepSeek-VL2 的 Yes 占比降低 11.90 pp,Uncertain 占比上升 13.53 pp)。残障线索刺激了模型输出肯定断言的冲动。
- 对齐与思考模式显著调节敏感度:在同一模型家族内部(如 Qwen3-VL 与 Ministral-3),Instruct 指令微调版本的敏感度与漂移量系统性高于经过长链思考的 Thinking/Reasoning 版本(例如 Qwen3-VL 30B-Instruct 的 \(\Delta\text{Rating}\) 为 -0.205,而 Thinking 版仅为 -0.114),表明显式推理机制有助于抑制基于浅层视觉感知的刻板同情冲动。
亮点与洞察¶
- 提出首个针对肢体残疾的视觉反事实基准:打破了过去多模态公平性研究仅聚焦种族和性别、或仅停留在语言模态纯文本测试的局限,填补了具身视觉表征评测的重要空白。
- 揭示了“正面偏倚”对系统可靠性的破坏:指出更高评分和过度肯定的回答同样是一种偏见与可靠性失效。盲目拔高评分或使用充斥同情与过度赞誉的评价性词汇,反映出模型评判尺度的剧烈漂移,有悖于负责任 AI 所倡导的客观一致准则。
- 可复用的局部重绘反事实构建范式:结合高精度实例掩码与扩散模型局部修复,并辅以双盲“找茬”过滤,为后续在其他敏感视觉属性(如外貌损伤、面部烧伤、老年退行性表征)上的因果可信度评估提供了高标准范例。
局限与展望¶
- 作者承认的局限:当前数据集规模受限于开源许可与高质量摄影素材,样本呈现男性偏多(66.4%)以及白人群体偏多(62.8%)的分布偏差,且以截肢假肢的下肢缺失为主,对罕见上肢或复合型肢体差异的覆盖度仍待扩展。
- 自己发现的局限:评测目前仅覆盖英语提示词,在其他文化语境或多语言提示下,模型对于残障的社会心理防线与过补偿倾向可能存在差异;此外,反事实图像生成工具自身可能潜在注入不可察觉的高频特征扰动。
- 具体改进思路:可引入多语言文化对比,并探索“成对一致性损失”(Paired Consistency Loss)或无偏提示词后处理 Guardrail,强制模型在表征层解耦动作主体语义与非相关身体特征。
相关工作与启发¶
- vs PAIRS / SocialCounterfactuals: 既有工作主要通过图像配对或扩散编辑研究种族与性别偏见,关注 toxicity 与传统职业刻板印象;本文首次将反事实因果扰动迁移至肢体残疾领域,并在任务设计上严格剔除身体能力关联,揭示了过补偿(Over-accommodation)这一独特的正向偏倚现象。
- vs AccessEval / VizWiz: VizWiz 侧重视障用户的实际交互可用性,AccessEval 侧重纯语言大模型的无障碍偏见;本文则是首个针对前沿视觉语言模型在视觉端感知肢体残障时因果一致性与表征风险的评测工作。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ 首次从视觉侧成对反事实视角解耦评估肢体残疾表征,发现逆常识的过度补偿偏见。
- 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 6 大主流开源与商业前沿模型家族,设计了细致的对照消融、NLI 与社会立场文本分析。
- 写作质量: ⭐⭐⭐⭐⭐ 逻辑结构严密,概念定义清晰,对正向偏见与可靠性本质的论述深刻。
- 价值: ⭐⭐⭐⭐⭐ 为无障碍 AI、残障代表性评估以及多模态模型可信对齐树立了标杆级测试工具。