Gender Bias in Vision-Language In-Context Learning¶
会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/mathfather/Gender-Bias-in-VL-ICL
领域: 多模态VLM / AI安全
关键词: 视觉语言模型, 上下文学习 (ICL), 性别偏见 (Gender Bias), 偏差评测基准 (VL-BICLE), 扩散模型合成去偏 (Diffusion-based Debiasing)
一句话总结¶
系统揭示多模态上下文学习中示例性别构成会像“定向引力”般加剧视觉语言模型偏见且主要通过单向恶化相反性别的跨性别退化机制触发,提出利用扩散模型生成合成上下文图像实现无损画质与精度的离线去偏。
研究背景与动机¶
大语言模型与多模态大模型(LVLMs)的演进使得交叉图文的上下文学习(In-Context Learning, ICL)成为免微调任务适配的核心范式。然而,多模态生成模型在预训练阶段不可避免地吸收了互联网海量图文对中潜在的社会刻板印象与人口统计学偏差,在图像描述、指代消解与视觉问答等任务中屡屡显现出系统性的性别倾斜。现有偏见研究大多聚焦于单模态文本上下文或针对 CLIP 等判别式视觉语言模型,而对于新一代自回归多模态模型在交织图文少样本示范下的行为机制仍缺乏系统量化。
更深层的矛盾在于上下文示例的双刃剑效应与传统评测盲区:在少样本提示中引入图文示范通常被视为提升泛化性能的标准手段,但示范样本中所内隐的性别分布是否会激活或放大模型内部原有的偏见属性此前尚无定论。与此同时,现行的语义检索选例(如基于 CLIP 的图像或文本相似度检索)往往无意识地放大了训练池本身的分布偏置,而 BLEU-4、CLIPScore 等传统图像描述质量指标对显著的偏见漂移完全“脱敏”,使得开发者在模型生成指标看似稳定的假象下忽视了公平性的急剧退化。
面对上述问题,本文系统拆解多模态上下文学习中的偏见诱发机理,探究示范样例的性别属性、检索机制与输出任务空间如何交互影响偏见走向。核心 idea:构建多任务系统评测框架 VL-BICLE 揭示单性别上下文通过“跨性别退化机制”定向偏置模型的规律,并提出以 Stable Diffusion 离线合成图像无痛替换真实上下文示例的免训练去偏方案。
方法详解¶
整体框架¶
本文构建的评估与去偏体系围绕 VL-BICLE(Vision-Language Gender Bias in ICL Evaluation)框架展开。该框架系统涵盖了 4 种基于性别构成的样本选取策略(随机采样 RS、纯男性采样 MS、纯女性采样 FS、男女交替平衡采样 BS)与 2 种基于相似度的检索基线(基于图像-图像相似度检索 SIIR、基于图像-文本相似度检索 SITR),横跨图像描述(COCOBias、DCI)、代词预测(VisoGender-OO、VisoGender-OP)及视觉问答(VisualCoT)三大任务与四套基准数据集。针对 6 种主流 LVLMs 的多轮分析表明偏见具有强烈的上下文定向性,进而推导出了基于扩散模型(SDMs)的上下文合成替换去偏流程。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
IN["多模态查询输入<br/>(Query Image + Task Instruction)"] --> D1["VL-BICLE 多维度评测矩阵<br/>6 类 ICL 配置 × 3 项下游任务构建"]
D1 --> D2["跨性别退化机制分析<br/>异性样本误差激增与偏见定向极化诊断"]
D1 --> D3["语义检索偏差继承诊断<br/>SIIR / SITR 检索池人口统计偏置审计"]
D2 --> D4["基于扩散模型的上下文合成替换<br/>SDM 离线可控生成示范图像与去偏验证"]
D3 --> D4
D4 --> OUT["无偏多模态生成输出<br/>(Equitable VLM Generation & Robust Metrics)"]
关键设计¶
1. VL-BICLE 多维度评测矩阵:解耦多模态上下文的偏见表征
针对多模态 ICL 评测缺乏受控基准的痛点,该设计构建了严密的子群性能差距评估指标体系与 6 种上下文构造策略。对于任务数据集 \(\mathcal{D}_t = \{(I_i, y_i, g_i)\}_{i=1}^N\)(其中 \(g_i \in \{\text{male}, \text{female}\}\) 为单人图像的受保护性别属性),定义男性子群误差率 \(\text{ER}_m\) 与女性子群误差率 \(\text{ER}_f\),并以误差率差距 \(\text{ER}_{m-f}\) 作为核心偏见度量:
其中 \(\text{ER}_{m-f} > 0\) 表示模型在男性样本上的错误率高于女性(表现为偏向女性预测),\(\text{ER}_{m-f} < 0\) 表示偏向男性预测,趋于 0 则代表两性性能对等。在选例策略上,RS 保持池内真实分布,MS 与 FS 分别隔离单性别属性构建极化示范流,BS 强制交替排布等量两性样例;同时引入基于预训练 CLIP 相似度的 SIIR 和 SITR 策略,将最相似样本放置于邻近待测输入位置,系统隔离上下文样例分布在不同任务与输出空间下的偏见诱导效应。
2. 跨性别退化机制分析:揭示单性别示范的非对称负迁移
针对单性别示范如何改变模型决策倾向的根本疑问,深入剖析各性别子群误差率的动态迁移轨迹。研究揭示出单性别上下文并非简单提升同性别表征的识别能力,而是像一种外在“定向引力”诱发跨性别退化(Cross-Gender Mechanism):当注入纯男性示范(MS)时,模型自身的男性子群错误率 \(\text{ER}_m\) 基本保持平缓或微降,而女性子群错误率 \(\text{ER}_f\) 出现断崖式上升;反之,纯女性示范(FS)则急剧拉高 \(\text{ER}_m\)。这种不对称的单向抑制效应在代词预测任务中被成倍放大(例如在 VisoGender-OP 上,QwenVL 在 8-shot MS 下的女性错误率高达 85.5%,而在 FS 下仅为 9.7%),证明了单性别上下文是通过单侧破坏对立性别的表征校准来强制偏向特定性别。
3. 语义检索偏差继承诊断:探究相似度驱动选例的偏见传递
针对前沿工作推崇的基于相似度检索示范(SBR)方案,深入量化其在公平性维度上的安全漏洞。由于真实预训练示范池(如 MSCOCO)天然存在明显的男性样本倾斜,SIIR(图图检索)与 SITR(图文检索)在贪心选取高相似近邻时会自发过度抽取男性样例。实验证明,SBR 检索方法完全继承了数据源头的人口统计学失衡,其诱发的男性偏见偏离度甚至超过人工构造的 MS 极端设定(例如在 8-shot Phi-3.5-V 上,SIIR 与 SITR 的 \(\text{ER}_{m-f}\) 分别恶化至 -2.25 与 -2.35,比 MS 的 -1.88 还要更偏向男性)。即使人为将检索候选池欠采样至男女 1:1 平衡状态,局部特征高相似度依然会导致检索子集失衡,从而证实单纯依靠相似度启发式检索无法实现上下文去偏。
4. 基于扩散模型的上下文合成替换:无损保真度的离线解耦去偏
针对改变上下文文本容易破坏任务指令且人工清洗成本高昂的现实困境,设计了一种基于文本到图像生成模型(SDMs)的上下文图像解耦替换策略。该方法保持原始示范池中的描述文本 \(y_i\) 严格不变,以原文本为 prompt 驱动先进扩散模型(FLUX 或 Stable Diffusion 3.5 Large)在离线阶段重新生成对应的合成图像 \(I_i^{synth}\),构成合成示范池 \(\mathcal{D}_s\)。在实际推理阶段,输入仅用合成图替换原始真实图作为 ICL 示范。由于扩散模型在根据文本渲染人像时重构了视觉特征背景并削弱了真实照片中非本质的统计共现偏差,即便在仅统计显式包含性别词汇的揭示样本(Revealed Samples, \(r_i=1\))上,两性绝对偏见值 \(|\text{ER}_{m-f}|\) 亦在大多数模型上普遍显著下降,同时 BLEU-4 与 CLIPScore 保持完全无损,且无需在推理阶段额外运行扩散模型。
损失函数 / 训练策略¶
本研究属于无须微调的推理期上下文学习评估与干预工作。在评估过程中,所有 LVLMs 与视觉骨干(CLIP)权重均保持冻结状态,生成解码统一采用确定性贪婪搜索(Greedy Search)。少样本设定测试 \(k \in \{0, 2, 4, 6, 8\}\);随机与平衡采样的实验均采用 5 组独立随机种子采样计算均值与标准差,基于相似度检索的方法则具有确定性。在 VisualCoT 任务中,利用开源评测大模型 GPT-OSS-20B 充当 LLM-as-judge,以计算生成答案与标准答案间的语义相似度评分 \(s_i \in [0, 1]\) 并确定连续误差 \(e_i = 1 - s_i\)。
实验关键数据¶
主实验¶
各模型在零样本(0-shot)基线下的 \(\text{ER}_{m-f}\) 表现如表 1 所示;此外表 2 详细列出了 Phi-3.5-V 在 COCOBias 数据集上随着上下文样本数 \(k\) 增加,各 ICL 策略下生成质量指标(BLEU-4、CLIPScore、平均长度 AvgL)与偏见指标 \(\text{ER}_{m-f}\) 的演进数据。
表 1:六款主流多模态模型在零样本基线下的性别偏见误差率差距 \(\text{ER}_{m-f}\)(负值代表偏向男性,正值代表偏向女性):
| 数据集 | 任务类型 | QwenVL | MiniCPM | Idefics3 | Phi35V | InternVL35 | Qwen3VL |
|---|---|---|---|---|---|---|---|
| VisoGender-OO | 代词预测 | -2.90 | -27.54 | -1.45 | +13.04 | -4.35 | +2.90 |
| VisoGender-OP | 代词预测 | -8.89 | -45.36 | -8.10 | +35.91 | -3.36 | +3.64 |
| COCOBias | 图像描述 | -0.94 | -0.09 | -1.69 | -0.09 | 0.00 | +0.19 |
| DCI | 图像描述 | +0.84 | +0.84 | -1.68 | 0.00 | -0.84 | -0.84 |
| VisualCoT | 视觉问答 (VQA) | – | -0.31 | – | +6.42 | – | +1.61 |
表 2:Phi35V 在 COCOBias 上不同 ICL 策略及 shot 数量下的质量与偏见对比:
| 策略 | \(k\)-shot | BLEU-4 ↑ | CLIPScore ↑ | 描述长度 AvgL | \(\text{ER}_{m-f}\) (偏见差距) |
|---|---|---|---|---|---|
| Zero-shot | 0 | 18.86 | 33.13 | 20.71 | -0.09 |
| RS (随机采样) | 2 | 35.84 | 32.08 | 10.70 | -1.30 |
| RS (随机采样) | 8 | 35.89 | 31.84 | 10.20 | -1.01 |
| MS (纯男性) | 2 | 34.15 | 32.19 | 11.19 | -0.92 |
| MS (纯男性) | 8 | 35.77 | 32.00 | 10.50 | -1.88 |
| FS (纯女性) | 2 | 34.60 | 32.21 | 11.30 | +0.28 |
| FS (纯女性) | 8 | 36.41 | 31.73 | 10.05 | +2.14 |
| BS (平衡交替) | 8 | 36.50 | 32.02 | 10.59 | -0.75 |
| SIIR (图图检索) | 8 | 36.65 | 32.07 | 10.81 | -2.25 |
| SITR (图文检索) | 8 | 37.16 | 32.39 | 10.96 | -2.35 |
消融实验¶
在固定文本描述不变的前提下,采用扩散模型(FLUX、SD3.5-Large)合成图像替换真实上下文图像,并对比纯黑色图像(Black)及不同负向提示词变体在揭示样本(\(r_i=1\))上的绝对偏见差距相对 COCOBias 原图的差值 \(\Delta |\text{ER}_{m-f}|\)(负值代表偏见缩小即表现更优):
表 3:在揭示性别样本上上下文图像替换带来的偏见改善对比(相对于原图基线的差值):
| 模型 | ICL 设定 | \(k\) | COCOBias 基准 | FLUX (合成图) | SD35L (合成图) | 纯黑图 Black | S-NP (无提示) | F-NP (无提示) |
|---|---|---|---|---|---|---|---|---|
| Idefics3 | MS (纯男) | 4 | 2.82 | -0.42 | -0.27 | -0.32 | -0.12 | -0.05 |
| Idefics3 | MS (纯男) | 8 | 2.87 | -0.12 | -0.30 | -0.33 | -0.02 | -0.25 |
| Phi35V | MS (纯男) | 4 | 2.24 | -0.36 | -0.23 | +2.48 | +4.92 | +3.70 |
| Phi35V | MS (纯男) | 8 | 2.04 | -0.10 | -0.20 | +3.84 | +9.41 | +5.79 |
| MiniCPM | MS (纯男) | 8 | 0.32 | -0.24 | -0.08 | +0.68 | +1.63 | +1.10 |
| Qwen3VL | MS (纯男) | 4 | 0.44 | -0.15 | -0.07 | -0.27 | +2.35 | +1.72 |
| Idefics3 | FS (纯女) | 4 | 1.00 | -0.02 | -0.16 | +0.95 | +0.74 | +1.01 |
| Phi35V | FS (纯女) | 8 | 2.53 | -0.90 | -0.59 | +3.36 | +27.91 | +19.52 |
| MiniCPM | FS (纯女) | 8 | 0.14 | -0.12 | -0.05 | +1.47 | +1.45 | +0.94 |
| Qwen3VL | FS (纯女) | 8 | 0.27 | -0.08 | -0.02 | +0.47 | +6.15 | +5.45 |
关键发现¶
- 单性别示范扮演偏见“定向引力”:无论模型基线偏向何种性别,注入 MS 上下文均显著将决策向男性偏见拉扯,FS 则向女性偏见拉扯,甚至能完全翻转原有偏见方向(如 MiniCPM 在 VisoGender-OO 上从 0-shot 的 -27.54% 翻转至 8-shot FS 下的 +27.20%)。
- 质量指标与偏见完全解耦:CLIPScore 在所有 6 款模型与各 shot 实验中波动范围均不超过 0.67,BLEU-4 亦未表现出与偏见相关的变化,验证了常规质量指标无法察觉模型伦理对齐状态的恶化。
- 任务输出空间决定偏见转移:VQA 任务中四种采样策略下的误差率完全重合(各设定下 \(\text{ER}_{m-f}\) 最大波动仅 1.82%),证明多模态 ICL 偏见仅在生成自由度包含显式性别词汇时才会实质性爆发。
亮点与洞察¶
- 提出跨性别退化解释模型:不仅观察到了偏见漂移,更定量揭示出单性别样例主要是通过剧烈恶化相反性别子群的准确率来拉大差距,提供了多模态上下文诱发偏见的微观机理。
- 证伪相似度选例的去偏能力:首次证明了被广泛采用的 CLIP 相似度检索会在隐式层面继承并加剧数据池的性别失衡,打破了相似度检索必然带来多维度全面增益的固有假定。
- 扩散模型合成上下文图像的即插即用去偏:创新性地利用扩散模型生成的高保真合成图像替换真实图片,无需额外标注或模型重训,即可有效压低揭示样本的偏见误差且完全无损下游性能。
局限与展望¶
- 作者承认的局限:研究所采用的性别属性基于二元分类定义,未涵盖非二元及更广泛的社会群体身份;扩散生成图像去偏目前仅在图像描述任务上完成了系统验证。
- 自主审视局限:合成图去偏的机理仍带有经验性探索性质,合成图像中背景纹理或先验对多模态注意力的具体注意力头重构机理仍有待更深入的可解释性归因分析。
- 未来改进思路:探索结合多模态模型内部注意力重加权的自适应上下文去偏,并将这一机制推广至种族、年龄等多重交叉属性(Intersectional Bias)的综合防护。
相关工作与启发¶
- vs Zhao et al. (ICCV 2021) / Hendricks et al. (ECCV 2018):早期工作主要关注单一图像描述模型微调后的静态偏见并提出基于平衡损失的训练约束;本文则深入自回归 LVLM 在免微调上下文学习(ICL)下的动态偏见迁移规律。
- vs Yang et al. (NeurIPS 2024 LeverLM) / Doveh et al. (2024):以往多模态 ICL 研究专注于提升任务精度指标与构建相似度检索序列,而完全忽视了公平性风险;本文明确指出了检索驱动选择会继承和放大偏见,填补了多模态 ICL 算法公平性的评测空白。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ 首次系统形式化并揭示多模态上下文学习中的偏见诱发与跨性别退化机制。
- 实验充分度: ⭐⭐⭐⭐⭐ 覆盖 6 种主流开源多模态大模型、4 个基准、3 项任务与 6 种 ICL 范式,验证周密。
- 写作质量: ⭐⭐⭐⭐⭐ 逻辑严谨闭环,实验设计与机制剖析丝丝入扣。
- 价值: ⭐⭐⭐⭐⭐ 为大模型上下文应用落地中的伦理风险防范与安全提示设计提供了坚实的理论与实验指南。