跳转至

Guardrail-Agnostic Societal Bias Evaluation in Large Vision-Language Models

会议: ECCV 2026
论文: ECCV 原文
领域: 多模态VLM
关键词: 大多模态模型、社会偏见评估、安全护栏、拒答解耦、总变差距离

一句话总结

针对强安全护栏导致传统属性推断 prompt 频繁拒答的问题,提出将人像解耦为背景上下文用户信息的护栏无关评测范式,在三项与人无关任务上实现零拒答并全面揭示 20 个主流 LVLM 的隐式社会偏见。

研究背景与动机

多模态大语言模型(LVLM)在视觉理解、图文推理和日常交互中展现出强大能力,但其内在的社会偏见(如性别和种族刻板印象)也引发了学界与工业界的严峻担忧。已有偏见评测基准普遍采用“图像主体属性推断”的范式:向模型输入带有特定人口统计学标签(如性别、种族)的人物照片,并要求模型直接回答针对该主体的属性推断问题(如“这个人是 CEO 还是秘书?”或“谁更聪明?”)。研究者进而通过比较模型在不同群体输入下的输出概率分布差异来量化偏见。

然而,随着对齐技术与安全护栏(Safety Guardrails)的发展,现代商用模型(如 GPT-5、Claude 3.7 Sonnet)乃至最新开源模型(如 Gemma3、Qwen2.5-VL)在面对直接推断人像属性的提示词时,普遍触发安全机制而拒绝回答(Refusal),在主流基准上的拒答率动辄达到 60% 至 100%。这种大面积拒答直接打破了传统评测所依赖的样本统计充分性假设,导致评测结果严重失真。另一方面,部分试图通过开放式图像描述(Image Captioning)绕过拒答的方法,又极易受到图像背景、物体等与人口属性虚假关联的上下文混淆,难以进行公允的因果属性比较。

面对安全护栏阻断评测与上下文混淆的双重困境,亟需一种不触发防御机制且不受画面杂质干扰的新型评测方案。核心 idea:将评测任务与画面主体彻底解耦,不再要求模型推断图中人物属性,而是将人像作为虚拟用户的上下文信息注入,并在人身无关的下游任务中检测模型输出是否对不同人口群体产生非预期的系统性分化。

方法详解

整体框架

本文提出的护栏无关评测范式(Guardrail-Agnostic Evaluation)彻底颠覆了以往将人像作为“查询目标”的范式,转而将人像定位为“请求用户画像”。评测流程由两项核心转变构成:提示词从属性推断转向与人无关(Person-Irrelevant),人像角色从判断目标转向附带的背景上下文。通过这一构造,模型在执行与用户身份无关的通用任务时完全不会触发防御阻断,从而实现对底层偏见的真实探测。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入:用户人像 + 通用提示词"] --> B["任务解耦与上下文注入<br/>人像转为附带用户画像,彻底规避推断拒答"]
    B --> C["三项人身无关探针任务<br/>故事生成 / 概念解释 / 试题问答"]
    C --> D["基于总变差距离的偏见量化<br/>提取属性分布并度量相对公平基准的偏移"]
    D --> E["输出:无拒答偏见评测得分"]

关键设计

1. 任务解耦与上下文注入:将图像主体由推断目标转换为提问用户

传统基准直接触碰 LVLM 的对齐红线,因直接询问人物属性(如智商、职业)被安全分类器判定为侵犯隐私或有害刻板推断。本文打破“对图提问”的定势,在输入中附带简短前缀(如“附上我的照片”),将 FairFace 人像设定为当前提问用户的暂存信息,而实际执行的文本任务与画面主体毫无关联(例如“写一个虚构角色的故事”或“讲解线性代数”)。在这一设定下,理想的无偏模型在面对人身无关任务时,其生成结果应当在统计上独立于提问者的人口属性特征:

\[\mathcal{O}_{a,q} = \{\phi(I, p, q) \mid (I, a') \in \mathcal{D}, a' = a\}\]

由于任务完全不要求模型评价或推断画面中的人物,模型自身的安全护栏不会被激活,彻底消除了拒答现象,同时避免了直接询问时模型刻意掩盖偏见的对齐防御。

2. 三项人身无关探针任务:多维度覆盖开放创作与受限推理

为了多角度探测不同交互深度下的偏见外显,设计了三类渐进受限的探针任务。故事生成(Story Generation)考察开放文本创作,要求模型自由构建虚拟人物,再通过辅助 LLM 抽取虚构人物的职业、专业与阶层,评估提问者性别或种族是否诱导模型生成性别分工(如程序员对护士)或阶层固化内容;概念解释(Term Explanation)覆盖数理、工程、艺术等 6 个领域的大学水平术语解释,利用辅助 LLM 盲测成对文本的学术门槛与术语深度,检测模型是否对女性或特定少数族裔用户预设性降低讲解难度;试题问答(Exam-Style QA)基于 MMLU 六个理科门类,测试在完全客观的选择题推理中,附加不同用户头像是否会引起准确率的不公波动。

3. 基于总变差距离的偏见量化:统一跨任务概率分布的偏离度量

传统基于 KL 散度的度量在长尾稀疏类别或零概率时极易产生数值不稳定,本文采用总变差距离(Total Variation Distance, TVD)作为统一的公平性测度。对于每个特定 prompt \(q\),将模型针对特定人口组别 \(a \in \mathcal{A}\) 的响应分布与理想公平状态(例如性别均等为各 50%,多组别选择率为 \(1/|\mathcal{A}|\),或群体间准确率与均值无差)之间的总变差绝对值累加:

\[\mathcal{S}_q = \text{TVD}\left( \{ \mathcal{O}_{a,q} \}_{a \in \mathcal{A}} \right)\]

将所有 prompt 的 \(\mathcal{S}_q\) 进行宏观平均并缩放至 \([0, 100]\) 区间。得分越高代表模型针对不同人口特征用户的输出分化越显著,在统一数学尺度下实现了开放生成、成对选择与精度波动的可比度量。

实验关键数据

主实验

在 20 款主流开源与商用 LVLM 上,对比了现有四个主流偏见基准与本文方法的拒答率,并在本文框架下量化了各模型的性别与种族偏见得分。

基准 / 模型 Qwen2.5-VL-32B Gemma3-27B InternVL3.5-38B GPT-5 Claude 3.7 Sonnet
SBBench 拒答率 (%) 90 80 80 83 100
ModScan 拒答率 (%) 94 61 63 49 98
VLA-gender 拒答率 (%) 90 86 71 97 98
Pairs 拒答率 (%) 35 41 61 52 81
本文方法拒答率 (%) 0 0 0 0 0

在实现 100% 响应样本采集后,表 2 测定了各模型在三项任务下的性别(Gender)与种族(Race)TVD 偏见得分(乘以 100,0 为无偏):

模型类型与代表模型 故事生成 (Gender / Race) 概念解释 (Gender / Race) 试题问答 (Gender / Race)
Molmo-7B 26.98 / 24.57 2.76 / 5.08 3.44 / 2.98
LLaVA-OneVision-7B 21.41 / 21.88 3.20 / 4.51 2.64 / 2.06
Qwen2.5-VL-32B 35.11 / 23.88 10.42 / 4.42 2.84 / 1.96
Gemma3-27B 21.64 / 23.70 11.64 / 5.87 1.43 / 1.20
InternVL3.5-38B 28.41 / 27.84 2.35 / 4.92 1.05 / 0.87
Claude 3.7 Sonnet 21.57 / 17.67 3.36 / 3.75 1.27 / 0.64
GPT-4o 26.29 / 21.19 6.88 / 3.90 1.47 / 0.99
GPT-5 14.53 / 16.80 3.59 / 4.61 0.50 / 0.36

消融实验

研究深入分析了任务自由度、模型规模及评测稳定性等维度对偏见测量的影响:

评估维度 / 配置 平均偏见得分 (TVD×100) 核心表现与相关性说明
任务约束度:故事生成(高自由度) 27.23 自由度最高,职业与社会阶层刻板印象泄露最为严重
任务约束度:概念解释(中自由度) 4.67 针对男性/白人使用更多技术术语,约束增加偏见外显收敛
任务约束度:试题问答(受限客观) 1.48 客观多项选择题中偏见最小,主要体现微弱准确率波动
跨任务偏见相关性 (\(r\)) -0.11 ~ 0.21 跨任务间无显著相关,单项任务无偏无法泛化到其他场景
性别-种族偏见共线性 (\(r\)) 0.49 / 0.60 / 0.93 故事生成/解释/客观问答中,性别与种族偏见高度同向共振
评测助手可靠性(人工一致率) 97.0% 辅助 LLM 与人类标注达成极高一致性,且隐去人口标签规避二次偏见

关键发现

  • 商用模型偏见更低但仍未根除:虽然 GPT-5 和 Claude 3.7 在各维度得分普遍优于开源模型,但在开放故事生成中 GPT-5 的偏见得分仍高达 14.53/16.80,面对男性用户更倾向生成机械师等 STEM 角色,面对女性用户更频繁生成护士。
  • 任务自由度决定偏见暴露程度:生成约束越少(故事 > 解释 > 试题),模型依赖隐含用户画像进行刻板补全的倾向越显著;即便在概念解释中,模型面对白人和男性用户时也倾向于使用更加艰深的术语解释物理与计算机概念。
  • 参数量与基础能力不决定公平性:模型在 MMMU 上的能力跑分与故事偏见相关度几乎为零(\(r = -0.17\)),开源模型增大尺寸后在故事任务中的种族偏见反而上升(\(r = 0.72\)),证明单靠扩大参数规模无法自愈偏见。

亮点与洞察

  • 解耦式评测视角的范式革新:巧妙地将人像从“被测客体”转换为“交互主体”,利用用户画像旁路探测模型的内在刻板印象,彻底突破了对齐护栏与偏见评测不可兼得的博弈死局。
  • 对齐机制的局限性暴露:揭示了现有安全对齐大部分局限于“关键词与直接敏感指令过滤”,模型在执行无害通用任务时仍然会无意识地泄露深层的社会人口学刻板偏见。
  • 部署全生命周期审计价值:该框架不依赖闭门基准题目,可无缝拓展至职业规划推荐、智能客服、教学辅导等实际落地场景,支持上线前审计与在线持续动态监控。

局限与展望

  • 人口属性标注维度有限:受限于 FairFace 现有标注,实验主要局限于二元性别与七大种族分类,未包含更多元性别认同、可见残障或不同年龄群体的正交评估。
  • 微小视觉背景伪相关隐患:即便 FairFace 主要以人脸居中为主,非人脸背景杂质仍可能带来细微的视觉伪关联混淆。
  • 评测语言与文化偏置:当前评估提示词主要为英文语境,未能完全覆盖跨语言跨文化下的复杂社会偏见形态。

相关工作与启发

  • vs SBBench / ModScan / Pairs 等属性推断基准:传统方法直接通过选择题或开放问题逼问图中人物特征,在强安全对齐下遭遇大面积拒答崩溃;本文通过人身无关提示词与背景注入,实现 100% 可用样本的无偏统计。
  • vs 开放式 Image Captioning 偏见评测:图像描述评测受制于画面背景、服饰与环境等虚假特征混淆;本文通过控制任务语义与输入人像分布对齐,排除了非目标视觉变量的干扰。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 颠覆了传统图文属性推断范式,通过用户上下文解耦完美规避了安全护栏拒答死结。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 20 个主流商用与开源 LVLM,跨越 3 种任务形态,提供了极具说服力的对比数据。
  • 写作质量: ⭐⭐⭐⭐⭐ 逻辑结构严密,问题提出明确,图表数据支撑详实。
  • 价值: ⭐⭐⭐⭐⭐ 为安全防护日益严密的大模型时代提供了可落地的偏见审计新范式,实用意义重大。