跳转至

Delineating Knowledge Boundaries for Honest Large Vision-Language Models

会议: ECCV 2026
论文: ECCV 原文
领域: 多模态VLM
关键词: 大视觉语言模型, 知识边界, 学习拒答, 偏好优化, 幻觉缓解

一句话总结

本文用目标模型自身的高温多采样一致性探针把知识密集型问答逐条标成「已掌握 / 未掌握」,再按掌握与否反向构造偏好对做 SFT + DPO/CPO/ORPO 对齐,让 VLM 在参数知识缺口处学会诚实地拒答而不误拒已掌握的事实,把 LLaVA-1.5-7B 在 V-Idk 上的 Truthful rate 从 57.9% 提到 67.3%。

研究背景与动机

大视觉语言模型(VLM)在开放域多模态问答上已经相当能打,但一碰到长尾实体或专业领域——稀有物种、复杂医学影像、冷门建筑与机械——就会用非常自信的语气给出完全错误的答案。这类失败不是「看不清」,而是「没学过」:图像本身清晰无歧义,模型却缺少解读它所必需的世界知识。已有的幻觉缓解工作几乎都瞄准「答得更对」这一条线:V-DPO 用视觉引导的直接偏好优化压低物体级幻觉,RLHF-V 用细粒度纠错反馈做行为对齐,CLIP-DPO 干脆拿视觉语言模型自己当偏好的来源。它们优化的是答案质量,隐含假设是「只要答得够准就够了」。但一个同样重要、代价却低得多的能力被忽略了——知道自己什么时候不该答。纯文本领域已经有了 Idk 框架、R-Tuning、Hindsight Instruction Relabeling 这些教 LLM 说「我不知道」的工作,多模态一侧却基本空白;而当前的对齐范式把 helpfulness 摆在 truthfulness 之上,等于在无据可依时逼着模型去猜。

把问题拆开看,VLM 的「拒答」其实有两种完全不同的来源。一种是感知不确定性:图像被模糊、遮挡或损坏,视觉证据不足,此时拒答理所当然(VizWiz 这类数据集测的就是这个),现有 VLM 拒答研究也大多停在这里。另一种是认知不确定性:图像清清楚楚、模型也确实「看见」了,但它对「看见的东西是什么」毫无参数化知识,此时拒答才是唯一诚实的行为。后一种更隐蔽也更危险,因为模型没有任何信号提示它该闭嘴。借用 Cheng 等人提出的四象限框架(图 1 左)来描述:vanilla VLM 几乎全部落在 Unknown Unknowns(IDK-IDK)格子里,也就是对没有真正掌握的实体给出自信而虚构的判断;本文的目标是把这些编造转化为 Known Unknowns(IK-IDK),即标准的诚实拒答。与 InBoL 关注「问题本质上无解」的通用知识边界不同,本文盯的是「问题本可解、但这个模型恰好不知道」的知识缺口。

麻烦之处在于,这条边界是 model-specific 的:同一个关于稀有鸟种的问题,13B 模型可能稳定答对,7B 模型十次里错九次,「已掌握 / 未掌握」的分界线必须逐个模型去量,数据集自带的标注完全用不上。本文的思路是先把这条边界测出来,再把它写回参数里。核心 idea:用目标模型自身的高温多采样一致性探针(同一问题独立采样 10 条回答、按平均正确率 \(A(x,q)\) 与阈值 \(\tau=0.7\))逐条标定 Known/Unknown,再按掌握与否反向构造偏好对——已掌握的事实把「答对」设为 chosen、把「拒答」设为 rejected,未掌握的事实把「拒答」设为 chosen、把模型自己最自信的错答设为 rejected——最后用 SFT 打底、DPO/CPO/ORPO 校准这条「答—拒」分界线。

方法详解

整体框架

输入是一批图文问答对和一个待对齐的目标 VLM \(\pi_\theta\)(本文用 LLaVA-1.5-7B/13B),输出是一个在参数知识缺口处会主动说「我不知道」、在已掌握事实上照常作答的模型。整条流水线由三块组成:数据构建做三件事——先用一个更强的 VLM 当裁判把感知噪声(模糊图、有歧义的答案、只需 OCR 就能答的问题)从 InfoSeek 里剔掉,再用目标模型自己的多次采样把每条样本标成 Known 或 Unknown,然后按标签反向生成偏好对;对齐训练分两阶段——SFT 先教会模型标准拒答格式,再在偏好对上做 DPO/CPO/ORPO,把「什么时候该拒」真正压进参数;四象限评估不只看答对率,而是用 LLM 裁判把每个输出映射回四个知识象限,分别统计「答对率」与「该拒就拒率」,两者之和就是本文的核心指标 Truthful rate。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400, 'subGraphTitleMargin': {'top': 8, 'bottom': 16}}}}%%
flowchart TD
    A["InfoSeek 图文问答对"] --> B["视觉-语义样本筛选<br/>VLM 裁判剔除感知噪声"]
    B --> C["多采样一致性知识探针<br/>10 次采样求平均正确率"]
    C -->|"A ≥ τ,标为 Known"| D["答对为 chosen<br/>拒答为 rejected"]
    C -->|"A 不足 τ,标为 Unknown"| E["拒答为 chosen<br/>最高置信错答为 rejected"]
    subgraph SG["非对称偏好对构造"]
        direction TB
        D
        E
    end
    D --> F["偏好感知对齐<br/>SFT 打底 + DPO / CPO / ORPO"]
    E --> F
    F --> G["四象限诚实度指标<br/>答对率 + 拒答率 = Truthful"]

关键设计

1. 视觉-语义样本筛选:先保证「答错」能被归因于知识缺口,而不是看不见

InfoSeek 这类知识密集型数据集本身带有感知噪声——图像模糊、标准答案有歧义,或者问题压根不需要世界知识(比如「这本书的作者是谁」,答案就印在封面上,OCR 一遍即可)。这些样本留在训练集里,「模型答错」就同时可能是感知问题、标注问题或知识问题,后面探针给出的标签会整体失真。本文用一个能力更强的 VLM(Qwen2.5-VL)当语义裁判对候选样本过三关:视觉质量清晰无歧义、ground-truth 答案精确、问题确实需要调用世界知识而非基础 OCR 或简单感知,三关全过才进入 curated 子集(图 2 里给出的拒绝理由就是「Relies on OCR, no world knowledge required」)。

这一步的意义在整套方法里是地基性的:它把「感知不确定性」从数据里彻底删掉,于是剩下样本上的任何错误都只能指向同一个原因——参数知识缺失。后面探针标出的 Known/Unknown 以及由它生成的偏好对,全部建立在这个干净的归因之上。这也划出了本文与感知鲁棒性类拒答工作的根本分界:那些工作处理模糊图像,本文处理清晰图像加空白的知识。

2. 多采样一致性知识探针:用模型自己的十次回答量出它的边界

知识边界逐模型、逐问题各不相同,没有现成标注可用;而单次回答也不足以判定「掌握」——模型可能碰巧猜对,也可能因采样波动偶尔失手。本文要判的甚至不是「这次答对了吗」,而是「这个事实到底在不在模型的参数里」。做法是对每条 \((x,q)\) 用较高解码温度独立采样 \(N=10\) 条回答,交给 LLM 裁判逐条判对错、取平均正确率 \(A(x,q)\),再与阈值 \(\tau\)(原文称 Ik threshold)比较;\(A\ge\tau=0.7\) 记 Known,否则记 Unknown。⚠️ 原文以文字描述该过程(Sec. 3.1),下面这个式子是等价的直白写法:

\[ A(x,q)=\frac{1}{N}\sum_{i=1}^{N}\mathbb{I}\!\left[V\!\left(y^{(i)},\,y_{gt}\right)\right],\qquad N=10,\ \tau=0.7 \]

多采样一致性正是把「偶然猜对」与「稳定掌握」区分开的机制:十次里至少七次给出正确答案,才承认这个事实真的在参数里。它量的是行为稳定性而非模型的自我报告,因此不受模型语言表述风格影响;标签本身则是 model-specific 的,换一个模型就得重新探一遍。在 V-Idk 上这套探针最终得到约 60% Known / 40% Unknown 的配比,两侧都留足了监督信号——Known 侧约束 helpfulness(别乱拒),Unknown 侧约束幻觉(别乱答)。阈值 \(\tau\) 实际上是一个同时牵动拒答率与误拒率的旋钮:调高它,被标为 Unknown 的样本变多,训练信号更偏向保守。

3. 非对称偏好对构造:按掌握与否把 chosen 和 rejected 反过来

只用 SFT 教拒答格式会带来「对齐税」(alignment tax):模型学到的是一个笼统的保守先验,连自己明明会的题也一并拒掉;反过来只拿未掌握样本训练拒答,又约束不住模型在已掌握样本上保持作答。本文的做法是在探针标签上分两路生成偏好对。对 Known(\(A\ge\tau\))样本,chosen 是那条正确回答、rejected 是拒答模板,等于明确告诉模型「这种题你必须答」;对 Unknown(\(A<\tau\))样本,chosen 是拒答模板、rejected 是模型此前生成过的置信度最高的错误回答,也就是把最像模像样的那次幻觉钉成负例。两路合起来构成 2 万条的 V-Idk 训练集。

这种「同一批数据、两个相反方向」的构造是偏好优化能起作用的前提。如果所有样本都朝「拒答」一个方向推,DPO/ORPO 与 SFT 就没有区别,模型只会学出一个更极端的保守先验;只有正负例方向随掌握程度翻转,模型才被迫去学「掌握与否」这个中间变量,而不是「拒答」这个表面模式。负例选取上挑最高置信度的错答而非随机错答,也提高了惩罚的针对性——模型最自信的幻觉恰恰是部署时最危险的那一类。

4. 四象限诚实度指标:把「诚实」定义成可以计数的行为

如果「模型是否诚实」只靠看几个例子,既无法比较不同对齐策略,也无法证明模型是真的知道边界、还是只背下了拒答模板。本文把探针得到的初始掌握标签 \(A(x,q)\) 与测试时输出的语义正确性交叉,得到四个知识象限:Known Knowns(IK-IK,答对)、Known Unknowns(IK-IDK,对本就没掌握的样本正确拒答)、Unknown Knowns(IDK-IK,误拒已掌握的事实,即对齐税)、Unknown Unknowns(IDK-IDK,对未掌握样本编造答案,即幻觉)。三个关键指标定义为(均以全测试集大小 \(|\mathcal{D}|\) 归一化):

\[ \rho_{IK}=\frac{1}{|\mathcal{D}|}\sum_{(x,q)\in\mathcal{D}}\mathbb{I}\!\left[V(y_{pred},y_{gt})\right],\qquad \rho_{IDK}=\frac{1}{|\mathcal{D}|}\sum_{(x,q)\in\mathcal{D}_{unk}}\mathbb{I}\!\left[V(y_{pred},\text{refusal})\right],\qquad T=\rho_{IK}+\rho_{IDK} \]

其中 \(\mathcal{D}_{unk}=\{(x,q)\in\mathcal{D}\mid A(x,q)<\tau\}\) 是探针判定为未掌握的子集,\(V(\cdot,\cdot)\) 是 LLM 裁判给出的语义判定谓词——预测与目标(ground-truth 答案或拒答意图)语义一致时为 True。

于是「诚实」被操作化成一句话:在已掌握事实上答对,或在未掌握事实上恰当拒答,二者居其一即记一次诚实行为,Truthful rate 就是这类行为的占比。这套定义直接决定了实验该怎么读:由于 \(\rho_{IK}\)\(\rho_{IDK}\) 都按 \(|\mathcal{D}|\) 归一化,在 60/40 的 Known/Unknown 配比下,两者各自的理论上限分别是 60 与 40(表 1 的 "Data Proportion" 行标的就是这两个上限),所以 45.8 这样的绝对值要对照上限看,而不是默认满分 100。作为补充证据,本文还在推理时统计模型生成拒答模板的平均对数概率(Logprob)与困惑度(PPL),用来分辨「基于真实认知校准的拒答」与「模板模仿」。只看 Truthful 会掩盖「用高拒答率换安全」的作弊解,同时报 \(\rho_{IK}\)\(\rho_{IDK}\) 才能看出模型是在学会区分,还是一律闭嘴。

一个完整示例

用图 2 里的两条样本走一遍(⚠️ 下述采样计数按原文图示整理)。

第一条,Q「这辆车的品牌是什么?」——10 次高温采样中 9 次答对(正确答案为 Chrysler,其中一次答成 Volkswagen),\(A=9/10=0.9\ge\tau\),标为 Known。偏好对是:chosen = "Chrysler",rejected = 拒答模板 "I don't know"。这条数据的含义是「这种题你必须答」,用来压住对齐税。

第二条,Q「这栋建筑是什么建筑风格?」——10 次采样得到 2 次 Gothic(正确)、6 次 Baroque、2 次 Neoclassical,\(A=2/10=0.2<\tau\),标为 Unknown。偏好对是:chosen = 拒答模板,rejected = 置信度最高的错答 "Baroque"。这条数据的含义是「这种题你不能猜」。

对照一条在筛选阶段就被丢掉的样本:Q「这本书的作者是谁?」虽然模型很可能答得出,但答案印在封面上、靠 OCR 即可获得,不消耗参数知识,因此被剔除——把它留在训练集里只会污染「答错即知识缺口」的归因。对齐完成后,边界会变成行为上可观测的差异(图 1 右):面对「这栋建筑属于哪个历史地区?」这类超出参数知识的问题,base 模型自信地答 "Moravia",对齐后的模型给出 "I don't know",而正确答案是 Bohemia。

损失函数 / 训练策略

训练分两阶段。第一阶段 SFT(原文称 Idk-SFT)只最大化 chosen 回答的对数似然,作用是教会模型标准拒答的表述格式:

\[ \mathcal{L}_{\text{SFT}} = -\mathbb{E}_{(x,y_w)\sim \mathcal{D}_{\text{V-Idk}}}\left[\log \pi_\theta(y_w \mid x)\right] \]

⚠️ 缓存中原文 Eq. 1–3 的 LaTeX 已损坏,上式按第 3.2 节的文字说明重写,精确写法以原文为准。

第二阶段在偏好对上做偏好优化,三种可选。DPO 以 SFT 后的模型作为参照模型 \(\pi_{ref}\),用系数 \(\beta\) 加权的对数比之差过 sigmoid,把 chosen 的概率往上、rejected 的往下推;CPO 不要参照模型,直接在 chosen 与 rejected 之间做对比目标,让模型靠近 chosen 分布、远离 rejected 分布;ORPO 则把监督项与偏好项合成一个目标 \(\mathcal{L}_{\text{ORPO}}=\mathcal{L}_{\text{SFT}}+\lambda\mathcal{L}_{\text{OR}}\),其中偏好项用 odds ratio 放大「在未知事实上诚实」的相对几率、同时保住已知事实上的 helpfulness(⚠️ 原文 Eq. 2/3 的 LaTeX 同样损坏,此处只还原其作用形式,精确表达式以原文为准)。这三者的差别正是实验要比较的对象:SFT 只学格式、DPO 偏保守、CPO/ORPO 在本任务上平衡最好。

实现细节:全部用 LoRA 做参数高效微调,rank \(r=64\)\(\alpha=128\)、覆盖 LLM backbone 的所有线性层;SFT 在 2 万条 V-Idk 训练样本上跑 1 个 epoch,AdamW、学习率 \(1\times10^{-5}\)、全局 batch size 32;偏好优化阶段跑 3 个 epoch,学习率降到 \(1\times10^{-6}\) 并配 cosine decay。硬件为 2×NVIDIA H800 (80G)。推理用贪心解码保证确定性,每个输出再交给高能力 LLM 裁判做语义判定。

实验关键数据

主实验

评测在 V-Idk 测试集(3,000 条,60% Known / 40% Unknown)上进行,两种推理协议:Zero-shot 只给图像和问题,不给任何拒答提示或模板,测的是对齐是否真把边界内化了;Few-shot 在 prompt 里明确写出「如果不知道就回答 I don't know」,并附两条上下文示例(一条正确作答、一条标准拒答),测的是模型在引导下能否校准边界。

模型 方法 Zero-shot IK-IK Zero-shot IK-IDK Zero-shot Truthful Few-shot IK-IK Few-shot IK-IDK Few-shot Truthful
数据占比(上限) 60.0 40.0 100.0 60.0 40.0 100.0
LLaVA-1.5-7B Base (Prompting) 45.8 1.8 47.6 45.5 12.4 57.9
SFT 34.4 ↓11.4 32.7 ↑30.9 67.1 ↑19.5 27.6 ↓17.9 36.8 ↑24.4 64.4 ↑6.5
DPO 51.9 ↑6.1 5.5 ↑3.7 57.4 ↑9.8 45.3 ↓0.2 17.8 ↑5.4 63.1 ↑5.2
CPO 44.4 ↓1.4 13.9 ↑12.1 58.3 ↑10.7 42.8 ↓2.7 24.5 ↑12.1 67.3 ↑9.4
ORPO 45.9 ↑0.1 14.1 ↑12.3 60.0 ↑12.4 40.0 ↓5.5 26.5 ↑14.1 66.5 ↑8.6
LLaVA-1.5-13B Base (Prompting) 49.9 4.3 54.2 49.6 19.8 69.4
SFT 34.4 ↓15.5 39.1 ↑34.8 73.5 ↑19.3 27.5 ↓22.1 39.8 ↑20.0 67.3 ↓2.1
DPO 50.2 ↑0.3 6.7 ↑2.4 56.9 ↑2.7 49.7 ↑0.1 21.4 ↑1.6 71.1 ↑1.7
CPO 44.9 ↓5.0 19.0 ↑14.7 63.9 ↑9.7 43.7 ↓5.9 30.3 ↑10.5 74.0 ↑4.6
ORPO 45.8 ↓4.1 20.4 ↑16.1 66.2 ↑12.0 42.7 ↓6.9 33.9 ↑14.1 76.6 ↑7.2

表中下标为相对同模型 Base 的涨跌;"Data Proportion" 行给出的是该测试集上 \(\rho_{IK}\)\(\rho_{IDK}\)、Truthful 各自的理论上限(三个指标都按全测试集 \(|\mathcal{D}|\) 归一化)。

消融实验

本文没有传统意义上的模块消融,最接近的是对训练目标本身的对照:把 Prompting(免训练)、SFT(只学格式)、DPO/CPO/ORPO(不同偏好优化形式)当成同一数据上的五种对齐策略来比,再叠加跨域泛化与内部探针两条分析线。

评测集(LLaVA-1.5-7B,Few-shot) 数据配比 Prompting SFT DPO CPO ORPO
V-Idk 主集 · Truthful 60:40 57.9 64.4 63.1 67.3 66.5
ScienceQA · Truthful 50:50 56.1 59.5 60.1 62.6 63.8
VizWiz-Unans · Truthful(视觉退化) 84.3 95.6 92.3 90.9 82.8
PMC-VQA · Truthful(知识迁移) 75.8 77.4 77.9 80.0 78.2

⚠️ VizWiz-Unans 与 PMC-VQA 两行是按原文 Fig. 3 柱状图上的数值标注整理的,精确数字请以原文图为准;VizWiz-Unans 上正确行为就是拒答,因此该行的 Truthful 严格等于成功拒答率,与主集「答对 + 拒答」的定义并不完全可比。

ScienceQA 上细分的两个分量更能说明问题:SFT 最保守(\(\rho_{IK}\) 最低,24.0,比 Prompting 的 30.3 掉了 6.3),DPO 是唯一把科学知识掌握度也提上去的方法(33.9,+3.6),CPO 与 ORPO 在 Truthful 上领先(62.6 / 63.8)。这说明对齐学到的不是对 InfoSeek 实体名的记忆,而是一个跨领域的「掌握与否」判据。

内部不确定性探针则直接读模型状态:强制模型在 Known 与 Unknown 两个子集上都生成拒答模板 "I don't know.",再看这段模板的平均 Logprob 与 PPL(Post-Align 为 ORPO 对齐后)。

子集 回答 Logprob ↑ (Pre / Post) 拒答模板 PPL ↓ (Pre / Post)
Known 问题 -0.88 / -0.76 2.42 / 2.14
Unknown 问题 -0.80 / -0.63 2.22 / 1.89

关键发现

  • Vanilla VLM 的过度自信是可量化的。 7B Base 在 zero-shot 下 \(\rho_{IK}\) 有 45.8,\(\rho_{IDK}\) 却只有 1.8——它几乎从不拒答;即便给了 few-shot 提示,\(\rho_{IDK}\) 也只爬到 12.4。这正面支持了「对齐范式把 helpfulness 摆在 truthfulness 之上」的判断。
  • SFT 的收益与代价都很极端。 7B zero-shot 下 \(\rho_{IDK}\) 从 1.8 涨到 32.7(+30.9),但 \(\rho_{IK}\) 同时从 45.8 掉到 34.4(−11.4),few-shot 下更要掉 17.9。这说明 SFT 学到的是一个笼统的保守先验,而不是「分清掌握与否」,它把拒答当成了万能动作。
  • 偏好优化把权衡拉回中间。 ORPO 在 7B zero-shot 拿到最高的 60.0(比 Base 的 47.6 高 12.4),在 13B few-shot 拿到全场最高的 76.6(比 Base 的 69.4 高 7.2);CPO 在 7B few-shot 拿到 67.3(+9.4),也就是摘要里 57.9 → 67.3 那条主结果(两者同为 7B few-shot 设置)。
  • 模型越大,边界越清楚。 13B 在几乎所有方法上都优于 7B;更关键的是 Base 13B 在 few-shot 下已有 19.8 的 \(\rho_{IDK}\),而 7B 只有 12.4——更大的参数容量本身就提供了更稳定的内部知识表示,对齐目标也更容易被执行。
  • 诚实性可以跨域迁移。 只在 V-Idk 上训练,ScienceQA 上 ORPO 的 Truthful 从 56.1 提到 63.8(+7.7),且内部行为结构与主集完全一致(SFT 最保守、DPO 最保知识、CPO/ORPO 最平衡)。这说明学到的是领域无关的诚实,而不是对特定实体的过拟合。
  • 「视觉退化」与「知识缺口」两类拒答由不同方法胜出。 VizWiz-Unans 上 SFT 拿到 95.6(比 Prompting 的 84.3 高 11.3)——视觉信号一塌糊涂时,「保守拒答」这单一先验就够了;但到 PMC-VQA 这种专业知识缺口,CPO 以 80.0 反超 SFT 的 77.4。偏好学习才能让模型区分「我不擅长医学」,而不是靠一个固定模板一律拒答。
  • 内部概率证据说明模型不是背模板。 ORPO 对齐后,模型对「在 Unknown 问题上拒答」的置信度(Logprob −0.63)明显高于「在 Known 问题上误拒」的置信度(−0.76),拒答模板在 Unknown 侧的 PPL 也更低(1.89 vs 2.14)。同时 Known 侧拒答模板的 Logprob 从 −0.88 升到 −0.76、PPL 从 2.42 降到 2.14,这正是对齐税在内部概率上的体现:模型对已知事实的拒答倾向也变强了,只是始终没有强过真正该拒的情况。

亮点与洞察

  • 把「诚实」从美德变成指标。 用「探针标签 × 输出语义正确性」交叉出的四象限把 honesty 与 helpfulness 的权衡拆成两个可同时观测的数(\(\rho_{IK}\)\(\rho_{IDK}\)),并且明确标出各自的理论上限。这个设计的关键收益是堵住了「靠一律拒答刷高分」的作弊解——只看 Truthful 的话,SFT 在 7B zero-shot 上的 67.1 看起来比 CPO 的 58.3 还好。
  • 用模型自己的采样定义「它不知道什么」。 一致性探针量的是行为稳定性,而不是模型的自我报告或单次回答的对错,因此天然是 model-specific 的、也不依赖输出格式。这个思路可以直接当作「能力边界标注器」移植到任何需要 model-specific 掌握度信号的场景。
  • 负例不是随机挑的,而是挑最自信的错答。 把置信度最高的那次幻觉设为 rejected,等于优先惩罚部署时最危险的一类错误;这一细节在原文中一笔带过,但它是「Unknown 侧 chosen 是拒答」能真正压住幻觉的隐含前提。
  • 可迁移的配方。 「多采样探针标边界 → 按标签反向造偏好对 → 偏好优化校准」这套模板不绑定 VLM:文本 LLM 的工具调用(该不该调检索)、RAG 系统(检索到的证据够不够)、医学问答(该不该转诊)都是同类问题,只要能用多次采样估出一个 model-specific 的「掌握度」即可。

局限与展望

  • 作者承认的局限:训练数据规模偏小,未来可以扩充训练数据,或结合更高效的调优方法(如模态线性表示引导、训练无关的数据选择)。
  • 探针与训练集的成本不低。 每条样本要 10 次采样加 LLM 裁判逐条判分,2 万条训练集大致对应 20 万次推理;换成更强的模型或更大的数据集时,这条流水线的开销会线性膨胀,而它必须先跑完才能开始训练。
  • \(\tau=0.7\) 没有做敏感性分析。 论文把 \(\tau\) 固定为 0.7,却没有报告 \(\tau\) 变化时 \(\rho_{IK}\) / \(\rho_{IDK}\) 的曲线;而 \(\tau\) 直接决定训练集里正负例的配比(最终落在 60/40),是最该被消融的超参。
  • 指标归一化的口径让跨表比较需要小心。 三个指标都以 \(|\mathcal{D}|\) 归一化,强依赖测试集本身的 Known/Unknown 配比(V-Idk 是 60:40,ScienceQA 是 50:50),且 VizWiz-Unans 上的 Truthful 只等于成功拒答率。不同数据集、不同模型的 Truthful 绝对值不能直接比大小。
  • 验证范围偏窄。 只在 LLaVA-1.5-7B/13B 两个模型上验证,且都用 LoRA。换成 Qwen-VL、InternVL 这类更强的模型时,探针是否同样测得准、ORPO 是否仍优于 SFT,都还没有证据。
  • 在纯感知退化场景下框架并不占优。 按 Fig. 3 的标注,ORPO 在 VizWiz-Unans 上只有 82.8,反而低于 Prompting 基线的 84.3(⚠️ 数值按柱状图标注整理,以原文为准)。这提示当「该拒答」的原因从知识缺口变成视觉证据不足时,偏好优化调出的拒答先验不够保守,本文的框架未必优于最朴素的 SFT。
  • 可改进方向:把 \(\tau\) 从全局固定阈值改成按问题难度或领域自适应;用主动学习只对探针结果最不确定的那批样本做 10 次采样以压低标注成本;把视觉侧的感知不确定性与知识侧的认知不确定性合成一个联合的拒答判据,让模型能对「看不清」和「不知道」给出不同措辞的拒答。

相关工作与启发

  • vs Idk 框架(Cheng et al., ICML 2024): 他们首次在纯文本 LLM 上提出「构造 model-specific 数据集 + SFT + 偏好优化」来让模型说「我不知道」,是本文的直接技术前身。本文把这条链路搬到了多模态,并针对一个他们没处理的问题重做了数据构建:文本域里「不知道」的判据可以直接沿用,而多模态下拒答决策同时依赖视觉感知(图里有什么)和知识掌握(我对它知道什么),必须先用样本筛选把前者的噪声压掉,探针结果才可信。
  • vs InBoL(Wang et al., 2024): 同样做 MLLM 的拒答能力,但 InBoL 针对的是「问题本质上无解」的通用知识边界,本文针对的是「问题本可解、但这个模型恰好不知道」的知识缺口,后者出现在长尾与专业领域,需要 model-specific 的边界标定。两者的问题设定不同,不构成直接竞争。
  • vs V-DPO / CLIP-DPO / RLHF-V 等 VLM 偏好优化工作: 它们的偏好对都围绕答案质量构造(物体级幻觉、跨模态对齐),目标是让答案更准;本文的偏好对围绕答与拒的边界构造,目标是让模型在该拒时拒。代价是本文不直接提升 \(\rho_{IK}\)——7B 上除了 DPO zero-shot 的 +6.1,其余方法的 \(\rho_{IK}\) 基本持平或下降;收益是把「编造」换成了「诚实拒答」,这在医学、法律这类高风险场景里的价值高于单纯的准确率。
  • vs 感知不确定性/校准类拒答工作: 那些工作针对模糊、遮挡、损坏的输入,靠输入质量或输出置信度就能决定是否拒答;本文处理的是图像清晰但知识缺失的情形,必须引入外部探针来标定边界。两者的互补性在 OOD 实验里体现得很直接:VizWiz-Unans 上 SFT 最强(95.6),PMC-VQA 上 CPO 最强(80.0)——单一方法覆盖不了两类拒答。

评分

  • 新颖性: ⭐⭐⭐⭐ 把文本域的 Idk 范式迁到多模态并非简单平移:三阶段数据构建(尤其是一致性探针)与四象限指标是针对「认知不确定性 vs 感知不确定性」这一新区分重新设计的,属实质性贡献;训练侧的 SFT + DPO/ORPO 本身是现成组件的组合,创新度相对有限。
  • 实验充分度: ⭐⭐⭐ 主集、跨数据集、OOD、内部概率探针四条线都有,内部探针这条尤其有说服力;但只覆盖 LLaVA-1.5-7B/13B,\(\tau\) 与训练数据规模都没有消融,OOD 结论只能从柱状图读数。
  • 写作质量: ⭐⭐⭐⭐ 四象限框架与三阶段流水线讲得清楚,指标定义完整、还主动标出了理论上限;但 PDF 里公式排版损坏(缓存中可见),OOD 部分只有柱状图,读者要自己读数,呈现上略欠。
  • 价值: ⭐⭐⭐⭐ 给出了一条可复用的「先测出边界、再写回参数」配方,并用内部概率证据证明模型确实在校准认知而非背诵模板,对高风险场景下的多模态助手有直接意义。