TruthLens: Object Hallucination Detection via Self-Evaluating Truthfulness Scores in LVLMs¶
会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/wyqstan/TruthLens
领域: 幻觉缓解 / 多模态VLM
关键词: 对象幻觉检测, 多模态大模型, 内部表示可分性, 真实性分数, 零推理开销
一句话总结¶
TruthLens 揭示了多模态大模型隐藏层中真实与幻觉对象表征高度可分、但在语言模型输出头严重衰减的失配现象,通过复用极低频特殊 token 的对数概率构建自评估真实性分数,在零附加推理开销下实现了跨架构 SOTA 的对象幻觉检测与闭环修正。
研究背景与动机¶
多模态大语言模型(LVLM)在图文理解、视觉问答及多模态推理领域取得了突破性进展,但对象幻觉(Object Hallucination, OH)——即模型在文本描述中编造图像中并不存在的实体——一直是阻碍其在自动驾驶、智慧医疗等安全敏感领域实际落地的关键瓶颈。以往针对 LVLM 对象幻觉的检测技术主要聚焦于外部辅助校验或视觉注意力溯源:一类方法引入额外的高算力评判大模型或辅助检测器(如 GAIVE、HaLEM),这显著增加了系统延迟与推理成本;另一类方法则试图通过注意力权重分布(如 SVAR)或图像与提示的特征相似度(如 GLSIM)来衡量视觉接地程度。然而,这些方法普遍忽略了语言模型内部表征本身对事实真实性的隐式编码能力。
深入探究纯语言模型的不确定性与内部置信度可以发现,模型的隐藏层状态通常包含着对事实正确性的判断线索。由于现代 LVLM 本质上是在视觉条件调制下于语言空间做自回归生成,直觉上其内部隐状态理应同样沉淀了对象是否在视觉上真实存在的置信信号。本文通过诊断性探测实验证实了这一猜想:利用线性判别分析(LDA)探查不同 LVLM(如 LLaVA-1.5、Qwen2.5-VL、LLaVA-OneVision)最后一层隐藏特征时,真实对象与幻觉对象展现出极佳的几何可分性(AUROC 达 79%~84%);然而,直接使用语言模型生成头(LM Head)预测的负对数似然(NLL)或熵时,这种可分性却被严重抹平(AUROC 跌落至 63%~64%)。定量投影空间分析表明,表征真实性的判别方向与 LM Head 投影矩阵的有效子空间之间的对齐比率不足 0.025,暴露出严重的“内部表征高度可分,输出投影功能失真”的表征-投影失配现象。
这种结构性矛盾催生了一个核心切入点:与其引入笨重的外部判别模型或进行计算复杂的特征检索,不如直接唤醒并校准原生 LM Head,让模型自发读出其内部已然具备的真实性判断。核心 idea:复用模型词表中极低频特殊 token 在对象位置处的输出对数概率作为自评估真实性分数,通过 MSE 奖励回归与 KL 散度约束在不损伤通用生成能力的前提下激活真实性读出能力,实现零额外推理成本的高精度对象幻觉检测与闭环修正。
方法详解¶
整体框架¶
TruthLens 的核心工作流分为“探测与重用设计”、“轻量自评估微调”以及“推理检测与闭环修正”三个主要阶段。在自回归生成过程中,模型在每个对象 token 位置输出词表概率分布;TruthLens 不扰动核心词汇的预测概率,而是选定一个在生成过程中几乎从不出现的低频特殊 token(如 <unk> 或 <|image_pad|>),提取其在该位置的未归一化对数概率并平移常数偏移,得到归一化的真实性分数 \(S(o)\)。在训练阶段,模型基于带有对象标注的少量图像进行多采样生成,利用类别重加权的均方误差损失(MSE)将真实对象与幻觉对象的得分分别牵引至 1 与 0,同时引入针对原始冻结模型的 KL 散度正则项锁死通用生成能力。在测试阶段,模型无需任何外部组件即可实时输出逐 token 的真实性打分,并可通过简单的置信度过滤指令实现生成文本的自修正。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["输入图像与文本指令<br/>多模态自回归生成候选序列"] --> B["特殊Token真实性打分机制<br/>提取低频特殊Token对数概率与常数平移"]
B --> C["平衡重加权与KL散度约束微调<br/>正负样本自适应加权MSE + 冻结模型KL正则"]
C --> D["自评估幻觉检测与闭环修正<br/>阈值分类识别幻觉 + 提示重写精炼描述"]
D --> E["输出无幻觉可靠文本与置信度报告"]
关键设计¶
1. 特殊Token真实性打分机制:将内部隐式可分性无感投射至输出对数概率
针对隐藏状态中真实性信号显著但在输出层被淹没的瓶颈,直接修改高概率常用词的生成概率势必破坏语言模型的语法流利度与生成连贯性。TruthLens 的巧妙之处在于将目光投向了词表中那些先验生成概率极低的特殊占位 token(例如 LLaVA 系列中的 <unk>,或 Qwen2.5-VL 与 LLaVA-OneVision 中的 <|image_pad|>)。这些 token 在正常的视觉问答与描述中几乎永远不会被采样选中,因而对其概率进行微小调整完全不会扰乱原本的主流生成分布。具体而言,对于生成序列中对应于实体对象的 token \(o\),模型提取 LM Head 分配给指定特殊 token \(z_c\) 的对数概率,并通过减去基准平移常数 \(c_{\mathrm{ref}}\) 定义该对象的自评估真实性得分:
$\(S(o, X, I) = \log \pi_\theta(z_c \mid X, I, y_{<o}) - c_{\mathrm{ref}}\)$
其中 \(c_{\mathrm{ref}}\) 设为 \(-28.0\)(由于未归一化的低频 token 对数概率极小,该负数常数可将原始输出平移至接近 \([0, 1]\) 的合理数值区间)。对于多 sub-token 组成的长词对象,研究证实真实性信号在实体内部均匀分布,默认直接取首个 sub-token 的打分即可获得极其稳健的表现。该机制赋予了语言模型一个原生的“测谎镜头”,在推理时只需读取输出分布的对应维度即可完成打分,时间与显存开销完全为零。
2. 平衡重加权与KL散度约束微调:兼顾非对称监督收敛与通用多模态能力保全
在模型训练过程中,由于现实场景下 LVLM 生成的绝大多数对象仍是真实存在的,真实对象 token 的数量往往数倍于幻觉对象 token,这种显著的数据不平衡容易诱发打分模型偏向高分的虚假置信问题;此外,参数微调容易导致模型遗忘原有的复杂多模态推理与常识理解能力。为了化解这两项矛盾,TruthLens 设计了双重优化的训练目标。首先,通过批次内动态统计真实对象数 \(N_r\) 与幻觉对象数 \(N_h\),构造自适应类别权重 \(w_r = \frac{N_r + N_h}{2N_r}\) 和 \(w_h = \frac{N_r + N_h}{2N_h}\),使反向传播对稀缺的幻觉 token 施加更高的梯度惩罚。其次,引入未微调的冻结参考模型 \(\pi_{\mathrm{ref}}\),构建全序列级别的 KL 散度约束,使得目标优化函数表示为: $\(\mathcal{L} = \frac{1}{N_r + N_h} \sum_{(X, I)} \sum_{y \sim \pi_\theta} \sum_{o \in \mathcal{O}(y)} \left( w_r \mathbb{I}_{\{\hat{r}=1\}} + w_h \mathbb{I}_{\{\hat{r}=0\}} \right) \cdot \beta \left( S(o, X, I) - \hat{r}(o, I) \right)^2 + D_{\mathrm{KL}}(\pi_\theta(y \mid X, I) \parallel \pi_{\mathrm{ref}}(y \mid X, I))\)$ 其中真实目标奖励 \(\hat{r}(o, I)\) 对图像中存在的真实对象置为 1、不存在的幻觉对象置为 0,\(\beta=0.1\) 为平滑回归梯度的缩放因子。配合参数高效的 LoRA(\(r=8, \alpha=16\)),该目标函数仅用 4,000 张 MSCOCO 样本图像和每图 8 个采样输出,即可在 6~12 小时内完成微调,不仅使真实性打分高度吻合二元标签,而且在主流基准测试中完全没有通用能力衰退。
3. 自评估幻觉检测与闭环修正:从零开销细粒度判决到即插即用文本精炼
经过微调校准后,模型自身便构成了一个自给自足的闭环可靠系统。在离线或实时判决场景下,检测规则极为精练直观:设定固定判别阈值 \(\mu\),当 \(S(o) \le \mu\) 时判定为幻觉对象,反之则认定为视觉接地的真实对象。在此基础上,TruthLens 进一步搭建了“检测-缓解”闭环链路,无需任何外部微调的改写器。系统以预设 95% 真正率(TPR)的工作点阈值筛选出可疑幻觉实体,连同原始生成文本一并返还给同一模型,要求其“在保留可靠视觉信息的前提下,删除或修正无视觉证据支撑的描述”。实验表明,该机制能够精准摘除捏造的背景小物体,实现了在基本不降低召回率的前提下大幅压低整句与实体级幻觉率。
损失函数 / 训练策略¶
模型采用 LoRA 针对视觉投影层与语言骨干网络进行低秩适配微调,学习率设为 \(5 \times 10^{-5}\),批大小为 16。对于每一个训练图像样本,利用随机采样(temperature > 0)预生成 8 条描述文本,借助标准自然语言解析工具与词形还原算法,提取全部候选名词并与图像标注的 Ground Truth 类别及同义词表比对,从而确定二值监督标签 \(\hat{r} \in \{0, 1\}\)。训练中仅对识别出的首个 sub-token 计算加权 MSE 损失,而对全句序列施加 KL 惩罚,确保模型既学会在指定 token 位置吐露真实性,又守住通用条件概率分布不偏移。
实验关键数据¶
主实验¶
论文在通用的 MSCOCO(80 类,与训练同源域)以及更具挑战性的大词表基准 Objects365(365 类,零样本迁移评估)上,对五大主流开源 LVLM 进行了系统评估,对比了基于对数概率、注意力和隐藏表征的多项代表性基线。
| 数据集 | 评估模型 | 核心检测指标 | TruthLens (本文) | 最佳基线 (GLSIM / SVAR) | 相对/绝对提升 |
|---|---|---|---|---|---|
| MSCOCO | LLaVA-1.5-7B | AUROC / AUPR | 90.57 / 97.25 | 83.70 / 94.20 (GLSIM) | +6.87% / +3.05% |
| MSCOCO | LLaVA-1.5-13B | AUROC / AUPR | 90.99 / 97.59 | 84.97 / 95.15 (GLSIM) | +6.02% / +2.44% |
| MSCOCO | LLaVA-NeXT-13B | AUROC / AUPR | 93.07 / 98.91 | 78.37 / 95.35 (GLSIM) | +14.70% / +3.56% |
| MSCOCO | Qwen2.5-VL-7B | AUROC / AUPR | 91.46 / 98.59 | 74.05 / 94.40 (GLSIM) | +17.41% / +4.19% |
| MSCOCO | LLaVA-OneVision-1.5-8B | AUROC / AUPR | 93.04 / 98.93 | 76.94 / 95.42 (GLSIM) | +16.10% / +3.51% |
| Objects365 | LLaVA-1.5-7B | AUROC / AUPR | 77.89 / 84.56 | 72.60 / 74.60 (GLSIM) | +5.29% / +9.96% |
| Objects365 | LLaVA-NeXT-13B | AUROC / AUPR | 80.15 / 87.58 | 70.33 / 79.02 (SVAR) | +9.82% / +8.56% |
| Objects365 | Qwen2.5-VL-7B | AUROC / AUPR | 71.54 / 84.56 | 65.11 / 80.75 (SVAR) | +6.43% / +3.81% |
| Objects365 | LLaVA-OneVision-1.5-8B | AUROC / AUPR | 82.14 / 88.31 | 72.59 / 80.88 (SVAR) | +9.55% / +7.43% |
注:在保留模型原始描述能力方面,微调后模型的 Recall 变化均极微弱(例如 LLaVA-1.5-7B 从 76.10% 变为 77.34%,Qwen2.5-VL-7B 从 66.51% 变为 66.80%),表明模型生成能力未受负面影响。
消融实验¶
在 MSCOCO 数据集上针对损失函数的各项组成模块进行消融验证,测试各组件对判别性能的关键贡献。
| 配置 | LLaVA-1.5-7B AUROC | LLaVA-1.5-7B AUPR | Qwen2.5-VL-7B AUROC | Qwen2.5-VL-7B AUPR | 说明 |
|---|---|---|---|---|---|
| 原始预训练模型 (无微调) | 34.80 | 70.71 | 35.04 | 80.98 | 未经校准的特殊 Token 缺乏真实性判别力 |
| MSE 奖励对齐 + KL 散度约束 | 89.02 | 96.36 | 85.69 | 97.49 | 激活核心判别信号,性能大幅飙升 |
| 完整模型 (+ 类别重加权) | 90.57 | 97.25 | 91.46 | 98.59 | 缓解正负样本失衡,Qwen 上提升尤为显著 (+5.77% AUROC) |
| 去掉 KL 约束 (w/o KL) | 严重退化 | 严重退化 | 崩塌 | 崩塌 | 文本生成崩溃,反复输出固定无意义重复句 |
此外,针对特殊 token 选择的消融证实,Qwen2.5-VL 在选用 <|image_pad|> (91.46)、<|vision_start|> (91.54) 与 <|vision_end|> (91.20) 时 AUROC 差异小于 0.35%,说明方法收益源自机制设计而非特定特殊 token 的特异性。
关键发现¶
- 最关键模块贡献:MSE 目标奠定了真实性信号映射的根基(AUROC 直接从 ~35% 跃升至 ~85-89%),而类别重加权则进一步解决了幻觉稀疏导致的偏见问题,在先进模型(Qwen2.5-VL)上带来了超 5.7% 的关键飞跃;KL 正则项则是保持语言生成不发生语义崩溃的生命线。
- 跨数据集泛化能力:模型仅在 MSCOCO 的 80 类对象上训练,但在类别空间大幅扩张至 365 类的 Objects365 上,仍能全面大幅碾压基线(AUROC 提升超 6%~9%)。这证实 TruthLens 学到的是多模态表征中底层的“事实接地置信度”,而非过拟合特定物体的统计共现。
- 层级演进与投影失配机理:逐层 LDA 探测证明,真实与幻觉表征的可分性主要在模型的中间层(归一化深度 0.3~0.7)随跨模态交互的加深而逐渐形成;而未微调的 LM Head 之所以失效,是因为判别方向与 Head 权重有效空间的对齐比率不足 0.025,微调实质上是补齐了这一投影通道。
- 闭环修正成效:基于检测分数的提示重写在 LLaVA-1.5-7B 上将句子级幻觉指标 CHAIRs 从 49.40% 降低至 43.78%,实体级幻觉指标 CHAIRi 从 14.81% 压低至 12.23%,同时图像描述的 Recall 几乎无损(76.74% 变至 76.31%)。
亮点与洞察¶
- 特殊 Token 的妙用借道:巧妙利用语言模型中天然处于静默边缘的极低频特殊占位 token 充当“真实性指示针”,不仅绕开了修改正常词汇概率引起的语言退化风险,更实现了零显存、零外部模型、零附加推理前向传播的极简架构。
- 机制解释兼具广度与深度:不仅提出了工程方法,更利用 LDA 逐层探测和输出零空间投影比率(Output-Null Analysis)精确剖析了“中间表征分得清,输出投影漏得光”的机理本质,研究逻辑严谨扎实。
- 检测与缓解的轻量闭环:证明了高精度的 token 级真实性评分不仅能用于事后监控,还能以“自我审计-提示重写”的原生方式反哺生成质量,构建了从感知到纠错的自愈闭环。
局限与展望¶
- 监督信号依然依赖外部标注:微调阶段仍需依赖 MSCOCO 这类具备高质量实体标注的数据集来进行正负样本划分,未来可探索利用多视图一致性或强化学习自主发现正负样本的无监督/自监督校准策略。
- 从两阶段重写到单阶段即时抑制:目前的闭环修正仍然是“生成全部文本 → 筛选低分实体 → 二次提示重写”的两阶段流程;未来有望将真实性得分直接集成到自回归解码阶段(如真实性引导的动态温度调节或对比解码),在单次前向中实时扼杀幻觉生成。
- 多词实体的粒度适配:尽管实验显示首 token 与平均 token 表现接近,但针对专业术语或复合长短语,更精细的跨 token 聚合机制仍有进一步探究的空间。
相关工作与启发¶
- vs GAIVE / HaLEM 等外部辅助模型方法:以往方法依靠教师大模型或外挂 LLM 进行二次打分,推理成本和端到端延迟剧增;TruthLens 彻底抛弃外部依赖,依托模型自身参数实现零开销内部自评。
- vs SVAR / GLSIM 等注意力与特征相似度方法:此类方法通过显式追踪注意力流动或构建图文特征相似度计算分数,无法直接利用语言模型内部丰富的上下文语义真实性知识;TruthLens 从语言模型表征可分性与 LM Head 投影的角度切入,检测精度(AUROC 提升超 15%)大幅领先。
- vs LASER 序列级自评估:LASER 在纯文本复杂推理的整个解答末尾预测单步 reward;TruthLens 将该思路精细化拓展至图文多模态场景下的 token 级细粒度实体决策,成功解决了更底层的实体接地校验问题。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ [敏锐发现 LM Head 的表征投影失配现象,借用低频特殊 Token 构建零推理成本自评估通道,构思非常优雅]
- 实验充分度: ⭐⭐⭐⭐⭐ [覆盖 5 种前沿 LVLM 架构、多项目标与属性幻觉基准,包含深度的表征-投影数学机理分析与消融实验]
- 写作质量: ⭐⭐⭐⭐⭐ [问题提出层层递进,动机剖析深刻透彻,图表规整,数学推导逻辑自洽]
- 价值: ⭐⭐⭐⭐⭐ [在工业落地中无任何新增延迟和额外参数,为构建可靠、可解释的多模态模型提供了实用范式]