跳转至

👻 幻觉检测

🔬 ICLR2026 · 40 篇论文解读

📌 同领域跨会议浏览: 📷 CVPR2026 (33) · 💬 ACL2026 (28) · 🧪 ICML2026 (21) · 🤖 AAAI2026 (15) · 🧠 NeurIPS2025 (17) · 📹 ICCV2025 (5)

🔥 高频主题: 多模态 ×9 · LLM ×7 · 推理 ×5 · 对齐/RLHF ×2

AFTER: 用自适应事实引导的激活编辑缓解 LVLM 的物体幻觉

AFTER 把图像的真值标注「文本化」成类别/属性/关系三类事实,用事实描述与原始图像的激活差构造正向的视觉-文本编辑方向,再训练一个轻量估计器为每个 query 估计偏移量,从而自适应地把 LVLM 的幻觉激活推向事实语义,在 AMBER 上最多降低 16.3% 的幻觉。

BARREL: Boundary-Aware Reasoning for Factual and Reliable LRMs

针对大推理模型(LRM)在事实问答上"宁可编也不说不知道"的毛病,本文先定位出两种由"事实性过度思考"引发的病态推理模式,再用"知识边界标注 → 边界感知 SFT → 基于可靠性奖励的 GRPO"三段式训练框架 BARREL,把 DeepSeek-R1-Distill-Llama-8B 的可靠性从 39.33% 拉到 61.48%,且准确率不降反升。

Beyond In-Domain Detection: SpikeScore for Cross-Domain Hallucination Detection

作者发现「由幻觉答案引出的多轮自对话,其不确定性分数会出现远比真实答案剧烈的尖峰抖动」,于是把这种抖动量化成 SpikeScore(分数序列的最大二阶差分),用一个阈值就能做到只在单个领域训练、却能跨多个领域稳定检测幻觉,在四个 LLM、六个 benchmark 上的跨域 AUROC 全面超过 PRISM、ICR Probe 等专门的跨域方法。

Cat-PO: Cross-modal Adaptive Token-rewards for Preference Optimization in Truthful Multimodal LLMs

针对多模态大模型的幻觉问题,本文提出 Cat-PO:在 DPO 偏好优化中,仅靠模型自身的跨模态注意力与相似度,为每个回答 token 计算全局/局部/语义三层视觉相关性,融合成一个平滑的 token 奖励来重新加权 DPO 损失并加上 token 级 KL 正则,从而对幻觉 token 做细粒度纠偏,在 AMBER-Generation、MM-Hal 等基准上比现有 SOTA 高 7%–15%。

ChainMPQ: Interleaved Text-Image Reasoning Chains for Mitigating Relation Hallucinations

ChainMPQ 是一个无需训练的推理框架:把"主体—关系—客体"这一关系问题拆成 5 个互补子问题,按顺序喂给视觉语言模型,并把每一步的文本答案与视觉注意力记忆传递给后续步骤,形成交错的图文推理链,从而在多个 LVLM 和关系幻觉基准上稳定降低关系幻觉。

CoFact: Conformal Factuality Guarantees for Language Models under Covariate Shift

把 LLM 事实性控制中固定不变的"共形阈值"换成随测试分布在线漂移而自适应调整的阈值,用在线密度比估计动态对校准集重加权,从而在 prompt 流持续协变量漂移、且拿不到测试标签的现实场景下,依然保证幻觉率不超过用户设定的 α。

Copy-Paste to Mitigate Large Language Model Hallucinations

提出 Copy-Paste 生成范式,通过训练 LLM 优先直接复制检索上下文中的片段来生成回答,而非自由改写,配合高复制偏好的 DPO 训练,在反事实 RAG 基准上将忠实度从 80.2% 提升到 92.8%。

Critical Confabulation: Can LLMs Hallucinate for Social Good?

本文把"幻觉"重新框定为一种可用资源:提出 critical confabulation(批判性虚构),让 LLM 在证据约束下"填补"历史档案中被结构性抹除的空白,并用一个基于未出版黑人历史语料的"叙事完形填空"任务系统评估了 19 个模型,证明受控、良定义的幻觉可以服务于知识生产而不坍缩成虚假。

Dynamic Multimodal Activation Steering for Hallucination Mitigation in Large Vision-Language Models

提出动态多模态激活引导(DMAS),通过构建基于语义的真实性引导向量数据库和视觉感知引导向量,在推理时动态选择最相关的引导向量对关键注意力头进行干预,无需训练即可显著缓解LVLM幻觉,在MME上提升94.66分,在CHAIR上降低20.2%幻觉率。

EmotionHallucer: Evaluating Emotion Hallucinations in Multimodal Large Language Models

EmotionHallucer 是一个面向 MLLM 情绪理解的幻觉评测基准,它把情绪幻觉拆成“情绪心理学知识”和“真实多模态情绪感知”两大维度,用成对的 basic / hallucinated 二元问答检测模型是否既能做基本情绪判断、又能拒绝看似合理但错误的情绪描述,并进一步提出 PEP-MEK 推理框架让模型在多模态情绪感知子集上平均提升 9.90%。

Enhancing Hallucination Detection through Noise Injection

在 LLM 中间层的 MLP 激活中注入均匀噪声来近似贝叶斯后验,捕获认知不确定性(epistemic uncertainty),与采样温度捕获的偶然不确定性(aleatoric uncertainty)互补,将 GSM8K 上的幻觉检测 AUROC 从 71.56 提升到 76.14。

Estimating Semantic Alphabet Size for LLM Uncertainty Quantification

本文指出经典「离散语义熵」(DSE) 在小样本下会系统性低估真实语义熵,借鉴种群生态学的「未见物种」问题提出一个混合语义字母表大小估计器,并据此对 DSE 做样本覆盖率校正,让黑盒不确定性估计在更可解释的前提下追平甚至超过 KLE、SNNE 等复杂 SOTA 方法。

FREAK: A Fine-grained Hallucination Evaluation Benchmark for Advanced MLLMs

FREAK 用「先生成正常图、再局部编辑出反常识细节」的自动化管线造出 1,786 张照片级反常识图像与 1,799 道题,专门戳 SOTA 多模态大模型在细粒度视觉感知上的幻觉——最强模型也只有 45% 准确率,远低于人类的 86.71%,并实锤了 CoT 推理在这类任务上不升反降。

GHOST: Hallucination-Inducing Image Generation for Multimodal LLMs

GHOST 不再用固定的静态 benchmark 评测多模态大模型(MLLM)的物体幻觉,而是主动生成一批"看起来自然、人眼看不出有目标物、却能让模型坚信物体存在"的图片,把幻觉成功率从已有方法的约 1% 拉到 28% 以上,并发现这些图片在不同模型间高度可迁移。

Grounding or Guessing? Visual Signals for Detecting Hallucinations in Sign Language Translation

本文首次研究手语翻译(SLT)中的幻觉问题,提出一个 token 级"可靠性"分数,用特征敏感度 + 反事实扰动量化解码器到底是"看视频接地"还是"靠语言先验猜测",从而无需参考译文即可预测幻觉风险,并揭示 gloss-free 模型为何更容易幻觉。

Hallucination-aware Intermediate Representation Edit in Large Vision-Language Models

HIRE 不重训也不做双前向,而是在 LVLM 中间表征层"就地编辑"——用对偶编码器把幻觉成分从语义里剥离出来、沿"减幻觉方向"做一次平移,再用轻量 Router 只对高风险 token 出手,在三个基准上以接近原始推理的开销刷到 SOTA,还能通过一个超参反向放大幻觉做可控生成。

Hallucination Begins Where Saliency Drops

提出 LVLMs-Saliency 梯度感知诊断框架来量化每个输出 token 的视觉锚定强度,发现"当先前输出 token 对下一个 token 预测的显著性降低时,幻觉就会产生"的关键规律,并基于此设计了 SGRS(显著性引导的拒绝采样)+ LocoRE(局部一致性增强)双机制推理时框架,在多个 LVLM 上显著降低幻觉率。

Hallucination Reduction with CASAL: Contrastive Activation Steering for Amortized Learning

CASAL 把推理时的激活引导(activation steering)"摊销"进模型权重——只训练单层的一个子模块、只用表示损失(不用交叉熵),就能让 LLM "知道的答、不知道的弃答",在多个短问答基准上把幻觉率降低 30%–40%,且比 LoRA 类基线省 ~30× 算力、~20× 数据。

HalluGuard: Demystifying Data-Driven and Reasoning-Driven Hallucinations in LLMs

本文提出统一的「幻觉风险界(Hallucination Risk Bound)」理论框架,把 LLM 幻觉风险用三角不等式分解为数据驱动项(训练期表示偏差)与推理驱动项(解码期不稳定),并据此设计无需外部参考、无需幻觉标注的 NTK 谱代理分数 HalluGuard,在 10 个基准、11 个基线、9 个骨干上一致取得 SOTA。

HARP: Hallucination Detection via Reasoning Subspace Projection

HARP 把 LLM 的隐藏态空间分解成「语义子空间 ⊕ 推理子空间」,通过对 Unembedding 层做 SVD 找出推理子空间的基向量,再把隐藏态投影到这个仅占约 5% 维度的子空间上作为幻觉检测特征,在 TriviaQA 上把 AUROC 推到 92.8%(比此前最佳高 7.5 个百分点)。

High Accuracy, Less Talk (HALT): Reliable LLMs through Capability-Aligned Finetuning

HALT 在微调阶段把预训练模型自己生成的回答拆成"事实片段"并用带真值的评估器逐片判对错,只保留模型确实能正确生成的部分、其余替换为"Unsure from here",从而训练出一个"只说有把握的话"的可靠 LLM——可调阈值在完整度与正确率之间权衡,单个 Llama3-70B 把四领域平均正确率从 51% 提到 87%。

Imitating the Truth: Attention-aware Truth-Guided Enhancement for Hallucination Mitigation in Large Vision-Language Models

本文发现 LVLM 在生成"真实 token"和"幻觉 token"时存在分阶段、模型特异的注意力差异,提出训练无关的 AGE 框架——在推理时把视觉/文本注意力"校准"成真实 token 的注意力模式,从而无需重训、不损流畅度地缓解幻觉。

Learning to Reason for Hallucination Span Detection

本文提出 RL4HS:用强化学习(基于 span-F1 奖励的 GRPO)训练一个会"先推理后定位"的 7B/14B 模型来精确检测幻觉跨度,并设计 Class-Aware Policy Optimization (CAPO) 修正奖励对"无幻觉"类的系统性偏置,在 RAGTruth 上超越 SFT、专有大推理模型(GPT-5、o3)。

Leveraging Pretrained Knowledge at Inference Time: LoRA-Gated Contrastive Decoding for Multilingual Factual Language Generation in Adapted LLMs

LGCD 用 SVD 把"原始预训练模型 vs 语言适配模型"的 FFN 权重差分解成一组 LoRA 矩阵,在解码时按 token 置信度动态判断是否触发对比解码,把适配过程中被灾难性遗忘掉的事实知识"重新注入"回来——全程无需训练、无需原始预训练数据。

Look Carefully: Adaptive Visual Reinforcements in Multimodal Large Language Models for Hallucination Mitigation

提出 AIR(Adaptive vIsual Reinforcement)框架,通过原型距离的 token 精简 + 最优传输引导的 patch 选择性增强,在推理时无训练地减少 MLLM 幻觉(LLaVA-1.5-7B CHAIR_S: 22→18.4,POPE 准确率 +5.3%),同时保持多模态通用能力。

LUMINA: Detecting Hallucinations in RAG System with Context-Knowledge Signals

提出 Lumina 框架,通过"上下文-知识信号"检测RAG系统中的幻觉:用MMD度量外部上下文利用程度,用跨层token预测演化度量内部知识利用程度,无需超参调优即可泛化。

Mechanistic Detection and Mitigation of Hallucination in Large Reasoning Models

本文提出基于机制可解释性的 Reasoning Score(用 LogitLens 度量后期层 logits 的分布漂移来刻画"推理深度"),据此揭示推理幻觉的三种内部模式,构建检测框架 RHD,并用势函数奖励塑形改造 GRPO 得到 GRPO-R 来缓解幻觉。

Micro-Macro Retrieval: Reducing Long-Form Hallucination in Large Language Models

M2R 提出"宏观检索 + 微观检索"双层框架:推理阶段从外部检索粗粒度证据并把答案对齐的关键信息存入键值库,回答阶段再用微观检索把这些关键信息取出来贴到答案 token 旁边,通过 GRPO + 课程学习训练,从根本上缓解长文本生成中的幻觉。

Mitigating Hallucination in Vision-Language Model with Depth and Spatial-aware Key-Value Refinement

作者发现 VLM 的视觉幻觉源于"相邻视觉 token 的 Key 向量失去相干性、各向同性发散",于是提出训练免费的 DSCR——用单目深度和 2D 空间近邻把同一物体上的 Key/Value 向量重新聚拢、把跨表面的推开,从而在不微调的前提下把跨模态注意力引回相关区域,在五个幻觉基准上最高带来 41.6% 的准确率提升。

NDAD: Negative-Direction Aware Decoding for Large Language Models via Controllable Hallucination Signal Injection

NDAD 反其道而行:不去从早层"捞"事实信号往上加,而是主动 mask 掉重要注意力头来诱导出幻觉信号,再把它作为"负方向"从最终输出分布里减掉,从而无需重训、无需外部知识就提升 LLM 的事实可靠性。

Neural Message-Passing on Attention Graphs for Hallucination Detection

把 LLM 内部的注意力矩阵和激活看作一张「带属性的有向图」(token 是节点、注意力流是边),用 GNN 做消息传递来检测幻觉,并从理论上证明该框架能涵盖此前的注意力启发式方法,实验上全面超越它们。

P2-DPO: Grounding Hallucination in Perceptual Processing via Calibration Direct Preference Optimization

P2-DPO 让大视觉语言模型(LVLM)针对自己的视觉短板自动生成 on-policy、视觉相关的偏好对(聚焦增强 + 抗噪),再用一个校准 DPO 损失把视觉信号和文本生成的因果关系对齐,在不依赖任何人工标注的前提下,幻觉基准上超过了靠昂贵人类反馈训练的强基线。

PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs

PostAlign 把"视觉 grounding(定位框/掩码)+ 文本 grounding(推理 rationale)"作为一副矫正眼镜后置在 MLLM 上,用一个 <REJ> 拒绝 token 让模型敢于拒绝不存在的物体、再用 <SIMPLE>/<COMPLEX> 路由信号按问题难度决定要不要生成中间推理,从而在 POPE、HaloQuest 等基准上显著压低幻觉、同时保住通用推理能力。

Seeing What's Wrong: A Trajectory-Guided Approach to Caption Error Detection

这篇论文提出 TRACED:不再用"一张图文对一个相似度分"判断字幕是否有误,而是反复编辑字幕去最大化图文对齐分、生成一条"字幕轨迹",用轨迹的改进幅度与语义变化作为特征训练分类器;在 MS COCO / Flickr30k / MM-IMDb 上把多种现有检测器的准确率最高提升约 2.8%,还能定位出错的具体词、并把这些线索喂给 VLM 把纠错后字幕的对齐分再提升最高 14.5%。

Semantic Uncertainty Quantification of Hallucinations in LLMs: A Quantum Tensor Network Based Method

针对语义熵检测幻觉时忽略「token 序列概率本身有多大随机波动」这一盲区,本文把序列概率的核均值嵌入看成一个量子张量网络(QTN)的波函数,用微扰理论一次性算出每条概率的局部不确定度,再用「熵最大化 + 按不确定度反比加权的 KL 惩罚」校准概率,得到对混淆(confabulation)更敏感、且可解释的语义 Rényi 熵;在 4 个数据集、8 个模型、3 档量化的 116 组实验里 AUROC/AURAC 稳定超过 SOTA。

SHIELD: Suppressing Hallucinations In LVLM Encoders via Bias and Vulnerability Defense

首次将LVLM对象幻觉系统性追溯到视觉编码器,识别出统计偏差(高频模式token过度强调)、固有偏差(预训练主导对象的残余表示)、脆弱性(微小扰动即导致特征失真)三大问题,并提出SHIELD——一个完全免训练的框架,通过token重加权、token减法和对比解码三策略协同防御,在LLaVA-1.5/InstructBLIP/Qwen-VL上全面超越VCD和OPERA等方法。

Token-Guard: Towards Token-Level Hallucination Control via Self-Checking Decoding

提出 Token-Guard,一种基于自检验解码的 token 级幻觉控制方法,通过隐空间中的 token 级/段级评分和迭代修正机制,在解码过程中检测并抑制幻觉生成,F1 平均提升 16.3%。

TraceDet: Hallucination Detection from the Decoding Trace of Diffusion Large Language Models

针对扩散大语言模型(D-LLM)多步去噪过程中暴露出的幻觉信号,本文把去噪轨迹建模成一条"动作轨迹",用信息瓶颈原理自动挑出对幻觉最有信息量的子轨迹来训练分类器,在两个开源 D-LLM、三个 QA 数据集上把幻觉检测 AUROC 平均提升 15.2%。

VeriTrail: Closed-Domain Hallucination Detection with Traceability

提出 VeriTrail——首个为多步生成过程(MGS)提供可追溯性的闭域幻觉检测方法,建模生成过程为 DAG 并沿路径逐层验证,同时构建了首批包含所有中间输出和人工标注的 MGS 数据集。

Visual Multi-Agent System: Mitigating Hallucination Snowballing via Visual Flow

本文发现 VLM 多智能体系统(MAS)会出现"幻觉滚雪球"——某个 agent 的视觉误判被后续 agent 通过纯文本流不断放大;作者通过逐轮/逐层/逐 token 的注意力分析定位到"中间层单峰视觉 token"是承载视觉证据的关键,进而提出 ViF:用这批视觉中继 token 在 agent 之间额外搭一条"视觉流",并配合注意力重分配,模型无关地缓解滚雪球,在 8 个 benchmark、4 种 MAS 结构、10 个底座上稳定提升 2.4–3.8%。