跳转至

The Commit-Abstain Circuit: Why Language Models Hallucinate Instead of Abstaining

会议: NeurIPS2026
arXiv: 2609.32964
代码: https://github.com/vnht/commit-abstain-circuit
领域: 幻觉 / 可解释性
关键词: 认识性弃答、无支持作答、因果门控、稀疏电路、策略读出

一句话总结

论文从生成前的作答—弃答 logit 间隔定位稀疏的作答—弃答电路(Commit-Abstain Circuit,CAC),发现早期作答积累与晚期弃答纠偏不足的模式,再用分量级贡献训练轻量策略,将报告的平均决策准确率从 0.692 提升至 0.814,而非证明答案内容准确率提高。

研究背景与动机

语言模型在信息不足时仍可能给出实质性答案,但这一行为不一定意味着内部完全没有“不该回答”的信号。已有隐藏状态探针能够读出正确性、真实性或不可回答性;另一方面,语义熵、多模型一致性与弃答训练主要在输出或行为层面解决问题。两者之间缺少一个组件级解释:如果相关信息已经存在,为什么最终输出仍越过作答门槛?本文将研究对象收窄为无支持作答(unsupported commitment),即在不可回答输入上没有弃答,而不是覆盖所有事实错误。

这里的弃答是认识性弃答(epistemic abstention):判断现有知识或上下文是否足够回答。它不同于因请求内容而触发的安全拒绝,也不同于“问题可以回答,但模型答错了”。KUQ 关注没有确定答案的问题,SQuAD 2.0 关注给定段落不支持的问题,MuSiQue 则通过移除支持文档制造推理链缺口;这些设置让“应不应该回答”成为独立的二分类目标。

作者选择在首个输出 token 之前测量模型偏好,避免把自回归生成已经形成的路径依赖混入起始决策。随后不只问某个方向是否可探测,而是联合干预注意力头和 MLP 子层,定位哪些组件支撑该偏好。核心 idea:保留作答—弃答决策形成过程中各组件的贡献,而不是只读取它们相加后的一个标量,从而识别被最终作答倾向掩盖的弃答信息。

方法详解

整体框架

输入是问题及可选上下文,监督信号是可回答性标签。分析阶段依次进行间隔归因、因果门控和功能干预,输出每个模型自己的 CAC;策略阶段再从未门控模型的一次生成前前向传播中抽取 CAC 特征,预测应作答还是弃答。

三个环节不能混为同一种计算:间隔归因使用固定最终归一化因子的线性分解;门控与功能干预修改实际前向传播,保留下游非线性;最终策略则训练一个外部轻量分类器,不更新基础语言模型,也不要求部署时继续施加定位用的门控。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    X["问题与可选上下文"] --> A["间隔归因"]
    A -->|训练集与可回答性标签| B["因果门控"]
    B -->|定位后的组件| C["功能干预"]
    C -->|分析验证而非推理必经步骤| D["分量策略读出"]
    A -->|推理:未门控前向的贡献| D
    B -->|固定 CAC 组件集合| D
    Y["训练监督:可回答性标签"] -.-> D
    D --> O["作答或弃答"]

关键设计

1. 间隔归因:把首步偏好拆成可追踪的组件贡献

作者先构建弃答起始 token 集合 \(\mathcal{A}\),其余词表构成作答集合 \(\mathcal{C}\)。在与训练、测试不重叠的 1,000 个不可回答样本上收集弃答回复的首 token,再跨模型合并、消歧并由标注者验证,主设置保留 17 个 token。这是一个词汇化的操作定义,不是对任何回复语义的完整判定;尤其不能因为某个起始词常见于弃答,就认为它的所有后续表达都必然是弃答。

在最后一个输入位置,分别取两个集合中 logit 最大的 token,并定义偏好间隔:

\[ \Delta(x)=z_{c^{*}(x)}(x)-z_{a^{*}(x)}(x),\qquad c^{*}(x)=\arg\max_{t\in\mathcal{C}}z_t(x),\quad a^{*}(x)=\arg\max_{t\in\mathcal{A}}z_t(x). \]

\(\Delta(x)\geq0\) 表示偏好作答,负值表示偏好弃答。它比较的是两组中最强的首步候选,而不是总概率质量,也不是答案正确概率。与完整贪心生成的行为标签平均一致率为 97.6%,支持其作为近似读出,但仍留下中途改口等例外。

残差流由各注意力头、MLP 子层输出以及嵌入等项相加构成。作者把最终归一化因子冻结为未门控前向的取值,将每个组件输出投影到两个最高 token 的读出差方向,得到带符号贡献:

\[ \Delta(x)=\kappa(x)+\sum_{k=1}^{K}v_k(x),\qquad v_k(x)=d(x)^{\top}c_k(x),\quad d(x)=u_{c^{*}(x)}-u_{a^{*}(x)}. \]

这里 \(c_k(x)\) 是组件输出,\(u_t\) 是吸收该样本冻结归一化因子的读出向量,\(\kappa(x)\) 收集嵌入与偏置等项。在这一归因口径下,正贡献推高间隔、负贡献压低间隔。该分解解释未干预前向的最终间隔,不能直接当作删除组件后行为变化的精确预测,因为删除会改变后续激活与归一化。

2. 因果门控:用相反正则压力筛出对决策有作用的组件

直接对所有组件逐个消融既昂贵,也容易遗漏交互。作者先用训练集上可回答与不可回答样本的平均贡献差筛选候选,然后在候选注意力头与 MLP 子层上联合训练 sigmoid 门。注意力头的门作用在输出投影之前,MLP 门作用在残差相加之前;非候选组件保持开启,基础模型权重始终冻结。

门控目标要求可回答输入的间隔变大、不可回答输入的间隔变小。用于该损失的最高作答与弃答 token 来自未门控模型,并在优化过程中固定,而不是在每次门控前向后重新执行最大值选择:

\[ \mathcal{L}_{\mathrm{task}}(G) =-\frac{1}{B}\sum_{x\in\mathrm{batch}}(2y-1)\Delta(x\mid G),\qquad \mathcal{L}(G;\lambda) =\mathcal{L}_{\mathrm{task}}(G)-\lambda\sum_{g\in\mathcal{S}}\mathrm{clip}(g,-C,C). \]

\(y=1\) 表示可回答,\(G=\sigma(g)\)。先在 \(\lambda=0\) 下优化任务损失得到共同初始化,再分别施加推向开启的保留压力和推向关闭的移除压力,得到 \(G^{+}\) 与 \(G^{-}\)。在移除压力下仍保持 \(G^{-}>0.5\) 的组件归为 c-component;在保留压力下仍保持 \(G^{+}<0.5\) 的组件归为 a-component。角色判断还结合跨种子平均门值,最终要求至少 8/10 个种子保持同一角色。

这些 a/c 名称表示相对于可回答性监督的差分角色,不等于“每个 a 组件的贡献都为负、每个 c 组件都为正”。附录 D.1 的示例中,一个组件在可回答与不可回答样本上的平均贡献分别为 +0.3、+1.5,两者都为正,却因差值为 −1.2 而可能被归为 a:它在本应弃答的样本上更强地推高作答间隔。门控梯度的差分解释应视作局部归因直觉;真实联合优化会改变下游计算,不能据此把完整模型当成独立线性组件。

3. 功能干预:分开检验门槛纠偏与排序结构

定位之后,作者按因果分数逐步删除 a 或 c 组件,并与 20 组同规模随机非 CAC 删除比较;另将组件输出放大,观察错误弃答和错误作答如何变化。这一步使用真实干预前向,而不是仅把固定归因式中的某个数减去或乘上系数。

关键结果并不符合字面标签的简单预测:删除 c 组件也更多导致“弃答变作答”。作者的解释是,c 组件不仅提供作答推动力,还支撑可回答与不可回答输入的排序分离;删除它们会破坏判别结构。相比之下,a 组件更像让临界样本跨过零门槛的纠偏信号,删除后排序变化较小。因此必须同时报告翻转方向与 AUROC,不能仅靠整体弃答比例给组件定性。

层深分析显示两类轨迹在约 80% 深度前都积累正贡献,真正弃答的轨迹随后明显转负,无支持作答轨迹则未被充分纠正。这是作者提出的“积累但纠偏不足”模式,并不是声称每个样本、每个模型都存在完全相同的时序电路。

放大也存在非线性边界。适度放大 c 组件增加作答、减少错误弃答;适度放大 a 组件增加弃答、减少错误作答,但会带来另一类错误。极端放大时,RMSNorm 会让归一化后的表示趋向组件方向而不是无限增大其幅度;a 组件的错误作答率仍出现非零平台。因此“把弃答组件乘得足够大”并不等价于可靠的弃答策略。

4. 分量策略读出:在相加之前保留可回答性信息

最终策略读取每个 CAC 组件在最后输入位置对间隔的贡献,并附加均值、标准差、最小值、最大值以及 a/c 组件贡献之和。不同模型的 CAC 有 16–64 个组件,特征维度再加这些统计量。它不重新求一个总和后套阈值,而是让分类器区分“一个巨大正向异常值盖过多个负向信号”和“多个组件一致支持作答”等模式。

MLP 的结构为 \(d_{\mathrm{in}}\to32\to128\to64\to32\to1\),先用 32 维瓶颈规范不同模型的特征规模,再进行非线性混合。输出为 \(P(\mathrm{answerable})\),低于验证集校准阈值时触发弃答。这里的概率是监督分类器的可回答性预测,不是语言模型对某个具体答案的正确性保证。

同特征逻辑回归也获得 +10.6 个百分点的平均决策准确率增益,MLP 为 +12.2 个百分点。两者仅相差 1.6 个百分点,说明主要收益来自分量级信息和重新读出,而不能全部归功于更复杂的分类器。

一个完整示例

附录 F.1 的 KUQ 个案在 Llama 3B 上被标为不可回答。模型的整体间隔为 +7.94,因此零阈值策略选择作答;其中 L19.MLP 的贡献达到 +8.27,而多个其他 CAC 组件提供负向贡献。

作者报告负贡献总和 −8.09、正贡献总和 +12.62,净 CAC 贡献为 +4.53。只看最终正间隔会丢失这种“一项强正值压过其他信号”的结构,而分量策略给出 0.089 的策略读出并正确弃答。该例说明分类器可以利用分布模式,不意味着任意单个大正贡献都代表不可回答,也不证明生成的答案在医学内容层面是否正确。

损失函数 / 训练策略

每个主数据集采样 1,000 个实例,监督实验按 50/50 划分训练与测试,并从训练部分留出验证集校准策略阈值。主分析覆盖五个模型家族的十个指令模型,规模为 3B–14B;完整生成行为检验采用贪心解码,最多 256 个新 token。

门控采用 Adam、批量大小 16,每阶段 100 步;第一阶段学习率从 0.1 降至 0.01,两个压力阶段从 0.5 降至 0.1,裁剪界为 4。正则强度按训练集未门控间隔尺度设置,结果汇总十个独立种子。候选筛选是相关性预筛,后续联合门控才提供干预证据,不能把二者互换。

策略 MLP 的隐藏层使用批归一化、ReLU 与 dropout 0.15;以二元交叉熵训练,AdamW 学习率和权重衰减均为 \(10^{-3}\),最多 500 个 epoch,早停耐心值为 120。定位与训练均按模型重新执行,不是跨模型共享一套门或分类器权重。

实验关键数据

主实验

下表摘取原文表 2:每行是同一模型在 KUQ、SQuAD 2.0、MuSiQue 三个测试集上的均值。Acc 是作答/弃答决策准确率,不是问答内容准确率;AUROC 衡量可回答性排序能力。

模型 零阈值 AUROC CAC MLP AUROC 零阈值 Acc CAC MLP Acc
Qwen 3.5 4B 0.725 0.879 0.655 0.829
Qwen 3.5 9B 0.798 0.911 0.697 0.855
Gemma 3 4B 0.722 0.807 0.644 0.765
Gemma 3 12B 0.854 0.889 0.770 0.845
Llama 3B 0.689 0.807 0.623 0.755
Llama 8B 0.784 0.874 0.651 0.820
Ministral 3B 0.790 0.874 0.714 0.815
Ministral 14B 0.848 0.877 0.753 0.829
Phi-4 mini 0.780 0.837 0.705 0.785
Phi-4 14B 0.830 0.888 0.711 0.840
全部配置均值,正文 §5.2 0.782 0.864 0.692 0.814

决策准确率定义为可回答样本选择作答、不可回答样本选择弃答的总体比例。错误弃答率 FA 是可回答样本中选择弃答的比例,错误作答率 FC 是不可回答样本中选择作答的比例;它们不是生成答案的精确匹配错误率。原文策略评估报告平均 FA 从 0.320 降至 0.127,约为原来的 1/2.5。

分析章节 §4.2 与附录 C 表 8 报告间隔 AUROC 均值 0.811,而策略比较 §5.2 的零阈值基线为 0.782。二者属于不同分析/评估汇总口径,原文没有完整交代其数值差异来源;不能把 0.811 替换进策略表,再重算作者报告的 +8.2 个 AUROC 点增益。

消融实验

下表汇总 §4.5 与附录 D.5 表 13。翻转比例以全部 1,500 个留出实例为分母,A→C 为弃答变作答,C→A 为作答变弃答;AUROC 变化是 §4.5 报告的跨模型平均值。

干预 A→C C→A 平均 AUROC 变化 解释
删除全部 a 组件 17.1% 7.8% −0.03 更多临界决策跨过零门槛,排序较稳定
删除全部 c 组件 31.7% 3.4% −0.17 同样偏向作答翻转,但判别结构明显受损

原文还报告 Qwen 4B 删除 c 组件后 AUROC 从 0.73 降至 0.40;同规模随机删除的平均变化为 −0.069。这一对照支持 CAC 并非随意抽取的组件集合,但不意味着每个 CAC 组件的完整语义功能已被解析。

下表摘取附录 E.3 表 18,检验策略结构是否必需;均值按十个模型汇总。

数据集 零阈值 Acc CAC 逻辑回归 Acc CAC MLP Acc
KUQ 0.707 0.887 0.923
SQuAD 2.0 0.665 0.743 0.745
MuSiQue 0.704 0.764 0.774
全部数据集 0.692 0.798 0.814

关键发现

  • CAC 在全部十个主模型中被定位,组件占比为 2.0%–11.8%,中位数 5.2%;其中 MLP 子层平均占约 25%。这支持将门控从注意力头扩展到 MLP,而不是将弃答归结为单一注意力头。
  • MLP 相对逻辑回归的优势主要来自 KUQ,平均差为 3.6 个百分点;SQuAD 2.0 为 0.2 个百分点,MuSiQue 为 1.0 个百分点。上下文任务中的大部分提升可以由分量级线性读出获得。
  • 两个未见数据集 HotpotQA 与 SelfAware 上,全部 24 个模型—数据集配置都优于零阈值,平均决策准确率提升 6.9 个百分点。大模型 Gemma 3 27B、Qwen 3.5 35B 先重新定位并在分布内数据上训练,随后做数据集零样本迁移;四个大模型 OOD 配置平均提升 6.3 个百分点,并非小模型权重零样本迁移。
  • 时序结论应按总体趋势理解:正文称在 60%–70% 深度“所有模型”每个 a 对应超过两个 c,但表 9 中 Qwen 9B 为 1.5/1.4,Gemma 12B 为 1.4/1.3。表格支持所有模型累计比例大于 1,不支持所有模型都大于 2。

亮点与洞察

  • 将“有信息”与“用信息做决策”拆开是最有价值的视角。组件贡献中可读出的可回答性信号可能在残差汇总后被掩盖,因此只优化总间隔未必能恢复正确决策。
  • 对消融的反直觉结果没有回避:删除所谓作答组件也会增加作答。区分排序结构和零门槛校准,避免用组件名称代替因果证据。
  • 策略只读取一小组组件的标量投影,而不是完整隐藏向量或多次生成。分量级读出为轻量部署提供方向,但离线定位、基础模型前向和 hooks 的成本仍然存在。
  • 放大实验揭示归一化带来的控制边界。适度干预的收益不能外推为极端幅度下的无限纠错能力,直接训练策略比盲目放大弃答信号更有依据。

局限与展望

  • 研究只覆盖不可回答输入上的无支持作答,没有解决可回答问题的错误答案;KUQ 的开放问题、SQuAD 2.0 的段落支持性、MuSiQue 的缺失文档分别代表特定不可回答性,不等价于完整真实世界事实核验。
  • 弃答词表与完整生成标签都依赖词汇表达,可能遗漏间接弃答或混合回复。17 token 设置及扩展词表的稳健性实验不能消除这种操作定义的限制,仍需语义级反例测试。
  • 固定最高 token 与冻结最终归一化因子便于归因,但不完整描述生成动态。97.6% 行为一致率并非 100%,也不能代替多轮对话和生成中途决策的机制分析。
  • CAC 是在相关性预筛之后获得的组级因果定位,不是每个头、每个 MLP 的完整功能图谱。不同组件交互、门控导致的下游变化和筛选漏检仍应通过更细的机制实验检验。
  • 数值报告存在边界不清与小冲突:分析 AUROC 0.811 与策略基线 0.782 不宜混算;附录 F.2 正文间隔为 +1.37,而表 20 为 +1.38。附录 D.4 将剩余项描述为跨输入共享,与 §3 的 \(\kappa(x)\) 写法也不完全一致,不能擅自统一为作者已证实的精确模型。
  • 下一步可在词汇表达变化、不同弃答代价及长上下文下检验 CAC 策略,并同时报告作答覆盖率、答案正确性和校准误差。跨数据集迁移已经有证据,跨模型共享策略权重则尚未由当前实验建立。

相关工作与启发

  • vs Causal Head Gating:沿用相反正则压力联合识别组件的思路,但把门控扩展到 MLP 子层,并将目标改为作答—弃答间隔。它是针对特定决策的机制定位,不是通用电路发现的完整替代。
  • vs HaMI / HaloScope:后者从 token 隐状态或隐藏子空间识别幻觉相关信息,本文先定位有干预证据的组件,再以其贡献作为策略特征。MLP 分类器并非新意所在,特征选择的机制依据才是主要差别。
  • vs Semantic Entropy / Multi-LLM:输出级方法依赖多次采样或多个模型的一致性,CAC 策略在生成前读取内部信号。较低的生成需求伴随白盒访问与逐模型定位需求,不能脱离成本条件宣称全面优越。
  • 对后续研究的启发:可检验训练是否让纠偏组件更早出现,或使策略信息更好进入最终读出。这是由层深模式导出的研究假设,当前论文没有证明调整时序即可稳定降低所有幻觉。

评分

  • 新颖性: 4/5 — 将可回答性表示与组件级决策控制联系起来,策略本身较轻量。
  • 实验充分度: 4/5 — 多家族、干预对照与数据集迁移较充分,但范围限定且存在报告口径疑点。
  • 写作质量: 3/5 — 机制主线清楚,组件命名、深度比例及部分数值需要谨慎核对。
  • 价值: 4/5 — 为认识性弃答提供可行动的机制读出,不应外推为通用事实正确性保证。