The Commit-Abstain Circuit: Why Language Models Hallucinate Instead of Abstaining¶
会议: NeurIPS2026
arXiv: 2609.32964
代码: https://github.com/vnht/commit-abstain-circuit
领域: 幻觉 / 可解释性
关键词: 认识性弃答、无支持作答、因果门控、稀疏电路、策略读出
一句话总结¶
论文从生成前的作答—弃答 logit 间隔定位稀疏的作答—弃答电路(Commit-Abstain Circuit,CAC),发现早期作答积累与晚期弃答纠偏不足的模式,再用分量级贡献训练轻量策略,将报告的平均决策准确率从 0.692 提升至 0.814,而非证明答案内容准确率提高。
研究背景与动机¶
语言模型在信息不足时仍可能给出实质性答案,但这一行为不一定意味着内部完全没有“不该回答”的信号。已有隐藏状态探针能够读出正确性、真实性或不可回答性;另一方面,语义熵、多模型一致性与弃答训练主要在输出或行为层面解决问题。两者之间缺少一个组件级解释:如果相关信息已经存在,为什么最终输出仍越过作答门槛?本文将研究对象收窄为无支持作答(unsupported commitment),即在不可回答输入上没有弃答,而不是覆盖所有事实错误。
这里的弃答是认识性弃答(epistemic abstention):判断现有知识或上下文是否足够回答。它不同于因请求内容而触发的安全拒绝,也不同于“问题可以回答,但模型答错了”。KUQ 关注没有确定答案的问题,SQuAD 2.0 关注给定段落不支持的问题,MuSiQue 则通过移除支持文档制造推理链缺口;这些设置让“应不应该回答”成为独立的二分类目标。
作者选择在首个输出 token 之前测量模型偏好,避免把自回归生成已经形成的路径依赖混入起始决策。随后不只问某个方向是否可探测,而是联合干预注意力头和 MLP 子层,定位哪些组件支撑该偏好。核心 idea:保留作答—弃答决策形成过程中各组件的贡献,而不是只读取它们相加后的一个标量,从而识别被最终作答倾向掩盖的弃答信息。
方法详解¶
整体框架¶
输入是问题及可选上下文,监督信号是可回答性标签。分析阶段依次进行间隔归因、因果门控和功能干预,输出每个模型自己的 CAC;策略阶段再从未门控模型的一次生成前前向传播中抽取 CAC 特征,预测应作答还是弃答。
三个环节不能混为同一种计算:间隔归因使用固定最终归一化因子的线性分解;门控与功能干预修改实际前向传播,保留下游非线性;最终策略则训练一个外部轻量分类器,不更新基础语言模型,也不要求部署时继续施加定位用的门控。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
X["问题与可选上下文"] --> A["间隔归因"]
A -->|训练集与可回答性标签| B["因果门控"]
B -->|定位后的组件| C["功能干预"]
C -->|分析验证而非推理必经步骤| D["分量策略读出"]
A -->|推理:未门控前向的贡献| D
B -->|固定 CAC 组件集合| D
Y["训练监督:可回答性标签"] -.-> D
D --> O["作答或弃答"]
关键设计¶
1. 间隔归因:把首步偏好拆成可追踪的组件贡献
作者先构建弃答起始 token 集合 \(\mathcal{A}\),其余词表构成作答集合 \(\mathcal{C}\)。在与训练、测试不重叠的 1,000 个不可回答样本上收集弃答回复的首 token,再跨模型合并、消歧并由标注者验证,主设置保留 17 个 token。这是一个词汇化的操作定义,不是对任何回复语义的完整判定;尤其不能因为某个起始词常见于弃答,就认为它的所有后续表达都必然是弃答。
在最后一个输入位置,分别取两个集合中 logit 最大的 token,并定义偏好间隔:
\(\Delta(x)\geq0\) 表示偏好作答,负值表示偏好弃答。它比较的是两组中最强的首步候选,而不是总概率质量,也不是答案正确概率。与完整贪心生成的行为标签平均一致率为 97.6%,支持其作为近似读出,但仍留下中途改口等例外。
残差流由各注意力头、MLP 子层输出以及嵌入等项相加构成。作者把最终归一化因子冻结为未门控前向的取值,将每个组件输出投影到两个最高 token 的读出差方向,得到带符号贡献:
这里 \(c_k(x)\) 是组件输出,\(u_t\) 是吸收该样本冻结归一化因子的读出向量,\(\kappa(x)\) 收集嵌入与偏置等项。在这一归因口径下,正贡献推高间隔、负贡献压低间隔。该分解解释未干预前向的最终间隔,不能直接当作删除组件后行为变化的精确预测,因为删除会改变后续激活与归一化。
2. 因果门控:用相反正则压力筛出对决策有作用的组件
直接对所有组件逐个消融既昂贵,也容易遗漏交互。作者先用训练集上可回答与不可回答样本的平均贡献差筛选候选,然后在候选注意力头与 MLP 子层上联合训练 sigmoid 门。注意力头的门作用在输出投影之前,MLP 门作用在残差相加之前;非候选组件保持开启,基础模型权重始终冻结。
门控目标要求可回答输入的间隔变大、不可回答输入的间隔变小。用于该损失的最高作答与弃答 token 来自未门控模型,并在优化过程中固定,而不是在每次门控前向后重新执行最大值选择:
\(y=1\) 表示可回答,\(G=\sigma(g)\)。先在 \(\lambda=0\) 下优化任务损失得到共同初始化,再分别施加推向开启的保留压力和推向关闭的移除压力,得到 \(G^{+}\) 与 \(G^{-}\)。在移除压力下仍保持 \(G^{-}>0.5\) 的组件归为 c-component;在保留压力下仍保持 \(G^{+}<0.5\) 的组件归为 a-component。角色判断还结合跨种子平均门值,最终要求至少 8/10 个种子保持同一角色。
这些 a/c 名称表示相对于可回答性监督的差分角色,不等于“每个 a 组件的贡献都为负、每个 c 组件都为正”。附录 D.1 的示例中,一个组件在可回答与不可回答样本上的平均贡献分别为 +0.3、+1.5,两者都为正,却因差值为 −1.2 而可能被归为 a:它在本应弃答的样本上更强地推高作答间隔。门控梯度的差分解释应视作局部归因直觉;真实联合优化会改变下游计算,不能据此把完整模型当成独立线性组件。
3. 功能干预:分开检验门槛纠偏与排序结构
定位之后,作者按因果分数逐步删除 a 或 c 组件,并与 20 组同规模随机非 CAC 删除比较;另将组件输出放大,观察错误弃答和错误作答如何变化。这一步使用真实干预前向,而不是仅把固定归因式中的某个数减去或乘上系数。
关键结果并不符合字面标签的简单预测:删除 c 组件也更多导致“弃答变作答”。作者的解释是,c 组件不仅提供作答推动力,还支撑可回答与不可回答输入的排序分离;删除它们会破坏判别结构。相比之下,a 组件更像让临界样本跨过零门槛的纠偏信号,删除后排序变化较小。因此必须同时报告翻转方向与 AUROC,不能仅靠整体弃答比例给组件定性。
层深分析显示两类轨迹在约 80% 深度前都积累正贡献,真正弃答的轨迹随后明显转负,无支持作答轨迹则未被充分纠正。这是作者提出的“积累但纠偏不足”模式,并不是声称每个样本、每个模型都存在完全相同的时序电路。
放大也存在非线性边界。适度放大 c 组件增加作答、减少错误弃答;适度放大 a 组件增加弃答、减少错误作答,但会带来另一类错误。极端放大时,RMSNorm 会让归一化后的表示趋向组件方向而不是无限增大其幅度;a 组件的错误作答率仍出现非零平台。因此“把弃答组件乘得足够大”并不等价于可靠的弃答策略。
4. 分量策略读出:在相加之前保留可回答性信息
最终策略读取每个 CAC 组件在最后输入位置对间隔的贡献,并附加均值、标准差、最小值、最大值以及 a/c 组件贡献之和。不同模型的 CAC 有 16–64 个组件,特征维度再加这些统计量。它不重新求一个总和后套阈值,而是让分类器区分“一个巨大正向异常值盖过多个负向信号”和“多个组件一致支持作答”等模式。
MLP 的结构为 \(d_{\mathrm{in}}\to32\to128\to64\to32\to1\),先用 32 维瓶颈规范不同模型的特征规模,再进行非线性混合。输出为 \(P(\mathrm{answerable})\),低于验证集校准阈值时触发弃答。这里的概率是监督分类器的可回答性预测,不是语言模型对某个具体答案的正确性保证。
同特征逻辑回归也获得 +10.6 个百分点的平均决策准确率增益,MLP 为 +12.2 个百分点。两者仅相差 1.6 个百分点,说明主要收益来自分量级信息和重新读出,而不能全部归功于更复杂的分类器。
一个完整示例¶
附录 F.1 的 KUQ 个案在 Llama 3B 上被标为不可回答。模型的整体间隔为 +7.94,因此零阈值策略选择作答;其中 L19.MLP 的贡献达到 +8.27,而多个其他 CAC 组件提供负向贡献。
作者报告负贡献总和 −8.09、正贡献总和 +12.62,净 CAC 贡献为 +4.53。只看最终正间隔会丢失这种“一项强正值压过其他信号”的结构,而分量策略给出 0.089 的策略读出并正确弃答。该例说明分类器可以利用分布模式,不意味着任意单个大正贡献都代表不可回答,也不证明生成的答案在医学内容层面是否正确。
损失函数 / 训练策略¶
每个主数据集采样 1,000 个实例,监督实验按 50/50 划分训练与测试,并从训练部分留出验证集校准策略阈值。主分析覆盖五个模型家族的十个指令模型,规模为 3B–14B;完整生成行为检验采用贪心解码,最多 256 个新 token。
门控采用 Adam、批量大小 16,每阶段 100 步;第一阶段学习率从 0.1 降至 0.01,两个压力阶段从 0.5 降至 0.1,裁剪界为 4。正则强度按训练集未门控间隔尺度设置,结果汇总十个独立种子。候选筛选是相关性预筛,后续联合门控才提供干预证据,不能把二者互换。
策略 MLP 的隐藏层使用批归一化、ReLU 与 dropout 0.15;以二元交叉熵训练,AdamW 学习率和权重衰减均为 \(10^{-3}\),最多 500 个 epoch,早停耐心值为 120。定位与训练均按模型重新执行,不是跨模型共享一套门或分类器权重。
实验关键数据¶
主实验¶
下表摘取原文表 2:每行是同一模型在 KUQ、SQuAD 2.0、MuSiQue 三个测试集上的均值。Acc 是作答/弃答决策准确率,不是问答内容准确率;AUROC 衡量可回答性排序能力。
| 模型 | 零阈值 AUROC | CAC MLP AUROC | 零阈值 Acc | CAC MLP Acc |
|---|---|---|---|---|
| Qwen 3.5 4B | 0.725 | 0.879 | 0.655 | 0.829 |
| Qwen 3.5 9B | 0.798 | 0.911 | 0.697 | 0.855 |
| Gemma 3 4B | 0.722 | 0.807 | 0.644 | 0.765 |
| Gemma 3 12B | 0.854 | 0.889 | 0.770 | 0.845 |
| Llama 3B | 0.689 | 0.807 | 0.623 | 0.755 |
| Llama 8B | 0.784 | 0.874 | 0.651 | 0.820 |
| Ministral 3B | 0.790 | 0.874 | 0.714 | 0.815 |
| Ministral 14B | 0.848 | 0.877 | 0.753 | 0.829 |
| Phi-4 mini | 0.780 | 0.837 | 0.705 | 0.785 |
| Phi-4 14B | 0.830 | 0.888 | 0.711 | 0.840 |
| 全部配置均值,正文 §5.2 | 0.782 | 0.864 | 0.692 | 0.814 |
决策准确率定义为可回答样本选择作答、不可回答样本选择弃答的总体比例。错误弃答率 FA 是可回答样本中选择弃答的比例,错误作答率 FC 是不可回答样本中选择作答的比例;它们不是生成答案的精确匹配错误率。原文策略评估报告平均 FA 从 0.320 降至 0.127,约为原来的 1/2.5。
分析章节 §4.2 与附录 C 表 8 报告间隔 AUROC 均值 0.811,而策略比较 §5.2 的零阈值基线为 0.782。二者属于不同分析/评估汇总口径,原文没有完整交代其数值差异来源;不能把 0.811 替换进策略表,再重算作者报告的 +8.2 个 AUROC 点增益。
消融实验¶
下表汇总 §4.5 与附录 D.5 表 13。翻转比例以全部 1,500 个留出实例为分母,A→C 为弃答变作答,C→A 为作答变弃答;AUROC 变化是 §4.5 报告的跨模型平均值。
| 干预 | A→C | C→A | 平均 AUROC 变化 | 解释 |
|---|---|---|---|---|
| 删除全部 a 组件 | 17.1% | 7.8% | −0.03 | 更多临界决策跨过零门槛,排序较稳定 |
| 删除全部 c 组件 | 31.7% | 3.4% | −0.17 | 同样偏向作答翻转,但判别结构明显受损 |
原文还报告 Qwen 4B 删除 c 组件后 AUROC 从 0.73 降至 0.40;同规模随机删除的平均变化为 −0.069。这一对照支持 CAC 并非随意抽取的组件集合,但不意味着每个 CAC 组件的完整语义功能已被解析。
下表摘取附录 E.3 表 18,检验策略结构是否必需;均值按十个模型汇总。
| 数据集 | 零阈值 Acc | CAC 逻辑回归 Acc | CAC MLP Acc |
|---|---|---|---|
| KUQ | 0.707 | 0.887 | 0.923 |
| SQuAD 2.0 | 0.665 | 0.743 | 0.745 |
| MuSiQue | 0.704 | 0.764 | 0.774 |
| 全部数据集 | 0.692 | 0.798 | 0.814 |
关键发现¶
- CAC 在全部十个主模型中被定位,组件占比为 2.0%–11.8%,中位数 5.2%;其中 MLP 子层平均占约 25%。这支持将门控从注意力头扩展到 MLP,而不是将弃答归结为单一注意力头。
- MLP 相对逻辑回归的优势主要来自 KUQ,平均差为 3.6 个百分点;SQuAD 2.0 为 0.2 个百分点,MuSiQue 为 1.0 个百分点。上下文任务中的大部分提升可以由分量级线性读出获得。
- 两个未见数据集 HotpotQA 与 SelfAware 上,全部 24 个模型—数据集配置都优于零阈值,平均决策准确率提升 6.9 个百分点。大模型 Gemma 3 27B、Qwen 3.5 35B 先重新定位并在分布内数据上训练,随后做数据集零样本迁移;四个大模型 OOD 配置平均提升 6.3 个百分点,并非小模型权重零样本迁移。
- 时序结论应按总体趋势理解:正文称在 60%–70% 深度“所有模型”每个 a 对应超过两个 c,但表 9 中 Qwen 9B 为 1.5/1.4,Gemma 12B 为 1.4/1.3。表格支持所有模型累计比例大于 1,不支持所有模型都大于 2。
亮点与洞察¶
- 将“有信息”与“用信息做决策”拆开是最有价值的视角。组件贡献中可读出的可回答性信号可能在残差汇总后被掩盖,因此只优化总间隔未必能恢复正确决策。
- 对消融的反直觉结果没有回避:删除所谓作答组件也会增加作答。区分排序结构和零门槛校准,避免用组件名称代替因果证据。
- 策略只读取一小组组件的标量投影,而不是完整隐藏向量或多次生成。分量级读出为轻量部署提供方向,但离线定位、基础模型前向和 hooks 的成本仍然存在。
- 放大实验揭示归一化带来的控制边界。适度干预的收益不能外推为极端幅度下的无限纠错能力,直接训练策略比盲目放大弃答信号更有依据。
局限与展望¶
- 研究只覆盖不可回答输入上的无支持作答,没有解决可回答问题的错误答案;KUQ 的开放问题、SQuAD 2.0 的段落支持性、MuSiQue 的缺失文档分别代表特定不可回答性,不等价于完整真实世界事实核验。
- 弃答词表与完整生成标签都依赖词汇表达,可能遗漏间接弃答或混合回复。17 token 设置及扩展词表的稳健性实验不能消除这种操作定义的限制,仍需语义级反例测试。
- 固定最高 token 与冻结最终归一化因子便于归因,但不完整描述生成动态。97.6% 行为一致率并非 100%,也不能代替多轮对话和生成中途决策的机制分析。
- CAC 是在相关性预筛之后获得的组级因果定位,不是每个头、每个 MLP 的完整功能图谱。不同组件交互、门控导致的下游变化和筛选漏检仍应通过更细的机制实验检验。
- 数值报告存在边界不清与小冲突:分析 AUROC 0.811 与策略基线 0.782 不宜混算;附录 F.2 正文间隔为 +1.37,而表 20 为 +1.38。附录 D.4 将剩余项描述为跨输入共享,与 §3 的 \(\kappa(x)\) 写法也不完全一致,不能擅自统一为作者已证实的精确模型。
- 下一步可在词汇表达变化、不同弃答代价及长上下文下检验 CAC 策略,并同时报告作答覆盖率、答案正确性和校准误差。跨数据集迁移已经有证据,跨模型共享策略权重则尚未由当前实验建立。
相关工作与启发¶
- vs Causal Head Gating:沿用相反正则压力联合识别组件的思路,但把门控扩展到 MLP 子层,并将目标改为作答—弃答间隔。它是针对特定决策的机制定位,不是通用电路发现的完整替代。
- vs HaMI / HaloScope:后者从 token 隐状态或隐藏子空间识别幻觉相关信息,本文先定位有干预证据的组件,再以其贡献作为策略特征。MLP 分类器并非新意所在,特征选择的机制依据才是主要差别。
- vs Semantic Entropy / Multi-LLM:输出级方法依赖多次采样或多个模型的一致性,CAC 策略在生成前读取内部信号。较低的生成需求伴随白盒访问与逐模型定位需求,不能脱离成本条件宣称全面优越。
- 对后续研究的启发:可检验训练是否让纠偏组件更早出现,或使策略信息更好进入最终读出。这是由层深模式导出的研究假设,当前论文没有证明调整时序即可稳定降低所有幻觉。
评分¶
- 新颖性: 4/5 — 将可回答性表示与组件级决策控制联系起来,策略本身较轻量。
- 实验充分度: 4/5 — 多家族、干预对照与数据集迁移较充分,但范围限定且存在报告口径疑点。
- 写作质量: 3/5 — 机制主线清楚,组件命名、深度比例及部分数值需要谨慎核对。
- 价值: 4/5 — 为认识性弃答提供可行动的机制读出,不应外推为通用事实正确性保证。