SpanUQ: Span-Level Uncertainty Quantification for Large Language Model Generation¶
会议: NeurIPS2026
arXiv: 2607.05721
论文: 项目页
领域: LLM 评测
关键词: 跨度级不确定性、隐状态探针、多样本蒸馏、Beta 混合分布、选择性预测
一句话总结¶
SpanUQ 将离线多样本回答的声明一致性蒸馏到冻结 LLM 的隐状态探针,用集合预测定位语义跨度并输出连续不确定性,五个分别训练的骨干探针取得 0.908–0.944 AUROC,同时支持比整段拒答更细粒度的风险筛选。
研究背景与动机¶
生成回答往往把多个可靠程度不同的事实写进同一句话。逐 token 熵能够发现难预测的词,却无法分清“罕见但正确的名字”和“流畅但错误的事实”;整段语义熵或 SelfCheckGPT 则通过多次生成捕捉语义分歧,但最后只有一个整段分数。把这个分数广播到所有局部声明,会给同一回答中正确与错误的部分完全相同的排序,既无法精确标注,也无法只复核最值得怀疑的信息。
本文把评估单位放在连续文本跨度上:一个跨度承载一个能够独立判断的语义单元,边界不必等于句界,多个声明也可以重叠。这个粒度不是把 token 分数简单平均,而是同时回答“在哪里有一个可评估声明”和“这个声明有多不稳定”。因此,固定滑窗和 BIO 分段都不是理想前处理:前者与语义边界错位,后者难以表示重叠跨度;若先切错,再精确打分也无济于事。
离线多样本比较能够提供细粒度监督,但每次在线生成后都重新采样和逐声明验证会把成本放大。冻结模型的中后层隐状态提供另一条入口:让一个小探针学习这些内部表征与跨样本不一致之间的关系,将昂贵操作移到数据构建阶段。核心 idea:把可重叠语义跨度检测和连续一致性风险预测联合学习,让单个已生成回答的内部表征替代在线多样本比较,而不是把整段分数硬分配给局部文字。
方法详解¶
整体框架¶
输入是提示词、一个生成回答及该回答在冻结 LLM 中的指定层隐状态,输出是若干“起点、终点、不确定性”三元组,并可进一步聚合为整段分数。训练先以多样本蒸馏建立跨度和软标签;部署时不再调用构建标签的裁判、不额外采样、不检索外部知识。
主干流程依次是集合式跨度检测、内容富集与 Beta 混合预测、不确定性条件迭代细化。检测模块内部先融合选定层、压缩并编码 token,再由查询集合定位跨度;预测模块读取跨度内的内容;细化模块利用第一轮分数再次运行共享解码器。所谓“单次前向”指单个回答的骨干隐状态提取及一次探针调用,不表示自回归生成整段回答只运行一次骨干,也不表示 UCIR 只有一次解码器运行。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["离线:主回答<br/>与20个采样回答"] --> B["多样本蒸馏"]
B -.->|训练:跨度监督| D["集合式跨度检测"]
C["推理:单个回答<br/>冻结LLM隐状态"] --> D
D --> E["内容富集与<br/>Beta混合预测"]
B -.->|训练:一致性软标签| E
E --> F["不确定性条件<br/>迭代细化"]
F --> G["有效跨度与分数<br/>可选整段聚合"]
关键设计¶
1. 多样本蒸馏:监督是条件矛盾率,不是真实错误概率
每个提示先生成一个贪心主回答,其文字位置与隐状态构成探针输入;另生成 20 个温度为 1.0、nucleus sampling 参数为 0.95 的回答。裁判只把主回答拆成原子声明,并给出对齐原文的字符偏移;随后对每个声明逐一读取这些采样回答,判定支持、矛盾或未提及。因为声明集合来自同一个主回答,不需要在不同生成之间再做声明匹配。裁判是 Claude Opus 4.6,但这里的验证参照物是模型自己的采样文字,不是数据库或检索结果。
对于第 \(k\) 个跨度,只在明确支持或矛盾的样本中统计矛盾比例:
未提及不是反证,必须从分母排除;若所有样本都沉默,这个跨度没有定义好的标签,直接删除。于是这个软标签衡量的是“模型在谈到该命题时有多不一致”,不能解释成“该命题客观错误的概率”。反复出现的同一个错误可能得到低分,真实命题也可能因为模型回答摇摆而得到高分。方法正文最初将标签简写为 unsupported fraction,精确定义应以上式和数据构建章节为准。
软标签保留了中间风险等级,但有效证据数并不总是 20:如果只有少数样本表态,一次裁判失误就能显著改变比例。附录声称单样本误判最多影响 0.05,只在分母为 20 等特定条件下成立;排除沉默之后并无这个普遍上界。这个问题提示后续可保留有效证据数,或用带置信区间的标签监督,而不是把所有比例都当作同等精确的观测。
2. 集合式跨度检测:让查询学习重叠边界,而不是先固定切分
Qwen3-14B 主设置选择第 22、24、26 层做逐元素平均,再把 5120 维隐状态投影到 512 维,加正弦位置编码后经过两层 Transformer 编码器。选层来自单层探针扫描:不确定性信号在中后层呈倒 U 形,最后一层并非最佳。这个 token 特征池同时提供给解码器交叉注意力与后续内容富集,使定位和评分共享同一表示空间。
主设置有 32 个可学习查询,对应最多 32 个候选跨度;三层 Transformer 解码器用查询间自注意力协调竞争和重叠声明,再用对 token 特征池的交叉注意力定位内容。查询最初不绑定具体位置,训练后才形成软性的分工。每个查询独立回归归一化起止坐标,所以两个查询可以覆盖同一 token,无须为每个 token 选择唯一 BIO 标签。32 是主设置而非所有骨干的固定值,Mistral-7B 的最终配置使用 16 个查询。
边界回归头必须读取尚未做内容富集的查询,否则“先用边界取内容、再用内容预测边界”会形成循环依赖。训练通过 Hungarian 一对一分配匹配预测与标注,代价综合边界 L1/GIoU、不确定性绝对误差和有效性分类;未匹配查询作为空槽学习抑制。推理按有效性概率 0.5 筛掉空槽,这个概率表示“是否检测到了一个跨度”,不是这个跨度是否事实正确。
3. 内容富集与 Beta 混合预测:把定位表征变成可校准的局部评分
查询知道自己大致看哪里,但不一定保留那里最重要的事实内容。SpanUQ 用两个 sigmoid 构造软边界掩码,再在该区域内做查询引导的注意力池化;这个掩码可微,使评分误差也能反馈到边界。池化后的内容通过门控残差加入查询,日期、人物关系等关键 token 可以得到比冠词更高的权重,短跨度则可少引入冗余内容。附录使用边界锐度 10;其作用是控制边界过渡,不应误读为另一次离散切分。
富集后的查询分别预测有效性及 Beta 混合分布参数。Beta 的定义域天然是 0–1,三分量混合比单分量更容易表达近端点与中间区域的不同形状;形状参数下限 0.5 允许 U 形分量。点估计取各分量均值的加权和:
这个分布拟合的是给定内部表征时软标签的条件分布,训练并没有直接监督某个声明的完整真实概率分布。各分量形状参数之和经过混合加权得到有效精度,供下一步使用;它是学习出的浓度代理,不是已经验证的认识不确定性分解。尤其混合分量的均值差异也会影响总方差,仅用分量精度不能等同于完整的预测置信区间。
4. 不确定性条件迭代细化:共享权重的第二遍解码,不是再次采样
第一遍得到不确定性均值、有效精度和有效性概率后,小 MLP 将这三个标量编码为条件向量,加回查询,再经过同一个三层解码器及预测路径。第二遍因而是在已有初始判断的条件下重新查看同一 token 特征池,并不调用第二个 LLM,也没有另生成一个回答。最终分数是两轮的凸组合,第二轮权重为 0.7,第一轮权重为 0.3;训练时两轮都有监督,第一轮损失权重较低。
这一步重用的是参数,不是免去了第二遍计算。论文分别报告 UCIR 相对探针自身基础解码器的开销低于 15%,以及完整探针相对骨干前向的额外延迟低于 3%;二者分母不同。共享权重本身也不足以证明计算开销很小,成本结论仍应限于作者报告的实现与硬件测量。
需要整段分数时,模型学习各跨度的重要性,以有效性调制的重要性分数经过 softmax 形成权重,再对跨度分数加权。整段监督目标是标注跨度软标签的均值,因而实验检验的是对这一特定目标的可组合性,不是证明所有序列级不确定性都能由局部声明完全分解。主公式给出加权平均,部分实验文字称 importance-weighted top-k,原文没有清楚统一这两种表述。
一个完整示例¶
以附录的 John Derek 传记为例,主回答中的出生姓名、出生日期和亲属信息对应若干独立跨度,职业信息又对应其他跨度。离线标签将其中出生日期的风险标为 0.95;部署时探针不读那 20 个参考回答,而只读当前传记的隐状态,检测该跨度并输出 0.89。附录还报告出生姓名 0.94、亲属信息 0.95,以及可靠职业信息 0.03。
这说明输出不是“整篇传记都不可信”,而是指出应优先复核的局部声明。示例数字是论文的定性展示,不是所有传记的平均效果;低分只说明探针估计的不稳定性低,仍不构成外部事实验证。
损失函数 / 训练策略¶
骨干始终冻结,只训练探针。主实验用 17,494 个训练提示,前 15 个 epoch 只训练检测相关模块,随后最多 25 个 epoch 联合训练;这样先获得较可信的边界,避免一开始就从错误区域学习风险。AdamW 学习率为 \(10^{-4}\),weight decay 为 0.01,batch size 为 16,使用余弦退火和 dev AUROC patience 5 的早停。
联合目标包含边界 L1/GIoU、全查询有效性 BCE、匹配跨度的 Beta 混合负对数似然、风险排序、整段一致性和中间解码层辅助监督。NLL 拟合连续标签,排序项强调风险大小关系,二者并不相互替代;计算 NLL 前将端点标签裁剪至 \([10^{-4},1-10^{-4}]\),避免数值不稳定。
排序项采用 margin 0.1:附录按高风险大于 0.3、低风险小于 0.1 分组,每 batch 最多抽 256 对,不足时用上下四分位替代。正文将配对描述为同序列,附录则写每 batch 分层抽样,配对范围有表述差异,不宜自行断言只有序列内排序。
整段一致性损失阻断对跨度预测的梯度,避免把各跨度拉向一个平均分数,主要让聚合路径适应整段目标。附录 D.1 的默认损失权重依次为 5.0、2.0、4.0、1.0、0.5、0.4;附录 A.3 却写辅助损失权重为 0.5,这一差异应在复现时核对,而不是悄悄统一。
实验关键数据¶
主实验¶
SpanUQ-Bench 覆盖长回答 QA、TriviaQA、ELI5、Biography 和 FELM。实际保留 19,994 个提示:训练 17,494、开发 500、测试 2,000;原始跨度 311,385 个,删除无人表态的跨度后全量约 293K、训练约 256K。原始计数不能与过滤后计数混用。
下表选取表 1 的默认 seed 42 结果,每个骨干使用自己的回答、标签与隐状态单独训练。AUROC 的二值目标来自一致性标签是否至少 0.5,MAE 针对连续一致性标签,相关性为跨度 Spearman;不是直接在人类事实标签上得到的 AUROC。MLP 基线使用真实跨度边界,是 oracle 对照。
| 骨干 | SpanUQ AUROC | SpanUQ MAE | SpanUQ 跨度 Spearman | Oracle MLP AUROC |
|---|---|---|---|---|
| Qwen3-14B | 0.939 | 0.110 | 0.685 | 0.881 |
| Qwen3-8B | 0.930 | 0.129 | 0.692 | 0.884 |
| Qwen3-4B | 0.944 | 0.126 | 0.754 | 0.873 |
| Qwen3-30B-A3B | 0.936 | 0.110 | 0.647 | 0.893 |
| Mistral-7B | 0.908 | 0.126 | 0.637 | 0.863 |
Qwen3-14B 上 SelfCheckGPT-NLI 的 AUROC/跨度 Spearman 为 0.808/0.471,Token Entropy 为 0.603/0.097。序列级方法广播分数的协议天然不允许序列内排序,因此该比较揭示的是粒度适配优势,不宜当作它们在原生整段任务上全面失效的证据。
独立的人类研究由五名非作者标注员各评 400 个互不重叠的跨度,判断事实正误并提交外部证据,共 2,000 个跨度。以下表 2 用这些人类标签评价拒绝高风险跨度后的实际错误,而非再次对比训练流水线标签。
| 方法 | 保留100%时风险 | 保留80%时风险 | 保留60%时风险 | 保留40%时风险 | AURC | PRR |
|---|---|---|---|---|---|---|
| SpanUQ | 18.6% | 10.5% | 7.9% | 6.3% | 0.076 | 0.587 |
| Oracle MLP Probe | 18.6% | 12.8% | 9.4% | 7.1% | 0.098 | 0.470 |
| SelfCheckGPT-NLI | 18.6% | 16.1% | 14.5% | 12.9% | 0.151 | 0.184 |
风险是保留跨度中的人类判错率,覆盖率是保留比例,AURC 是风险—覆盖曲线下面积、越低越好;PRR 表示相对随机拒绝关闭了多少随机到 oracle 的差距。拒绝最高风险的 20% 后,SpanUQ 将风险从 18.6% 降到 10.5%,相对下降 43.9%。因此“约 80% 覆盖对应 10% 风险预算”只能当近似描述,表中 80% 覆盖的实际风险仍高于 10%,不是严格达标保证。
消融实验¶
下表按表 4 保留逐项增加组件的结果,不把它冒充与表 1 完全一致的数值口径。
| 配置 | AUROC | ECE | MAE | 跨度 Spearman | 整段 Spearman |
|---|---|---|---|---|---|
| Base DETR + Single Beta | 0.907 | 0.058 | 0.154 | 0.673 | 0.765 |
| + Enrichment Gate | 0.920 | 0.052 | 0.144 | 0.725 | 0.729 |
| + MoB(三分量) | 0.933 | 0.020 | 0.116 | 0.760 | 0.846 |
| + UCIR(一轮细化) | 0.939 | 0.013 | 0.106 | 0.790 | 0.839 |
MoB 将 MAE 从 0.144 降到 0.116、ECE 从 0.052 降到 0.020,是连续评分与校准的重要增益;UCIR 再提高局部排序,但整段相关性略降。所有指标都不应被概括为每加一个模块必然提升。
原文表 1 的完整 Qwen3-14B MAE/跨度 Spearman 是 0.110/0.685,表 4 则为 0.106/0.790,没有清楚交代两组差异,故分别报告。整段实验表 A1/A3 给出 Spearman 0.851、Pearson 0.839,而摘要和表 4 的整段相关性又使用 0.839;不能把所有 0.839 都当成同一相关系数。
关键发现¶
- 检测实验控制评分器为同一个 MLP:DETR 的精确率/召回率/F1 为 0.857/0.970/0.910,最佳滑窗 F1 为 0.653,相对提高 39.4%。这里 DETR+MLP 的 AUROC 0.927 不等于完整 MoB+UCIR 的 0.939。
- 检测 F1 用 IoU 至少 0.3 判断匹配;不确定性指标用 Hungarian 配对且没有这个 IoU 截断。高评分质量与高边界质量是两个需要分别核验的维度。
- 人类标签与阈值化流水线标签的一致率为 89.4%,Cohen’s kappa 为 0.618;高标签跨度中仍有 22.3% 被人类判定为事实正确。对其中 45 个案例的单人审计认为 40 个源于真实跨样本冲突,不能将“有不确定性”直接改称“事实错误”。
- 五个训练 seed 的 Qwen3-14B AUROC 为 0.930±0.007,Mistral-7B 为 0.884±0.014。主表不是多 seed 平均,架构可移植性也不是一个探针跨模型零样本迁移。
亮点与洞察¶
- 可解释性来自输出单位,而非仅来自更复杂的分布头。把分数绑定到可独立复核的语义跨度,才使选择性验证成为可执行操作。
- 可微内容富集把边界学习与评分学习连接起来。定位不再只是前处理,局部风险监督能够反过来影响模型应该读哪些 token。
- 检测与风险筛选的证据分开呈现很有价值。独立的人类风险—覆盖结果支持实际筛选效用,但并不自动证明模型输出就是客观错误概率。
局限与展望¶
- 需要白盒隐状态,不能直接用于仅返回文本的封闭 API;数据构建还需要每个骨干额外采样与裁判调用。跨语言、推理步骤和代码执行风险尚是扩展设想,并非本次实验结论。
- 一致性监督对稳定重复的错误存在结构性盲点,有限证据数与裁判噪声也未逐组件量化。可在训练中结合外部事实核查,并显式区分语义摇摆、证据不足和真实错误。
- 参数统计有冲突:正文主实验写 24.4M,附录 A14 的 Qwen3-14B 配置写 27.04M;其他探针为 17.18–26.51M 等不同规模。“约25M”不能一律说成骨干的不到0.2%,在 4B 骨干上即便用17.18M也是约0.43%。
- 作者报告完整探针增加骨干前向延迟低于3%,相对需要10–20次采样的方案总耗时快10–20倍;这是不同分母的两个结论,不包括昂贵离线标签成本,也不是所有部署硬件的普遍保证。
- 附录 C.9 把输出称为错误概率,较严格的数据定义和局限章节却明确它是跨样本一致性分数。实际应用应通过目标分布上的外部事实标签选阈值,并提示低风险未标注区域也没有被验证。
相关工作与启发¶
- vs Semantic Entropy / SelfCheckGPT:多样本法直接观察生成差异,本文将该类信号离线蒸馏,并学习局部跨度;代价是需要监督数据、内部访问及每骨干重训。
- vs Semantic Entropy Probes / HaloScope / HaMI:同样利用内部表征降低额外生成成本,SpanUQ 的主要区别是把边界和连续风险联合建模,而非给整段一个分数后广播。
- vs FActScore / SAFE:外部证据核查目标是事实正确性,本文训练标签只比较自身样本;主文的 FActScore 对照还采用自验证改编,不应把其结果泛化到标准检索版事实核查。
- vs DETR / BIO:借用集合预测的是一维语义跨度定位,不是视觉目标检测任务。值得延伸的方向是引入有效样本覆盖度监督和外部核查预算分配,检验哪些局部评分真正节省了验证成本。
评分¶
- 新颖性: 4/5 — 联合语义跨度定位、连续风险预测与共享解码细化,贡献主要是任务粒度和系统组合。
- 实验充分度: 4/5 — 五骨干、组件消融和独立人类筛选评估较完整,标签噪声分解与跨任务验证仍不足。
- 写作质量: 3/5 — 方法机制清楚,但参数规模、配对范围、聚合方式和部分指标口径存在未解释差异。
- 价值: 4/5 — 有助于局部复核和低成本风险提示,前提是不把一致性分数误当事实认证。