跳转至

Diversity Combining for Multi-Path LLM Reasoning

会议: NeurIPS2026
arXiv: 2609.38829
领域: LLM 推理
关键词: 自一致性、多路径推理、正确性相关、有效样本量、自适应计算预算

一句话总结

本文用正确性相关与设计效应解释多路径推理的收益饱和,并从有标签的离线四路径试运行估计固定部署预算;在五个模型–任务组合上,选取 4–10 条路径保留了 32 路径二元多数票准确率的 96%–103%,但这一评测指标不等同于开放答案的实际相对多数投票准确率。

研究背景与动机

自一致性(self-consistency,SC)对同一个问题重复采样思维链,再按答案票数选出结果。增加路径容易实现,却不意味着增加了同等数量的独立证据:模型擅长的问题往往每条路径都答对,模型不擅长的问题往往反复答错。于是,把总体单路径准确率代入独立伯努利投票模型,会对强模型的多数票表现过度乐观,也可能对低于一半准确率的模型过度悲观。

这里的相关性需要明确统计层级。同一问题内的路径可以独立采样,但把不同难度的问题混合起来后,各路径的正确性仍会呈现正相关。本文并不是发现了采样随机种子之间必然存在依赖,而是把这种跨问题的能力异质性压缩成一个正确性相关系数,再用它衡量重复采样的边际价值。无线通信中的分集合并提供了分析语言,但并不意味着 LLM 内部真的实现了高斯信道。

论文因此将“继续加路径是否值得”放到聚合方法之前:先估计当前模型、提示与任务的相关结构,再选择预算;只有分支质量明显不同时,才进一步考虑加权。核心 idea:用正确性相关决定有效样本量的饱和程度,通过离线校准选定部署路径数,并把提示模板变化作为相关结构的诊断探针,而不是把答案多样性直接当成准确率提升。

方法详解

整体框架

输入是一组带标准答案的校准问题,以及后续不带标准答案的新问题。实际流程先做“相关校准”,再做“预算选择”;部署时只执行固定预算的“均匀聚合”,不访问新问题的正确性标签。“模板探针”是另外的受控实验,用来观察更换提示是否改变相关结构,不是 Adaptive-K 部署必须经过的阶段。

论文同时包含三种不同角色的对象:潜在嵌入信道用于理论抽象,正确性指示用于离线统计与实验评分,离散答案用于实际部署。默认部署不解码潜在嵌入,也不运行 GLS;经验 GLS-R 需要隐藏状态和协方差校准,属于另一种可选构造。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["校准问题与标准答案"] --> B["相关校准"]
    B --> C["预算选择"]
    C -->|固定预算,无新标签| D["均匀聚合"]
    E["新问题"] --> D
    D --> F["相对多数答案"]
    B -.->|另行比较 SC 与 PT| G["模板探针"]
    G -.-> H["相关结构诊断"]

关键设计

1. 相关校准:把跨问题的共同成败转成预算诊断量

每个校准问题采样四条路径,抽取答案,再与标准答案比较得到二元正确性。开放问答和 DROP 使用 token F1 至少 0.5 的阈值;代码任务使用执行后的通过/失败信号。平均单路径准确率记为 \(\bar p\),路径间相关估计取所有路径对的平均:

\[ \hat c=\binom{K}{2}^{-1}\sum_{j<k} \frac{\frac{1}{n}\sum_{i=1}^{n}Y_i^{(j)}Y_i^{(k)}-\bar p^{2}} {\bar p(1-\bar p)}. \]

这不是“答案字符串相同”的比例,也不是无需标准答案的置信度。它衡量不同路径在同一批问题上是否共同成功或共同失败。SC 中相同提示的路径槽位可视为可交换;在给定问题后采样独立,并不消除跨问题混合产生的边际相关。

在共同准确率和等相关假设下,平均正确性方差由独立情形乘上设计效应。因此,有效样本量是“具有相同均值方差的独立样本数”,不是实际不同解法的计数。论文另定义潜在协方差的参与比有效秩,两者必须分开:

\[ K_{\mathrm{eff}}^{\mathrm{vote}}=\frac{K}{1+(K-1)c}, \qquad \lim_{K\to\infty}K_{\mathrm{eff}}^{\mathrm{vote}}=\frac{1}{c}; \qquad K_{\mathrm{eff}}^{\mathrm{rank}}=\frac{K}{1+(K-1)\rho^{2}}. \]

投票层的 \(c\) 是正确性相关,潜在层的 \(\rho\) 是信道增益相关;不能把前者替换为后者的平方。附录 G 从等相关矩阵的一个公共特征方向及其余差分方向推导参与比;附录 D 则直接累加伯努利变量的方差与协方差,得到投票层公式。附录 V 的高斯阈值代理只说明:固定单路径准确率时,正确性相关随决策层相关单调增加,不提供两个层级的数值等价。

有效样本量自身还不能唯一决定多数票准确率。为得到准确率曲线,作者额外假设每个问题有一个 Beta 分布的成功概率,条件于这个概率时各路径独立,形成 beta-binomial(BB)模型:

\[ \Theta\sim\operatorname{Beta}(\alpha,\beta),\qquad Y_k\mid\Theta\sim\operatorname{Bernoulli}(\Theta),\qquad \alpha=\frac{p(1-c)}{c},\quad\beta=\frac{(1-p)(1-c)}{c}. \]

参数用矩估计得到,再对正确路径数超过一半的概率求和;偶数路径恰好平票时计入一半概率。该混合模型把问题难度异质性纳入预测,但仅有均值和相关系数并不足以证明真实分布必然属于 BB 家族。

2. 预算选择:在有效样本量边际增益过小时停止扩预算

Adaptive-K 不逐题检查当前答案是否一致,而是对一个模型、提示、任务配置选定全局预算。作者把连续化后的有效样本量导数与预设阈值比较,解出操作点:

\[ \frac{\partial K_{\mathrm{eff}}^{\mathrm{vote}}}{\partial K} =\frac{1-c}{[1+(K-1)c]^{2}},\qquad K^{*}=\left\lceil\frac{\sqrt{(1-c)/\varepsilon}-1}{c}+1\right\rceil. \]

默认阈值为 \(\varepsilon=0.025\),最大预算为 32。算法先判断试运行平均准确率是否退化为全对或全错;退化时回退到最大预算,否则把相关估计裁剪至 0.05–0.99,再将预算限制在 1 到最大预算之间。这个裁剪也是实现的一部分,不能把近零相关直接代入带除法的表达式。

所谓“四路径试运行”是每个校准问题四条路径,而不是仅用一个问题的四个答案。推荐校准问题数为 50–100,标签只在这里使用;正式部署的新问题无需标签。改变模型、提示或问题分布后,原预算不在论文保证的迁移范围内,应重新校准。

公式控制的是方差意义上的边际多样性,不是准确率下降的严格保证,更不是自动满足某个延迟约束的最优控制器。它的优势是只需少量固定校准,缺点是不能区分同一任务中的容易题与困难题。

3. 均匀聚合:对称分支默认等权,但不把 GLS 扩大成通用投票最优性

部署时生成选定数量的路径,抽取离散答案,再返回出现次数最多的答案,即相对多数投票(plurality vote)。论文为等权策略提供的理论依据来自另一个线性嵌入估计模型:分支表示包含带质量增益的共同目标及零均值误差,误差协方差为 \(\boldsymbol\Sigma\),质量增益向量为 \(\mathbf g\)。在线性无偏约束下,最小均方误差权重是:

\[ \mathbf w_{*}=\frac{\boldsymbol\Sigma^{-1}\mathbf g} {\mathbf g^{\top}\boldsymbol\Sigma^{-1}\mathbf g}. \]

附录 H 用拉格朗日约束求出该式。等增益、等方差、等相关时,逆协方差作用于全一向量仍沿全一方向,因此最优线性权重均匀;附录 Q 进一步说明,在等增益且均匀权重可行时,严格改善要求协方差行和不再完全一致。相关不等于必须加权:若所有分支同样冗余,没有哪条路径值得额外偏重。

但嵌入均方误差和离散分类准确率是不同目标。只有解码保持相应对称性时,两者才可能对齐;这一证明不是“多数票在所有聚合规则中 Bayes 最优”的定理。实际的等权离散投票也不是先运行 GLS 再解码。

实验还有一个重要区别:MV@K 是对标准答案评分后的正确性指示做二元多数票,正确路径超过一半计 1,恰好一半计 0.5。开放答案的部署会比较每个具体答案的票数;若错误答案彼此分散,正确答案即使不到总票数的一半也可能获胜。因此,二元多数票曲线不能直接当成开放问答的部署相对多数准确率,附录 W 的错误答案均匀分散推导也只是启发式,并未证明完整多项分布的随机占优。

4. 模板探针:主动改变分支分布,检查饱和诊断能否随配置变化

受控实验给八个路径槽位分配不同模板,例如数学中的代数求解、先估算后精算、反向推导与代回验证,问答中的抽取关键事实、直接回答与先回答后核验。这些变化不再满足相同分支分布,用来检验相关结构是否真的可被提示改变,而不是将模板变化包装为新的训练方法。

跨任务比较报告路径正确性向量的平均两两 Pearson 相关,原表记作 \(\hat\rho_{\mathrm{SC}}\) 与 \(\hat\rho_{\mathrm{PT}}\);这些是观测统计量,不是潜在信道的 \(\rho\)。相对变化定义为 \(\Delta\rho=(\hat\rho_{\mathrm{PT}}-\hat\rho_{\mathrm{SC}})/|\hat\rho_{\mathrm{SC}}|\)。SC 下它与前述相关估计一致,异质模板下则可能略有差异,不能无条件把等相关有效样本量当成完整协方差的精确摘要。

模板可能让分支更不相关,也可能让单路径准确率变差,因此去相关不保证多数票更准。附录 I 在槽位准确率变异较大的 PT 单元上观察到较大加权收益,但权重用同一评测集的准确率估计,是标签知情的诊断参照,部署仍需留出校准。作者把它称为 oracle 上界;它不是任意可部署聚合器都无法超过的普适准确率界。

一个完整示例

以 Qwen2.5-7B 的 GSM8K 配置为例,先对 100 个带答案的问题各生成四条路径,并用正确性模式估计相关约为 0.60。默认阈值选择六路径预算;之后每道新题只生成六条答案并按答案身份投票,不再读取标准答案。这个例子是表 IV 配置的流程说明,不是另一次实验。

评测时六路径的二元多数票准确率为 81.6%,32 路径为 81.9%。若部署仅服务一个新问题,前期校准并不便宜;若固定配置服务大量问题,校准可以摊销。表 IV 的核算表达式为 \((K^{*}+4)/32\),得到 31%;按算法的一次性校准实际核算,服务 \(N\) 个新问题的路径数比为 \((4n+K^{*}N)/(32N)\),不能说每道新题都额外需要四条带标签路径。

实验关键数据

主实验

主饱和实验在 GSM8K 上使用三个模型家族、五个种子,每种子 100 题;跨任务实验使用五个指令模型、12 个基准、八路径,每种子 50 题。主要推理温度为 0.7。下表来自表 IV,准确率均为二元多数票,保留率与成本保留原表的整数舍入。

任务/模型 四路径相关 选定路径数 选定预算准确率 32 路径准确率 保留率 表 IV 成本
GSM8K / Qwen-7B 0.60 6 81.6% 81.9% 100% 31%
GSM8K / Llama-8B 0.53 8 78.1% 79.3% 98% 38%
GSM8K / Mistral-7B 0.45 10 43.6% 42.4% 103% 44%
HotpotQA / Llama-8B 0.61 6 50.2% 52.2% 96% 31%
BoolQ / Llama-8B 0.79 4 80.2% 80.3% 100% 25%

五个单元的配对 bootstrap 准确率差 95% 区间都包含零;103% 保留率不是可靠证明少采样更优。表 IV 成本是路径数核算,不是实测 GPU 时间或 token 成本。附录 J 对 100 题的一次性校准给出 400 条路径;服务 1000 题时,五个配置的含校准总路径成本为固定 32 路径的 13.8%–32.5%。附录 R/S 的部分成本措辞将一次性校准与表 IV 简化核算混用,这里分别说明,不自行将两者改成同一口径。

消融实验

以下为表 I、II 的饱和与模型校准分析,不是删除网络模块的消融。BB 与独立二项模型都用同一评测数据拟合,因此这一表属于样本内预测。

GSM8K 模型 32 路径有效样本量 实测 MV@32 BB 预测 独立二项预测
Qwen2.5-7B 1.67 81.9% 81.1% 100.0%
Llama-3.1-8B 1.94 79.3% 77.8% 99.9%
Mistral-7B 2.13 42.4% 41.3% 20.6%

Qwen 的表 I 在 32 路径时给出正确性相关 0.586、有效样本量 1.67、天花板 1.71,已到天花板的 98%。这里的平均单路径准确率为 79.2%,不是表 II 的多数票准确率 81.9%。BB 样本内误差为 0.8–1.5 个百分点;用一半问题的四路径试运行预测另一半问题的 32 路径结果,误差变为 3.3–4.8 个百分点,独立模型误差为 18–24 个百分点,不能混称同一验证强度。

下表选取表 III 的四个基准,相关为观测 Pearson 相关,下降百分比是每个模型相对变化再取平均,不必等于表中平均相关相除的结果。

基准 有效模型数 SC 平均相关 PT 平均相关 平均相关相对变化 有效样本量平均变化
TriviaQA 5 0.68 0.19 -71.5% +2.1
HotpotQA 5 0.55 0.17 -62.5% +2.0
GSM8K 5 0.55 0.38 -29.4% +0.5
MATH 5 0.60 0.55 -9.2% +0.2

关键发现

  • 60 个模型–基准单元中,三个 DROP 单元因单路径准确率低于 2% 被排除;余下 57 个有 55 个相关下降,但只有 43 个的 95% 区间排除零。它不是“55 个都显著提升准确率”。
  • 附录 L 的 PT 准确率变化在六个领域有正有负:QA 平均 -0.4 个百分点、Math -1.3、Code -3.9,而 NLU 为 +2.3。扩大多样性空间与维持路径质量是两个不同目标。
  • 附录 P 中 50 题试运行的相关估计变异系数最高为 14.2%,预算标准差约 1.5–2.0;25 题时部分预算估计明显更不稳定。四路径低成本不等于无需足够问题数。
  • 附录 M 的 Qwen3.5-9B thinking 模式在 GSM8K 选择 14 路径,保留 MV@32 的 99.8%;生成上限为 16,384 token,5.4% 路径因触顶被记错,不能外推到更难题或无限长推理。

亮点与洞察

  • 把采样条数与有效证据量拆开,比只画准确率曲线更有诊断价值。同样的 32 条路径,在相关较高时只对应很小的设计效应有效样本量。
  • 对称冗余不一定需要复杂加权;先检查分支是否异质更合理。GLS 的价值是揭示这一条件,而不是给任意多数票规则背书。
  • 模板变化作为结构探针,比只汇报一次平均涨点更能揭示任务差异。开放答案任务去相关更明显,但这种观察仍是统计关联,不是答案空间开放性的因果证明。

局限与展望

  • 二元评分压缩了错误答案分布,开放答案的相对多数投票可能与本文评测曲线不同。需要额外报告真正的部署答案准确率,并建模错误答案是否集中。
  • 全局预算不能按题目难度分配计算,和在线早停方法的等计算量比较仍未完成。可在离线预算先验上叠加逐题停止机制,但需另行验证。
  • PT 破坏可交换性后,单一平均相关无法完整刻画槽位质量与协方差结构。附录 J 的块方差有效样本量与等相关近似的平均比为 1.16,个别开放问答单元达到 2.5 倍。
  • BB 是参数化混合假设,饱和天花板是有效样本量的界,不是任意任务准确率的严格界。将问题难度分层、检验非 Beta 混合以及报告留出预测区间会更稳健。
  • 校准仍需要 50–100 道有标签问题,配置变化需重新校准。没有标签、任务分布持续变化或仅有极少问题时,本文规则不能直接作为免校准方案。

相关工作与启发

  • vs Self-Consistency:保留重复采样与答案投票,新增的是预算饱和的离线诊断,而非新的思维链生成器。
  • vs Adaptive-Consistency / ESC / RASC:这些方法逐题根据采样过程中的一致性或质量早停;本文先在校准集选固定预算,两者可互补,但尚无匹配计算量的优劣结论。
  • vs CISC 等置信度加权方法:本文指出异质槽位才是较有希望的加权场景。附录 I 的同集标签权重结果不能替代部署时的置信度校准实验。
  • vs compound-inference scaling:二者都面对跨题难度异质性;本文将其概括为一个相关统计量,不分解难度来源。一个可研究方向是同时检验条件正确性相关与错误答案集中度,以区分问题混合导致的饱和和具体错误模式导致的投票失败。

评分

  • 新颖性: 4/5。将经典统计量组织成 LLM 多路径推理的可操作预算诊断,核心公式并非全新理论。
  • 实验充分度: 4/5。多家族、多任务和留出 BB 验证较完整,但部署相对多数指标及在线早停对比不足。
  • 写作质量: 4/5。假设映射和理论边界明确,部分成本表述及观测相关记号容易造成混淆。
  • 价值: 4/5。适合有标签校准集、配置稳定的推理服务,不应作为通用投票最优性或免标签停止保证。