Measuring Collapse and Correction in Homogeneous-Panel LLM Debate¶
会议: NeurIPS2026 — Evaluations and Datasets Track(按任务包提供的元数据保留,未独立核验官方录用或主会身份)
arXiv: 2609.35279v1
领域: 多智能体 / LLM 评测
关键词: 同质面板辩论、状态转移账本、条件坍塌、纠错保留、有符号回放
一句话总结¶
本文将同一模型的三智能体辩论拆成保留正确、坍塌、纠错与未修复四类转移,结合辩论前筛查和逐轮轨迹定位风险;但离线冻结回放在阻止 29 次坍塌的同时丢失 108 次纠错,说明风险信号不等于有效控制策略。
研究背景与动机¶
多智能体辩论通常让模型先独立答题,再阅读同伴理由并更新答案,最后用多数结果评估效果。然而,最终准确率只显示两种相反流量抵消后的净值:讨论可以把原本错误的面板救回来,也可以把原本正确的面板带偏。单纯统计改答案的频率也无法区分方向。原文用 Sonnet 4.5 与 Llama-3.1-8B 举例,两者辩论改答率为 0.705 与 0.726,但条件坍塌率为 2.15% 与 8.46%;“是否愿意修改”并不是“修改是否有益”。
这也影响缓解方法的判断。如果一个模型容易修订答案,或第一轮多数答案发生变化,停止辩论似乎能减少风险。但同样的信号也可能出现在有益纠错之前。仅报“避免了多少坍塌”会把冻结策略塑造成安全改进,却忽略它同时拿走了多少恢复机会。本文因此不提出新辩论架构,而是建立可审计的评测协议,将模型选择阶段的筛查、单次轨迹的运行时诊断与干预回放分开。
作者刻意选择同质、闭卷、多项选择题环境,以标准答案和规则编码降低评价歧义;这并不意味着所有解析与投票细节都无关紧要。核心 idea:把辩论收益写成方向明确、分母固定的状态转移账本,再用“阻止坍塌减去丢失纠错”的有符号效用审计干预,而不是把风险排序直接当作控制器。
方法详解¶
整体框架¶
输入是模型、题目池、答案标签、探针输出以及保存的逐轮辩论记录,输出是筛查统计、四格转移账本、坍塌起始轮次和干预的阻止/丢失/净值。流程依次为辩论前筛查、转移记账、轨迹定位、有符号回放;这些是测量与离线分析阶段,不是部署时串联运行的控制网络。
标准辩论使用同一模型的三个智能体:Round 0 独立回答,随后 Round 1–3 阅读面板当前回答并修订,以 Round 3 多数答案作为最终结果。不同智能体使用 0.5、0.7、1.0 的温度,因此同质指模型相同,不指采样设置完全相同。原文的“多数”由规则实现,可能包含解析失败后的过滤和平票裁决,不应理解为必然形成三人一致共识。
探针另行测量单个模型的可修订性,逐轮记录则用于观察真实辩论。两者通过模型—脚手架行及题目身份关联,但测量单位不同;原文的 14 行关联队列、6,925 次起始轮次队列和 6,525 次冻结回放队列不能合并成一个统一实验样本。
本文以评测协议和机制诊断为主,因此用文字说明测量依赖,不将其绘制成容易被误认为在线控制架构的网络图。
关键设计¶
1. 辩论前筛查:测量可修订性,而非给出安全排名
每个模型—题目对先得到初始回答,再接受 8 个测量条件,即 4 个论证强度与 2 个社会通道设置的交叉。这里仅保留实验因素与聚合统计,不复现可用于诱导错误答案的提示文本。每个条件记录是否改答,平均后得到探针改答率;模型级总改答率再对题目池聚合,用于决定哪些模型—脚手架行值得投入更昂贵的轨迹审计。
其中,修订事件取 1 表示答案改变,取 0 表示未改变。总改答率同时容纳有害与有益变化,不能当作坍塌概率。作者另按初始答案是否正确,定义对抗改答率为“初始正确条件下,后续答案错误的比例”,纠错改答率为“初始错误条件下,后续答案正确的比例”。错误答案之间的漂移也是改答,但不是纠错。这些条件比例的分母不同,不能直接相加还原总改答率。
通道诊断也不是新控制器。社会敏感度是社会条件平均改答率减去单独条件平均改答率;论证敏感度是强与很强条件的平均值减去弱与中等条件的平均值,均对另一因素平均。S/A 将社会敏感度除以两种敏感度绝对值之和再加 0.000001,保留社会效应的符号,不能把它理解为两个正数的普通比值。作者报告的通道差异存在模型间异质性,尤其不能由总改答率相关性推断 Qwen 内部存在统一的独立通道机制。
高改答率题目池依据探针行为选取,而不使用后续辩论成败:在固定 1,000 题池上按单独条件改答率,取每个模型的前 200 题。结果导向泄漏因此受到约束,但不同模型可能评估不同题目。共享题池与全题池检查用于界定这种选择效应,不使跨模型比较自动变成严格配对比较。
筛查的使用时点是采集辩论轨迹之前。三个智能体的初始回答一旦已经生成,分歧、答案多样性等信号可以直接利用,未必值得额外付费执行全探针。附录还指出,完整心理测量配置的生成成本可能高于小规模直接辩论审计,不能仅因单模型探针就宣称成本更低。
2. 转移记账:将准确率拆成可核对的双向变化
以初始面板与最终面板的正确性建立四格账本:正确到正确是保留,正确到错误是坍塌,错误到正确是纠错,错误到错误是未修复。本文的坍塌操作定义只要求最终多数错误,不要求所有智能体一致,也不要求中间状态从未恢复。条件坍塌率使用初始正确多数作为风险分母,而不是所有辩论次数。
相应的条件纠错率使用初始错误多数作为分母。当每个初始与最终多数均有定义时,“纠错次数减去坍塌次数,再除以辩论总数”恰好等于最终减初始准确率。账本因此是准确率的分解,不是替代指标;它让同样的净准确率变化可以被解释为完全不同的风险与恢复结构。遇到未定义多数时,则必须明示如何处理,再讨论这个等式的适用范围。
答案提取依次偏好显式最终答案标记、回答/选择变体、独立选项字母,最后才用最后一个有效选项字母兜底。探针提取失败默认记作未修订,辩论投票则过滤未解析答案并按字母顺序打破平票。这些规则不需要 LLM 评委,但会影响低信号样本的标签,因此协议同时要求解析失败率、替代解析器重编码和投票稳定性审计。
3. 轨迹定位:发现风险出现的时间,不把事后信息包装成预测
对最终发生坍塌的辩论,起始轮次定义为运行多数第一次从正确变为错误的轮次。它可能发生在第一轮,也可能在第二或第三轮;如果早期错误多数曾被修复,仍不能把“起始”简单等同于最后一次变错。逐轮保存答案使这种时序定位可以重算,而非依赖对整段文本的主观评价。
作者比较辩论前特征、加入 Round 1 特征以及加入完整轨迹后的折外 AUC。Round 1 特征包括多数变化、智能体改答数与一致度,可以比静态筛查更直接刻画单题运行状态。但附录 E.1 的基线还包含初始正确性,即利用标准答案的审计变量;完整轨迹进一步使用后续轮次,因此这些结果不能一概描述为部署时可用的前瞻预警系统。
AUC 衡量诊断区分能力,不说明采用什么动作能提高效用。原文还说明,报告的 AUC 增量区间通过辩论索引重采样得到,开放材料不足以恢复预注册要求的题目/模型聚类区间。这既限制统计解释,也要求将轨迹相关性与因果机制主张分开。
4. 有符号回放:把冻结节省的错误与牺牲的恢复一起计价
离线回放读取已经完成的辩论,某个门控触发时,用保存的初始多数替代保存的最终多数。对坍塌样本,这样能保留原本正确的答案;对纠错样本,则抹掉讨论获得的正确答案。其他两格通常不改变准确率,因此必须同时统计阻止的坍塌和丢失的纠错。
默认两种权重均为 1,此时净效用除以队列大小就是相对保存的标准辩论结果的准确率变化。非等权时,该商是归一化加权效用,不再是字面上的准确率增益。盈亏平衡权重比是使净值非负所需的最小“坍塌价值/纠错价值”比例,应在选择策略前确定,而不是看完结果后重新定义安全收益。
探针门控使用留一模型法(LOMO):风险分类器、冻结阈值和冻结模式只在其余模型上选择,再固定评估被留出的模型。作者另外测试固定 Round 1 多数变化规则和严格 LOMO 的单层决策树。它们是检验账本的回放基线,不是本文交付的有效部署策略,且三行使用不同队列,不能按准确率变化直接评选最佳控制器。
损失函数 / 训练策略¶
本文不训练新的基础 LLM,也没有用微调改变辩论行为。主要统计分析按 7 个家族平均聚合相关模型变体,再做精确双侧 Spearman 检验;14 个模型行仅作为敏感性视图,不能当作 14 个独立模型证据单位。
协议最初预注册计划包含 18 个模型行,实际经缺失与身份/题目池检查后保留 14 行,其中 Qwen 占 6 行。家族级分析是对实际队列非独立性的修正,不是原定样本目标毫无变化地完成。初始探针答案实际使用 0.5、0.7、1.0 的温度,仅挑战后的回复在供应商支持时使用 0;附录 G.2 明确纠正了此前“全部探针温度为 0”的描述。
实验关键数据¶
主实验¶
下表摘取原文 Table 3,按其行序保留家族均值。条件坍塌率是各模型条件率的家族平均,不是把所有家族题目合并后重新计算的比率。
| Family | Models | Probe total FR | Conditional collapse (%) |
|---|---|---|---|
| DeepSeek | 1 | 0.113 | 0.00 |
| 2 | 0.288 | 0.29 | |
| OpenAI | 2 | 0.346 | 1.52 |
| Anthropic | 1 | 0.450 | 2.15 |
| Phi | 1 | 0.469 | 10.24 |
| Qwen | 6 | 0.699 | 19.75 |
| Meta | 1 | 0.774 | 8.46 |
主分析为 7 个家族,Spearman 相关系数 0.8929,精确双侧 p=0.0123。免费能力压力指标“1 减初始多数准确率”的家族相关系数为 0.821;控制初始多数准确率后的家族偏相关为 0.767,p=0.0877,并未达到常用显著性门槛。因而证据支持协议内的审计分流,不支持能力调整后已校准的风险预测。
下表来自原文 Table 5,保留列标签与分组规模,避免将单题诊断与家族排序混为一谈。
| Predictor | Gemini (N=990) | Haiku (N=500) | GPT (N=494) | Pooled (N=994) |
|---|---|---|---|---|
| Mean probe FR | 0.455 | 0.626 | 0.735 | 0.658 |
| S/A ratio | 0.394 | 0.473 | 0.576 | 0.529 |
| Initial disagreement | 0.765 | 0.550 | 0.858 | 0.573 |
| Combined (FR+Diff+Disagree) | 0.845 | 0.719 | 0.931 | 0.762 |
| Combined (+S/A) | 0.843 | 0.719 | 0.933 | 0.765 |
这些 AUC 整体说明运行时分歧与组合特征的重要性,但并非每一列“分歧都胜过探针”:Haiku 与 Pooled 列中的分歧 AUC 低于探针 FR。原文关于分歧更强的总结须保留这个表内边界;Pooled 的 N=994 也不是前三列规模之和,笔记不将其改写成全样本汇总。
消融实验¶
下表来自原文 Table 7,并由附录 E.7、E.8 解释队列与冻结语义。Delta acc 使用百分点(pp),每行相对于各自保存的标准辩论结果。
| Policy | Cohort | Validation | Delta acc (pp) | Prevented | Lost | Net | Break-even ratio |
|---|---|---|---|---|---|---|---|
| Probe-gated freeze | 6,525 OSS debates | LOMO | -1.21 | 29 | 108 | -79 | 3.72 |
| Round 1 majority change | 1,255 traces | Fixed replay | -1.04 | 56 | 69 | -13 | 1.23 |
| Learned Round 1 stump | 1,255 traces | Strict LOMO | -2.31 | 2 | 31 | -29 | 15.50 |
探针回放队列共有 251 次坍塌与 804 次纠错,门控分别阻止其中 29 次与丢失其中 108 次;仅展示前一个数字会颠倒结论。Round 1 固定规则在坍塌价值足够高时可能具有正加权效用,但等权结果仍为负,且这不构成在线部署收益的证据。
关键发现¶
- 起始轮次分析覆盖 6,925 次辩论、253 次坍塌:Round 1 为 149 次(58.9%),Round 2 为 47 次(18.6%),Round 3 为 57 次(22.5%)。第一轮是最大风险窗口,但仍有明显的晚发尾部。
- 原文 Table 2 与附录 E.1 报告折外 AUC 从 0.669 提升到加入 Round 1 后的 0.768,再到完整轨迹的 0.846;后一个结果包含后续状态,只能作为诊断参照。
- 附录 A.3.3 的开放子集审计中,字母平票规则触发 298/3,240 次初始/最终投票归约(9.20%);取消最后字母兜底后,在 966 条仍可严格标注的记录中有 51 条改变四格归属(5.28%)。规则标签并非天然无误差。
- GPQA 压力检查中,Mistral Small 4 有 20 次坍塌与 21 次纠错,看起来近乎准确率中性;剔除 4 条无有效初始多数的记录后,净值从 +1 变为 -1。它支持记账价值,不证明筛查跨基准迁移。
亮点与洞察¶
- 将风险识别与干预收益解耦。 高相关性和更好的 AUC 可以同时存在于负效用策略中;干预评测必须把恢复机会算作成本,而不是只对错误避免量记功。
- 保留条件分母与方向。 同一准确率净增益可能隐藏完全不同的坍塌负担,用四格账本可以区分“稳定但不纠错”与“活跃且有双向转移”。这适合扩展评测报告,但不是通用安全认证。
- 负结果成为可复用标尺。 已知等权负效用的冻结基线有助于检验新控制器是否真正保留纠错;跨队列、跨权重比较仍需重新做匹配的留出审计。
局限与展望¶
- 样本小且家族不均衡。 主推断只有 7 个家族,Qwen 家族内条件坍塌率从 5.11% 到 43.90%;平均聚合缓解相关变体被重复计数的问题,却不能消除异质性或能力混杂。
- 开放重建边界明确。 6,525 次探针 LOMO 决策矩阵仅发布冻结聚合结果,精确逐辩论 Round 1 特征矩阵仍受访问限制。不能据此声称已用公开材料复现全部逐行控制比较。
- 解析与平票属于评测设计。 本文主实验按字母裁决,附录 G.5 的共享初始回答后续实验则把平票保留为未决并计错;两者的坍塌与准确率不能直接混合。
- 机制与迁移证据有限。 同质、闭卷、静态选项任务不能代表异质监督、工具使用、检索或自由生成;逐轮关联也不证明因果中介机制。
- 自修订对照不是算力匹配的单智能体推理上限。 后续实验共享 Round 0,在 12 个选择题设置中私有修订的二元准确率比同伴辩论低 1.44–4.81 个百分点,但给平票期望得分后差异为 -1.62 至 +0.38;11 个推理模式行仍出现双向转移。这些是事后边界检查,不是“辩论必然优于更长单模型推理”的证明。
- 原文一致性问题应保留。 文本抽取重复了“88”“253253”等数学渲染,本笔记依据明确的 4×2 设计及表格恢复为 8 个探针;附录 B.4 的简写加和不能按未加权条件率理解。正文给出的平均 AUC 与表内逐列关系也不能被修成一致。
相关工作与启发¶
- vs Du 等的多智能体辩论。 既有工作主要展示推理与事实性收益,本文沿用标准脚手架,将平均收益进一步拆为坍塌和纠错,不把测量协议包装成新协作算法。
- vs 信心、多样性与自适应停止研究。 这些工作设计聚合或控制机制,本文提供可重评分的目标:在固定留出队列与效用权重下同时报告阻止、丢失和净值,比较行动而非只比较诊断分数。
- vs 迎合与群体顺从研究。 本文使用行为测量区分论证和社会通道,但没有激活缓存或受控训练实验,不能解释为内部电路复现,也不能把不愿改答视为安全。
- 可延伸的研究问题。 对不确定样本采用保留纠错机会的弃权或外部核验策略,并在统一队列中比较解析规则、动作覆盖率和加权转移效用;这只是笔记的研究启发,不是本文已验证的方法。
- 资源。 论文;DebateLedger 项目页。本文仅据指定本地全文写作,未联网核验项目发布状态。
评分¶
- 新颖性: 4/5 — 贡献在方向性记账与审计协议,而非新辩论架构。
- 实验充分度: 4/5 — 有留出负结果、解析检查与扩展边界,但主家族数量有限且部分逐行材料受限。
- 写作质量: 3/5 — 对结论边界较克制,队列版本与正文/附录口径需要仔细辨别。
- 价值: 4/5 — 为比较辩论控制器提供比坍塌率或最终准确率更透明的报告方式。