跳转至

Reasoning-Trace Collapse: Evaluating the Loss of Explicit Reasoning During Fine-Tuning

会议: NeurIPS2026(任务队列归属;本文依据 arXiv v2)
arXiv: 2605.21127
代码: https://github.com/itsluketwist/thinkpack/
领域: LLM 推理
关键词: 推理轨迹坍塌、结构有效性、监督微调、损失掩码、条件化评测

一句话总结

本文把“答得对”与“仍会输出完整显式推理”分开评测,发现无推理轨迹的常规微调可让模型在 Chemistry 上准确率提高而有效推理率降至零附近,并用推理区域损失掩码缓解这一结构性退化,但效果依赖模型与任务。

研究背景与动机

显式推理模型通常经强化学习、蒸馏或专门的格式监督,学会先输出思维链(chain-of-thought, CoT),再给最终答案。部署小模型时,却常用普通指令—回答数据继续监督微调:数据有答案,甚至有解释,却没有模型要求的独立推理区域。这个差别不是“数据没有任何推理内容”,而是训练目标没有保留原先的推理输出协议。模型可能适应了新任务,同时学会跳过该协议。

只看 pass@1 难以发现这种变化。一段不带推理标签的解释也可能给出正确答案;反过来,模型可能产生很长但没有闭合的推理,无法提取可用答案。将两者都压缩成准确率,会混淆“完整推理的任务能力下降”和“完整推理越来越少出现”。已有逐步验证、逻辑评测和忠实性分析关注轨迹内容,通常以轨迹已经存在为前提;本文补上的是此前更基础的结构检查,而不是另一个证明模型真的在推理的指标。

作者利用不同模型的聊天模板、轨迹解析和训练损失控制,把这一问题组织成可复用的评测流程。核心 idea:联合报告轨迹结构状态、最终答案准确率与有效轨迹条件下的准确率,并通过屏蔽空推理区域的训练损失,避免直接把“不输出推理”教成目标行为。

方法详解

整体框架

这是一项评测与受控微调研究,而非新的推理网络。输入是原有显式推理模型与无独立推理轨迹的指令—回答数据;先通过缺失推理对照改变数据格式和监督区域,再周期性生成回答,经跨格式结构解析分离轨迹与答案,最后做条件化联合评测。

ThinkPack 将聊天模板、解析器、统计与掩码接口接到 Hugging Face transformers 流程中。训练时的掩码只决定哪些 token 参与损失,并不在推理时强制模型生成轨迹;推理时仍按各模型模板、贪心解码及统一预算生成。因此,轨迹保留是训练后观察到的行为,不是外接生成器补出来的内容。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["模型与无轨迹数据"] --> B["缺失推理对照"]
    B -->|训练:格式与损失监督| C["微调检查点"]
    C -->|推理:固定题集与贪心解码| D["生成回答"]
    D --> E["跨格式结构解析"]
    E --> F["条件化联合评测"]

关键设计

1. 缺失推理对照:把数据表示与监督信号一起纳入实验

普通回答缺少显式轨迹时,模板仍必须决定怎样表示这种缺失。empty-think 在答案之前加入空的 <think>...</think> 块;no-think 完全省去推理块。Qwen3-8B 的默认表示是前者,Olmo-3-7B、Llama-R1-8B 与 Nemotron-7B 是后者。作者让每个模型都测试两种格式,而不是把模型默认当成理所当然的安全选项:空块会直接示范“立即结束推理”,省略块则会示范“无需进入推理区域”,两种信号对不同后训练模型的影响可能不同。

缓解实验仍使用 empty-think 数据,但改变损失支持区域。masked-think 屏蔽空推理区域,保留其余监督;response-only 进一步屏蔽提示,只让最终回答贡献损失。这里的“最终回答”是数据中的解释加答案,不应误解为只监督最后一个选项或数字。掩码也不是删除输入:提示与模板仍参与条件计算,只是不再作为预测目标直接计入损失。它保留已有行为的方式是撤掉反向训练信号,而不是提供正确思维链。

蒸馏是成本更高的对照:GPT-5-mini 同时看到问题与目标回答,再产生简短推理摘要,最多尝试两次提取非空轨迹。2,674 条训练数据中有 2,408 条获得轨迹,占 90.1%;剩余 266 条保留,并按各模型默认缺失格式处理。因此,这不是全部样本都有教师轨迹的理想化蒸馏,也不是经过独立逐步验证的轨迹监督。

2. 跨格式结构解析:把失效拆成可定位的类别

ThinkPack 根据 tokenizer 与聊天模板识别内联推理、模板预置起始标签的推理,以及独立字段中的推理;不能自动识别时允许覆盖格式定义。这个适配很重要:Olmo 的开标签已经由模板提供,不能仅因生成文本缺少新的开标签就判为 missing。解析结果必须结合预期格式,判断轨迹能否与最终回答分离。

结构有效的轨迹必须完整、非空且可可靠提取。empty 表示有边界但内部没有内容;missing 表示提取不到轨迹;truncated 表示已经开始却未完成,例如缺少闭合标签,或达到生成上限。VR、ER、MR、TR 分别是四类样本占全部生成的比例。结构有效只表示满足输出协议,不表示步骤正确、忠实反映内部计算,或因果上产生了答案。

截断还被细分为 overflow 与提前结束:前者耗尽可用生成预算,后者在闭合前输出结束 token。两者都会破坏结构,但解决方向不同。增加预算可能帮助 overflow,却不会让已经提前结束的轨迹自动完整;因此不能一看到 TR 高,就统一归因于推理太长。

作者人工检查了跨模型、任务、格式与检查点的 100 条生成,覆盖四种结构类别,与解析器达到 100% 一致。这支持当前研究格式下的解析可靠性,但不是面向任意新模型的无误保证,更不是对推理语义正确性的验证。

3. 条件化联合评测:让结构保留与答题能力分别可见

每个检查点同时报告总体 pass@1 与有效轨迹条件下的 Rpass@1。用 \(V_i\) 表示第 \(i\) 个回答结构有效,用 \(C_i\) 表示答案正确,下式是指标定义的数学表达,而非新的优化目标:

\[ \mathrm{VR}=\frac{1}{N}\sum_{i=1}^{N}V_i,\qquad \mathrm{pass@1}=\frac{1}{N}\sum_{i=1}^{N}C_i,\qquad \mathrm{Rpass@1}=\frac{\sum_{i=1}^{N}V_iC_i}{\sum_{i=1}^{N}V_i}. \]

ER、MR 与 TR 使用相同分母 \(N\),将有效指示替换为对应失效类别的指示。有效样本不超过 10 条时,作者不报告 Rpass@1,表中的“—”不是零准确率。两种准确率的分母不同,也不能把总体 pass@1 简单写成 VR 与 Rpass@1 的乘积,因为结构无效的回答仍可能答对。

若 VR 与 Rpass@1 都下降,结构保留和有效轨迹条件下的任务表现都在变差;若 VR 大降而 Rpass@1 较高,则剩下能输出完整轨迹的回答仍有较高正确率。本文将后者视为坍塌的典型信号,但不能由此推断全部题目的潜在推理能力都未受损:条件集合会随微调变化,可能优先保留容易题或模型熟悉的题。

附录进一步跟踪 Qwen3-8B 的 GSM8K 有效且正确集合。在 seed 42 的最后五个检查点,VR 从 65.2% 降至 60.5%,该集合从 162 条减至 152 条,Rpass@1 为 96.8%–98.1%;相邻检查点集合 Jaccard 为 0.87–0.90。这说明该案例的高条件准确率不是由剧烈换题集合制造的,但仍没有消除条件选择,也没有证明轨迹对答案的因果贡献。

损失函数 / 训练策略

下面用掩码交叉熵概括训练机制;这是对常规自回归监督与本文掩码操作的说明,不冒充原文给出的编号公式:

\[ \mathcal{L}_{\mathrm{mask}}=-\frac{1}{\sum_t m_t}\sum_t m_t\log p_\theta(y_t\mid y_{<t}),\qquad m_t\in\{0,1\}. \]

被屏蔽位置取 \(m_t=0\),不直接贡献 token 损失;其余取 \(m_t=1\)。masked-think 与 response-only 的区别是提示区域是否也被屏蔽,而不是训练时在线采样思维链。由于最终回答仍在空块上下文中被监督,掩码不能保证模型一定保留推理,实际有效性必须测量。

主实验使用非量化 LoRA,训练 3 个 epoch;学习率 \(10^{-5}\),AdamW、权重衰减 0.01、余弦调度、warm-up 比例 0.1。LoRA rank 为 16、alpha 为 16、dropout 为 0,作用于注意力和 MLP 投影;bf16、单设备 batch size 2、梯度累积 2,训练种子为 42 与 67。

Chemistry 训练集有 2,674 条,留出集有 507 条。每 100 步评测一次,最终评测检查点为 step 2000;每个任务固定抽取 256 条并跨设置复用。EvalPlus 子集包含 83 条 HumanEval 与 173 条 MBPP,不是分别评测完整 HumanEval+ 与 MBPP+ 后求平均。

评测无 system prompt,采用贪心解码,至少生成 32 token。共享上下文限制为 32,768 token,实际生成预算要减去提示长度;这不同于每条输出都可生成完整 32,768 token。Chemistry 与 GSM8K 要求 boxed 答案,但检查器接受常见等价格式;代码由 EvalPlus 测试框架检验。

实验关键数据

主实验

下表摘自附录 F 的 Table 2 与 Table 3,均为 Chemistry。Base 是微调前,Final 是 step 2000 的两训练种子均值;数值为百分比,保留原表不确定性。默认格式不一定保护推理。

模型 状态 / 默认策略 pass@1 VR Rpass@1
Qwen3-8B Base 28.9 ± 5.8 73.0 ± 5.7 39.6 ± 7.2
Qwen3-8B Final / empty-think 54.1 ± 7.0 0.0 ± 1.9 —
Olmo-3-7B Base 23.8 ± 5.6 83.6 ± 5.0 28.5 ± 6.4
Olmo-3-7B Final / no-think 19.9 ± 6.1 59.2 ± 7.0 33.6 ± 9.0
Llama-R1-8B Base 32.4 ± 6.0 57.4 ± 6.1 51.7 ± 8.0
Llama-R1-8B Final / no-think 54.5 ± 7.0 0.2 ± 2.1 —
Nemotron-7B Base 34.0 ± 6.0 73.0 ± 5.7 46.5 ± 7.1
Nemotron-7B Final / no-think 53.5 ± 7.0 0.0 ± 1.9 —

Base 的区间基于 256 条样本的 95% Wilson 区间;微调结果使用各种子 97.5% Wilson 区间端点的均值构造近似 95% 不确定性区间。它们主要描述评测样本不确定性,并非训练种子标准差或完整训练随机性。

Qwen、Llama 与 Nemotron 展示了“任务适应成功、显式轨迹近乎消失”的分离;Olmo 则同时出现任务表现下降与截断增多。正文将 Llama 默认设置的最终 Chemistry VR 概括为 0%,但附录 Table 3 是 0.2%;此处保留精确表值,不把概括写成严格零。

消融实验

下表摘自附录 F 的 Table 3,比较最终 GSM8K 结果。它既展示格式效应,也展示掩码与蒸馏并不跨模型统一有效;所有数字均为百分比。

模型 策略 pass@1 VR Rpass@1
Qwen3-8B empty-think 79.5 ± 6.2 60.2 ± 7.0 98.4 ± 4.2
Qwen3-8B no-think 96.3 ± 3.7 96.3 ± 3.7 97.2 ± 3.5
Qwen3-8B masked-think 96.5 ± 3.6 99.8 ± 2.1 96.7 ± 3.5
Qwen3-8B distillation 96.7 ± 3.5 99.6 ± 2.2 97.1 ± 3.4
Olmo-3-7B no-think 41.4 ± 7.0 44.9 ± 7.0 92.2 ± 7.5
Olmo-3-7B empty-think 74.8 ± 6.5 79.7 ± 6.2 93.9 ± 4.9
Olmo-3-7B masked-think 64.8 ± 6.9 69.3 ± 6.8 93.5 ± 5.4
Olmo-3-7B distillation 21.1 ± 6.2 21.9 ± 6.3 96.4 ± 10.4

Qwen 在 Chemistry 上的最终 VR 也从 empty-think 的 0.0% 提高到 masked-think 的 81.4%、response-only 的 83.0% 和蒸馏的 99.2%。对应最终 pass@1 是 42.8%、45.1% 和 50.8%;正文提到的掩码 44%–47% 与蒸馏约 55% 是峰值表现,附录 Table 4 精确值为 44.1%、46.7% 和 54.9%,不能混为最终结果。

下表来自附录 E.4 的 Table 1,专门诊断 Olmo 最终检查点的截断,仅使用 seed 42。Overflow 是 TR 中耗尽预算的部分,不能再把两列相加。

数据集 / 策略 TR(%) Overflow(%)
Chemistry / no-think 41.8 39.8
GSM8K / no-think 55.1 0.4
GSM8K / distillation 78.9 0.0

关键发现

  • 同样失去轨迹,机制不同。 Qwen、Llama 与 Nemotron 主要变为空轨迹或缺轨迹;Olmo 主要截断。其 GSM8K 蒸馏设置 TR 为 78.9% 而 overflow 为 0.0%,说明增大预算不是通用修复。
  • 结构保留不等于任务能力保留。 Llama 在 GSM8K 的 empty-think 最终 VR 为 100.0%,但 pass@1 为 70.1%,低于 Base 的 85.9%;不能仅据 VR 宣称推理能力完整保存。
  • 坍塌不只发生在 Chemistry。 单种子附录实验中,Qwen3-14B 仍出现标准微调坍塌;Qwen3-8B 在各取 2,674 条的 OrcaMath 与 SelfOSS 上微调时,坍塌往往在对应数学或代码任务更强。它们是针对性稳健性检查,不是完整多种子复现。
  • 种子与子集检查支持趋势,但范围有限。 Qwen 与 Olmo 的 24 个非蒸馏组合中,训练过程 VR 平均绝对种子差不超过 3.1 个百分点,最终差不超过 6.6 个百分点;Qwen 换 GSM8K 子集后 VR 降幅为 34.0 个百分点,原子集为 38.3 个百分点。

亮点与洞察

  • 先问轨迹是否存在,再问轨迹是否可信。 将结构检验作为内容评测的前置条件,可以避免在轨迹已消失时仍把系统称作“保留显式推理”。但这只是必要的协议检查,不能替代忠实性与逐步正确性检验。
  • 训练格式也是实验变量。 空块与省略块都表达缺失,模型却可能作出完全不同反应。实际适配时应将模板、监督区域与模型共同列入验证矩阵,而非只记录学习率和 LoRA 参数。
  • 诊断比单一排行榜更有操作价值。 ER、MR 与 TR 指向不同干预;进一步拆分截断原因,则能判断应调整预算、终止行为,还是数据监督。对于本文场景,损失掩码提供了无需教师调用的低成本起点。

局限与展望

  • 主实验只有四个 7–8B 模型、一个训练领域、非量化 LoRA、两个训练种子与固定 256 条评测子集;不能推广为所有规模、全参数微调、RL 或真实部署流量的发生率。
  • Rpass@1 基于训练后筛选出的有效轨迹集合。集合稳定性检查仅覆盖一个模型任务组合;应进一步在共同题目集合、难度分层与配对样本上比较,以减轻条件选择造成的乐观解释。
  • GPT-5-mini 对各 100 条 Base / Final 的有效 Qwen GSM8K 轨迹分别判为 94% / 92% 正确,但这是小规模模型辅助审计。它不证明语义质量完全不变,更不证明轨迹忠实或因果必要。
  • 解析器依赖聊天模板与格式约定,100 条人工一致性检查不能覆盖所有异常边界。新模型、服务框架、独立推理字段与不规则标签需要额外适配和验证。
  • 较低学习率能延缓坍塌,但也削弱域内适应;单种子学习率扫描不支持宣称某个学习率普遍最优。未来可联合评估结构保留、答案质量、轨迹长度与计算成本。

相关工作与启发

  • 对比 CoT prompting 与 DeepSeek-R1 后训练:它们主要建立或诱发显式推理行为;本文研究已有行为在下游适配后是否还存在。其贡献是保留性评测与诊断,而不是提出更强推理算法。
  • 对比 On the Impact of Fine-Tuning on Chain-of-Thought Reasoning:相关研究讨论微调后的推理表现与忠实性;本文把轨迹缺失、空白和不完整明确拆出,补充一个比语义质量更基础的失效维度。
  • 对比 Distilling Step-by-Step! 与 SCOTT:蒸馏通过添加教师推理提供正向监督;掩码只撤掉诱导空推理的监督。前者需要生成成本且结果依赖模型,后者更轻量但不能教会新的可靠推理。
  • 对比 DSPy 与 LLM Reasoners:这些框架偏向推理流程编排与优化;ThinkPack 关注模型级聊天格式、轨迹解析、统计与掩码,可作为适配实验的基础工具,而非完整服务编排系统。

评分

  • 新颖性: 4/5 — 将结构性轨迹丢失与答案退化分离,明确了容易被忽视的评测盲点。
  • 实验充分度: 3/5 — 多模型、格式、缓解策略及诊断互相支撑,但子集规模与种子数限制外推。
  • 写作质量: 4/5 — 定义及失效类别清楚;阅读时需严格区分正文取整、峰值与最终检查点。
  • 价值: 4/5 — 为低成本适配显式推理模型提供实用验收指标,但不能作为可信推理的认证。