跳转至

Commutator Memory: Sparse, Path-Local Reading and Steering in Language Models

会议: NeurIPS 2026
arXiv: 2609.34348
领域: 优化/理论
关键词: 训练次序、李括号、词元归因、路径依赖、参数记忆

一句话总结

本文把两次训练更新的非交换残差分解为有符号的词元读出,在局部 SGD 条件下定位并干预训练次序差异,Qwen-3-4B 的定向干预使留出损失差距中位数缩小 32.0%,配对终点次序判别达到 66/72 = 91.7%。

研究背景与动机

语言模型后训练通常先后接触多个数据源。即便数据和总训练量完全一致,先训练代码再训练新闻,也不一定等价于反过来训练。原因不只是随机批次:第一次更新改变了模型所处的位置,第二个数据源在新位置上的梯度随之变化。常规做法比较最终损失或基准分数,只知道次序有影响,却不知道这种影响集中在哪些输出上,也难以区分可解释的源间交互与一般数值噪声。

已有工作利用李括号描述两条梯度场的非交换性,并将它投影到评估损失梯度上,预测哪个次序更好。但一个标量仍然不能回答“差距由什么承载”。另一类训练历史研究从激活中检测近期学习痕迹,关注表示中的新近性,而不是两种相同曝光量训练路径之间的反对称差异。本文希望把这个差异变成可定位、可干预、可从配对参数终点读出的对象,而不把它误称为能够检索具体样本的记忆库。

这里的困难在于,可见的稀疏性未必来自训练次序本身:随机参数方向经过同一个 logit 读出,也可能产生重尾分布。因此,论文不仅检查少数词元是否承载大量读出质量,还检查这些词元能否与真实终点差异对齐、换批次后保持稳定,以及定向修改它们是否比频率匹配的近零读出词元更能缩小差距。核心 idea:把两次更新的李括号通过误差加权的 logit 方向导数分解到词表,再用支持集对齐、词元干预和配对终点判别分别检验训练历史残差的可定位性、因果作用与可读性。

方法详解

整体框架

输入包括基座模型、两个指定训练源以及一个留出评估切片。先在基座计算源间的李括号,再在共同一阶参考点上把它读成每个词元的有符号分数。随后以真实训练路径检验预测支持集、定向干预效果和配对终点中的次序痕迹;这些是诊断流程,不是新增的语言模型网络,也不是推理时记忆检索。

论文始终区分两件事:从基座预测训练次序差异,以及取得实际终点之后检查或校正差异。词元图可以在运行两种次序之前计算,但主干预实验的词元符号筛选使用了测得的基线差距;配对终点判别则明确需要两种次序的权重。不能把整套实验合并成只需一个最终模型的通用历史恢复系统。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    I["基座、双源、评估切片"] --> A["局部括号估计"]
    A --> B["误差加权词元读出"]
    B --> C["支持集验证与干预"]
    C --> D["配对终点读出"]
    T["固定批次训练<br/>两种次序"] -.->|提供实测差距与终点| C
    T -.-> D
    D --> O["路径局部诊断报告"]

图中的实线表示诊断处理顺序,虚线表示实际训练产生的验证材料;没有生成时的存储、检索或监督分支。

关键设计

1. 局部括号估计:隔离交换次序才会翻转的残差

设两个源的梯度与 Hessian 均在基座处计算。先在源 A 做一次 SGD,再在源 B 做一次,和反过来的路径共享同一个一阶更新;差异从二阶开始出现。李括号取两种交叉曲率响应之差:A 的更新怎样改变 B 的梯度,减去 B 的更新怎样改变 A 的梯度。交换源名就会翻转方向,因此它描述的是反对称路径残差,而不是某个源的普通学习量。

\[ b_{AB}=H_Bg_A-H_Ag_B,\qquad \theta_{AB}-\theta_{BA}=\eta^2b_{AB}+O(\eta^3). \]

这一身份以及标量次序预测并非本文首次提出。本文继承已有 SGD 结果,新的重点是把残差分解、检验其支持集并实施干预。计算不显式构造 Hessian,而用两个精确 Hessian–向量积;相关计算采用 fp32,不能因为模型以 bf16 存储,就认为二阶测量也可以忽略精度。

共同参考点是 \(\theta_{\rm ref}=\theta_0-\eta(g_A+g_B)\)。在这个位置评估损失梯度,减少共同一阶漂移对读出的污染。理论要求局部损失具有足够光滑性,步长处于经验校准的 BCH 局部窗口:既能让二阶信号越过数值分辨率,又不能让高阶项主导。这个单步展开不是长程训练的精确恒等式,也不能直接套到带动量缓存和步数计数器的 AdamW。

2. 误差加权词元读出:把一个总差距拆成有符号词表坐标

参数方向本身不容易解释。论文先计算模型沿括号方向的 logit 变化,再乘以交叉熵在该词元坐标上的误差,即预测概率减去标签指示。这样,同样大小的 logit 变化只有结合当前预测和真实标签,才能被解释为损失变化;一个词元即使没有作为标签出现,也可能通过预测概率项贡献读出。

\[ \tau_k=\mathbb{E}_{(x,y)\sim E}\!\left[e_k(x,y;\theta_{\rm ref})\, \delta z_k(x;\eta^2b_{AB})\right],\qquad \sum_k\tau_k=\eta^2\langle g_E(\theta_{\rm ref}),b_{AB}\rangle. \]

这里 \(e=\operatorname{softmax}(z)-\operatorname{onehot}(y)\),\(\delta z(x;v)=J_\theta z(x;\theta_{\rm ref})v\)。正分数表示该坐标在括号预测层面对 AB 相对 BA 的损失差距贡献为正;负分数则相反。它是评估切片上的聚合归因,不是对任意一句话单独计算的标签词元 NLL 差,也不是神经回路定位。

上式对真实 Jacobian–向量积严格成立,但实现中的 logit 方向导数来自中心有限差分。精确 HVP 与近似 logit JVP 必须分开理解:前者没有显式 Hessian,后者仍有截断误差。SFT 使用 \(\epsilon=1.0\);修正后的 DPO 恒等式检查使用 \(\epsilon=0.1\)。

\[ \widetilde{\delta z}_\epsilon(v)= \frac{z(\theta_{\rm ref}+\epsilon v)-z(\theta_{\rm ref}-\epsilon v)}{2\epsilon}. \]

因此实验读出只是近似满足解析求和恒等式。个别词元分数还依赖原生 logit 坐标;对所有 logit 加相同的位置偏移时,求和不变,单个归因却不保证不变。这个边界防止把词元图误当作与参数化无关的绝对解释。

3. 支持集验证与干预:区分重尾读出与真正的次序支持

论文按分数绝对值观察集中度,但不把高 Gini 当作特殊性的充分证据。真正的检验是用相同读出算子处理实测终点位移、独立批次重新计算的括号以及范数匹配随机方向,然后比较它们与原始括号的高质量词元支持集。随机方向同样可能稀疏,却不应同样恢复特定源对的支持;这使对照检验针对“来源是否特定”,而不是只针对“曲线是否陡峭”。

因果检验进一步选择十个绝对分数最大、符号与实测基线差距一致的词元。这些“有害词元”是对某次次序差距贡献同向的坐标,并不表示词元内容本身有害。Qwen-3-4B 在源 A 更新时下调这些标签位置的交叉熵权重;其他位置补偿上调,使平均位置权重不变,避免把整体学习率变小误当作定向干预成功。

\[ w_t=\begin{cases}\alpha,&y_t\in\mathcal H,\\ \dfrac{1-p\alpha}{1-p},&y_t\notin\mathcal H, \end{cases}\qquad \mathcal L_{\rm reweighted}=\frac{1}{N_{\rm pos}}\sum_t w_t\ell_t. \]

其中 \(p\) 是目标属于所选词元集的训练位置比例。主实验使用 \(\alpha=0.1\),即所选标签位置仅保留原来的 10% 权重。对照选择标签频率匹配且括号分数接近零的词元,保持干预剂量可比。Qwen-2.5-1.5B 的小信号实验则采用输出层对应行的学习率缩放,减少经隐状态通路放大的噪声,不能与前一模型的效果量直接横比。

闭合率衡量的是两种次序的差距是否减小,而不是两个模型的绝对损失是否都改善。它上界为 1,负值没有下界;基线差距接近数值噪声时,分母会使该比例剧烈波动。

\[ C=1-\frac{|\Delta_{\rm edited}|}{|\Delta_{\rm baseline}|},\qquad \Delta_{\rm baseline}=\mathcal L_E(\theta_{AB})-\mathcal L_E(\theta_{BA}). \]

4. 配对终点读出:消去共同漂移后判断次序

单独把一个终点相对参考点的位移投影到括号上,会混入两条路径共有的二阶对称项。即便理论上反对称分量存在,两种终点的单点分数仍可能同号。论文因此使用两个实际终点的差,而不是把单模型分数强行推广到所有尺度。

\[ \Delta s=\langle\theta_{AB}-\theta_{BA},b_{AB}\rangle =\eta^2\|b_{AB}\|^2+O(\eta^3\|b_{AB}\|). \]

当首个终点确实来自 AB,这个统计量的主导项为正;交换终点呈现顺序后变负。配对相减消除了共同漂移,所以在主导项超过有限步长、抽样和数值误差的局部条件下,可以给两端分配次序。它需要基座、候选双源及两个备选次序终点,不能被解释为从未知单一模型恢复完整训练历史。

一个完整示例

以代码与新闻这对源为例,诊断先在基座上形成两个交叉 HVP 的差,再在留出切片上生成词元图。不同参考点和评估切片可以使表面词元不同:主解释实验偏向专名和领域标记,另一个基座参考读出则出现代码语法标记。因此不能跨这两个协议逐词核对“是否一致”。

在指定 Qwen-3-4B 干预协议中,使用十个与基线差距同向的高分词元,重加权后重新训练并比较留出差距,得到 32.0% 的中位闭合率。这个数值说明该修改产生了有效的因果影响,不说明这些词元精确解释了 32.0% 的原始差距,更不说明剩余部分是某个独立的高阶机制。论文另测得修改后的领先括号预测仍为原差距的 71%,但它与闭合率中位数使用不同聚合方式,不能相减拼成成分分解。

损失函数 / 训练策略

主实验是固定双源路径上的 SFT,覆盖 The Pile 的 code、news、math、legal、biomedical 和 wikipedia;序列长度为 512。支持集实验使用全部 15 个源对、每对三个种子,主要干预使用三个固定源对、每对三十个种子。配对次序判别是每源单步 SGD 的六个源对、每对三个种子,而不是全部长程训练轨迹。

匹配路径的参数校正遵循 \(\theta_{AB}-\eta^2b_{AB}=\theta_{BA}+O(\eta^3)\)。它旨在逼近反向次序终点;迭代版本每轮重新估计括号,并用已观察到的反向终点确定投影步长,所以约 90% 的迭代闭合不是无需目标终点的预测成绩。另一个在共同参考点构造的 bracket-only 更新有条件地优于两种次序:对称漂移必须提高目标损失,且括号投影的符号必须估计正确,不能写成无条件训练改进保证。

DPO 将不同偏好数据来源作为独立双源,不把同一偏好损失的 chosen/rejected 两部分当成两个独立源。GRPO-style 扩展固定两种次序共享的 rollout,使用解析奖励和 KL 正则代理,且测试中裁剪未激活。这不是在线 GRPO 的普适结果。AdamW 则在参数、动量、二阶矩及计数器的增广状态上重放更新,固定时钟下次序效应可从步长一阶开始,不能沿用 SGD 的二阶括号缩放。

实验关键数据

主实验

下表来自论文表 3。闭合率及其置信区间均按百分比表示;均值是 5/95 缩尾均值,区间不是中位数区间。Qwen-3-4B 使用全部 90 次留出评估试验;Qwen-2.5-1.5B 仅保留预先指定的 28/90 次高于 \(10^{-4}\) 分母阈值的 fp32 试验。

模型与协议 词元集 中位闭合率 缩尾均值 均值 95% CI 差距缩小次数
Qwen-3-4B,损失重加权 高分同向词元 +32.0% +31.2% [+21.4%, +39.7%] 68/90
Qwen-3-4B,损失重加权 频率匹配近零分数 +0.2% +1.2% [−5.8%, +8.7%] 45/90
Qwen-2.5-1.5B,输出行学习率缩放 高分同向词元 +47.9% +48.6% [+40.5%, +57.1%] 27/28
Qwen-2.5-1.5B,输出行学习率缩放 频率匹配近零分数 −0.003% −0.006% [−0.03%, +0.02%] 11/28

配对终点判别是独立的可读性测试。论文表 4 每个模型使用 18 个源对–种子单元,每个模型只计一次;机会水平为 50%。

模型与精度 正确分配次序 Wilson 95% CI
Llama-3.2-1B,fp32 14/18 = 77.8% [55%, 91%]
Qwen-2.5-1.5B,fp32 16/18 = 88.9% [67%, 97%]
Qwen-3-4B,bf16 18/18 = 100.0% [82%, 100%]
Llama-3.1-8B,bf16 18/18 = 100.0% [82%, 100%]
合计 66/72 = 91.7% [83%, 96%]

消融实验

下表来自表 2 和附录 R 的 fp32 对照子集,每模型三个源对、每对三个种子。两个支持集重合列都表示与原括号 top-20 的重合,不是直接比较不同模型的词表。

模型 承载 80% 绝对读出质量的词表比例,均值/中位数 实测终点位移支持重合 独立批次括号支持重合 范数匹配随机方向重合
Llama-3.2-1B 1.47% / 1.47% 99% 97% 35%
Qwen-2.5-1.5B 0.99% / 1.16% 99% 97% 39–40%
Qwen-3-4B 0.30% / 0.042% 82% 93% 36–49%

两个 HVP 项都参与有效归因:Qwen-3-4B 用完整括号选择干预词元时,配对比较的 Cohen 效应量为 \(d=0.53\),只用 \(H_Bg_A\) 时为 \(d=0.25\)。这比仅展示集中度更直接地说明,交叉响应之差不是可以随意删掉一半的形式包装。

关键发现

  • 稀疏不等于特殊。较小模型的随机方向甚至可以比括号更集中,关键证据是实际终点和重采样括号的支持重合明显高于同读出算子的随机对照。
  • 配对读出明显强于单终点读出。单终点方法仅在 Qwen-3-4B 达到 77.8%,在其余三个模型接近机会水平;主结果的 91.7% 不能写成普遍的单模型次序识别率。
  • 匹配批次 DPO 的原始 180 次试验中,中位差距闭合为 77.0%。合并原始与新源对后,12/12 个源对的括号减随机闭合差中位数为正,11/12 通过逐试验 bootstrap 严格区间检查;源对共享数据来源,不能把 316/360 次同向结果当作独立样本显著性检验。
  • 冻结匹配 rollout 代理的单步损失闭合中位数为 0.805,换成不匹配 rollout 的括号则为 −0.158。路径匹配不是可忽略的实施细节,而是正结果与负对照的分界。
  • 第三域继续训练后,20 次运行中仍保留同向痕迹的数量从四步后的 15 次降到八步后的 14 次、十六步后的 13 次。最初同向的 18 次运行,其保留比例中位数约从 27% 降到 14%、7%,并有部分符号反转。

亮点与洞察

  • 将“哪个次序好”推进为“次序差异落在哪里”。词元图与总括号预测相连,避免另训练一个没有机制约束的解释器;但词元坐标仍依赖模型和评估切片。
  • 对照针对真正的混淆因素。随机方向共享同一个 logit 读出,频率匹配干预控制常见词元效应,使稀疏支持与因果作用的证据比单个高 Gini 更可信。
  • 配对相减是一种可复用的实验设计。它去掉两条路径共有的漂移,再检测交换次序才翻转的量,比直接把单终点投影符号当历史标签稳健。

局限与展望

  • 理论对象是局部双源 SGD 残差,实验更新数和参数子空间受限。支持集多步持续不代表全词表排序或差距幅度在长程训练中仍精确。
  • 闭合率不是绝对性能收益,论文没有据此证明 GSM8K exact match 或 HumanEval pass@1 普遍改善。小分母、数值精度和阈值筛选必须与效果量一起报告。
  • 部分干预依赖已测得的差距符号,迭代校正需要反向终点,DPO 校正需要匹配批次,奖励代理需要冻结匹配 rollout;目前是受控诊断证据,不是直接可部署的通用更新工具。
  • 输出稀疏不能自动证明整个参数向量稀疏。附录的可观测/零空间估计只覆盖指定参数子空间,且有阻尼、未完全收敛的共轭梯度与 bf16 舍入误差。
  • 后续可研究低成本曲率近似是否保留次序符号和高质量支持,并设计无需观察反向终点的校正验证。跨优化器研究必须纳入状态与时钟,而不是直接移植 SGD 式子。

相关工作与启发

  • vs 标量李括号次序预测:既有工作提供终点二阶身份和目标梯度投影;本文主要增加词元分解、因果干预与配对终点读出,应把继承机制和新增贡献分开评价。
  • vs 激活新近性探针:前者检测哪些知识更近期,本文检测指定源对交换次序的反对称参数残差。两者都研究训练历史,但访问条件和解释对象不同。
  • vs 样本影响归因与机制归因:影响函数、TRAK 等归因到训练样本,回路解释定位内部结构;本文归因到输出词元,并只针对训练路径交互,不承诺样本来源恢复。
  • vs EWC、GEM、PCGrad 与模型编辑:这些方法缓解遗忘、处理梯度冲突或改变知识,本文首先测量组合更新的非交换性。可借鉴其配对控制思路检查正常后训练交互,但不能把 NLL 差距闭合等同于保持所有能力。

评分

  • 新颖性: 4/5。核心二阶身份来自前作,但词元级读出、对照与配对可读性构成清晰的新问题。
  • 实验充分度: 4/5。多模型、多种对照与负结果较完整,仍受局部路径、阈值和小种子簇限制。
  • 写作质量: 4/5。明确区分继承结果、有限差分与匹配条件,附录协议较多,阅读负担偏高。
  • 价值: 4/5。提供后训练次序交互的可解释诊断框架,部署收益与长程有效性尚待验证。