跳转至

Deep Minds and Shallow Probes

会议: NeurIPS2026
arXiv: 2605.11448
领域: 可解释性
关键词: 仿射不变性、多项式探针、低秩张量、探针可见商空间、跨模型迁移

一句话总结

本文从最终读出层的坐标对称性推导浅层探针的多项式层级,并以低秩 CP 探针读取交互概念、以探针可见商空间迁移概念读出,在跨 token 一致性任务上获得 16.8–20.0 个百分点的 AUROC 提升,同时明确区分迁移准确率与概念覆盖。

研究背景与动机

探针是在冻结的神经表示上训练的小型预测器:它的成功通常被用来说明表示中包含某种可读出的属性。线性探针易训练、容量有限,但只能读取线性可分结构;直接换成强大的非线性网络,又可能把任务求解能力引入探针本身。真正需要回答的不是“非线性是否更强”,而是哪些非线性读出仍能支持有关原表示的可信结论。

另一个困难来自坐标的不唯一性。两个模型即便实现同样的输出计算,也未必使用同样的隐藏坐标。如果一种探针限制只在某个基底下成立,那么它的成败可能反映坐标选择,而非概念是否存在。作者从最终线性或仿射读出层出发,在非退化条件下刻画这种坐标自由度,再要求探针函数族能随坐标变化保持可表达的分数。这个要求针对函数族,不要求训练好的参数保持不变。

跨模型迁移也面临类似问题:完整隐藏状态含有大量与监测概念无关的方向,强行重建它们不一定是必要目标。本文把“浅”形式化为有限维线性分数空间,把“共享”形式化为相同概念函数族,而不是把架构相似或有限测试集上的输出相似当作充分条件。核心 idea:用表示对称性约束探针函数族,用探针能看见的商空间约束迁移对象,从而同时讨论读出容量、坐标稳定性和覆盖边界。

方法详解

整体框架

论文有两条相互关联但不同的论证线:第一条从最终读出层的等价性得到仿射坐标变换,再分类满足精确仿射闭包的浅层分数空间;第二条从共享的线性概念族得到探针可见商空间,并把这一抽象对象实现为探针权重矩阵的 SVD 坐标。前者解释为什么选择多项式及低秩交互,后者解释迁移时究竟应保留什么。

实际读取交互概念时,先用源概念标签训练原始线性探针,再在它们的低维分数上训练二次组合头。实际迁移时,先由源探针库确定可见方向,再用两个模型处理同一输入得到的无标签配对激活,拟合目标隐藏状态到源商坐标的映射;推理只需目标激活、这个映射和源读出参数。

这些理论对象不是神经网络模块序列,因此不把定理清单画成网络结构图。尤其要区分概念探针的有监督训练与迁移映射的无目标标签拟合:后者仍需要配对输入和双方激活,也仍依赖前者已经使用过源概念标签。

关键设计

1. 仿射稳定的分数空间:把坐标自由度变成函数族约束

在线性读出情形,两个模型的隐藏维度相同、源表示张成整个空间、两套读出矩阵均满列秩,并且对比较域中每个输入给出完全相同的输出分数时,定理 2.1 得到唯一的可逆线性隐藏坐标变换。带偏置的读出可以通过附加常数坐标处理,于相应非退化条件下允许隐藏空间平移。softmax 概率相同则还允许所有类别共享的 logit 偏移,不能与隐藏状态平移混为一谈。结论锚定最终读出接口,不自动涵盖不同维度的完整隐藏空间或任意中间层。

换坐标后,探针参数应该一起变化,使同一输入的分数不变。因此作者要求分数函数族在所有可逆仿射映射的预复合下封闭。定理 2.3 的准确量词是:连续实值函数构成的有限维线性子空间,若对完整仿射群精确封闭,就只能是零空间或某个完整的有界次数多项式空间。

\[ V\subset C(\mathbb{R}^{n}),\quad \dim V<\infty,\quad f\in V,\ g\in\operatorname{Aff}(n)\Rightarrow f\circ g\in V \quad\Longrightarrow\quad V=\{0\}\ \text{or}\ V=\mathcal{P}_{\leq\ell}(\mathbb{R}^{n}),\qquad \ell\geq 0. \]

这里“线性空间”是指函数之间可以线性组合,不是说每个函数都是线性的;次数 0 包含常数,次数 1 包含带截距的线性分数。证明先由平移闭包得到光滑性和导数闭包,再由伸缩排除非零指数模式,最后利用一般线性群补齐最高次数的全部齐次多项式,并通过求导补齐低阶项。它解释的是整个层级为什么完整,而不只是证明多项式可以使用。

这个定理不意味着任意有限参数 MLP 都是多项式:有限参数的非线性函数族一般不是有限维线性函数空间。它也没有证明在有限样本上近似封闭就必然近似多项式。向量值推论仅保证各输出坐标有统一次数上界,不保证包含所有可能的输出方向;对分类而言,被分类的是连续分数,不是阈值化后的不连续标签或 sigmoid 概率。

2. 仿射补全 CP 探针:用低秩交互压缩二次读出

完整多项式的系数数目随维度和次数迅速增长,完整二次探针在语言模型隐藏空间尤其昂贵。CP(Canonical Polyadic)探针把高阶项写成少量线性形式乘积之和。可逆线性变换只需变换各因子向量,因此保持给定的秩上界;反之,少量非零单项式经坐标混合会展开成大量项,单项式稀疏性没有同样的几何稳定性。

齐次 CP 本身只保证一般线性群下的稳定性。平移会产生低阶项,因此作者使用带因子偏置、并补充全部必要低阶项的形式;实验中的二次版本是:

\[ f(h)=\sum_{r=1}^{R}\alpha_r\bigl(\langle u_r,h\rangle+a_r\bigr)\bigl(\langle v_r,h\rangle+b_r\bigr)+\langle w,h\rangle+c. \]

两个仿射因子的乘积承载交互,末尾的线性项和常数承载仿射补全。这个固定秩结构族不是定理 2.3 所分类的完整线性函数空间,而是其中一个对坐标变换稳定的结构化子族;不同低秩函数相加时可能需要更高秩。因此“完整空间的分类”与“低秩子族的压缩”并不矛盾,也不能把 CP 秩 1 当作所有二次概念的充分表达形式。

跨 token 实验先对 Universal Dependencies English-EWT 的词性、数、时态、标点和依存关系训练 30 个原始探针,把主语与动词的分数拼成 60 维输入,再拟合组合头。数特征之间的乘积能够表达一致性,而简单线性求和难以表达这一关系。两个类别都采用跨句配对以减弱句子身份混淆。分数来自线性探针,所以二次分数组合仍是原始拼接隐藏状态上的二次函数,但 60 维组合比直接处理完整激活更可控。

3. 探针可见商空间:只对齐概念库实际读取的方向

给定隐藏空间和线性探针空间,把所有探针共同无法响应的方向合并为不可见子空间。两个隐藏向量若只相差不可见方向,就对整个探针库给出相同分数,应该视为同一可读出状态。这不是 PCA 的最大方差压缩,而是由已训练概念读出定义的任务相关压缩。

\[ K(V)=\bigcap_{\ell\in V}\ker\ell,\qquad Z(V)=H/K(V),\qquad \mathcal{C}_i=\{\ell\circ h_i:\ell\in V_i\}. \]

定理 3.3 要求两个模型实现相同的有限维概念函数族,且评价映射把不同探针映到不同概念,即没有非零探针在所有被表示输入上恒为零。在这些条件下,两套商空间都规范同构于共同概念族的对偶空间。隐藏维度可以不同,因为需要共享的是可见概念,不是整个隐藏状态。

\[ \mathcal{C}_1=\mathcal{C}_2=\mathcal{C},\quad E_i:\ell\mapsto\ell\circ h_i\ \text{injective} \quad\Longrightarrow\quad H_1/K(V_1)\cong\mathcal{C}^{*}\cong H_2/K(V_2). \]

这个“共享”的假设比输出行为相似具体得多:仅有行为一致,不会替任意选定的探针库自动建立概念族相等。证明把隐藏向量理解为对概念的评价,核恰好是不可见子空间,因此除去核后得到共同评价空间;“规范”也不意味着实际 SVD 基底唯一。

实现时把源线性探针权重逐行堆成矩阵,保留足够大的右奇异方向,以它们的转置作为商坐标映射。截距单独保留,实际数据用训练均值中心化;源权重矩阵的核描述的是中心化表示中的方向,而不是要求各探针截距为零。

\[ W=U\Sigma R^{\top},\qquad Q=R_k^{\top},\qquad k=\#\{j:\sigma_j>10^{-3}\sigma_1\},\qquad z=Qh. \]

数值阈值意味着实际保留的是截断商空间,而非精确保留所有非零方向。目标侧无需先训练同一批带标签的探针:附录 E.5 的实现直接以目标完整激活预测源商坐标。这与理想定理中的双侧商空间同构有关,但不能把实验写成“双方探针库都已由目标标签训练”。

4. 覆盖与条件数诊断:把可迁移性从单一准确率中拆出来

商空间迁移利用训练划分上的配对激活拟合 Ridge 映射,再把源概念读出拉回到目标空间。若新概念方向位于探针库张成空间内,它可以通过商坐标表达;若大量方向被投影掉,迁移失败可能是覆盖不足而非对齐算法没有找到参数。作者用 in-span fraction(ISF)衡量源概念权重在源可见空间内的平方范数占比。

\[ \operatorname{ISF}(w)=\frac{\|Qw\|_2^2}{\|w\|_2^2},\qquad w\neq 0. \]

ISF 无需目标标签,但需要已有的源概念方向。它是固定坐标及欧氏度量下的几何覆盖量,不是语义正确性的证书。真实数据中,库内概念的相关性可能使低 ISF 概念仍被预测出来,也可能使中等 ISF 没有对应的有效判别信号;因而不应写成“ISF 低必然不能分类”。覆盖不足时主动弃用某个迁移监测器,是基于信息边界的保守决策,不等于证明原模型完全不含该概念。

附录 C.1 的误差界由概念族分数失配除以源探针库最小可见奇异值控制;它是给定分数匹配条件的坐标误差界,不是自动保证有限样本 Ridge 泛化或目标 AUROC 的定理。附录 C.3 进一步说明双侧探针库条件数会影响诱导迁移映射的稳定性,而分类一致还需要源分数具有足够间隔。

探针数量也不能代替覆盖质量。受控冗余实验中,替换独立方向会缩小有效可见空间并降低迁移表现;仅追加接近重复的方向时,SVD 阈值可把它们丢弃,表现不变。阈值化和 Ridge 能吸收部分数值病态,所以应同时看有效维度、奇异谱和概念多样性,不能只按条件数大小排序探针库。

一个完整示例

考虑合成迁移实验:共享潜在概念维度为 8,源隐藏维度为 64,目标为 128,双方还各自加入独立干扰和观测噪声。源端用 5 个原始概念标签训练探针,它们通常产生 5 维可见空间;随后用 5,000 对没有目标标签的激活学习目标到源商坐标的映射。

留出的一个概念是原始 5 个方向的线性组合,另一个与这些潜在方向正交。对前者,源读出仍能在商坐标里表达;对后者,商投影丢掉它所依赖的方向,得到接近随机的分类表现。即便完整状态 OLS 准确迁移后者,也只能说明完整激活映射保留了更广的信息,不能证明这 5 个探针直接覆盖了该概念。

表 2 中干扰维度从 0 增至 56 时,商空间库内概念 balanced accuracy 从 0.997 变为 0.991,库外概念从 0.484 变为 0.519;完整状态 OLS 的库外表现仍为 0.995 和 0.989。这里展示的是选择性及覆盖透明度与更广迁移之间的取舍,不是完整状态 OLS 的准确率失败。

损失函数 / 训练策略

  • 基础分类探针使用带截距的 logistic regression,C=1.0、max_iter=5000;模型激活冻结,测试和验证中心化使用训练均值。
  • CP 分类头优化二元交叉熵,使用 L-BFGS 和 strong-Wolfe 线搜索,按实验进行 30–50 次随机重启,以验证 AUROC 选择结果。合成回归 CP 使用平方误差和 Adam,学习率为 \(10^{-3}\),最多 500 epochs、patience 30,并使用 2–3 次重启。
  • 商坐标对齐采用 multi-output Ridge,正则系数为 \(10^{-4}\)。训练划分用于无标签配对对齐,目标标签只用于与对齐数据不相交的测试评估;“零标签”准确含义是零目标标签。
  • 多数实验使用 5 个种子;跨 token 主表明确报告 10 次重采样的均值与标准差,监测迁移表报告 bootstrap 区间半宽。不能把不同表的误差条统称为同一种统计量。

实验关键数据

主实验

表 1:跨 token 主语—动词数一致性,AUROC。 原文表 1;60 维原始探针分数空间,均值与标准差来自 10 次重采样。提升为 CP-1 相对线性组合头的 AUROC 百分点差,不是准确率提升。

模型 线性头 完整二次头 CP-1 CP-1 提升
Pythia-70m 0.733 ± 0.005 0.819 ± 0.013 0.901 ± 0.004 16.8 pp
Pythia-160m 0.740 ± 0.003 0.855 ± 0.007 0.930 ± 0.002 19.0 pp
Pythia-410m 0.755 ± 0.004 0.872 ± 0.011 0.955 ± 0.003 20.0 pp

完整二次头比线性头强,却不如秩 1 结构。附录表 21 中三种规模的完整二次训练—测试差为 0.176、0.145、0.128,而 CP-1 分别为 0.026、0.029、0.012,支持容量过拟合的解释,但不是对优化原因的严格因果证明。

表 2:跨模型监测迁移的选定概念,AUROC。 取自原文表 3,仅保留一般情感和聚合内容审核任务;源为 Qwen-2.5-7B-Instruct,使用 11 个探针的库,条件数约 5.8。目标数值的 ± 为 95% bootstrap 区间半宽,源值是源模型内表现。

概念 源模型 Qwen-3B Qwen-14B Qwen-Coder Mistral 随机初始化
情感 0.975 0.966 ± 0.01 0.974 ± 0.01 0.967 ± 0.01 0.972 ± 0.01 0.511 ± 0.04
内容审核 0.890 0.836 ± 0.05 0.857 ± 0.04 0.867 ± 0.04 0.820 ± 0.05 0.512 ± 0.07

跨架构结果说明部分概念具有可携带性,不说明整个概念库同样可靠。原文完整表 3 的五个核心概念在 Mistral 上范围为 0.669–0.972,最弱方向仍需额外验证。随机初始化控制在多数概念上接近随机,但并非所有指标完全等于 0.5。

消融实验

表 3:合成迁移中干扰维度的影响,balanced accuracy。 原文表 2;共享潜变量 8 维、源/目标 64/128 维,5 个种子的均值与标准差。库内与库外指相对于源原始探针的概念张成空间。

对齐方法 库内,干扰 0 库内,干扰 56 库外,干扰 0 库外,干扰 56
商空间 Ridge 0.997 ± 0.002 0.991 ± 0.004 0.484 ± 0.020 0.519 ± 0.023
完整状态 OLS 0.996 ± 0.001 0.990 ± 0.003 0.995 ± 0.001 0.989 ± 0.006
PCA 投影 0.996 ± 0.001 0.573 ± 0.036 0.996 ± 0.001 0.585 ± 0.022
随机投影 0.927 ± 0.029 0.574 ± 0.018 0.903 ± 0.065 0.567 ± 0.027

商空间对库内概念稳定,PCA 则受高方差干扰影响;完整状态 OLS 在两类概念上都准确,缺少的是探针库覆盖诊断。商空间库外近随机是投影的预期结果,不等于系统执行了一个经过验证的自动拒绝协议。

关键发现

  • 坐标稳定性与学习算法稳定性不同:附录 F.2 不重训的完整二次解析迁移最大分数误差为 \(1.14\times10^{-11}\);同一变换下固定原 50 个单项式槽位的稀疏探针 \(R^2=-18.3\pm3.5\)。这里隔离的是函数族闭包,不是所有稀疏模型都无法重新训练。
  • 对齐文本必须激活相关概念:附录表 27 中,只用 SST-2 对齐时情感 AUROC 为 0.966,而两个聚合安全概念只有 0.596 和 0.523。无目标标签并不意味着任意无标签文本都足够。
  • 受控冗余替换中,Qwen-3B 的均值 AUROC 从 0.897 降至 0.855;追加重复方向则保持 0.897。有效可见方向被替换,比探针数增加本身更值得警惕。
  • 多项式次数、精确标签表达次数和多项式阈值判别次数不能混用。附录 F.1 明确指出 AND、三路 AND 与多数表决的阈值判别次数为 1,不能因为标签的乘积写法含高次项就断言必须使用高次分类头。

亮点与洞察

  • 探针失败不再只有“模型没有概念”一种解释。还应区分函数族容量不足、坐标依赖限制、探针库覆盖不足和迁移失配,避免用一个准确率把它们混在一起。
  • 低秩不是随意压缩参数,而是通过线性形式组织交互。只要补齐低阶项,坐标变化可以由因子参数吸收,比固定单项式槽位更符合读出对称性。
  • 商空间保留的是概念库承诺读取的信息,不是模型所有信息。与完整状态迁移比较时,覆盖透明度和任务准确率应作为不同目标评价。

局限与展望

  • 理论的精确仿射对称性来自最终读出层及非退化假设,中间层可能只有更弱或近似的对称性。本文没有证明所有层都适用同一个完整仿射群。
  • 理论分类要求连续标量分数、有限维线性空间和精确闭包。近似闭包、有限数据拟合以及特定神经探针结构需要额外分析,不能直接套定理结论。
  • ISF 是源权重的几何重叠,且依赖所选欧氏坐标;任意非正交变换下它不必数值不变。它不能替代语义覆盖、分布外鲁棒性或目标侧验证。
  • 跨模型迁移依赖源标签和足够覆盖相关方向的无标签配对激活。不同探针库、中心化策略和对齐样本去重会影响结果,不能把不同附录配置的数值视为同一实验重复。
  • 原文统计说明存在差异:表 1 标注 10 次重采样,表 3 标注 bootstrap 区间半宽,checklist 却概括表 1–4 为 5 种子标准差。本笔记采用各表图注的具体口径,并保留这一不一致。
  • 高层聚合监测及行为评估只提供实验范围内的部分迁移证据,不构成部署保证。可继续研究数据度量下的覆盖诊断、带不确定性校准的弃用规则,以及覆盖与条件数联合优化的探针库。

相关工作与启发

  • vs 线性探针与控制任务:线性探针强调读出容量受限,控制任务检验探针是否自行学会任务;本文增加坐标稳定性标准,两者互补,后者不能替代前者。
  • vs structural probes:已有句法结构探针使用二次几何,本文给出从仿射对称性到完整次数层级的解释,并以仿射补全低秩结构控制交互读出成本。
  • vs model stitching 与表示相似性:完整激活对齐问隐藏状态能否对应,本文问给定概念族能否在共同可见空间中对应。PCA 按方差选方向,商空间按探针权重选方向,服务的目标不同。
  • 研究线索:在保持已有源概念覆盖的前提下,按可见奇异谱和增量方向增益选择新探针,并跨域检验 ISF 的稳定性。这是由附录 C 和冗余消融启发的后续想法,不是本文已经验证的算法。

评分

  • 新颖性: 5/5 — 把探针族分类和跨模型可见空间统一到表示几何问题中。
  • 实验充分度: 4/5 — 合成、语言交互和跨模型实验相互补充,但覆盖诊断仍有现实例外。
  • 写作质量: 4/5 — 定理与实验的联系清楚,部分统计口径与配置说明需要仔细区分。
  • 价值: 5/5 — 为选择非线性探针及解释迁移失败提供了可复用的边界框架。