跳转至

Parameter symmetries determine representational geometry in overparameterized nonlinear networks

会议: NeurIPS2026
arXiv: 2609.39078
代码: https://github.com/mrvnthss/symmetries-representational-geometry
领域: 可解释性
关键词: 参数对称性、表征几何、过参数化、对称轨道、最小范数选择

一句话总结

本文在一隐层非线性网络中,将保持全局函数不变的参数对称性归结为特征添加、复制与缩放,证明它们可以显著改变表征几何,并给出最小范数选择恢复几何可辨识性的充分条件。

阅读版本为 arXiv v1,日期为 2026-09-30;会议字段沿用任务清单归档,缓存本身不提供独立的录用声明。

研究背景与动机

表征相似性分析常把一组输入引发的隐藏活动组织成相似度矩阵,再通过模型之间或模型与脑数据之间的相似性推断计算机制。 问题在于,相似度矩阵只看隐藏活动,而网络输出还依赖读出权重:一个神经元可以活动很强,却完全不参与输出;同一个计算也可以由不同数量、不同尺度的神经元承担。 因此,即便网络在整个输入域上实现完全相同的函数,它们的隐藏几何也未必接近。 已有深线性网络分析展示了函数与表征的双重分离,但非线性网络拥有激活边界及激活函数特有的代数对称性,不能直接照搬线性结论。

单纯指出“参数不唯一”还不够:神经元置换虽然改变参数,却不会改变隐藏活动的 Gram 矩阵。 真正需要分析的是哪些函数保持变换改变几何、哪些特征必须保留、额外宽度能增加多少几何自由度,以及什么约束能把这些自由度消掉。 本文围绕一个可严格分析的一隐层模型回答这些问题,避免把有限样本上预测一致误当成全局函数等价,也避免把某一种相似性度量的失效泛化为所有解释方法的失效。

作者采用的切入点是参数对称轨道:先锁定一组函数保持变换能连接起来的实现,再分析该轨道内部的隐藏特征与几何。 这样既能建立精确的反例,也能说明恢复可辨识性所需的实现约束。 核心 idea:表征几何的歧义来自特征的添加与重新加权;只有同时约束特征生成成本和读出成本,并消除剩余的方向分配自由度,函数才可能在给定对称轨道内识别唯一几何。

方法详解

整体框架

分析对象是全连接的一隐层网络,隐藏神经元具有输入权重与偏置,输出为这些神经元活动的线性组合。 给定同一组探测输入,将神经元活动按“神经元 × 输入”排列为隐藏活动矩阵 \(\mathbf H\),并以未中心化 Gram 矩阵 \(\mathbf M=\mathbf H^\top\mathbf H\) 描述表征几何。 这里每一个神经元贡献一个秩一矩阵,因此改变特征种类、复制数量或幅度,都能直接改变几何。

论文的论证依次建立轨道不变量、特征原语、必要与辅助几何分解,以及最小范数选择规则。 主文的宽度增长和范数选择结果针对非线性的正一阶齐次激活;附录将对称分类与特征结构扩展到其他激活类型。 这是机制与定理分析,不是多模块训练系统,因此不把证明目录画成网络流水线。

“函数保持”要求整个输入域上的输出相同,不只是训练样本上的标签相同。 “不可约”指在所列对称性生成的轨道中已经达到最小宽度;“过参数化”指同一轨道存在更窄实现,并非一般意义上的参数量超过样本数。 此外,轨道不等于所有实现同一函数的参数集合:论文明确不声称所列对称性穷尽整个函数纤维。

关键设计

1. 轨道不变量:按激活边界聚合计算贡献

对 ReLU 等非线性正一阶齐次激活,作者利用 \(\sigma(z)=\delta|z|+mz\),其中 \(\delta\neq0\),把神经元输出拆成非线性部分与仿射部分。 将输入权重和偏置合并为 \(\overline{\mathbf w}_j\) 后,同一向量的任意非零倍数对应同一个激活超平面,归入参数类 \(q\)。 同类所有神经元的有效读出聚合为 \(\boldsymbol\beta_q=\sum_{j\in\mathcal J_q}\|\overline{\mathbf w}_j\|\mathbf a_j\);它保留了该边界对应的非线性计算贡献,却不保留每个副本的尺度与分工。 其余仿射贡献与常数神经元的输出合并为全局残差 \(\mathbf r\)。

命题 3.3 的必要充分条件是:两个实现使用相同激活,并且每个参数类的聚合系数与全局残差都相同,才属于同一对称轨道;未出现的类按零系数处理。 系数非零的类称为必要参数类,它在轨道内不能完全消失。 但“必要类”不意味着某一个朝向的 ReLU 特征固定不变:相反朝向可以通过激活相关的群变换和跨群残差抵消互相替换。 附录 B.15 用按激活类型调整后的参数类与系数,将这一判据扩展到其他非线性激活。

这个判据的证明不是诉诸抽象的不唯一性:充分性方向构造由目标网络和原网络读出取负副本组成的辅助实现。 不变量一致保证辅助实现的非线性贡献及总残差抵消;加入它后,再移除原神经元与其抵消副本,就留下目标实现。 对于线性群或常数群,只有总残差抵消时联合操作才保持函数,不能把每个群的添加都独立视为对称变换。

2. 特征原语:把参数变化变成几何的添加与加权

忽略不影响 Gram 矩阵的行置换,所列参数对称性对隐藏活动的作用都由三类原语及其逆操作组成。 添加在活动矩阵中追加行,复制重复已有行,缩放乘以非零标量。 例如复制一个神经元并拆分其读出,输出保持不变,但同一特征的秩一几何贡献被重复累计;ReLU 的输入参数放大与读出缩小互相补偿,则能在固定宽度下改变该贡献的连续权重。 奇激活的符号翻转只会改变特征符号,其秩一 Gram 贡献不变,因此并非每种缩放都产生几何变化。

命题 4.2 表明,每个正一阶齐次轨道实现都保留每个必要类的至少一个朝向,再加上来自非必要类与常数神经元的特征,随后经过复制与正缩放。 将这一结构代入 Gram 矩阵,命题 5.1 得到必要与辅助两部分:

\[ \mathbf M= \underbrace{\sum_{\ell=1}^{|\mathcal I|}\gamma_\ell\mathbf f_\ell\mathbf f_\ell^\top}_{\text{essential}} + \underbrace{\sum_{k=1}^{K}\gamma_{|\mathcal I|+k}\mathbf u_k\mathbf u_k^\top}_{\text{auxiliary}}, \qquad \boldsymbol\gamma=\mathbf D_{\boldsymbol\nu}^\top\boldsymbol\alpha^2. \]

其中 \(\mathcal I\) 指已出现的必要类朝向,\(\mathbf D_{\boldsymbol\nu}\) 记录复制次数,\(\boldsymbol\alpha^2\) 表示逐元素平方。 对已实现的特征配置,正一阶齐次对称性允许在特征、复制次数和宽度不变的情况下,把这些几何权重设为任意严格正值。 不具备该缩放对称性的激活仍可以通过复制改变整数权重,但不能据此套用任意连续加权结论。 “辅助”也不等于可逐个删除:其中一些神经元可能承担守恒残差,删除它们需要其他群同时补偿。

3. 宽度增长与极限:相似度范围由激活和探测输入决定

论文以两个 RSM 的严格上三角条目之间的 Pearson 相关 \(\rho\) 比较几何,要求双方这些条目都不是常数。 给定参考矩阵 \(\mathbf N\),固定宽度的可达相关集合为 \(\mathcal S_{N_h}(\mathbf N)\),其跨度定义为 \(\Delta_{N_h}=\sup\mathcal S_{N_h}-\inf\mathcal S_{N_h}\);所有宽度的对应跨度为 \(\Delta_\infty\)。 命题 5.2 不只是说明增加神经元“可能”增加自由度:对正一阶齐次激活,只要尚未达到轨道极限,每增加一个隐藏神经元,相关跨度就严格增大。

证明关键是添加一个零读出神经元:它可以带入任何该激活在探测输入上能实现的单神经元特征,而不改变输出。 同时缩放原网络后,几何变为“原几何的正倍数 + 新特征的非负秩一贡献”。 把严格上三角相关写成去对角线、去非对角均值后的余弦相似度,便能从更宽网络中找出一个改善当前相似度边界的特征。

命题 5.3 进一步通过投影特征锥证明:极限相关上下界只依赖激活、探测输入和参考几何,不依赖轨道所实现的函数。 锥版 Carathéodory 定理将所需辅助贡献数量限制在投影空间维数 \(d\leq P(P-1)/2-1\),因而从宽度 \(N_h^\star+d\) 起,上下确界已经与所有宽度的极限相同,其中 \(N_h^\star\) 是轨道最小宽度。 这里的“达到极限”指上下确界相同,不保证某组有限参数恰好取到边界值,也不声称所有中间相关值都一定可达。

若扩展输入矩阵满足 \(\operatorname{rank}(\overline{\mathbf X})=P\),则任意参考几何都可被任意逼近到相关 \(-1\) 与 \(1\);充分宽度为 \(N_h\geq N_h^\star+P(P-1)/2-1\)。 该秩条件要求探测输入仿射独立,通常需 \(P\leq N_i+1\);高输入维度并不自动保证任意实际数据集满足它。 不满足条件时,附录给出一维输入 \((-1,0,1)\)、参考特征 \((1,0,1)^\top\) 的反例:任何 ReLU 网络与该参考的相关均不大于零,与宽度和函数无关。

4. 最小范数选择:压掉辅助几何仍需处理朝向自由度

作者在固定宽度的同一轨道内考虑两种选择规则,而不是提出新的监督学习算法:

\[ \Omega_W=\|\mathbf W\|_F^2+\|\mathbf b\|^2+\|\mathbf A\|_F^2, \qquad \Omega_H=\|\mathbf H\|_F^2+\|\mathbf A\|_F^2. \]

两者都同时惩罚生成特征与读出特征的成本,避免把功能贡献通过任意放大活动、缩小读出隐藏起来。 对权重范数,算术—几何平均不等式和三角不等式给出下界 \(2\sum_{q\in\mathcal E}\|\boldsymbol\beta_q\|\)。 达到下界要求非必要神经元参数为零、必要神经元输入参数范数与读出范数相等,而且同类有效读出都与其聚合系数同向,不能靠相互抵消浪费范数。

剩下的自由度是每个必要类的有效读出如何分给正、负朝向:正朝向占比为 \(t_q\in[0,1]\),负朝向占比为 \(1-t_q\)。 这些分配必须在整个输入域上重现原来的仿射残差,并满足宽度预算;一个内部占比需要两个朝向神经元,端点占比只需要一个。 命题 6.1 要求这样的可行分配集合 \(\mathcal T_{N_h}\) 非空,才保证下界达到且辅助几何消失。 此时必要类的总几何权重固定为 \(\|\boldsymbol\beta_q\|\),仍允许将它按 \(t_q\) 分到两种朝向。

推论 6.2 再要求 \(m\neq0\) 且类特定残差矩阵 \(\boldsymbol\beta_q\overline{\mathbf w}_q^\top\) 线性无关,于是残差唯一确定全部占比,最小权重范数几何才唯一且不随更大宽度变化。 这一条件是充分条件而非普遍结论:纯偶正齐次激活可因两朝向特征相同而直接获得唯一几何;反之,ReLU 帐篷函数在最小权重范数下仍可有多个几何。 因此,“加范数约束即可恢复可辨识性”必须带上可行性与剩余自由度条件。

表示范数的结论还依赖具体探测样本。 附录 F.6 要求每个必要类两个单位朝向特征的最小范数 \(g_q\) 严格大于零,并能只用较低活动范数的朝向满足残差与宽度预算;此时类几何权重为 \(\|\boldsymbol\beta_q\|/g_q\)。 若一个全局必要特征在全部探测输入上都不活动,放大输入参数并缩小读出就能使目标趋向下确界而没有有限最小值,故不能省略最小值存在性的检查。

一个完整示例

取附录 G 的两类 XOR 解析代表:解 2 计算对角投影的绝对值减去 \(1/\sqrt2\),解 5 计算反对角投影绝对值的负值再加 \(1/\sqrt2\)。 两者在四个 XOR 点上给出同样的正负 logits,但在完整二维输入域上并非同一函数。 这首先区分“完成相同任务”与“实现相同全局函数”。

在解 2 上添加来自解 5 的零读出特征,解 2 的全局输出完全不变,却增加了一项朝向参考几何的秩一贡献。 再复制或正缩放这项辅助特征,它可以主导表征相似度,因此几何接近解 5 不能推出计算接近解 5。 若对解 2 的轨道施加满足条件的最小权重范数选择,这些辅助贡献被清除;其必要类的两个朝向占比被残差固定为 \(1/2\),从宽度 2 起轨道内获得唯一几何。 “唯一”分别发生在每个轨道内部,不表示六个解析解共享同一个几何。

实验关键数据

本文以理论为主,但并非没有经验实验:附录 G 提供小规模 XOR 初始化扫描和聚类,用于支撑图中的示意解。 没有大规模真实数据基准、SOTA 比较或标准模块移除消融;下面分别整理可核验数值及理论条件分析。

主实验

项目 原文设置或结果 解释边界
XOR 数据与网络 4 个二维输入,2 个 ReLU 隐藏神经元,标量输出 额外输出偏置固定;理论作用于扣除它后的隐藏层输出
初始化扫描 1000 次独立初始化,参数来自 \(\mathcal U(-1/\sqrt2,+1/\sqrt2)\) 只代表该初始化与训练协议
优化预算 全批次 Adam,学习率 0.1,\(10^7\) 步 不是标准优化器对比
收敛判据 最终 BCE 小于 \(10^{-12}\);296 次收敛 不将低于阈值写成精确零损失
六类解的频数 解 5、2、4、6、1、3 分别为 88、83、34、34、32、25 聚类是在消除置换与正缩放后进行,合计 296
解析代表的 logits 四个输入上幅度均为 \(1/\sqrt2\) 正确分类不等于其有限参数 BCE 为零

消融实验

下表是理论条件与反例分析,不是经验消融结果。

条件或反例 保证或观察 不可省略的边界
正一阶齐次激活,相关集合非空 相关跨度随宽度严格增长直至饱和 一般激活不能直接套用连续缩放证明
\(\operatorname{rank}(\overline{\mathbf X})=P\) 每个轨道的相关下确界为 \(-1\),上确界为 \(1\) \(N_h\geq N_h^\star+P(P-1)/2-1\) 足够;端点可只被逼近
同激活网络作为参考,参考宽度 \(L\) 上确界为 \(1\) \(N_h\geq N_h^\star+\min\{d,L\}\) 足够,不要求函数一致
权重范数且 \(\mathcal T_{N_h}\neq\varnothing\) 最小值 \(2\sum_q\|\boldsymbol\beta_q\|\),无辅助几何 朝向分配仍可能不唯一
再加 \(m\neq0\) 与残差矩阵线性无关 唯一最小权重范数 RSM,之后宽度不改变它 是充分条件,不是所有函数都满足
ReLU 帐篷函数反例 宽度 3 有两个最小范数几何,宽度至少 6 有一参数族 两个端点目标均为 \(4+4\sqrt2\);最小范数本身不足
零活动的必要特征反例 \(f(x)=\operatorname{ReLU}(x-2)\),输入 \((-1,0,1)\) 时 \(\inf\Omega_H=0\) 缩放后 \(\Omega_H=\alpha^{-2}\to0\),没有有限参数达到它

关键发现

  • 所有六个解析 XOR 解都满足推论 6.2,故各自轨道从宽度 2 起具有唯一的最小权重范数几何;这与未经约束的几何可大幅变化并不矛盾。
  • 解 2 与解 5 的分类结果相同,但全局函数不同;添加零读出特征展示的是另一件事,即在全局函数严格固定后仍能改变几何。
  • 正确分类的解析代表只有有限 logit;附录 G 通过整体增大 logit 使 BCE 趋向零,这种缩放改变函数,不是前文保持函数的互逆缩放对称性。
  • 原文图注的“近乎不相关”“近乎完美相关”没有在缓存正文提供对应精确系数,本笔记不补造小数。

亮点与洞察

  • 把复杂的参数群操作投射到三个特征原语,解释了为什么置换不影响几何、复制改变整数权重、齐次缩放改变连续权重,而不是把所有参数不唯一性混为一谈。
  • 必要与辅助的区分由轨道不变量定义,而不是由活动方差或肉眼显著性定义。大幅度活动可以来自零输出贡献,提醒表征解释必须同时观察读出路径。
  • 最小范数证明的等号条件给出明确的功能校准机制:必要类的几何权重由有效计算贡献确定,而不是任意训练实现的尺度。
  • 极限相关由投影特征锥控制,既解释强反例,也保留了输入几何施加的真实约束;它不是“任何网络都能匹配任意脑数据”的无条件结论。

局限与展望

  • 模型是一隐层全连接非线性网络;深层跨层退化、注意力、归一化与现代大模型架构不在所证范围内。
  • 对称轨道未被证明覆盖全部函数等价实现,故轨道内唯一性不能直接升级为整个函数纤维的唯一性。
  • 最小范数是实现选择原则,论文没有证明普通 Adam、权重衰减或实际训练必然找到该轨道内的全局最小范数实现。
  • Pearson 结果使用未中心化 Gram 的严格上三角条目;不能直接替换为其他 RSA 指标或 CKA 后继续引用同一界。
  • XOR 实验仅验证小型网络中的机制与代表解,六类也只描述该扫描的主要解,不能视为所有两神经元 XOR 解的完备分类。
  • 后续可研究近似函数等价、有限范数预算和更深网络中的剩余歧义,并检验真实训练能否近似满足理论平衡条件;这些是延伸建议而非本文已完成结果。

相关工作与启发

  • vs Braun et al. (2025):前者分析深线性网络的函数—表征分离与选择规则;本文在一隐层非线性网络中利用激活代数结构建立对应结果,但没有因此覆盖任意深非线性网络。
  • vs Şimşek et al. (2021):前者研究过参数化损失景观及特定教师—学生条件下的对称性;本文把焦点转向隐藏活动和 RSM,并区分必要计算与辅助几何。
  • vs Martinelli et al. (2024):本文继承并细化激活相关对称群,加入非退化条件与全局残差约束,再推导它们在特征层面的作用。
  • 对表征相似性分析的启发:比较模型时,应将几何一致性视为需要额外实现假设的证据,而不是计算一致性的充分判据;可先检查功能贡献与活动尺度是否平衡。
  • 对通用表征假说的启发:任务更复杂不必无条件缩小实现空间;当模型宽度也增长时,对称性诱导的歧义可能继续扩大,必须额外说明实现选择机制。

评分

  • 新颖性: 4/5。把非线性参数对称性、特征分解、宽度增长与条件性几何可辨识性串成一套精确分析。
  • 实验充分度: 3/5。理论证明与反例完整,经验支持限于 XOR,尚无真实模型验证。
  • 写作质量: 4/5。主文逻辑清楚,附录保留重要可行性与非存在边界,但读者需要较强数学背景。
  • 价值: 4/5。为表征解释和模型—脑比较提供了可检查的假设边界,而不是只给出否定性反例。