Spectral-Sphere-Constrained Hyper-Connections¶
会议: NeurIPS2026(清单归属;解读依据 arXiv v2)
arXiv: 2603.20896
代码: https://github.com/6zHAOyi/s2HC
领域: 预训练 / 优化与理论
关键词: 超连接、谱范数约束、均值保持、动态流混合、语言模型预训练
一句话总结¶
s²HC 将多流残差矩阵从非负双随机约束放宽到保持均值的谱范数球面,用零和子空间上的动态旋转与有界缩放实现非退化混合,在三个从头预训练的语言模型上将八项评测平均准确率提高到 47.1、50.2 和 50.7。
研究背景与动机¶
普通残差连接保留一条恒等路径,让注意力或 MLP 的输出叠加到已有特征上。Hyper-Connections(HC)把这条路径扩展为多条并行特征流,再用随输入变化的矩阵在流之间交换信息;这样增加的是连接拓扑的自由度,而非简单增加一个更宽的注意力块。不过,多层无约束矩阵连续相乘可能放大信号。mHC 因而要求混合矩阵非负且行列和均为 1,既保留流间均值,也将矩阵谱范数固定为 1。
这个约束有两类代价。实现上,有限次 Sinkhorn–Knopp(SK)归一化只能近似满足双随机条件;mHC-lite 用全部排列矩阵的凸组合实现精确约束,却引入阶乘增长的参数,KromHC 则用 Kronecker 分解换取效率及更受限的表达空间。表示上,本文在训练后的 Qwen3 中发现这些方法的矩阵仍接近恒等初始化,流间相似度轨迹也接近不做残差混合的基线。作者提出的解释是:在通常的混合条件下,双随机操作容易同时削弱偏离均值的方向,模型可能为了避免特征被同质化而选择少混合。这是有观察支持的机制假说,不是所有双随机矩阵必然退化的定理;排列矩阵就是不衰减的反例。
本文因此不再把“稳定”与“每个矩阵元素非负”绑定,而是直接控制混合算子的谱。它保留行列和约束,把公共均值锁定为不变方向;其余方向允许旋转、翻转与选择性衰减,而不允许线性混合放大范数。核心 idea:将均值保持与偏差混合分开参数化,只约束偏差子空间的最大增益,使多流交互不必退回近恒等矩阵来维持稳定。
方法详解¶
整体框架¶
输入是每个 token 的多流隐藏状态,记为 \(X_l\in\mathbb{R}^{n\times C}\),其中 \(n\) 是流数、\(C\) 是单流宽度。s²HC 仍采用 HC 的双路径:一条做残差流混合,另一条将多流聚合成一个注意力或 MLP 输入,再将其输出写回多流。论文只替换残差混合矩阵的生成方式,分支的读写门控沿用 mHC。
新增部分依次是“均值与偏差解耦”“动态谱参数化”,随后进入“残差与分支合流”。解耦给出固定的均值投影和零和基;动态参数化从当前隐藏状态生成偏差空间内的两组旋转和一组缩放,再合成为合法的残差矩阵。整个生成过程在训练和推理时都执行,并非先训练出一个全局固定矩阵、推理时直接复用。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
X["当前 token<br/>多流隐藏状态"] --> B["均值与偏差解耦<br/>固定均值投影与零和基"]
B --> C["动态谱参数化<br/>旋转与有界缩放"]
X -->|归一化后动态生成| C
C -->|当前残差矩阵| D["残差与分支合流<br/>混合及分支读写"]
X -->|原始特征| D
D --> Y["下一层多流状态"]
Y -.->|仅训练时经语言模型输出头| L["语言建模损失"]
T["下一 token 目标"] -.->|仅训练监督| L
关键设计¶
1. 均值与偏差解耦:让公共分量保持不变,混合自由度留给流间差异
行和为 1 意味着所有流相同的输入不会被改变,列和为 1 意味着输出流的平均值等于输入平均值。两者合在一起,把均值方向与零和偏差方向隔离开来。作者用 \(J=\frac{1}{n}\mathbf{1}_n\mathbf{1}_n^{\top}\) 表示均值投影,并写成 \(\mathcal{H}_l^{\mathrm{res}}=J+\mathcal{H}_l^{\mathrm{disp}}\);偏移矩阵满足 \(\mathcal{H}_l^{\mathrm{disp}}\mathbf{1}_n=0\) 和 \(\mathbf{1}_n^{\top}\mathcal{H}_l^{\mathrm{disp}}=0\)。这里的“偏移”不是额外注入的常数,而是处理流间偏差的线性算子。
对任意一个特征通道,\(J\) 只保留各流共同的均值,偏移矩阵只处理与均值正交的差异,两个输出仍处在互相正交的子空间。因此核心关系是 \(\|\mathcal{H}_l^{\mathrm{res}}\|_2=\max(1,\|\mathcal{H}_l^{\mathrm{disp}}\|_2)\)。原本看似难维护的“谱范数严格等于 1”,于是变成偏移矩阵范数不超过 1。允许负元素不会破坏这个结论,也不会破坏残差混合的均值保持。
这解释了为什么方法不是简单把矩阵除以最大奇异值:那样可能破坏均值方向,而本文先锁定这一方向,只在其正交补上学习。固定的截断 Helmert 矩阵 \(U_{\mathcal{Z}}\in\mathbb{R}^{n\times(n-1)}\) 给出零和子空间的正交基;它不是从数据学习的投影,也不是把所有流先平均后丢掉差异。
2. 动态谱参数化:把混合方向与衰减强度分开学习
在上述基下,偏移矩阵等价于一个 \((n-1)\times(n-1)\) 小矩阵。最终构造是 \(\mathcal{H}_l^{\mathrm{res}}=J+(U_{\mathcal{Z}}U_l^{\mathrm{core}})\Sigma_l(U_{\mathcal{Z}}V_l^{\mathrm{core}})^{\top}\)。左右核心矩阵均正交:右侧选择要读取的偏差方向,对角矩阵控制每个方向的增益,左侧决定这些方向如何写回不同流。两组旋转分别控制输入与输出方向,避免把自由度压缩成单纯的对称缩放。
具体实现先展平并 RMSNorm 当前 token 的全部流,再由三组线性投影产生两组旋转参数和一组对角参数。旋转参数经过带可学习尺度的 tanh 和幅度门,填入反对称矩阵的上三角,下三角取相反数,再经 Cayley 变换得到正交核心矩阵。每组只需 \(k=\frac{1}{2}(n-1)(n-2)\) 个独立旋转输出;对角参数则有 \(n-1\) 个,经过 tanh 后绝对值不超过 1。实际执行的是生成一个具有谱分解形式的矩阵,并非每个 token 对任意矩阵运行数值 SVD。
原文把 tanh 对角项称为“奇异值”,但它们可以为负,更准确的说法是有符号对角系数;真正的奇异值是这些系数的绝对值,符号可吸收进对应方向。范数控制仍然成立,负号则允许方向翻转。选择性衰减也没有被完全取消:方法取消的是非负双随机约束对方向与增益的耦合,偏差方向仍只能保持或衰减,不能放大。
理论和实现的覆盖范围需要分开读。附录 D.4 证明的是任意正交核心矩阵配合对角谱的抽象表示完备性;有限参数的标准 Cayley 变换不覆盖全部正交矩阵,带有特征值 \(-1\) 的旋转不能直接由该图表获得,反射也不是其直接输出。配合有符号对角项可能弥补部分限制,但不能据抽象 SVD 证明直接宣称具体动态生成器在有限参数下覆盖整个闭合目标集合。
3. 残差与分支合流:保留 HC 的读写接口,而不是扩大每个计算块
完整更新沿用 \(X_{l+1}=\mathcal{H}_l^{\mathrm{res}}X_l+(\mathcal{H}_l^{\mathrm{post}})^{\top}\mathcal{F}(\mathcal{H}_l^{\mathrm{pre}}X_l,\mathcal{W}_l)\)。残差路径直接混合原始多流特征;计算分支由动态的 pre 门控聚合为单流,经过原有注意力或 MLP,再经 post 门控分配回各流。因此均值保持只描述残差混合,分支新增内容仍可改变下一层特征均值。
pre 使用 sigmoid,post 使用两倍 sigmoid,二者都从归一化后的隐藏状态生成,结构与 mHC 相同。这一点使主实验较清楚地比较“残差矩阵约束换成什么”,而非同时更改分支网络。不过,它们并没有被新的谱约束一并控制。
附录 D.1 的乘法封闭性说明,冻结各层已生成的矩阵时,其残差混合乘积仍保持均值且谱范数为 1。这个结论针对线性残差路径,不等于总网络 Jacobian 的界:矩阵本身依赖输入,求导还要包含生成器的导数,非线性分支和动态 pre/post 也有额外项。因此“固定线性残差不放大”有严格依据,“整个输入相关网络绝不发生梯度爆炸”则不是该证明的推论。
一个完整示例¶
以主实验的四流配置为例,每个 token 的状态是四个宽度为 \(C\) 的向量。固定均值方向之外,还剩三个独立偏差方向;两组旋转各输出 3 个参数,对角缩放输出 3 个参数,总共 9 个动态残差参数,再还原为一个 \(4\times4\) 矩阵。
如果三个偏差方向的实际奇异值分别接近 1、1、0.77,那么公共均值不变,两个选中的偏差方向基本保留,第三个方向的幅度减至 0.77 倍。这组数值用于解释原文图 5 的谱现象,不代表每层都固定采用同一组系数。流之间可以重新组合,甚至出现负权重,但残差线性混合整体不放大欧氏范数。
随后,pre 门控把四流读成一个注意力或 MLP 输入,计算结果由 post 门控写回,再与刚才的残差混合相加。下一个 token 或下一层的输入变化时,旋转、缩放及读写门控都会重新生成;推理时也保留这一步,没有需要真实答案参与的门控。
损失函数 / 训练策略¶
论文改变的是连接结构,没有提出新的辅助损失;训练仍是自回归语言建模。实验不是把已预训练 Qwen 或 Gemma 权重拿来微调,而是沿用其架构,在 FineWebEdu 上从头训练。Qwen3-0.6B 去掉词嵌入绑定后实际约 0.75B 参数,Gemma3-1B 与 Qwen2.5-1.5B 保持词嵌入绑定;对应预算分别为 15B、20B、30B tokens。
初始化使两组 Cayley 核心矩阵为恒等,对角偏置设为 4,投影权重为零,旋转幅度门为 1,三个尺度为 0.01。原文称此时是精确恒等残差,但有限实数下 \(\tanh(4)<1\),按公式只能得到近恒等矩阵;是否因具体数值精度饱和或代码中另有处理,全文没有交代,不能仅凭描述认定精确恒等。
训练使用 AdamW、bfloat16、余弦学习率及 1000 次迭代线性预热,梯度裁剪阈值为 1.0。序列长度为 2048;Qwen3 初始学习率为 \(6\times10^{-4}\),其余两者为 \(4\times10^{-4}\),最低学习率均为对应初始值的十分之一。附录表 4 的全局 batch 分别是 512、512、1024。
评测通过 lm-eval harness:PIQA、BoolQ、MMLU、TruthfulQA 为 0-shot,WinoGrande 为 5-shot,HellaSwag 为 10-shot,ARC-E/C 为 25-shot。MMLU 特别采用 0-shot 以避免超过上下文长度,不能直接把这里的数值当作常见 5-shot MMLU 成绩。
实验关键数据¶
主实验¶
下表摘录原文表 1 的八项平均准确率,单位为百分比。增益是相对同一架构中最好的双随机 HC 基线,以百分点计;不是相对外部排行榜 SOTA。
| 从头训练架构 | RC | mHC | mHC-lite | KromHC | s²HC | 相对最佳双随机 HC 增益 |
|---|---|---|---|---|---|---|
| Qwen3,约 0.75B | 46.1 | 46.1 | 45.8 | 45.3 | 47.1 | +1.0 |
| Gemma3,1B | 48.9 | 49.4 | 49.9 | 50.0 | 50.2 | +0.2 |
| Qwen2.5,1.5B | 49.0 | 49.5 | 49.6 | 49.5 | 50.7 | +1.1 |
所有 HC 方法的能力主实验均使用 4 条流。三个模型的平均值都改善,但不是每个任务都最好:例如 Gemma3 的 ARC-C 为 36.0,低于 KromHC 的 36.6;Qwen3 的 TruthfulQA 为 34.4,低于 RC 的 36.7。
数值口径存疑:Qwen2.5 的 s²HC 八项展示分数为 55.2、62.2、71.6、51.5、66.5、37.0、25.1、35.7,简单平均得到 50.6,而原文 Avg. 列写 50.7。这里保留作者报告的 50.7 与据此得到的 +1.1,不自行改表;原文未说明差异来自未展示精度还是统计口径。
消融实验¶
下表摘录附录表 2、3,均为准确率百分比。“固定恒等”仍保留多流及动态 pre/post,只删除可学习的残差混合;“正交”是直接在完整流空间生成正交矩阵,并不保留均值方向。
| 架构 | 残差混合配置 | ARC-E | ARC-C | MMLU |
|---|---|---|---|---|
| Qwen3 | 固定恒等 | 58.9 | 31.1 | 24.0 |
| Qwen3 | 正交 | 59.8 | 30.4 | 24.3 |
| Qwen3 | s²HC | 59.8 | 30.9 | 25.6 |
| Gemma3 | 固定恒等 | 67.0 | 35.4 | 24.3 |
| Gemma3 | 正交 | 65.7 | 33.8 | 25.2 |
| Gemma3 | s²HC | 67.5 | 36.0 | 25.3 |
| Qwen2.5 | 固定恒等 | 65.3 | 35.1 | 25.2 |
| Qwen2.5 | 正交 | 66.5 | 33.7 | 26.2 |
| Qwen2.5 | s²HC | 66.5 | 37.0 | 25.1 |
动态混合并不逐项胜过固定恒等:Qwen3 的 ARC-C 从 31.1 降到 30.9,Qwen2.5 的 MMLU 从 25.2 降到 25.1。正交消融同时改变了均值保持与可衰减谱,不能单独归因于“允许奇异值小于 1”。
关键发现¶
- 图 5 中,Qwen3 的两个主要偏差奇异值接近 1,最小值可降到 0.77,支持“有选择地保持或削弱差异”,而不是全部流必须持续更不相似。
- 图 7 基于 1024 个样本:20 次 SK 后,mHC 单层列和峰值仍可到 2.0,28 层复合后离群值可到 3.6;s²HC 与精确双随机方法的累计谱范数保持在 1 附近。此处仍是残差矩阵统计,不是总网络 Jacobian。
- 吞吐实验在 4 张 H200、长度 2048、全局 batch 512 下运行。7 流时,mHC-lite 的辅助参数约 2B 并发生显存溢出,mHC 和 s²HC 分别约 26M、20M;这证明参数化扩展优势,不证明多流数下的能力普遍提高。
- 作者说明 mHC 吞吐来自 PyTorch 重实现,可能低估专用 kernel 的性能。正文吞吐设置的 micro-batch 为 8,与附录中 Qwen2.5 主训练的 4 属于不同实验设置,不应混为统一配置。
亮点与洞察¶
- 稳定性所需的是不变均值方向和受控算子增益,未必需要所有元素非负。先分离“不该变化的分量”,再学习剩余子空间,是比整矩阵归一化更可解释的约束设计。
- 非退化混合与不放大可以共存:旋转改变信息分布,而选择性衰减筛掉部分偏差。单看梯度稳定或矩阵接近恒等,不能判断多流连接是否真的在利用额外自由度。
- 两组旋转加对角谱的输出数合计为 \((n-1)^2\),投影权重规模为 \(nC(n-1)^2\),固定 \(C\) 时随流数呈三次增长。它消除了阶乘爆炸,但没有消除多流状态本身的存储与带宽代价。
局限与展望¶
- 作者承认,多流架构的内存访问开销仍在;更大模型和更长 token 预算尚待验证。现有能力实验覆盖约 0.75B、1B、1.5B 三个架构和 4 流,不能外推到大规模长期预训练。
- 表格未给出多随机种子的误差条或显著性检验,尤其 Gemma3 平均增益仅 0.2 个百分点,稳健性需要重复实验确认。
- 精确线性谱约束不是整个动态网络的稳定性保证,实际训练还使用梯度裁剪。后续应分别测量矩阵生成器、读写门控和非线性分支对总 Jacobian 的贡献。
- 抽象表示完备性、有限 Cayley 图表的覆盖范围,以及 tanh 初始化是否精确达到恒等,需要更清楚的理论与实现说明。可比较不同正交参数化及明确的近恒等初始化。
- 正交消融缺少“同样保持均值但偏差奇异值全为 1”的对照;补上该对照,才能更干净地识别选择性衰减的贡献。
相关工作与启发¶
- vs HC:HC 开放动态残差混合,但无约束矩阵可能放大信号;s²HC 在保留动态混合的同时,直接限制均值之外的线性增益。
- vs mHC:mHC 用非负双随机矩阵和 SK 迭代间接获得谱控制;s²HC 去掉非负性,以固定零和基及有界谱获得代数约束,但仍需考虑浮点误差。
- vs mHC-lite / KromHC:前者以排列凸组合换取精确双随机性,后者用 Kronecker 分解降低成本;s²HC 不需要枚举排列,也不依赖流数易分解,但投影参数仍随流数三次增长。
- 研究启发:把“保留公共信息”和“允许方向重组”作为两条独立约束,可用于其他多分支混合模块;需重新确认任务中的公共方向含义,而不是直接照搬全一向量。
评分¶
- 新颖性: 4/5。把双随机约束拆成均值保持与偏差谱控制,给出具体动态参数化。
- 实验充分度: 3/5。三架构和两种消融较有针对性,但规模、种子重复及消融隔离仍有限。
- 写作质量: 3/5。几何与实证对应清楚,奇异值用词、精确初始化及稳定性表述需收紧。
- 价值: 4/5。提供较紧凑的多流连接方案,适合继续验证预训练与系统实现收益。