跳转至

TiltDiff: Tilted Weight-Space Diffusion for Neural Network Generation

会议: ECCV 2026
论文: ECCV 2026
领域: 图像生成
关键词: 权重空间学习、神经网络权重生成、潜在扩散模型、性能倾斜扩散、模型可解释性

一句话总结

TiltDiff 提出了一种面向神经网络权重生成的性能倾斜潜在扩散框架,通过排列对齐与 Transformer 自编码器将网络参数投影至低维隐空间,并利用验证集准确率加权扩散去噪目标,在维持表征多样性的同时偏向生成高性能、高鲁棒性的网络参数。

研究背景与动机

随着深度学习的发展,神经网络权重正逐步被视作一种蕴含丰富结构信息的高维数据,而不仅是单次训练优化的终点产物。在“模型权重即数据”的视角下,由不同随机初始化、超参数配置和优化轨迹训练得到的模型集合(Model Zoo)构成了一个跨越特定模型家族的高维权重空间分布。对该空间进行生成式建模,不仅能够实现模型插值、属性预测与迁移,更有望直接合成无需完整训练即可运作的功能性神经网络,为低成本模型复用开辟全新路径。

然而,在高维权重空间中生成实用模型面临着严峻的技术壁垒。神经网络权重不仅参数维度极高、具有天然的分层拓扑结构,且对细微扰动高度敏感;同时,网络内部存在的通道置换对称性导致功能高度相似的模型在原始参数空间中可能相距甚远。更关键的矛盾在于真实模型库的质量异质性:现有的超表示(Hyper-Representations)与自编码方法(如 SANE)通常对全量检查点进行无差别建模,均等地分配生成容量。这种无偏拟合不可避免地导致生成模型将大量容量浪费在欠拟合、性能孱弱或退化的权重区域,无法优先采样具备优异泛化能力的实用模型。

针对这一瓶颈,本文的核心切入点在于重构权重空间的扩散生成目标:既不能简单抛弃模型库原有的拓扑多样性,又必须在优化目标中注入性能偏置导向。核心 idea:将网络参数经置换对齐后映射到紧凑的 Transformer 隐空间,利用验证集准确率构造加权去噪扩散损失,实现向高精度权重流形倾斜的生成采样,并结合去噪网络特征归因实现决策通路的因果验证。

方法详解

整体框架

TiltDiff 的完整生成流水线包含权重预处理与隐空间编码、性能倾斜潜在扩散训练、以及反向采样与权重重建三个核心阶段。首先,系统输入待建模的模型库检查点,通过统一的参考模型进行通道置换对齐与标准化,并由 Transformer 权重自编码器将其压缩为规则的低维潜在向量;随后,潜在扩散 U-Net 在隐空间中学习去噪轨迹,训练过程中通过样本验证精度自适应调节去噪损失权重;最终,推理阶段从标准高斯噪声出发,经逐步去噪得到隐向量,并通过解码器与逆标准化重建出功能完备的目标神经网络参数。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["模型库检查点集合<br/>(含参数及验证精度)"] --> B["权重标准化与置换对齐"]
    B --> C["权重标记化与隐空间自编码"]
    C --> D["精度加权潜在扩散训练"]
    D --> E["反向扩散采样与参数反标准化"]
    E --> F["决策通路归因与因果验证"]
    F --> G["高性能功能性神经网络"]

关键设计

1. 权重标准化与置换对齐:消除对称性导致的表征歧义

不同神经网络层之间的参数尺度差异极大,且由于隐藏层神经元的置换不变性,功能完全一致的两个网络在参数空间中可能表现出巨大的欧氏距离。为了消除这种几何冗余对生成流形建模的干扰,TiltDiff 首先对每个模型检查点执行层级标准化,随后以一个固定参考模型为基准,求解最优神经元置换矩阵。

具体而言,对于标准化后的检查点参数,算法通过求解优化问题确定使得参数向量化点积最大的置换算子: $$ \pi_i^* = \arg\min_{\pi \in \Pi} |\operatorname{vec}(\check{\Theta}_{\mathrm{ref}}) - \operatorname{vec}(\pi \cdot \check{\Theta}_i)|_2^2 $$ 该置换按照 Git Re-Basin 准则在相邻层之间协同传播,严格确保网络的推理功能完全不变。对同一次训练轨迹中的所有检查点,算法统一采用末期检查点的置换算子进行校准,从而在参数空间中对齐不同模型的表征基底。

2. 权重标记化与隐空间自编码:高效压缩高维参数拓扑

经对齐校准后的高维连续参数直接采用扩散模型建模开销极大且容易崩塌。TiltDiff 借鉴 SANE 协议,将对齐后的连续参数切片切块为固定长度的权重标记(Weight Tokens),并结合各层特异性的共享位置编码输入 Transformer 自编码器。

在编码过程中,系统首先剔除模型库中严重欠训练的低质样本,仅保留高质量子集以建立初始候选池。Transformer 编码器将长序列参数标记压缩为紧凑的潜在编码 \(z_0^{(i)}\),自编码器重构损失确保该隐空间保留了完整的网络功能重构能力。训练完成后,自编码器权重完全冻结,生成的潜在空间成为后续扩散模型轻量、平滑的学习基座。

3. 精度加权潜在扩散训练:向高性能流形平滑倾斜

传统的扩散模型以均等权重拟合经验分布,容易生成性能平庸的检查点。TiltDiff 显式构造了以性能加权的倾斜概率分布 \(p_{\mathrm{tilt}}(\Theta) \propto p_{\mathrm{zoo}}(\Theta)\widetilde{w}(\Theta)\)。为了在扩散过程中平滑实现这一偏置,首先将验证集准确率归一化至 \([0, 1]\) 区间: $$ v_i = \frac{a_i - a_{\min}}{a_{\max} - a_{\min}} $$ 在此基础上,通过指数加权 \(\widetilde{w}_i = \exp(\lambda v_i)\) 或 Sigmoid 加权 \(\widetilde{w}_i = \sigma(\beta(v_i - \tau))\) 计算未归一化权重,并缩放至均值为 1。最终的潜在扩散去噪优化目标被定义为: $$ \mathcal{L}{\mathrm{tilt}} = \mathbb{E}, t) \right|_2^2 \right] $$ 这一设计赋予高精度网络更大的梯度影响权重,迫使 U-Net 去噪网络优先优化高精度参数流形,显著改善了生成模型的平均精度与极值分布。}} \left[ w_i \left| \boldsymbol{\epsilon} - \boldsymbol{\epsilon}_\psi(\mathbf{z}_t^{(i)

4. 决策通路归因与因果验证:探究生成权重的内部功能对齐

仅凭宏观测试精度不足以确认生成的权重是否具备真实的内部功能逻辑。TiltDiff 进一步提出利用扩散 U-Net 跨层连接与 Captum 特征归因定位类别特异性决策通路。

在固定扩散时间步(\(t=261\))下提取 U-Net 块间特征,计算单元激活对目标类得分的梯度敏感度: $$ \operatorname{Attr}^{(l)}(x, c) = A^{(l)}(x) \odot \frac{\partial f_c(x)}{\partial A^{(l)}(x)} $$ 筛选正归因神经元并递归追踪最强上游连接构建决策通路。通过对特定通路执行神经元置零掩码,测试其对目标类别的因果抑制效应与对非目标类别的特异性留存,并验证该功能通路在独立生成的模型间具有涌现的对应关系。

损失函数 / 训练策略

模型分为两阶段训练。第一阶段训练 Transformer 权重自编码器,采用均方误差重构损失训练编码器与解码器,使其具备保真还原模型参数的能力;第二阶段冻结自编码器,使用由性能加权的 \(\mathcal{L}_{\mathrm{tilt}}\) 目标训练 U-Net 扩散去噪网络。扩散去噪网络采用标准的 \(\epsilon\)-预测参数化机制(预测注入噪声)。在生成推理时,从标准高斯噪声采样,通过逆向去噪采样得到 \(\hat{z}_0\),再输入解码器、去标记化并反标准化,最终获得可直接部署的功能性模型参数。

实验关键数据

主实验

论文在 CIFAR-10 卷积模型库(约 12k 参数)、MNIST 卷积模型库(约 5k 参数)以及 CIFAR-100 ResNet-18 分类头(约 53k 参数)上进行了系统评估。表 1 展示了 CIFAR-10 上不同保留比例下生成模型的测试精度,TiltDiff 及其加权变体一致优于基线 SANE。

表 1:CIFAR-10 模型库不同数据保留比例下的生成模型测试精度对比

数据保留比例 指标 SANESub (基线) TiltDiff (无加权) TiltDiffSig (Sigmoid加权) TiltDiffExp (指数加权)
30% Top-1 / Top-3 (%) 59.77 / 57.37±2.24 58.74 / 58.14±0.71 58.83 / 58.13±0.78 60.39 / 59.63±0.66
25% Top-1 / Top-3 (%) 58.01 / 57.23±0.69 57.61 / 56.58±0.95 55.84 / 55.69±0.78 58.45 / 58.01±0.57
20% Top-1 / Top-3 (%) 58.93 / 57.59±1.17 56.95 / 56.79±0.15 61.02 / 59.08±1.69 59.93 / 58.73±1.06
15% Top-1 / Top-3 (%) 55.53 / 55.13±0.36 59.93 / 59.76±0.27 60.13 / 59.60±0.13 60.16 / 59.03±0.98
10% Top-1 / Top-3 (%) 57.80 / 56.79±0.89 60.61 / 58.70±2.43 61.54 / 60.76±0.62 58.88 / 58.54±0.40

在跨架构与更复杂权重的泛化评测中,表 2 报告了 MNIST 与 CIFAR-100 分类头的 Top-3 精度,TiltDiff 在各类设置下均显著超出基线。

表 2:MNIST 与 CIFAR-100 ResNet-18 分类头上的生成模型 Top-3 测试精度 (%)

任务场景 保留数据比例 SANESub TiltDiff TiltDiffSig TiltDiffExp
MNIST CNNs 25% 85.87 ± 0.32 87.27 ± 0.17 87.68 ± 0.19 87.91 ± 0.19
MNIST CNNs 20% 85.84 ± 0.55 86.83 ± 0.60 88.02 ± 0.39 88.28 ± 0.04
MNIST CNNs 10% 86.57 ± 0.71 86.56 ± 0.06 86.68 ± 0.26 86.37 ± 0.01
CIFAR-100 ResNet-18 头 30% 69.89 ± 0.07 74.59 ± 0.06 73.24 ± 2.11 71.45 ± 2.62
CIFAR-100 ResNet-18 头 20% 69.39 ± 0.21 74.63 ± 0.04 74.51 ± 0.10 74.43 ± 0.00
CIFAR-100 ResNet-18 头 15% 69.60 ± 0.19 74.36 ± 0.06 74.40 ± 0.04 74.40 ± 0.04

消融实验

论文在 CIFAR-10 模型库上严格分析了扩散目标形式、准确率加权与数据筛选机制的单独与联合影响。

表 3:CIFAR-10 核心设计组件消融实验(Top-3 准确率,%)

预测目标参数化 精度加权损失 验证集数据筛选 Top-3 测试准确率 (%) 说明
\(z_0\) (直接预测清洁编码) – – 21.17 ± 3.24 直接预测隐编码难以收敛
\(\boldsymbol{\epsilon}\) (预测注入噪声) – – 42.18 ± 1.11 噪声预测带来基础生成能力 (+21.01%)
\(\boldsymbol{\epsilon}\) ✓ – 46.76 ± 0.70 仅引入精度加权即可增益 +4.58%
\(\boldsymbol{\epsilon}\) – ✓ 58.70 ± 2.43 仅筛选前 10% 高质量样本大幅提点 (+16.52%)
\(\boldsymbol{\epsilon}\) (TiltDiff 完整模型) ✓ ✓ 60.76 ± 0.62 联合筛选与精度加权取得最优效果

关键发现

  • 去噪目标参数化的决定性作用:直接预测清洁隐状态 \(z_0\) 表现较差(仅 21.17%),而采用 \(\boldsymbol{\epsilon}\)-预测参数化能稳定拟合复杂的权重流形,精度直接跃升至 42.18%。
  • 筛选与加权的互补增益:仅剔除低分模型可获得最大幅度的单一增益(至 58.70%),而在此基础上施加验证精度加权能进一步提升至 60.76%,证明连续权重倾斜在离散样本截断后依然能提供精细的性能导向。
  • 扰动鲁棒性与多样性兼备:随机参数置零实验表明,TiltDiff 生成的模型在 1%–10% 的卷积层参数被遮蔽时,精度衰减明显小于 SANE;同时在 CKA(Centered Kernel Alignment)表征相似度评估中,TiltDiff 生成样本具备更低的互相似度(更高的多样性得分 \(1 - s_{\max}\)),打破了“高性能生成必然导致样本崩塌单一化”的假象。
  • 因果通路的特异性验证:在对 U-Net Block 4 提取的猫类别决策通路执行掩码时,目标猫类别精度相对骤降 98.21%(绝对掉点 44.00%),而其他非目标类别相对掉点仅 14.90%,特异性差距高达 83.31 百分点,强力证实生成的网络内部保留了清晰且因果相关的决策拓扑。

亮点与洞察

  • 性能加权扩散目标的设计轻巧高效:无需修改 U-Net 结构或引入高复杂度的强化学习微调,仅通过对扩散损失按验证精度执行缩放归一化加权,就达成了显著的分布倾斜效应。
  • 从生成器中间层反哺功能可解释性:揭示了生成器 U-Net 的中间层激活蕴含网络功能语义,成功跨越了“黑盒生成黑盒”的传统困境,证明生成式模型能够学习到具有因果可解释性的决策神经通路。
  • 微调初始化的即插即用潜力:将 TiltDiff 生成的权重直接作为网络初始权重,在无需任何额外调优时即达到 60.8%(CIFAR-10)和 88.0%(MNIST)的高性能起点,并在单轮微调后迅速收敛,展示了作为神经架构超快冷启动方案的应用价值。

局限与展望

  • 模型容量与架构复杂度受限:目前验证的架构主要局限于小型浅层卷积网络(约 12k 参数)与固定骨干网的线性分类头(约 53k 参数),尚未扩展至百兆以上参数的现代超大规模骨干网络。
  • 置换对齐的时间开销依赖:Git Re-Basin 置换求解算法在处理复杂多分支网络(如 DenseNet、Vision Transformer)时开销较大,且跨架构置换对齐尚未完全解决。
  • 未来方向:未来可探索将性能倾斜机制推广到条件化可控权重生成、细粒度神经模块编辑以及多模型集成自动化合成等场景。

相关工作与启发

  • vs SANE (Schürholt et al., ICML 2024):SANE 确立了参数标记化与自编码机制,但仅做无偏经验分布建模;TiltDiff 引入性能倾斜损失与噪声去噪机制,在精度、鲁棒性与表征多样性上实现全面超越。
  • vs Hyper-Representations / D2NWG:早期超表示与扩散方法多聚焦于无条件拟合或简单的隐式神经场生成;TiltDiff 首次系统验证了生成权重的决策通路因果对应性,建立了可解释性权重生成范式。

评分

  • 新颖性: ⭐⭐⭐⭐ [创新地将精度倾斜加权引入权重空间潜在扩散,并建立跨模型的因果通路分析]
  • 实验充分度: ⭐⭐⭐⭐⭐ [覆盖多数据集、权重扰动鲁棒性、CKA 表征多样性及深度因果通路遮蔽验证]
  • 写作质量: ⭐⭐⭐⭐⭐ [逻辑严谨清晰,数学形式化规范,图表数据自洽且详实]
  • 价值: ⭐⭐⭐⭐ [为神经网络权重生成、快速初始化与模型空间内在拓扑理解提供了强有力的工具]