跳转至

Robust Trajectory Distillation: Hybrid Reweighting Meets Teacher-Inspired Targets

会议: ECCV 2026
论文: ECCV 2026
领域: 模型压缩
关键词: 数据集蒸馏;噪声标签学习;轨迹匹配;样本重加权;二阶遗忘

一句话总结

本文在轨迹匹配式数据集蒸馏(DATM)骨架上加了两个模块——把 KNN 邻域一致性(动态)与二阶遗忘时间戳(静态)课程式融合的样本重加权 SGR 用于净化教师参数轨迹,以及用"高置信子集微调出的降噪教师检查点"提供辅助对齐目标的 TIAT——使蒸馏出的小数据集在对称/非对称/真实标签噪声下都更鲁棒,CIFAR-10 40% 对称噪声下最高比 DATM 高 4.7–6.6 个百分点。

研究背景与动机

数据集蒸馏(dataset distillation, DD)想用一个几十到几百张图的合成集替代整个训练集:把知识压进少量合成样本,让在合成集上重训的模型逼近在全量真实集上训练的模型,从而支持高效重训、快速适配和隐私友好的数据共享。近年的工作(如 Cheng 等提出的"distiller 天生是去噪器")进一步暗示,蒸馏本身可以充当过滤器,把有信息的干净信号和噪声模式分开。但主流的 DD 方法——轨迹匹配(trajectory matching)系的 DATM、分布匹配系的 DANCE、隐式梯度系的 RCIG、效率优先的 RDED——几乎都默认标签是干净的。真实的网络采集数据里,人工标注偏差、众包不一致和语义歧义会带来成规模的标注错误,一旦监督被污染,DD 的可靠性就无从谈起。而传统的噪声标签学习(sample selection 的 small-loss 技巧、损失重加权、标签纠正)把噪声估计和模型优化紧紧耦合在同一个回路里:模型既当噪声检测器又当预测器,自反馈会放大确认偏差,让模型对错误标签越来越自信,还往往需要干净验证集做锚点或反复迭代精修,在需要"即插即用"监督的蒸馏场景里并不合适。

于是本文的问题设定变成:在噪声监督下,如何同时提升蒸馏数据的质量容量?作者把它拆成两个互补的挑战——❶ Learning Better,让教师给出的监督信号本身更可信、干净知识保留得更多;❷ Learning More,让合成数据集能通过更丰富的师生交互吸收更多高质量监督。前者的障碍在于现有 DD 缺少区分干净/损坏信号的机制(论文报告 CIFAR-10 20% 噪声、50 IPC 下即有 2–3% 的精度下滑),后者的障碍在于合成集被参数化成固定大小的图像张量(例如 50 IPC),表示容量先天受限,噪声与干净信号还没解耦就已被"过早压缩"。

本文的切入角度很朴素:不去动标签,也不挑干净子集,而是去动教师。整体框架像一位老师先把自己的专业水平提升(净化自己的参数轨迹),再给学生布置课后作业(额外的辅助任务)来巩固学习。核心 idea:把"降噪"放到教师轨迹这一层——用静态遗忘先验与动态邻域一致性的课程式混合重加权训练出更干净的教师轨迹,再用跨教师的置信均值与方差筛出可靠子集、微调出一个噪声被抑制的教师检查点,把它作为辅助目标与原始轨迹对齐损失联合优化合成集。

方法详解

整体框架

先把符号和骨架说清。真实训练集记为 \(\mathcal{D}_{\text{real}}=\{(x_i,\tilde y_i)\}_{i=1}^N\),其中 \(\tilde y_i\) 是观测到的(可能被污染的)标签;测试集假定完全干净,用来评估泛化。目标是合成一个紧凑集 \(\mathcal{S}\)\(|\mathcal{S}|\ll|\mathcal{D}_{\text{real}}|\)),使得只在 \(\mathcal{S}\) 上训练的模型比在全量噪声集上训练的模型泛化误差更低。

本文沿用轨迹匹配式 DD。所谓"轨迹"指的是教师模型在噪声真实集 \(\mathcal{D}_{\text{real}}\) 上训练时参数随迭代变化的整条路径 \(\tau^*=\{\theta^*_t\}_{t=1}^{T}\)——不是扩散模型的采样轨迹,也不是强化学习的决策轨迹;蒸馏的目标也不是"把轨迹压小",而是反过来:让合成集 \(\mathcal{S}\) 诱导出的学生参数轨迹去贴合教师轨迹。流程是双层优化。内层从某个锚点 \(\hat\theta_t=\theta^*_t\) 出发,用 \(\mathcal{S}\) 上的 mini-batch 做 \(N\) 步梯度更新,模拟学生轨迹 \(\hat\tau=\{\hat\theta_{t+n}\}_{n=0}^{N}\);外层则要求学生的终点逼近教师 \(M\) 步之后的参数 \(\theta^*_{t+M}\),并对齐误差做归一化:

\[\mathcal{L}_{\text{match}}=\frac{\big\|\hat\theta_{t+N}-\theta^{*}_{t+M}\big\|_2^2}{\big\|\theta^{*}_{t+M}-\theta^{*}_{t}\big\|_2^2}\]

分母是教师自身在 \([t,t+M]\) 区间内的参数位移量,作为尺度因子让损失在不同锚点间可比(尺度不变),否则靠后的锚点天然位移更小、损失更小,优化会被近端锚点主导。

在此骨架上,本文提出的框架是一个三阶段流水线。第一阶段\(\mathcal{D}_{\text{real}}\) 上训练教师:训练过程中用选择性引导重加权(Selective Guidance Reweighting, SGR)按样本可靠性给每个样本一个权重,这些权重既调制教师参数更新、也调制外层对 \(\mathcal{S}\) 的指导,从而得到一条被"净化"过的教师轨迹;论文同时训练 \(P\) 条靠混合系数铺开多样性的教师轨迹。第二阶段初始化合成集 \(\mathcal{S}\)(高斯噪声采样或真实样本初始化,配软/硬标签),在合成集上模拟学生内层训练,并引入教师启发辅助目标(Teacher-Inspired Auxiliary Targets, TIAT):从高置信样本上抽出教师中间状态的辅助一致性信号,作为轨迹对齐之外的正则。第三阶段在外循环用多个锚点上的归一化轨迹匹配损失更新 \(\mathcal{S}\)。合起来,SGR 提升"监督来源的可信度",TIAT 提升"轨迹对齐被学生吸收的效率"。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["噪声真实集 D_real"] --> B["混合重加权 SGR<br/>KNN 一致性 × SSFT 遗忘先验"]
    B --> C["多条多样教师轨迹<br/>混合系数在 0–1 铺开"]
    C --> D["置信聚合与稳定性筛选<br/>跨教师均值 + 方差 → D_sub"]
    D --> E["TIAT 辅助目标<br/>可靠子集微调出降噪检查点"]
    E --> F["归一化轨迹匹配<br/>联合损失更新合成集 S"]
    F --> G["蒸馏集 S(用于训练学生)"]

关键设计

1. 混合重加权 SGR:把"学得晚不晚"和"邻居怎么看它"拼成一个权重

SGR 针对的是噪声下教师轨迹本身不可信的痛点。它给每个训练样本估计一个可靠性权重,由两路互补信号组成,再按训练进度做凸插值,而不是只在损失上乘一个静态系数。

第一路是动态的 KNN 一致性。在特征空间里取样本 \(i\)\(K\) 个最近邻,看邻居们的预测分布 \(\hat y_j\) 与它自己的观测标签 \(\tilde y_i\)(当作 one-hot 分布)有多一致,用 Jensen–Shannon 散度度量分歧:

\[W_{\text{knn}}^{(i)}=1-\frac{1}{K}\sum_{j=1}^{K}\mathrm{JS}(\tilde y_i,\hat y_j)\]

取值落在 \([0,1]\),邻居越认同这个标签分值越高。它抓的是局部证据:如果一个样本的标签与它在特征空间里的所有近邻都不符,它很可能就是错的。

第二路是静态的遗忘先验(SSFT)。借鉴 second-split forgetting 的思路,训练教师时记录每个样本两个时间戳——\(t^{(i)}_{\text{learn}}\) 是它第一次被正确分类的 epoch,\(t^{(i)}_{\text{forget}}\) 是它之后第一次又被分错的 epoch——再折算成难度分数 \(s^{(i)}\)(学得越晚、忘得越早,分数越高)并翻转成可靠度 \(W_{\text{ssft}}^{(i)}=1-s^{(i)}\)。⚠️ 缓存文本中该分数的公式 OCR 已损坏,这里按原文对 \(s^{(i)}\) 语义的描述(学得晚 + 忘得早 ⇒ 更可能是噪声/困难样本)与 \(\lambda\in[0,1]\) 的"平衡"作用复原,具体形式以原文为准:

\[s^{(i)}=\lambda\cdot\frac{t^{(i)}_{\text{learn}}}{\max_j t^{(j)}_{\text{learn}}}+(1-\lambda)\left(1-\frac{t^{(i)}_{\text{forget}}}{\max_j t^{(j)}_{\text{forget}}}\right)\]

这一路抓的是全局证据:遗忘行为是样本在整个训练历史上留下的痕迹,不受某一时刻的表示质量影响。而且这些时间戳只需在蒸馏前算一次、之后所有实验复用,是纯一次性开销。

两路信号的可靠性会随训练阶段变化,所以 SGR 用随时间变化的系数 \(\alpha_t\) 做凸组合,\(\alpha_t=\min\big(\alpha_{\max},\ \tfrac{t}{T_{\text{warmup}}}\cdot\alpha_{\max}\big)\),即在前 \(T_{\text{warmup}}\) 个 epoch 内从 0 线性升到 \(\alpha_{\max}\)(默认 \(T_{\text{warmup}}=60\),约占训练的 20%):

\[W^{(i)}=(1-\alpha_t)\cdot W_{\text{ssft}}^{(i)}+\alpha_t\cdot W_{\text{knn}}^{(i)}\]

课程式过渡的道理很具体:训练早期模型还在"early learning"阶段,表示空间尚不可靠、KNN 近邻本身就可能把噪声样本聚在一起,此时信任跨训练历史累积出的全局遗忘先验更稳妥;训练后期网络开始记忆噪声、特征空间逐渐可信,局部一致性反而更能捕捉样本当下的状态。此外,当训练 \(P\) 条教师轨迹时,作者把第 \(p\) 条的 \(\alpha^{(p)}_{\max}\) 设为 \((p-1)/P\),让不同教师在"偏静态先验"到"偏动态一致性"之间均匀铺开,为后面的跨教师共识提供多样性。

2. 置信聚合与稳定性筛选:只看均值不够,方差才是"稳定可靠"的证据

单条轨迹给出的权重是带噪的,TIAT 的第一步是把多条教师轨迹的意见汇总成一个置信度,并且同时看均值和方差。样本 \(i\) 的置信度定义为它在所有教师视角下的期望可靠度,实践中用 \(P\) 条轨迹的均值近似:

\[W_{\text{conf}}^{(i)}:=\mathbb{E}_{p\sim\mathcal{U}(\mathcal{P})}\big[W_p^{(i)}\big]\approx\frac{1}{P}\sum_{p=1}^{P}W_p^{(i)}\]

其中 \(W_p^{(i)}\) 是第 \(p\) 条教师轨迹在训练末段给样本 \(i\) 的权重。均值回答"这条样本整体可不可信",而作者还用跨轨迹方差 \(\mathrm{Var}_p(W_p^{(i)})\) 回答"它的可信度稳不稳定":低方差意味着不同教师(不同静态-动态配比)都给出相近判断,这样的样本才算一致地可靠。基于这两个互补准则筛出可靠子集 \(\mathcal{D}_{\text{sub}}\):既要有 \(W^{(i)}_{\text{ssft}}\ge\delta_{\text{sup}}\)(统计上足够自信),又要有 \(\mathrm{Var}_p(W_p^{(i)})\le\sigma_{\text{inf}}\)(动力学上足够稳定)。

用方差而不是只卡阈值,是本设计区别于常规"高置信样本筛选"的地方:一个样本可能在某条轨迹下得分很高、另一条下很低,单看均值会被平均假象骗过,而方差恰好把这种"靠运气的高分"暴露出来。⚠️ 两个阈值 \(\delta_{\text{sup}}\)\(\sigma_{\text{inf}}\) 的具体取值正文未给出,以原文为准。

3. TIAT 辅助目标:让学生对齐一个"降噪过"的教师检查点,而不是直接回归原轨迹

SGR 只解决了教师一侧的问题——它让教师轨迹本身更干净,却没有机制约束学生在对齐过程中如何吸收这些信号。残留的噪声和轨迹上局部不稳定的区域仍然可能被学生拟合进去,表现为决策边界漂移、泛化受限。TIAT 于是在学生一侧补上一个正则:用上一步筛出的可靠子集 \(\mathcal{D}_{\text{sub}}\),对教师检查点 \(\theta^*_t\) 做几轮短微调(沿用原教师同样的学习协议,但只用高置信样本),得到一个"噪声被抑制的轨迹延续" \(\theta^{\text{ft}}_{t+M}\);再要求学生在合成集上走 \(N\) 步后的参数位移,对齐到这个降噪检查点的位移上,损失形式与主轨迹损失完全同构:

\[\mathcal{L}_{\text{aux}}=\frac{\big\|\hat\theta^{(i)}_{t+N}-\theta^{\text{ft}}_{t+M}\big\|_2^2}{\big\|\theta^{\text{ft}}_{t+M}-\theta^{*}_{t}\big\|_2^2}\]

之所以说它比直接回归教师轨迹更稳:原轨迹的终点 \(\theta^*_{t+M}\) 仍然携带着噪声样本造成的参数扰动,直接拟合等于把这些扰动当作"正确答案";而 \(\theta^{\text{ft}}_{t+M}\) 是在干净子集上继续训练出来的,它代表"如果没有这些噪声、教师本该走到哪里",学生对齐它就同时获得了一个把噪声方向推开的力。整个流程不改标签、不删样本,因此保持了标签不变(label-preserving)与轻量。需要强调的一点是:这些高置信真实样本用于微调教师检查点和构造辅助目标,它们与合成样本之间没有配对、索引或一一映射关系,合成集 \(\mathcal{S}\) 不会因此变成"真实样本的复制"。

损失函数 / 训练策略

最终优化目标是主轨迹对齐损失与辅助损失的加权和,\(\beta\in[0,1]\) 控制降噪后的辅助轨迹相对原始教师轨迹的影响(⚠️ 该式在缓存文本中 OCR 损坏,此处按原文对 \(\beta\) 的描述与消融结论复原,以原文为准):

\[\mathcal{L}_{\text{total}}=(1-\beta)\cdot\mathcal{L}_{\text{match}}+\beta\cdot\mathcal{L}_{\text{aux}}\]

关键超参:教师轨迹数 \(P=100\)(沿用 DATM 的设置);SGR 的 KNN 邻域 \(K=10\)、SSFT 平衡系数 \(\lambda=0.6\)、warmup 长度 \(T_{\text{warmup}}=60\);TIAT 的高置信子集比例为 60%、辅助权重 \(\beta=0.1\)。CIFAR-10/100 用 3 层 ConvNet、Tiny-ImageNet 用 4 层 ConvNet,学生与教师同构;评测报告 5 个独立初始化网络在蒸馏集上训练后的测试精度均值与标准差。

实验关键数据

主实验

CIFAR-10 上四种噪声设置(对称/非对称 × 20%/40%),同一列里同时列出 DATM(同骨架基线)与该列最强的其他基线,避免把"骨架的功劳"算成"SOTA":

噪声设置 (CIFAR-10) IPC 本文 DATM 该列最佳基线 相对 DATM
对称 20% 10 64.5 62.7 68.7 (DANCE) +1.8
对称 20% 1000 83.3 81.9 81.9 (DATM) +1.4
对称 40% 10 64.8 58.2 65.8 (DANCE) +6.6
对称 40% 1000 81.4 76.7 76.7 (DATM) +4.7
非对称 20% 10 63.7 61.9 69.2 (DANCE) +1.8
非对称 20% 1000 82.1 80.4 80.4 (DATM) +1.7
非对称 40% 10 58.7 55.5 66.1 (DANCE) +3.2
非对称 40% 1000 75.0 71.4 71.4 (DATM) +3.6

跨数据集与真实噪声(CIFAR-N 用人工多标注者的 CIFAR-10N/100N,"全量数据"列是在噪声全集上直接训练、不做蒸馏的参照):

数据集 / 噪声 IPC 本文 最佳基线 全量数据
CIFAR-100 对称 40% 100 52.8 44.4 (DATM) 39.9
CIFAR-100 非对称 40% 100 40.7 36.0 (DATM) 33.0
CIFAR-100N 真实噪声 10 41.0 42.0 (DANCE) 44.4
CIFAR-100N 真实噪声 50 45.9 43.9 (DATM) 44.4
CIFAR-10N Aggre (9.03%) 1000 83.4 83.0 (DATM) 82.5 (DANCE 报告的全量)
CIFAR-10N Worst (40.21%) 1000 79.2 75.3 (DATM) 67.1
Tiny-ImageNet 对称 20% 10 30.8 30.4 (DATM) 30.0
Tiny-ImageNet 对称 40% 10 30.1 28.2 (DATM) 22.6

消融实验

在 DATM 上逐级加模块(CIFAR-10;括号内为相对 DATM 的提升):

配置 对称 20% @50 IPC 对称 40% @10 IPC 非对称 40% @1000 IPC
DATM 71.7 58.2 71.4
+ SGR 72.8 (↑1.1) 62.9 (↑4.7) 73.3 (↑1.9)
+ SGR + TIAT 73.5 (↑1.8) 64.8 (↑6.6) 75.1 (↑3.7)

辅助权重 \(\beta\) 与高置信子集比例的敏感性(CIFAR-10,IPC=50):

β 子集 60%,对称 20% 子集 60%,对称 40%
0.1(默认) 73.5 71.5
0.5 73.4 72.2
1.0 69.6 71.7

效率开销(CIFAR-10,单张 RTX 3090,与 DATM 同为 TESLA 式省显存实现):

IPC 峰值显存 DATM 训练时长 本文训练时长 开销
10 2.5 GB 6.5 h 7.0 h 1.08×
50 6.2 GB 17 h 25 h 1.47×
500 10.4 GB 24 h 36 h 1.50×
1000 11.6 GB 60 h 70 h 1.17×

关键发现

  • 两个模块分工明确且互补。SGR 在噪声重、IPC 低的格子增益最大(对称 40% @10 IPC 直接 +4.7),说明轨迹级去噪在标签损坏严重、合成样本又少的时候最值钱;TIAT 则在噪声有系统性偏置时相对增益更大(非对称 40% @1000 IPC +3.7),说明"不确定性过滤 + 干净检查点"对结构化噪声特别有用。整体上看高噪声场景 TIAT 贡献更大,低噪声场景两者都稳。
  • 噪声下蒸馏确实成了过滤器:Tiny-ImageNet 40% 对称噪声下本文的 30.1% 远高于在全量噪声集上直接训练的 22.6%;CIFAR-100N 在 50 IPC 时 45.9% 也反超全量数据集的 44.4%。反过来看,随机子集(Subset)基线在同一预算下只有 3–20%,说明"压缩本身"不是增益来源,压缩方式才是。
  • 低 IPC、非对称噪声下 DANCE 仍然更强。非对称 20% @10 IPC 时 DANCE 69.2 比本文 63.7 高 5.5 个点,非对称 40% @10 IPC 也高 7.4 个点。分布匹配类方法不依赖嵌套优化、在极小合成集上更稳,这一点论文正文也承认;本文的优势集中在高 IPC 与高噪声率区间。
  • \(\beta\) 不能调大\(\beta=1.0\)(几乎只优化辅助目标)在对称 20% 下掉到 69.6,比 \(\beta=0.1\) 低 3.9 个点,说明辅助目标必须依附在轨迹对齐之上、只能当正则;\(\beta=0.1\) 与 0.5 接近,作者选 0.1 是因为它在两种噪声率下都稳。子集比例在 50%–70% 区间内不敏感,60% 配合 \(\beta=0.1\) 是默认组合。
  • 教师多样性有用。把 \(P\) 条轨迹的 \(\alpha_{\max}\)\([0,1]\) 上均匀铺开(Diverse Sampling)比固定 \(\alpha_{\max}\)(0/0.5/1.0)在噪声升高时明显更稳,固定的几条会随噪声率出现不可忽视的掉点,说明"注入多样性"本身就是一种鲁棒性来源。
  • 开销主要在训练时间而非显存。可靠性估计与辅助目标构造带来 1.08×–1.50× 的训练时长开销(IPC=500 时最贵),峰值显存与 DATM 基本持平。

亮点与洞察

  • 把两个正交的噪声信号按训练阶段调度起来。SSFT 时间戳答"这个样本在整段训练史里表现如何"(全局、静态、一次性算好),KNN 一致性答"它此刻的邻居怎么看它"(局部、动态、每轮更新),用 \(\alpha_t\) 从 0 线性升到 \(\alpha_{\max}\) 完成"早期信先验、后期信局部"的交接。这个交接点选得有道理:early learning 阶段特征空间还不可靠,KNN 会把噪声样本按错误标签聚成簇,直接信它反而有害。
  • 用跨轨迹方差做可靠性判据,而不是只用均值。多教师集成里最容易被忽略的是"平均看起来很高但意见分歧很大"的样本;把方差显式写进筛选条件,等于要求样本在完全不同的静态-动态配比下都被判为干净,这是一个便宜且有效的鲁棒性来源,可以直接迁移到任何多轨迹/多视图蒸馏或伪标签筛选场景。
  • "干净子集"的用法被换掉了。传统 LNL 拿干净样本去选样本或改标签,本文只拿它微调出一个降噪的教师检查点,剩下的全部交给一个与主损失同构的辅助对齐项。这样既不破坏标签不变性,也不引入硬筛选带来的样本丢失,思路可以迁移到"用干净锚点构造参考轨迹"的其他蒸馏/微调管线(例如 RLHF 里用一个干净偏好子集微调出参考模型来约束策略)。
  • 归一化的对齐损失设计值得复用。分子量"学生走了多远、离目标差多少",分母量"教师在该区间自身走了多远",后者把不同锚点、不同训练阶段的位移尺度差异消掉;这个尺度不变的形式让多锚点联合优化不至于被近端锚点主导。

局限与展望

  • 只在图像分类上验证。CIFAR-10/100、Tiny-ImageNet、CIFAR-N 是全部实验对象,没有更大规模(如 ImageNet-1K 子集)或检测/分割等下游任务,泛化性证据限于小分辨率分类。
  • 强依赖轨迹匹配骨架,代价不低。方法挂在 DATM 上,必须先训练 \(P=100\) 条教师轨迹,IPC=1000 时单卡训练 60→70 小时;对不需要嵌套优化的分布匹配类 DD(DANCE、M3D 等)不能直接套用,这限制了适用面。
  • 阈值 \(\delta_{\text{sup}}\)\(\sigma_{\text{inf}}\) 无敏感性分析。正文给出了子集比例与 \(\beta\) 的网格,却没有这两个筛选阈值的取值与消融(⚠️ 正文未给出,以原文为准),可靠子集的构造因此不完全可复现。
  • 非对称与低 IPC 区间仍落后。在极小合成集上分布匹配类方法明显更强,论文对此只有定性解释;如果能把 SGR 的权重逻辑迁移到分布匹配的损失项上,可能补齐这块短板。
  • 与基线数字存在小幅不一致。CIFAR-10 非对称 40% 的 DATM 在 Table 1 记 55.5、Table 6 记 55.9,@50 IPC 与 @1000 IPC 的本文结果为 67.0/75.0(Table 1)与 67.1/75.1(Table 6)。差异在标准差量级内,此处按各自表格原样列出,不做统一。
  • 命名容易误导。标题里的 "trajectory distillation" 实指 trajectory matching 框架下的数据集蒸馏,与扩散模型/强化学习语境下的"轨迹蒸馏"无关,读者读摘要时需注意上下文。

相关工作与启发

  • vs DATM (difficulty-aligned trajectory matching): DATM 是本文的骨架——同样做轨迹匹配,用难度对齐的方式挑选匹配区间;本文在它之上加 SGR(改教师轨迹的样本权重)与 TIAT(加辅助对齐目标),消融表也是从 DATM 起底逐级加模块。区别在于 DATM 完全假设标签干净,噪声进来时没有任何防御机制。
  • vs DANCE (dual-view distribution alignment): DANCE 做分布匹配,不需要嵌套优化,因此在低 IPC 与非对称噪声下仍然很有竞争力(非对称 20% @10 IPC 领先本文 5.5 个点),但精度随 IPC 增大基本饱和(CIFAR-100N 上 50 IPC 反而低于 10 IPC),说明它从更多合成样本里榨不出更多干净监督;本文的轨迹匹配骨架在高 IPC 时持续获益。
  • vs RDED / RCIG: RDED 主打效率与真实感、RCIG 用凸化隐式梯度,两者在噪声下退化很快——RDED 在高 IPC 直接不再报告结果(降幅过大),RCIG 在所有设置上都明显低于本文。它们的效率优势在噪声场景里换不来鲁棒性。
  • vs 传统噪声标签学习(small-loss 选择、Co-teaching、Meta-Weight-Net 等重加权、标签纠正): 这些方法把噪声估计与模型优化耦合在同一个回路里,模型既是检测器又是预测器,确认偏差会被自我放大,通常还需要干净验证锚点或反复迭代精修。本文把"降噪"上移到教师轨迹层,不改标签、不删样本、不需要干净锚点,恰好符合蒸馏场景对"紧凑、即插即用监督"的要求——这也是论文动机里最核心的一条论据。

评分

  • 新颖性: ⭐⭐⭐ 两个模块都是已有思路的组合与迁移(SSFT 遗忘先验、KNN 一致性、多教师方差筛选、辅助蒸馏目标),但"把降噪搬到教师轨迹这一层 + 用降噪检查点当辅助目标"的组合视角在噪声数据集蒸馏这个具体问题上是有价值的,且论文的动机论证(LNL 的耦合困境 vs DD 的即插即用需求)比方法本身更亮。
  • 实验充分度: ⭐⭐⭐⭐ 覆盖对称/非对称/真实三种噪声、四个数据集、四个 IPC 档位,消融覆盖模块、\(\beta\)、子集比例与效率;不足是缺少筛选阈值的敏感性分析、没有更大规模任务,正文里两处与表格的数字有小出入。
  • 写作质量: ⭐⭐⭐ 动机与三个挑战的表述清楚,图示流程完整;但公式 OCR/排版质量差(多处公式在论文 PDF 抽取后即损坏),部分符号定义(阈值取值、\(s^{(i)}\) 的确切形式)缺失,标题用词 "trajectory distillation" 容易与扩散/RL 语境混淆。
  • 价值: ⭐⭐⭐⭐ 对"噪声监督下的数据压缩"这一交叉方向给出了一个轻量、标签不变、可挂到任意轨迹匹配式 DD 上的插件方案,且在不改动标签的前提下把鲁棒性提升做实(40% 噪声下 +4.7–6.6),对实用数据管线有直接参考价值。