跳转至

The Shape of Events: Edge-Based Inductive Biases via Cross-Domain Distillation

会议: NeurIPS2026
arXiv: 2609.30478
代码: https://github.com/snskysk/event2rgb-distillation
领域: 事件视觉 / 可解释性
关键词: 事件相机、跨域知识蒸馏、形状偏置、边缘结构、频谱权衡

一句话总结

本文把标准知识蒸馏用作分析工具,将事件域教师的预测迁入RGB学生,发现颜色变化耐受性、形状偏好及高频带噪声耐受性可以共同迁移,但伴随干净准确率下降和对几何连续性破坏的敏感,而不是获得全面鲁棒性。

研究背景与动机

ImageNet训练的CNN往往能利用局部纹理完成分类,但这类线索会随颜色、成像条件和分布变化而失效。事件相机记录的是像素亮度随时间的变化,而非完整RGB外观:静止均匀区域通常没有事件,运动把空间亮度梯度转换成时间变化后,轮廓和边缘更容易被保留下来。不过,纹理也可能因运动产生事件,因此不能把事件输入简单等同于“没有纹理的形状图”。真正的问题是这种传感器选择性如何影响网络学到的表征。

直接研究事件域表征受到评测工具不足的限制。RGB领域已有ImageNet-C、形状与纹理冲突图、形状信息保留测试等诊断资源,事件域缺少同样成熟的工具。作者因此反转常见的RGB到事件蒸馏方向:先让事件教师指导RGB学生,再在RGB域检验学生的行为。这不是寻找更小的网络,也不是以ImageNet准确率为首要优化目标,而是在熟悉的评测空间观察异质监督迁移了什么。

这种迁移又给机制分析提供了对照:若灰度教师、二值教师、RGB边缘教师或静态图像差分代理能够复制所有现象,那么事件监督可能并无独特作用。论文实际关注的是多个诊断轴上的联合表现,而不是宣称颜色不变性或高频耐受性只能来自事件数据。核心 idea:用配对事件—RGB样本上的标准logit蒸馏,把事件域的亮度梯度选择性迁入RGB表征,再用互补诊断辨别边缘结构先验及其代价。

方法详解

整体框架

训练输入是一一对应的ImageNet RGB图像和N-ImageNet事件样本。冻结的DiST ResNet-34教师读取事件表示,RGB ResNet-34学生一方面学习分类标签,另一方面匹配教师的类别概率;训练结束后,学生仅依赖RGB输入,不需要事件相机或教师。

分析流程由“配对事件监督”“双分支蒸馏”“互补诊断”组成。前两部分生成可比较的RGB模型,最后一部分从颜色、形状、频率和迁移表现检验表征变化;诊断并非额外训练损失。下图实线表示训练数据与监督流,虚线表示训练完成后的RGB评测路径。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    I["配对事件与RGB<br/>及分类标签"] --> P["配对事件监督<br/>冻结DiST教师"]
    I --> D["双分支蒸馏<br/>RGB弱视图KL / 强视图CE"]
    P -->|事件软标签,仅训练| D
    D --> S["训练后的RGB学生"]
    S -.->|仅RGB推理,非训练监督| A["互补诊断<br/>颜色 / 形状 / 频率 / 迁移"]

关键设计

1. 配对事件监督:把传感器选择性变成可迁移的类别分布

N-ImageNet通过事件相机重新拍摄显示器上的ImageNet图像,保留相同的1000类及实例对应关系。蒸馏时,教师不是读取学生当前RGB视图,也不是给整个类别提供一个固定模板,而是读取该RGB实例对应的事件样本。实例配对让每次KL比较有明确语义:两个域描述同一个对象,学生需要复现教师在这份事件证据下对各类别的相对判断。

主实验直接使用公开DiST ResNet-34权重,教师保持冻结,在N-ImageNet验证集上的top-1为48.43%。教师和学生采用相同骨干,有利于把主要区别放在监督来源上,而不是模型规模上;但教师准确率与RGB基线的73.90%来自不同输入域,不能据此直接给教师能力排序。教师较弱及其输出熵仍可能影响学生,作者提供行为一致性论证,却没有做输出熵匹配的因果对照。

事件输入的关键是亮度梯度选择性,而非所有事件硬件优势。显示器重采样没有检验真实场景HDR,也没有深度运动视差。因此,这套实验最多支持“这种事件训练分布能传递特定结构先验”,不能直接推广为原生动态事件数据在所有条件下的优势。

2. 双分支蒸馏:保留RGB分类监督,同时接收事件教师约束

同一个RGB实例分别经过强、弱两套增强。强视图用于真实标签交叉熵,弱视图用于匹配事件教师的温度软化输出。这样,强增强提供常规RGB分类能力,较稳定的弱视图承担跨域类别分布匹配;两项损失更新同一个学生,而不是训练两个独立学生或在推理时融合双路预测。

主模型ED_Student取\(\alpha=0.2\),纯软标签模型ED_SoftLabelOnly取\(\alpha=1.0\),RGB基线取\(\alpha=0\)。纯软标签设置移除了RGB真实标签监督,更突出事件教师的行为特征,但干净准确率只有53.50%;混合设置恢复到69.70%,仍低于基线73.90%。因此,ED_SoftLabelOnly更像机制探针,ED_Student则检验结构先验在保留实用分类能力时是否仍然存在。

弱RGB视图采用固定Resize与CenterCrop,事件侧却独立采样时间翻转、水平翻转和空间平移,两域并未逐次同步空间视图。类别概率匹配不要求像素对齐,但“类别不变”并不等于“预测分布不变”。作者将不对称视图解释为随机正则化,并承认没有实验隔离该混杂因素;笔记因此不把视图不匹配已被排除写成定论。

3. 互补诊断:用行为变化与失效边界共同约束机制解释

颜色轴通过色相旋转和灰度输入观察预测是否依赖颜色;形状轴同时使用形状—纹理冲突、ImageNet-Sketch、二值图、Canny边缘和轮廓掩码。形状偏置按16类restricted-argmax协议统计,在形状类或纹理类两种有效选择中,形状选择所占比例更高,表示相对偏好向形状移动。这个比例不是整体分类准确率,也不证明模型严格只依赖形状;ED_Student的0.375仍远低于人类参考0.959。

另外,patch-shuffle与patch-rotation保留一定的块内局部线索,却破坏跨块几何连续性。事件蒸馏学生对此下降更明显,与冲突图中的偏好变化相互补充。这类受控信息抑制提供机制证据,但不能与形状偏置指标互换,也不能把所有几何变化都视为同一种因素。

频率轴区分“去掉不依赖的纹理”和“污染依赖的频带”。JPEG压缩移除部分高频细节,仍可能保留轮廓,因此学生较耐受;严重像素化、模糊或形变会破坏边缘连续性,优势可能消失甚至反转。宽带噪声也污染低中频结构,所以对高频带噪声更耐受不意味着对Gaussian、shot或impulse噪声全面更好。本文只报告这些防御性测量结论,不展开扰动构造或优化操作。

内部证据来自早期层滤波器、相关性和跨模型层间相似度。ED_SoftLabelOnly的首层明显更平滑、相关性更高;ED_Student的首层平均相关性却接近基线,不能把纯软标签模型的现象直接移植为主模型的解释。附录C.4.2进一步发现两个事件学生在layer1的平均最大滤波器余弦相似度为0.161,高于基线—ED_Student的0.142;作者据此把变化主要定位到早期表征,而非仅凭首层一个标量解释全部行为。

输入统计也提供上游线索:在相同中间频段拟合的径向PSD幂律指数,ImageNet为2.46,N-ImageNet为1.48,后者频谱更平坦。这不与RGB学生较少利用无结构高频纹理矛盾:数据中相对强调的边缘并不只位于极高频,低中频也承载宽轮廓与连续梯度。频谱统计、滤波器与行为结果组成一致的假说证据链,但不是完整的因果证明。

一个完整示例

以一对N-ImageNet事件样本与其ImageNet RGB原图为例:冻结DiST教师读取事件并输出类别分布,学生在RGB弱视图上匹配该分布,同时在RGB强视图上用真实类别计算CE。这里描述的是单个训练实例的数据流,不假定某张图的具体概率或局部边缘。

训练完成后只输入RGB。表14中ED_Student的干净准确率为69.70%,低于baseline的73.90%,但Canny输入为13.27%,高于10.83%。这一组整体测试结果说明迁移后的结构偏好可能改善特定信息移除条件,不能反推该实例一定预测正确,也不能把事件教师带入RGB推理流程。

损失函数 / 训练策略

本文使用标准知识蒸馏目标,没有提出新的蒸馏损失。保留原文式(1),其中KL中的两个分布均由温度软化logits得到,CE则承担普通真实标签分类监督:

\[ \mathcal{L}=(1-\alpha)\,\mathcal{L}_{CE}\bigl(y,\,p_s(x_{\text{strong}})\bigr)+\alpha\,T^2\,\mathcal{L}_{KL}\bigl(p_t(x_{\text{event}}),\,p_s(x_{\text{weak}})\bigr). \]

这里\(y\)是真实标签,\(x_{\text{strong}}\)和\(x_{\text{weak}}\)来自同一RGB实例,\(x_{\text{event}}\)是配对事件样本,\(p_t\)、\(p_s\)分别表示教师和学生输出。所有KD学生固定\(T=3.0\)。

“soft:hard = 2:8”仅描述\(\alpha\)与\(1-\alpha\)在乘\(T^2\)前的约定。ED_Student的KL系数实际为\(0.2\times3^2=1.8\),CE系数为0.8;这既不是有效损失贡献2:8,也不是梯度贡献2:8。作者没有测量两项的相对梯度,因此不能用该简称证明CE在某层必然占主导。

主实验的baseline、ED_Student和ED_SoftLabelOnly使用AdamW、batch size 512、学习率\(2\times10^{-3}\)、weight decay \(5\times10^{-2}\),训练120 epochs,先5 epochs线性warmup,再cosine衰减;共同随机种子为1。主ResNet-34设置没有MixUp或CutMix,300 epochs的强配方复验是单独实验。

下游采用严格线性探测:冻结整个骨干,仅训练新线性分类层。各数据集共用50 epochs、batch size 1024的SGD设置,但每个模型—数据集组合跑两个种子,表1报告两者最佳验证准确率中的较高者,而非均值与标准差。这个协议衡量冻结表征的可迁移性,不能等同于全量微调能力。

实验关键数据

主实验

下表选自原文表14,数值为top-1准确率(%)。Sketch是独立ImageNet-Sketch数据集,不是对ImageNet验证图像作变换;其他信息移除条件对应验证图像的处理版本。

模型 干净RGB 灰度 Sketch B&W Canny Silhouette
baseline 73.90 62.45 23.70 41.39 10.83 3.30
ED_Student 69.70 64.64 28.08 49.01 13.27 5.43
ED_SoftLabelOnly 53.50 52.58 24.47 34.87 11.45 5.42
Gray Distilled 74.60 69.51 25.60 45.56 7.87 3.63
SIN 72.18 62.53 30.84 51.62 25.77 5.38

ED_Student干净RGB损失4.20个百分点,但灰度、Sketch及三类进一步信息移除输入均超过baseline。Gray Distilled的灰度准确率更高,SIN在Sketch、B&W和Canny上更强,因此事件蒸馏不是每个单独指标的最优解;Silhouette准确率也仅5.43%,不能描述为充分解决了纯轮廓识别。

表1的19个下游任务平均线性探测准确率由73.5%升至75.1%,平均增益1.6个百分点。其中CIFAR-100、CIFAR-10、Chest X-ray和MNIST分别提高5.2、4.8、4.3和3.4个百分点;Oxford-IIIT Pet与Food101分别下降0.1和0.4个百分点。平均值不包含预训练ImageNet,也不能跨任务视为样本加权总体准确率。

消融实验

下表选自原文表2。Clean是绝对准确率;其余四列均是相对baseline的百分点变化,正号统一表示改善。高频列度量\(0.95\pi\)频带噪声下准确率下降量减少多少,不是扰动后的绝对准确率。

监督方式 Clean(%) 色相平均增益 Sketch增益 高频下降量改善 线性探测平均增益
ED_Student 69.7 +3.6 +4.4 +17.4 +1.6
Canny_Distilled 71.1 +4.3 +4.2 −5.9 +0.2
Synth_Distilled 71.8 −3.4 −3.2 +18.9 −5.4
Adversarial Training 66.0 −11.2 −2.4 +28.1 −1.8
Noise Training 74.4 +0.8 +1.7 +13.4 −0.8
SIN 72.2 +0.5 +7.1 +19.3 −0.9

baseline在这四轴上的参考值依次为色相平均61.8%、Sketch 23.7%、高频准确率下降29.6个百分点、线性探测平均73.5%。ED_Student的高频下降仅12.2个百分点,对应表中的17.4个百分点改善。各鲁棒化基线使用自己的训练配方,而非除监督来源外完全一致的设置。

Canny教师来自RGB边缘图,能复制颜色和Sketch方面的收益,却不能复制高频耐受性及平均迁移增益。Synth教师来自静态RGB增强视图的灰度差分ON/OFF代理,不是真实事件传感器或事件模拟器输出;它具有高频耐受性,却在颜色、Sketch及平均迁移上退步。结论是已测试的非事件监督没有复制四轴联合表现,而不是证明事件数据对任何单项性质不可替代。

以下为原文表15的机制分析,不是独立性能消融。RGB Correlation描述首层滤波器的跨RGB通道相关性,Spatial Autocorrelation描述相邻像素空间自相关;全文没有给出更细的聚合计算公式,故不猜补精确实现。

模型 RGB Correlation Spatial Autocorrelation
baseline 0.549 0.391
ED_Student 0.544 0.398
ED_SoftLabelOnly 0.747 0.575

关键发现

  • 形状偏置从baseline的0.212升至ED_Student的0.375,纯软标签模型为0.487;这支持偏好迁移,而不是严格依赖性证明,也不是达到人类0.959的水平。
  • ImageNet-C覆盖19类损坏,但收益不均匀。JPEG和fog较有利,严重pixelate、contrast、elastic_transform及部分blur条件会反转;宽带噪声也可能与baseline相当或更差。
  • 五种架构的有限防御性测量中,ED_Student仅在30种架构—评测—预算组合中的19种超过baseline;11种例外主要集中在ConvNeXt-Base和RepLKNet31B,不能写成跨架构一致提升。
  • 防御性对抗测量结论限于\(0<\epsilon\leq1/255\)及原文有限评测,未覆盖更大预算或AutoAttack。强训练配方复验下该轴的优势消失,而颜色、Sketch、高频带和迁移增益仍存在。
  • 强配方表12的clean top-1为75.92%对70.80%,Sketch为26.98%对28.94%,下游平均为74.19%对75.45%。收益保留仍伴随更低clean准确率,不能说更强训练消除了代价。

亮点与洞察

  • 把蒸馏变成测量桥梁。 事件域缺少成熟诊断,不必先建立所有工具才能分析它;把监督迁入RGB学生后,可以调用现有受控评测。新意在实验问题与跨域设置,而非更复杂的loss。
  • 联合行为比单项胜出更有信息。 Canny、Synth和SIN各能复制部分优点,却不能在四轴同时改善。这个结果把“事件特有”限定为当前对照中的联合轮廓,避免以单个指标作过强归因。
  • 失败边界也支持机制。 如果模型更重视边缘连续性,几何破坏时更脆弱并非意外,而是预测得到的代价。对纹理去除和结构污染作区分,比把所有损坏统称噪声更有解释力。

局限与展望

  • 数据覆盖有限。 显示器重采样隔离的是亮度梯度选择性,不验证HDR或真实三维运动视差;原生配对事件—帧数据才能检验这些外推。
  • 机制仍有混杂。 教师置信度、跨域视图不匹配,以及纯软标签模型缺少强CE增强没有被完全隔离。未来需要熵匹配教师和增强匹配对照,而不能把作者的解释性论证当作消融证实。
  • 容量与任务边界。 验证集中在CNN图像分类,大骨干收益减弱;ViT、检测与分割尚未验证。logit蒸馏也未与特征级蒸馏充分比较。
  • 统计报告不足。 主训练共用单个种子,下游取两个种子中的较优验证结果,没有报告方差;收益是否稳定以及模型选择造成多大偏差仍需重复实验。
  • 准确率代价真实存在。 纯软标签并非可直接部署的通用替代品,混合监督也损失clean准确率。应用应依据预计分布变化和结构线索价值判断,而不是以形状偏置更高作为单一选型准则。

相关工作与启发

  • vs 标准KD与跨模态蒸馏:沿用Hinton等的软标签框架,目标不是压缩或提升新任务准确率,而是通过事件到RGB的方向分析异质监督。DeiT与Patient Teacher提供双视图训练背景,但不能替代本实验的视图一致性验证。
  • vs Stylized-ImageNet / SIN:SIN通过风格化降低纹理捷径,某些形状输入上明显更强;本文的区别是颜色、频率与冻结表征迁移的联合权衡,不是声称形状偏置绝对最高。
  • vs Burgert等的受控抑制分析:冲突图测得的是选择偏好,严格依赖需要补充信息抑制证据。本文的patch诊断与形状输入测试增加了证据,但仍需保留测量间的区别。
  • 研究启发:比较原生事件监督、事件表示方法与熵匹配RGB教师,观察早期层表征及冻结迁移是否共同改变,可进一步区分传感器统计与蒸馏正则化的作用;这是待验证方向,不是本文已完成结论。

评分

  • 新颖性: 4/5 — 用事件到RGB蒸馏做表征诊断,贡献清晰,但蒸馏目标本身是标准方法。
  • 实验充分度: 4/5 — 多轴对照、非事件监督和强配方复验丰富,因果混杂与统计不确定性仍未充分隔离。
  • 写作质量: 4/5 — 主线连贯,附录补充了首层相关性与鲁棒性边界;若干强机制措辞需要结合限定理解。
  • 价值: 4/5 — 提供分析事件监督的新路径及可迁移结构先验证据,但不是全面鲁棒化或无代价精度提升。