Beyond Missing Rates: Rethinking Incomplete Multi-View Clustering with Protocol Divergence¶
会议: NeurIPS 2026(Poster)
arXiv: 2606.04857
代码: https://github.com/dk23lhl/CRAFT
领域: 自监督/表示学习
关键词: 不完整多视图聚类、协议分歧、观测支持、掩码注意力、一次训练多场景部署
一句话总结¶
论文用实际缺失率与完整样本比例揭示不完整多视图聚类的评测协议分歧,并提出只融合当前样本已观测视图的 CRAFT:在信息匹配的不完整训练中赢得 13 个条件中的 12 个,另以完整视图训练后的固定检查点评测跨协议部署。
研究背景与动机¶
不完整多视图聚类(Incomplete Multi-View Clustering,IMVC)希望在部分传感器、模态或特征源缺失时,仍把无标签样本组织成有意义的簇。COMPLETER、DCP、DCG 等方法利用同一样本的共观测视图学习跨视图预测或重建,但“缺失率为 0.5”并没有说明这些监督还剩多少。若只是让一半样本各少一个视图,六视图数据实际仅缺少约 8.3% 的条目;若在全部条目中删除一半,观测信息与完整样本支持都会明显减少。沿用同一个名义缺失率横向比较,容易把不同数据难度误当成算法差异。
这不只是评测标签问题,还涉及重建分支究竟靠什么训练。要求全部视图同时出现的损失依赖完整样本;只要求特定视图对的损失依赖该视图对的共观测概率,两者不能混为一谈。另一方面,为每一种缺失配置重新训练,回答的是模型能否适应已知缺失分布;从完整视图训练一次、部署后不再更新,回答的则是固定模型能否处理变化的观测集合。本文同时研究这两个问题,但把它们分开报告:完整视图预训练带来的信息优势不能包装成信息匹配的不完整训练优势。
CRAFT 因而没有简单否定重建,而是把“训练时如何学到表示”与“推理时如何接受缺失输入”拆开。训练时重建仍提供主要信号;推理时则让缺失视图在注意力中严格退出,不需要补齐后再聚类。核心 idea:用观测结构而非单一名义缺失率刻画任务,并以逐样本、掩码感知的共享融合模型,分别检验不完整训练能力和固定检查点的跨缺失配置部署能力。
方法详解¶
整体框架¶
本文首先审计缺失协议及其隐藏观测分布,再给出 CRAFT(Co-occurrence-free Robust Attention-masked Fusion Transformer)。CRAFT 接收一个样本的已观测视图和缺失掩码,经视图专属 MLP 编码后,用带可学习 CLS token 的 Transformer 融合,最后由余弦 softmax 聚类头输出簇分布。
网络流程依次包含“逐样本掩码融合”“两阶段表示与聚类训练”“掩码微调”。后两者只属于训练路径:默认部署训练从所有视图可用的数据开始,第一阶段学习表示,第二阶段用自标注对齐聚类结构,随后可选地增加掩码微调(Masked Fine-Tuning,MFT);最终检查点冻结后,推理只保留编码、掩码融合和共享聚类头,不执行解码重建、伪标签刷新或优化。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["样本视图 + 掩码"] --> B["逐样本掩码融合<br/>视图编码 → CLS → 余弦头"]
B -->|训练:默认完整视图| C["两阶段表示与聚类训练<br/>重建与一致性 → 自标注"]
C -->|训练:可选续训| D["掩码微调<br/>视图子集与 KL 一致性"]
C -->|不启用 MFT| E["冻结最终检查点"]
D --> E
E -.->|固定参数| B
B -->|推理:仅已观测视图| F["簇分布 / 簇标签"]
这个图描述网络,不把四种协议画成串行模块:协议是决定输入掩码分布的评测条件,不是 CRAFT 的四个处理阶段。信息匹配实验另用每个条件真实可见的输入与监督训练自己的模型,不能沿用图中默认完整视图监督。
关键设计¶
1. 逐样本掩码融合:让缺失视图真正退出当前样本的计算
CRAFT 的两个架构条件分别是 C1:固定共享参数后,某个样本的融合表示只依赖它自己的已观测视图,不依赖其他样本的缺失模式;C2:融合函数对任意非空观测子集都有定义,并且只聚合已观测视图。C1 不是说训练完全没有跨样本统计,第二阶段的批平均熵正则就会汇总多个样本;它限定的是前向表示的数据依赖,也不要求训练期间从未见过完整样本。
实现中,各视图的专属编码器把不同维度特征映射到相同嵌入空间,前面加入始终有效的 CLS token。固定槽位实现仍保留全部视图位置,但逐样本 key-padding mask 把缺失位置的注意力 logit 设为负无穷,因此这些位置不进入 softmax 的有效分母,权重严格为零。缺失位置是否存放零值或占位内容不再影响 CLS 聚合;这与只填零、填均值或学习一个缺失 token 不同,后者若不掩码,仍可能占据注意力质量。
输出取 CLS 的隐藏表示,余弦 softmax 头用单位范数簇原型计算缩放后的余弦相似度,再产生簇概率。所有观测子集共享同一个融合网络和同一个聚类规则,不为每一种缺失模式另设分类头。注意力可以根据当前内容改变已观测视图的权重,但“接受任意非空子集”不等于“删除信息量大的视图也不掉精度”。固定槽位矩阵也不会因为观测视图减少而自动缩小,不能把可变观测集合误写成推理复杂度必然随剩余视图数降低。
2. 两阶段表示与聚类训练:先保留多视图结构,再把表示推向簇结构
第一阶段从融合表示分别解码回各视图特征,以平方重建误差约束表示不要丢掉输入结构;同时,对同一样本不同视图的嵌入加入 SimSiam 风格的一致性。具体做法是让一个视图的嵌入经过预测器,朝另一个视图的停止梯度嵌入对齐,遍历有序视图对并最小化负余弦相似度。它不是把不同样本当负例的对比损失,也不是仅对最终簇概率做一致性。
默认部署训练中全部视图可用,因而每个视图都能作为重建目标、每个视图对都能提供一致性监督。信息匹配的不完整训练则仅编码已观测输入、仅对已观测条目计算重建目标,一致性按有效观测视图对平均;只有一个视图的样本该项为零。方法名中的“co-occurrence-free”不能读成所有训练监督都不依赖共观测:本文的默认训练确实利用完整数据,配对一致性也有有效视图对条件。被消除的是推理时对其他样本完整性和缺失视图补全的输入依赖。
第二阶段不再只要求“能解释输入”,而要求输出形成可用簇划分。每个 epoch 开始刷新伪标签,以当前簇概率最大的簇作为自标注目标,再对余弦 softmax 输出计算交叉熵,联合微调表示与聚类头。批平均预测的负熵作为反塌缩正则:最小化它鼓励平均簇分布更均匀,避免所有样本挤进单一簇。普通第二阶段关闭子集 KL 项;有了训练结构的表示才进入自标注,而不是从随机表示直接依靠伪标签自我强化。
3. 掩码微调:用部署时的同一种掩码机制继续训练子集鲁棒性
MFT 从第二阶段检查点继续优化,不是对每个测试协议分别重新训练。每个样本随机抽取要删除的视图数,再随机选择被删除视图;每次至少保留两个视图。同一样本的两个采样子集分别经过掩码融合,在自标注与熵正则之外,对两者簇预测加入 KL 一致性。这样可以要求共享聚类规则对多种观测集合保持协调,而不学习某个固定部署缺失率的专属模型。
删除数量在从零到总视图数减二之间均匀采样,所以不同大小子集被等权抽到,并不是所有具体子集等概率。例如六视图时会涉及 57 个保留至少两个视图的子集;两个视图时只能抽到删除零个视图,MFT 不发生视图删除。后者若有性能变化,只能涉及额外续训或独立特征噪声等因素,不能解释成学会了单视图遮挡。网络推理仍支持单视图输入,但 MFT 的采样规则本身没有覆盖这种边界。
4. 协议与监督支持审计:分清缺了多少信息、哪些损失仍能学习
本文把名义缺失率记作 \(r\),把真正缺掉的“样本—视图条目”比例记作 \(\hat r\),把所有视图都在的样本比例记作 \(p_c\)。掩码 \(M_v^{(i)}\) 为 1 表示样本 \(i\) 的视图 \(v\) 被观测;二者的定义如下,而不是把 \(r\) 直接当实际条目缺失率。
四种协议都保证每个样本至少有一个视图,但删除预算与分配方式不同。下面为固定视图数、样本数趋于无穷时的公式;协议 4 在有限样本中是固定预算、无放回删除,条目之间并非独立 Bernoulli。
| 协议 | 删除机制 | 实际缺失率 \(\hat r\) | 完整样本比例 \(p_c\) |
|---|---|---|---|
| P1 | 选取比例 \(r\) 的样本,各随机删除一个视图 | \(r/V\) | \(1-r\) |
| P2 | 每样本保护一个视图,其余视图以 \(r/(V-1)\) 独立删除 | \(r/V\) | \((1-r/(V-1))^{V-1}\) |
| P3 | 全部条目以 \(r\) 独立删除,空样本随机恢复一个视图 | \(r-r^V/V\) | \((1-r)^V\) |
| P4 | 每样本保护一个视图,从其余条目中无放回删除固定预算 | \(\min(r,(V-1)/V)\) | \([\max(0,1-Vr/(V-1))]^{V-1}\) |
因此,“隐藏分布”指名义缺失率背后的观测掩码分布,而不只是一个未报告的平均数。六视图、名义缺失率 0.5 时,P1 的完整样本比例为 50%,P4 约为 1.024%,相差约 49 倍;同时实际缺失率也分别为约 8.3% 和 50%。这个对照揭示协议分歧,但并未控制总观测信息,所以不能声称精度差异全由完整样本比例因果决定。即使 \(\hat r\) 与 \(p_c\) 一样,留下的视图身份、视图对支持与信息量也可能不同。
理论分两层。能力界针对任何方法:观测视图集合的簇相关互信息不少于其中最有信息的单视图;只有在视图给定簇标签后条件独立、信息量有限时,才有“不超过各视图互信息之和”的上界。固定编码器还受数据处理不等式约束,但观测集合的信息下界不能转移给学到的表示,一个常数编码器就能丢掉全部信息。推理时由已观测视图确定性生成的补全结果不会新增信息,这也不否定重建在训练时提供有效梯度。
可训练性界则只针对支持门控重建分支。令 \(q_2(P)=\Pr_{M\sim P}(|O|\geq2)\),在全部抽样样本上归一化、均匀抽样、每个有效样本梯度沿轨迹有统一上界 \(C_g\) 时,该分支的期望梯度范数不超过 \(C_gq_2(P)\)。若只优化此损失、使用固定步长 \(\eta\) 的 SGD 和新鲜独立样本,\(T\) 步的期望参数位移不超过 \(\eta TC_gq_2(P)\)。要求严格完整样本的分支才把 \(q_2\) 换成 \(p_c\);特定视图对还应看该对的共观测概率。
这些假设是结论的一部分,不是技术注脚。只按有效样本归一化时,严格完整分支的相应梯度上界涉及批次至少有一个有效样本的概率,而不是线性乘上 \(p_c\);AdamW 也不能直接套用 SGD 位移结论。其他损失仍可更新共享参数,小位移不必然导致随机聚类,正支持也不保证高精度。六视图 P1 在 \(r=1\) 时每个样本仍有五个视图:\(p_c=0\),但 \(q_2=1\),因此“没有完整样本,所有跨视图重建都失效”是错误泛化。
一个完整示例¶
考虑同一个三视图样本:训练时三种特征都可用,第一阶段从 CLS 融合表示重建三种特征,并让各视图嵌入相互提供停止梯度一致性目标;第二阶段用该样本当前最可能的簇刷新伪标签,推动表示与共享簇原型对齐。
进入 MFT 后,每次可删除零个或一个视图,例如两个采样子集分别保留视图 1、2 和视图 1、3。它们使用相同网络参数,只是 key-padding mask 不同;KL 项约束两次簇预测一致。部署时若只剩视图 2,网络仍能前向:视图 1、3 的注意力权重为零,CLS 汇总视图 2 后交给原有聚类头。这是架构支持的输入边界,不是 MFT 已经训练过单视图样本的证明。
这个例子说明为什么“完整数据训练后冻结部署”不等于“仅有缺失数据时重新训练”。前者的表示与簇原型已经受三视图监督塑造;后者从一开始就拿不到缺失目标,必须按实际观测信息重新构造训练损失。本文把这两种条件作为不同实验,而不是互相替代。
损失函数 / 训练策略¶
保留两阶段目标以展示训练职责:第一阶段是重建加嵌入一致性;第二阶段是自标注交叉熵、批平均负熵及 MFT 子集 KL。普通第二阶段令 \(\gamma=0\),只有 MFT 续训才使用子集 KL。
默认配置用单层、四头 Transformer,AdamW、批量大小 256、权重衰减 \(10^{-4}\)。CUB 的嵌入维度为 128,默认 HandWritten 为 256;MultiFashion 使用浅编码器,其两个普通训练阶段各为 200 epoch,而 CUB 各为 100 epoch。部署配置一次选择后复用最终检查点,不按测试协议再调节;论文也承认历史记录没有完整确定每次检查点选择准则。
MFT 是额外训练预算:HandWritten 与 Out-Scene 为第二阶段后再训练 100 epoch,MultiFashion 为 300 epoch,学习率 \(10^{-5}\),不包含在普通第二阶段 epoch 数内。CUB 的默认部署结果不启用 MFT。CRAFT-Core 则只保留第一阶段重建、余弦头与注意力掩码,联合删除多个训练组件;它与 canonical CRAFT 的差距不能当成 MFT 的单独消融效应。
实验关键数据¶
主实验¶
下面摘取原文表 2 的 ACC(%)。CRAFT per-condition 按每个条件独立训练;CRAFT train-once 从完整视图数据开始训练并复用检查点。CUB 与 MultiFashion 已报告的 per-condition 条件构成信息匹配比较;HandWritten 属于单独的缺失率匹配对照,不能一并计入“12/13”。
| 数据集 | 协议 / \(r\) | CRAFT per-condition | CRAFT train-once | 该条件最高基线 |
|---|---|---|---|---|
| CUB | P1 / 0.1 | 87.17 | 82.09 | Energy-DIMC 75.20 |
| CUB | P1 / 0.7 | 69.00 | 73.61 | DCG 63.50† |
| CUB | P4 / 0.3 | 72.00 | 74.15 | DCG 65.39† |
| CUB | P4 / 0.5 | N/A | 68.99 | Energy-DIMC 42.38 |
| HandWritten | P4 / 0.5 | 91.05 | 93.69 | Energy-DIMC 92.75 |
| HandWritten | P4 / 0.7 | 82.56 | 85.21 | Energy-DIMC 83.26† |
| MultiFashion | P1 / 0.1 | 98.07 | 93.21 | HSACC 97.46 |
| MultiFashion | P1 / 0.7 | 89.61 | 91.97 | COMPLETER 90.09 |
| MultiFashion | P4 / 0.5 | 86.59 | 88.12 | DVIMC 80.43 |
| MultiFashion | P4 / 0.7 | N/A | 85.41 | Energy-DIMC 29.14 |
† 表示一个有效独立 seed。未标记的 CRAFT 与 HSACC 为五 seed 均值;其他基线按附录 A.1 的独立运行记录解释,不能一概称为五 seed。N/A 是未报告的不完整训练结果,不是失败或零精度;MultiFashion P4 / 0.7 的 DVIMC 与 COMPLETER 运行失败,不参与最高基线选择。表 2 的 HandWritten 只在 train-once 行启用 MFT,per-condition 行没有;附录 D.6 的双方均关闭 MFT 对照是另一套训练配方。
完整信息匹配结果是 CUB 的六个条件全部第一、MultiFashion 的七个条件中六个第一。唯一例外为 MultiFashion P1 / 0.7:COMPLETER 90.09、Energy-DIMC 89.90、CRAFT per-condition 89.61。固定检查点覆盖七个数据集、每个四协议乘四缺失率的部署网格,但补充数据集 UCI-Digit、Out-Scene、Caltech 没有重跑基线,YTF-31 仅一个 seed,不能称七个数据集都获得同等强度的 SOTA 验证。
消融实验¶
以下摘取附录表 20,均为 P4 下三 seed 的 ACC 均值 ± 标准差。这组历史消融固定使用 learnable-placeholder 配方,不是表 2 的 canonical 注意力掩码配方,因此只与本表 Full 比较,不能直接相减推断主实验模块贡献。
| 数据集 / \(r\) | Full | No Stage 2 | No Entropy | Recon Only | Repr Only | No Pretrain |
|---|---|---|---|---|---|---|
| HandWritten / 0.5 | 74.42 ± 1.3 | 73.62 ± 1.5 | 73.47 ± 1.6 | 74.22 ± 5.8 | 11.33 ± 0.1 | 43.15 ± 6.4 |
| HandWritten / 0.7 | 54.27 ± 1.9 | 53.67 ± 1.9 | 53.20 ± 1.7 | 54.83 ± 6.8 | 10.46 ± 0.1 | 31.40 ± 4.4 |
| CUB / 0.3 | 68.62 ± 4.4 | 65.63 ± 1.9 | 66.03 ± 2.1 | 73.93 ± 4.8 | 31.60 ± 1.8 | 49.34 ± 1.3 |
| CUB / 0.5 | 61.54 ± 5.7 | 57.99 ± 2.5 | 58.42 ± 2.7 | 69.28 ± 5.5 | 15.34 ± 1.1 | 47.49 ± 3.3 |
Recon Only 去掉第一阶段一致性、仍保留后续训练;Repr Only 去掉第一阶段重建;No Pretrain 完全跳过第一阶段。HandWritten / 0.5 的 Repr Only 比 Full 低 63.09 个百分点,说明本配方中重建是关键锚点;CUB / 0.5 的 Recon Only 反而高 7.74 个百分点,一致性并非普遍有益。表内结果未建立统计显著性。
关键发现¶
- 真正隔离推理缺失处理的是表 4:同一完整视图训练检查点、CUB P4 / 0.5 下,注意力掩码为 63.84 ± 7.9,learnable 为 61.54 ± 5.7,zero 为 58.13 ± 4.4,mean 为 55.89 ± 0.9,均为三 seed。这里不能换用表 2 的 68.99,因为实验配方不同。
- 表 3 在共享编码器、两阶段训练且均无 MFT 时比较融合块:HandWritten P4 / 0.7 的 Transformer 为 79.06 ± 5.7,SetMLP-Light 为 62.09 ± 2.3,SetMLP-Match 为 55.15 ± 1.9,concat 为 56.55 ± 0.7,均为五 seed。满足 C1+C2 的池化方法也能运行,只是这组实验低于注意力融合,不能据此证明 Transformer 是唯一可行结构。
- 两视图 P4 的实际缺失率上限为 0.5,所以名义 0.5 与 0.7 是饱和后的同一掩码分布;CUB train-once 两列同为 68.99 不是两次独立的更强缺失鲁棒性证据。三视图 P4 的上限则为 \(2/3\)。
- MultiFashion 记录的十六次 DVIMC 总训练为 128 分钟、一次 CRAFT 为 14.5 分钟,约 8.8 倍是累计网格成本比;单次 DVIMC 为 8 分钟,反而更短。记录未单列模型选择、搜索和额外 MFT,因此不是完整开发流程的 8.8 倍加速。
亮点与洞察¶
- 把名义缺失率拆成覆盖与监督支持,直接暴露旧协议的隐藏难度差异。进一步按具体损失检查完整样本或视图对支持,比仅报告一个总体缺失比例更有诊断价值。
- 严格掩码比学习一个“缺失语义”更明确:缺失位置的权重为零是结构保证,准确率更高仍需实验支持。架构正确处理缺失,与训练成功获得有用表示,是不同层面的结论。
- 重建并没有被淘汰,而是从部署时必须补全的环节变成训练时塑造表示的监督。将这种分离迁移到传感器融合时,也应分别测信息匹配训练与固定模型部署,避免混淆信息预算。
局限与展望¶
- 主要缺失机制是四种受控合成协议,尚未验证自然发生、质量相关或相关联的传感器故障。相同覆盖统计下的视图身份差异也没有被两个汇总量完全表达。
- 默认部署训练需要全部视图起初可用;某个模态训练阶段从未出现、严格零完整样本训练超出已报告条件等情况仍待研究。MFT 至少留两个视图,对单视图部署的适应是额外边界。
- C1+C2 是前向条件,不是学习成功定理;支持门控界受归一化、梯度有界、抽样与优化器假设限制。不能用它给所有重建方法、分布方法或低精度运行指定共同失败原因。
- 历史表格混合独立运行数、训练配方与检查点记录完整度,限制了显著性及公平性解释。下一步应统一种子、信息预算、模型选择和完整成本记账,并补充真实缺失与不均衡簇测试。
相关工作与启发¶
- vs COMPLETER / DCP / DCG:这些方法通过共观测信息训练恢复或预测分支,具体支持条件并不一致。本文的多视图 COMPLETER 扩展采用成对完整训练,在 HandWritten P1 / 1.0 仍得到 68.76 ± 5.34;这正说明零完整样本不能否定所有成对重建。
- vs Energy-DIMC:它以跨样本或分布关系提供监督,不属于本文的支持门控重建梯度界。其某些严格协议结果仍较强,说明不能仅按是否补全来解释性能;CRAFT 默认部署与其逐配置训练还存在信息条件差异。
- vs DVIMC / FreeCSL / I2MVC:逐样本、无显式恢复的融合并非 CRAFT 首创。CRAFT 的具体实现贡献在于掩码注意力与共享聚类头及分离的训练/部署评测;DVIMC 的初始化失败只约束所评估实现,不证明整类架构失败。
- vs Set Transformer / 缺失模态 Transformer:集合式注意力与已观测模态融合已有基础,本文将其用于无监督 IMVC 并配套协议审计。评测工具 imvc-audit 的可复用价值在于核对真实掩码结构,而不只是增加一种网络。
评分¶
- 新颖性: 4/5,协议审计与训练/部署分离有价值,注意力融合本身并非全新。
- 实验充分度: 4/5,包含信息匹配、固定检查点与多种诊断,但历史种子和配方不统一。
- 写作质量: 4/5,明确理论假设和支持类型,阅读实验时仍需仔细区分不同配方。
- 价值: 4/5,为 IMVC 公平评测和动态缺失部署提供了可执行的检查框架。