跳转至

🔄 自监督/表示学习

🧠 NeurIPS2026 · 6 篇论文解读

📌 同领域跨会议浏览: 🎞️ ECCV2026 (22) · 📷 CVPR2026 (91) · 🔬 ICLR2026 (81) · 💬 ACL2026 (1) · 🧪 ICML2026 (28) · 🤖 AAAI2026 (16)

🔥 高频主题: 自监督学习 ×2

Beyond Missing Rates: Rethinking Incomplete Multi-View Clustering with Protocol Divergence

论文用实际缺失率与完整样本比例揭示不完整多视图聚类的评测协议分歧,并提出只融合当前样本已观测视图的 CRAFT:在信息匹配的不完整训练中赢得 13 个条件中的 12 个,另以完整视图训练后的固定检查点评测跨协议部署。

Efficient Dataset Distillation for Pre-Trained Self-Supervised Models via Statistical Flow Matching

SFM 把冻结预训练视觉骨干上的线性梯度匹配近似解释为类别中心之间的相对向量匹配,再用一次计算的全局统计量监督合成图像,在每类一张图像的分类实验中改善精度;其约 10 倍显存节省、4 倍加速来自单增强 SFM 与十增强 LGM 的跨预算比较,而不是同预算收益。

Handwritten Text Recognition Lives in the High-Pixel Variance Subspace

本文用像素 PCA 投影与冻结编码器探针研究手写文本识别的信号分布,在六个拉丁文字基准上发现高方差像素方向更利于转录,且 MAE 的真实数据预训练表示取得 5.5% 平均探针 CER,结合语言解码器并全量微调后取得 4.5% 平均 CER。

I Have a Stream: Making Self-Supervised Learning Work on Continuous Video

StreamMAE 不改变 MAE 的像素重建目标,而以更强正则化、样本级 DataDrop 和运动偏置两阶段裁剪适配按时间顺序读取的视频流,在 WT++12h 上改善分类、分割和深度迁移,并在多数指标上接近同数据的离线 i.i.d. MAE。

Latent Video Prediction for World Modeling: An Evaluation Uncovering Intriguing Favorable Evidence

本文以统一读出协议评测四个冻结视频编码器,发现 V-JEPA 系列在退化输入下更能保留可用的动作语义,并在有限的模拟操作实验中支持更可靠的规划,但这些结果不是生成质量评测,也未因果隔离预训练目标。

Structure-Guided Masked Autoencoders for Ultra-High Resolution Scientific Image Understanding

SGMA 将内容自适应四叉树 token 化与跨尺度结构条件掩码共同用于 MAE 预训练,让标准 ViT 在固定序列预算下保留科学图像微结构;SpringXCT 的 SGMA-SAM 达到 95.68% Dice,PAIP 的 SGMA-SAM 2 达到 83.21%,而最高 24.8 倍推理加速来自另一个较短序列配置。