跳转至

📦 模型压缩

🧠 NeurIPS2026 · 5 篇论文解读

📌 同领域跨会议浏览: 🎞️ ECCV2026 (92) · 📷 CVPR2026 (108) · 🔬 ICLR2026 (239) · 💬 ACL2026 (59) · 🧪 ICML2026 (116) · 🤖 AAAI2026 (60)

🔥 高频主题: 模型压缩 ×2

CASS: Contribution-Aware Structured Sparsity for Model Merging

CASS 用无标签任务样本识别贡献突出的注意力头和 FFN 神经元,再过滤任务向量或约束微调梯度,以减少模型合并干扰,例如将 ViT-B/16 上 Task Arithmetic 的 20 任务平均准确率从 65.02% 提升到 69.99%。

Distilling What Matters: Confidence-Aware Selective Distillation for Large Language Models

CaRE-KD 按教师与学生的相对置信度逐 token 选择前向或反向 KL,并用 MC-dropout BALD 拒绝教师不确定而学生较确定的监督,在所测模型上改善蒸馏质量,达到 MBPP 62.4、GSM8K 73.9,但收益并非每个任务都成立,训练开销也明显增加。

Importance-Aware OBS Pruning for Diffusion Models

本文把提示词相关的空间重要性注入 OBS 的逐层重建目标,在不微调的情况下改善高稀疏率扩散模型的主体保真度,但全局掩码系数消融与给出的精确公式存在未解释的一致性问题。

Not All Tasks Quantize Equally: Fisher-Guided Quantization for Visual Geometry Transformer

FGQ 在 VGGT 的逐块训练后量化中,用各几何任务的归一化平方梯度给通道重建误差加权,使有限的校准能力优先保护敏感特征;W4A4 下,7-Scenes 的平均完整性误差由 QuantVGGT 的 0.085 降到 0.059,但并非所有指标都恢复到 FP16。

Stabilizing the Dynamic Low-Rank Training

SDLRT 在动态低秩训练中保留上一轮刚被截断的主要奇异方向,用补偿基扩展和截断容差负反馈缓解高压缩下的秩坍缩,并在六项 SuperGLUE 验证任务上取得 85.15% 的平均准确率。