🔬 可解释性¶
🧠 NeurIPS2026 · 10 篇论文解读
📌 同领域跨会议浏览: 🎞️ ECCV2026 (31) · 📷 CVPR2026 (34) · 🔬 ICLR2026 (195) · 💬 ACL2026 (63) · 🧪 ICML2026 (91) · 🤖 AAAI2026 (37)
🔥 高频主题: 对齐/RLHF ×2 · LLM ×2
- Can Circuit Alignment Predict OOD Generalization?
-
本文用同类电路跨域相似度减去异类电路相似度构造电路对齐分数(CAS),在不使用目标域数据的源域模型选择中取得 PACS 平均 Spearman 相关系数 0.88,但其 OOD 排名一致性依赖额外的单调性假设,并非完全无数据的权重诊断。
- Deep Minds and Shallow Probes
-
本文从最终读出层的坐标对称性推导浅层探针的多项式层级,并以低秩 CP 探针读取交互概念、以探针可见商空间迁移概念读出,在跨 token 一致性任务上获得 16.8–20.0 个百分点的 AUROC 提升,同时明确区分迁移准确率与概念覆盖。
- Interpretable but Fragile? Robustness of Concept Bottlenecks under Geometric-Semantic Perturbations
-
论文用共享生成器区分潜空间几何变化和生成器概念变化,比较普通分类器与概念瓶颈模型的预测稳定性及平滑分类器证书,发现可解释性不带来统一的鲁棒性优势,而是改变敏感性出现的位置;结论限于生成器原生输入及具体任务条件。
- Listening to the Wise Few: Query-Key Alignment Unlocks Latent Correct Answers in Large Language Models
-
冻结大语言模型后,先校准一个注意力头,再用提示末尾查询与各选项行末键的旋转位置编码前点积选择答案,揭示内部选择与最终输出之间的差距;特定零样本配置在 HellaSwag 和 HaluDialogue 上分别提高 27.4 和 49.8 个百分点,但并非所有模型都获益。
- Parameter symmetries determine representational geometry in overparameterized nonlinear networks
-
本文在一隐层非线性网络中,将保持全局函数不变的参数对称性归结为特征添加、复制与缩放,证明它们可以显著改变表征几何,并给出最小范数选择恢复几何可辨识性的充分条件。
- PersonaManifold: Revealing and Exploiting Curved Geometry in LLM Persona Representations
-
PersonaManifold 将 LLM 人设激活建模为弯曲且各向异性的低维流形,通过局部度量加权的图最短路衡量相似性并生成插值人设,使三种 7–8B 模型的 BST 综合三元组一致率较欧氏距离提高 5.1–6.1 个百分点,优势主要出现在高偏离人设对。
- PULSE: Identifying Demonstration-Utility Features with Sparse Autoencoders
-
PULSE 用少量带标签的发现样本定位与上下文示例效用相关的 SAE 特征,再分别用于完整示例集合排序和可缓存的逐例检索,在六个文本任务上改善示例选择,但这些特征目前只有关联性而非因果干预证据。
- SMILE: Bridging Continuous Optimization and Discrete Symbolic Recovery
-
SMILE 先从数据识别可分解结构,再拟合固定符号激活网络,最后通过剪枝、常数重拟合与梯度舍入恢复简洁表达式,在 SRBench 的高噪声条件下取得较强符号恢复能力,但并非无噪声恢复率或预测精度全面领先。
- The Shape of Events: Edge-Based Inductive Biases via Cross-Domain Distillation
-
本文把标准知识蒸馏用作分析工具,将事件域教师的预测迁入RGB学生,发现颜色变化耐受性、形状偏好及高频带噪声耐受性可以共同迁移,但伴随干净准确率下降和对几何连续性破坏的敏感,而不是获得全面鲁棒性。
- Witness Overlap: Directional Provenance Inside Open-Weight Model Families
-
在已知同族且权重对齐的开放权重模型中,Witness Overlap 引入第三个检查点,比较两个候选端点各自向目标与见证者的更新重叠,以较低重叠端预测父模型;Frobenius 余弦在 16 个 LLM 家族的 1,542 个单见证三元组上取得 95.3% 定向准确率。