跳转至

🔬 可解释性

🧠 NeurIPS2026 · 10 篇论文解读

📌 同领域跨会议浏览: 🎞️ ECCV2026 (31) · 📷 CVPR2026 (34) · 🔬 ICLR2026 (195) · 💬 ACL2026 (63) · 🧪 ICML2026 (91) · 🤖 AAAI2026 (37)

🔥 高频主题: 对齐/RLHF ×2 · LLM ×2

Can Circuit Alignment Predict OOD Generalization?

本文用同类电路跨域相似度减去异类电路相似度构造电路对齐分数(CAS),在不使用目标域数据的源域模型选择中取得 PACS 平均 Spearman 相关系数 0.88,但其 OOD 排名一致性依赖额外的单调性假设,并非完全无数据的权重诊断。

Deep Minds and Shallow Probes

本文从最终读出层的坐标对称性推导浅层探针的多项式层级,并以低秩 CP 探针读取交互概念、以探针可见商空间迁移概念读出,在跨 token 一致性任务上获得 16.8–20.0 个百分点的 AUROC 提升,同时明确区分迁移准确率与概念覆盖。

Interpretable but Fragile? Robustness of Concept Bottlenecks under Geometric-Semantic Perturbations

论文用共享生成器区分潜空间几何变化和生成器概念变化,比较普通分类器与概念瓶颈模型的预测稳定性及平滑分类器证书,发现可解释性不带来统一的鲁棒性优势,而是改变敏感性出现的位置;结论限于生成器原生输入及具体任务条件。

Listening to the Wise Few: Query-Key Alignment Unlocks Latent Correct Answers in Large Language Models

冻结大语言模型后,先校准一个注意力头,再用提示末尾查询与各选项行末键的旋转位置编码前点积选择答案,揭示内部选择与最终输出之间的差距;特定零样本配置在 HellaSwag 和 HaluDialogue 上分别提高 27.4 和 49.8 个百分点,但并非所有模型都获益。

Parameter symmetries determine representational geometry in overparameterized nonlinear networks

本文在一隐层非线性网络中,将保持全局函数不变的参数对称性归结为特征添加、复制与缩放,证明它们可以显著改变表征几何,并给出最小范数选择恢复几何可辨识性的充分条件。

PersonaManifold: Revealing and Exploiting Curved Geometry in LLM Persona Representations

PersonaManifold 将 LLM 人设激活建模为弯曲且各向异性的低维流形,通过局部度量加权的图最短路衡量相似性并生成插值人设,使三种 7–8B 模型的 BST 综合三元组一致率较欧氏距离提高 5.1–6.1 个百分点,优势主要出现在高偏离人设对。

PULSE: Identifying Demonstration-Utility Features with Sparse Autoencoders

PULSE 用少量带标签的发现样本定位与上下文示例效用相关的 SAE 特征,再分别用于完整示例集合排序和可缓存的逐例检索,在六个文本任务上改善示例选择,但这些特征目前只有关联性而非因果干预证据。

SMILE: Bridging Continuous Optimization and Discrete Symbolic Recovery

SMILE 先从数据识别可分解结构,再拟合固定符号激活网络,最后通过剪枝、常数重拟合与梯度舍入恢复简洁表达式,在 SRBench 的高噪声条件下取得较强符号恢复能力,但并非无噪声恢复率或预测精度全面领先。

The Shape of Events: Edge-Based Inductive Biases via Cross-Domain Distillation

本文把标准知识蒸馏用作分析工具,将事件域教师的预测迁入RGB学生,发现颜色变化耐受性、形状偏好及高频带噪声耐受性可以共同迁移,但伴随干净准确率下降和对几何连续性破坏的敏感,而不是获得全面鲁棒性。

Witness Overlap: Directional Provenance Inside Open-Weight Model Families

在已知同族且权重对齐的开放权重模型中,Witness Overlap 引入第三个检查点,比较两个候选端点各自向目标与见证者的更新重叠,以较低重叠端预测父模型;Frobenius 余弦在 16 个 LLM 家族的 1,542 个单见证三元组上取得 95.3% 定向准确率。