跳转至

⚖️ 对齐 / RLHF

🧠 NeurIPS2026 · 2 篇论文解读

📌 同领域跨会议浏览: 🎞️ ECCV2026 (6) · 📷 CVPR2026 (12) · 🔬 ICLR2026 (102) · 💬 ACL2026 (38) · 🧪 ICML2026 (37) · 🤖 AAAI2026 (17)

Authority Bias in Language Models: Source Deference and User Agreement Are Not Interchangeable

论文固定错误答案、只改变背书者,用方向移除与独立拟合的归因补丁证明:在三个开放权重模型家族中,服从错误来源与迎合用户具有可选择性干预的差异,不能用同一种迎合评测代替。

Learning Where It Matters: Geometric Anchoring for Robust Preference Alignment

GAPO 在当前策略附近沿批次平均偏好间隔的下降方向构造临时几何锚点,以各偏好对的间隔退化量调低脆弱样本的更新权重,在多个对齐评测和受控噪声实验中取得改进,但不保证所有模型、指标都胜出。