⚖️ 对齐 / RLHF¶
🎞️ ECCV2026 · 1 篇论文解读
📌 同领域跨会议浏览: 📷 CVPR2026 (12) · 🔬 ICLR2026 (102) · 💬 ACL2026 (38) · 🧪 ICML2026 (37) · 🤖 AAAI2026 (17) · 🧠 NeurIPS2025 (36)
- Omni-RRM: Advancing Omni Reward Modeling via Automatic Rubric-Grounded Preference Synthesis
-
Omni-RRM 先用双教师共识合成带五维评分准则解释的偏好数据,再以 SFT→GRPO 学习跨图像、视频和音频的成对回答判别,使 7B 奖励模型的五基准平均准确率由骨干的 60.2% 提升到 70.4%,并能在不更新生成器参数的情况下改善候选回答选择。