🎮 强化学习¶
🧠 NeurIPS2026 · 10 篇论文解读
📌 同领域跨会议浏览: 🎞️ ECCV2026 (12) · 📷 CVPR2026 (25) · 🔬 ICLR2026 (400) · 💬 ACL2026 (46) · 🧪 ICML2026 (110) · 🤖 AAAI2026 (58)
🔥 高频主题: 强化学习 ×6
- AlphaPareto: Formulaic Alpha Discovery with LLM-Guided Multi-Objective Reinforcement Learning
-
AlphaPareto 用冻结 LLM 编码当前因子池,让 MaskPPO 在知道已有信号的条件下逐 token 搜索公式,并通过自适应多目标奖励兼顾预测力、排名稳定性、扰动鲁棒性与多样性,在 CSI300、CSI800 和全市场取得 3.92%、5.70% 和 10.10% 的样本外 IC。
- From Weak Data to Strong Policy: Q-Targets Enable Provable In-Context Reinforcement Learning
-
QTPT 将共享参数 Transformer 的行为动作预测替换为上下文条件化的 Q 目标回归,使固定权重模型能从同一任务的奖励与转移历史中改进决策;弱行为数据上的实验收益较明显,但理论依赖覆盖与可实现性,不能解释为任意低覆盖数据上的保证。
- HaM-World: Soft-Hamiltonian World Models with Selective Memory for Planning
-
HaM-World 把选择性历史记忆与作用于部分潜在坐标的软哈密顿先验接入同一个规划模型,在六个状态输入控制任务上四项最终回报第一、两项第二,但想象预测优势局限于规划相关时域,且消融中记忆的影响明显大于几何结构。
- Learning Chance-Constrained MDPs with Bellman Distributional Certificates
-
论文将累计成本超标事件改写为剩余预算上的贝尔曼递推,在有界后继支持与认证规划预言机条件下得到近匹配的确定性策略样本复杂度,并为随机策略提供局部近似 KKT 优化与独立安全验证,合成及电网仿真实验展示了统计保守性与期望成本替代约束的区别。
- Loop-Free Inverse Reinforcement Learning via Sequential Value Recovery with Q-Score Matching
-
LFIRL 将冻结扩散策略提供的局部动作分数转成软 Q 梯度监督,再依次拟合价值、校准状态偏移并回归奖励,移除了奖励学习与策略优化的交替回路,在包含扩散预训练的计时口径下比最快基线通常快约 2–3 倍,但并非每项奖励质量指标都最优。
- Modeling Quantum Neural Network Gradient With Reinforcement Learning
-
RLQ-Grad 用带谱归一化的经典 PPO 策略,根据量子神经网络的训练状态产生替代更新信号,在给定分类模拟实验中提高验证准确率并降低额外求导开销,但不证明真实梯度恢复或普遍绕过贫瘠高原。
- Replay-buffer engineering for noise-aware quantum circuit optimization
-
本文把量子电路优化的瓶颈从“换一个智能体”转向“更有效地复用经验”:以退火可靠性回放提高样本效率、以分块评估减少量子—经典调用、以仅迁移回放缓存加速噪声适应,但不同任务的精度、门数和收敛速度优势并不统一。
- Safe Score Matching: Diffusion Policies with Hamilton-Jacobi Reachability for Online Safe Reinforcement Learning
-
Safe Score Matching(SSM)用学习到的 Hamilton–Jacobi 安全价值切换扩散策略的奖励与恢复训练目标,在在线安全强化学习中兼顾多模态动作表达与低违规成本,但其硬约束问题定义不等于学习后的策略具有严格安全保证。
- Trust Guided Decision Transformer
-
TGDT 用已实现转移的滚动下一状态预测误差先筛选可信历史后缀,再用冻结的 IQL critic 对候选动作排序,在长时域导航上改善回报与持续高误差,但不提供闭环覆盖率或安全保证。
- Verifying Neural Networks with Reinforcement Learning
-
Rsb 用图结构观测与 actor-critic 学习重加权 Fsb 的神经元分支分数,在不替代验证逻辑的前提下,将 600 个困难测试实例中的求解数量从 148 提高到 165,但奖励定义、特征掩码和部分统计存在原文不一致,需与性能收益分开理解。