跳转至

💡 LLM Reasoning

🎞️ ECCV2026 · 1 篇论文解读

📌 同领域跨会议浏览: 📷 CVPR2026 (16) · 🔬 ICLR2026 (241) · 💬 ACL2026 (82) · 🧪 ICML2026 (78) · 🤖 AAAI2026 (37) · 🧠 NeurIPS2025 (82)

ProAct: Agentic Lookahead in Interactive Environments

ProAct 把"前瞻"从推理期搬进数据构建期:先用真实环境的 MCTS 探出未来轨迹、压缩成"观察→分析→结论"的因果推理链做 SFT(GLAD),再用无参数、靠随机策略批量 rollout 估值的蒙特卡洛批判器(MC-Critic)稳定 PPO/GRPO 训练,让一个 4B 模型在 2048 与 Sokoban 上大幅超过同规模与更大的开源基线。