💡 LLM Reasoning¶
🧠 NeurIPS2026 · 8 篇论文解读
📌 同领域跨会议浏览: 🎞️ ECCV2026 (1) · 📷 CVPR2026 (16) · 🔬 ICLR2026 (241) · 💬 ACL2026 (82) · 🧪 ICML2026 (78) · 🤖 AAAI2026 (37)
🔥 高频主题: 推理 ×6 · LLM ×3
- Advancing Entropy-Level Credit Assignment in RLVR via Proximal Entropy Policy Optimization
-
PEPO 将成功推理轨迹中 token 的更新权重改为相对邻域的不确定性,并保持每条轨迹的总权重不变,在数学推理主实验中优于所比较的 GRPO 与全局熵基线,但趋势鲁棒性和跨任务推广均有明确边界。
- Diversity Combining for Multi-Path LLM Reasoning
-
本文用正确性相关与设计效应解释多路径推理的收益饱和,并从有标签的离线四路径试运行估计固定部署预算;在五个模型–任务组合上,选取 4–10 条路径保留了 32 路径二元多数票准确率的 96%–103%,但这一评测指标不等同于开放答案的实际相对多数投票准确率。
- Externalized CPDAG Summaries Improve LLM Causal Deduction
-
Structured Thinking 先让同一个大语言模型生成受格式约束的 CPDAG 摘要,再依据该图判断因果命题是否在所有相容 DAG 中成立,在 Corr2Cause 上将 Qwen3.5-27B 主种子 F1(YES) 从 73.01 提升到 86.36,但结构合法性和全等价类推理仍没有形式化保证。
- Provable Test-Time Scaling for Beam Search in LLM Reasoning
-
本文在只能采样下一 token、不能读取完整 logits 的设定下,用低频 token 过滤改进束搜索,并在前缀似然与正确性对齐的条件下,将搜索所需样本对最难一步覆盖系数的依赖从最坏情形二次降至近线性;真实 LLM 矩阵乘法实验的准确率由 37.2% 提升至 38.8%。
- Reasoning-Trace Collapse: Evaluating the Loss of Explicit Reasoning During Fine-Tuning
-
本文把“答得对”与“仍会输出完整显式推理”分开评测,发现无推理轨迹的常规微调可让模型在 Chemistry 上准确率提高而有效推理率降至零附近,并用推理区域损失掩码缓解这一结构性退化,但效果依赖模型与任务。
- SAGE: Mitigating Long-Horizon Reasoning Biases via Topological Guidance
-
SAGE 在后训练中用“操作是否对应未解决约束”和“新状态是否接近目标结构”两类软势函数同时引导候选采样与奖励,在保留普通推理时解码的前提下改善长程推理;Qwen3.5-35B 的数学平均准确率由 GRPO 的 61.92% 提升至 64.86%。
- Structured Sparse Memory for Recurrent Reasoning
-
CoSE 用因子化 FiLM 条件分支与 rank-32 实例残差替代庞大任务表,在受控 ARC 实验中将任务记忆参数缩至约 1/15 并提高 pass@2;结合合成数据、循环计算和延长训练的 CHARM 系统达到 ARC-AGI-1 / 2 公共评测 84.0% / 46.7%,不能把这一系统成绩全部归因于 CoSE。
- Why Deterministic PRM Guidance Underperforms in Discrete Diffusion Reasoning
-
这篇诊断研究把扩散生成和奖励评分统一计入推理预算,发现 Dream-7B 的确定性 top-1 PRM 引导不如独立采样加任务匹配 ORM,并通过候选池、终局评分和读出消融拆出失败发生的位置。