跳转至

💻 代码智能

🧠 NeurIPS2026 · 5 篇论文解读

📌 同领域跨会议浏览: 🎞️ ECCV2026 (2) · 🔬 ICLR2026 (58) · 💬 ACL2026 (49) · 🧪 ICML2026 (22) · 🤖 AAAI2026 (10) · 🧠 NeurIPS2025 (19)

CodeScaler: Scaling Code LLM Training and Test-Time Inference via Reward Models

CodeScaler 把高质量执行反馈蒸馏为代码奖励模型,用严格代码提取和奖励塑形支撑无需在线执行的强化学习与候选重排序,在 DeepCoder 上让 8B/14B 策略的四项基准平均 Avg@8 分别超过 RLVR 1.55/4.23 个百分点。

Counterfactual Rollout Replay: Forkable Environments as Free Process Rewards for Software Engineering Agents

CRR 在训练时恢复软件工程轨迹中的少量决策状态,用原轨迹与替代动作后续轨迹的终局回报差评价原动作,在同一八卡 H100 节点、40.125 小时训练窗口内,将 SWE-bench Verified 的 pass@1 从延长训练 GRPO 的 36.7% 提高到 41.7%,但不免除分叉执行成本。

CTE-Bench: Counterfactual Trace Evaluation for Stateful Software Simulators

CTE-Bench 用真实执行生成软件干预前后的响应轨迹,在固定未来调用上评测模型能否持续预测干预效果:正确历史答案可见时影响步骤准确率为 54.3%–61.5%,自由滚动时降至 24.8%–33.2%,整条轨迹完全正确的比例最高仅 1.2%。

Execution Guided Line-by-Line Code Generation

EG-CFG 在推理时预览并执行代码前缀的多种短续写,把运行轨迹注入提示,再通过双分布无分类器引导逐 token 生成、逐行刷新反馈;使用 DeepSeek-V3-0324 时,论文报告 MBPP / HumanEval / DS-1000 准确率分别为 96.6% / 99.4% / 69.9%,但依赖可执行的已提供测试与额外搜索计算。

Remember Your Trace: Memory-Guided Long-Horizon Agentic Framework for Consistent and Hierarchical Repository-Level Code Documentation

MemDocAgent 用依赖与目录层级共同约束的遍历顺序,以及可读取、写入和验证的 RepoMemory,让单一智能体连续生成组件、模块和仓库三级文档;在 20 个 Python 仓库上,Qwen3-Coder 配置取得 0.979 完整度、0.916 真实性和 0.690 有用性,但验证失败后的保覆盖回退并不保证每篇文档都可信。