跳转至

🤖 机器人/具身智能

🧠 NeurIPS2026 · 6 篇论文解读

📌 同领域跨会议浏览: 🎞️ ECCV2026 (129) · 📷 CVPR2026 (146) · 🔬 ICLR2026 (162) · 💬 ACL2026 (11) · 🧪 ICML2026 (53) · 🤖 AAAI2026 (30)

🔥 高频主题: 导航 ×2

Action Chunking Proximal Policy Optimization with Feedback Correction

ACPPO-Corr 用低频动作块规划器与逐步反馈校正器共同扩展 PPO,保留仅输入状态的价值网络,在 25 个模拟机器人任务上将最终归一化四分位均值相对 PPO 提升 30.4%,而不是提升 30.4 个成功率百分点。

Behavioral Foundation Models for Quality Diversity

BFM-QD 冻结离线预训练的行为基础模型,在其潜码空间而非策略权重空间构建高质量、多样化的行为档案,并用闭式后向推断引导小步变异,在稀疏导航和接触操作中显著改善搜索,但仍需要环境 rollout 与预训练投入。

GeoWind2Plan: Mission-Time 3D Urban Wind Prediction for Energy-Efficient UAV Planning

GeoWind2Plan 将建筑几何和背景风转换成任务走廊内的三维平均风场,再联合优化无人机路径与速度;在街区 A、4 m/s 背景风下,CFD 复评能耗由无风感知规划的 \(13.3\pm1.8\) 降至 \(12.5\pm1.5\) Wh/km,而 20% 走廊的风场推理约需 3 秒。

Language-Conditioned World Modeling for Visual Navigation

本文构建语言条件视觉导航数据集,并比较“扩散世界模型 + 潜空间演员–评论家”与“统一自回归动作/图像预测”两种替代方案:前者在已见环境的图像结构保真度上更强,后者在未见环境的离线轨迹预测上更好,但实验不验证真实闭环控制。

Linguistic Trajectory Encoding for Efficient Long-Horizon Spatial Memory in Embodied Agents

本文把物体的运动历史编码为语言描述、稀疏三维锚点与视觉锚点相互关联的记忆,在长时第一人称视频上提高语义轨迹检索,并以昂贵的一次性构建换取亚秒级在线查询。

ProCompNav: Proactive Instance Navigation with Comparative Judgment for Ambiguous User Queries

ProCompNav 先在未知环境中收集同类物体,再递归寻找能区分候选的属性并向用户提是非问题,在模拟 CoIN-Bench 的三个划分上将成功率提升至 23.7%、28.1%、17.0%,同时显著缩短用户模拟器的回答。