🧊 3D 视觉¶
🧠 NeurIPS2026 · 8 篇论文解读
📌 同领域跨会议浏览: 🎞️ ECCV2026 (519) · 📷 CVPR2026 (751) · 🔬 ICLR2026 (194) · 🧪 ICML2026 (30) · 🤖 AAAI2026 (79) · 🧠 NeurIPS2025 (116)
🔥 高频主题: 人脸/视线 ×3
- DirectUV: Image-Conditioned UV Texture Generation with Surface-Aware Positional Encoding
-
DirectUV 在冻结的 Flux VAE 潜在 UV 空间直接生成网格纹理,把三维表面坐标写入各注意力头的旋转位置编码,并将参考图和粗 UV 仅作为条件,在 GSO 上取得 25.13 PSNR、0.9527 SSIM,同时改善跨 UV 岛的一致性与细节。
- M-plicits: Neural Implicit Surfaces via Nested Multiscale Residuals
-
M-plicits 用全域粗 SIREN 加逐级窄带监督的残差 SIREN 重建有向点云,并让追踪、网格提取和属性映射复用这一层级,在较小参数量下获得实时渲染与较强的合成测量噪声鲁棒性,但并非所有精度和速度指标都胜出。
- NRF-GS: Neural Residual Fields for Expressive and Compact Gaussian Splatting
-
NRF-GS 用共享的低频/高频神经残差分支替换逐高斯球谐外观,在不改增密与剪枝规则的情况下,以更少的高斯获得更高的平均 PSNR,但并非在感知质量或渲染速度上全面胜出。
- Rethinking the State Update Gate for Long-Sequence Recurrent 3D Reconstruction
-
AFG 在冻结的 CUT3R/TTT3R 推理流程中,用相邻帧内部特征的变化生成一个正值帧级写入权重,与 token 门相乘以减少重复帧覆盖历史,在不丢帧、不再训练且保持恒定记忆的条件下将 KITTI 平均 ATE 从 68.54 m 降至 43.96 m,但并非所有序列和误差指标都改善。
- SceneScaffold: Active Scene-State Construction for Unified 3D Scene Understanding
-
SceneScaffold 把固定的 100 个视觉 token 分配给细节、实体、空间参照、关系和全局摘要,在语言推理前组织场景证据,相比 3D-LLaVA 将 ScanRefer / Multi3DRefer 的 mIoU 从 43.3 / 42.7 提高到 47.0 / 47.9。
- Seeing Speech: Learning Visible Articulatory Dynamics for Speech-Driven 3D Facial Animation
-
Seeing Speech 将面部运动按展宽、张口和前突三个坐标方向学习,通过语音—发音记忆检索局部运动特征,再用拓扑感知残差组合成三维网格动画,在 VOCASET 和 TFHP 上降低面部与嘴唇重建误差,但并未恢复真实发音器官的生理机制。
- Seg3DParts: Segmentation-Grounded Controllable Part-Level 3D Generation
-
Seg3DParts 将外部提供的部件分割分别注入两阶段 3D 生成器,并让各部件潜变量交换结构信息,在保留训练时相对坐标的空间中直接输出独立网格;其优势是可指定分解方式且减少部件互穿,而不是自动发现未知部件。
- Towards Generalizable 3D Anomaly Detection via Relational Inconsistency Modeling
-
GRIM 用正常点云生成局部关系破坏作为监督,通过边感知图细化与样本内簇偏差建模学习缺陷判据,在 Anomaly-ShapeNet 达到 97.4/94.5 的物体级/点级 AUROC,直接迁移到 Real3D-AD 仍达到 83.6/89.6。