跳转至

🧊 3D 视觉

🎞️ ECCV2026 · 519 篇论文解读

📌 同领域跨会议浏览: 📷 CVPR2026 (751) · 🔬 ICLR2026 (194) · 🧪 ICML2026 (30) · 🤖 AAAI2026 (79) · 🧠 NeurIPS2025 (116) · 📹 ICCV2025 (267)

🔥 高频主题: 3D 高斯渲染 ×98 · 三维重建 ×40 · 动态场景 ×33 · 新视角合成 ×26 · 扩散模型 ×23

V-JEPA 2.1: Unlocking Dense Features in Video Self-Supervised Learning

V-JEPA 2.1 把视频潜空间预测的监督扩展到可见位置和多个网络深度,在增强局部时空结构的同时恢复全局语义能力,其 ViT-G 在冻结特征评测中达到 NYUv2 深度 RMSE 0.307 和 SSv2 动作识别准确率 77.7%。

RoMa v2: Harder Better Faster Denser Feature Matching

RoMa v2 用冻结 DINOv3 上的多视图粗匹配、解耦训练的高效细化和像素级不确定度预测,兼顾困难视角匹配与亚像素精度,在 AerialMegaDepth 上将 RoMa 的 EPE 从 25.05 降至 4.12 像素,但并未在极端跨模态泛化或绝对速度上全面领先。

Ultra3D: Efficient and High-Fidelity 3D Generation with Part Attention

Ultra3D 先用紧凑 VecSet 确定物体粗布局,再用沿部件边界组织的注意力生成稀疏体素潜特征,在支持 1024 分辨率网格的同时,相对全注意力基线取得部件自注意力 6.7×、DiT 推理 3.3× 的加速。

P3-SAM: Native 3D Part Segmentation

P3-SAM 利用约 3.7 million 个原生 3D 资产的部件监督,训练单点提示的两阶段多掩码网络,再用质量预测与去重实现自动分割,在 PartObj-Tiny 不利用连通性的设置下达到 59.88 的平均 IoU,高于 PartField 的 53.93。

VolSplat: Rethinking Feed-Forward 3D Gaussian Splatting with Voxel-Aligned Prediction

VolSplat 将前馈 3D Gaussian Splatting 的基元预测范式从逐像素对齐改为逐体素对齐:先将多视图 2D 特征通过深度图反投到 3D 空间形成体素特征网格,经稀疏 3D U-Net 残差精化后逐体素预测高斯参数,从而从根本上解耦 3D 表征与输入图像分辨率的刚性绑定,实现自适应高斯密度分配。

LoGeR: Long-Context Geometric Reconstruction with Hybrid Memory

LoGeR 将视频按块重建,用滑窗注意力保留邻块细节、用测试时训练更新的快权重记忆传递全局几何,带前馈位姿对齐的 LoGeR* 在 KITTI 上将平均 ATE 从 TTT3R 的 72.86 m 降至 18.65 m,但超长序列结果包含周期性状态重置。

MVGS: Multi-view Regulated Gaussian Splatting for Novel View Synthesis

MVGS 将高斯泼溅的单视角逐步拟合改为多视角联合更新,并结合跨内参引导与两类增密,在 Mip-NeRF 360 上将 3DGS 的 PSNR 从 28.69 提高到 29.61,但训练时间也从 0.3 小时增加到 2.4 小时。

Skyfall-GS: Synthesizing Immersive 3D Urban Scenes from Satellite Imagery

Skyfall-GS 用卫星影像约束城市的粗几何与外观,再通过由高到低的视角课程将扩散模型生成的立面细节逐轮写回 3D 高斯场景,在 DFC2019 上取得 FIDCLIP 27.03、CMMD 2.110,并支持离线优化后的实时漫游。

XYZ-IBD: Benchmarking Robust 6D Object Pose Estimation under Real-World Industrial Complexity

XYZ-IBD 用多传感器真实料箱数据、喷涂辅助几何标注及噪声匹配仿真建立工业 6D 位姿基准,在 15 种零件上揭示现有方法的明显性能缺口,其中 SAM6D 的 XYZ-IBD 6D AP 为 0.578,而其 BOP-Core 5 平均值为 0.704。

Generation Models Know Space: Unleashing Implicit 3D Priors for Scene Understanding

VEGA-3D 把冻结的 Wan2.1 视频生成模型用作空间特征提取器,通过中等强度加噪、中间层取特征及逐 token 门控融合增强多模态模型,使 ScanRefer [email protected] 从 51.7 提高到 56.2,同时在空间推理和操作任务上取得幅度不一的收益。

LoMa: Local Feature Matching Revisited

LoMa 保留 DaD 检测器、DeDoDe 描述子与 LightGlue 匹配器的基本分工,通过扩大训练数据、改进训练配方和匹配器扩容,在新建的 HardMatch 测试集上取得 54.3 mAA@10px,比 ALIKED+LightGlue 高 18.6 点。

Register Any Point: Scaling 3D Point Cloud Registration by Flow Matching

RAP 将多视图点云配准改写为局部几何条件下的点坐标生成,用逐步刚性约束稳定流匹配采样,再从生成点恢复各视图位姿,在作者提出的跨域零样本基准上取得 85.9% 边成功率、77.3% 图成功率和平均 8.9 秒的运行时间。

RayRoPE: Projective Ray Positional Encoding for Multi-view Attention

RayRoPE 用查询相机坐标系中的射线片段表示图像 patch,并对预测深度的不确定区间计算期望 RoPE,在不额外监督内部深度的情况下增强多视图几何建模,使小规模 LVSM 在 RE10K 上相对 PRoPE 的 LPIPS 从 0.112 降至 0.085。

AnyView: Synthesizing Any Novel View in Dynamic Scenes

AnyView 将单目视频及源/目标相机射线一起送入预训练视频扩散模型,通过跨域多视角数据学习隐式时空关系,无需深度重投影或测试时优化,在 AnyViewBench 极端视角零样本测试中取得 12.13 dB 平均 PSNR 和 1757 FVD,但不保证补出的遮挡内容真实。

DINO-SLAM: DINO-Informed RGB-D SLAM for Neural Implicit and Explicit Representations

DINO-SLAM 用在线优化的场景几何编码器将冻结 DINOv2 特征与深度融合成 geoDINO,再分别接入隐式和显式地图,使基于 GauS-SLAM 的版本在 Replica 八场景平均 PSNR 上从 40.25 提升到 41.42 dB,同时改善深度与轨迹误差。

Forge4D: Feed-Forward 4D Human Reconstruction and Interpolation from Uncalibrated Sparse-View Videos

Forge4D将动态人体与交互物体的重建拆成尺度一致的流式3D高斯预测和双向稠密运动匹配,再通过遮挡感知融合生成中间时刻;在DNA-Rendering的新时刻与新视角联合评测中达到29.0378 dB PSNR,无需输入相机标定参数。

ReSplat: Learning Recurrent Gaussian Splatting

ReSplat 先从带相机参数的图像预测紧凑高斯场,再利用输入视图的渲染误差循环修正高斯与隐状态,在无需测试时显式梯度计算的情况下,将 DL3DV 八视图重建从初始化的 26.21 dB 提升到 27.70 dB,并保持逐像素基线约 1/16 的高斯数量。

UniPR-3D: Towards Universal Visual Place Recognition with Visual Geometry Grounded Transformer

UniPR-3D 首次将 VGGT 的 3D 几何感知 token 引入视觉位置识别,针对 2D 和 3D token 的不同特性设计定制聚合策略,同时支持单帧和变长序列匹配,在多个基准上超越现有单视图和多视图方法。

VGGT-World: Transforming VGGT into an Autoregressive Geometry World Model

VGGT-World 将冻结 VGGT 的中间几何特征作为世界状态,用干净目标预测和两阶段流强制课程学习未来状态,再由原有几何头联合解码,在 KITTI 短期深度预测上达到 0.065 AbsRel,同时完全绕过未来 RGB 生成。

Flow4R: Unifying 4D Reconstruction and Tracking with Scene Flow

Flow4R 用共享双视图 Transformer 预测局部几何与跨帧点位置,再通过可学习权重的几何求解分离相机运动和物体运动,在无需全局后优化的条件下统一 4D 重建与跟踪,并在 Point Odyssey 上取得 71.1 的全点跟踪 APD 和 81.00 的重建 APD。

GlobalSplat: Efficient Feed-Forward 3D Gaussian Splatting via Global Scene Tokens

GlobalSplat先把多视图对齐到固定数量的全局场景token,再解码紧凑3D高斯,在RealEstate10K的24视图设置下以16K高斯达到28.53 dB PSNR、77.88 ms单次前向耗时和3.8 MB场景文件,但感知细节仍弱于更重的ZPressor。

Habitat-GS: A High-Fidelity Navigation Simulator with Dynamic Gaussian Splatting

Habitat-GS 用零拷贝高斯渲染、离线准备的可驱动人物和动态胶囊障碍扩展 Habitat-Sim,在保留导航接口的同时提高训练环境逼真度;固定预算下,混合 mesh/GS 训练将 GS 测试集成功率从 61.30% 提升至 79.60%,但真实迁移证据仍限于视频开环评估。

InverseCrafter: Efficient Video ReCapture as a Latent Domain Inverse Problem

InverseCrafter 将单目视频沿指定相机轨迹的重拍转化为潜空间修补,用轻量编码器预测连续多通道掩码,再以无需反向传播的 DDS 求解观测一致性,在不微调视频扩散模型的前提下取得 71 秒运行时间与 29.35 dB 观测 PSNR。

MetricAnything: Scaling Metric Depth Pretraining with Noisy Heterogeneous Sources

MetricAnything 用随机稀疏深度提示组织约2000万异构图像深度对的预训练,再把条件教师的稠密伪标签蒸馏给纯 RGB 学生,在深度补全和单目度量深度上取得较好的平均排名,并展示依赖数据、提示与蒸馏设计共同作用的规模收益。

Repurposing Geometric Foundation Models for Multi-view Diffusion

GLD 将冻结的 Depth Anything 3 特征空间改作多视图扩散的生成空间,通过边界层联合生成、深层冻结传播和浅层级联,在不使用文本到图像生成预训练的条件下取得 Re10K PSNR 16.362,并直接复用几何解码器输出深度和射线图。

SLAM-Former: Putting SLAM into One Transformer

SLAM-Former 用共享权重的 Transformer 交替执行因果增量建图与全局地图校正,并将校正后的 KV 缓存反馈给前端,在无需相机标定的设置下达到 TUM RGB-D 平均 ATE 0.039 m 和 7-Scenes 重建 Chamfer 0.027 m。

Track4World: Feedforward World-centric Dense 3D Tracking of All Pixels

Track4World 用全局视频几何支撑二维到三维相关性解码,以可查询的帧对场景流构建每帧所有像素的世界坐标轨迹,在 KITTI 上取得 0.0742 的 EPE3D,同时避免把昂贵的三维邻域搜索直接扩展到全像素。

Tri-Efficient Transfer Learning for Point Cloud Videos

PoinTriE 用静态点云的刚体伪运动与跨模态对齐学习动态先验,再以冻结主干、低秩侧网络和单元掩码实现高效迁移,在 MSR-Action3D 的四种帧长设置上取得 94.37% 平均准确率,同时只微调表 1 所列的 2.2% 参数。

VIGS-SLAM: Visual Inertial Gaussian Splatting SLAM

VIGS-SLAM 将稠密视觉对应与 IMU 约束放入同一次联合优化,用分阶段初始化稳定启动、用回环变换同步修正高斯地图,在 EuRoC 上取得 2.79 cm 平均 ATE RMSE,并改善困难场景的新视角渲染。

One4D: Unified 4D Generation and Reconstruction via Decoupled LoRA Control

One4D 把观测帧数量变化编码成统一掩码条件,以共享冻结视频骨干、分开计算的 RGB/XYZ LoRA 分支和稀疏双向控制链接,同时生成外观与几何,在一个模型中支持单图 4D 生成、稀疏帧补全和完整视频重建。

Reconstruction by Generation: 3D Multi-Object Scene Reconstruction from Sparse Observations

RecGen 从一个或两个视角的 RGB-D 与实例掩码联合生成完整形状和相机坐标系中的位姿,再用位姿约束纹理生成,在 ArtVIP 部件重建中将 SAM3D 的严格位姿准确率从 45.8% 提高到 84.0%,但双视角及外观指标并非处处优于基线。

SplatPainter: Interactive Authoring of 3D Gaussians from 2D Edits via Test-Time Training

SplatPainter 先把已有 3D 高斯资产压缩为带上下文特征的体素潜表示,再用测试时训练吸收二维编辑并按空间范围更新资产,在小规模创意编辑测试中显著减少非编辑区域的外观漂移,同时支持亚秒级的增量更新。

Boxer: Robust Lifting of Open-World 2D Bounding Boxes to 3D

Boxer 将开放词汇二维检测与三维几何估计分开,用兼容可选稀疏或稠密深度的 BoxerNet 提升物体框,再通过跨帧融合生成静态场景框;在 CA-1M 的真实二维框加稠密深度设置下,逐帧类别无关 mAP 从 CuTR 的 0.250 提升至 0.412。

DreamPartGen: Semantically Grounded Part-Level 3D Generation via Collaborative Latent Denoising

DreamPartGen 将部件几何与外观表示和语言导出的关系语义表示结合,通过部件内、部件间同步去噪生成可编辑的三维组合体,在 PartRel3D 上将 CD 从 PartCrafter 的 0.371 降至 0.081,但其低重叠指标不能直接等同于物理装配正确。

On Geometric Understanding and Learned Priors in Feed-forward 3D Reconstruction Models

通过逐层基础矩阵探针、注意力敲除和受控场景扰动,本文发现 DUSt3R、VGGT 与 Depth Anything 3 确实形成了与对应匹配有关的几何表征,但 VGGT 在遮挡下也会借助先验补全对应关系,因此几何能力和数据先验不是非此即彼。

RAG-3DSG: Enhancing 3D Scene Graphs with Re-Shot Guided Retrieval-Augmented Generation

RAG-3DSG 用物体点云的虚拟重拍视角诊断跨视角描述冲突,再检索可信邻近物体来纠正不确定节点,使 GPT-4o 版本在 SceneFun3D 上的物体 R@10 从 OpenFunGraph 的 87.8% 提高到 90.2%。

ReconPhys: Reconstruct Appearance and Physical Attributes from Single Video

ReconPhys 将冻结的单图 3D 高斯重建器与视频物理参数预测器连接到可微弹簧质点仿真,用图像重建误差学习从单目自由落体视频生成可仿真资产,在合成测试集上将未来预测 PSNR 从 Spring-Gaus 的 13.27 提高到 21.64,并报告小于 1 秒的前馈推理时间。

URoPE: Universal Relative Position Embedding across Geometric Spaces

URoPE 将 key 图像块沿相机射线在固定深度锚点处提升为 3D 点、再投影到查询视图图像平面,让标准 2D RoPE 能直接编码跨视图/跨几何空间的相对位置关系,是一种参数无关、内参感知、坐标系统无关且兼容 FlashAttention 的通用位置编码。

World Reconstruction From Inconsistent Views

本文把视频生成中的几何漂移视为需要消除的观测形变,用非刚性点云对齐和逆形变感知的 2D Gaussian Splatting(2DGS)优化重建统一静态世界,在跨视频模型主实验中取得 79.29 的 3D 一致性和 86.59 的光度一致性得分。

Any to Full: Prompting Depth Anything for Depth Completion in One Stage

Any2Full 将稀疏深度编码为尺度提示,在冻结的 Depth Anything v2 内部引导几何一致的相对深度预测,再一次性恢复公制尺度,在跨域与多种缺失模式评测中取得 2.3 的平均排名,并以相同 DA-L 骨干实现比 PriorDA 约 1.4 倍的推理速度。

EventVGGT: Exploring Cross-Modal Distillation for Consistent Event-based Depth Estimation

EventVGGT 用混合特征辅助预测、时空特征对齐和深度变化蒸馏,把 VGGT 的多视图几何知识迁移到事件序列,在推理只使用事件的条件下,将 EventScape 的 30 m 截断平均绝对深度误差从 EventDAM 的 2.30 m 降至 1.06 m。

GaussianGPT: Towards Autoregressive 3D Gaussian Scene Generation

GaussianGPT 将 3D 高斯场景压缩为离散 token 序列,用带 3D 旋转位置编码的因果 Transformer 做逐 token 自回归预测,首次在 3D 高斯场景生成上实现纯自回归范式,在形状合成和场景生成上达到或超越扩散模型 SOTA,并天然支持场景补全和外扩。

Holo360D: A Large-Scale Real-World Dataset with Continuous Trajectories for Advancing Panoramic 3D Reconstruction and Beyond

Holo360D 通过连续手持全景采集、离线几何对齐与人工辅助修复,构建含 109,495 张全景的数据集,并证明现有前馈重建模型使用水平透视拆分和网格深度微调,比直接输入全景更适合恢复连贯几何。

MonoArt: Progressive Structural Reasoning for Monocular Articulated 3D Reconstruction

MonoArt 将单图铰接物体重建组织为几何生成、部件表示、双查询运动解码与运动学估计,在 PartNet-Mobility 的 46 类设置取得 0.670 F-Score 和 67.47% 关节类型准确率,但轴方向误差并非最优。

Syn4D: A Multiview Synthetic 4D Dataset

Syn4D 将高质量动态场景渲染与紧凑的网格跟踪标注结合,提供约 4.7K 多视角片段、1.4M 帧,并在不改变 4RC 架构的条件下,把 Soviet 测试集的稠密跟踪 APD 从 58.35 提升至 74.46。

TORA: Topological Representation Alignment for 3D Shape Assembly

TORA 在训练一个基于 flow-matching 的 3D 装配模型时,额外让它对齐一个冻结的预训练 3D 编码器的「点与点之间谁像谁」的关系结构(用 CKA 损失匹配 Gram 矩阵),从而把几何交互先验蒸馏进网络,收敛提速最高 6.9 倍、跨域鲁棒性显著提升,且推理时零额外开销。

Fisheye3R: Adapting Unified 3D Feed-Forward Foundation Models to Fisheye Lenses

Fisheye3R 用可学习校准 token 和按相机类型控制的注意力掩码,让冻结的统一前馈 3D 模型直接处理鱼眼及混合相机图像;仅用无标注透视图像适应,MapAnything 在 ScanNet++ 鱼眼测试上的位姿 AUC 就从 0.519 提升到 0.766。

FLEG: Feed-Forward Language Embedded Gaussian Splatting from Any Views via Compact Semantic Representation

FLEG 用一次前馈推理从任意数量(2~30+)、无标定无位姿的多视图图像重建出携带语言语义的 3D 高斯:训练时靠冻结 VGGT 的几何伪标签与 SAM2+CLIP 的语义蒸馏摆脱 3D 真值,并把语言嵌入从稠密几何高斯中解耦为一组稀疏「语义高斯」,只用不到 5% 的嵌入量就保持了可比的语义保真度。

GaussianLens: Localized High-Resolution Reconstruction via On-Demand Gaussian Densification

GaussianLens 以低分辨率图像前馈重建出的全局 3DGS 为骨架,对用户用 2D 掩码框选的兴趣区域额外输入该区域的稀疏高分辨率图像,用一个跨模态网络预测区域内高斯的残差式更新、并按高分辨率像素逐点撒下"像素引导高斯",把局部高清重建从"全局抬高分辨率"变成一次按需前馈——在 RE10K 256→512 与 DL3DV 256→1024 上分别达到 28.54 / 23.74 dB PSNR,比同等条件下的基线高 1 dB 以上,高斯数仅为全局高分辨率方案的 40%。

GENA3D: Generative Amodal 3D Modeling by Bridging 2D Priors and 3D Coherence

GENA3D 提出一种生成式非模态 3D 建模框架,通过 View-Wise Cross Attention 并行融合多视图 2D 补全特征、Stereo-Conditioned Cross Attention 将 MVS 点云作为几何门控注入注意力 logits,在稀疏遮挡输入下同时实现生成多样性与几何一致性,在 GSO 数据集上 FID 达 30.73(4视图),相比 Amodal3R 提升 4.4,且可见区域 SSIM 达到 0.838。

OmniX: Any-view and Any-time 4D reconstruction via Feed-forward Trajectory Fields

OmniX 将逐帧几何恢复与跨时刻运动预测解耦,用少量动态 token 生成轨迹变换基,再可变形采样为逐像素轨迹,在自建验证集的单目全帧评测中将前景 APD3D 从 VDPM 的 0.199 提高到 0.300。

OmniX: From Unified Panoramic Generation and Perception To Graphics-Ready 3D Scenes

OmniX 把预训练的 2D 流匹配模型(Flux.1-dev)改造成「多条件输入 → 多模态输出」的统一全景模型:用循环平移等变的算子改造消掉等距柱面接缝、用模态专属 LoRA 隔离各路条件输入,一个框架同时做图像→全景生成、RGB→距离/法线/反照率/粗糙度/金属度感知与掩码补全,再把距离图与材质图投影成带 PBR 材质的三角网格,得到可直接导入 Blender 做重光照与物理仿真的 graphics-ready 三维场景。

One Video, One World: Turning Monocular Video into Physical 4D Scenes

OVOW是首个将单目视频转为实例级、可物理仿真的4D mesh场景的训练无关系统,通过VLM引导场景分解、类别感知网格重建、迭代尺度姿态恢复和物理接地组装四阶段流水线,无需微调即可输出watertight网格实例并直接用于MuJoCo等物理仿真器。

Predictive Photometric Uncertainty in Gaussian Splatting for Novel View Synthesis

把不确定性做成每个 3D 高斯上一条与颜色同构的球谐通道,用训练视图残差图作为监督、以冻结的 α 混合权重构造线性最小二乘并用 Bayesian 先验正则求解,从而在任意新视角下渲染出逐像素不确定性图——Mip-NeRF360 上把 AUSE(DSSIM) 从 0.495 压到 0.214、Pearson 相关从 0.160 提到 0.547,额外训练开销仅 12.8%。

Towards Geometry-Grounded Dense Semantic Matching with VGGT Priors

本文把 VGGT 从同实例跨视角重建迁移到跨实例稠密语义匹配,通过直接预测双向采样网格、合成稠密监督和循环一致性训练,同时改善对应精度、局部结构保持与不可见区域的可靠性估计。

Volume Transformer: Revisiting Vanilla Transformers for 3D Scene Understanding

本文把 ViT 式的原版 Transformer 编码器(体素立方 patch 分词 + 全局自注意力 + 3D RoPE)直接搬进 3D 场景理解,用一个"强增强 + 强正则 + 卷积教师蒸馏"的数据高效训练配方补上当前 3D 监督的不足,再靠多数据集联合训练放大其规模优势,在 ScanNet / ScanNet200 / ScanNet++ 与 nuScenes / Waymo / SemanticKITTI 的语义与实例分割上取得新最好结果,且推理时比 PTv3 更快、更省显存。

AerialMetric: Benchmarking and Adapting UAV Monocular Metric Depth Estimation in the Real World

本文构建了包含四个互补子集的大规模无人机航拍单目度量深度基准 AerialMetric(52K 真实 + 16K 合成图像-深度对),系统性揭示了现有 SOTA 模型在空域视角下 δ1 接近 0 的严重域差距,并通过 LoRA 参数高效微调 MoGe2 在几乎不损失地面泛化能力的前提下将空域 δ1 提升至 84% 以上。

AirZoo: A Unified Large-Scale Dataset for Grounding Aerial Geometric 3D Vision

AirZoo 构建了一个百万级航空合成数据集,通过 AirSim-Cesium-Unreal 三位一体仿真管线从 Google 3D Tiles 自动渲染出带像素级深度和 6-DoF 地理参考位姿的无人机航拍序列,覆盖 22 个国家 377 条多天气轨迹,在航空图像检索、跨视角匹配和多视图三维重建三个任务上微调现有 SOTA 模型均取得显著提升,尤其是真实场景零样本泛化能力大幅增强。

Auto3R: Automated 3D Reconstruction and Scanning via Data-driven Uncertainty Quantification

Auto3R 从当前三维模型的颜色与深度渲染中学习预测不确定性,再用深度加权和可靠性重加权选择下一扫描视角,在 Objaverse 的最终 20 视图设置下取得平均 PSNR 27.00 dB,并将视角选择扩展到机器人连续扫描路径。

CameraAnything: Refilming Videos with Arbitrary Camera Control

CameraAnything 将逐像素相机射线注入视频扩散模型的注意力位置编码,并用可独立变化的合成相机监督训练,在一次生成中联合改变视点、焦距、画幅和镜头切换,在 DAVIS 重拍评测中将旋转误差从 ReCamMaster 的 5.11982 度降至 2.7600 度。

DART: Difficulty-Adaptive Routing for Zero-Shot Video Temporal Grounding

DART 将同一个查询条件化 DPP 核同时用于关键帧选择和难度估计,仅对复杂事件启用结构化时序推理,在不做任务微调的条件下取得 Charades-STA 48.93、ActivityNet Captions 39.89 的 mIoU。

Drop-In Perceptual Optimization for 3D Gaussian Splatting

本文把 3DGS 训练用的 2D 失真损失本身当作唯一的设计变量,系统比较了原始 L1+SSIM、L1+L2+MS-SSIM+LPIPS 复合损失与 Wasserstein 失真(WD)三类目标,并用 39,320 次成对人工评分的大规模主观研究定胜负,选出 WD 的轻正则版本 WD-R:只替换损失、不改任何 3DGS 算法,就能在人工偏好上达到原损失的 2.3 倍以上、比 Perceptual-GS 高 1.5 倍,且在 Mip-Splatting、Scaffold-GS 与压缩场景中同样生效(压缩场景约省 50% 码率)。

E-M3RF: An Equivariant Multimodal 3D Re-assembly Framework

E-M3RF 将随旋转一致变化的几何特征与逐点颜色特征融合,用 SE(3) 流匹配预测碎片位姿,并在训练时惩罚相互穿透,使 RePAIR 上的旋转 RMSE 从 GARF 的 49.31° 降至 37.91°,但并非在所有泛化数据集的所有指标上都占优。

Edit3r: Instant 3D Scene Editing from Sparse Unposed Images

Edit3r 把「编辑 3D 场景」改造成一次前向的稀疏无位姿高斯重建:训练时用 SAM2 重着色造出跨视图一致的监督信号、并用「一帧已编辑 + 一帧原始」的非对称输入主动制造跨视图冲突,让前馈主干学会把互相矛盾的逐视图 2D 编辑提议融合成几何一致的编辑后 3D 高斯,推理时约 0.5 秒出结果。

FILT3R: Latent State Adaptive Kalman Filter for Streaming 3D Reconstruction

FILT3R 把流式重建模型的递归状态更新重写成 token 空间里的状态估计问题——用 EMA 归一化的时序漂移在线估计过程噪声、把量测噪声固定成一个标量,让每个 token 的增益在场景平稳时随置信累积自动收缩、在真实场景变化时升高,从而在冻结骨干、完全免训练的前提下显著缓解长序列上的漂移与灾难性遗忘。

FoundationGeo: Learning Spatial Pixel-Wise Fields for Monocular Metric Geometry

FoundationGeo 先学习高质量相对点图,再用像素尺度场和射线方向校正恢复真实尺度,并以焦距多样化合成数据补齐相机分布,在七个零样本度量深度基准上取得平均 AbsRel 14.8%、\(\delta_1\) 80.8%。

Free-Range Gaussians: Non-Grid-Aligned Generative 3D Gaussian Reconstruction

Free-Range Gaussians 从四幅带相机位姿的图像直接生成不依附像素或体素网格的 8K 个高斯,以层级配对和重建引导改善不可见区域补全,在部分观测 GSO 上获得 28.08 dB PSNR 与 27.69 FID,但迭代生成并不等于单次前向重建。

From Perspective to Fisheye Depth Estimation and Open-Vocabulary Segmentation

本文提出 Distortion Extenders(DEX)——一组插进冻结主干每一层的轻量可学习调制器,通过在隐空间把鱼眼图像的特征分布拉回透视图像的特征分布,让只在透视数据上预训练的深度估计与开放词汇分割基础模型零样本迁移到鱼眼相机,训练不需要真值深度也不需要真实鱼眼图像,测试时不需要标定或重投影;在 ScanNet++、KITTI-360 与 WoodScape 三个真实鱼眼数据集上同时改善了 RMSE/δ1 与 mIoU,并且 DEX 的激活还能被解码回 KB 畸变系数用于相机标定。

FUSE: A Flow-based Mapping Between Shapes

把每个形状表示成一条从共享单位高斯锚点出发的可逆连续流(用流匹配训练),源形状的逆流与目标形状的正流一复合就得到两形状之间的点映射——既不训练配对模型也不做测试时优化,还能在网格、点云、SDF 与四面体网格之间跨表示匹配,在 FAUST/SMAL 等地标监督基准上达到最低或接近最低的对应误差。

GAINS: Gaussian-based Inverse Rendering from Sparse Multi-View Captures

GAINS 在 2D Gaussian Splatting 的两阶段逆渲染框架中系统性地接入五类基础模型先验(单目深度/法线、几何阶段 SDS、SAM 子部件分割、单目内蕴分解 IID、多光照 MI-SDS),在 4–32 个稀疏视角下把几何、材质与环境光解耦开,重光照 PSNR 在 Synthetic4Relight 上达到 28.16(Ref-Gaussian 为 24.29)、在 Shiny Blender 上达到 22.29(Ref-Gaussian 为 17.26)。

Geometry-Aware Single-Image 4D Synthesis via Dense Trajectory Generation

MoGe4D 先从单图估计几何,再以扩散模型生成几何条件化的稠密运动轨迹并补全新视角视频,在复杂相机运动测试中改善成像质量与轨迹误差,但并非所有视频一致性或动态指标都领先。

GeoWorld: Providing Full-frame Geometry Features to Facilitate 3D Scene Generation

GeoWorld 先补全相机轨迹下的粗视频,再把 VGGT 提取的全帧几何信息作为第二阶段的视频条件与训练约束,使 RealEstate10K 新视角合成 PSNR 达到 17.28 dB,随后重建的 3DGS 场景达到 16.64 dB。

GRAFT: Geometric Refinement and Fitting Transformer for Human Scene Reconstruction

GRAFT 是一个学习到的"人体-场景交互先验",它将基于优化的物理合理性拟合过程"摊销"进一个前馈 Transformer 中——通过几何探针将人体-场景的相对关系编码为 24 个紧凑 token,在循环迭代中预测"交互梯度"纠正漂浮和穿透,最终以 0.2s 的前馈速度达到优化方法级别的交互质量,且可作为即插即用先验提升任何前馈方法。

Hierarchical and Holistic Open-Vocabulary Functional 3D Scene Graphs for Indoor Spaces

本文将桌面可操作物体和物体内部层级引入功能三维场景图,以二维视觉锚定、多线索节点关联、时序边优化和全局层级塑形稳定恢复功能连接,在扩展 FunGraph3D 上比 OpenFunGraph Hierarchy 的总体节点与三元组检索分别高 13.9 和 20.5 个百分点。

HSImul3R: Physics-in-the-Loop Reconstruction of Simulation-Ready Human–Scene Interactions

HSImul3R把仿真器作为重建监督器,用场景定向强化学习修正人体运动、用直接仿真奖励优化修正物体几何,在HSIBench上将简单交互的稳定率从HSfM的10.52%提高到53.68%,但困难交互仍只有13.92%。

MAGiSt3R: Multi-Agent Feed-forward 3D Reconstruction from Monocular RGB Videos

MAGiSt3R 用 VGGT 预测局部几何,以共享的 MAGMA 网络完成智能体内部及智能体之间的子图配准,再通过位姿图优化修正漂移,在仅输入未标定 RGB 视频的条件下实现多智能体室内重建,ReplicaMultiagent 多智能体平均重建误差 Acc./Comp. 为 5.37/3.36,双智能体运行速度为 9 FPS。

Masked BRep Autoencoder via Hierarchical Graph Transformer

本文保持 CAD 边界表示的拓扑不变,掩去面与边的原始几何和属性,用双分辨率跨尺度注意力及局部消息传递重建它们,从而获得可迁移的表示,在 MFInstSeg 的 0.1% 标注设置下取得 88.75% 面级准确率。

Matryoshka Gaussian Splatting

MGS 把高斯按不透明度动态排序,并联合训练随机长度前缀与全集,使一个场景模型支持细粒度预算截断,在 MipNeRF 360 上获得 28.20 dB 全集 PSNR 和 64.81 的质量与帧率曲线面积,但训练时间约为骨干的两倍。

MoCam: Unified Novel View Synthesis via Structured Denoising Dynamics

MoCam 把「按目标轨迹渲染出来的点云脚手架」和「源视角视频」这两种条件按去噪时间轴接力使用——前期只用脚手架锚定几何与运动,越过一个切换点后换成源视频来纠错与细化外观——用一个视频扩散模型同时统一了单图 3D 重建与视频 4D 重打相机(re-camera)。

Neural Harmonic Textures for High-Quality Primitive Based Neural Reconstruction

本文把可学习特征向量锚定在每个图元(高斯/三角形)外接虚拟四面体的顶点上、在光线与图元的交点处做重心插值,先用 sin/cos 周期函数激活、再沿光线做不透明度加权累积——于是 alpha 混合本身就成了一次谐波分解——最后只用一个轻量 MLP 在图像空间做一次延迟解码;在 MipNeRF360 等三个数据集上以 140+ FPS 超过 3DGS、2DGS、Spherical Voronoi 等基线(MipNeRF360 28.74 PSNR / 25.68 PSNR on Tanks & Temples),并能无缝接入 2DGS 与 Triangle Splatting。

Point2Pose: Occlusion-Recovering 6D Pose Tracking and 3D Reconstruction for Multiple Unknown Objects Via 2D Point Trackers

Point2Pose 把长程 2D 点跟踪器当作贯穿整段视频的持久数据关联引擎:在物体上撒一组查询点、用深度把它们抬进物体坐标系累积成关键点地图,位姿由「当前观测 ↔ 地图」的配准解出,于是在没有任何 CAD 模型的前提下能同时跟踪多个未知刚体,并在物体被完全遮挡后重新出现时立刻恢复——代价是同数据集上的单物体 ADD 与重建精度略低于 BundleSDF。

Pseudo-Stereo Inputs: A Solution to the Occlusion Challenge in Self-Supervised Stereo Matching

本文用当前正在训练的模型自渲染出一张伪视图来替换输入对中的一侧,把网络输入与光度反馈解耦,使遮挡在遮挡物两侧等概率出现,再配合渲染过程给出的遮挡掩码与全伪立体输入策略保证稳定收敛;在 KITTI 2015 测试集上把 D1-all 从之前最好的 6.11% 降到 4.39%,遮挡区域的 D1 误差从 20.82% 降到 9.05%。

R3DP: Real-Time 3D-Aware Policy for Embodied Manipulation

R3DP 把 VGGT 的昂贵几何理解改为稀疏关键帧计算,用轻量时序网络持续更新特征并融合相机几何,使 RGB 扩散策略在 RoboTwin 十任务上达到 69.0% 平均成功率,同时在另一运行配置下将观测编码延迟从 73.1 ms 降到 40.3 ms。

SeeClear: Reliable Transparent Object Depth Estimation via Generative Opacification

SeeClear 用扩散模型把透明物体改成保留轮廓与表面明暗的不透明外观,再接入不微调的深度模型,使 DA3 在 ClearGrasp 透明物体区域的 RMSE 从 24.03 降至 21.45 mm。

SKEL-CF: Coarse-to-Fine Biomechanical Skeleton and Surface Mesh Recovery

SKEL-CF 提出了一种从单张 RGB 图像恢复生物力学骨骼和表面网格的粗到细框架:先用高质量 HMR-SKEL 数据集训练,再用显式相机内参建模消除深度歧义,最后通过编码器粗预测 + 解码器逐层迭代优化的策略,在 MOYO 等挑战性数据集上大幅超越此前 SKEL 方法 HSMR(MPJPE 降低 18.6%),同时达到与 SMPL 方法相当甚至更优的数值精度,且输出解剖学上更合理的姿态。

TACO-Net: Topological Signatures Triumph in 3D Object Classification

TACO-Net 先把点云转换为多种灰度体素上的固定拓扑统计,再训练轻量 1D CNN 学习这些统计之间的关系,在 ModelNet40 上取得 99.05% OA,但包含拓扑特征生成的完整吞吐量约为 5.3 个点云/秒。

WAFT-Stereo: Warping-Alone Field Transforms for Stereo Matching

WAFT-Stereo 用一次视差分类初始化和高分辨率特征变形驱动的循环回归取代代价体,在纯合成数据训练下取得 ETH3D BP-0.5-noc 0.89%,并以 DAv2-L、5 次迭代在 L40 上处理 540p 输入耗时 106 ms。

WorldMesh: Generating Navigable Multi-Room 3D Scenes via Mesh-Conditioned Image Diffusion

WorldMesh 先构建带物体的多房间网格,再把逐步积累的纹理与深度作为图像生成条件,最后以网格深度约束 3D Gaussian Splatting(3DGS)重建,在 31 人感知研究中获得对基线平均 96.2% 的偏好;其核心是持久几何约束,而不是仅生成一条看起来连贯的视频。

3D-LENS: A 3D Lifting-based Elevated Novel-view Synthesis method for Single-View Aerial-Ground Re-Identification

3D-LENS把单一真实视角的图像提升为固定纹理网格,渲染缺失的空中或地面视角,再用外观对齐和稳健混合训练学习重识别表示,在不使用真实目标视角训练样本的条件下,将AG-ReID.v2航拍训练、CCTV到航拍检索的mAP提升到37.8%,比该列最强既有方法PASS高21.2个百分点。

Axolotl3D: a Unified Framework for Faithful 3D Shape Completion

Axolotl3D 把图像、可见性掩码、相机和部分点云统一为 3D 生成条件,以几何锚点约束补全,在 Toys4K 单视图遮挡设置中达到 0.9046 F-score,同时支持保留未编辑区域的局部形状修改。

Beyond Prompts: Unconditional 3D Inversion for Out-of-Distribution Shapes

论文发现原生 text-to-3D 生成模型(TRELLIS)在分布外文本条件下会掉进对提示"无感"的 sink trap,于是在反演时把描述源形状的提示整个换成空提示、只在无条件先验里锚定形状,既把非刚性形状的反演重建误差从 L1 17.75 降到 5.40,又解锁了第一个只靠目标提示、不需要掩码与 2D 先验的 3D 编辑流程(SigLIP 0.1469,约为最强基线的 1.8 倍,平均 9 秒一次编辑)。

BrepLLM: Enabling Large Language Models to Understand Boundary Representations

BrepLLM 是首个让大语言模型直接解析和推理原生 B-rep(边界表示)CAD 模型的框架:通过自适应 UV 采样将 B-rep 转为面-边拓扑图,用层级化 BrepEncoder 提取面/边/拓扑三支解耦特征,再经 CLIP 对比预训练和两阶段渐进式 LLM 微调,最终在 3D 物体描述和分类任务上全面超越基于点云和图像的基线模型。

CanoVerse: 3D Object Scalable Canonicalization and Dataset for Generation and Pose

CanoVerse 将连续三维旋转标注改为五种候选姿态的人工选择,构建 320K 对象、1,156 类的规范化数据集,使 VI-Net 在 OmniObject3D 上的 Acc@10° 达到 20.18%,并显著降低图像到三维生成的姿态波动。

City-Level 3D Surface Reconstruction with Viewpoint Orientation Partitioning and Scene Completion

本文先把有利于相互重建的相机视图分到同组,再按关键点分布熵选择性补全初始点云,最后用多视图一致性优化高斯表示,将 MatrixCity 的表面重建 F1 从 CityGS-X 的 0.581 提高到 0.803。

DDStereo: Efficient Dual Decoder Transformers for Stereo 3D Road Anomaly Detection

DDStereo 把「与类别无关的定位」和「语义分类」拆到两个解码器里——3D 主分支在左视图纹理特征上回归尺寸/朝向/已知类别,前景分支在立体视差特征上只做二分类判断"是不是障碍物",两支共用同一组 object query 保证实例对齐,异常分数由前景置信度减去最大已知类概率得到;在 AR-OoD 上 OoD 类 AP3D 达 78.09%(比 S3AD 高 4.40),同时在 KITTI 上以 24 ms / 19.6 M 参数达到与单目检测器相当的实时速度。

DefenseSplat: Enhancing the Robustness of 3D Gaussian Splatting via Frequency-Aware Filtering

DefenseSplat 通过小波变换分解输入图像、滤除高频子带来抑制对抗扰动,并引入 ReLU 形式的尺度正则化损失限制拉长高斯体的生成,在没有干净真值监督的条件下显著提升 3DGS 对对抗攻击的鲁棒性。

Dense Dynamic Scene Reconstruction and Camera Pose Estimation from Multi-View Videos

本文为「多台自由移动相机同时拍摄同一个动态场景」这一设定提出两阶段优化框架:先用前馈重建模型 VGGT 做宽基线初始化、建立跨相机的统一尺度锚点,再用一张把相机内时序、同刻跨相机、跨相机的历史帧三类约束统一起来的时空连接图做多相机联合 bundle adjustment,最后用宽基线稠密光流做「帧级尺度对齐 + 位姿与逐像素深度交替精修」,在合成与自采真实数据上的位姿精度、场景一致性和显存占用同时优于 COLMAP/GLOMAP 与 VGGT/Fast3R/FastVGGT/CUT3R,并发布了带动捕真值的 MultiCamRobolab 数据集。

DreamCAD: Scaling Multi-modal CAD Generation using Differentiable Parametric Surfaces

DreamCAD 用共享边界的可微参数曲面承接大规模网格的点级监督,再以粗到细流匹配支持图像、点云和经图像中转的文本条件生成,在 ABC 点云到 CAD 任务上将 Cadrille 的 CD 从 2.98 降至 0.93(表中数值均为原始 CD 乘 \(10^3\)),但完整 CAD 拓扑仍需额外恢复。

EditVerse3D: High-Quality 3D Object Editing with Region-Aware Learning

EditVerse3D 将 TRELLIS 改造成接受原始物体、粗三维包围框和局部参考图像的监督式编辑器,通过匹配粗输入的训练与区域损失重加权,在添加任务上将 Repaint 的整体 PSNR 从 27.44 提高到 28.67,同时降低用户准备精确掩码和完整编辑视图的负担。

Efficient Camera Pose Augmentation for View Generalization in Robotic Policy Learning

GenSplat 从稀疏、未标定的机器人多视角观测前馈重建三维高斯场景,以三维先验蒸馏稳定几何,再保持动作标签生成新视角示范,使大幅相机扰动下的 \(\pi_0\) 平均成功率从 48.9% 提升至 62.2%,合成耗时为每帧 0.14 秒。

Face Anything: 4D Face Reconstruction from Any Image Sequence

本文提出Face Anything,将4D人脸重建与跟踪统一为规范坐标预测问题——网络从任意图像序列中同时估计深度和规范人脸坐标,稠密对应关系直接通过在规范空间做最近邻搜索获得,无需显式建模帧间运动,在深度估计(RMSE降低16%)、对应关系精度(3倍提升)和推理效率(32倍加速)上全面超越现有方法。

Fourier Splatting: Generalized Fourier encoded primitives for scalable radiance fields

本文把平面面元的边界从"固定圆盘"换成一条由傅里叶级数定义、可以随时截断的闭合曲线,让基元自身携带连续可调的细节层次:同一个训练好的模型只要在渲染时少传几个傅里叶系数,就能得到更低码率/更低细节的画面,无需重训或剪枝,在 Mip-NeRF 360 上取得平面基元方法中最好的 PSNR 与 SSIM。

From Blobs to Spokes: High-Fidelity Surface Reconstruction via Oriented Gaussians

本文给每个 3D 高斯附加一个可学习的定向法向,把它从"无朝向的对称团(blob)"重新解释成"只朝外侧半空间衰减的随机面元",使 3DGS 满足 Objects as Volumes 的互易衰减假设、闭式导出占据(occupancy)与法向场,再配合法向对齐损失、法向感知致密化与 Primal Adaptive Meshing,在 DTU、Tanks and Temples 上以每个高斯仅 2 个枢轴的提取方式和远小于同期方法的网格体量取得新的 SOTA,并稳定重建出自行车辐条这类极细结构。

Gaussian Belief Propagation Network for Depth Completion

GBPN 把深度补全重新表述为「在一张由网络动态构建的马尔可夫随机场上做高斯置信传播」——网络不直接回归深度,而是学出 MRF 的势函数、边权和非局部边结构,再用可微的高斯 BP 迭代推理出稠密深度分布(均值当深度、精度当置信度),在 NYUv2 / KITTI 上达到 SOTA,尤其在极稀疏输入下鲁棒性远超纯回归网络。

Gaussians on Fire: High-Frequency Reconstruction of Flames

本文把火焰重新定义为"短寿命的体积发光载体"而不是"持续存在的场景基元":给每个 3D 高斯加上生命周期与线性速度,用三视角稠密光流融合出的 3D 流场初始化它们,再配合 ESP32 + LED 的亚帧同步采集与静态/动态解耦,仅用三台消费级相机就重建出时序一致的高频火焰 4D 表示,在火焰区域 PSNR/SSIM/LPIPS、深度一致性以及合成场景的运动场相似度上全面超过 4DGS、Grid4D、FreeTimeGS 等动态高斯基线。

Generalizable Neural Reconstruction of High-Fidelity Surfaces via Sparse Volumetric Representations

SVRecon 用一个「低分辨率占用预测 + 高分辨率稀疏特征体」的两阶段嵌套结构替换泛化式神经表面重建里昂贵的稠密特征体,在 32GB 显存内把前馈重建的分辨率从 128³ 推到 512³,在 DTU 稀疏视图上给出最平滑、法向一致性最好的表面。

HandSCS: Structural Coordinate Space for Animatable Hand Gaussian Splatting

HandSCS 为每个手部高斯建立相对骨架的结构坐标,再结合逐高斯残差嵌入和跨姿态匹配约束细节,使 InterHand2.6M 的 test/Capture0 新姿态渲染达到 32.91 dB PSNR、0.0291 LPIPS,同时保留了部分 SSIM 不及基线的例外。

Heat Kernel Textures -- the Geodesic Gaussians That Do Not Splat

HKTex 将可学习的各向异性热核直接放在三角网格曲面上,用曲面约束优化与可微光线追踪替代 UV 纹理存储,在较小的报告存储量下恢复细节,但并不具备 Gaussian Splatting 的高速光栅化优势。

HiReFF: High-Resolution Feedforward Human Reconstruction from Uncalibrated Sparse-View Video

HiReFF 以 VGGT 为骨干,加上高斯头、掩码头与一条高分辨率旁路,从四路相隔 90° 的无标定视频前馈重建人体 3D 高斯,在 2072×2072 分辨率下做 360° 动态人体的新视角合成,单张 RTX 4090 上流式重建速度 3.01 FPS。

Improving Sparse-View 3DGS Generalization via Flat Minima Optimization

本文从平坦极小值(Flat Minima)优化的视角解决稀疏视图 3DGS 的过拟合问题:通过尺度自适应的位置扰动(SAP)+ 随机施加 + 幅度调度 + 周期性非位置参数重初始化,在不改变网络架构的前提下使 3DGS 收敛到更平坦的损失景观区域,在 LLFF 和 Mip-NeRF360 上稀疏视图设定下取得 SOTA 或接近 SOTA 的渲染质量。

Interact3D: Compositional 3D Generation of Interactive Objects

Interact3D 提出无需训练的"先生成再组合"框架,利用 2D/3D 生成模型的空间先验将 3D 组合生成转化为结构化配准问题,通过两阶段组合管线(全局到局部几何对齐锚定主物体 + SDF 碰撞感知优化放置剩余物体)和 VLM 驱动的智能体闭环迭代修正,从单张图像和文本提示自动生成物理合理、无碰撞的交互式 3D 组合场景,并发布 8,000+ 对交互式 3D 数据集。

Interaction-Aware 4D Gaussian Splatting for Dynamic Hand-Object Interaction Reconstruction

在不用任何物体形状/类别/位姿先验的前提下,本文把动态手物交互场景拆成手、物体、背景三套解耦的隐式场来驱动 4D 高斯泼溅,给高斯追加可学习的权重 \(w\) 与半径 \(o\) 来刻画遮挡与边缘锐度,把手部关键帧位置拼进物体变形场让物体形变由手条件化,再配合显式的手部/物体旋转/交互正则与五阶段渐进式优化,在 HOI4D 与 HO3D 上把视图合成指标推到超过 4DGS、Deform3DGS、SC-GS 以及专门的 HOLD/BIGS 的水平(HOI4D 平移场景 PSNR 30.32 dB,比最强基线高 3.99 dB)。

IRIS: Intersection-aware Ray-based Implicit Editable Scenes

IRIS 把可移动高斯作为神经特征载体,用解析射线采样和局部特征聚合替代密集采样及逐点三维近邻搜索,在 NeRF Synthetic 上以 32.65 dB PSNR 获得 6.038 FPS,但其优势主要是相对既有可编辑神经场的效率提升,而非所有场景都达到实时渲染。

Know3D: Prompting 3D Generation with Knowledge from Vision-Language Models

Know3D 将 Qwen-Image-Edit 的背面生成中间特征注入 TRELLIS.2,使单图到 3D 生成能够接受不可见区域的语言约束,在 HY3D-Bench-test 上取得 ULIP 0.2174、Uni3D 0.3518,但背面指令遵循能力主要由定性案例展示。

LinStereo: Linear-Complexity Global Attention for Multi-Scale Iterative Stereo Matching

LinStereo 把迭代式立体匹配里那个一直在局部窗口里打转的 ConvGRU 更新算子换成位置感知的线性注意力(PALA),让每一次精修都能在整张特征图上做 O(N) 的全局聚合,再配上逐尺度相关体(HSCV)与单目深度暖启动(DPI),只用 SceneFlow 训练就在标准基准上达到同级最强,并在无水下数据的情况下于 TartanAir-UW / SQUID 上拿到最好精度。

MAC-Splat: Multi-Attribute Consistency for High-Fidelity Sparse-View Reconstruction

MAC-Splat 用语义增强的二维匹配连接不同视角预测的三维高斯,联合约束位置、形状和外观,在 ScanNet++ 的 Very Wide 划分达到 21.34 dB PSNR,比 Splatt3R 高 5.18 dB。

Markov-Renewal Single-Photon LiDAR Simulator

把 SPAD 死时间下的光子注册过程写成马尔可夫更新过程(MRP),用闭式公式解析预测每个像素的光子计数分布(高斯均值与方差)和时间 PDF,再靠「延迟不变性 + 预计算查表」一次并行采样出整幅 H×W×n_b 直方图立方体:统计上与逐光子拒绝采样的 gold standard 无法区分,但生成 128×128×1024 立方体只要 1.01 s 对 40.8 s(>40×)。

MLP Splatting: Object-Centric Neural Fields

MLP-Splatting 把场景的每个基元从"一个高斯椭球"换成"一个参数不共享、只在自己各向异性高斯支撑内起作用的紧凑 MLP",用分块排序的稀疏体渲染合成图像;仅靠 RGB 监督,这些神经基元就自发特化到物体或物体部件上,因此不训练任何分割掩码就能做物体级编辑,并在 Replica/ScanNet 上以约 1/7 的内存和约 5 倍的速度达到与 Feature-3DGS 持平甚至更好的渲染质量。

Monocular Avatar Reconstruction via Cascaded Diffusion Priors and UV-Space Differentiable Shading

用一个统一的预训练扩散骨干串联「纹理补全 → 光照均质化 → 材质分解」三个子任务、每个子任务只挂一个 LoRA,再配合 UV 空间可微 BRDF 渲染损失,仅用不到 100 个真实 3D 扫描就从单张野外照片重建出 4K 分辨率、可重打光的高保真人脸 PBR 数字人。

Monte Carlo Energy Aggregation for Mobile 3D Gaussian Splatting

Flux-GS 通过蒙特卡洛镜面能量聚合将三阶球谐函数压缩为一阶表示,辅以零推理开销的属性条件增强模块和多视图 alpha 加权致密化/剪枝策略,在移动端骁龙 8 Gen 3 上实现 130+ FPS 的实时高保真新视角合成,同时将存储压缩至 2-5 MB,训练时间从 Mobile-GS 的 80+ 分钟降至 11 分钟。

MotionAnymesh: Physics-Grounded Articulation for Simulation-Ready Digital Twins

MotionAnymesh 用 SP4D 运动先验约束 VLM 的部件归组、再用"接触界面几何初始化 + 物理约束轨迹优化"两段式估计关节,把单张静态网格零样本地转成零碰撞、带行程限位的 URDF 数字孪生,在分割 mIoU 上拿到 0.86、在 SAPIEN 里的物理可执行率达到 87%(此前最好方法仅 46%)。

Multi-View Foundation Models

本文在二维基础模型内部插入多视图适配器,联合处理同一静态场景的图像,并以几何对应监督和语义正则约束特征,使 DINOv2 的 ScanNet++ 定位误差从 0.1029 降至 0.0247,同时将相对原模型的特征余弦相似度保持在 0.9376。

OrthoTrack: Continuous 6-DoF UAV Trajectory Estimation Anchored in Public Orthophotos

OrthoTrack 提出一种免训练的无人机6-DoF连续轨迹估计系统,仅利用公开的正射影像(DOP)和地表模型(DSM),通过"关键帧稠密匹配锚定 + 帧间光流传播"的交替策略,在无需GPS、IMU或后处理对齐的条件下,以实时帧率实现亚米级绝对度量位姿估计,并配套发布了大规模多模态基准 MovingDrone。

Pix2NPHM: Learning to Regress NPHM Reconstructions From a Single Image

Pix2NPHM 用一个几何预训练的人脸专用 ViT,把单张图像直接回归成 MonoNPHM 的解耦身份/表情隐码,靠自建的 102K 个 NPHM 配准数据和基于估计法向的二维自监督训练,在 NeRSemble SVFR 与 NoW 上超过所有公开的单图人脸重建方法,前馈推理在 RTX3080 上约 8fps。

PixGS: Pixel-Space Diffusion for Direct 3D Gaussian Splat Generation

PixGS 把 3DGS 的每个高斯属性排布成多视角「属性图像」,用预训练像素空间扩散模型(PixNerd,约 4500 万张图像先验)以流匹配方式直接去噪这组属性张量,配上 2 倍超分渲染监督、深度/法线与多尺度 LoG 正则以及三阶段训练课程,在单卡 A100 上约 1 秒完成文本或图像条件的 3DGS 生成,并在 T3Bench 与 GSO 上同时超过 DiffSplat、TRELLIS、GaussianCube、LGM、DreamGaussian 等基线。

RAGA: Real Time Ray Traced Gaussian Shadow Casting for 3DGS Avatar-Scene Interaction

RAGA 提出了一种完全在高斯空间中计算阴影的射线追踪方法——对每条阴影射线做精确的高斯线积分并归一化,得到描述光线"穿过多少"遮挡体的厚度因子,以此驱动阴影透射率;同时引入化身代理(avatar proxy)消除动画中的时序抖动,在 NVIDIA OptiX 上实现约 50 FPS 的交互式阴影投射。

RayMap3R: Inference-Time RayMap for Dynamic 3D Reconstruction

RayMap3R 发现用 RayMap 训练的流式重建模型在「只喂 RayMap 特征」时会出现静态场景偏置,于是用主分支与 RayMap 分支的逐像素深度差在推理时识别动态区域、并以此门控记忆状态更新,再叠加重置度量对齐与状态感知平滑,在不训练、不引入外部模块的前提下把动态场景下的位姿/深度/重建精度推到流式方法前列。

Rotate Your Character: Revisiting Video Diffusion Models for High-Quality 3D Character Generation

RCM 将复杂姿态的单张或多张角色图像转成规范 A/T 姿态的高分辨率环绕视频,利用视频先验、逐像素相机条件和三阶段训练改善新视角合成,再由独立的重建模型生成网格。

SGMatch: Semantic-Guided Non-Rigid Shape Matching with Flow Regularization

SGMatch 把多视角渲染经 DINOv2 编码再反投影到曲面得到的语义特征,用「通道门控 + 网格邻域受限交叉注意力」的方式注入几何描述子,同时把条件流匹配(CFM)改造成顶点级特征输运的时间条件正则项来平滑稠密对应恢复,在强非等距形变(SMAL 测地误差 2.5)与拓扑噪声(TOPKIDS 2.9)基准上取得最好结果。

ShellMaker: Language-Guided Exterior Completion under Structural Constraints

ShellMaker 提出语言引导的建筑外观补全框架:给定建筑脚手架(室内生成器/CityGML/CAD 输出的墙体+门窗开洞布局)和一句风格提示词,通过参数化屋顶生成、LLM 部件感知提示词精化、兼容性感知的墙-屋顶纹理联合检索、几何感知装配四个模块,产出完整 PBR 外立面网格,在严格保持足迹和开洞布局的前提下匹配任意建筑风格,足迹 IoU 达 0.992,开洞中心误差仅 0.091。

SK-Adapter: Skeleton-Based Structural Control for Native 3D Generation

SK-Adapter 提出将 3D 骨架作为第一类控制信号,通过轻量级 adapter 网络(GRPE 拓扑编码 + 骨骼交叉注意力)注入冻结的 3D 流匹配生成骨干(Trellis),在保留预训练生成先验的前提下实现面向原生 3D 空间的精确骨架结构控制,同时配套构建了 24k 图文-网格-骨架三元组数据集 Objaverse-TMS。

StoryBlender: Inter-Shot Consistent and Editable 3D Storyboard with Spatial-temporal Dynamics

StoryBlender 把"剧本生成故事板"从逐帧采样像素改成在 3D 引擎里做分层多智能体规划:先用四层连续性记忆图解耦全局资产与镜头局部变量,再把资产实例化成统一坐标系的 3D 网格,最后用引擎物理校验 + VLM 评审构成的反思环求解布局、相机与灯光动作,在 CineBoard3D 上同时拿到跨镜头一致性(CIDS Self 0.917 / Cross 0.803、OCCM 78.16)与非破坏性可编辑性。

StructSplat: Generalizable 3D Gaussian Splatting from Uncalibrated Sparse Views

StructSplat 将几何、语义和纹理交给不同编码路径,再用不向高斯特征泄漏目标图像的相机对齐机制完成前馈重建,在 DL3DV 双源视图、无相机参数输入且无后优化的设置下达到 28.045 dB PSNR。

SuperFlex: Deformable Superquadrics for Point Cloud Decomposition

SuperFlex 用联合体积与表面损失学习可弯曲、可渐缩的超二次曲面,并以优化后的完整分解监督遮挡输入,使 ShapeNet 前馈 IoU 从 SuperDec 的 0.59 提升到 0.72,同时保留平均 5.64 个基元的紧凑表示。

SuperVoxelGPT: Adaptive and Ordered 3D Tokenization for Autoregressive Shape Generation

SuperVoxelGPT 先按预测的几何显著性划分并排序超体素,再用 Qwen2.5-0.5B 与 Jacobi 解码生成局部几何 token,在图像到三维测试中用平均 1,048 个形状 token、4.60 秒实现接近 TRELLIS2 的几何质量。

TAIHRI: Task-Aware 3D Human Keypoints Localization for Close-Range Human-Robot Interaction

TAIHRI 把"机器人第一人称相机下任务相关人体部位的三维定位"改写成视觉语言模型的下一 token 预测问题:把交互空间量化成体素 token、让模型先推理 2D 关键点再推深度、并用姿态感知奖励做 GRPO 强化微调,在 Harmony4D 与 EgoBody 的近距离设定下把上半身关键点的全局 MPJPE 从 124.91 mm 降到 93.83 mm。

TanGO: Training-Free 3D Editing via Tangent-Space Guidance and Optimization

TanGO 把基于 VecSet 潜表示的流匹配 3D 生成模型的文本编辑,写成每一步都要解一次的瞬时单步最优控制问题:用源/目标条件速度场之间逐 token 的方向失配(vMF 负对数似然,即 \(1-\cos\theta_i\))决定每个 token 的引导增益,闭式解让该改的 token 被强推、该保留的 token 被压住,从而在不需要掩码、不需要微调、也不需要反传优化的前提下完成局部编辑;在自建 TanGOEdit 基准上 CLIP-T/CLIP-I/DINO-I 分别为 0.2301/0.7679/0.6510,全面超过 FlowEdit 与 AnchorFlow,单次编辑耗时约 28.7 秒。

TouchAnything: Diffusion-Guided 3D Reconstruction from Sparse Robot Touches

TouchAnything 把稀疏触摸提供的局部几何与冻结的二维扩散模型提供的类别形状先验结合,在无需任务专用扩散训练的情况下,通过由粗到细的优化重建三维物体,并在 20 次触摸的六类仿真评测中获得更低的 EMD。

TreeSRNF: Square-Root Normal Fields for Generative Modelling of the Geometric and Structural Variability in Tree-like 3D Objects

把平方根法向场(SRNF)从固定拓扑的 genus-0 曲面推广到分支结构可变的树状 3D 物体——每个树枝参数化为单位圆柱上的曲面、按分叉点递归组装成层级树——在由此得到的 TreeSRNF 树-形状空间上用「父枝弯曲/拉伸 + 分叉点位置 + 子树几何」三项加权的度量做配准、测地线与统计,并在一个可解析求逆的切向量空间里用 PCA + 多元高斯采样生成新的 3D 树。

TriFlow: Generating Artist-Like 3D Mesh Topology via Nearest-Vertex Vector Fields

TriFlow 把网格拓扑表示成定义在表面上的最近顶点向量场(NVF,每个表面点指向它所在三角形里重心坐标最大的那个顶点),用条件隐空间流匹配从输入 SDF 生成这个场,再用分水岭聚类加约束 QEM 化简把场无损地提取回网格——绕开了自回归序列建模的慢推理与误差累积,几何误差相对此前最好的学习类方法在 Objaverse 上从 0.98 降到 0.12、单样本推理快约 8 倍,生成的拓扑在 VLM 与人工偏好评测中全面胜出。

TRiGS: Temporal Rigid-Body Motion for Scalable 4D Gaussian Splatting

TRiGS 把每个高斯基元的运动写成 se(3) 上的连续刚体轨迹——耦合指数映射给出旋转与平移、可见性窗口内的二次 Bézier 残差刻画非线性、逐基元局部锚点充当独立旋转中心——从而在 0.5M 基元、160 MB 的恒定预算下,把 SelfCap 的 600/900/1200 帧序列和 N3V 上的渲染质量同时推到最高。

UniQueR: Unified Query-based Feedforward 3D Reconstruction

UniQueR 把前馈式 3D 重建从「逐像素预测」改写成「一组稀疏 3D 查询的推理」:4096 个带显式 3D 坐标的可学习锚点在共享场景坐标系中与多视图特征交互、各自派生 64 个高斯,一次前向即从无位姿图像同时给出相机位姿、点图与可渲染高斯,在 Mip-NeRF 360 / VR-NeRF 上用约 1/15 的基元数量取得优于前馈基线的渲染质量与深度精度。

Video Generative Models as Geometry Learner

GeoNeXt 把单张 RGB 图像的深度和法线当作视频模型的后续“帧”,同步重建图像与几何,仅用 59K 合成训练样本便在 KITTI 上将统一生成基线 GeoWizard 的深度 AbsRel 从 14.4 降至 8.2,但并非所有指标都优于专用模型。

Wid3R: Wide Field-of-View 3D Reconstruction via Camera Model Conditioning

Wid3R 把多视图前馈重建的输出从「点图」改成「球谐射线方向 + 沿射线径向距离」的解耦表示,并用可学习的相机模型 token 显式条件化共享主干,使同一个网络无需标定和去畸变就能对鱼眼、360° 畸变图像单次前向预测稠密点图与相机位姿;在 Zip-NeRF(鱼眼)上把 AUC@30° 从 π3 的 40.94 提到 74.61,在 Stanford2D3D(360°)上从之前最好的 2.60 提到 79.93。

ZeroSplat: Generalized Referring Segmentation in 3D Gaussian Splatting

ZeroSplat 将视觉语言模型的类别与定位先验,经多视角掩码和几何约束转成高斯点级二值标签,无需逐场景语义训练或额外语义特征存储,在 GR-LERF 与 GR-ScanNet 上分别达到 50.8 和 41.2 mIoU。

3D Scene-Adaptive Trajectory-Controllable Human Image Animation with Camera Movement

3STC-HIA 在统一三维场景中沿用户路径修正人体高度与朝向,再以可见场景点云指导预训练视频模型,实现免训练的人物运动与相机联合控制,在 Trajectory100 上将平移误差从 RealisMotion 的 1.305 m 降至 0.478 m,但朝向误差并未同步改善。

4DGS360: 360° Gaussian Reconstruction of Dynamic Objects from a Single Video

4DGS360 用高置信二维轨迹为三维跟踪提供时空锚点,先建立包含遮挡区域的可靠运动初始化,再优化动态高斯,在不依赖扩散模型的基础流程中改善全周重建,iPhone 五场景平均 LPIPS 从 HiMoR 的 0.4639 降至 0.3877。

A Benchmark for Heterogeneous Stereo Deblurring with Physically- and Epipolar-constrained Cross Attention

本文构建面向手机广角与超广角相机的 HSD 非对称去模糊基准,并用 PECA 将跨视角检索限制到物理可行的单向极线窗口,使 NAFNet 在 HSD 上从 32.16 dB 提升到 32.92 dB,同时避免全局匹配的高额开销。

A second-order theory of texture for depth from focus

本文从波动光学解释看似无纹理表面仍具有可用于聚焦深度估计的主观散斑,并用窄带滤光片提高其对比度,在自然环境光下恢复原本难以重建的表面,但收益需要额外曝光时间且依赖材料与照明条件。

AC3S: Adaptive Conditioning for 3D-Aware Synthetic Data Generation

本文提出AC3S,通过自适应视觉提示调制器动态衰减ControlNet的条件注入强度,并辅以多智能体VLM系统生成与几何结构一致的文本提示,在保持3D姿态精确对齐的前提下大幅提升合成图像的逼真度和多样性,FID相较基线3D-DST降低15.95点,下游分类和姿态估计任务均取得显著提升。

Agentic Collaborative Cognition for Zero-Shot 3D Understanding

这篇论文把零样本 3D 场景理解改造成 Planning Agent 与 Perception Agent 围绕显式 holistic cognitive map 反复协作的过程,通过主动补关键视角、跨视角记录物体属性和反馈式候选过滤,在 ScanRefer / Nr3D / SQA3D / ScanQA 等 6 个基准上明显优于已有零样本方法。

AIMold: An Autonomous AI-based Pipeline for Complex Mold Design

AIMold 将复杂零件的模具设计串成方向筛选、粗体素装配生成、潜变量几何细化与 CAD 后处理,在 MoldCAD 测试集上将辅助组件生成的 COV 从 VecSet 基线的 21.24% 提升至 57.29%,但生成结果仍需下游制造验证。

AirSplat: Alignment and Rating for Robust Feed-Forward 3D Gaussian Splatting

AirSplat 只微调 DA3 的高斯预测头,用训练时的自一致位姿对齐修正错误监督,再用教师几何评分约束不透明度以抑制漂浮伪影,在 RE10K 12 视图设置中将 PSNR 从 20.78 提升到 23.08 dB。

AnchorSplat: Fast and Structure Consistent Detail Synthesis for Gaussian Splatting

AnchorSplat 将低质量高斯资产视为带属性点云,用局部点锚约束和单次多高斯生成直接补充三维细节,在不访问原始多视角图像的推理条件下,于 3DGS-SR 达到 36.57 dB PSNR,报告每个资产约 0.01 秒的处理时间。

AnyMatch: Supercharging Universal Multi-Modal Image Matching with Large-Scale Single-View Images

AnyMatch 提出一种从海量单视图图像零成本合成多模态多视角匹配数据的框架,通过单目深度估计+3D重投影+扩散补全实现几何一致的视角变换,结合跨模态图像翻译实现红外/深度/法向/事件四种模态生成,并用样本级几何一致性验证(SGCV)过滤生成瑕疵;在 Any-syn 合成数据集上微调 LoFTR/EDM/RoMa 后,跨模态匹配性能大幅超越 MINIMA 等现有合成方法,且在未见医学/遥感模态上展现出强零样本泛化能力。

APT: Anchor-aligned Perturbations for Tamper Localization in Fully Regenerated Images

针对真实扩散图像编辑中全图重生成导致背景主动水印被抹除的问题,APT 在 VAE 潜空间优化密集向量级锚点对齐扰动,利用生成前景服从自然分布偏离锚点而背景重建保留对齐特征的天然视差,实现全图重生成与拼接双重场景下的精准像素级篡改定位。

AquaStereo: Enabling Underwater Stereo Matching via Depth-Conditioned Diffusion and Geometry Self-Distillation

针对水下立体匹配真实数据匮乏与严重特征退化痛点,AquaStereo 提出深度条件扩散生成结合左右一致性校验构建大规模几何保真水下立体数据集,配合冻结陆地教师的跨域几何自蒸馏与时序感知增强特征匹配器,在无需目标域微调下大幅刷新零样本水下泛化性能。

Argus: Metric Panoramic 3D Reconstruction for Indoor Scenes

针对室内无序全景图像重建中参考视角漂移与尺度模糊问题,Argus 提出了可学习的共视感知参考帧选取机制与过完备几何分解监督策略,在首个大规模全景 RGB-D 数据集 Realsee3D 上实现了单次前馈、高精度的室内度量级 3D 重建。

Articulated Object Reconstruction from Rest-State Observation

Rest2Art 提出了首个仅从单一静止闭合状态网格重建多部件铰接物体的框架,通过视觉语言模型与分割模型的迭代互校解耦部件层级,并借助视频扩散模型合成运动假设结合网格刚体投影优化求解关节参数。

Audio-Visual Camera Pose Estimation with Passive Scene Sounds and In-the-Wild Video

本文提出首个利用被动场景音频辅助视觉进行相对相机位姿估计的方法,通过到达方向谱与双耳化嵌入组成的空间音频编码器(SAE)与SOTA视觉位姿估计模型Reloc3r进行晚期融合,在真实场景与仿真数据集上均取得显著提升。

AutoCompass: Accurate Visual Localization on Public Maps by Learning from Weak Labels

AutoCompass 针对公开2D地图神经匹配器过度依赖带噪绝对地理参考位姿真值的瓶颈,提出消除航向角标签依赖的隐式监督机制、容忍大范围位置误差的 GPS 局部块边际化损失,以及基于 SfM 相对位姿的高精度约束,仅用弱标签即可超越强监督 SOTA。

Beyond Isolated Objects: Relationship-aware Open Vocabulary Scene Understanding via 3D Scene Graph Analysis

针对现有 3D 开放词表语义分割将物体视作孤立实体而难以辨识外观相似物体的痛点,RelGraphOV 提出结合多视角 VLM 链式思维推理构建关系感知 3D 场景图,并通过自适应门控双流上下文 GAT 与层次对比学习解耦传播稠密几何与稀疏语义,显著提升了细粒度与长尾场景理解能力。

Broadband Wide Field of View Imaging with Computational Mirrors

针对折射透镜在宽光谱(400–1700nm)下色差严重及反射镜视场弯曲与离轴像差大的矛盾,提出计算反射镜成像系统:通过采集稀疏焦点堆叠(2–4张)并结合物理启发的仿射形变点扩散函数模型 SeidelConv 与即插即用去卷积,实现单传感器全视场无色差超宽光谱成像。

CAM3R: Camera-Agnostic Model for 3D Reconstruction

针对前向三维重建基础模型受限于针孔假设、在广角与非透视镜头下严重退化的问题,CAM3R 将两视角几何解耦为球谐光线方向场与径向距离/相对位姿,并提出光线感知全局对齐,实现了无需标定即可跨全景、鱼眼及针孔相机的高保真三维重建。

Capacity-Controlled Multi-View Stylization of 3D Gaussian Splatting

本文提出基于容量控制最优传输的3D高斯泼溅多视角风格化框架:用半平衡最优传输替代贪心最近邻匹配,通过列容量约束抑制many-to-one问题,同时引入跨视角匹配引导保证相邻视角的风格一致性,辅以几何正则化增强重建质量,在风格质量、内容保真和多视角一致性上全面超越现有方法。

CapFrame: Text-Instructed Viewpoint Grounding in 3D Gaussian Scenes via Geometric Pseudo Labels

针对传统3D场景语言引导仅关注目标定位而无法控制构图与视角的痛点,CapFrame提出文本指令视点定位任务,通过两阶段问答式检索初始化候选姿态,并将自然语言解析为几何伪标签指导可微3DGS相机姿态连续优化。

CasaMaestro: Multi-View Panoramas for House-Scale 3D Reconstruction

CasaMaestro 是首个面向房屋级场景的无外参多视全景前馈 3D 重建模型,仅需 20~50 张稀疏全景图,即可联合直接回归各视角绝对度量深度与全局对齐的相机位姿,实现全屋厘米级点云重建。

Category-Level 3D Correspondence in Camera Space via Morphable Object Priors

针对单视角类别级 3D 对应在相机空间中严重受制于遮挡、视角与尺度歧义的问题,本文提出首个大规模 3D 相机空间评测基准 HouseCorr3D,并提出 Morpheus 框架,通过解耦规范形状先验、实例仿射形变与 6D 位姿,在无显式对应标注监督下自发涌现高质量类别级 3D 对应。

CoIn: Comprehensive 2D-3D Inpainting with Gaussian Splatting Guidance

CoIn 提出了一种融合 2D 扩散生成与 3D 高斯泼溅(3DGS)的双向协同 3D 场景补全框架,通过参考自适应高斯(Ref-GS)构建几何粗结构、基于 GS 特征翘曲的一致性损失引导(CLG)约束 2D 扩散多视角一致去噪,再经局部纹理判别器(TE-D)对抗细化,实现了在任意形状掩码(包括包围盒)下对物体移除与插入任务的高质量多视角一致补全。

CoMind: Understanding Collaborative Human Activity from Multiple Minds and Views

提出了一个包含 81 小时双目第一人称与第三人称多视角视频、精确眼动追踪、密集 3D 场景与物体网格扫描的大规模多人协同数据集 CoMind,并系统构建了共同注意力估计、社交条件动作预测和协作式交接预测三大递进式心智理论基准任务。

Complex-Valued 2D Gaussian Representation for Computer-Generated Holography

提出基于复数2D高斯基元的紧凑全息图表示与定制化CUDA光栅化传播管线,借助Gabor最小空频不确定度将优化参数空间缩减至1/5,并在两类主流相位全息格式上保持高保真衍射重构。

Confidence-Based Mesh Extraction from 3D Gaussians

针对 3D 高斯泼溅在强视点相关与光照变化场景下易用几何伪造外观导致网格畸变的问题,提出纯自监督置信度加权、混合颜色与法向方差损失,以及解耦 D-SSIM 的外观建模,在无需大模型先验和多视图约束的高效前提下实现 SOTA 无界网格重建。

COSY: Compositional 3DGS Synthesis for Disentangled Human Head Editing

COSY 提出了一种无需显式几何先验或精确分割掩码的组合式 3D 高斯泼溅(3DGS)生成对抗网络,将人头解耦为头发、皮肤、眼镜和躯干四个独立子生成器,并通过共享几何与光照上下文向量保持全局一致性,实现了高保真、零干扰的实时 3D 人头属性编辑。

CSS-BA: Gate Guided Column Space Search for Bundle Adjustment

针对低视差与近纯旋转场景下舒尔补相机系统极度病态导致经典LM位姿与标定估计失真的难题,CSS-BA在完全保留原始BA目标函数、测量残差与全量参数的前提下,通过几何门控筛选高可靠相机子集并结合列空间搜索(CSS)构建紧凑的Lanczos/Ritz低维更新子空间,实现了无需外加先验的稳健位姿求解。

DANTE-W: Diffuse Albedo Neural Texturing in the Wild

针对非受控野外大规模场景多视角重建中阴影与光照烘焙的顽疾,Dante-w 将视角空间扩散反照率先验提升至 UV 空间神经纹理,并利用反照率与辐照度在频带分辨率上的显著差异实施物理神经渲染,实现了高保真、三维一致且无缝兼容传统图形管线的漫反射反照率恢复。

DAP: Doppler-aware Point Network for Heterogeneous mmWave Action Recognition

针对毫米波雷达人体动作识别中因硬件设备与频段差异导致的异构多源域偏移,本文构建了首个大规模多源基准 UniMM-HAR,并提出了双空间多普勒重参数化网络 DAP-Net,结合几何增密、特征重校准与文本语义锚定实现了卓越的跨源泛化性能。

Denoising-GS: Gaussian Splatting with Spatial-aware Denoising

将 3D 高斯泼溅的优化重新建模为空间感知高斯基元去噪过程,结合动量随机探索、均值与尺度协调的空间梯度去噪、Fisher 信息不确定性剪枝以及局部稀疏补偿,在显著压缩基元数量的同时实现了 SOTA 的新视点合成质量。

DETRAM: End-to-end DEtection, Tracking and Recovery of HumAn Meshes

DETRAM 提出了一种单阶段统一 Transformer 架构,通过在单一解码器中并行协同检测 Query、跨帧时序跟踪 Query 与用户提示 Query,实现了无需外部检测器与独立跟踪模块的视频多人 3D 人体网格联合检测、跟踪与恢复。

DF3DV-1K: A Large-Scale Dataset and Benchmark for Distractor-Free Novel View Synthesis

针对非受控随手拍场景中动态遮挡与瞬态物体导致的伪影难题,本文构建了首个包含 1,048 个室内外场景及对应干净真实视角的大规模去干扰评测基准 DF3DV-1K,系统评测了 10 种前沿辐射场方法,并基于该数据集训练了即插即用的 2D 扩散增强器 DI2FIX,使新视角渲染质量平均提升 0.96 dB PSNR。

Differentiable Polarized Path Tracing

针对偏振光传输中穆勒矩阵普遍降秩导致标准路径重放反向传播(PRB)矩阵求逆崩溃的问题,提出一种结合后缀辐射度紧凑缓存与混合检查点重算的无偏可微偏振路径追踪框架,以恒定显存与更高效率实现材质、粗糙度、法线及偏振光学器件的高保真逆向重建。

DiffGI: Differentiable Geometry Images for High-Fidelity Thin-Shell 3D Generation

DiffGI 提出将连续 2D 截断符号距离场(TSDF)引入几何图像并构建可微 Marching Squares 算法,结合几何感知法向渲染损失,在极紧凑的 \(32 \times 32 \times 4\) 潜在空间中实现了高保真、亚像素边界精度的薄壳与非流形 3D 表面端到端生成。

Diffusion-Based Material Regularization for Physics-Based Inverse Rendering

本文提出一种将扩散模型预测的 G-buffer(反照率、粗糙度、金属度、法向)作为相似性核来正则化物理解耦逆渲染的方法——不是把扩散预测当目标值去拟合,而是用它定义表面区域间的材质相似度,通过联合双边滤波约束同一材质区域的优化参数趋于一致,从而抑制"光照烘焙进材质"的伪影,在 Stanford-ORB 上显著超越 Neural-PBIR 和 MaterialFusion 等 SOTA 方法。

DiGS-Avatar: Single-Image Animatable 3D Human Reconstruction via UV-Space Diffusion

DiGS-Avatar 将单视角可驱动 3D 人体重建重新表述为规范 UV 隐空间的扩散补全任务,借助多视角教师网络蒸馏几何一致的隐空间骨架,并通过跨注意力语义聚合模块注入高层外观特征,仅耗时 0.71 秒即可从单张图像生成高保真且天然支持骨骼驱动的 3D Gaussian 人体模型。

Director: Instance-aware Gaussian Splatting for Dynamic Scene Modeling and Understanding

Director 将 4D 动态高斯泼溅重建与实例/语言语义建模进行基元级紧密耦合,利用跨视点时空一致的 SAM3 掩码与多模态大模型时序文本嵌入监督高斯基元学习 8 维语义属性,结合光流引导显式形变与 ARAP 局部刚性微调,实现了高保真动态渲染与开放词汇 4D 实例分割。

Discovering Geometric Biases in 3D Face Reconstruction: A Curvature-Aware Spectral Framework for Fairness Evaluation

针对传统欧氏距离指标对局部高频形态失真不敏感而掩盖算法偏见的问题,本文提出了基于局部二次拟合 Laplace-Beltrami 算子的曲率重建误差(CRE)与谱空间误差聚类框架,首次系统揭示并量化了 3D 变形模型及其重建算法中显著的年龄与族裔几何偏差。

Do Flat Minima Improve Sparse Novel View Synthesis?

本文首次深入探究了稀疏新视角合成中损失锐度与泛化性的关系,揭示出全局追求平坦极小值会抹杀高频细节的本质矛盾,提出了依据局部图像结构自适应调节扰动半径与正则权重的结构感知锐度正则化(FASR),在显著抑制漂浮物的同时完整保留边缘高频纹理。

DR-GS: Physically-Based Deformable and Relightable 2D Gaussians

DR-GS 构建了一个将基于物理的逆向渲染、动态重光照与形变驱动控制深度统一的 2D 高斯框架,通过显式解耦几何、材质与环境光照,并结合低样本多重重要性采样与网格光线追踪加速,彻底消除了形变高斯渲染中光照烘焙与高光失真问题。

DreamEdit3D: Personalization of Multi-View Diffusion Models for 3D Editing

DreamEdit3D 提出面向多视角扩散模型的可解耦个性化表征学习方法,通过注意力对齐的文本倒置与联合多视角全 UNet 微调两阶段优化,在保留源 3D 物体核心身份的同时实现精准的局部对象级组合编辑与高保真网格重建。

DualDiff3D: Dual Structure-Appearance Diffusion Priors for Reliability-Enhanced 3D Gaussian Splatting

针对稀疏视角 3D 高斯泼溅(3DGS)渲染新视角时结构视角差与参考视角外观冲突导致的模糊问题,本文提出解耦结构与外观的双分支扩散先验模型 DualDiff,并设计结合渐进式采样过滤与置信度加权的 RRO 闭环框架 DualDiff3D,显著提升稀疏视角 3D 重建质量与几何可靠性。

Dynamic-Robust Photometric–Semantic Reconstruction for Open-Vocabulary 3D Scene Understanding

针对非受限动态环境中运动前景导致的特征几何冲突,SPAR 提出跨视点动态区域预测器与单阶段联合编解码框架,无需运动标注即可在单次前向传播中解耦瞬态干扰并自监督重构多视点一致的静态光度与连续语义场。

Efficient and High-Quality Depth Estimation via Pixel-Space Diffusion with Linear Attention

针对高分辨率生成式单目深度估计中二次复杂度与多步去噪带来的巨大计算瓶颈,Lapis 提出了首个基于线性注意力与单步像素空间扩散的几何生成框架,通过由粗到精的补丁级一致性与像素级精炼模块消除了线性化的保真度退化,实现了兼顾极致推理效率与细粒度几何边界的高质量深度估计。

Ego-Human Motion Prediction with 3D-Aware LLM

Ego3DLM 将第一人称动作预测建模为显式 3D 场景感知的大语言模型推理过程,以单阶段自回归方式联合解码过去与未来的 3D 姿态及自然语言叙述,并借助跨模态对齐奖励的 GRPO 强化学习大幅提升运动物理可行性与语义保真度。

EgoGVAE: Ego-body Mesh Reconstruction via Guided Variational Autoencoder

针对第一人称仅凭头部轨迹重建全身人体网格时扩散模型采样缓慢的问题,EgoGVAE 提出用以全身姿态为输入的变分自编码器潜空间先验来引导头部到动作网络,实现高保真度全身网格的单步快速重建(推理速度提升 50 倍以上)。

Error-Driven Scene Editing for 3D Grounding in Large Language Models

针对 3D-LLM 严重依赖语言先验与数据集共现捷径导致的视觉定位偏差,提出 DEER-3D 闭环框架,通过对定位失败样例进行确定性谓词归因、谓词对齐的极简三维场景反事实编辑与阶梯式问答构建,实现端到端误差驱动的迭代修正与无偏几何对齐。

Extending a Large View Synthesis Model for Multi-view Panoptic Segmentation

本文提出一种解耦的多视角全景分割范式,首次证明仅经 RGB 光度重建训练的冻结大视角合成模型(LVSM)具备通用空间对应能力,无需显式 3D 重建或分割微调,即可通过 3 位二进制通道编码将源视角全景标签高质量传播至新视角,在 ScanNet 上达到 33.56 dB PSNR 与 0.5949 mIoU。

Fast and Compact 3D Gaussian Splatting with Polarized Opacity Prior

针对传统 3DGS 因“先致密化后剪枝”引发的严重模型膨胀与梯度泄漏问题,本文提出极化不透明度先验(POP)与 L2 误差比例梯度的协同优化框架,使重要高斯趋向完全不透明、冗余高斯自然消亡,在减少近 90% 高斯数量的同时大幅缩短训练耗时并保持高保真渲染质量。

FeDepth: Federated Learning for Depth Estimation under Robot Heterogeneity

针对多机器人系统中由于平台形态、观测环境及深度量程差异引发的非独立同分布(Non-IID)问题,FeDepth 提出基于特征分布高斯描述子与对称杰弗里斯散度的软聚类联邦学习框架,通过允许多重隶属与冗余合并,实现了异构机器人单目深度估计的稳健协同训练与跨域泛化。

FillGS: Filling Observation Gaps in 4D Gaussian Splatting via Viewpoint-Time Selection and Generative Refinement

针对稀疏多视角视频下 4D 高斯泼溅因时空观测空缺导致的动态模糊与伪影,FillGS 通过渲染敏感度与运动感知观测稀疏度主动筛选极具信息量的虚拟时空视角,利用视频扩散模型增强渲染图像,并结合几何匹配与运动共视掩码进行鲁棒微调,显著提升了动态场景插值与外推的几何与纹理保真度。

FixAnything: 3D-Consistent Rendering Refinement via Video Generative Priors

FixAnything 提出了一种统一通用先验的渲染修复范式,将 3DGS、NeRF、网格及稀疏点云在稀疏视角下的渲染退化统一表述为隐空间条件视频去噪,结合掩码锚点控制与基于位姿恢复精度的 Flow-DPO 偏好对齐,仅用轻量 LoRA 即可将异构退化渲染修复为兼具高质感与 3D 多视角一致性的逼真视频。

FlexiAvatar: Unified 3D Gaussian Human Avatars Under Arbitrary Body Visibility

针对现有单目人体数字人重建方法普遍假设全身可见而在局部视野下产生严重几何畸变与纹理漂移的问题,FlexiAvatar 提出首个面向任意身体可见度的统一 3D 高斯重建框架,通过光栅化可见性感知修剪抑制不可见区域的虚假梯度传播,结合遮挡鲁棒的 SMPL-X 跟踪、局部特异性残差细化与扩散旋转纹理补全,在全身、半身及纯头部场景下均显著超越现有专用与通用基线。

FoundDP: Revisiting Weak Disparity Observability in Dual-Pixel Depth Estimation

针对双像素(DP)微基线在弱纹理与降采样区域视差不可观测导致的结构崩塌,FoundDP 首次将物理接地的 DP 度量深度与单目深度大模型(DAV2)的全局结构先验深度融合,并通过散焦特征对齐与自适应门控引导,实现了高保真、度量尺度一致的稠密深度估计。

G2P: Gaussian-to-Point Attribute Alignment for Boundary-Aware 3D Segmentation

本文提出 G2P,通过马氏距离建立高斯-点云之间的精确对应关系,将 3D Gaussian Splatting 中的不透明度和尺度属性迁移到点云上,在保留原始点几何结构的同时引入外观线索,从而有效缓解几何形状相似但外观不同的物体的分割混淆问题。

GARDEN: Gravity-Aligned Reconstruction of Disentangled ENvironments from RGB images

GARDEN 提出一种纯 RGB 输入的物理场景解耦框架,以重力先验构建统一的 Gravity-View 坐标系消除全局旋转歧义,通过非模态 3D 网格生成与 6-DoF 位姿精炼重建前景刚体,并借助条件 3D 点云分类剔除背景重复几何,形成兼具物理可交互性与高视觉保真度的结构化混合场景表示。

Generating Multi-view Adversarial Examples for Visual Geometry Grounded Transformer

针对视觉几何大模型 VGGT 在多视角 3D 重建中的安全脆弱性,本文提出首个无需测试时迭代优化的前向多视角对抗扰动生成器 MVAP-G,通过跨视角对抗对齐与 DPT 多尺度解码,实现毫秒级生成多视角一致且肉眼不可见的对抗样本,使重建点云向原点塌陷并导致几何位姿全面崩塌。

Generative Relightable Avatars

提出混合式生成可重光照化身系统 GRA,将显式物理微表面渲染、UV 空间 RelightNet 姿态纹理细化与基于流匹配的时空视频扩散精炼有机解耦,在保障 3D 视角可控性的同时实现高保真物理光照与高频衣褶动态生成。

GenHOI: Generalized Hand-Object Pose Estimation with Occlusion Awareness

GenHOI 针对单目 RGB 手-物交互位姿估计中因遮挡与物体外形变化导致的泛化瓶颈,提出结合 InstructBLIP 分层语义文本提示、图像-点云-文本三模态掩码自编码重构以及手部隐式 SDF 与结构几何先验引导,在 DexYCB S3 未知物体测试上实现了 89.34% 的 ADD-0.5D 准确率。

GenSP: Consistent Spherical Parameterization via Learning Shape Generative Models

GenSP 提出用数据驱动的方法学习一个神经生成模型,将单位球面连续变形到任意 genus-0 形状,从而通过逆映射获得跨形状一致且低几何畸变的球面参数化,在 ShapeNet 上比现有方法提升 14× 以上等距畸变、3.6× 以上一致性。

Geo-ID: Test-Time Geometric Consensus for Cross-View Consistent Intrinsics

Geo-ID 提出一个无需训练的测试时框架,通过稀疏3D几何对应关系将独立运行的预训练单视图本征扩散模型的预测耦合起来,形成置信度加权的体素级鲁棒共识再反向注入后续扩散采样过程,以仅操作潜在变量的梯度更新方式引导各视图预测趋于一致,在不降低单视图分解质量的前提下实现 albedo / roughness / metallicity 的跨视角一致性提升,并可直接用于下游的可编辑神经场景表示。

Geometric Foundation Model Distillation for Efficient Lunar 3D Reconstruction

针对星载受限算力环境下的月表无标定双目 3D 重建任务,本文提出一套针对 3D 几何大模型(MASt3R)的紧凑知识蒸馏方案,通过截断 SVD 解码器权重初始化与容差边界特征对齐,在将模型压缩 4.4× 至 7.3× 并获得超 2× 推理加速的同时,仅牺牲约 15% 的倒角误差,甚至超越了稀疏真值直接监督的基线。

Geometrically Consistent Multi-View Scene Generation from Freehand Sketches

针对手绘草图几何信息匮乏且存在形变扭曲的难题,本文提出首个单阶段草图到多视角场景生成框架,通过平行相机注意力适配器注入相对几何投影并引入稀疏 SfM 对应关系监督,无需参考照片或逐场景优化即可一步生成 360° 几何一致的多视角场景图像。

Geometry-Aware Style Transfer in 3D Gaussian Splatting

本文提出一种几何感知的 3DGS 风格迁移框架,通过解耦优化交替更新颜色和几何参数,并引入多模态(RGB + 深度 + 边缘)对比特征匹配损失 GCFM 来引导风格结构和几何纹理的迁移,在风格保真度和多视图一致性上显著优于现有 3DGS 风格迁移方法。

Global Pose Control for Generative View Synthesis in Normalized Object Coordinate Space

将新视角合成重新构建为基于指令的图像编辑任务,在规范化对象坐标空间(NOCS)中利用紧凑普吕克射线图与区域注意力注入全局绝对相机位姿,结合文本定义规范前向与前向视图锚定,实现高质量、免输入相机位姿估计的精准全局可控视角生成。

Graph-GSReg: Leveraging 3D Scene Graphs for Gaussian Splatting Registration

将 3D 高斯泼溅场景升维构建为融合几何与语义属性的 3D 场景图,利用 TRIMs 距离一致性约束与最大团搜索求解刚体配准,并通过自监督测试时优化消除拼接伪影与空洞,实现免预训练的高质量大场景无缝融合。

Gravity-aware partially calibrated absolute pose estimation from affine- or rotation-covariant features

针对未知焦距相机的绝对位姿估计(PnPf),本文结合 IMU 重力先验与局部特征的几何属性(仿射或旋转协变),推导全新多项式几何约束并构建出单仿射对应求解器 UP1PfAC 与双旋转协变特征求解器 UP2PfORI,将最小样本需求骤降至 1 或 2 个特征,在保持解析求解高效性的同时大幅提升 RANSAC 鲁棒定位速度与焦距恢复精度。

GridFlow: Structured Latent Flow for Seamless City-Scale 3D Point Cloud Generation

GridFlow 提出了基于网格对齐 VAE 的结构化隐式流匹配生成框架,通过空间局部对应的二维隐式网格与紧凑隐空间边缘一致性约束,从卫星图像及辅助遥感模态中生成具有无缝接缝、包含 10 万个彩色点的城市级超大规模 3D 点云。

GrowFields: Compositional 4D Neural Fields for Topology-Changing Plant Growth

GrowFields 将植物点云时序解构为解耦的局部规范化器官坐标系,结合经器官隐码条件化的共享连续 4D SIREN 速度场与欧拉积分,首次在稀疏时序下实现了应对拓扑变化与非刚性生长的器官级高精度 4D 动态重建与叶尖跟踪。

HAT-4D: Lifting Monocular Video for 4D Multi-Object Interactions via Human-Agent Collaboration

HAT-4D 提出首个面向单目视频 4D 多物体交互重建的 agentic 框架:以交互知识图谱(IKG)为因果引擎驱动 3D 生成、空间组合和记忆增强 4D 传播,并通过多层级人在回路(HITL)协同解决深度歧义和遮挡难题,在 MVOIK-4D 基准上全面超越现有单目 4D 基线,且少量人工反馈即可显著提升交互重建质量。

Head Avatars with Dynamic Explicit Hair

DynHair 提出了一种结合显式发丝几何与 3D 高斯泼溅的动态头部数字人模型,通过以头部角速度、角加速度和相对重力为条件的 LSTM-FiLM 时序网络预测发丝非刚性形变,并引入弹性保持等物理约束,实现了逼真且时序连贯的发丝级动力学渲染。

Hierarchical 3D Scene Graph Construction and Belief-based Planning for Semantic Navigation

本文提出一种零样本语义导航框架,通过在线增量构建物体-区域-区分层 3D 场景图(HSG)作为结构化全局记忆,并在其上融合 LLM 语义先验与探索证据维持分层信念状态,用 POUCT 在 HSG 模拟器内做有限步前向展开以显式评估宏动作的长程期望回报,长程导航 SR/SPL 分别提升 9.4%/5.0%。

High-Resolution Artwork Outpainting with Global Blueprint Guidance and Layout Control

提出两阶段艺术画作高分辨率外延框架 BlueOut,先生成低分辨率全局蓝图并显式注入边界框布局条件,再基于前向扩散低频保留性质初始化多块噪声并注入全局引导特征,实现高质量、强布局可控且可跨 GPU 并行的高分辨率画面拓展。

HitMem: Hierarchical Temporal 3D Memory with Multi-Modal Context-Aware Retrieval for Dynamic Environments

HitMem 针对动态环境中物体常因人类等外部智能体扰动而发生位移的问题,构建了结合载体-承载物拓扑与时序衰减机制的分层 3D 记忆,并在目标丢失时结合外部智能体历史轨迹与语义类别亲和度实施两阶段上下文感知检索,大幅降低了无效探索代价并提升了长程任务成功率。

HybridSim: A Physics–Learning Hybrid Digital Twin for mmWave Human Sensing

针对毫米波人体感知仿真中高阶多径射线追踪计算爆炸与神经隐式场纠缠运动微多普勒的瓶颈,HybridSim 将电磁波传播解耦为基于微表面逆向渲染的直射径与基于代理虚拟接收器 3D 高斯泼溅的间接多径,实现了高保真、低开销的动态人体中频毫米波信号合成。

Hyper-Network Neural Functional Maps for Unsupervised Robust 3D Shape Matching

针对非刚性 3D 形状匹配中拓扑噪声与局部缺失导致截断谱基无法被线性变换对齐的核心瓶颈,本文提出首个无监督非线性神经泛函映射(NFM)框架,利用 ViT 超网络基于粗糙线性泛函映射动态预测残差 MLP 权重,并设计无监督谱对齐损失进行端到端优化,在多项严苛基准上刷新 SOTA。

InceptionGS: Generative Bootstrapping for Large-Scale Gaussian Splatting under Unstructured View Sampling

针对真实大规模场景采集存在的视角非结构化与局部观测稀缺问题,InceptionGS 将 PGSR 的 G-buffer 几何特征引入条件扩散模型构建场景自适应生成先验,并通过可靠光度融合与朗之万动力学重要性采样软性自举优化 3DGS 场,在无额外真实采集的前提下显著消除大视角伪影并降低 32% 的 FID。

Inclusive Interactive Collisions for Multi-View Consistent Compositional 3D Generation

本文提出针对组合式多物体3D生成的优化框架 I2C-3D,通过包容性交互碰撞约束引导高斯基元自然汇聚于物体间接触区,并结合实例与空间词元交叉注意力调控的多视角自适应分数蒸馏采样,显著化解了物体交互失真与多视角幻觉难题。

Incremental Online Scene Reconstruction by 3D Gaussian Triangulation

提出一种基于稠密几何高斯三角化的增量在线三维场景重建框架,通过将高斯图元约束为高不透明度平面椭圆表面微元(Surfels)并实施平面拉拽约束与直接局部三角化,结合历史稳定区域动态冻结机制,实现了高效、高精度的在线网格重建与逼真新视角合成。

InFlux++: Real and Synthetic Data for Estimating Dynamic Camera Intrinsics

构建包含 1,841 个过程化生成合成视频(44.1 万帧,带薄透镜呼吸效应与真实光学畸变)与 334 个高分辨率真实视频(51.4 万帧,覆盖日常复杂平移运动与大视场反向标定)的动态相机内参综合套件 InFlux++,通过合成数据微调使 SOTA 动态内参估计模型的焦距预测召回率显著提升。

InSpace: Structure-Aware 3D Indoor Scene Generation from a Single 360° Image

针对单张普通视角图像视野受限且缺乏全局室内布局锚点的问题,InSpace 提出基于单张 360° 全景图(ERP)的三阶段流匹配生成框架,通过几何先验初始化、视角选择性交叉注意力与结合 3D OBB 的全局-局部混合注意力,实现了包含地板墙体建筑布局与独立解耦纹理资产的高保真 3D 室内场景生成。

Instant Expressive Gaussian Head Avatars at Over 100 FPS

论文针对人像动画在推理速度、3D多视角一致性与面部表情表现力之间的“三难困境”,提出了一种解耦运动基向量的特征空间前馈高斯形变机制,辅以扩散先验蒸馏策略,在保持严格3D一致性与细腻微表情的同时实现了107.31 FPS的高速动画渲染。

InterPet4D: A Multimodal 4D Human-Pet Interaction Dataset for Pet Motion Generation

提出了首个大规模多模态4D人宠自然交互数据集InterPet4D(涵盖23名参与者与11个品种13只狗的683万帧同步视频与3D运动),并构建了结合骨骼一致性离散Token化与模态感知自回归生成的InterPetMoGen基准模型。

JanusMesh: Fast and Zero-Shot 3D Visual Illusion Generation via Cross-Space Denoising

JanusMesh 提出一个零样本两阶段框架,利用 TRELLIS 结构化 3D 隐空间的双分支去噪与 SDF 融合生成多语义几何体,再通过视角约束的纹理合成赋予各视角对应的外观,在 3–5 分钟内即可生成高质量 3D 视觉幻觉网格。

KISS-GS: 3D Gaussian Splatting Compression Kept Simple

提出解耦重建、紧凑化、编码与微调的模块化 3DGS 压缩框架 KISS-GS,在解码端仅依赖通用浏览器原生图像解码的前提下,通过两阶段误差剪枝与有效秩约束紧凑化(POPSpa)、协方差 48 重对称性平滑(PRAS)与自组织 2D 颜色码本(SOG-XT),在保持原画质下实现 85× 至 319× 的极端文件体积缩减。

Large-Scale High-Quality 3D Gaussian Head Reconstruction from Multi-View Captures

HeadsUp 提出一种可扩展的前馈式方法,将多相机捕捉的多视图图像通过跨注意力 Transformer 压缩为紧凑 2D 潜变量,再解码到锚定于中性头部模板的 UV 参数化 3D 高斯上,从而将输出高斯数量与输入图像分辨率和视角数解耦,在 10,000+ 人的内部数据集上达到 SOTA 重建质量,且无需测试时优化。

Last-Layer-Centric Feature Recombination: Unleashing 3D Geometric Knowledge in DINOv3 for Monocular Depth Estimation

本文针对现有单目深度估计方法均匀采样 ViT 中间层构建特征金字塔而忽略几何分布异质性的缺陷,系统揭示了 DINOv3 中深层表征蕴含更强三维几何预测力的规律,进而提出以最后一层为几何锚点、自适应融合语义互补中间层的特征重组模块(LFR),在零样本泛化与全监督基准上刷新 SOTA。

Learning Global Camera Poses from Noisy View-Graphs for Structure from Motion

提出 VGPA (View-Graph Pose Averaging) 框架,利用置换等变边条件图神经网络直接从含噪视点图聚合两两相对位姿以回归全局相机外参,结合无监督相对位姿一致性目标与解耦的三角化光束法平差,在千张级大场景下以极高吞吐率实现与顶尖经典 SfM 媲美、大幅超越先前深度模型的位姿精度与相机召回率。

Learning Implicit Constitutive Laws for Dynamic 3D Gaussian Splatting from Monocular Videos

针对单目视频反演物体动力学中严重的几何与材料欠定问题,本文提出 GCA 框架,结合 LoRA 微调、基于秩次一致性的深度几何锚点与本构先验软正则化,实现了高质量隐式本构关系的稳健学习。

Learning Manifolds in High-D Point Embedding for Anisotropic Surface Approximation from Unstructured Point Clouds

针对无序点云无法直接计算各向异性度量的难题,提出 HD-PEA 框架,通过重心不变性投影构建监督数据与 Point Transformer 学习 8 维局部等距嵌入,并在切子空间中驱动粒子系统与高维受限 Voronoi 胞元(RVC)裁剪,直接从原始点云重构出高保真、低单元数的各向异性表面网格。

Learning Spectral and Polarimetric Clues for One-to-Multimodal Novel View Synthesis

针对非传统传感器数据采集成本高昂的难题,本文提出 SPoILeR 隐式辐射场架构,通过跨场景多模态预训练学习多源波段互相关先验,仅需目标场景单视角/多视角普通 RGB 图像微调,即可合成多视角严格一致的多光谱、近红外与偏振新视角图像。

Learning Video Dynamics with Predictive Differentiable Rendering

提出 Predictive Differentiable Rendering(PDR)框架,通过在现有像素空间预测器后附加轻量 PredGS 适配器将粗预测映射为 2D 高斯参数,经 CUDA 加速的可微渲染器生成连续空间预测再与像素预测融合,以极小计算开销显著缓解确定性视频预测的过度平滑问题。

LEGO: Leveled Language Gaussian Splatting

针对现有 3D 语言高斯泼溅受制于 2D 视角依赖或单一尺度超参的缺陷,LEGO 通过自适应多视角峰值检测将多粒度 SAM 掩码重评定为 3D 一致的结构层级,结合解耦特征对比蒸馏与层级语言场景图,实现了多层级开放词表分割与复杂空间链式推理。

LiteMatch: Lightweight Zero-Shot Stereo Matching via Cost Volume Stabilization

针对传统双目立体匹配严重依赖重型 3D 卷积正则化或大规模单目深度先验导致计算膨胀且跨域易崩的问题,LiteMatch 通过傅里叶高频与跨视角双编码器融合、体素级二值交叉熵代价体一致性损失(CVC-Loss)从源头抑制多模态模糊,以 3.36M–9.58M 的极致轻量参数在零样本泛化与实时推理上大幅超越现有 SOTA。

LivingWorld: Interactive 4D World Generation with Environmental Dynamics

针对交互式场景外扩生成中自然流体与宏观环境动态缺失的难题,LivingWorld 提出了由几何感知对齐与连续哈希运动场构成的全局欧拉动力学表征,以仅 12 秒单步交互时延实现了大尺度 4D 环境的高一致性生成与无缝循环渲染。

LSRM: High-Fidelity Object-Centric Reconstruction via Scaled Context Windows

针对前馈式3D重建在精细纹理与外观保真度上难以匹敌密集视图优化的痛点,LSRM通过原生稀疏注意力将物体与图像Token上下文窗口扩展20倍和2倍以上,并结合3D空间感知路由与块感知序列并行,实现了高保真物体网格重建与逆渲染。

LUNA: Learning Universal 3D Human Animation Beyond Skinning

LUNA 提出首个完全抛弃线性混合蒙皮 (LBS) 的端到端 3D 人体动画框架,通过解耦的 Transformer 动画器将 2D 驱动信号(RGB 图像、关键点、手绘草图甚至未知角色图像)直接映射为 3D 高斯变形;在训练中利用 LBS 蒸馏提供结构性先验防止几何坍缩,推理时彻底摆脱 LBS 约束,实现了零样本跨身份、跨模态的 3D 人体动画。

Map-Det3D: Metric Feed-Forward 3D Reconstruction Prior for Multi-view 3D Object Detection from Streaming Inputs

Map-Det3D 将前馈度量 3D 重建模型(MapAnything)重构为检测 Transformer 的几何编码器,在流式时序滑动窗口内直接在重建 3D 空间预测尺度解耦的 3D 边界框并由解耦尺度因子恢复米制真值,彻底摆脱 2D-to-3D 投影抬升带来的误差放大,在 CA-1M 及跨数据集零样本评估中均刷新纯视觉在线 3D 检测 SOTA。

MeGAS: Thermomechanical Dynamic Gaussian Splatting for Thermophysical Scene Editing

MeGAS 将热力学相变动力学(热传导、对流、熔化/凝固)集成进 3D Gaussian Splatting 框架,使真实场景的重建结果能够受控地发生基于物理的热力学形变,并在极端大变形下通过拓扑自适应渲染策略保持光栅化质量。

Memory Tree Guided Key Frame Querying for Efficient 3D Question Answering

针对长视频 3D 具身问答中直接输入多帧显存激增与逐次视觉搜索极慢的瓶颈,提出基于 6-DoF 相机位姿与目标跟踪在线构建的层次化记忆树 MemTree3D,利用 LLM 纯文本空间与时序推理指导加权关键帧检索,仅用 3 帧即在 OpenEQA 上超越均匀采样 17.4% 并带来 69.2% 的检索加速。

MemPose: Category-level Object Pose Estimation with Memory

MemPose 针对类别级物体位姿估计中静态先验与固定网络参数难以适应实例多样性的瓶颈,提出了显式整合非参数化几何记忆库的增强框架,通过相似度引导的动态更新机制与自适应门控检索融合,在零额外可学习先验权重的开销下显著提升了 9-DoF 位姿预测精度。

MessyKitchens: Contact-rich object-level 3D scene reconstruction

针对复杂杂乱场景中物体级单目 3D 重建缺乏物理真实感与跨物体穿透严重的痛点,本文提出了具备毫米级配准精度与接触保真度的 MessyKitchens 基准数据集,并构建了基于 SAM 3D 的多物体联合姿态微调解码器(MOD),显著提升了接触图预测与场景级几何重建质量。

MetaView: Monocular Novel View Synthesis with Scale-Aware Implicit Geometry Priors

MetaView 构建了一种无显式三维重建的单目大视角新视角合成框架,通过将前馈深度模型的中间特征作为隐式几何先验经由并行注意力注入冻结的 MM-DiT,并利用尺度感知 RoPE 嵌入度量深度与相机位姿,彻底解决了隐式生成模型的尺度漂移与显式重建退化难题。

Mitigating Positional Leakage in 3D Masked Autoencoders for Robust Representation Learning

针对 3D 掩码自编码器在坐标重建时过度依赖掩码区域位置编码造成“位置信息泄漏”与语义特征欠优化的痛点,本文提出 MPL-MAE,通过序同构重校准位置嵌入抑制连续度量坐标并保留几何拓扑,结合 Gumbel-Softmax 门控位置接口与度量泄漏正则化,实现了平衡、稳健的 3D 自监督表示学习。

MMDiff: Extending Diffusion Transformers for Multi-Modal Generation

针对扩散 Transformer 在生成过程中丢弃丰富感知表征的问题,MMDiff 在完全冻结 DiT 主干的前提下,通过跨去噪轨迹的多时间步自适应特征聚合、单向概念注意力提取以及与判别表征的互补融合,仅需轻量级解码器即可在生成图像的同时高精度预测语义分割、显著性与深度图。

MoCA3D: Monocular 3D Bounding Box Prediction in the Image Plane

MoCA3D 摆脱传统单目 3D 提升对相机内参的依赖,将 3D 包围盒恢复重构为图像平面上的密集预测任务,通过结合自适应峰值加权与置信度加权的 Transformer 架构,以少至 19.0M 的参数量实现投影角点与深度的高精度对齐。

Monocular Models are Strong Learners for Multi-View Human Mesh Recovery

本文提出一种完全免多视角训练(training-free)的多视角人体网格恢复框架 MonoMV,通过将预训练单视角 HMR 模型的特征与预测聚合为虚拟视角(Virtual View),并利用解剖地标重投影、跨视角一致性与单视角先验正则化进行轻量化测试时自适应(TTA),在无需多视角训练数据和无相机标定条件下均达到 SOTA 性能。

MSVS-VAE: Multi-Scale Anchored VecSet for High-Fidelity 3D Reconstruction

针对传统集合式 3D 表示在精细几何重建中面临的过度平滑与空间分辨率受限瓶颈,MSVS-VAE 引入分层点混洗上采样渐进增加锚定潜变量密度,并用轻量局部算子 AVS-Conv 替代全局交叉注意力,在维持紧凑表征的同时实现了媲美高分辨率稀疏体素的高保真重建与约 10 倍的解码加速。

Multi-THuMBS: Multi-person Tracking of 3D Human Meshes Beyond Video Shots

针对真实多镜头视频中视角突变导致的身份丢失与人体网格漂移难题,Multi-THuMBS 利用几何基础模型在镜头切换边界构建共享 3D 场景锚点,结合三维距离、表观与姿态重识别及全局时空平滑,实现了跨镜头多人动作与身份的一致性重建。

Multi4D: High-Fidelity Dynamic Gaussian Splatting via Multi-Level Competitive Allocation

Multi4D 把动态场景显式拆成「静态结构 + 持久动态几何 + 瞬态外观」三套高斯子集,让它们在共享光栅化下竞争性地去解释光度残差,从而同时保住长时运动一致性和高频外观细节,用比 4DGS 少 25× 的动态高斯就拿到 SOTA 渲染质量、实时帧率,还能顺带做到 10× 提速的 4D 分割。

MV-GEL: Language-Driven Multi-View Geometric Entity Localization on Meshes

针对传统3D点云分割缺乏拓扑边界约束且视点遮挡严重的问题,MV-GEL提出结合提示引导的视点几何排序模块(GELviews)与CAD自适应推理分割(LISA-CAD),仅依赖无结构三角网格即可高精度定位自然语言描述的CAD面与边实体。

MVFusion-GS: Motion-Variance Guided Temporal Attention for High-Quality Dynamic Gaussian Splatting

针对动态 3D 高斯泼溅中变形网络缺乏显式运动感知导致动静态解耦不彻底的瓶颈,提出结合全局运动方差引导先验与局部时序 Cross-Attention 的即插即用精炼模块,兼获干净静态背景与高保真动态前景。

NeuroRefiner: Morphology-Aware Multi-Agent Refinement for 3D Fluorescence Microscopy Neuron Segmentation

针对三维荧光显微成像中神经元信号稀疏、拓扑易断裂且端到端单次推理不可逆的难题,NeuroRefiner 构建了首个拓扑感知多智能体协同优化系统,联合全局拓扑巡检、指令生成与质量校验智能体,闭环驱动三维跨模态编辑网络 TopoRefineNet 迭代修正体素级断裂与噪点。

NoPA: Non-Parametric Online 3D Scene Graph Generation

针对基于单高斯假设的在线3D场景图生成容易在扁平或多部件物体上发生欠合并与几何细节丢失的问题,NoPA提出基于固定粒子集核密度估计的非参数化物体表征,结合“Hellinger粗筛 + MMD细判”的两阶段在线融合策略与亲和度关系传播机制,在保持实时推理效率的同时大幅提升了场景图构建精度。

Objects as Audio-Visual Modal Sound Fields

提出视听模态声音场(AV-MSF),将 3D 高斯泼溅视觉几何先验与紧凑的物理模态振动参数相结合,仅需多视角图像和少量撞击录音即可高保真重建空间连续的物体级撞击声场,并支持撞击定位与文本驱动的声音编辑。

OmniDS: Dual-Stream Context Fusion for Omnidirectional Depth from Fisheye Cameras

针对多鱼眼相机宽基线全向深度估计中的遮挡冲突与刚性投影模糊,OmniDS 提出结合轻量 CNN 与冻结 DINOv3 的动态 ERP 上下文融合,以及融合分组相关与跨视角方差的全局共识体,并通过轻量学生网络蒸馏实现端侧约 10 FPS 实时高精度建图。

OmniPoint: Universal Monocular Metric Pointcloud from Any Camera

OmniPoint 提出了首个统一任意相机模型(针孔、鱼眼、360° 全景)的单目度量点云重建框架,通过射线方向与径向距离解耦表征、解耦点云学习目标、双向 3D 数据增强以及平滑几何先验注入机制,实现了对全景/大视场与常规透视图像的 SOTA 零样本度量几何重建。

One Scene, Two Depths: Probing Geometric Ambiguity in Monocular Foundation Models

针对单目深度基础模型将多层几何强行坍缩为单层标量的固有二义性缺陷,本文构建了稀疏二层序数基准 MD-3k 并提出免微调的拉普拉斯视觉提示(LVP),在冻结权重下成功激发基础模型生成互补的深浅几何假设。

OneWorld: Taming Scene Generation with 3D Unified Representation Autoencoder

OneWorld 摒弃传统的 2D/视频潜在空间生成范式,构建融合外观与语义的 3D 统一表征自编码器并在其几何感知空间中直接扩散生成 3D 高斯泼溅场景,配合跨视角对应约束与流形漂移强化解决多视角一致性与曝光偏差难题。

Online Segment 3D Gaussians via Launching Virtual Drones

SAGO 将交互式 3D 高斯泼溅分割重构为虚拟无人机引导的在线次优视点(NBV)马尔可夫规划过程,彻底摒弃耗时的逐场景预处理阶段,实现亚秒级(0.4~0.9 秒)高质量 3D 资产提取。

OP3DSG: Open-Vocabulary Part-Aware 3D Scene Graph Generation for Real-World Environments

OP3DSG 提出统一 3D 场景图生成框架,通过知识引导的部件检测、部件感知多视图融合和几何初始化先验图+验证门控 LLM 推理,联合建模物体、交互部件、空间关系、功能关系和 affordance,在自建 UniGraph3D 基准上部件节点召回以绝对优势领先此前方法 31+ 点,并可直接作为机器人问答、导航和任务规划的感知后端。

Open-Vocabulary 3D Object Detection with Co-Distillation Discovery and Dual Guidance Robust Training

针对开放词表3D目标检测中新物体发现阶段定位不准与分类错配、训练阶段对伪标签无差别监督的痛点,本文提出 Co-3DGT 框架,通过 2D-3D 空间语义双向协同蒸馏筛选高可靠候选,并在训练时引入场景感知不确定性正则化与大语言模型分层语义对齐,显著提升未见类别的 3D 检测精度。

OpenGround: Planning-based Online Perception for Open-World 3D Visual Grounding

针对现有零样本 3D 视觉定位受限于离线预定义对象查找表(OLT)而无法定位表外未见目标的问题,OpenGround 提出任务链规划将复杂长文本查询解构为渐进式子目标序列,并利用已定位锚点实现上下文引导的在线 2D 感知与 3D 几何提升,在新建的开放世界基准 OpenTarget 上大幅超越强基线。

OVGGT: O(1) Constant-Cost Streaming Visual Geometry Transformer

OVGGT 提出了一种无需训练的流式视觉几何 Transformer 框架,通过基于 FFN 残差幅值的自选择性缓存(与 FlashAttention 完全兼容并引入空间平滑)和动态锚点保护(首帧全局锚点与长程历史锚点),将流式 3D 重建的显存与单步计算锁定在 \(O(1)\) 常数预算内,彻底消除了显存溢出风险并提升了几何精度。

P-CORE: Self-Supervised Surface Consistency for Point-Based Neural Editing

针对基于点的神经渲染在非刚性大形变下易产生孔洞与撕裂的问题,P-CORE 提出一种无需真实形变多视角数据或显式几何代理的自监督曲面一致性微调框架,通过强制“曲面预测与形变场可交换”并设计双重光线形变模式,使注意力插值核在仅 30K 无空间延展点的紧凑表示下实现连续平滑的零样本形变渲染。

Pano3D: Unified 3D Reconstruction and Panoptic Segmentation

Pano3D 在前馈式 3D 重建模型(FRM,如 MUSt3R / Pi3)后面直接接一个 Mask2Former 风格的集合式掩码解码器,用几何+语义两个损失联合微调几何解码器,第一次做到无需外部 2D 模型、无需聚类后处理就在单次前馈里同时输出稠密点云 + 3D 全景分割,在 ScanNet / ScanNet200 / ScanNet++ 上语义分割 mIoU 大幅超过 SOTA(ScanNet +16.6)。

PanoLess: Environment Reconstruction from Partial Reflective Views

针对无需全景相机的单侧反射表面拍摄场景,PanoLess 基于表面对齐的 2D 高斯泼溅与无衰减神经立方体贴图延迟着色,精确解耦物体几何与高频远场环境光,并同步输出指示环境观测完备度的可见性图,相比现有反向渲染基线将环境重构 PSNR 提升近 5 dB。

PASTEL: Panoramic Alignment for Monocular 4D Scene Reconstruction

PASTEL 将单目动态视频的相机外推从难以求解的高维 3D 笛卡尔空间转化到结构化的 2D 全景球面域,通过自适应外推轨迹与动静解耦投影引导视频扩散先验,并利用不可见与不可靠区域掩码实施策略性监督,实现了高几何一致性的无边界 4D 场景重建。

Physically Grounded 3D Generative Reconstruction under Hand Occlusion using Proprioception and Multi-Contact Touch

本文融合单目RGB视觉、本体感知(手部姿态)和多点触觉,在流匹配扩散框架下生成严重手部遮挡下的公制尺度物体SDF,并通过非贯穿与接触一致性两项物理损失同时在训练和推理采样阶段引导形状重建,使输出在物理上可行且位姿隐式估计。

Physically Grounded Monocular Depth via Nanophotonic Wavefront Encoding

通过定制可见光双折射超构透镜在单次单目曝光中将物理度量深度编码为正交偏振螺旋点扩散函数(PSF)的旋转位置偏移,并采用免网络修改的伪 RGB 输入适配方案微调单目深度基座模型(Depth Anything V2),实现了无需主动激光雷达的高精度度量单目深度估计。

PhysMani: Physics-principled 3D World Model for Dynamic Object Manipulation

针对传统VLA和视频世界模型缺乏显式3D几何与物理规律导致无法处理高速运动物体的问题,本文提出了耦合物理原则3D高斯世界模型与未来感知策略网络的PhysMani框架,通过在线优化无散度高斯速度场预测场景未来动力学,并在动态操纵基准上实现了显著超越SOTA的成功率。

PIC: Revisiting INR for Image Coding with Fast Encoding and Sub-Millisecond Decoding

针对隐式神经表示(INR)图像编码因逐图训练导致编码极慢的瓶颈,PIC 提出了一种纯前向超网络调制架构与硬件对齐的极轻解码管线,在单次前向传播中完成多尺度潜变量与网络权重的同步生成,实现 20 FPS 实用编码、2000 FPS(0.42 ms)亚毫秒级超快解码,且率失真表现全面超越经典 JPEG。

PixVOD: Pixel-Distributed Direct Visual Odometry and Depth Estimation

针对近传感器计算范式(Pixel Processor Array),提出首个基于高斯置信度传播(GBP)与局部关键帧锚定的完全像素级分布式直接法视觉里程计与深度估计框架 PixVOD,仅通过局部邻域通信即可实现全局 6DoF 相机运动共识与度量尺度深度恢复。

Point Ladder Tuning: Parameter-Efficient Hierarchical Adaptation for 3D Point Cloud Understanding

Point Ladder Tuning (PLT) 通过侧边构建从原始点云提取的多分辨率局部几何金字塔,利用选择性注意力融合并生成动态提示反哺冻结的 3D Transformer 主干,仅用 2.71% 的可微调参数量即在分类与分割任务上超越全参数微调。

PointSplat: Compact Gaussian Splatting via Human-Centric Prediction

PointSplat 提出了一种以人体为中心的 3D 高斯前馈预测框架,利用空间雕刻与光线投射构建紧凑表面点代理并建立显式 2D-3D 对应,再经点-图像 Transformer 直接在 3D 空间回归高斯属性,以仅约 1/3 的高斯球数量超越了现有视点中心基线的新视角渲染质量。

PRISM-VO: Scale-Aware Visual Odometry Using Photometric Plenoptic Bundle Adjustment

针对聚焦全光相机的成像物理特性,PRISM-VO 构建了端到端光度全光光束法平差(Bundle Adjustment)框架,将单帧微透镜视差提供的度量尺度深度先验与滑动窗口多视角时间光度一致性联合优化,无需外部传感器即可实现高精度、抗漂移的尺度可感知视觉里程计。

PRISM3D: Probabilistic Refinement and Robust Initialization for Physically Consistent Scene Modeling under Extreme Motion Blur

针对极端运动模糊下传统 SfM 彻底崩溃导致三维重建失败的难题,PRISM3D 结合深度密集点追踪(VGGSfM)提供拓扑骨架、3DGS-MCMC 概率采样填补稀疏空洞,并基于连续 \(SE(3)\) Bézier 曝光轨迹进行物理一致性联合优化,首次实现了无需清晰图像先验的盲端到端高质量新视角合成。

Pro-Pose: Unpaired Full-Body Portrait Synthesis via Canonical UV Maps

Pro-Pose 提出了一种基于规范全人体 UV 纹理空间的无配对人像姿态重定与规范化合成框架,通过新颖的供体遮罩重姿态机制打破姿态与纹理边界泄漏,实现基于单一非受控图像生成保真度极高的可控人像化身,并为虚拟试衣等下游任务提供无遮挡的标准中介画布。

Probing the 3D Object-Level Understanding of Pre-Trained Detection Transformers

本文提出了一套探测 2D 检测 Transformer 隐式几何表征的方法体系,揭示了在完全没有 3D 监督信号训练下的 DETR 模型查询嵌入中,已自发编码了高度精确的目标级深度和 3D 相机坐标系空间位置信息。

Progressive Pose-Guided 4D Animal Reconstruction from Monocular Video

本文提出基于3D高斯溅射的渐进式测试时优化框架,通过解耦骨架运动与非刚体变形,从单目视频中重建高保真4D动物模型,仅需粗粒度形状先验即可泛化到多种物种。

PUF: Plug-and-Play Uncertainty-Aware Fusion for Online 3D Scene Graph Generation

针对在线 3D 场景图生成中确定性融合忽略观测截断、2D 模型预测与 3D 几何表征三大不确定性的缺陷,提出免训练即插即用融合框架 PUF,通过概率化节点关联、双路狄利克雷证据累积及类别条件关系先验,在仅 15 ms 实时延迟下将 3DSSG 关系召回率大幅提升 18.1 个百分点。

PWM-ArtGen: Part World Model for Articulated Object Generation

提出首个面向单图铰接物体生成的部件世界模型 PWM-ArtGen,通过解耦时间步联合扩散建模动作后视觉动态与运动学参数,结合视觉动力学正则化与 19.7k 逼真无标注数据协同训练,实现了逼真且物理自洽的 3D 铰接物体零样本生成。

Racing in Volume with Flow Ensembles

针对户外赛车等大位移运动场景下流式 4D 重建因单尺度对应失效而崩溃的难题,提出 FastFlowGS 融合跨尺度光流与点追踪信号,结合几何不确定度与卡尔曼时序先验更新高斯位置,并在全新拟真基准 Monaco4D 上实现了首个鲁棒的流式高斯重建。

RADmesh: Remesh-Aware Mesh Deformation

针对显式网格在噪声视觉损失引导下做大幅度生成式形变易导致网格面退化与拓扑受限的难题,RADmesh 提出将顶点级六维尺度-旋转形变表征与由粗到细的周期性各向同性重网格化及优化器状态插值相结合,实现了保面片质量、支持大尺度局部生长与全局结构细化的纯网格端到端生成。

RayDer: Scalable Self-Supervised Novel View Synthesis from Real-World Video

RayDer 将相机位姿估计、场景重建与新视角渲染完全整合进单一前馈 Transformer 主干网络,通过将场景动态建模为干扰因子并配合状态 Dropout,彻底打破了自监督新视角合成依赖静态场景的扩展瓶颈,在海量无标注动态视频上实现了可预测的幂律扩展与强大的零样本泛化性能。

REALM: An RGB and Event Aligned Latent Manifold for Cross-Modal Perception

REALM 通过轻量卷积嵌入层与 LoRA 参数高效微调,将异步稀疏事件流直接投射至冻结的 RGB 基础模型 (DUNE) 潜在流形,在无需任何事件微调的情况下,实现了冻结图像解码器 (MASt3R) 对事件数据的零样本几何与语义感知迁移。

ReconSplat: Generalizable 3D Scene Reconstruction Beyond Observed Views

ReconSplat 提出了一个前馈式 3D 场景重建与视角外推框架,通过光栅化 3D 变分高斯分布构建多视角几何与外观潜在特征,并将其作为粗糙先验注入多视角潜在扩散模型(MV-LDM),同时实现了未观测视角的高保真合成与多视角一致的精确深度重构。

Reconstructing Humans and Objects in Interaction using Large Reconstruction Models

MILO将单目3D人-物交互重建问题重新表述为“解释大重建模型(LRM)生成的联合网格”,将LRM网格作为保留相对空间与邻近线索的非参数化几何脚手架,通过多视角关键点三角化两阶段拟合SMPL-H人体模型与分割对齐物体,在无需任何真实接触先验的情况下刷新了多个数据集的SOTA。

Recurrent Sinusoidal INRs for Efficient High-Fidelity Representation

论文揭示了正弦激活函数诱导谐波线谱扩展的数学本质,提出权重共享的无偏置正弦循环架构与双极性格雷码对齐监督,在不增加模型参数量的前提下成倍扩增有效频域支撑,实现了低计算预算下的高保真乃至无损离散信号重建。

Reflection-aware generative novel view synthesis

Ref-GeNVS 是首个面向镜面场景的免训练生成式新视角合成方法,将镜面图像拆解为两个互补视角,结合镜面门控跨视角注意力与潜空间反射注入,在稀疏或单视角输入下实现了反射与三维场景一致的新视角生成。

RefracGS: Novel View Synthesis Through Refractive Water Surfaces with 3D Gaussian Ray Tracing

针对非平整折射水面下水下场景重建中的非线性光路畸变与多视角不一致难题,本文提出结合连续神经高度场与网格细分求交的混合水面表征,并构建了梯度可穿透斯涅尔折射定律反传至水面参数的端到端可微 3D 高斯光线追踪框架,实现了兼具 15 倍训练加速与 200+ FPS 实时渲染的高保真新视角合成与水面水下联合解耦重建。

RegHead: Non-Humanoid Head Blendshapes via Feed-Forward Registration

针对非人形态 3D 头部缺乏拓扑对应与表情标注数据的难题,RegHead 构建了约 2 万个涵盖统一定义表情词表的非人头像数据集,并提出拓扑无关的密集随机锚点运动表征与粗到细前向配准网络,无需真实对应标签即可单次前向输出语义一致的 Blendshapes 并实现人类面部驱动的实时表情重定向。

Relaxed Rigidity with Ray-based Grouping for Dynamic Gaussian Splatting

针对单目动态 3D 高斯泼溅中外置运动先验易传导误差、传统 KNN 严格刚性约束损害非刚体形变的问题,提出利用光线 \(\alpha\) 混合权重进行无需几何近邻搜索的视线高斯分组,并联合运动方向一致性与协方差特征值谱正则化构建松弛刚性约束,在不改变模型架构与零推理开销下显著提升动态场景几何保真度与时间连续性。

Reliability-Aware 3D Geometric Injection for Universal Person Re-identification

UniGeo 提出了一种运动学感知的单目 3D 姿态编码器与基于跨模态一致性的可靠性门控机制,将 3D 几何拓扑作为动态调节的结构残差注入表征空间,在大幅提升换衣与遮挡场景重识别性能的同时,有效避免了几何噪声在常规场景造成的负迁移。

ReViV: Reconstructing the Viewer and the View in 4D from Monocular Egocentric Video

ReViV 提出了首个基于单目第一人称 RGB 视频联合重建观察者与场景的统一 4D 生成框架,通过离散多模态标记化与掩码生成 Transformer(MGET),在无需外部 SLAM 轨迹或辅助传感器的前提下实现了观察者身体、手部、视线与场景深度、相机轨迹的高精度实时前向推理。

RGB-Pointmap Pretraining for Unified 3D Scene Understanding

UniScene3D 提出了基于多视角图像与世界坐标点图(RGB-Pointmap)的统一 3D 场景表征预训练框架,通过 Patch 级早期融合继承 2D 大模型先验,并结合跨视角几何对齐与指称定位对齐等多尺度目标,在视角定位、场景检索与 3D VQA 等任务上均取得 SOTA 表现。

ROAR-3D: Routing Arbitrary Views for High-Fidelity 3D Generation

ROAR-3D 提出一种轻量级多视角 3D 生成范式,通过在预训练单视角扩散模型中引入基于特征亲和度的 Token 级视角路由器、解耦朝向与几何的双流交叉注意力机制及朝向扰动训练策略,无需相机姿态即可灵活融合任意数量未校准视角的几何细节。

Robust 3DGS-based SLAM via Adaptive Kernel Smoothing

针对 3D 高斯参数噪声导致光度对齐易陷入尖锐局部极小的问题,本文提出在光栅化阶段引入瞬态自适应核平滑校正(CB-KNN),构建平滑优化曲面并解耦保真度与跟踪鲁棒性,在维持高精度建图的同时将相机轨迹跟踪误差降低 19% 至 35%。

Robust and Efficient Monocular 3D Gaussian SLAM for Kilometer-Scale Outdoor Scenes

针对单目 3DGS 在公里级室外大场景下面临的长序列位姿追踪脆弱与高斯基元显存暴涨两大核心瓶颈,本文提出 KiloGS-SLAM,通过运动自适应混合追踪架构(本质矩阵/PnP 自适应切换与基础模型按需激活)结合全生命周期管理的高斯建图机制(DoG 与深度梯度的概率初始化加分块多视角一致性增删),在单卡上实现了超万帧真实室外序列的 SOTA 追踪精度与高质量轻量级神经辐射场重建。

Rolling Shutter Camera Self-Calibration

首个无需标定板或辅助硬件的卷帘快门相机纯视觉自标定方法,将连续时间B样条轨迹估计与2D像素轨迹校正场估计统一为双重投影光束法平差模型,实现相机内参与行读出时间比率的高精度联合估计。

SA-ResGS: Self-Augmented Residual 3D Gaussian Splatting for Next Best View Selection

针对主动场景重建中视角选择严重受制于 3DGS 早期不确定性估计偏差与梯度消失问题,SA-ResGS 提出结合单视点外推三角化的自增强点云(SA-Points)进行物理视锥覆盖度粗筛,并设计不确定性引导的残差分支渲染模拟跳跃连接,显著提升主动视角探索效率与少样本下的几何保真度。

SAF3R: Dynamic Sparse Attention for Feed-Forward 3D Reconstruction Transformers

针对前馈三维重建(F3R)Transformer中跨视角全局注意力二次复杂度的计算瓶颈,SAF3R揭示了注意力头之间高度异质且动态的稀疏行为,通过离线头部画像自适应分配四种专用稀疏算子配合轻量在线动态采样,在免微调前提下将长序列推理最高加速7.3倍并无损重建质量。

Scal3R: Learning Efficient Multi-Relative Pose Query for Scalable Online 3D Reconstruction

针对前馈在线三维重建模型在长序列中全局位姿外推崩溃的问题,Scal3R 冻结预训练骨干网络并注入约 1% 参数量的多参考相对位姿查询 Token,结合非对称注意力和在线位姿图优化,以单卡 8 小时微调在公里级序列上实现低漂移高保真重建。

Scene Generation at Absolute Scale: Utilizing Semantic and Geometric Guidance From Text for Accurate and Interpretable 3D Indoor Scene Generation

本文提出 GuidedSceneGen,首创将 3D 全局度量代理布局引入文本到 3D 室内场景生成管线,结合几何与语义双重引导的全景扩散模型与避障相机轨迹优化,实现了绝对度量尺度下具有 9D 物体位姿与语义可解释性的连贯 3D 高斯泼溅场景重建。

SceneHI: High-Resolution 3D-Consistent Scene Texturing with Controllable Illumination

针对复杂多物体室内场景纹理生成中的视角不一致、表面分辨率受限与物理光照缺失难题,SceneHI 提出了免微调的解析几何映射与高分辨率隐式纹理(HRLT)框架,并引入分块精炼与几何一致阴影烘焙,实现了高保真、多视角一致且光照可控的 3D 场景纹理合成。

Seen2Scene: Completing Realistic 3D Scenes with Visibility-Guided Flow

Seen2Scene 是首个直接在不完整真实 3D 扫描数据上训练的流匹配场景补全与生成方法,通过显式掩码未知不可见区域的可见性引导流匹配(Visibility-Guided Flow Matching)与稀疏 VAE,在保留观测表面几何的同时高质量补全复杂现实室内场景。

SegVGGT: Joint 3D Reconstruction and Instance Segmentation from Multi-View Images

SegVGGT 提出了首个基于多视角未标定 RGB 图像直接端到端联合实现前馈 3D 重建与 3D 实例分割的统一框架,通过在几何基础模型中逐层注入物体查询并引入无推理开销的帧级注意力分布对齐(FADA)机制,在 ScanNetv2 和 ScanNet200 上刷新了多项 SOTA。

SemCityLoc: Aerial 6DoF Localization Using Semantic 3D City Models

SemCityLoc 将无人机空中 6DoF 位姿估计重新定义为「基础模型视觉先验(语义分割 + 单目深度)与标准化语义 3D 城市模型之间的结构化表面配准」问题,通过「4D 语义代价体积粗定位 → 粒子滤波联合语义-深度精对齐」的两阶段管线,在无需稠密辐射重建的前提下,将城市峡谷场景的定位召回率从 35.11% 提升至 69.15%(2m-2度阈值),位置误差从 9.89m 降至 2.62m,并同步发布首个厘米级精度真实无人机定位基准 SemCityLockeD。

SHReg: Strictly Rotation-Equivariant Point Cloud Registration via Spherical Harmonics

针对传统点云配准依赖数据增强或脆弱局部参考系导致的旋转泛化差问题,SHReg 基于 SO(3) 群表示理论与球谐函数构建了严格旋转等变卷积骨干,不仅解耦读出严格旋转不变的判别性几何描述子,还利用等变高阶张量在单个对应点上闭式求解刚体变换假说,在 3DMatch、3DLoMatch 与 KITTI 上全面超越现有 SOTA。

SkipGS: Post-Densification Backward Skipping for Efficient 3DGS Training

SkipGS 针对 3D 高斯泼溅(3DGS)稠密化后阶段反向传播耗时占比超 60% 且大量收敛视角梯度收益衰减的瓶颈,提出视角自适应反向门控机制,在保持全前向统计跟踪的同时选择性跳过冗余反向传播,并结合预热自校准预算约束,在保持画质几乎无损的前提下使稠密化后训练时间减少 42.0%、端到端训练提速 23.1%。

SMG: Semantic Motion Graph for Monocular Dynamic Gaussian Splatting

针对单目动态高斯泼溅在稀疏视角与复杂遮挡下的几何漂移难题,提出语义运动图(SMG)架构,通过语义门控与时序拓扑限制运动传播范围,并利用置信度加权 ARAP 与局部刚体运动控制由可靠节点引导弱约束区域变形,实现了兼顾拓扑稳定与高保真的动态新视角合成。

SOCO: Benchmarking Semantic Object Correspondence in Vision Foundation Models

针对传统语义对应基准混淆局部概念识别与物体空间拓扑位置、缺乏跨类别迁移与文本描述的问题,SOCO 提出了首个基于分层分类体系的语义对应基准,构建了覆盖 100 个类别、逾 100 万对应对的大规模数据集与语言描述,全面揭示了视觉基础模型在对称部件混淆与多模态大模型在跨图视觉匹配上的关键瓶颈。

Sparse auto-regressive modeling for scene generation from multi-view images

针对极稀疏、大视差且无约束多视角图像下的完整 3D 场景补全难题,SPAR3S 提出了一种无需真实 3D 监督的稀疏体素对齐 3D 隐式自回归生成模型,结合可微 3D 高斯泼溅渲染与掩码扩散生成,实现了高质量的新视角合成与未观测区域几何外推。

Sparse-View Surface Reconstruction using Gaussian Splatting through High-Confidence Depth Propagation with Normal Priors

针对稀疏视角下 3DGS 缺乏几何线索和离散高斯易导致深度模糊与断裂的问题,本文提出利用多视角几何与光度一致性筛选高置信度锚点、在单目法线先验引导下向低置信度区域迭代传播深度,并结合异常深度边缘感知平滑损失消除离散裂痕,实现了高质量表面重建。

SPECSIA: Stylization Dataset for Novel-View Enhancement in Drawing-based 3D Animation

本文提出 SPECSIA-15K 成对风格化数据集(14,980 对带伪影投影与干净目标)和轻量即插即用后校正模块 DraViE,通过数据级预训练先验替代样本级逐帧优化,有效消除绘图驱动 3D 动画中新视角下的投影伪影并保持原画风格。

SpectralSplats: Robust Differentiable Tracking via Spectral Moment Supervision

把 3DGS 可微跟踪的监督目标从空间域(逐像素光度误差)换成频域(谱矩),配上一套从相位缠绕原理严格推导出来的频率退火调度,让高斯资产即便初始化时和目标完全不重叠也能获得非零的方向梯度、平滑地"流"到正确位姿——从而无需人工对齐或类别先验就能做鲁棒跟踪。

Stable and Scalable Bundle Adjustment of Holistic 3D Structures

提出统一的高阶几何光束法平差框架,将高阶几何组置于非消元相机块并将约束重构为像素重投影误差,既保留经典舒尔补的块对角稀疏性与极速消元,又实现包含点、线、面及线框的整体3D结构联合优化。

StereoGS: Sparse-View 3D Gaussian Splatting via Stereo Priors

StereoGS 通过构建虚拟立体相机对、引入立体深度正则化和梯度感知透明度衰减,解决了稀疏视角 3DGS 中单目深度先验固有的尺度模糊与跨视角不一致问题,在 LLFF、DTU、Mip-NeRF360 和 Blender 四个数据集上达到新视角合成的最优水平。

Stitched Embeddings: A Unified Latent Space for 3D Garments and 2D Patterns

提出首个免物理仿真的端到端全可微双向隐空间表征 StEm-Net,利用 BoxMesh 桥接 3D 悬垂衣物与 2D 缝合裁剪图样,在实现 SOTA 版型逆向推断的同时支持基于梯度的测试时几何优化与免仿真实时 3D 交互编辑。

StructureGS: Structure-aware Gaussian Splatting for Articulated Object Reconstruction

StructureGS 针对现有铰接物体隐式与显式重建中纯光度监督导致的几何-运动纠缠与边界模糊问题,为各部件引入显式有向包围盒(OBB)表示与规范化 3D 高斯泼溅,借助基于分离轴定理的接触损失与部件贴合损失引入结构约束,实现了清晰的部件分解、精确的运动参数估计与鲁棒的稀疏视角重建。

StyleFusion360: View-Consistent Head Stylization via Adaptive Style Modulation

针对现有3D人脸风格化难以兼顾精细几何保持与任意风格零样本泛化的难题,本文提出 StyleFusion360,依托3D感知扩散模型构建解耦的双分支外观模块,并通过创新的两阶段风格融合注意力与自适应键调制,实现了无需单风格重训练的360度多视角一致且身份保真的头像风格化。

SubSplat: High-Resolution Pixel-aligned 3DGS via Sub-pixel Gaussian Reparameterization

SubSplat 通过亚像素高斯重参数化器(SPGR)与可变形注意力多视图特征聚合,在保持主干网络低分辨率输入与低延迟的前提下,将每个锚点主高斯在 3D 空间细分为多个精细亚像素图元并守恒重分配不透明度,彻底解决了像素对齐 3DGS 在高分辨率渲染上面临的二次计算膨胀与欠参数化伪影矛盾。

SynCity 3000: Bootstrapping Scene-Scale 3D Diffusion

SynCity 3000 提出了一种两阶段大尺度 3D 场景生成框架,先以滑动窗口联合去噪生成高分辨率二轴测全景模板,再利用在合成场景数据上微调的“卷积式”两阶段 3D 扩散模型将其无缝解码为任意尺度的 3D 高斯泼溅场景,彻底打破了传统网格化拼接的割裂感与视距限制。

TabletopGen: Tabletop Scene Generation and Interactive Simulation for Robotic Manipulation

TabletopGen 提出了一个免训练、端到端的交互式桌面场景生成与物理仿真引擎,通过生成式实例抽取与解耦的姿态尺度对齐策略(DRO 旋转优化与 TSA 顶视空间对齐),从单张图像或文本生成无穿透、带碰撞几何的物理可交互桌面场景,支撑高质量机器人操作数据合成及零样本 Sim-to-Real 策略迁移。

Temporally Aware Densification for Dynamic 3D Gaussian Splatting

针对动态 3D Gaussian Splatting 中继承静态稠密化策略导致短寿命和高动态高斯无法充分分裂克隆的问题,本文提出可见性加权梯度积累(VAD)、基于寿命自适应调节阈值(TAT)以及集中变形容量的时间偏移扭曲(TOW),显著提升了动态区域的细节重建质量与渲染帧率。

TetraSDF: Analytic Isosurface Extraction with Multi-resolution Tetrahedral Grid

TetraSDF 提出结合多分辨率四面体网格与 ReLU MLP 的神经符号距离函数架构,利用四面体内部重心插值的仿射特性保持全局连续分段仿射(CPWA)结构,首次在保留网格编码器高频拟合能力的同时实现了严格精确匹配零等值面的解析多边形网格提取。

The Dynamic Prior: Understanding 3D Structures for Casual Dynamic Videos

本文提出无需下游任务特定训练的“动态先验”(Dynamic Prior),通过视觉语言模型(VLM)进行链式思考推理识别视频中的动态物体并由 Sa2VA+SAM2 生成精确运动掩码,将其即插即用集成到相机位姿平差、深度优化与 4D 轨迹估计中,显著提升复杂动态视频的 3D 几何结构理解精度。

TIDES: Time-Derivative Event Simulation via Deformable Reconstruction

针对传统事件相机仿真因离散帧间差分导致的“时间戳批处理”与遮挡失真问题,TIDES 基于动态 4D 高斯泼溅构建前向时间导数光栅化管线,直接从显式 3D 场景动力学解析求解连续时间对比度阈值跨越,并结合遮挡风险自适应步长与物理读出仲裁器,显著提升仿真事件流保真度与下游迁移能力。

TimeWalker: Personalized Neural Space for Lifelong Head Avatars

针对传统头部化身仅建模瞬时静态或短视频片段的局限,TimeWalker 提出个性化神经线性组合空间与动态 2D 高斯泼溅(DNA-2DGS),仅需网络非结构化跨年龄照片集合即可构建兼具跨年龄身份一致性与多维度显式解耦控制的终生 3D 头部化身。

TopoGS: Planar Reconstruction via Topology-Aware 3D Gaussian Splatting

TopoGS 首次将 2D 拓扑图与 3D 高斯泼溅联合优化深度绑定,提出融合光度、几何与拓扑的三重一致性约束与不确定度加权机制,自适应滤除视点依赖的伪邻接,从多视角图像中端到端重建出边界精准、物理连通的结构化平面模型。

Towards Alias-Free 4D Gaussian Representations with Motion-Aware Filtering

针对 4D 高斯表示在跨尺度视点渲染(变焦/拉远)时出现的严重混叠与模糊问题,本文提出一种基于 Parzen 窗核密度估计的运动自适应 3D 平滑滤波器,通过联合建模时间与焦距-深度比的概率分布,使基元抗混叠滤波强度随物体动态运动自适应调节,实现了跨尺度的无混叠动态渲染。

Towards in-the-wild Egocentric 3D Hand-Object Pose Estimation

本文用「手上接触区 → 双射传到物体 → 优化拟合」的低成本标注流程造出首个野外第一人称手物接触数据集 EPIC-Contact,并提出把预训练手部先验通过 cross-attention 注入物体特征的端到端网络 HOPformer,一次前向同时回归双手与物体姿态,在 ARCTIC 上把成功率从 76.2% 提到 82.4%,在野外数据上成功率近乎翻倍、接触偏差降 75%。

Triangle Splatting SLAM

首个直接将可微三角形汤(Triangle Soup)作为唯一核心地图表征的密集 RGB-D SLAM 系统,通过解析相机位姿雅可比加速追踪、正三角形几何正则化与在线德劳内三角化,实现了超越 3D/2D 高斯泼溅的高保真 3D 几何重建与实时在线网格编辑。

UBone3D: Physics-Rectified Conditional Flow Matching for Anatomical 3D Shape Completion from Ultrasound

UBone3D 将解剖结构合理性与成像物理一致性解耦,通过在高质量 CT 上训练的条件流匹配生成先验(BoneFM)与可微声学物理代理网络(USimNet),在测试期利用显式梯度动态校正生成轨迹,实现了从严重带伪影且大面积残缺的超声点云到完整解剖骨骼的高精度三维形状补全。

UniFusion: Sparse-View 4D Reconstruction via Unified Spatio-temporal Depth Alignment

UniFusion 提出了基于低秩时空神经场残差权重的单目深度联合对齐框架,无需前景分割与点追踪模型即可统筹跨视角与跨时间的几何一致性,并为 4D 高斯泼溅提供高质量几何初始化与密集监督。

UniPart: Towards Zero-shot Language-Grounded 3D Part Segmentation for Embodied Interaction

UniPart 提出了一种基于层级残差文本注入的轻量级前馈 3D Transformer 架构,并配套构建了包含 16 万资产与 800 万文本-部件对的多视角一致性数据集 LangPart-1M 及精标子集 LangPart-4K,实现了无需推理期多视角重投影的高效零样本 3D 细粒度部件分割与真实具身抓取交互。

UniSim-SLAM: Feed-Forward SLAM with Unified Sim(3) Optimization

UniSim-SLAM 针对几何基础模型前馈 SLAM 中双视角低延迟与多视角高几何约束的内在权衡,提出在统一的 Sim(3) 多级因子图上协同优化全局关键帧位姿与多视角子图位姿,在非标定设置下将 TUM RGB-D 与 7-Scenes 的轨迹误差分别降低 38.5% 与 45.9%。

UniTriSplat: A Unified 3D Gaussian Splatting Framework with Uniform Spherical Rasterization for Universal Cameras

把 3D Gaussian Splatting 的光栅化从「针对某一类相机的平面投影」搬到「单位球面上的 HEALPix 等面积网格」,用一套 camera-agnostic 的球面光栅器统一支持透视 / 鱼眼 / 全景相机,既消除了等距柱状投影的极区过采样、又拿到了稳定的跨相机泛化。

Unsupervised Pixel-Level Semantic Left-Right Understanding of In-the-Wild Images

针对真实自然图像缺失3D信息导致像素级左右语义难以判别的问题,Pix2LR通过调换预测与表面聚合顺序,首次构建了无监督跨模态混合训练框架,将有限3D形状的几何手性先验成功迁移至开放类别自然图像的密集像素预测中。

URHead: A Unified UV-Space Representation for Joint Mesh–3DGS Optimization in Head Avatars

URHead 提出了一种在统一 UV 空间下联合参数化与优化网格和 3D 高斯泼溅(3DGS)的头部数字人表示方法,通过共享属性图与基于重构误差的自适应 UV 采样,既保留了参数化网格的拓扑控制力,又实现了高保真的微观细节重建与时序稳定的动画驱动。

Vitality-Aware Compression for Efficient Image-to-Shape Diffusion Transformers

针对图生 3D 形状的 Diffusion Transformer(DiT),本文用一个基于 Earth Mover's Distance 的「层活力(vitality)」指标度量每层对几何合成的贡献,据此做结构化剪枝 + 分层混合精度量化 + 只微调最低活力层的定向蒸馏,在 Step1X-3D / Hunyuan3D 等 SOTA 模型上把 backbone 压缩最多 66% 而几乎不掉几何保真度。

VOCA: Visual Odometry with Codec Awareness

VOCA利用H.264视频编码过程中内置的运动矢量作为KLT光流跟踪的初始化先验,在Basalt框架上实现了对百倍压缩视频的高精度因果视觉里程计,在EuRoC、TUM-VI和MSD三个数据集上全面超越了现有方法。

Walking in the Implicit: Interactive World Exploration via Neural Scene Representation

NeuWorld 把交互式世界探索的"rollout 状态"从会不断增长的视频帧潜变量,换成一组定长、可渲染、局部锚定的神经隐式场景(NIS)token,让扩散模型只在这个紧凑状态空间里做转移、再用冻结解码器按查询相机位姿渲染观测,从而在完全从零训练、不借助任何预训练视频大模型的前提下,取得优异的长程位姿一致性、回访一致性与推理效率。

Weather-Conditioned Depth Anything

针对单目深度基础模型在雨雪雾夜等恶劣天气下特征混杂与几何失真的痛点,本文提出 DA-W(Weather-Conditioned Depth Anything),通过跨域对比学习的风格滤波器提取解耦天气嵌入,并借助零初始化 AdaLN-Zero 轻量调制解码器,在不破坏清晰场景泛化能力的前提下显著提升复杂天气下的深度估计鲁棒性。

What VGGT Knows About Overlap: Probing Geometric Foundation Models for Co-Visibility

通过冻结几何基础模型 VGGT 并接入一个约 7.5M 参数的轻量级分层混合专家(MoE)头,Co-VGGT 仅凭 RGB 图像即可实现超越人类基准的高精度共视性预测,在 Co-VisiON 基准上将成对预测 IoU 较此前 SOTA 提升逾 25%,并揭示出第 17 层专职剔除非共视像对的“负锚点”涌现机制。

When 3D Gaussian Splatting Recovers Real Surfaces

本文基于首击渲染抽象建立了 3D 高斯泼溅(3DGS)几何可识别性的理论框架,证明了几何偏差通过视差将空间纹理强制转化为高频视角信号,揭示了过高视角容量会导致“不透明广告牌”几何崩溃,并导出了保证真实表面可识别的中等球谐阶数窗口。

White Aggregation and Restoration for Few-shot 3D Point Cloud Semantic Segmentation

针对少样本3D点云分割中最远点采样(FPS)随机性大以及朴素交叉注意力分布失配导致注意力崩塌的问题,本文提出白化聚合与着色恢复模块(WARM),通过ZCA白化对齐特征分布、交叉注意力聚合语义原型、再通过逆向着色恢复实例统计特性,以极简的无重型解码器架构在S3DIS上大幅刷新SOTA。

WildDepth: A Multimodal Dataset for 3D Wildlife Perception and Depth Estimation

WildDepth 建立了首个包含 29 个物种、20.2 万精选帧的野外同步 RGB-LiDAR 多模态数据集,揭示了主流单目深度模型在远距离非刚性野生动物场景下的严重退化,并提出了基于稀疏激光锚定对齐与形变高斯泼溅的度量级 3D/4D 重建基准。

WildSplat: Feedforward Gaussian Splatting from Unposed In-the-Wild Images

WildSplat 是首个面向无位姿野外图像的前馈 3DGS 框架:几何分支(DINOv2 编码器 + 24 层交替注意力)提取外观不变内容特征并联合预测相机位姿,外观分支用 [CLS] 预调制加交叉注意力把参考图外观注入内容特征后预测条件化球谐颜色;多参考联合监督防止几何与外观纠缠,在 MegaScenes/Phototourism 的 4/8/12 视角设置下全面超过 AnySplat、WorldMirror 与优化式方法,Phototourism 12 视角 PSNR 21.47、且支持单次前向的外观编辑与外观插值。

WilLaGS: Latent-Conditional 3D Appearance Fields for Robust Gaussian Splatting In-the-Wild

WilLaGS 用 β-VAE 学习连续全局外观潜空间,以潜码生成 Tri-Plane 三维外观场调制局部光照,并用 EMA 教师与真实图像的感知差异屏蔽瞬态遮挡,在 Photo Tourism 的 Sacre Coeur 达到 25.84 dB,同时提供 58 FPS 的渲染及同一场景内的外观插值和随机采样能力。

2D Features Are All You Need for 3D Shape Understanding

MeshFM 先把纠正边界混叠后的二维基础模型特征拟合为三维教师场,再训练带旋转增强的前馈网络预测该场,在无需三维人工标注的情况下,以同一套特征支持分割、对应和变形,并在 PartObjaverse-Tiny 原始/旋转语义分割上取得 0.549/0.539 mIoU。

3D Gaussian Splatting Compression with Object Scalability

论文先用 RecastGS 将预训练 3DGS 重组为可按对象选择质量的分层表示,再用 LayeredCGS 逐层压缩和渐进解码,在 kitchen 的约 2.3 MB 工作点将 ROI PSNR 从 19.65 dB 提至 21.81 dB,代价是降低背景及全图质量。

3D Gaussian Texture for Real-time Mesoscale Appearance Synthesis and Rendering

本文把三维高斯组织为按离表面高度分层的规则纹理,使草叶、榴莲尖刺和编织缝隙等中尺度结构能够按样例实时合成、映射到新网格并进行基础重光照,在四组实验中均优于 NeRF-Texture 的 SIFID,图 4 所示耗时为 3.28–4.98 ms。

3D-ReGen: A Unified 3D Geometry Regeneration Framework

MeshReGen 将粗网格、不完整点云和遮罩几何统一编码为 VecSet 条件,通过条件 token 与带噪目标 token 的拼接及自动构造的退化配对,学习图像辅助的三维再生成,在 GSO 四视图重建中达到 CD 0.0081、F-score 0.4913,同时支持几何增强和局部编辑。

3DGS3: Joint Super Sampling and Frame Interpolation for Real-Time Large-Scale 3DGS Rendering

3DGS3 不再要求每个输出帧都做高分辨率高斯光栅化,而是用解析梯度引导的超采样与轻量插帧联合恢复空间和时间分辨率,在 Mip-NeRF 360 的 4096×2160 设置下将 3DGS 的 17.35 FPS 提升到 96.47 FPS,同时相对高分辨率参考渲染达到 49.22 dB PSNR。

4D-VGGT: A SpatioTemporal Foundation Model for Dynamic Scene Geometry Estimation

4D-VGGT 用自适应视角-时间网格组织输入,让跨视角全局融合与跨时间局部融合并行学习空间和运动线索,再按任务分配给五类预测头,在 Bonn 相机位姿估计上取得 ATE 0.017,并通过消融展示空间分支与时间分支的不同贡献。

Abstract the Layout, Focus the Detail: A Dual-Granularity Representation Framework for Zero-Shot 3D Visual Grounding

本文将三维场景改写成用于空间推理的抽象布局和用于外观核验的物体细节图,让现成 VLM 按“先空间、后视觉”选择目标,在 ScanRefer 达到 45.0% [email protected],在不提供 GT 物体类别的 Nr3D 达到 63.2% 准确率。

ActiveStructure: Plane Scene Graph-Guided Active 3D Gaussian Splatting

ActiveStructure 在主动 3DGS 建图中加入持续更新的平面场景图,用关系异常与三维缺口驱动视点选择,并让已建好的墙面从探索吸引目标变成抑制信号,在 Replica 的固定 2000 帧预算下达到 97.47% 覆盖率和 32.13 dB PSNR。

Ada-VNNs: Adaptive Equivariance for Vector Neural Networks

Ada-VNNs 在严格旋转等变的向量神经元骨干后加入可放松坐标权重共享的残差分支,让训练数据决定等变约束的实际强度,在 ShapeNet 近似连续自对称类别上将 VNN 的 10° 配准召回率从 8.87% 提升至 70.31%,但并非所有任务都受益。

AdaptiveSplat: Texture Aware Controllable 3D Gaussian Allocation for Feed-Forward Reconstruction

AdaptiveSplat 先按局部纹理复杂度决定哪些三维高斯可以删,再让掩码条件高斯头一次性重预测保留高斯的属性,在不做测试时场景优化的情况下实现可控稀疏重建,剪去 80% 高斯时仍在 RE10K 上达到 20.740 dB PSNR。

Aggregating Cross-Domain Knowledge via Learnable Tokens for Multi-Teacher Distillation

ACTok在学生骨干之后加入通道拼接的可学习令牌和跨空间/域内交替交互,用ImageNet-1K汇聚CLIP、MAE、DINO等教师的互补表征,使ViT-B在Caltech101上达到94.4%,但并未在所有任务上超过最强教师或蒸馏基线。

AnyGround3D: Towards Grounding Any 3D Object in the Wild via 2D-to-3D Lifting

AnyGround3D 把 COCO、KITTI 等单目图像自动提升为带场景点云、完整物体三维框和自然语言描述的 3D grounding 监督,再将 DINOv2 语义蒸馏到三维编码器,在 3EED 联合集上达到 66.76/31.34 [email protected]/0.5,并在无需针对性微调的 Mono3DRefer 测试集达到 62.71/54.79。

AutoPhyX: Automatic Text-Condition Physics Property Generation

AutoPhyX 提出了首个文本条件引导的前向 3D 物理属性预测框架,通过神经辐射场体素化与 FiLM 跨模态特征调制,在单次前向推理中为任意 3D 资产回归稠密杨氏模量、泊松比与密度场,有效消除纯视觉反演的物理多义性。

AVSplat:Dense-View Feed-Forward 3D Gaussian Splatting with Assist-View Preconditioning

针对无位姿前馈 3D 高斯泼溅在密集视角输入下由于全局注意力弥散和体素均值融合导致的重建退化问题,AVSplat 提出了辅助视角预处理机制与占用率引导的自适应温度体素融合,成功恢复了视角数量增加时性能持续上升的正向缩放特性。

BioMTBee: Biologically Constrained Multi-View Template-Based 3D Reconstruction of Bumblebee

BioMTBee 用微型 CT 构建熊蜂关节化模板,以多视角时空滤波姿态和轮廓引导带生物约束的网格拟合,在 DBS 测试划分上把 MAMMAL 的网格关键点误差从 0.189 mm 降至 0.152 mm,同时将轮廓 IoU 从 0.696 提高到 0.758。

BLASt3R: Bundle Adjustment of Any Image Set with Multi-View Matching and Monocular Depth Priors

BLASt3R 提出了一种融合流式多视图特征匹配与可调单目深度先验的混合 3D 重建系统,在统一的 GPU 深度正则化光束法平差框架下无缝支持大规模无序离线 SfM 与在线实时 VSLAM,无需相机内参即可大幅超越现有校准与未校准基线。

Boosting 6D Object Pose Estimation via Monocular Depth Cues

MDC-Net 将单目深度的尺度校正、几何内点筛选与循环位姿细化相互反馈,在推理时不使用真实深度,以单个位姿假设取得七个 BOP 数据集平均 AR 66.9%,但论文部分辅助表格和训练描述存在不一致。

Boosting Correspondence Learning with Structure-Aware Estimator

本文把对应学习末端的独立加权最小二乘替换为结构感知估计器,用学习到的内点关联图修正几何求解的信息矩阵,使 DeMatch 在 YFCC100M 上的 AUC@5° 从 30.95 提高到 36.58,但跨室内外场景与硬筛点架构仍是明显边界。

Bootstrapping Articulated 3D Reconstruction from 2D Image Collections

BAT3R 用单个规范姿态网格启动三维预测,再从二维图像中拟合关节姿态、重渲染并迭代训练,使 Animodel-Points 马类别的 RMS Chamfer Distance 从 7.88 cm 降到 5.65 cm,但仍未达到使用完整三维监督的 DualPM 的 4.30 cm。

BRepFacetGen: Reverse Engineering B-Reps By Generative Face Segmentation

针对传统 CAD 逆向工程中点云确定性分割带来的拓扑不稳定性与多义性问题,BRepFacetGen 提出将 CAD 面分解表述为以连续连续几何潜在变量为条件的生成式潜在变量建模任务,利用预训练 3D 基础模型与流匹配联合生成连续网格及密集面标签,大幅提升了下游 B-Rep 重建的几何与拓扑精度。

Bridge-UniPS: Bridging Calibrated Photometric Stereo toward Universal Photometric Stereo

Bridge-UniPS 提出了一种将泛日光度立体(UniPS)桥接到校准光度立体(CPS)的新范式,通过可学习的光照适配器将任意未知光照图像转化为 CPS 兼容的桥接图像-光照对,并在无中间监督下借助冻结的预训练 CPS 网络反传梯度,实现了物理可解释且高精度的表面法线估计。

CascadeProto: Cascaded Cross-Modal Prototype Purification via Entropy-Aware Learning for Few-Shot 3D Point Cloud Segmentation

针对少样本点云分割中初始原型受背景噪声污染及缺乏语义信息的问题,CascadeProto 提出级联熵感知提纯与解耦跨模态对齐网络,无需预训练即在 S3DIS 和 ScanNet 上刷新 SOTA 表现。

CAST3D: Customizing Arbitrary 2D Assets into 3D World

CAST3D 提出了一个无需训练的定制化 3D 组合生成框架,通过 3D 布局推断与随机轨迹调控,将任意多张 2D 资产图像在文本引导下融合成几何自洽且忠实于原图外观的连贯 3D 对象。

Category-Level Articulated Object Pose Estimation via Pose–Shape Hypothesis Generation and Verification

针对单视点下严重遮挡与深度噪声引发的铰接物体位姿歧义问题,本文提出生成-验证框架,通过标准化流联合生成内在耦合的位姿-形状假设对,结合部件级观测点云去噪,并利用基底关节锚定与连续符号距离函数(SDF)进行跨空间几何一致性打分剪枝,在真实遮挡场景下显著超越现有单视点与序列跟踪基线。

Closing the Capacity–Convergence Gap: Globally Optimal Configuration of Implicit Neural Representations

将隐式神经表示(INR)的层级激活函数、初始化尺度及学习率联合配置重构为混合变量全局优化问题,利用混合核高斯过程与经验期望提升进行贝叶斯搜索,有效弥合了容量与收敛的权衡鸿沟。

Consistent Monocular Depth Estimation with Contact Region Boundary-Aware Refinement

针对单目深度估计在物体接触区域普遍存在虚假深度跳跃的瓶颈,本文提出一种接触边界感知的深度估计与优化框架,通过视觉语言语义过滤提取物理接触边界先验,并将其多尺度融合进深度解码器辅以多阶几何约束,在仅使用 4000 张合成图像微调下显著消除接触面深度断层并支持可控交互修正。

Controllable Generative Reference for Stereo Image Compression via Reliability-Aware Gating

针对传统双目图像压缩在视场外(OOV)区域匹配失效与强量化伪影传递的瓶颈,提出利用预训练扩散模型并结合联合语义-空间控制合成高质量目标视点参考,再通过可靠性感知门控自适应调节熵模型信息流,实现了显著超越现有 SOTA 的率失真性能。

Cube-Splat: High-Fidelity 360° Gaussian Splatting SLAM via Cubemap Factorization and Adjoint-Consistent Optimization

针对传统针孔高斯泼溅 SLAM 视场狭窄、漂移严重及非前向视角空洞的问题,Cube-Splat 将 360° 全景帧解耦为共享光心的四面固定姿态虚拟针孔立方体图,通过李代数伴随映射汇聚多面光度梯度联合更新单一相机位姿,实现了大范围室内外场景高精度、无盲区的全景密集 3DGS-SLAM。

DA-F2F: Domain-Adaptive Object Detection with Feature-to-Feature Modulation and Alignment

针对传统图像级风格迁移在域自适应目标检测(DAOD)中计算开销大、易引入伪影及伪标签不稳定等缺陷,本文提出 DA-F2F,在潜空间中利用目标域风格统计量动态调制源域特征(SFM),并结合前景/背景软加权提议对抗对齐(SPA),实现了高效稳定的特征级跨域对齐与 SOTA 检测精度。

DASAM3D: A Unified Foundation Model for Enhanced 3D Scene Reconstruction and Segmentation

DASAM3D 将 SAM 3D 的高质量单物体高斯先验作为 3D 几何布局约束,在不微调基座模型权重的前提下,通过三阶段可微优化机制对齐并精细化 Depth Anything 3 (DA3) 的全景高斯几何,同时冻结颜色参数以完整保留其照片级渲染质感。

Detect by Track: Making Detector-Free Matcher Trackable

针对无检测器特征匹配器隐式关键点选取导致多视角轨迹断裂的核心痛点,本文提出 Detect-by-Tracking (DeT) 机制,通过伪轨迹与双线性采样操控局部相似度矩阵,使无检测器匹配器在无需重新训练的前提下直接输出亚像素级连续轨迹。

DeWorldSG: Depth-Aware 3D Semantic Scene Graph Generation via World-Model Priors

DeWorldSG 提出一种从 RGB-D 序列生成时空鲁棒 3D 语义场景图(SSG)的框架:用 SAM 掩码引导的双域深度过滤为每个物体估计实例级概率 3D 高斯分布,再通过 V-JEPA 2 世界模型积累跨帧关系证据并以不确定性感知融合精炼谓词边,在 3DSSG 上关系召回率提升 77.4%、谓词召回率提升 23.2%。

DINOv3D: 2D-3D Joint Optimization for Unified Spatial Understanding

DINOv3D 提出了一种基于 DINOv3 的同源师生联合优化框架,通过冻结教师模型构建 3D 高斯正则化场锚定原生 2D 视觉先验,同时利用双记忆移位窗口注意力与光线-深度-语义几何对齐机制使 LoRA 学生模型吸收长程多视角 3D 一致性,仅以 10% 可训参数量在 3D 统一场景理解上刷新 SOTA 并反哺 2D 几何感知能力。

DiTex4D: Direct Text-Driven 4D Generation with Structured Latent Diffusion

DiTex4D 基于 3D 基础模型 TRELLIS 构建了直接文本驱动的 4D 结构化隐式扩散框架,通过混合 4D RoPE 与空间键控相关噪声注入消除视频中介和两阶段累积误差,原生支持从头生成 4D 内容与掩码引导的静态网格动画。

DLGStream: Dynamic Language-embedded Gaussian Splatting for Open-vocabulary Enabled Free-viewpoint Video Streaming

DLGStream 提出双透明度语言高斯表示和基于时间特征插值的变形场,在对多视角动态场景进行高质量自由视角视频重建的同时嵌入可流式传输的时空语言特征,以平均 43 KB 的帧大小实现实时 4D 开放词汇查询和帧插值。

Don’t Mask Out the Background! Natural-Light Photometric Stereo via Illumination Reconstruction

针对未标定自然光光度立体(NaPS)中环境光未知的强病态性,本文摒弃将背景扣除的传统做法,利用刚性绑定的相机-物体在多姿态移动中采集的背景观测,通过两阶段 3D 高斯泼溅(3DGS)显式重建连续保距的近场空间光照场,进而利用基于路径追踪的逆向渲染联合优化表面法线、Disney BRDF 材质与深度,在复杂室内近场光照下实现了高精度几何与材质解耦。

Don’t Starve the Boundaries: Boundary-Constrained Label Propagation for Weakly Supervised 3D Segmentation

针对弱监督三维点云语义分割中边界区域缺乏有效监督导致的“边界饥饿”难题,本文提出 Bound3D 框架,通过多模态几何线索投影构建3D边界、施加流形约束与最远角采样的伪标签传播,并结合位置感知分治监督机制,在无需外部大模型与昂贵标注的前提下显著提升了点云边界划分精度与整体分割性能。

DPGS: A Diffusion-Prior Guided Framework for Large-Scale 3D Gaussian Splatting Reconstruction

针对高空单一下视航拍数据中立面观测缺失、弱纹理几何坍塌以及并行训练负载失衡三大瓶颈,DPGS 协同视觉基础模型稠密初始化、视见负载自适应图划分与参考视角调优的扩散生成先验,实现了几何完整且高保真的大尺度 3DGS 重建。

DualResPS: Dual-Resolution Photometric Stereo Using a Frame-Event Hybrid Camera

提出首个基于帧-事件混合相机系统的双分辨率光度立体视觉框架 DualResPS,通过连续旋转单光源下的极稀疏长曝光帧与高时间分辨率事件流协同,结合隐式神经反渲染与显式阴影/高光解耦,仅用常规方案 18.1% 的数据带宽即实现了高分辨率、高质量的表面法向重建。

EGGS: Explicitly Granular 3D Gaussian Splatting via Luma-Aware and Volume-Preserving Attribute Factorization

针对 3DGS 显式属性存储极度膨胀的痛点,EGGS 提出基于亮度的球谐 DC 压缩与保体积尺度因子分解,将每个高斯显式属性降至极简维度(最低仅 9 维),配合轻量全局 MLP 隐式估计重建,将场景存储压缩至数兆字节并保持超过 140 FPS 的高质量实时渲染。

EgoSim: Egocentric World Simulator for Embodiment Interaction Generation

EgoSim 提出了一种闭环第一人称世界模拟器,通过将 3D 环境表征为可更新的点云世界状态,结合几何与动作感知的视频扩散模型和交互感知状态更新模块,实现了空间一致且支持跨本体迁移的连续具身交互视频生成。

EPO: Boosting 3D Foundation Models with Edge-based Pose Optimization

提出EPO,一种无需显式特征track的几何优化框架,利用Canny边缘图和距离变换场构造可微的边缘重投影损失,通过两阶段自适应优化精化3D基础模型输出的相机参数和深度,在消费级GPU上以秒级运行时间达到甚至超越传统BA方法的几何精度。

ETCH-X: Robustify Expressive Body Fitting to Clothed Humans with Composable Synthetic Data

ETCH-X 提出“先脱衣后稠密拟合”的两阶段解耦范式,结合局部 SE(3) 等变紧致度向量预测与隐式稠密神经场,并在可组合合成数据(CLOTH3D 模拟服装、AMASS 大规模动作与 InterHand2.6M 手势)上分别缩放训练,实现了对多变服装、复杂姿态与单视点残缺扫描的高鲁棒、高表现力 SMPL-X 人体拟合。

EventSpecPS: Photometric Stereo with Multispectral Reflectance Using an Event Camera

提出首个基于事件相机的单阶段多光谱光度立体系统 EventSpecPS,通过光谱-角度多路复用光源与恒定白光偏置破除几何与反射率耦合及尺度歧义,实现低带宽、抗阴影高光的物体法向量与绝对多光谱反射率联合重建。

Fast Spatial Memory with Scalable Elastic Test-Time Training

针对大块测试时训练(LaCT)在长时序4D动态场景中完全可塑导致的快权重漂移与过拟合难题,本文提出弹性测试时训练(LaCET),引入基于费舍尔信息量加权与滑动平均锚点的弹性正则,构建了兼顾高吞吐与多块时序稳定性的可扩展4D空间记忆模型 FSM。

FFAvatar: Feed-Forward 4D Head Avatar Reconstruction from Arbitrary Images

FFAvatar 提出了一种基于 Transformer 与 3D 高斯泼溅的前馈 4D 头部头像增量重建框架,通过交替注意力解耦身份与视角/表情、结合“稀疏顶点到稠密 UV”的分层跨模态对齐以及运动感知细化模块,实现了从单张或多张任意人像快速生成高保真、可驱动且身份一致的动态头像。

Flash-Refine: Frustum-Guided Local Incremental Learning for Efficient 3D Gaussian Splatting Completion

针对静态 3D 高斯泼溅 (3DGS) 资产的局部缺损与模糊问题,提出基于原位优化的轻量级增量补全框架 Flash-Refine,通过多视角共识掩码与自适应深度先验界定局部活动区并锁定背景梯度,在完全无需历史训练图像的条件下,仅用 2~4 分钟即可实现高质量几何修复并防止背景灾难性遗忘。

F⁴Splat: Feed-Forward Predictive Densification for Feed-Forward 3D Gaussian Splatting

针对前馈 3D 高斯泼溅中固定像素/体素分配导致的基元冗余与缺乏预算控制问题,F⁴Splat 提出了以前馈预测稠密化分数为导向的自适应分配框架,无需重新训练即可根据几何复杂度与视点重叠显式控制高斯数量,在基元数减少 70% 以上的同时实现优于先验无标定方法的渲染质量。

G2FM: A Geodesic Flow Matching Framework with Geometric Prior for Category-Level 9-DoF Pose Estimation

针对扩散模型在类别级 9-DoF 姿态估计中推理缓慢且欧氏插值破坏旋转正交性的难题,本文提出了基于连续测地流匹配的 G2FM 框架,通过在 \(SO(3) \times \mathbb{R}^3 \times \mathbb{R}^3\) 乘积流形上沿测地线传输旋转并引入免重训倒角距离切空间几何引导,仅需 3 步 ODE 求解即可达到 31.5 FPS 的实时高精度姿态估计。

Geometric Context Transformer for Streaming 3D Reconstruction

GCT 借鉴经典 SLAM 的三层空间上下文分解思想,提出几何上下文注意力(GCA),解耦出锚点上下文、局部姿态参考窗口与轻量轨迹记忆,将流式重建单帧 token 膨胀率降低约 80 倍,在 H800 上以 20 FPS 稳定运行超长视频序列并大幅超越现有流式与优化方法。

Geometric Distillation from Rectified Stereo: Leveraging Epipolar Cues for Monocular Depth Estimation

针对多视角基础模型在单目推理时跨视角注意力退化导致尺度先验丢失的问题,提出 EpiDistill 框架,通过深度引导极线注意力与校正立体 Token 将多视角极线几何与度量尺度先验显式蒸馏到单视角 Transformer 中,大幅提升零样本绝对尺度估计能力。

Geometric Probing for Isotropic Optimization Manifold in Sparse-View 3D Gaussian Splatting

针对稀疏视角下3DGS损失曲面高度各向异性导致的浮斑与退化问题,StableGS在无外部先验监督下,通过基于Hessian曲率的属性空间探测与临界视点一致性约束,重塑各向同性优化流形,在LLFF、DTU和Mip-NeRF360上取得SOTA。

Geometry-Propagated Gaussian Splatting for Aerial Sparse Novel View Synthesis

针对航拍稀疏视点下 SfM 特征匹配崩溃与大面积未观测盲区两大瓶颈,GeoProp-GS 提出深度引导几何初始化与锚点约束高斯优化,通过分层深度对齐与视点增广补全几何,并利用锚点-残差解耦将可靠几何传播至弱监督区域,在仅 3 个航拍视点下实现 SOTA 新视角合成。

GlassGS: Geometry and Concept-Aware 3D Gaussian Splatting for Reflective Enclosures

针对博物馆等玻璃展柜中强镜面反射破坏多视角一致性的难题,GlassGS 提出几何一致性感知与无反射概念学习双阶段迭代框架,结合自建首个玻璃展柜基准数据集,实现了无伪影的高保真 3D 高斯重建。

GraphCPD: Coherent Point Drift for Point Cloud Registration via Graph Signal Processing

GraphCPD 将图信号处理(GSP)引入相干点漂移(CPD)概率配准框架,通过高通滤波提取具有刚体变换不变性的高频几何分量构建 9 维图信号,以局部图拉普拉斯替代传统高斯混合模型(GMM)的各向同性协方差,并借助高频几何特征构建匹配先验,在大规模点云与高噪声、部分重叠场景下兼顾了极高的配准精度与运行效率。

GRF-Recon: Global Ray-Field Optimization for Long-Sequence Feed-forward Reconstruction

GRF-Recon 针对免标定单目长视频三维重建中累积漂移严重和显存爆炸的痛点,结合重归一化 LoRA 几何先验蒸馏与混合权重稀疏光线场全局因子图联合优化,在 24GB 消费级显卡上实现了公里级大场景低漂移、全局一致的高保真重建。

HHA: Hierarchical Hyperbolic Constraints for Imperceptible Point Cloud Attacks

HHA 将 3D 点云沿几何与语义双重轴线分解为多尺度子结构并映射至庞加莱双曲空间,通过双曲局部正则项保持多层级结构一致性,在维持近 100% 攻击成功率的同时大幅降低形变感知度。

Holo-Captioning: A Comprehensive Textual View of 3D Scenes

本文提出面向三维场景“文本等价物”的 Holo-Captioning 新任务,通过解耦式 3D-LLM 架构 HoloScribe 在纯文本形态下端到端联合预测实体类别、三维空间包围盒、细粒度属性与实体间双向关系,并在 1.5 万场景的自建基准 HoloScan 上达到 SOTA。

Identity-Preserving Human Reconstruction from a Single Image via 3D Token Inference

本文提出身份保持的大型人体三维重建模型(IPRM),通过在基于 SMPL 的稀疏体素空间中利用基于可见性的交叉注意力显式冻结可见身份 token 并推断不可见区域,结合 3D 身份分支引导的 3D ID Adapter 消除解码漂移,在约 0.6 秒的前馈推理中实现了高几何保真度与强身份一致性的 3DGS 和 Mesh 重建。

IndoorSplat: Enhanced Indoor Scene Reconstruction with Structured 2D Gaussian Splatting

针对室内大面积无纹理区域、几何歧义及传统SfM稀疏初始化导致的表面重建残缺问题,IndoorSplat基于2D高斯泼溅提出前馈模型与单目先验对齐的密集初始化、按活跃状态自适应分裂的时序致密化策略以及平滑L1不透明度正则与几何先验联合约束,在ScanNet/ScanNet++上大幅刷新室内表面几何重建指标。

InSeg: Interactive Refinement via Intent Propagation for Point Cloud Semantic Segmentation

针对点云语义分割在单场景部署中因单点监督导致的“局部修正陷阱”,InSeg 将用户稀疏修正点击建模为区域意图种子,利用特征亲和度、空间连通性与实例先验构建去噪的三重掩码意图一致区域并生成虚拟点击,结合交互感知熵正则与历史回放实现稳定高效的在线微调。

Instance Segmentation as Tracking: A New Paradigm for Multi-Small-Object Tracking with Event Cameras

针对传统事件相机多小目标跟踪中“先转帧再检后跟”造成的微秒级时序离散化与背景冗余,本文提出将跟踪重构为3D时空点云实例分割的新范式,结合3D稀疏卷积与基于几何一致性的图关联网络 Ev-ISNet,在保留事件原生高时序分辨率的同时实现高效流式在线跟踪。

InstantHDR: Single-forward Gaussian Splatting for High Dynamic Range 3D Reconstruction

针对多曝光低动态范围图像在极端光照下无法直接前馈重建高动态范围 3D 场景的问题,InstantHDR 提出首个单次前向高动态范围 3D 高斯泼溅架构,复用冻结几何分支的跨视角注意力引导辐照度融合,配合元网络预测场景自适应色调映射,仅需数秒即可完成可控曝光的 3D HDR 初始化。

InstGS: Shared-Template Gaussian Instancing for Object-Redundancy-Free Rendering

InstGS 首次将图形学实例化渲染机制引入 3D 高斯泼溅,通过梯度驱动的跨视点实例分割构建共享高斯几何模板,结合可学习的逐实例位置、颜色与不透明度轻量偏移及可微光栅化器,在几乎不损失保真度的前提下大幅消除重复物体的显存冗余并显著提升渲染帧率。

KineticGS: Momentum-driven Coherent 4D Gaussian Splatting for Monocular Dynamic Scene Reconstruction

针对单目动态场景重建中由于缺乏物理先验导致的运动轨迹断裂与非物理形变,KineticGS 将高斯图元建模为承载动量的粒子,构建起“动量引导采样-可学习能量流激活-整体动能同步”的分层物理约束体系,在动态目标区域实现了超越现有方案 +0.91 dB PSNR 的高质量一致性重建。

Large-Scale Light Field Synthesis from Videos Enables Geometrically Consistent Bokeh Editing

针对传统散景编辑受限于单目深度估计误差在镜面反射和精细遮挡处崩溃的问题,本文提出了 Vid2Bokeh 数据获取管线,利用前馈 3D 重建从普通视频直接合成密集 25×25 光场以绕过深度估计,构建包含超 10 万场景的高几何保真散景数据集,并基于此训练扩散模型实现了对复杂几何体鲁棒的双向对焦与景深编辑。

Latent Fusion: Decoding Consolidated 3D Geometry from Feed-forward Geometry Transformer Latents

本文提出 Fus3D,抛弃了传统几何变换器“逐图预测再后验融合”的范式,直接利用可学习规范化体素查询从前馈几何变换器(VGGT)的中间多视角隐空间中交替 cross/self-attention 聚合 3D 几何特征并回归稠密 SDF,实现了无需位姿、无累积噪声且未观测面几何补全优异的单次前馈重建。

Learning Generatable Mutual Distance for Scene-Aware Human Motion Generation

针对相互距离在随机动作生成中因缺少绝对坐标参考而产生的歧义性,本文提出两阶段扩散框架 MDNet,引入大语言视觉模型(VLM)推理语义空间锚点消除几何歧义,并在频域中建模平滑互距轨迹以引导物理真实且时序连贯的场景人体动作生成。

Learning Geometry-Aware Embedding Fields for Intrinsic Riemannian Mappings

针对非流形与含噪离散点云上黎曼测地映射求解困难的问题,提出了一种学习连续几何嵌入场的方法,通过稀疏八叉树卷积与三平面超调制解码,以单次前向推理高效预测指数映射与对数映射。

LESV:Language Embedded Sparse Voxel Fusion for Open-Vocabulary 3D Scene Understanding

针对 3D 高斯泼溅在开放词表场景理解中空间重叠模糊与多层级语义计算开销大的瓶颈,LESV 基于显式稀疏体素与 AM-RADIO 聚集型基座模型构建确定性置信度门控融合框架,大幅削减预处理开销并在点云开放词表分割上取得 SOTA。

LiteGS: a high-performance framework to train 3dgs in subminutes via system and algorithm codesign

LiteGS 针对传统 3DGS 训练中原子累加冲突、无序内存布局以及启发式致密化模糊的三重系统瓶颈,提出 Warp 级光栅化、Cluster-Cull-Compact 内存流水线与不透明度梯度方差指导的致密化机制,在 RTX 3090 上实现亚分钟级(47~67秒)极速收敛,并在高质量模式下较 3DGS-MCMC 提速 10~18 倍且仅需三分之一高斯参数量。

LOOM: Weaving Geometry-Consistent Human-Object Interaction Videos via Progressive Curriculum Learning

针对人-物交互视频生成中多视角几何一致性差与重度依赖精细手部网格标注的双重瓶颈,ByteLOOM 提出 RCM-cache 机制将复杂新视角合成降维为空间纹理查找,并结合三阶段渐进式课程学习,在仅依赖简易 2D 骨架的条件下合成几何高度保真的 6-DoF 人-物交互视频。

LumiDepth: Stable Monocular Depth in Multi-Illumination Scenes

针对真实多光源与变照度场景下深度估计严重失真的难题,LumiDepth 提出在免目标域真值深度的设定下,利用分歧校准概率伪监督(DCPS)与频域解耦一致性蒸馏(FaCD)从同场景多光照 RGB 图像组中自监督学习光照不变且保几何细节的单目深度。

LVSPM: Long Sequence View Synthesis and Pose Estimation Model

LVSPM 提出了一种基于大块测试时训练(LaCT)与可学习相机标记的前向序列预测模型,仅依赖 RGB 渲染与相机位姿监督,在无需稠密 3D 点云真值的前提下,实现了支持多达 256 张未标定长序列图像的高精度位姿估计与高质量实时新视角合成。

MagnetGS-Mesh: High-Quality Multi-Object Mesh Reconstruction via Adaptive Surface Optimization

针对 3DGS 场景解耦重建中离群高斯漂移与表面密度不均导致的网格空洞问题,MagnetGS-Mesh 提出增强占据率学习与自适应局部法向量一致性损失,像磁铁般将离群高斯吸附重定位至稀疏表面区域,实现了高保真、低存储开销的解耦物体网格重建。

Manifold-Aware Spectral Compaction: A Graph Signal Processing Perspective on Online Gaussian Reduction for 3DGS SLAM

本文提出面向在线 3DGS SLAM 的流形感知谱紧凑化框架(MASC),从图信号处理(GSP)与黎曼流形视角将地图压缩重构为连续信号重建问题,结合对称 KL 散度建图、增量 Nyström 谱聚类与保矩 Bures-Wasserstein 质心聚合,在消除约 60% 冗余高斯的同时使 GPU 显存降低至原来的 1/2.8、渲染帧率提升 2.4 倍,并在 TUM 数据集上实现 0.98 cm 的轨迹跟踪精度。

MindBlock: Probing Spatial Assembly and Structure in Unified Multimodal Models

针对统一多模态模型空间推理局限于被动 2D 问答的缺陷,本文提出首个以像素级主动构建为核心的评测基准 MindBlock,并设计基于 3D 高斯泼溅的 3DGS-Eval 体积几何一致性评测协议,揭示了当前模型存在的 2D-3D 一致性脱节、多步空间漂移与感知-执行鸿沟。

Minute4D: Training High-Fidelity 4D Gaussian Splatting in One Minute

针对非受限单目视频动态三维重建中相机与物体运动耦合、视角覆盖匮乏及优化极其缓慢的痛点,Minute4D 结合基础模型驱动的分割追踪几何补全与多视角光度误差引导的 4D 高斯自适应密度控制,将 4D 高斯泼溅优化耗时压缩至约 40 秒(提速超 5 倍),并在渲染保真度与显存开销上刷新 SOTA。

MoBa-GS: Learning a Spatially-Varying Motion Basis over a Dynamic Canonical Space for 4D Reconstruction

MoBa-GS 通过提出由时间基底转向空间变化运动基底的结构倒置范式,将 4D 高斯形变解耦为低频动态规范空间与局部空间运动基底的稀疏线性组合,在无需 SfM 点云先验与随机初始化条件下实现了高保真非刚性 4D 重建,并借助时间不变缓存达成超过 163 FPS 的实时渲染与 16 倍以上的训练加速。

Modeling and Compensating Phase Error in High-speed 3D Reconstruction

论文揭示了误差扩散抖动算法中扩散方向与条纹结构耦合导致系统性相位偏差的数学机理,推导出相位误差与步数和离焦量无关的不变性模型,并提出利用正反向 Floyd-Steinberg 核配对编码的误差扩散融合(EDF)策略,在零计算开销下降低了 23.77% 的三维重建 RMSE。

MotionEditGS: Editing Motion and Appearance of 4D Scenes from Monocular Video via Semantically Anchored Gaussians

针对单目视频重建动态 3D 场景缺乏多视角约束、现有编辑方法局限于外观修改且几何易崩溃的难题,MotionEditGS 结合视频扩散模型先验,提出语义特征引导重建、冻结语义的语义锚定编辑以及梯度驱动的特征提升机制,实现了具备高时空一致性与真实几何形变的动作与外观复合编辑。

MotionSplicer: Part-Based Motion Editing for 4D Volumetric Videos

针对 4D 高斯体积视频中多物体与非刚性部件无法交互编辑的难题,MotionSplicer 提出了一种无需模板与人工标注的局部动作编辑框架,通过时序差分图像驱动的 2D 提示传播与 3D 合并分裂算法自适应发现运动部件,并结合时不变哈希特征网格与流式时序一致性重估实现时空连贯的高斯蒙皮绑定与自由动作解耦重组。

MuCHeR: Multi-Person Camera-Centric Human Detection, Mesh Recovery and Tracking

MuCHeR(Multi-HMR 2)提出了一个简单且鲁棒的单阶段 DETR 多人三维人体检测、网格恢复与跟踪框架,通过仅基于 2D 位置的二分图匹配实现轻量级高效训练并吸纳纯 2D 监督,结合垂直视场角预测在无真实相机内参下实现高精度相机坐标系绝对度量定位,并通过蒸馏 SAM2 记忆特征实现无需视频数据训练的在线人体网格跟踪。

Multi-view Multi-vehicle Driving Dataset for Novel View Synthesis

针对自动驾驶场景中新视角合成评测仅依赖单轨迹插值的严峻瓶颈,本文构建了首个由汽车、两轮电瓶车及无人机同步采集的多车跨视角真实驾驶数据集 MV2,通过高精度对齐与基于极线一致性的位姿验证,构建了跨轨迹与空地视角的严苛基准,实验证明现有优化型和前馈型 NVS 方法在基线变大时均出现灾难性性能退化。

NanoGS: Training-Free and Lightweight Gaussian Splat Simplification

NanoGS 提出了一个免训练、高效率的 3D 高斯泼溅简化框架,通过构建空间稀疏 KNN 邻域合并图、基于 I-Divergence 评估局部两高斯混合分布的逼近代价,并借助保质量矩匹配(MPMM)闭式合并高斯基元,在无需渲染反向传播和多视角图像监督的条件下实现高达 1000 倍的极端图元化简。

NeLU3D: Neural Inverse Structured Light without Modeling the Projector

NeLU3D 提出一种无需对投影仪进行显式几何与辐射度标定的神经逆结构光重建方法,通过将单次标定的 3D 空间到投影模式颜色的映射固化为多分辨率哈希编码 MLP,并结合神经隐式表面体渲染与有界环境光解耦,仅用 3 幅单色非精确设计模式加 1 幅白光闪光图即可达到亚毫米级三维重建精度。

NEOMAP: Novel-View Synthesis via Noise Initialization by Manifold Alternating Projection

针对单图与单目视频新视角合成中视角不对齐与生成伪影并存的难题,NeoMap 提出直接在预训练视频生成模型的数据流形中寻找最优解,通过流形交替投影迭代优化初始高斯噪声,在无需额外训练和生成引导的情况下实现了高保真且视角一致的新视角视频合成。

NeuralGarSim: Geometry-agnostic Garment Simulation with Neural Fields

针对传统网格仿真分辨率敏感以及前序神经仿真器强依赖二维参数化平面的瓶颈,NeuralGarSim 首次借助切向微分算子(TDC)在三维欧几里得空间直接构建非线性 Kirchhoff–Love 薄壳模型,实现了无缝兼容多裁片复杂拓扑及网格、UDF、点云、3D高斯等多模态几何输入的无参数化准静态布料神经仿真。

Nexels: Neurally-Textured Surfels for Real-Time Novel View Synthesis with Sparse Primitives

针对 3D 高斯泼溅为表示高频纹理而导致基元爆炸的问题,Nexels 将几何与外观解耦,采用可变形为硬质矩形的可微面元表达表面,并由全局 Instant-NGP 神经场通过双通道光栅化为每条像素光线仅查询权重前 \(K\) 个相交基元赋予高频纹理,以低显存占用与稀疏基元实现 50 FPS 的实时渲染与出色的感知质量。

Novel View Synthesis as Video Completion

FrameCrafter 将稀疏新视角合成重构成低帧率视频补全任务,通过单视角独立 VAE 编码、目标视角中心普吕克射线条件注入以及剥离时序 RoPE,将预训练视频扩散模型转化为严格置换不变的多视角生成器,仅用 1K 场景微调即超越在海量多视角数据上训练的图像扩散基线。

ObjectForesight: Predicting 3D Object Trajectories from Human Videos

ObjectForesight 是一个物体中心的 3D 前向动力学模型,通过自动化八阶段管线从自中心日常交互视频中提炼出逾 200 万条高质量 6-DoF 轨迹,结合 3D 点云几何编码器与扩散 Transformer(DiT),实现了从无显式动作标签的人类被动视觉观测中预测物体物理自洽的 3D 运动轨迹。

OCA: ODE-Driven Cross-Attention for Image-to-Point-Cloud Registration

本文针对图像到点云(I2P)配准中跨模态差异引起的注意力模糊难题,将交叉注意力建模为连续时序上的分配常微分方程(Assignment ODEs),通过分析动力系统收敛条件提出即插即用、无参数的 OCA 模块,在几乎不增加耗时的情况下显著增强 2D-3D 特征判别力与配准召回率。

OmniLife360: A Benchmark for 3D Reconstruction from In-the-Wild 360° Captures

针对消费级 360° 全景相机在真实野外长轨迹拍摄中相机剧烈抖动与动态干扰严重的挑战,本文构建了首个包含 2407 条 4K 分钟级野外序列的大规模基准 OmniLife360,并提出了首个专为球面全景视频设计的 4D 高斯泼溅框架 Omni4DGS。

OmniRen: Neural Rendering wih Heterogeneous Scene Primitives

针对传统神经渲染难以扩展至复杂场景图元与大规模几何图元的问题,RenderFormer-V2(OmniRen)提出结合希尔伯特曲线空间重排的局部滑动窗口与融合物理语义的渲染注意力汇聚(Attention Sinks)机制,配合独立于解析反射模型的连续神经材质隐空间与异构图元嵌入,实现了免针对单场景微调的高保真全局光照前向渲染。

One-Shot Feed-Forward 360° Animatable Avatar via Inpainted UV-Space Gaussian Modeling

提出前向单张图像 360° 可驱动全头 3D 高斯头像重建框架 FHAvatar,通过预训练 3D GAN 提取全局全头先验,并在参数化人脸模型的对称 UV 空间中补全局部高分辨率外观特征,实现 246 FPS 的高保真自由视角动态头像驱动。

Online 3D Instance Segmentation at task-oriented granularity with Unposed Monocular Video

针对具身智能在无位姿单目视频下的在线感知需求,提出一种任务导向的 3D 实例分割系统,复用 MASt3R-SLAM 前馈密集像素对应构建几何关联度与帧内互斥约束,通过置信度优先聚类实现无需深度传感器与离线先验的实时 3D 实例解耦。

Optimizing Mesh Animation from Video via Shape Flow Guidance

针对单目视频驱动网格动画严重依赖2D重构损失导致的几何塌陷与运动伪影,提出形状流引导(Shape Flow Guidance)机制,通过免训练干预预训练网格生成器的采样轨迹提取时序一致的3D形状序列,并结合解耦局部形变与全局位姿的骨骼动画模型实现高质量4D网格优化。

ORACLE-3D: Open-world Region-aligned Cross-modal Learning for Label-efficient 3D Scene Understanding

ORACLE-3D 提出以图像为语义桥梁的统一多模态对比学习框架,通过双层跨模态知识蒸馏与视点匹配模块动态修正 2D-3D 投影误差,摆脱昂贵的点云-文本数据对构建,在完全不依赖 3D 标注或仅依赖基类标注下大幅刷新开放词表 3D 分割 SOTA。

OREO: Fidelity Alignment in 3D Generation via On-the-fly Rendering-Editing Optimization

OREO 提出了一种在线“渲染-编辑-优化”的 3D 生成保真度对齐框架,利用无反演的强化编辑动态构建保结构的高真实感 2D 伪真实值,并通过潜在空间对比蒸馏将细节增益直接注入 3D 生成器,显著提升了前馈 3D 资产的视觉质感与微观纹理。

PaD-GS: Leveraging Distortion Map for Panoramic Gaussian Splatting

PaD-GS 针对全景等矩形投影(ERP)固有几何畸变导致的伪影与几何模糊,构建了基于极角的畸变图,并提出结合全局特征解码与局部不透明度自适应调制的双阶机制,实现了显著优于已有方案的全景新视角合成质量。

Parametric SDF for Dynamic Surface Reconstruction

将静态有向距离场拓展为时间相关的多项式与傅里叶混合参数化轨迹,结合可微等值面提取与可微PBR渲染管线,实现了大尺度非刚性形变与拓扑变化下高保真动态网格的端到端重建。

PDF-Omni: Poincaré Dual Disk Distortion Field-based Recurrent Update for Omnidirectional Stereo Matching

针对多目鱼眼全向立体匹配在拼缝过渡区因严重边缘径向畸变与视角模糊导致的匹配失效,本文构建庞加莱双圆盘测地畸变场来度量连续几何不确定性,驱动畸变感知注意力与非均匀感受野 GRU 迭代优化,并设计局部熵累积损失自适应监督模糊代价分布,实现全向深度估计在拼缝区与全局的高精度重建。

Penetration-Free Compositional 3D Generation via Gaussian Surface Offset

针对组合式文本到 3D 场景生成中物体间严重几何重叠与物理穿透问题,CompSAG 提出利用轻量隐式代理表面计算法向排斥力以驱动 3D 高斯离散基元产生表面偏移,并结合关系感知分数蒸馏与法向对齐矫正,实现了几何无穿透、外观高保真的多物体场景生成。

PhysConvex: Physics-Informed Dynamic Convex Fields for Reconstruction and Simulation

本文提出将动态凸包(Dynamic Convex)同时作为可微渲染图元、形变载体与物理积分支撑的统一表征 PhysConvex,结合边界驱动动力学与无网格神经蒙皮降阶仿真,实现了可泛化且高效的形变物体视频重建与物理系统辨识。

Physically Grounded Dual-Opacity Gaussian Splatting for Joint RGB-TIR Reconstruction

提出 RaViGS 框架,通过共享几何骨架下的辐射物理属性参数化与光谱解耦的双重不透明度渲染,彻底解决了可见光与热红外(RGB-TIR)联合 3DGS 重建中的辐射机理错配和跨模态视线遮挡冲突。

Point Diffusion Mamba: Unified Diffusion-State-Space Modeling for Single-View 3D Reconstruction under Data Scarcity

针对低数据量下单视角 3D 重建中多义性严重且传统注意力开销巨大的瓶颈,本文提出融合局部几何聚合与双向 Mamba 的扩散状态空间架构 PDM,配合分层特征融合网络与动态加权采样,在极低显存与计算开销下实现了高精度点云重建。

PointGT: Simultaneous Geometric and Textural Editing for Point-Based Representations

PointGT 基于邻近注意力点渲染(PAPR)与无显式法线的神经 UV 映射,通过几何正则化与形变感知规范对应机制,实现了点云神经表征下几何形变与高分辨率纹理的同时解耦编辑,且纹理在非刚性变形下稳定不漂移。

PoseShield: Neural Collision Fields for Human Self-Collision Resolution

PoseShield 在 SMPL 姿态空间内学习一个带 Eikonal 正则化的神经碰撞场(近似姿态空间 SDF),将其作为可微约束函数嵌入 SLSQP 等梯度约束优化器中,实现从自穿透姿态到最近无碰撞姿态的后处理修正;该方法无需重训下游运动生成模型即可扩展到运动序列碰撞修正,在自建 HwC 数据集上达到 95.8% 的成功率,远超 COAP(44.6%)。

PrimitiveUDF: Primitive-Based Unsigned Distance Fields for Surface Reconstruction from Point Clouds

针对无符号距离场在多层紧密重叠表面混淆临近点的问题,本文通过视点引导的球面与切平面局部图表重组欧氏近邻,并构建各向异性的三角形与线段混合图元,为无符号标量距离回归提供显式的表面拓扑归纳偏置。

PriSplat: Propagating Reliable Multi-view Information for Distractor-Free 3DGS

PriSplat 改变了无干扰物 3DGS 仅依靠掩码清零丢弃监督信号的传统范式,通过几何感知支持视角选择与掩码感知快速权重更新,将大规模新视角合成先验改造为 3D 修复谐波器,为被遮挡背景合成具备几何一致性的伪真实标签,在 On-the-go 基准上取得了 23.11 dB PSNR 的全场景最优去伪影重建质量。

Progressive and Localized Super-Resolution of 3D Objects via Localized Latent Voxel Diffusion

针对现有 3D 扩散生成模型受限于固定体素分辨率与显存三次增长瓶颈的问题,PLSR 提出一种基于结构化稀疏隐空间的渐进式局部超分辨率框架,通过关联输入解耦构建局部图文三元组、轻量级低分辨率跨注意力微调 DiT、以及迭代去噪块缝合机制,仅凭单卡低成本微调即可将粗糙几何无缝超分至 \(2560^3\) 级精细几何与纹理。

P²Fusion: Prompt-based Progressive Infrared-Visible Image Fusion via Dual-Prior Distillation

针对红外-可见光图像融合中先验硬约束冲突与粒度失配问题,P²Fusion 提出以“Teach-to-Fuse”范式将热显著性与空间质量双重内在物理先验蒸馏为动态可学习提示,并结合门控动态专家重校准模块实现自校正特征提炼与高保真感知重建。

R3RECON: Radiance-Field-Free Active Reconstruction via Renderability

针对传统主动重建严重依赖在线神经辐射场优化状态导致计算延迟高与未收敛评估失真的问题,本文提出基于可渲染度(Renderability)的主动重建框架 R3CON,通过轻量级体素统计地图闭式计算视角效用并结合 360° 全景评估,在毫米级延迟与百兆显存下显著提升了 3DGS 新视角合成质量。

RaPTGS: Render-Agnostic Post-Training Compression of 3D Gaussian Splatting

针对现实资产分发中缺失训练视点与渲染管线的严格“纯模型”后训练场景,RaPTGS 提出结合不透明度、形状各向异性与尺度感知高频外观能量的渲染无关多准则剪枝,配合免训练的体素质量补偿、分度数球谐矢量量化以及基于空间重排序的熵编码,实现了 30 倍的高保真极速压缩。

Raymap-Guided Coupling for Drift-Robust Unposed Feed-Forward 3D Reconstruction

针对无位姿前馈3D高斯泼溅在长序列重建中因相机位姿漂移累积导致几何与渲染崩溃的问题,本文提出 NoDrift3R,通过光线图引导耦合模块将高斯中心显式锚定至密集射线几何,构建外观反哺几何的双向协同联合优化回路,并配合兼顾视差扩展与高重叠重放的双频视角调度策略,实现了长时序轨迹下漂移鲁棒的全局高保真3D重建。

RealDyadic: Synthesizing Realistic Dyadic 3D Dialogue with Neural Appearance Priors

针对双人3D对话数字人受限于3D追踪伪标签噪声导致的口型不准与闭合失效问题,RealDyadic提出了首个结合扩散运动生成与3D高斯泼溅渲染的两阶段框架,利用2D视频光度梯度在交替训练中反传校准3D运动先验,突破了追踪算法的性能上限。

Reconstructing 3D Human-Object Interaction via a Unified Triplane Space

针对单目 3D 人-物交互重建中人体参数化模板与多样化物体的结构失衡痛点,提出统一三平面特征空间(Unified Triplane Space),结合 HOIT-VAE 隐式几何先验、相机感知 HOIT-T 图像到三平面转换与 SMPL-H 姿态拟合,实现了平衡且高精度的交互网格重建。

REFINE: Super-efficient Pruning for 3D Gaussian Splatting via Rendering-Free Primitive Importance

针对 3D 高斯泼溅(3DGS)后处理剪枝在“参数空间启发式失效”与“渲染敏感度开销过大”之间的两难困境,REFINE 提出了一种免渲染的基元重要性度量,通过解析解耦视线能见度与几何投影能量并结合内容自适应校准,将剪枝计算量降低超过 3000 倍且维持 SOTA 级画质。

ReGen3D: Generalizable Unified Representation Learning for 3D Understanding

针对现有3D理解模型绑定单一几何格式且难以跨表征迁移的痛点,本文形式化了「表征泛化(Representation Generalization, RG)」新设定,提出通过统一表征词元化(URT)、共享记忆交互(SMI)与高效表征适配器(ERA)协同的 ReGen3D 框架,在冻结共享主干的前提下实现了多表征联合预训练、测试期单表征解耦推理以及对未知新表征的轻量扩展。

RegVGGT: Sustainable Visual Geometry Grounding for Streaming via Regulated Memory

本文提出免训练的流式前馈3D重建Token调控方法 RegVGGT,基于Token初始显著性决定其长期重要性的时序一致性发现,通过首帧全局锚点永久保留、网络层分群解耦、单帧仅接纳至多1%显著Token入库以及兼容FlashAttention的LSE显著性估算,在消费级显卡上实现数千帧流式视频的高精度可持续几何定位与3D重建。

ReInGS: Re-Initializing 3D Gaussians against Sparsity Discrepancy in Few-Shot Novel View Synthesis

针对少样本 3DGS 依赖全数据集稠密 SfM 点云导致的数据泄露与“稀疏差异”问题,ReInGS 提出由粗到细的两阶段高斯重初始化架构,通过空间扩展混合点采样捕捉全局宏观几何,并结合视角内与跨视角细节感知采样重建高频局部表面,在无额外视角先验下取得少样本新视角合成 SOTA。

REON-NVS: Real-Time Online Novel-View Synthesis from Sparse-View Videos

针对稀疏视角流式视频动态新视角合成计算慢、依赖繁琐相机位姿优化与大量视角的瓶颈,REON-NVS 提出了首个纯前向在线 NVS 框架,通过自监督隐式位姿预测、参考尺度位姿映射,以及基于双向 Mamba2 状态空间模型(Bi-SSM)的时序记忆融合与视图精炼模块,在单张 A100 GPU 上实现无需迭代优化、超 30 FPS(32 FPS)的实时自由视角渲染。

RePer-360: Releasing Perspective Priors for 360\(^\circ\) Depth Estimation via Self-Modulation

RePer-360 提出一种基于归一化调制的自条件框架,在不覆盖预训练透视先验的前提下,利用互补投影(CP 与 ERP)的特征作为几何对齐的引导信号来调制深度基础模型,从而以极少量全景数据(约 1%)实现 SOTA 的全景深度估计。

ReSWD: ReSTIR‘d, not shaken. Combining Reservoir Sampling and Sliced Wasserstein Distance for Variance Reduction

借鉴图形学实时光线追踪中的 ReSTIR 重采样思想,本文将加权蓄水池采样(WRS)引入切片 Wasserstein 距离(SWD),在保持蒙特卡洛无偏性的同时自适应保留高方差投影方向,显著提升优化梯度的信噪比与收敛速度。

RoomPlanner: Reachability-Aware View Sampling for Text-to-Room 3D Gaussian Splatting

针对文本驱动室内 3D 场景生成中布局不可行与相机视角采样脱节的痛点,RoomPlanner 提出了分层 LLM 规划与双重空间约束(碰撞与基于 A* 的可达性),并创新性地将可达性地图无缝桥接至 ReachView 相机轨迹采样与多区间时间步流匹配(ITFS)优化中,实现了仅凭简短文本输入在 30 分钟内生成物理合理、支持物体级解耦编辑的高保真 3D 高斯泼溅室内场景。

Rosetum3D: A Large-Scale 3D Vision Dataset from Preharvest Roses

针对采前鲜花表型与采摘自动化缺乏三维空间基准的瓶颈,本文构建了包含 2.1 万张高分辨率 RGB-D 图像与 4.6 万株玫瑰的三维视觉数据集 Rosetum3D,提出植物学引导的 2D-to-3D 混合标注方案,并建立了涵盖目标检测、关键点定位与时序多帧三维空间定位的完整基准。

SAND: Stage-Aware Noise Decomposition for Training-Free Diffusion Guidance

针对传统免训练引导方法采用静态注意力扰动而忽略去噪时序演化的问题,SAND 将高斯噪声正交分解为模长与方向分量,通过阶段自适应权重动态注入注意力投影,在无需额外训练的前提下显著提升了图像生成与视频生成的全局一致性与细粒度几何纹理。

Scale3D: Autoregressive Modeling for Large Outdoor Scene Generation

Scale3D 提出一种解耦全局布局规划与局部几何合成的分层自回归室外 3D 场景生成框架,结合高保真分块 VAE 与 DPO 偏好对齐,实现了跨大尺度空间无接缝的高质量连续几何生成与文本空间交互控制。

SEAR: Simple and Efficient Adaptation of Visual Geometric Transformers for RGB+Thermal 3D Reconstruction

针对基于前馈视觉几何 Transformer(如 VGGT)在联合处理 RGB 与热红外时产生断裂、尺度失配的问题,SEAR 提出了一种仅需更新少于 5% 参数的轻量微调策略,通过模态专用相机 Token、交替注意力层 LoRA 适配与非配对非对称批次训练,以近乎零的推理开销实现了 SOTA 级的统一 RGB-T 3D 重建与相机位姿估计。

SegFly: A 2D-3D-2D Paradigm for Aerial RGB-Thermal Semantic Segmentation at Scale

提出一种面向无人机高重叠空照视角的 2D-3D-2D 跨模态几何驱动标注与配准范式,仅需手动标注不足 3% 的 RGB 图像并提升至 3D 点云,便能自动渲染生成其余 97% RGB 与 100% 热成像的高保真稠密伪真值(准确率达 91% 和 88%),同时在无硬件级时钟同步前提下实现 87.05% 精度的像素级跨模态几何对齐,构建出含 20,606 张 RGB 与 15,007 对对齐 RGB-T 图像的大规模基准 SegFly,并提出高效统一的 Firefly 基线。

SFD-Net: Sharp Feature Detection Network Based on Local Geometric Features

SFD-Net 提出了一种即插即用的三尺度法向差分二阶矩各向同性描述子(LGD),结合增强型 PointNet++ 骨干与 Focal Tversky-Dice 类别不平衡目标函数,在点云局部密度波动与强高斯噪声联合扰动下实现了高精度的尖锐几何特征检测。

SharpGS: Sharpness-Preserving 3D Gaussian Splatting with Differentiable Blur-Driven Density Control

针对 3D 高斯泼溅(3DGS)依靠位置梯度进行密度控制难以敏感捕获高频边界与纹理细节的瓶颈,SharpGS 提出将模糊作为感知线索,通过 CUDA 可微模糊模块动态评估基元级模糊程度,并结合平滑区正则化与软不透明度衰减,在显著减少基元数量的同时大幅提升精细重建质量。

SkySplat-OV: Generalizable Language Gaussian Splatting for Open-Vocabulary Scene Understanding from Sparse Satellite Views

首个面向稀疏卫星遥感视角的通用型开放词表 3D 场景理解框架,通过将 RPC 有理多项式相机模型显式引入语言 3DGS 前馈管线,结合几何-辐射-语义融合(GRS-Fusion)与单目相对高程自监督,配合单阶段 SAM3 蒸馏,实现了无需场景级优化的秒级前馈几何重建与高一致性开放词表三维语义分割。

SMP-UWGS: Coupled Physics-Geometry Optimization for Scalable Multi-Partition Underwater 3D Reconstruction

针对大规模水下场景中光衰减与几何深度高度耦合导致的计算爆炸与色偏退化问题,提出 SMP-UWGS 框架,将多分区高斯架构与可微物理渲染网络(DPR-Net)联合优化,实现了高保真、可扩展且实时渲染的水下三维重建。

Steering 3D Generations: Preference Alignment via Direct Reward and Preference Optimization

针对单图到3D生成中几何伪影严重与用户偏好难以形式化的痛点,提出融合神经SDF高斯曲率数据清洗、直接奖励优化(DRO)与直接偏好优化(DPO)的整流流偏好对齐框架,利用轻量LoRA实现高保真度与几何风格可控生成。

StereoEdit: A Diffusion-Based Framework for Stereo-Consistent Image Editing

针对 2D 扩散模型独立编辑立体图像对时产生的跨视角纹理漂移与几何畸变问题,StereoEdit 提出了无需重训的免微调框架,通过几何门控注意力参考(GGAR)与几何感知潜空间对齐(GALA)分别在特征层与潜空间层约束视差可靠性,实现了兼顾高文本保真度与精确双目视差一致性的立体图像编辑。

StratoSplat: Taming Layered Regularities for Sparse Aerial 3D Gaussian Splatting

针对无人机稀疏航拍视角下点云初始化缺失与视线过拟合退化问题,StratoSplat 利用重力方向分层几何先验,通过分层深度图像引导的深度扩散自适应与神经多平面虚拟高斯混合表征,实现了高质量几何补全与新视点渲染。

Structure Gaussian Splatting SLAM

针对传统高斯 SLAM 在弱纹理与重复环境中光度梯度消失导致的位姿漂移与浮块伪影,本文将室内丰富平面显式建模为持久化平面高斯实例(PGI),提出利用非平行平面相对几何估计相机位姿的结构闭环机制与稀疏全局视点锚定优化,在无需轨迹重访的条件下实现了毫米级跟踪精度与高保真稠密重建。

SupIR-GS: Thermal Infrared Super-Resolution Novel View Synthesis with Imaging-Calibrated 3D Gaussian Splatting

针对热红外成像中热扩散导致几何模糊与传感器硬件噪声引发“信噪比倒置”的核心难题,SupIR-GS 提出首个结合成像标定的超分辨率 3D 高斯泼溅框架,通过物理可微标定层解耦硬件噪声、强度条件色调适配器激活平坦纹理对比度,并借助频域感知渐进式学习由粗到精恢复精细高频热边界。

SWSL: Semantic-aware Weakly Supervised Learning for 3D Motion Generation using 2D Motion Data

针对配对文本-3D动作数据稀缺的问题,SWSL构建了文本-2D-3D统一语义对齐空间,利用单视角2D动作的语义向量增强3D伪标签,并通过语义级判别差距构建强化学习奖励直接端到端优化生成模型,在大幅降低3D数据依赖的同时显著改善生成动作的保真度与语义匹配度。

SyncFix: Multi-View Consistent Diffusion Refinement of 3D Reconstructions

针对稀疏视角 3D 重建中独立 2D 扩散修复引发的跨视角几何与语义冲突,SyncFix 将多视角修复重构为联合隐式桥匹配问题,通过置换无关跨视角注意力实现无需相机位姿的隐空间同步与单步确定性求解,显著提升了几何一致性与重建保真度。

SynLF: Zero-Shot Metric Depth from Light Field Cameras via Physics-Grounded Synthesis

针对光场相机训练数据稀缺及真实复杂场景泛化差的难题,本文提出 SynLF 框架,通过物理接地的光场合成流水线(PG-LF)从大规模 RGB-D 在线生成含散焦与非朗伯扰动的多视点光场,并结合融合单目先验与显式多视点遮挡推理的迭代估计网络 VisDepth,在自建真实光场数据集上实现了无需微调的零样本绝对尺度深度估计(MAE 30.05 mm,AbsRel 1.38%)。

Tackling Misattribution in 3D Intrinsic Decomposition via Proximity Attention Point Rendering

揭示了基于体渲染聚合的3D高斯等方法由于半透明图元权重混合导致图元级反射率错误归因(misattribution)的根源,提出采用不透明近邻注意力点渲染(PAPR)直接对表面点进行无歧义监督,并结合条件隐式最大似然(cIMLE)与空间雕刻损失实现多视角一致且可精准编辑的高保真3D本征解耦。

Taming LLMs for Codematic Indoor Scene Generation

针对直接微调大语言模型生成室内3D场景代码时注意力被长代码历史淹没而遗忘用户指令的问题,SceneSpinner构建了首个包含5.2万房间的开集文本3D场景数据集,并提出“语言规划链+条件互信息(CMI)正则化训练”范式,大幅提升了精细化布局生成与复杂指令遵循能力。

Tempo-SAM3D: Monocular Video to 4D via Temporal Memory-Guided Generation

Tempo-SAM3D 提出首个无需微调即可将单目图像布局感知 3D 生成扩展至时序 4D 的框架,通过注意力层双路径记忆缓存、求解器层几何与渲染速度修正,以及后处理 HexPlane 低秩滤波,实现具有空间精准定位的高保真连贯 4D 生成。

The Sterkfontein Caves Dataset: A Novel View Rendering Challenge from the Cradle of Humankind

针对联合国教科文组织世界遗产斯泰克方丹古人类洞穴极端暗光、高动态范围与复杂岩壁纹理,论文构建了首个洞穴多视角RAW合成数据集,并揭示出简单改进的Raw-Nerfacto在可靠性与保真度上显著超越现有专用低照度与高斯泼溅方法。

ThermoGS: Decoupling Physical Surface Attributes for Spatio-Temporal Thermal Field Emulation via 4D Gaussian Splatting

ThermoGS 将 4D 高斯泼溅与热力学物理定律相融合,通过 PINN 显式解耦地表材质的发射率、对流换热系数、体积热容与吸收率,实现了全天候动态环境下的高保真时空热场仿真与绝对温度预测(误差小于 1℃)。

TopoFuse: Topology-Aware Tri-Planar Fusion for 3D Cryo-Electron Tomography Segmentation

TopoFuse 针对冷冻电镜断层三维分割中因极低信噪比与缺失楔伪影导致的膜结构断裂和腔室塌陷,将拓扑先验从软损失函数重构为前向前向通道的可微投影算子,结合三平面 SAM 基础特征与拓扑条件化 FiLM 融合,仅需编辑约 3.1% 的关键体素即在贝蒂数误差上取得 54% 的大幅下降。

TopoGAT: Plug-and-Play Topological Graph Attention for Fine-Grained 3D Segmentation

针对细粒度 3D 点云分割中局部几何高度自相似导致部件边界混淆的瓶颈,TopoGAT 首次将持续同调提取的全局拓扑结构向量化并通过 FiLM 动态调制图注意力权重,以仅 1.4M 参数的轻量级即插即用方式为现有主干网络带来显著的边界识别提升。

UniGeo: Unifying Geometric Constraints for Camera-Controllable Image Editing via Video Priors

针对相机可控图像编辑与视角合成中几何引导碎片化导致的结构崩塌与跨视角漂移,UniGeo基于预训练视频扩散模型,系统性地在表征、架构与损失函数三个层级统一注入几何先验,在连续大范围相机位姿变换下实现了高质量三维几何一致性。

VideoSfM: Exploiting Temporal Structure for Video-Based Structure-from-Motion

VidMap(VideoSfM)结合 SLAM 的时序约束与全局 SfM 的非因果全局优化,通过视频感知的稠密特征轨迹追踪、时序与回环观测的溯源分离、以及注入单目度量深度先验的全局定位与平差,实现了对长时非受控未知内参视频高精度、抗漂移的度量级三维重建。

ViewSplat: View-Adaptive 3D Gaussian Splatting for Feed-Forward Synthesis

ViewSplat 给无位姿前馈 3DGS 补上一个「视角自适应」环节——先预测一套基础高斯 + 一套场景条件化的 View MLP,渲染时让这些 MLP 吃目标视角坐标、为每个高斯的全部属性(位置/尺度/旋转/不透明度/颜色)现场算出残差偏移,从而在保持实时渲染(最大骨干仍有 90 FPS)的同时把镜面高光、锐利反射这类静态表示丢失的高频视角相关效果重建出来,刷新了 pose-free NVS 的保真度 SOTA。

VisTa3D: A Dataset and Benchmark for Vision, Tactile, and 3D Point Clouds-based Thin Object Reconstruction

论文提出了首个面向细薄物体(Thin Objects)三维重建的多模态基准 VisTa3D,包含同步 RGB、深度、触觉响应图与高精结构光真值,系统评测了 11 种前沿三维重建方法并提出了首个视触融合深度补全基线 Tactile-DC。

VKSR: Scalable Kernel Surface Reconstruction Using Vecchia's Approximation

针对传统核表面重建依赖全局低秩近似而在稠密或复杂点云上计算昂贵且过度平滑的难题,VKSR 引入高斯过程中的 Vecchia 近似将全局核求解分解为局部响应过程的近邻推断,配合分区近邻检索与多分辨率体素求值,在数分钟内实现千万级点云的高保真隐式表面重建,速度比现有核方法提升达 180 倍。

VoxAnchor: Explicit Voxel-Semantic Grounding for Spatial Understanding in Videos

针对视频多模态大模型因 2D 投影坍缩导致的实体空间混淆与绝对尺度缺失问题,VoxAnchor 提出将视觉 token 与 DA3 几何先验显式反投影至统一 3D 体素网格,通过体素感知注意力约束物理局部交互,在仅 4B 参数下取得 VSI-Bench (66.8%) 与 VSTI-Bench (66.3%) SOTA。

Vulnerability of Privacy-Preserving Visual Localization against Diffusion-based Attacks

本文提出了一种基于多尺度条件潜在扩散模型与多模态LoRA调制的统一图像反演攻击框架,并构建了涵盖重建多样性与VLM语义恢复率的综合隐私评估基准,系统证实了几何与描述子混淆方案仍面临严重的敏感细节反演风险,而粗粒度语义分割在精度与隐私权衡中提供了更可靠的保护。

Wat3R: Underwater 3D Geometry Learning without Underwater Annotations

Wat3R 是首个面向水下复杂环境的前馈式 3D 几何估计半监督框架,通过物理渲染合成水下数据与大规模无标注真实水下视频的协同训练,结合前景静态掩膜引导的跨视角几何一致性损失,在完全不依赖真实水下 3D 标注的前提下实现了高精度的前馈多视角深度、位姿与点云重建。

WildCity: A Real-World Dataset for City-Scale Rendering and Beyond

WildCity 将六座美国城市、18 条连续行车日志整理为 1,507.1 公里的环视 RGB–LiDAR 数据,并提出结合刚性相机组位姿优化、天空分离和道路正则的 3DGS 基线,展示城市重建不仅需要能容纳更多高斯,还需要控制位姿漂移、几何歧义与轨迹外渲染错误。

X-SG2S: Safe and Generalizable Gaussian Splatting with X-dimensional Watermarks

X-SG2S 将比特、图像和三维对象水印分块后,通过内容相关选点与模态专用 MLP 写入已有 3DGS 的高阶球谐系数,再学习定位与恢复这些片段,实现无需逐场景微调的多模态水印;论文报告约 3 秒注入,48-bit 对比设置下无扰动提取准确率为 100%。

Zero-Shot Depth from Defocus: 从对焦堆栈零样本估计度量深度

本文提出 FOSSA,一个基于 Transformer 的零样本对焦深度估计网络,通过新颖的堆栈注意力层高效聚合焦点堆栈中的散焦线索,并在大规模合成数据上训练后实现了跨数据集、跨场景的强零样本泛化;同时发布了 ZEDD——一个包含 100 个场景、4K 分辨率、LiDAR 真值的高质量对焦深度实测基准。

Zero-Shot Novel Depth Synthesis Using Foundation Models Scene Representations

Z3D 在冻结 VGGT/WorldMirror 的场景 token 空间中,按源图像和目标相机位姿生成目标视角表征,再用冻结深度头解码;相比作者构造的像素深度扩散基线,它在域内和 DTU 等设置中更准确,但 NRGBD 上并不全面占优。

∂DIBR: Differentiable Depth Image-based Rendering for Fast Novel View Synthesis

将经典基于深度图像的渲染 (DIBR) 重构为端到端可微框架,以连通三角网格保证几何连通性与结构一致性,在消费级 GPU 上实现 277 FPS 的高速实时新视角合成。