跳转至

🧊 3D 视觉

🎞️ ECCV2026 · 67 篇论文解读

📌 同领域跨会议浏览: 📷 CVPR2026 (751) · 🔬 ICLR2026 (194) · 🧪 ICML2026 (30) · 🤖 AAAI2026 (79) · 🧠 NeurIPS2025 (116) · 📹 ICCV2025 (267)

🔥 高频主题: 3D 高斯渲染 ×14 · 人体姿态 ×4 · 扩散模型 ×4 · 压缩/编码 ×4 · 动态场景 ×4

AC3S: Adaptive Conditioning for 3D-Aware Synthetic Data Generation

本文提出AC3S,通过自适应视觉提示调制器动态衰减ControlNet的条件注入强度,并辅以多智能体VLM系统生成与几何结构一致的文本提示,在保持3D姿态精确对齐的前提下大幅提升合成图像的逼真度和多样性,FID相较基线3D-DST降低15.95点,下游分类和姿态估计任务均取得显著提升。

AerialMetric: Benchmarking and Adapting UAV Monocular Metric Depth Estimation in the Real World

本文构建了包含四个互补子集的大规模无人机航拍单目度量深度基准 AerialMetric(52K 真实 + 16K 合成图像-深度对),系统性揭示了现有 SOTA 模型在空域视角下 δ1 接近 0 的严重域差距,并通过 LoRA 参数高效微调 MoGe2 在几乎不损失地面泛化能力的前提下将空域 δ1 提升至 84% 以上。

Agentic Collaborative Cognition for Zero-Shot 3D Understanding

这篇论文把零样本 3D 场景理解改造成 Planning Agent 与 Perception Agent 围绕显式 holistic cognitive map 反复协作的过程,通过主动补关键视角、跨视角记录物体属性和反馈式候选过滤,在 ScanRefer / Nr3D / SQA3D / ScanQA 等 6 个基准上明显优于已有零样本方法。

AirZoo: A Unified Large-Scale Dataset for Grounding Aerial Geometric 3D Vision

AirZoo 构建了一个百万级航空合成数据集,通过 AirSim-Cesium-Unreal 三位一体仿真管线从 Google 3D Tiles 自动渲染出带像素级深度和 6-DoF 地理参考位姿的无人机航拍序列,覆盖 22 个国家 377 条多天气轨迹,在航空图像检索、跨视角匹配和多视图三维重建三个任务上微调现有 SOTA 模型均取得显著提升,尤其是真实场景零样本泛化能力大幅增强。

AnyMatch: Supercharging Universal Multi-Modal Image Matching with Large-Scale Single-View Images

AnyMatch 提出一种从海量单视图图像零成本合成多模态多视角匹配数据的框架,通过单目深度估计+3D重投影+扩散补全实现几何一致的视角变换,结合跨模态图像翻译实现红外/深度/法向/事件四种模态生成,并用样本级几何一致性验证(SGCV)过滤生成瑕疵;在 Any-syn 合成数据集上微调 LoFTR/EDM/RoMa 后,跨模态匹配性能大幅超越 MINIMA 等现有合成方法,且在未见医学/遥感模态上展现出强零样本泛化能力。

Audio-Visual Camera Pose Estimation with Passive Scene Sounds and In-the-Wild Video

本文提出首个利用被动场景音频辅助视觉进行相对相机位姿估计的方法,通过到达方向谱与双耳化嵌入组成的空间音频编码器(SAE)与SOTA视觉位姿估计模型Reloc3r进行晚期融合,在真实场景与仿真数据集上均取得显著提升。

BrepLLM: Enabling Large Language Models to Understand Boundary Representations

BrepLLM 是首个让大语言模型直接解析和推理原生 B-rep(边界表示)CAD 模型的框架:通过自适应 UV 采样将 B-rep 转为面-边拓扑图,用层级化 BrepEncoder 提取面/边/拓扑三支解耦特征,再经 CLIP 对比预训练和两阶段渐进式 LLM 微调,最终在 3D 物体描述和分类任务上全面超越基于点云和图像的基线模型。

Capacity-Controlled Multi-View Stylization of 3D Gaussian Splatting

本文提出基于容量控制最优传输的3D高斯泼溅多视角风格化框架:用半平衡最优传输替代贪心最近邻匹配,通过列容量约束抑制many-to-one问题,同时引入跨视角匹配引导保证相邻视角的风格一致性,辅以几何正则化增强重建质量,在风格质量、内容保真和多视角一致性上全面超越现有方法。

DefenseSplat: Enhancing the Robustness of 3D Gaussian Splatting via Frequency-Aware Filtering

DefenseSplat 通过小波变换分解输入图像、滤除高频子带来抑制对抗扰动,并引入 ReLU 形式的尺度正则化损失限制拉长高斯体的生成,在没有干净真值监督的条件下显著提升 3DGS 对对抗攻击的鲁棒性。

DeWorldSG: Depth-Aware 3D Semantic Scene Graph Generation via World-Model Priors

DeWorldSG 提出一种从 RGB-D 序列生成时空鲁棒 3D 语义场景图(SSG)的框架:用 SAM 掩码引导的双域深度过滤为每个物体估计实例级概率 3D 高斯分布,再通过 V-JEPA 2 世界模型积累跨帧关系证据并以不确定性感知融合精炼谓词边,在 3DSSG 上关系召回率提升 77.4%、谓词召回率提升 23.2%。

Diffusion-Based Material Regularization for Physics-Based Inverse Rendering

本文提出一种将扩散模型预测的 G-buffer(反照率、粗糙度、金属度、法向)作为相似性核来正则化物理解耦逆渲染的方法——不是把扩散预测当目标值去拟合,而是用它定义表面区域间的材质相似度,通过联合双边滤波约束同一材质区域的优化参数趋于一致,从而抑制"光照烘焙进材质"的伪影,在 Stanford-ORB 上显著超越 Neural-PBIR 和 MaterialFusion 等 SOTA 方法。

Diffusion-Based Material Regularization for Physics-Based Inverse Rendering

将扩散模型预测的 G-buffer 不作为目标值而是作为相似性核(similarity kernel),通过联合双边滤波正则化在优化中隐式地对同材质区域聚类,在保持输入图像拟合精度的同时消除烘焙伪影,实现高质量 PBR 资产重建。

DLGStream: Dynamic Language-embedded Gaussian Splatting for Open-vocabulary Enabled Free-viewpoint Video Streaming

DLGStream 提出双透明度语言高斯表示和基于时间特征插值的变形场,在对多视角动态场景进行高质量自由视角视频重建的同时嵌入可流式传输的时空语言特征,以平均 43 KB 的帧大小实现实时 4D 开放词汇查询和帧插值。

EPO: Boosting 3D Foundation Models with Edge-based Pose Optimization

提出EPO,一种无需显式特征track的几何优化框架,利用Canny边缘图和距离变换场构造可微的边缘重投影损失,通过两阶段自适应优化精化3D基础模型输出的相机参数和深度,在消费级GPU上以秒级运行时间达到甚至超越传统BA方法的几何精度。

Face Anything: 4D Face Reconstruction from Any Image Sequence

本文提出Face Anything,将4D人脸重建与跟踪统一为规范坐标预测问题——网络从任意图像序列中同时估计深度和规范人脸坐标,稠密对应关系直接通过在规范空间做最近邻搜索获得,无需显式建模帧间运动,在深度估计(RMSE降低16%)、对应关系精度(3倍提升)和推理效率(32倍加速)上全面超越现有方法。

FiCA: Feed-forward Instant Gaussian Codec Avatars from a Single Portrait Image

FiCA 通过串联 Sapiens 人体基础模型、条件扩散模型和可学习的 UV 精化网络,以纯前馈方式从单张自然肖像照片在 5 秒内生成可实时驱动的、高保真 3D 高斯 Codec Avatar。

G2P: Gaussian-to-Point Attribute Alignment for Boundary-Aware 3D Segmentation

本文提出 G2P,通过马氏距离建立高斯-点云之间的精确对应关系,将 3D Gaussian Splatting 中的不透明度和尺度属性迁移到点云上,在保留原始点几何结构的同时引入外观线索,从而有效缓解几何形状相似但外观不同的物体的分割混淆问题。

Gaussian Belief Propagation Network for Depth Completion

GBPN 把深度补全重新表述为「在一张由网络动态构建的马尔可夫随机场上做高斯置信传播」——网络不直接回归深度,而是学出 MRF 的势函数、边权和非局部边结构,再用可微的高斯 BP 迭代推理出稠密深度分布(均值当深度、精度当置信度),在 NYUv2 / KITTI 上达到 SOTA,尤其在极稀疏输入下鲁棒性远超纯回归网络。

GaussianGPT: Towards Autoregressive 3D Gaussian Scene Generation

GaussianGPT 将 3D 高斯场景压缩为离散 token 序列,用带 3D 旋转位置编码的因果 Transformer 做逐 token 自回归预测,首次在 3D 高斯场景生成上实现纯自回归范式,在形状合成和场景生成上达到或超越扩散模型 SOTA,并天然支持场景补全和外扩。

GaussLite:在线任务条件化的 3D 高斯泼溅实时机器人建图

GaussLite 用自然语言任务描述(如"捡起桌上的物品")指挥在线 3DGS 建图器把高斯密度和优化预算集中在任务相关区域,在匹配的高斯预算和实时建图速度下 ROI PSNR 比基线高 2-3 dB,并支持多机器人任务专用建图的轻量融合。

GaussLite: Online Task-Conditioned 3D Gaussian Splatting for Real-Time Robotic Mapping

GaussLite 提出一种任务驱动的在线 3DGS 建图系统,通过自然语言指令引导高斯密度分配,在相同 Gaussian 预算下将渲染质量集中到任务相关区域,单智能体 ROI PSNR 提升 +2.72 dB,并支持多机器人按体素投票融合各自专化地图。

GENA3D: Generative Amodal 3D Modeling by Bridging 2D Priors and 3D Coherence

GENA3D 提出一种生成式非模态 3D 建模框架,通过 View-Wise Cross Attention 并行融合多视图 2D 补全特征、Stereo-Conditioned Cross Attention 将 MVS 点云作为几何门控注入注意力 logits,在稀疏遮挡输入下同时实现生成多样性与几何一致性,在 GSO 数据集上 FID 达 30.73(4视图),相比 Amodal3R 提升 4.4,且可见区域 SSIM 达到 0.838。

GenSP: Consistent Spherical Parameterization via Learning Shape Generative Models

GenSP 提出用数据驱动的方法学习一个神经生成模型,将单位球面连续变形到任意 genus-0 形状,从而通过逆映射获得跨形状一致且低几何畸变的球面参数化,在 ShapeNet 上比现有方法提升 14× 以上等距畸变、3.6× 以上一致性。

Geo-ID: Test-Time Geometric Consensus for Cross-View Consistent Intrinsics

Geo-ID 提出一个无需训练的测试时框架,通过稀疏3D几何对应关系将独立运行的预训练单视图本征扩散模型的预测耦合起来,形成置信度加权的体素级鲁棒共识再反向注入后续扩散采样过程,以仅操作潜在变量的梯度更新方式引导各视图预测趋于一致,在不降低单视图分解质量的前提下实现 albedo / roughness / metallicity 的跨视角一致性提升,并可直接用于下游的可编辑神经场景表示。

Geometry-Aware Style Transfer in 3D Gaussian Splatting

本文提出一种几何感知的 3DGS 风格迁移框架,通过解耦优化交替更新颜色和几何参数,并引入多模态(RGB + 深度 + 边缘)对比特征匹配损失 GCFM 来引导风格结构和几何纹理的迁移,在风格保真度和多视图一致性上显著优于现有 3DGS 风格迁移方法。

GRAFT: Geometric Refinement and Fitting Transformer for Human Scene Reconstruction

GRAFT 是一个学习到的"人体-场景交互先验",它将基于优化的物理合理性拟合过程"摊销"进一个前馈 Transformer 中——通过几何探针将人体-场景的相对关系编码为 24 个紧凑 token,在循环迭代中预测"交互梯度"纠正漂浮和穿透,最终以 0.2s 的前馈速度达到优化方法级别的交互质量,且可作为即插即用先验提升任何前馈方法。

HAT-4D: Lifting Monocular Video for 4D Multi-Object Interactions via Human-Agent Collaboration

HAT-4D 提出首个面向单目视频 4D 多物体交互重建的 agentic 框架:以交互知识图谱(IKG)为因果引擎驱动 3D 生成、空间组合和记忆增强 4D 传播,并通过多层级人在回路(HITL)协同解决深度歧义和遮挡难题,在 MVOIK-4D 基准上全面超越现有单目 4D 基线,且少量人工反馈即可显著提升交互重建质量。

Hierarchical 3D Scene Graph Construction and Belief-based Planning for Semantic Navigation

本文提出一种零样本语义导航框架,通过在线增量构建物体-区域-区分层 3D 场景图(HSG)作为结构化全局记忆,并在其上融合 LLM 语义先验与探索证据维持分层信念状态,用 POUCT 在 HSG 模拟器内做有限步前向展开以显式评估宏动作的长程期望回报,长程导航 SR/SPL 分别提升 9.4%/5.0%。

Improving Sparse-View 3DGS Generalization via Flat Minima Optimization

本文从平坦极小值(Flat Minima)优化的视角解决稀疏视图 3DGS 的过拟合问题:通过尺度自适应的位置扰动(SAP)+ 随机施加 + 幅度调度 + 周期性非位置参数重初始化,在不改变网络架构的前提下使 3DGS 收敛到更平坦的损失景观区域,在 LLFF 和 Mip-NeRF360 上稀疏视图设定下取得 SOTA 或接近 SOTA 的渲染质量。

Ink3D: Sculpting 3D Assets with Extremely Complex Textures via Video Generative Models

Ink3D将3D纹理生成解耦为"几何优先、纹理其次"的两阶段管线:先用现成3D模型生成白模几何,再通过条件视频生成模型OrbitPainter合成密集轨道扫描视频,最后用TextureOptimizer神经烘焙模块将多视图纹理融合到几何体上,从而借助大规模预训练视频先验实现现有3D生成方法难以企及的极复杂纹理合成。

Interact3D: Compositional 3D Generation of Interactive Objects

Interact3D 提出无需训练的"先生成再组合"框架,利用 2D/3D 生成模型的空间先验将 3D 组合生成转化为结构化配准问题,通过两阶段组合管线(全局到局部几何对齐锚定主物体 + SDF 碰撞感知优化放置剩余物体)和 VLM 驱动的智能体闭环迭代修正,从单张图像和文本提示自动生成物理合理、无碰撞的交互式 3D 组合场景,并发布 8,000+ 对交互式 3D 数据集。

JanusMesh: Fast and Zero-Shot 3D Visual Illusion Generation via Cross-Space Denoising

JanusMesh 提出一个零样本两阶段框架,利用 TRELLIS 结构化 3D 隐空间的双分支去噪与 SDF 融合生成多语义几何体,再通过视角约束的纹理合成赋予各视角对应的外观,在 3–5 分钟内即可生成高质量 3D 视觉幻觉网格。

Large-Scale High-Quality 3D Gaussian Head Reconstruction from Multi-View Captures

HeadsUp 提出一种可扩展的前馈式方法,将多相机捕捉的多视图图像通过跨注意力 Transformer 压缩为紧凑 2D 潜变量,再解码到锚定于中性头部模板的 UV 参数化 3D 高斯上,从而将输出高斯数量与输入图像分辨率和视角数解耦,在 10,000+ 人的内部数据集上达到 SOTA 重建质量,且无需测试时优化。

Learning Video Dynamics with Predictive Differentiable Rendering

提出 Predictive Differentiable Rendering(PDR)框架,通过在现有像素空间预测器后附加轻量 PredGS 适配器将粗预测映射为 2D 高斯参数,经 CUDA 加速的可微渲染器生成连续空间预测再与像素预测融合,以极小计算开销显著缓解确定性视频预测的过度平滑问题。

LUNA: Learning Universal 3D Human Animation Beyond Skinning

LUNA 提出首个完全抛弃线性混合蒙皮 (LBS) 的端到端 3D 人体动画框架,通过解耦的 Transformer 动画器将 2D 驱动信号(RGB 图像、关键点、手绘草图甚至未知角色图像)直接映射为 3D 高斯变形;在训练中利用 LBS 蒸馏提供结构性先验防止几何坍缩,推理时彻底摆脱 LBS 约束,实现了零样本跨身份、跨模态的 3D 人体动画。

MeGAS: Thermomechanical Dynamic Gaussian Splatting for Thermophysical Scene Editing

MeGAS 将热力学相变动力学(热传导、对流、熔化/凝固)集成进 3D Gaussian Splatting 框架,使真实场景的重建结果能够受控地发生基于物理的热力学形变,并在极端大变形下通过拓扑自适应渲染策略保持光栅化质量。

Monocular Avatar Reconstruction via Cascaded Diffusion Priors and UV-Space Differentiable Shading

用一个统一的预训练扩散骨干串联「纹理补全 → 光照均质化 → 材质分解」三个子任务、每个子任务只挂一个 LoRA,再配合 UV 空间可微 BRDF 渲染损失,仅用不到 100 个真实 3D 扫描就从单张野外照片重建出 4K 分辨率、可重打光的高保真人脸 PBR 数字人。

Monte Carlo Energy Aggregation for Mobile 3D Gaussian Splatting

Flux-GS 通过蒙特卡洛镜面能量聚合将三阶球谐函数压缩为一阶表示,辅以零推理开销的属性条件增强模块和多视图 alpha 加权致密化/剪枝策略,在移动端骁龙 8 Gen 3 上实现 130+ FPS 的实时高保真新视角合成,同时将存储压缩至 2-5 MB,训练时间从 Mobile-GS 的 80+ 分钟降至 11 分钟。

Multi4D: High-Fidelity Dynamic Gaussian Splatting via Multi-Level Competitive Allocation

Multi4D 把动态场景显式拆成「静态结构 + 持久动态几何 + 瞬态外观」三套高斯子集,让它们在共享光栅化下竞争性地去解释光度残差,从而同时保住长时运动一致性和高频外观细节,用比 4DGS 少 25× 的动态高斯就拿到 SOTA 渲染质量、实时帧率,还能顺带做到 10× 提速的 4D 分割。

One Video, One World: Turning Monocular Video into Physical 4D Scenes

OVOW是首个将单目视频转为实例级、可物理仿真的4D mesh场景的训练无关系统,通过VLM引导场景分解、类别感知网格重建、迭代尺度姿态恢复和物理接地组装四阶段流水线,无需微调即可输出watertight网格实例并直接用于MuJoCo等物理仿真器。

OP3DSG: Open-Vocabulary Part-Aware 3D Scene Graph Generation for Real-World Environments

OP3DSG 提出统一 3D 场景图生成框架,通过知识引导的部件检测、部件感知多视图融合和几何初始化先验图+验证门控 LLM 推理,联合建模物体、交互部件、空间关系、功能关系和 affordance,在自建 UniGraph3D 基准上部件节点召回以绝对优势领先此前方法 31+ 点,并可直接作为机器人问答、导航和任务规划的感知后端。

OrthoTrack: Continuous 6-DoF UAV Trajectory Estimation Anchored in Public Orthophotos

OrthoTrack 提出一种免训练的无人机6-DoF连续轨迹估计系统,仅利用公开的正射影像(DOP)和地表模型(DSM),通过"关键帧稠密匹配锚定 + 帧间光流传播"的交替策略,在无需GPS、IMU或后处理对齐的条件下,以实时帧率实现亚米级绝对度量位姿估计,并配套发布了大规模多模态基准 MovingDrone。

Pano3D: Unified 3D Reconstruction and Panoptic Segmentation

Pano3D 在前馈式 3D 重建模型(FRM,如 MUSt3R / Pi3)后面直接接一个 Mask2Former 风格的集合式掩码解码器,用几何+语义两个损失联合微调几何解码器,第一次做到无需外部 2D 模型、无需聚类后处理就在单次前馈里同时输出稠密点云 + 3D 全景分割,在 ScanNet / ScanNet200 / ScanNet++ 上语义分割 mIoU 大幅超过 SOTA(ScanNet +16.6)。

Physically Grounded 3D Generative Reconstruction under Hand Occlusion using Proprioception and Multi-Contact Touch

本文融合单目RGB视觉、本体感知(手部姿态)和多点触觉,在流匹配扩散框架下生成严重手部遮挡下的公制尺度物体SDF,并通过非贯穿与接触一致性两项物理损失同时在训练和推理采样阶段引导形状重建,使输出在物理上可行且位姿隐式估计。

PoseShield: Neural Collision Fields for Human Self-Collision Resolution

PoseShield 在 SMPL 姿态空间内学习一个带 Eikonal 正则化的神经碰撞场(近似姿态空间 SDF),将其作为可微约束函数嵌入 SLSQP 等梯度约束优化器中,实现从自穿透姿态到最近无碰撞姿态的后处理修正;该方法无需重训下游运动生成模型即可扩展到运动序列碰撞修正,在自建 HwC 数据集上达到 95.8% 的成功率,远超 COAP(44.6%)。

Progressive Pose-Guided 4D Animal Reconstruction from Monocular Video

本文提出基于3D高斯溅射的渐进式测试时优化框架,通过解耦骨架运动与非刚体变形,从单目视频中重建高保真4D动物模型,仅需粗粒度形状先验即可泛化到多种物种。

RAGA: Real Time Ray Traced Gaussian Shadow Casting for 3DGS Avatar-Scene Interaction

RAGA 提出了一种完全在高斯空间中计算阴影的射线追踪方法——对每条阴影射线做精确的高斯线积分并归一化,得到描述光线"穿过多少"遮挡体的厚度因子,以此驱动阴影透射率;同时引入化身代理(avatar proxy)消除动画中的时序抖动,在 NVIDIA OptiX 上实现约 50 FPS 的交互式阴影投射。

RePer-360: Releasing Perspective Priors for 360\(^\circ\) Depth Estimation via Self-Modulation

RePer-360 提出一种基于归一化调制的自条件框架,在不覆盖预训练透视先验的前提下,利用互补投影(CP 与 ERP)的特征作为几何对齐的引导信号来调制深度基础模型,从而以极少量全景数据(约 1%)实现 SOTA 的全景深度估计。

SemCityLoc: Aerial 6DoF Localization Using Semantic 3D City Models

SemCityLoc 将无人机空中 6DoF 位姿估计重新定义为「基础模型视觉先验(语义分割 + 单目深度)与标准化语义 3D 城市模型之间的结构化表面配准」问题,通过「4D 语义代价体积粗定位 → 粒子滤波联合语义-深度精对齐」的两阶段管线,在无需稠密辐射重建的前提下,将城市峡谷场景的定位召回率从 35.11% 提升至 69.15%(2m-2度阈值),位置误差从 9.89m 降至 2.62m,并同步发布首个厘米级精度真实无人机定位基准 SemCityLockeD。

ShellMaker: Language-Guided Exterior Completion under Structural Constraints

ShellMaker 提出语言引导的建筑外观补全框架:给定建筑脚手架(室内生成器/CityGML/CAD 输出的墙体+门窗开洞布局)和一句风格提示词,通过参数化屋顶生成、LLM 部件感知提示词精化、兼容性感知的墙-屋顶纹理联合检索、几何感知装配四个模块,产出完整 PBR 外立面网格,在严格保持足迹和开洞布局的前提下匹配任意建筑风格,足迹 IoU 达 0.992,开洞中心误差仅 0.091。

SK-Adapter: Skeleton-Based Structural Control for Native 3D Generation

SK-Adapter 提出将 3D 骨架作为第一类控制信号,通过轻量级 adapter 网络(GRPE 拓扑编码 + 骨骼交叉注意力)注入冻结的 3D 流匹配生成骨干(Trellis),在保留预训练生成先验的前提下实现面向原生 3D 空间的精确骨架结构控制,同时配套构建了 24k 图文-网格-骨架三元组数据集 Objaverse-TMS。

SKEL-CF: Coarse-to-Fine Biomechanical Skeleton and Surface Mesh Recovery

SKEL-CF 提出了一种从单张 RGB 图像恢复生物力学骨骼和表面网格的粗到细框架:先用高质量 HMR-SKEL 数据集训练,再用显式相机内参建模消除深度歧义,最后通过编码器粗预测 + 解码器逐层迭代优化的策略,在 MOYO 等挑战性数据集上大幅超越此前 SKEL 方法 HSMR(MPJPE 降低 18.6%),同时达到与 SMPL 方法相当甚至更优的数值精度,且输出解剖学上更合理的姿态。

Sonar-MASt3R: Real-Time Opti-Acoustic Fusion in Turbid, Unstructured Environments

Sonar-MASt3R 将 MASt3R 的稠密光学匹配与声纳重建的尺度信息实时融合,在浑浊水体中实现带公尺度的高质量三维重建,经实验验证在 0.5—12 NTU 的浊度范围内均保持鲁棒。

SPECSIA: Stylization Dataset for Novel-View Enhancement in Drawing-based 3D Animation

本文提出 SPECSIA-15K 成对风格化数据集(14,980 对带伪影投影与干净目标)和轻量即插即用后校正模块 DraViE,通过数据级预训练先验替代样本级逐帧优化,有效消除绘图驱动 3D 动画中新视角下的投影伪影并保持原画风格。

SpectralSplats: Robust Differentiable Tracking via Spectral Moment Supervision

把 3DGS 可微跟踪的监督目标从空间域(逐像素光度误差)换成频域(谱矩),配上一套从相位缠绕原理严格推导出来的频率退火调度,让高斯资产即便初始化时和目标完全不重叠也能获得非零的方向梯度、平滑地"流"到正确位姿——从而无需人工对齐或类别先验就能做鲁棒跟踪。

StereoGS: Sparse-View 3D Gaussian Splatting via Stereo Priors

StereoGS 通过构建虚拟立体相机对、引入立体深度正则化和梯度感知透明度衰减,解决了稀疏视角 3DGS 中单目深度先验固有的尺度模糊与跨视角不一致问题,在 LLFF、DTU、Mip-NeRF360 和 Blender 四个数据集上达到新视角合成的最优水平。

TORA: Topological Representation Alignment for 3D Shape Assembly

TORA 在训练一个基于 flow-matching 的 3D 装配模型时,额外让它对齐一个冻结的预训练 3D 编码器的「点与点之间谁像谁」的关系结构(用 CKA 损失匹配 Gram 矩阵),从而把几何交互先验蒸馏进网络,收敛提速最高 6.9 倍、跨域鲁棒性显著提升,且推理时零额外开销。

Towards in-the-wild Egocentric 3D Hand-Object Pose Estimation

本文用「手上接触区 → 双射传到物体 → 优化拟合」的低成本标注流程造出首个野外第一人称手物接触数据集 EPIC-Contact,并提出把预训练手部先验通过 cross-attention 注入物体特征的端到端网络 HOPformer,一次前向同时回归双手与物体姿态,在 ARCTIC 上把成功率从 76.2% 提到 82.4%,在野外数据上成功率近乎翻倍、接触偏差降 75%。

UniPR-3D: Towards Universal Visual Place Recognition with Visual Geometry Grounded Transformer

UniPR-3D 首次将 VGGT 的 3D 几何感知 token 引入视觉位置识别,针对 2D 和 3D token 的不同特性设计定制聚合策略,同时支持单帧和变长序列匹配,在多个基准上超越现有单视图和多视图方法。

UniTriSplat: A Unified 3D Gaussian Splatting Framework with Uniform Spherical Rasterization for Universal Cameras

把 3D Gaussian Splatting 的光栅化从「针对某一类相机的平面投影」搬到「单位球面上的 HEALPix 等面积网格」,用一套 camera-agnostic 的球面光栅器统一支持透视 / 鱼眼 / 全景相机,既消除了等距柱状投影的极区过采样、又拿到了稳定的跨相机泛化。

URoPE: Universal Relative Position Embedding across Geometric Spaces

URoPE 将 key 图像块沿相机射线在固定深度锚点处提升为 3D 点、再投影到查询视图图像平面,让标准 2D RoPE 能直接编码跨视图/跨几何空间的相对位置关系,是一种参数无关、内参感知、坐标系统无关且兼容 FlashAttention 的通用位置编码。

ViewSplat: View-Adaptive 3D Gaussian Splatting for Feed-Forward Synthesis

ViewSplat 给无位姿前馈 3DGS 补上一个「视角自适应」环节——先预测一套基础高斯 + 一套场景条件化的 View MLP,渲染时让这些 MLP 吃目标视角坐标、为每个高斯的全部属性(位置/尺度/旋转/不透明度/颜色)现场算出残差偏移,从而在保持实时渲染(最大骨干仍有 90 FPS)的同时把镜面高光、锐利反射这类静态表示丢失的高频视角相关效果重建出来,刷新了 pose-free NVS 的保真度 SOTA。

Vitality-Aware Compression for Efficient Image-to-Shape Diffusion Transformers

针对图生 3D 形状的 Diffusion Transformer(DiT),本文用一个基于 Earth Mover's Distance 的「层活力(vitality)」指标度量每层对几何合成的贡献,据此做结构化剪枝 + 分层混合精度量化 + 只微调最低活力层的定向蒸馏,在 Step1X-3D / Hunyuan3D 等 SOTA 模型上把 backbone 压缩最多 66% 而几乎不掉几何保真度。

VOCA: Visual Odometry with Codec Awareness

VOCA利用H.264视频编码过程中内置的运动矢量作为KLT光流跟踪的初始化先验,在Basalt框架上实现了对百倍压缩视频的高精度因果视觉里程计,在EuRoC、TUM-VI和MSD三个数据集上全面超越了现有方法。

VolSplat: Rethinking Feed-Forward 3D Gaussian Splatting with Voxel-Aligned Prediction

VolSplat 将前馈 3D Gaussian Splatting 的基元预测范式从逐像素对齐改为逐体素对齐:先将多视图 2D 特征通过深度图反投到 3D 空间形成体素特征网格,经稀疏 3D U-Net 残差精化后逐体素预测高斯参数,从而从根本上解耦 3D 表征与输入图像分辨率的刚性绑定,实现自适应高斯密度分配。

Walking in the Implicit: Interactive World Exploration via Neural Scene Representation

NeuWorld 把交互式世界探索的"rollout 状态"从会不断增长的视频帧潜变量,换成一组定长、可渲染、局部锚定的神经隐式场景(NIS)token,让扩散模型只在这个紧凑状态空间里做转移、再用冻结解码器按查询相机位姿渲染观测,从而在完全从零训练、不借助任何预训练视频大模型的前提下,取得优异的长程位姿一致性、回访一致性与推理效率。

Zero-Shot Depth from Defocus: 从对焦堆栈零样本估计度量深度

本文提出 FOSSA,一个基于 Transformer 的零样本对焦深度估计网络,通过新颖的堆栈注意力层高效聚合焦点堆栈中的散焦线索,并在大规模合成数据上训练后实现了跨数据集、跨场景的强零样本泛化;同时发布了 ZEDD——一个包含 100 个场景、4K 分辨率、LiDAR 真值的高质量对焦深度实测基准。