跳转至

🎨 图像生成

🧠 NeurIPS2026 · 6 篇论文解读

📌 同领域跨会议浏览: 🎞️ ECCV2026 (337) · 📷 CVPR2026 (490) · 🔬 ICLR2026 (352) · 💬 ACL2026 (5) · 🧪 ICML2026 (141) · 🤖 AAAI2026 (79)

🔥 高频主题: 扩散模型 ×4

All Roads Lead to Rome: Flow-driven Multi-Anchor Exploration for Open-Environment Active 3D Mapping

本文用条件流匹配生成多个长期探索锚点,再通过障碍感知规划、探索模式聚类与层次路径选择决定机器人怎么走,在 AiMDoom 同难度评测及难度迁移、AiMDoom→MP3D 跨数据集迁移中提高建图覆盖率,但不提供任意开放环境的泛化保证。

One View Is Enough: In-the-Wild Monocular Pretraining for Novel View Generation

OVIE 用冻结深度模型把 30M 张单图转换为局部有效的伪视图训练对,以遮罩重建与感知损失学习可见区域、以全图对抗先验补全未知区域,最终仅凭源图和目标位姿单次前向生成新视角,在 H100 上达到 116 FPS,并能通过多视图微调提升域内表现。

Panoptic Scene Program Diffusion Transformer

PSP-DiT 把包含实例、属性、关系与数量的全景场景程序变成与图像共同去噪的潜变量,用区域归属和循环一致性监督约束其视觉实现,在匹配的内部基线上将 GenEval 2 从 32.8 提升至 38.2,同时报告约 1.12 倍推理时延。

PixelDiT2: Representation-Grounded Pixel Diffusion Transformers

PixelDiT2 在每次像素去噪时重新编码当前噪声图像,以冻结 DINO 的逐块表示和时间步适配器提供空间条件,在不引入自编码器的前提下取得 ImageNet-256 的 FID 1.46(600 epochs)和 ImageNet-512 的 FID 1.48(680 epochs)。

Rethinking Cross-Layer Information Routing in Diffusion Transformers

DAR 将扩散 Transformer 的逐层残差累加改为时间步感知的历史子层输出注意力,在 ImageNet 256×256 上以 600K 步取得无 CFG 的 ODE FID 7.56,相比训练 1.75M 步的 SiT 基线降低 2.11,并能与 REPA 的表征对齐损失结合。

Revisiting Diffusion Fine-Tuning for Unsupervised Domain Adaptation

MUSE 将扩散生成器的适应拆成仅由源域标签训练的共享语义分支和目标域条件化风格分支,一次源域参与的微调支持多个目标域生成桥接数据,在三个闭集分类基准上提升下游 UDA 平均准确率,并相对 Terra 将生成器微调时间缩短至原来的约一半至四成。