🎨 图像生成¶
🎞️ ECCV2026 · 56 篇论文解读
📌 同领域跨会议浏览: 📷 CVPR2026 (490) · 🔬 ICLR2026 (352) · 💬 ACL2026 (5) · 🧪 ICML2026 (141) · 🤖 AAAI2026 (79) · 🧠 NeurIPS2025 (221)
🔥 高频主题: 扩散模型 ×15 · 对齐/RLHF ×5 · 文生图 ×3 · 图像编辑 ×3 · 超分辨率 ×2
- Accelerated Likelihood Maximization for Diffusion-based Versatile Content Generation
-
ALM 提出一种完全无需额外训练的扩散模型采样策略,在逆扩散过程中对未观测区域进行显式似然最大化优化,并利用「相邻迭代更新近似相等」的性质将 N 轮迭代坍缩为单次更新,在图像补全/外扩、人体动作补全、3D 纹理生成和长视频生成等多模态任务上以零训练成本大幅超越此前最先进方法。
- Advancing WordArt-Oriented Scene Text Recognition: Datasets and Methods
-
本文从数据和模型两个维度系统推进艺术字场景文本识别(WATER):数据侧构建了 2M 规模的合成艺术字数据集 WATER-S(渲染子集 WATER-T + 生成模型子集 WATER-Z),模型侧提出支持任意形状输入 + 自回归解码的 WATERec,首次在 WordArt-Bench 上突破 90% 准确率(90.40%),显著超越通用 VLM 和 OCR 专用 VLM。
- Anchoring on Reality: Breaking the Pseudo-Target Ceiling in Makeup Transfer
-
提出ART双阶段DiT框架,通过可微分现实锚定循环——从裸肤参考重建真实参考让梯度回传惩罚遗漏——突破伪目标天花板,在2K分辨率下实现密集贴纸、面部彩绘等复杂妆容的高保真迁移。
- AVSR-Diff: Scale-Agnostic Diffusion Priors for Temporally Consistent Arbitrary-Scale Video Super-Resolution
-
提出 AVSR-Diff,将扩散模型的尺度无关潜在去噪与连续坐标解码解耦,通过 TGFR 模块做跨帧特征对齐抑制 flickering、SAFR 模块做傅里叶域尺度自适应频率调制,在任意尺度 VSR 上首次同时实现强生成质量与稳定时序一致性,且计算开销不随输出分辨率增长。
- C3-Bench: A Context-Aware Change Captioning Benchmark
-
C3-Bench 是一个面向上下文感知变化描述任务的综合性基准,包含 4,996 对人类标注图像对(覆盖 4 大领域 51 种真实变化上下文),首次将 LLM-as-Judge 引入变化描述评测体系,并引入可逆性指标;对 32 个模型的测评揭示了传统模型在开放域下全面崩溃、LMM 存在系统性感知/空间/位置偏误等关键盲区。
- Continuous Speculative Decoding for Autoregressive Image Generation
-
本文首次将推测解码从离散分布扩展到连续分布,通过去噪轨迹对齐(denoising trajectory alignment)提升 draft-target 接受率,再配合接受-拒绝采样(acceptance-rejection sampling)解决修正分布无解析表达式的采样难题,在 MAR、xAR、Harmon 等多个连续视觉 AR 模型上实现超过 2 倍墙钟加速且保持生成质量不变,全程无需额外训练。
- Curvature-Adaptive Consistency Flow Matching: Autonomous Trajectory Optimization via Reinforcement Learning
-
CACFM 将一致性蒸馏重新建模为动态决策过程,用轻量 RL agent 自动探测 PF-ODE 轨迹上的高曲率瓶颈段并优先训练,结合 Flow 适配的 DMD 和对抗一致性损失,在 FLUX 和 SDXL 上以 4 步推理达到 SOTA,FID 比 FLUX-schnell 低 2 个点以上。
- Diffusion Integrated Gradients: Controllable Path Generation for Flexible Feature Attribution
-
DiffIG 将积分梯度(IG)中的归因路径生成重铸为条件生成建模问题——用扩散模型学习 Stick-Breaking Process 生成的路径分布,推理时通过忠实度与复杂度双重引导采样,生成自适应的非线性积分路径,在 Oxford-IIIT Pet 和 Mini-ImageNet 上 DiffID 指标大幅超越现有路径归因方法。
- Divide and Conquer: Decoupled Representation Alignment for Multimodal World Models
-
M2-REPA 通过将扩散模型的中间特征解耦为模态专属的子空间,分别与 DINOv2、DepthAnythingV2、SAM2 等模态专家进行表示对齐,并借助 CKA 正则化压制跨模态冗余,首次将单模态 REPA 扩展到了多模态视频生成场景,在三模态(RGB-深度-掩码)生成中取得了显著提升。
- DivRL: Disentangled Self-Similarity Rewards for Diverse Subject-Driven Generation
-
DivRL 提出基于 Flow-GRPO 的后训练框架,通过解耦的视觉特征分别衡量结构多样性和身份一致性,并用「探索-抑制」两阶段优化策略让模型同时生成高身份保持和高结构多样性的图像。
- Don't Settle at the Mode! Mitigating Diversity Collapse in Pretrained Flow Models via Feature Self-Guidance
-
本文发现预训练流匹配模型(如 FLUX)在相同条件输入下生成多样本时会出现内部 MMDiT 特征坍塌,进而导致输出多样性坍塌;提出一种免训练的推理时特征自引导(Feature Self-Guidance)机制——对 batch 内样本的中间特征做迭代分散后,再通过同一 MMDiT block 重投影回流形,以极小的推理开销显著提升生成多样性,同时保持 prompt 对齐度。
- DriftScope: Measuring The Hidden Effects of Diffusion Model Adaptation
-
本文证明文本到图像扩散模型在概念定制和概念遗忘两种适配操作中都会系统性地损害语义无关的其他概念(零样本分类最差类别掉点最高 18.9 分),而 FID/KID 等聚合指标对此结构性盲视;作者提出 DriftScope,一种基于软提示优化的 token 级概念漂移诊断工具,通过最大化两检查点间交叉注意力图的差异来排定受漂移影响最严重的 token。
- DTI: Dynamic Trajectory Initialization for Generative Face Video Super-Resolution
-
DTI 提出一种"动态轨迹初始化"范式,将生成式人脸视频超分从"全生成"重新定义为"输入驱动的定向恢复"——通过判别式引导器(DG)结合 SNR 对齐理论,为每个低质量输入动态确定扩散采样起点,仅需少量微调就在保真度、感知质量和推理效率上全面超越现有方法。
- Dual-End Consistency Model
-
DE-CM 通过从 PF-ODE 整条轨迹中挑选三条关键子轨迹(一致性轨迹 + 瞬时速度轨迹 + 噪声到噪声轨迹)作为优化目标,用流匹配做边界正则化稳定训练,用 N2N 映射缓解误差累积,在 ImageNet 256 上以一步生成达到 FID 1.70 的 SOTA 水平。
- Edit in 2D, Verify in 3D: Reinforcement Learning for Multi-view Consistent Scene Editing
-
RL3DEdit利用GRPO强化学习框架,以VGGT三维基础模型的置信度图和位姿预测作为几何感知奖励信号,无需成对3D编辑数据即可将FLUX-Kontext二维编辑器锚定到三维一致流形上,实现单遍推理的高效多视图一致3D场景编辑。
- Entropy-Controlled Flow Matching
-
ECFM(Entropy-Controlled Flow Matching)在标准 flow matching 目标上增加了一个熵率约束 \(\frac{d}{dt}\mathcal{H}(\mu_t) \geq -\lambda\),从理论上证明了该约束等价于 Schrödinger Bridge,能提供可证明的模式覆盖保证(mode-coverage certificates),并在 \(\lambda \to 0\) 时 \(\Gamma\)-收敛到经典最优传输。这是 flow matching 方向一篇纯理论论文,建立了约束变分原理与熵控传输的数学基础。
- FedOT: Ownership Verification and Leakage Tracing via Watermarks for Federated LDMs
-
FedOT 提出在联邦潜扩散模型训练中嵌入分块水印并结合潜向量变换(LVT),首次同时实现所有权验证和恶意客户端溯源,即使攻击者替换带水印的 VAE 也无法去除水印而不严重损伤生成质量。
- Few-Shot Synthetic Image Attribution: Identifying Unseen Generators with Limited Samples
-
本文定义了一个全新的「少样本合成图像溯源」任务——用每类仅 10 张参考图就能识别训练时未见过的图像生成器,并构建了含 45 个独立生成器(无 PEFT 变体)的 OmniFake 数据集和双路径对比学习基线 OmniDFA,在溯源与检测上均显著超越前人。
- 无滤波快照高光谱成像:基于引导Patch扩散模型
-
本文提出一种基于 patch 条件扩散模型的无滤波快照高光谱成像方法,仅用一片衍射透镜(metalens)加无滤波全色传感器拍摄单张灰度图,即可重建出 H×W×31 的高光谱图像;核心是在推理时通过光学点扩散函数(PSF)的物理一致性引导同步各 patch 预测,在 ARAD1K 上以 34.6 dB PSNR 超越此前最优方法近 2.9 dB,并能提供与重建误差高度相关(r=0.80)的逐像素不确定性估计。
- Focusing on What Matters: Saliency-Harnessing Accurate Routing for Diffusion MoE
-
SharpMoE 提出一种即插即用的后训练框架,利用前一步去噪预测的干净潜变量 x̂₀ 替代噪声潜变量作为路由器输入,解决扩散 MoE 中"噪声路由"导致显著性 token 识别失败的核心问题,并辅以轨迹路由损失全局对齐累积计算分配,仅需 100K 步后训练即可显著提升多种已收敛预训练扩散 MoE 模型的生成质量。
- FUMO: Prior-Modulated Diffusion for Single Image Reflection Removal
-
FUMO 提出一种先验调制的扩散框架用于单图像反射去除,从混合图像中提取 VLM 驱动的反射强度先验和多尺度高频先验,通过门控机制对 ControlNet 的条件残差注入进行空间自适应调制,再经粗到细两阶段(一步去噪扩散粗恢复 + 细粒度精修模块)在三个标准基准和真实场景中取得有竞争力的量化结果和一致的感知质量提升。
- Gen2Balance: Generative Balancing for Long-Tailed Video Action Recognition
-
Gen2Balance 用文生视频模型(WAN 2.1)为长尾视频动作识别合成尾部类样本,通过 VLM(Gemini 2.5 Pro)驱动的三层提示管线(多样化 + Action Profile 消歧 + In-Context Exemplars 锚定)保证生成视频的多样性和语义正确性,再配合两阶段训练策略(合成+真实数据学特征,纯真实数据校准),在 K100-LT 和 UCF-LT 上分别超越最强长尾基线 7.0% 和 5.1%,在 RareAct 稀有动作上提升 31.9%。
- GeoEdit: Geometry-Aware Object Editing via Dual-Branch Denoising
-
GeoEdit 用一条免训练的「抬升-操纵-渲染-去噪」流水线,先把单张照片解耦重建到 3D、按用户指定的 3D 变换(平移/旋转/缩放)渲染出一张几何对齐的粗代理图,再用「双分支去噪」在去噪窗口内以方差齐性的方式把 3D 约束只注入前景、让背景自由生成,从而在遵守透视/遮挡等物理约束的同时兼顾前景刚性与背景真实感。
- H-Adapter: Pose-Robust Hairstyle Transfer via Attention-Derived, Source-Aligned Hair Masks
-
H-Adapter 用一个「区域特定损失」把 IP-Adapter 微调成只在头发区域注入参考发型、在非头发区域保持原样的适配器,训练后的交叉注意力自然分离出头发/非头发,从中导出一张与源头姿态对齐的粗掩码来引导两阶段扩散 inpainting,从而在源图与参考图头姿差异很大时也能把发型放对位置、贴合脸型。
- Histogram-constrained Image Generation
-
本文提出 HIG,在扩散模型采样过程中利用最优传输(OT)将中间预测显式变换为与目标直方图精确匹配的分布,从而在直方图粒度实现精确、可解释、训练无关的可控生成,并拓展到高容量信息嵌入和隐空间直方图匹配。
- In-context Region-based Drag: Drag Any Region to Any Shape
-
ICRDrag 将区域拖拽(region-based drag)建模为上下文学习(in-context learning)任务,以源图像、源区域掩码、目标区域掩码作为统一条件输入 DiT,通过图像-掩码注意力一致性(IMAC)和源-目标注意力对应性(STAC)两个新颖的正则化损失引导生成目标图像,并配套构建了 28.7 万样本的 Paired Region Dataset(PRD),在编辑精度、视觉保真度和用户偏好上显著超越已有方法。
- Intermediate Text Representation Guided Text-to-Image Generation for Enhancing One-and-Only Alignment
-
本文通过信息论分析证明文本编码器中间层比最终嵌入保留更多概念互信息,提出 IR-guided diffusion——在去噪早期将中间隐藏状态注入条件信号以恢复被强先验压制的属性,无需训练或外部模型,在 OAO-AttackBench 上 VQAScore 最高提升 19.1 个百分点,同时保持生成质量与人类偏好。
- ISAC: Training-Free Instance-to-Semantic Attention Control for Multi-Instance Generation
-
ISAC 通过层次化、实例优先的免训练注意力控制方法,先利用自注意力在早期去噪步中稳定实例布局,再在已确立的实例区域内绑定额外语义,显著提升扩散模型多实例生成的计数准确率和语义分离度。
- Layout-Conditioned Autoregressive Text-to-Image Generation via Structured Masking
-
SMARLI 提出结构化掩码策略,通过显式控制自回归 Transformer 中文本提示词、布局和图像三类 token 之间的注意力交互,在无需修改模型架构的前提下实现 AR 模型的布局可控图像生成;并首次将 GRPO 后训练引入 AR 布局到图像生成,设计包含 VQA、mIoU、precision 的复合布局奖励,在 LayoutSAM-Eval 和 OverLayBench 上以 1.3B 参数超越多数扩散模型 SOTA。
- Learn Once, Edit Anywhere: Visual Direction Transfer for Diffusion Models
-
ViDiT 提出一种"学一次,到处编"的框架:从少量图像编辑对(before/after)中优化一个连续的潜在方向 d,将该方向注入扩散模型的 CFG 推理过程,实现对任意图像零样本、解耦、强度可控的细粒度属性编辑,无需微调基座模型也无需逐图像优化。
- MEPA: Multi-Scale Representation Alignment for Visual Autoregressive Modeling with Mixture of Experts
-
MEPA 针对 VAR(Visual AutoRegressive)模型中共享架构导致的多尺度表示学习冲突和早期尺度语义错误传播问题,提出尺度感知的 Token 路由混合专家(STMoE)解耦不同尺度的模型容量,并结合自监督视觉特征(DINOv3)对早期尺度的残差聚合表示做语义对齐,在 ImageNet 256x256 上用一半训练轮数即超越 VAR 基线,FID 降低 0.63-0.69。
- MGI: Member vs Generated Inference
-
本文提出一个新任务 MGI(Member vs Generated Inference):给定一个样本和一个生成模型,判断该样本是模型的训练成员还是模型自己生成的输出;并设计了三阶段级联方法 DCB,利用自编码器重建/量化误差过滤生成样本、再用潜空间生成器做成员推理、最后跨生成器比较条件概率做溯源,在 IAR 和扩散模型上均显著超越现有 MIA 和归属方法。
- MIMFlow: Integrating Masked Image Modeling with Normalizing Flows for End-to-End Image Generation
-
MIMFlow 提出一种端到端框架,通过在 VAE 编码器中对掩码图像使用可学习 Token 瓶颈提取语义潜在表示,让归一化流专注于低频语义流形建模、解码器负责高频纹理合成,在 ImageNet 256x256 上用仅 128 个 token(比标准模型少 50%)达到 FID 2.50 和 71.3% 线性探测准确率。
- MindFlow: Harmonizing Cognitive Semantics and Acoustic Dynamics for Facial Animation Generation in Dyadic Conversations
-
MindFlow 受神经科学腹侧-背侧双通路模型启发,将双人对话中的面部动画生成解耦为认知语义理解(Ventral 模块)与反射性运动生成(Dorsal 模块)两条协同通路,通过 Chunk-State 方法从音频块中提取细粒度情感状态并指导流匹配网络生成高保真面部动画。
- MirrorPPR: Exemplar-Based Portrait Photo Retouching
-
MirrorPPR 提出示例引导的人像结构修图任务,通过专用的编辑操作提取器(MAE + R-Former)+ 连接器 + DiT 双流骨干(Qwen-Image-Edit-2511)+ LoRA 适配管线,配合自增强数据策略生成的 4700 万对数据集,首次实现了精细结构修图操作的精准跨身份迁移。
- NoiseTilt: Noise-Tilted Reverse Kernels for Diffusion Reward Alignment
-
本文提出 NTRK(Noise-Tilted Reverse Kernel):在扩散推理时不改反向核的均值,而是把奖励梯度经一个「白化算子」变成一个合法的高斯噪声方向后注入到噪声项里,从而在每步只采一个样本的前提下同时拿到「梯度引导」和「噪声兼容性」;在美学图像生成上仅用 25 NFE 就超过了最强基线在 500 NFE 下的奖励,算力降低 20 倍。
- Not All Prediction Targets Keep Training-Free Diffusion Guidance on the Manifold
-
本文从理论上证明扩散模型的预测目标(\(\epsilon\)-prediction / \(v\)-prediction / \(x\)-prediction)在训练免引导(training-free guidance)下形成严格的误差放大层级,\(\epsilon\)-prediction 因恢复公式中 \(1/t\) 因子在高噪声步发散而导致样本脱离数据流形,而 \(x\)-prediction 直接输出干净图像、无误差放大;实验通过 crossed-lines 控制消融、143 种鸟类细粒度基准和风格迁移三个维度验证了该层级,并引入 Child FID 作为流形感知评估指标。
- Obliviate: Erasing Concepts from Autoregressive Image Generation Models
-
把扩散模型里成熟的「负向引导概念擦除」搬到自回归图像生成模型上,通过共享视觉前缀对齐条件/伪无条件两路预测、在整条 token 轨迹上做 KL 分布监督,在几乎不损伤模型效用的前提下把裸露、血腥、品牌 logo 等概念擦干净(Liquid 上 RAB 裸露检测率从 91.58 降到 3.15)。
- OTCache: Optimal Transport for Geometry-Aware Caching in Diffusion Models
-
OTCache 提出免训练的扩散模型加速框架,通过最优传输理论将不同推理预算下的缓存调度建模为策略空间的连续演化轨迹,以高预算图搜索参考调度和低预算黑盒搜索锚点为两端点,在 Wasserstein 空间中通过分位数插值预测任意目标预算的调度方案,在 FLUX.1、Qwen-Image 和 HunyuanVideo 上分别实现 4.5x、4.7x 和 3.66x 加速,同时一致优于现有图搜索缓存基线。
- Phase-Aligned RoPE for Mixed-Resolution Diffusion Transformer
-
本文首次揭示 RoPE 在混合分辨率 DiT 中失败的根本原因——注意力分数是 token 相对距离的正弦周期函数 \(\kappa(\Delta)\),不同分辨率 token 被映射到统一坐标空间后落到 \(\kappa(\Delta)\) 曲线的不同相位,导致注意力分数系统性失真;据此提出训练无关的 Phase-Aligned Mixed-Resolution Attention (PMA),对每个查询-键对在查询的原始尺度上计算位置偏移,恢复一致的相位基准,配合轻量边界精修模块 (BER),在 Wan 视频模型和 FLUX 图像模型上以 4 倍加速实现与全分辨率可比甚至更优的生成质量。
- PhyEditBench: A Real-World Multi-Stage Benchmark for Physics-Aware Image Editing
-
PhyEditBench 是首个专门评估指令式图像编辑模型物理推理能力的基准,包含 4 大类 12 子类的真实世界物理场景和反物理实例;同时提出训练无关的 PhyWorld 方法,将视频生成模型作为物理推理引擎,配合测试时扩展与 latent 压缩策略,在 5B 参数下超越多数开源编辑模型。
- Prompt2Effect: Training-Free Image-to-Video Model Specialization via LoRA Generation
-
Prompt2Effect 提出一种权重驱动的超网络,通过显式利用冻结基模型权重作为条件、并将 LoRA 参数预测空间规范化为 SVD 能量排序形式,在单次前向传播中直接合成效果专属 LoRA 权重,实现 I2V 扩散模型的零样本训练无关效果控制,推理仅需 3.3 秒而质量堪比完整 LoRA 微调。
- Rethinking Garment Conditioning in Diffusion-based Virtual Try-On: Decouple, Don't Denoise
-
DeCo-VTON 通过可视化分析双 UNet 参考网络的噪声预测行为,首次揭示空间拼接式虚拟试穿中全参数微调失效的根本原因——服装条件与去噪过程耦合导致的三个功能冲突——并对应提出三个解耦设计原则(服装无关引导、解耦损失、干净潜变量锚定),在不改动网络架构的前提下,以单 UNet 860M 参数达到甚至超越双 UNet 1.8B 参数 SOTA 模型 Leffa 的试穿效果。
- Revisiting Autoregressive Models for Generative Image Classification
-
本文重新审视自回归(AR)模型在生成式图像分类中的潜力,发现固定token序是限制AR分类器性能的关键瓶颈,提出用任意序AR模型(RandAR)对多个随机token序的类别条件对数似然取Jensen下界平均(序边际化),在ImageNet及多个OOD基准上全面超越扩散分类器且推理快25倍,并首次使生成式分类器达到与DINOv2可竞争的水平。
- Semantic Browsing: Controllable Diversity for Image Generation
-
提出 Semantic Browsing 框架,用多智能体 VLM 流水线将用户提示词自动扩展为结构化 JSON 场景表示,再通过系统性变异语义维度生成层级多样性图像画廊,实现可导航、可解释的可控多样性生成。
- SONIC: Spectral Optimization of Noise for Inpainting with Consistency
-
SONIC 提出一种免训练的扩散模型图像修复方法,核心思想是优化初始噪声样本使其经过去噪后能忠实重建未遮挡区域,通过去噪轨迹线性化绕过昂贵的反向传播,并在频谱域中用 Adam 做预条件优化以实现稳定收敛,在三个标准修复数据集上全面超越现有方法(包括需要专门训练的 BrushNet)。
- Spanning the Visual Analogy Space with a Weight Basis of LoRAs
-
LoRWeB 用一组可学习的 LoRA 基(basis)替代单 LoRA 做视觉类比编辑:一个轻量 CLIP 编码器根据输入类比样本对动态计算 attention 权重,将 N 个基 LoRA 加权组合成任务专属的混合 LoRA 注入 Flux.1-Kontext,在推理仅比单 LoRA 慢 3% 的前提下实现了对未见变换类型的显著泛化提升。
- SRUM: Fine-Grained Self-Rewarding for Unified Multimodal Models
-
SRUM 提出一种自奖励后训练框架,让统一多模态模型(UMM)的理解模块扮演内部评估器,通过全局-局部双奖励系统为生成模块提供细粒度纠正信号,显著提升复杂文本到图像生成的质量。
- Symbiotic-MoE: Unlocking the Synergy between Generation and Understanding
-
Symbiotic-MoE 在原生 MoE Transformer 架构内通过模态感知专家解耦与渐进式训练策略,在零参数开销下解决了生成与理解任务的梯度冲突,实现两类能力协同提升——生成质量优于 MoT/Bagel,而理解能力(MMLU +20.1%、OCRBench +13.8%)甚至超过了仅做理解任务的基线。
- Text-Conditioned Background Generation for Editable Multi-Layer Documents
-
把一份多页文档当成「文本 / 图 / 背景」三层可分离的结构,用一个免训练的框架只重新生成背景层:在扩散潜空间对前景区域做软性衰减以护住文字,用一套对比度驱动的算法自动给文字加半透明底衬保证可读性,再用递归摘要-指令记忆把主题风格贯穿全篇,最终在可读性(WCAG 99.75% / OCR 0.97)和用户偏好(83.57%)上大幅甩开 BAGEL 和 GPT-5。
- The Illusion of High Utility in Safety Alignment of Text-to-Image Diffusion Models
-
这篇论文揭穿了「T2I 安全对齐既安全又不掉能力」的假象——粗粒度指标(FID / CLIPScore)看不出的细粒度指令遵循能力其实大幅退化,根因是文本编码器嵌入空间发生「语义坍缩」,并提出 SAGE 用两个几何正则项(保住嵌入铺展 + 保住局部相似结构)在几乎不牺牲安全的前提下把结构化保真度追回来。
- UniTranslator: A Unified Multi-modal Framework for End-to-end In-Image Machine Translation
-
UniTranslator 提出统一多模态框架解决图像内机器翻译(IIMT),用理解-生成对齐模块(UGAM)在表示层面缓解翻意预测与视觉渲染之间的监督冲突,并用空间掩码解码器(SMD)提供像素级文字区域定位,在 Translatotron-V、IIMT30k、PRIM 三个基准上均取得 SOTA。
- UNITY: Attention Flow Networks for Adaptive Conditioning in Diffusion
-
UNITY 提出一种 Universal-to-Specialized 两阶段训练范式和 Morphable Attention Flow 网络,用一个固定参数量的适配器同时支持多模态复合条件控制,训练成本降低 37.5%,FID/CLIP 全面超越 ControlNet、Uni-ControlNet 等方法。
- Universal Image Immunization against Diffusion-based Image Editing via Semantic Injection
-
针对扩散模型恶意编辑,本文训练一张与图像无关的通用对抗扰动(UAP),通过「注入目标语义 + 抑制源语义」两个损失让扩散模型把被保护图误认成某个目标概念(如把狗看成「Ronaldo」),从而在测试时只需一次加法就能阻断非法编辑,推理开销近乎为零。
- ViDiT:从图像编辑对中学习可迁移的连续视觉方向
-
ViDiT 提出从少量"编辑前-编辑后"图像对中学习一个全局连续的编辑方向向量,将其注入预训练扩散模型的 CFG 条件空间,实现零样本、解耦、强度可控的图像属性编辑,无需微调基础模型或逐样本优化。
- VTEdit-Bench: A Comprehensive Benchmark for Multi-Reference Image Editing Models in Virtual Try-On
-
VTEdit-Bench 提出了首个系统评估通用多参考图像编辑模型在虚拟试衣场景中表现的基准,包含 24,220 个测试对、5 个复杂度递增的任务,并配套 VTEdit-QA(基于 GPT-4o 的参考感知评估器)实现细粒度自动评价,实验表明通用编辑模型在经典试衣任务上与专用模型持平,在复杂场景下泛化更稳定,但在多衣物组合控制上仍有明显差距。