跳转至

🎞️ ECCV2026 论文汇总

420篇ECCV2026论文解读,涵盖 3D 视觉(67篇)、图像生成(56篇)、多模态 VLM(39篇)、自动驾驶(33篇)、视频生成(24篇)、人体理解(18篇)、目标检测(18篇)、VLM Reasoning(18篇)等 32个方向。每篇含一句话总结、核心思想、方法详解、实验结果与局限性分析,5分钟读懂一篇论文核心思想。


🦾 LLM Agent (4)

GUIDE: Resolving Domain Bias in GUI Agents through Real-Time Web Video Retrieval and Plug-and-Play Annotation

GUIDE 是一个免训练、即插即用的框架,通过从 YouTube 教程视频中自动检索并提取领域专用的规划知识(Planning)和定位知识(Grounding),注入 GUI Agent 的对应模块来消除领域偏置(domain bias),在 OSWorld 上为三种不同架构的 agent 带来 +4.47 到 +7.48 个百分点的提升。

NaLA: A 3D Native LLM Layout Agent for High-quality 3D Scene Generation

NaLA 提出了一种直接编码 3D 点云的大语言模型布局智能体,通过粗到细的位姿预测机制实现高质量、高效率的 3D 场景生成,在物理合理性、语义一致性和美观度上全面超越现有方法。

Think While You Map: Asynchronous Vision-Language Agents for Incremental 3D Scene Graphs

ThinkGraphs 提出异步架构,将轻量增量3D映射与重型VLM推理解耦,通过后台运行的 Critic Agent(语义闭环检测合并碎片化轨迹)和 Description Agent(多目标帧调度注入细粒度属性)在不阻塞在线映射的同时持续丰富场景图语义,在 Sr3D+/Nr3D/ScanRefer 三个视觉定位基准上超越此前最优 15.3-18.8 [email protected]

VisCritic: Visual State Comparison as Process Reward for GUI Agents

VisCritic 提出基于视觉状态对比的 GUI 智能体过程奖励框架,通过孪生 ViT 比较动作前后截图在语义特征空间中的差异,融合动作上下文联合预测动作成功概率、任务进度与错误类型,作为即插即用的推理时验证模块,在五个基准上普遍提升各类 GUI 智能体的任务成功率。


👥 Multi-Agent (1)

QuantV2X: A Fully Quantized Multi-Agent System for Cooperative Perception

QuantV2X 提出首个全量化多智能体 V2X 协作感知系统,通过端到端量化神经网络模型和通信消息表征,在 INT4/INT8 低比特下保持全精度模型 99.8% 的感知精度,同时将系统端到端延迟降低 3.2 倍,在 V2X-Real 数据集上 mAP30 反超全精度基线 +9.5。


🔒 LLM 安全 (5)

Learning to Compose: Revisiting Proxy Task Design for Zero-Shot Composed Image Retrieval

FoCo(Focus-then-Complete)将零样本组合图像检索(ZS-CIR)中的视觉-文本组合建模为可学习的"先聚焦后补全"两阶段过程,通过文本锚定的视觉聚合和上下文条件化的语义补全两个代理任务联合训练,配合跨实例对比损失防止捷径学习,在四个 ZS-CIR 基准上全面超越已有方法,且推理时不依赖 LLM。

Neural Gate: Mitigating Privacy Risks in LVLMs via Neuron-Level Gradient Gating

本文提出 Neural Gate,一种神经元级梯度门控的 LVLM 隐私风险缓解方法。核心思路是先通过可学习向量在隐私主体特征上测量各神经元对隐私目标的贡献一致性,将神经元分为强激活、弱激活、非激活三类,再在模型编辑时仅对强激活隐私神经元的梯度做参数更新,其余神经元梯度被截断。在 MiniGPT 和 LLaVA 上,Neural Gate 在敏感查询拒绝率超过 94% 的同时几乎不损失通用任务性能,且在分布外隐私类别上展现出强泛化能力。

ReShift: Aha-Moment-Driven Reasoning-Level Backdoor Attacks on Vision-Language Models

ReShift提出一种面向视觉语言模型的推理层后门攻击方法,利用强化学习激发的"啊哈时刻"(aha moment)认知行为,在推理轨迹中诱导可控转向,在保持推理逻辑连贯性的同时将预测结果重定向到预设目标答案,比传统输出层后门攻击更难被检测。

SlowBA: An efficiency backdoor attack towards VLM-based GUI agents

SlowBA 首次提出针对 VLM-based GUI agent 的效率后门攻击:通过两阶段奖励级后门注入(RBI),在 SFT 中教会 agent 生成超长回复、再在 RL 中用触发感知的奖励函数区分带触发器/干净输入,使 agent 在遇到弹窗类触发器时产生极高延迟响应,而任务准确率基本不变。

Towards Benign Memory Forgetting for Selective Multimodal Large Language Model Unlearning

提出"良性记忆遗忘"新范式与 S-MLLMUn Bench 评测基准,并设计 SMFA(Sculpted Memory Forgetting Adapter)框架,通过保留锚点引导的参数掩码精确抹除 MLLM 中的隐私敏感知识,同时不损伤模型的基础视觉理解能力。


👻 幻觉检测 (2)

From Hallucination to Grounding: Diagnosing Visual Spatial Intelligence via CRISP

CRISP 是一个结构诊断式视觉空间智能评测基准,通过 Spatial QA + 3D Scene Graph 双任务范式与跨任务一致性协议,揭示 VLM 的空间推理究竟是真正的 3D 几何理解还是依靠语言先验的语义捷径。

No Place to Hide: Benchmarking Video Hallucination with Background-Controlled Pairs

本文提出 VidPair-Halluc 视频幻觉 benchmark,用「背景高度相似、前景语义显著不同」的对抗视频对,把模型出错的原因从背景变化里剥离出来、干净地归因到前景幻觉;配套的 PairFlow 三阶段生成流水线借助 T2I / 视频生成模型自动造出 1K 高质量视频对与 11K 时空 QA,评测显示主流大视频模型在这种受控设置下普遍大幅掉点。


📚 预训练 (2)

360Anything: Geometry-Free Lifting of Images and Videos to 360°

360Anything 提出一种几何无关(geometry-free)的扩散Transformer框架,将透视输入和全景目标统一视为 token 序列、通过序列拼接让模型自行学习二者间的几何对应,无需任何相机元数据即可将任意视角图像/视频提升为重力对齐的无接缝 360° 全景图,在图像和视频两个任务上全面超越依赖真实相机参数的此前最优方法。

GryphOne: Symbol-Aware Masked Diffusion for Structural Refinement in Offline Handwritten Mathematical Expression Recognition

GryphOne 将手写数学表达式识别(HMER)从自回归序列生成重新定义为离散掩码扩散的迭代符号精炼过程,通过符号感知分词(SAT)保持局部编辑的语法一致性,并用随机掩码互学习(RMML)提升精炼稳定性,在 MathWriting 上以 5.51% CER 和 59.9% ExpRate 全面超越重实现的自回归基线及商用 HMER 系统。


💬 LLM 其他 (1)

SAM2Matting: Generalized Image and Video Matting

SAM2Matting 提出一种解耦的"跟踪器到抠图"框架,将视频抠图拆分为高层跟踪(冻结的 VOS 跟踪器如 SAM2/SAM3 负责时序一致性)和低层抠图(可训练的 ROI 检测器 + 渐进式 Alpha 预测器负责细粒度透明度估计),仅用图像抠图数据训练就在视频抠图基准上以 zero-shot 方式达到 SOTA,同时支持多种 prompt 类型、维持强时序一致性、在人类和开放场景下均泛化良好。


🔍 信息检索/RAG (2)

HyFL-CLIP: Hyperbolic Fine-Tuning of CLIP for Robust Long-Context Understanding

HyFL-CLIP 将预训练 CLIP 的欧氏图文对齐蒸馏到双曲空间(Lorentz 模型),通过爱因斯坦中点聚合建模"全局描述--局部成分"的层次蕴涵关系,使模型在长文本被扰动(重排、删除、丢词)时仍能稳定检索正确图像,在扰动词下比最强基线提升最高 19.5%。

LightSTAR: Efficient Visual Document Retrieval via Lightweight Selection with Vision-Adaptive Refinement

LightSTAR 针对视觉文档检索中 MLLM 全量编码页面太慢的问题,先用 LLM-free 轻量视觉选择模块高召回筛出候选,再只对候选做视觉自适应语义精排,在 ViDoRe 上达到 89.1 NDCG@5,同时把 5000 页端到端延迟降到 123.9s。


🎨 图像生成 (56)

Accelerated Likelihood Maximization for Diffusion-based Versatile Content Generation

ALM 提出一种完全无需额外训练的扩散模型采样策略,在逆扩散过程中对未观测区域进行显式似然最大化优化,并利用「相邻迭代更新近似相等」的性质将 N 轮迭代坍缩为单次更新,在图像补全/外扩、人体动作补全、3D 纹理生成和长视频生成等多模态任务上以零训练成本大幅超越此前最先进方法。

Advancing WordArt-Oriented Scene Text Recognition: Datasets and Methods

本文从数据和模型两个维度系统推进艺术字场景文本识别(WATER):数据侧构建了 2M 规模的合成艺术字数据集 WATER-S(渲染子集 WATER-T + 生成模型子集 WATER-Z),模型侧提出支持任意形状输入 + 自回归解码的 WATERec,首次在 WordArt-Bench 上突破 90% 准确率(90.40%),显著超越通用 VLM 和 OCR 专用 VLM。

Anchoring on Reality: Breaking the Pseudo-Target Ceiling in Makeup Transfer

提出ART双阶段DiT框架,通过可微分现实锚定循环——从裸肤参考重建真实参考让梯度回传惩罚遗漏——突破伪目标天花板,在2K分辨率下实现密集贴纸、面部彩绘等复杂妆容的高保真迁移。

AVSR-Diff: Scale-Agnostic Diffusion Priors for Temporally Consistent Arbitrary-Scale Video Super-Resolution

提出 AVSR-Diff,将扩散模型的尺度无关潜在去噪与连续坐标解码解耦,通过 TGFR 模块做跨帧特征对齐抑制 flickering、SAFR 模块做傅里叶域尺度自适应频率调制,在任意尺度 VSR 上首次同时实现强生成质量与稳定时序一致性,且计算开销不随输出分辨率增长。

C3-Bench: A Context-Aware Change Captioning Benchmark

C3-Bench 是一个面向上下文感知变化描述任务的综合性基准,包含 4,996 对人类标注图像对(覆盖 4 大领域 51 种真实变化上下文),首次将 LLM-as-Judge 引入变化描述评测体系,并引入可逆性指标;对 32 个模型的测评揭示了传统模型在开放域下全面崩溃、LMM 存在系统性感知/空间/位置偏误等关键盲区。

Continuous Speculative Decoding for Autoregressive Image Generation

本文首次将推测解码从离散分布扩展到连续分布,通过去噪轨迹对齐(denoising trajectory alignment)提升 draft-target 接受率,再配合接受-拒绝采样(acceptance-rejection sampling)解决修正分布无解析表达式的采样难题,在 MAR、xAR、Harmon 等多个连续视觉 AR 模型上实现超过 2 倍墙钟加速且保持生成质量不变,全程无需额外训练。

Curvature-Adaptive Consistency Flow Matching: Autonomous Trajectory Optimization via Reinforcement Learning

CACFM 将一致性蒸馏重新建模为动态决策过程,用轻量 RL agent 自动探测 PF-ODE 轨迹上的高曲率瓶颈段并优先训练,结合 Flow 适配的 DMD 和对抗一致性损失,在 FLUX 和 SDXL 上以 4 步推理达到 SOTA,FID 比 FLUX-schnell 低 2 个点以上。

Diffusion Integrated Gradients: Controllable Path Generation for Flexible Feature Attribution

DiffIG 将积分梯度(IG)中的归因路径生成重铸为条件生成建模问题——用扩散模型学习 Stick-Breaking Process 生成的路径分布,推理时通过忠实度与复杂度双重引导采样,生成自适应的非线性积分路径,在 Oxford-IIIT Pet 和 Mini-ImageNet 上 DiffID 指标大幅超越现有路径归因方法。

Divide and Conquer: Decoupled Representation Alignment for Multimodal World Models

M2-REPA 通过将扩散模型的中间特征解耦为模态专属的子空间,分别与 DINOv2、DepthAnythingV2、SAM2 等模态专家进行表示对齐,并借助 CKA 正则化压制跨模态冗余,首次将单模态 REPA 扩展到了多模态视频生成场景,在三模态(RGB-深度-掩码)生成中取得了显著提升。

DivRL: Disentangled Self-Similarity Rewards for Diverse Subject-Driven Generation

DivRL 提出基于 Flow-GRPO 的后训练框架,通过解耦的视觉特征分别衡量结构多样性和身份一致性,并用「探索-抑制」两阶段优化策略让模型同时生成高身份保持和高结构多样性的图像。

查看全部56篇「图像生成」论文 →


🎬 视频生成 (24)

AHOY! Animatable Humans under Occlusion from YouTube Videos with Gaussian Splatting and Video Diffusion Priors

AHOY 从严重遮挡的单目 YouTube 视频中重建完整可动画的 3DGS 化身——先用 DensePose+FLUX+多视角扩散粗建 canonical 化身,再通过 LoRA 微调的 Wan 2.2 视频扩散模型做 RF-Inversion 生成多视角"幻觉"监督视频,最后用 map-pose/LBS-pose 解耦吸收生成数据的不一致性,训练出带姿态依赖形变的高保真高斯图化身。

AR-CoPO: Align Autoregressive Video Generation with Contrastive Policy Optimization

AR-CoPO 提出分块级对比策略优化框架来对齐少步自回归视频生成器:通过分叉机制在随机选取的 chunk 处构造初始噪声邻域候选、局部 GRPO 更新实现信用分配,绕开了 SDE 式 GRPO 与一致性模型近确定性动力学之间的根本性不匹配;同时设计半在策略训练范式利用固定参考回放和 ratio clipping 信任域来提升文本语义对齐质量,避免纯探索导致运动质量崩溃,在 Self-Forcing 上实现 VBench 和 VideoAlign 双基准联合提升。

AVTok: 1D Unified Tokenization for Holistic Audio-Video Generation

AVTok 提出首个统一的音视频 tokenizer,用双流 Transformer 架构(共享编解码器 + 模态特定可学习查询)将音视频对联合编码到单个 1D 离散隐空间,配合 VFAL 分层训练策略和表示对齐学习,在重建质量和下游自回归生成任务(A2V / V2A / 联合生成)上均达到领先水平,且参数量和计算量远小于主流双分支方案。

Controllable Egocentric Video Generation via Occlusion-Aware Sparse 3D Hand Joints

本文提出用稀疏3D手部关节点作为显式控制信号驱动第一人称视频生成,通过遮挡移除的上下文聚合、3D深度加权的遮挡感知传播和3D几何嵌入三个关键设计,在WAN 2.1基础上以仅~20k参数的轻量模块实现精细的手物交互视频控制,性能大幅超越现有2D轨迹和隐式姿态方法。

CustomX: Unified Character, Action, and Scene Customization in Video World Models

CustomX将3DGS场景、多视角角色与文本指令统一建模为条件自回归视频生成问题,用户提供任意场景与角色后可通过自然语言驱动角色执行上百种动作,在生成质量、角色一致性和动作控制成功率上全面超越基础模型与专用世界模型。

EMOSH: Expressive Motion and Shape Disentanglement for Human Animation

EMOSH 利用具有丰富表达能力的三维参数化人体模型 EHM 作为控制信号,通过显式的形状-姿态参数解耦从根本上消除体型泄漏问题,结合粗到细的混合运动注入和空间对齐条件机制,在保持精细表情和手势控制的同时实现高保真的人体动画生成。

Event-Driven Video Generation

EVD 给预训练视频 DiT 加了一个轻量 token-level event head,并在训练和采样时用事件门控约束 latent update 只发生在交互真正活跃的区域,从而减少物体提前动、接触缺失、支撑关系跳变和事件后漂移等视频生成动态错误。

GeoNVS: Geometry Grounded Video Diffusion for Novel View Synthesis

GeoNVS 提出即插即用的 GS-Adapter,把参考视角的扩散特征"抬升"到 3D 高斯里再渲染回目标视角,在特征空间而非图像输入端注入几何先验,从而在相机可控性和几何一致性上大幅超越 SEVA / CameraCtrl,平移误差最多降 2 倍、Chamfer 距离最多降 7 倍。

LatSearch: Latent Reward-Guided Search for Faster Inference-Time Scaling in Video Diffusion

LatSearch 训练了一个能对去噪轨迹中间态潜在向量(而非解码后视频)直接打分的潜在奖励模型,并用它驱动「奖励引导重采样 + 剪枝(RGRP)」在潜在空间做推理时搜索,从而在视频扩散上做到与 SOTA 相当甚至更好的质量,同时把运行时间最多减少 79%。

Learning Transferable Dynamics Priors from Action to World Modeling

提出 A2World,在大规模(215.6 万条轨迹、20+ 机械臂形态)真实机器人操控数据上预训练一个以动作为条件的多视角扩散世界模型,学得的动作→动态先验可适配为长程仿真器(A2World-sim)或指令驱动策略(A2World-policy),在 LIBERO 基准和真实机器人上均达到领先性能。

查看全部24篇「视频生成」论文 →


🧩 多模态 VLM (39)

AdaBoosting Text Prompts for Vision-Language Models

本文提出 Text Prompt Boosting (TPB),将 AdaBoost 框架引入 VLM 的文本提示构造中——把每个类别的提示词集合视为一个弱分类器,通过迭代重加权困难样本、逐轮构造新的提示弱分类器并集成为强分类器,从而在少样本场景下实现样本数驱动的性能持续提升(shot scalability),且该自然语言提示集成可在异构 VLM 间直接重嵌入迁移,保持跨模型迁移后的性能增益。

ADAPT: Attention Dynamics Alignment with Preference Tuning for Faithful MLLMs

ADAPT 从早期解码的多层交叉注意力中提纯语义对齐的视觉锚点,在推理时以锚点为参照在线监测注意力保真度、仅检测到显著退化时稀疏纠正,并通过视觉条件对比的偏好优化强化模型对视觉证据的依赖,在多个幻觉基准上降低 40–60% 幻觉率,仅 1.42 倍推理开销。

Anchored, Not Graded: Vision-Language Models Fail at Slant-from-Texture Perception

本文系统评估了多种VLM在纹理驱动斜面感知任务上的表现,发现VLM的零样本预测严重锚定在少数离散值(0度、±25度、±45度)上,与人类和自监督CNN展现的连续有偏感知完全不同,且这种锚定来源于语言输出端的读取瓶颈而非视觉编码器的几何信息缺失。

Curvature-Guided Mixing for MLLM Adaptation

提出Curvature-Guided Mixing(CGM)框架,通过对预训练和微调两个损失曲面进行二阶泰勒展开与Hessian对角近似,推导出基于相对曲率的闭式软混合比(CGM),并进一步设计基于曲率感知评分的稀疏硬混合策略(CGM†),在MLLM微调中实现下游适应与通用知识保留的最优平衡。

DiCoBench: Benchmarking Multi-Image Fine-Grained Perception via Differential and Commonality Visual Cues

DiCoBench 提出首个以隐式视觉线索(差分与共性)驱动的高分辨率多图像细粒度感知 benchmark,包含 765 个高质样本、8 种任务,用 MCQ 范式消除 n-gram 评测偏差;18 个 MLLM 中最好的 Gemini-3-Pro 仅 58.1%(人类 98.3%),揭示了现有模型在自主视觉线索发现上的严重不足。

Domain Arithmetic: One-Shot VLA Adaptation under Environmental Shifts

DART 提出一种基于权重空间类比运算的 VLA 模型 one-shot 域适配方法:用单个源域+目标域 demonstration 分别微调,通过子空间对齐过滤后相减提取纯域向量,再将其加回基座模型,在 LIBERO 多视角、视觉扰动、跨实体和真实机器人场景下,仅用 1 条 demonstrations 就显著超越现有适配基线。

Edges Before Embeddings: A Confidence-Aware Blur Gate for Vision-Language Pipelines

本文提出 MagikaDocumentFromPixel,一个轻量级 CPU 友好型模糊检测门控器,通过 Laplacian 边缘先验模块 (EPM) 作为第 4 输入通道注入频域信息,搭配多尺度测试时增强和 max-softmax 选择性预测阈值,在 ~7ms CPU 推理时间内以 F1=0.9803 的质量为 VLM/OCR 管线提供清晰/模糊/不确定三路路由决策。

EgoSAT: A Comprehensive Benchmark of Egocentric Streaming Interaction Understanding

EgoSAT 是首个面向第一人称(egocentric)流式交互理解的系统性基准,将过去(回顾)、现在(实时)、未来(前瞻)三类推理统一在严格的在线协议下,通过可回答性量化与置信度诊断揭示当前 VLM 不仅在时序推理上表现薄弱,更存在严重的"自信地犯错"(confidently wrong)校准失效问题。

EraseLoRA: MLLM-Driven Foreground Exclusion and Background Subtype Aggregation for Dataset-Free Object Removal

EraseLoRA 提出一种无数据集的物体移除框架:先用 MLLM 对单张图像做三路分割(目标前景 / 非目标前景 / 背景子类型),再通过测试时 LoRA 自适应优化将多个背景子类型聚合重建到 mask 区域,全程不需要任何训练数据、不做 self-attention 的显式遮挡或重定向,在背景保真度上比此前 dataset-free 方法提升至少 23%、前景再生率近乎减半,且超越所有 dataset-driven 方法。

Evaluating and Enhancing Negation Comprehension in Remote Sensing MLLMs

针对遥感 MLLM 在否定查询下性能严重退化的问题,本文构建首个遥感否定理解基准 RS-Neg(22K 样本,覆盖区域级到场景级四类任务),并提出测试时自适应方法 NeFo,将否定的逻辑角色(真值翻转算子)显式建模为优化目标,仅用约 5% 无标签测试样本即可显著提升多个基座模型的否定理解能力,并在未见任务上展现强泛化性。

查看全部39篇「多模态 VLM」论文 →


🧠 VLM Reasoning (18)

ROVA: Are Video Reasoning Models Ready to Go Outside?

ROVA 提出了一套鲁棒视频推理训练框架,通过结构化时空扰动生成、自反思难度感知在线课程、以及基于 GRPO 的双分支对齐来提升 VLM 在真实世界扰动(天气、遮挡、光照、相机抖动)下的推理鲁棒性。同时提出 PVRBench——首个系统性注入真实扰动的具身视频推理 benchmark,覆盖 9K+ 视频和 51K+ 问答对。

Dense Reward for Multi-View 3D Reasoning with Global Maps and Local Views

针对多视角 3D 视觉问答里 MLLM「只拿最终答案对错做稀疏监督、跨视角推理不一致、视角选择乱跳」的顽疾,本文把任务显式拆成「建全局俯视认知地图 → 按问题规划看图顺序 → 转成自我中心视角作答」三段,用冻结的 3D 视觉基础模型(VGGT+SAM3)生成的几何一致伪地图当全局奖励、用基准元数据推出的参考轨迹当局部奖励,在 GRPO 下做轨迹级优化,让一个 3B 模型在 MindCube 上从 37.8 提到 66.5。

E-TTS: A New Embodied Test-Time Scaling Framework for Robotic Manipulation

E-TTS 是一个即插即用的具身测试时缩放框架,在推理时对 VLA 模型的推理过程和动作进行联合采样、历史感知验证和反馈引导迭代精炼,无需额外训练或数据即可将多种基座模型在仿真和真实场景中的成功率最高提升 33.14%。

EgoVITA: Learning to Plan and Verify for Egocentric Video Reasoning

EgoVITA 将第一人称视频推理显式分解为"自我规划 + 外部视角验证"两阶段推理,用 GRPO 强化学习配合两个密集奖励信号(ACMG 预测性跨模态对齐 + 置信度验证偏好优化)训练,在仅 52k 样本下 EgoBlind 超 Qwen2.5-VL-7B +7.7 点,同时外部视角视频理解性能零退化。

GAIA: A Data Flywheel System for Training GUI Test-Time Scaling Critic Models

本文提出 GAIA 数据飞轮系统,通过让真实 GUI agent 执行任务来采集正/负动作样本,训练一个直觉式(非推理式)裁判模型 ICM;ICM 在测试时以 Best-of-N 方式从 agent 采样的多个候选动作中选出概率最高的正确动作,再用这些选中的动作扩充数据飞轮训练更强的 ICM-r2,形成自我进化的良性循环。

Generative Lane Topology Reasoning via Autoregressive Model with Geometry Prior

TopoGPT 将车道拓扑推理从"检测-关联"的判别式范式转为自回归序列生成范式,在 330 万大规模地图场景上预训练车道图的几何先验后,通过流匹配感知适配器将对齐到 BEV 图像条件,在 OpenLane-V2 上以 lane-level +6.4、point-level +11.6 的显著优势全面超越此前方法,且生成的车道图在端点几何一致性和结构完整性上大幅改善。

HyLaR: Hybrid Latent Reasoning with Decoupled Policy Optimization

HyLaR 通过引入控制 token 在文本离散 token 和连续视觉潜在向量之间无缝切换,实现混合离散-连续推理;针对混合动作空间的高效强化学习,提出 DePO(解耦策略优化),利用 vMF 球面建模和解耦信任域裁剪解决标准 RL 的几何与方差不匹配问题,在细粒度感知和通用多模态理解基准上显著超越现有方法。

Information-Regularized Attention for Visual-Centric Reasoning

本文提出 Information-Regularized Attention (IRA),在 VLM 的 attention 模块内对视觉 value states 施加基于信息瓶颈原理的随机正则化——通过变分推断框架注入数据依赖的层级噪声,让模型在端到端全参数微调中学会主动控制视觉信息的注入量,从而同时改善幻觉、视觉定位和灾难性遗忘问题。

Latent Visual Diffusion Reasoning with Monte Carlo Tree Search

提出 LVDR 框架,将细粒度技能评估中从不确定逐步收敛到确定的认知过程建模为潜空间扩散去噪,并用关键点引导的 Monte Carlo Tree Search 提取可解释的推理轨迹,在运动与手术四个数据集上取得超越 SOTA 的评分精度同时输出透明的决策依据。

MonoSR: Open-Vocabulary Spatial Reasoning on Monocular Images

MonoSR 构建了首个大规模开放世界单目空间推理数据集(100万+ QA对,覆盖室内/室外/物体中心三大场景共98个语义类别),通过四阶段可观察性过滤机制保证每对QA均可从单张RGB图像回答,并系统性评测了7个开源/闭源VLM以及多种辅助信息对空间推理能力的影响。

查看全部18篇「VLM Reasoning」论文 →


⚡ VLM Efficiency (8)

Accelerating Multimodal Large Language Models with Prior-Corrected Token Reduction

PriorTR 是一种无需训练的视觉 token 剪枝方法,通过用 null token(分隔符)估计模型固有的注意力先验,再用 V-可用信息 \(P \cdot \log(P/Q)\) 替代原始注意力分数进行 token 排序,在单次前向传播中完成先验校正与物理剪枝,在激进 token 预算下显著提升了 MLLM 的精度-效率权衡。

HSD: Training-Free Acceleration for Document Parsing Vision-Language Models with Hierarchical Speculative Decoding

本文提出层次化推测解码(HSD),一种免训练的端到端文档解析加速方法:先用轻量级 pipeline 为每个区域生成粗草稿,再分两阶段验证——Stage 1 在裁切区域上并行做局部验证以获得高吞吐,Stage 2 在全页上做全局验证以恢复跨区域连贯性;在 HunyuanOCR 上实现 2.78 倍端到端加速且精度近乎无损,长文档场景最高加速 7.04 倍。

Paying More Attention to Visual Tokens in Self-Evolving Large Multimodal Models

VISE 提出纯无监督的单模型自演化框架,用几何不变性和语义不变性两种奖励信号直接正则化解码器的视觉条件化策略(而非优化答案一致性),在 Qwen3-VL-2B 上 COCO CIDEr 提升 +16.85、TextCaps CIDEr 提升 +19.66、幻觉 Chair-I 降低 5.0 点,且跨 4 个模型规模(2B/4B/8B/32B)与 4 种架构主干一致有效,无任何任务间的 tradeoff。

ResilPhase: Plug-and-Play Phase Mapping and Noise-Resilient Macro-Trajectory Extrapolation for Diffusion Acceleration

ResilPhase 将 DiT 免训练加速从逐层导数外推范式重构为 ODE 空间中的宏观轨迹外推:用端到端 Global Drift 消除逐层误差级联,用无导数 Barycentric Lagrange 插值绕过导数混沌噪声,再用 Chebyshev/Balanced 相位映射将离散时间步投影到有界相位空间以抑制 Runge 现象,在 FLUX.1-dev 上以约 5 倍加速仍保持 SOTA 画质。

SMART: When is it Actually Worth Expanding a Speculative Tree?

SMART 提出了一套硬件感知的边际分析框架,将推测解码中的推測树构建重写为最大化端到端加速比的序列决策问题——只有在节点的边际收益-成本比超过当前树的整体加速比时才扩展该节点,从而避免了大批量下验证开销超线性增长导致的"负加速"悖论,平均额外带来 20.0%(MLLM)和 15.4%(LLM)的加速提升且无需重新训练。

Spectral Evolution-Guided Token Pruning in Multimodal Large Language Models

本文提出 CLSE(Cross-Layer Spectral Evolution),一个 training-free 的视觉 token 剪枝框架:不再用单层 attention 或特征幅值判断 token 重要性,而是把每层视觉 token 变换到频域、经高通滤波后度量其高频结构能量在相邻 LLM 层之间的相对变化量,变化剧烈的 token 被判为语义活跃并保留;在 LLaVA/Qwen2-VL/Video-LLaVA 等多个 MLLM、剪到 11%~33% token 的激进压缩下,精度保持显著优于 FastV、SparseVLM、PDrop 等。

ViQ: Text-Aligned Visual Quantized Representations at Any Resolution

ViQ 提出两阶段视觉量化框架——先做文本对齐预训练让连续特征富含语义,再渐进式压缩并用量化器 FSQ 做低维离散化——使离散视觉编码器在 9 个多模态基准上首次达到与连续编码器接近甚至超越的性能,同时带来 20%-70% 的训练加速和接近 1/96 的存储压缩比。

GoodQ: 利用现成生成模型实现目标检测器的零样本量化

GoodQ 利用现成的扩散模型生成多样化训练图像,再通过信息密集提示、固有分布感知选择和教师引导自适应降噪三个组件系统性地解决生成图像与目标检测零样本量化之间的三大挑战,在 W4A4 和 W3A3 等极低位宽下大幅超越此前基于噪声优化的方法。


🎵 音频/语音 (7)

LipsFlow:神经形态 OT-CFM 在多说话人视觉语音识别中的首次探索

LipsFlow 首次将神经形态事件相机感知与最优传输条件流匹配(OT-CFM)引入多说话人视觉语音识别,通过可学习事件表示捕捉毫秒级唇部动态、OT-CFM 实现 2 步 ODE 确定性解码、以及双层语义监督解决同形异义词歧义,在 DVS-Lip 上以 22.3% WER 和 240ms 延迟取得 SOTA。

MG-RWKV: Multi-Grained Context-Aware RWKV for Temporal Forgery Localization

MG-RWKV 提出基于 RWKV 线性复杂度递归架构的时序伪造定位(TFL)框架,通过双向 RWKV 捕获全局时序上下文、多粒度混合专家(MG-MoE)自适应选择显式时间感受野、以及跨粒度一致性约束(CGC)消除多尺度特征间的矛盾预测,在 Lav-DF、TVIL、Psynd、AV-Deepfake1M 四个基准上全面超越此前 SOTA,同时保持 O(T) 线性复杂度,推理仅需 73.4ms。

OLIVE: View-Augmented Latent Prediction with Waveform Reconstruction for Speech SSL

OLIVE 提出一种同时优化「分析」(视图增强掩码蒸馏)与「合成」(波形重建)的语音自监督学习框架,通过在早期编码器特征上施加重建约束、后期上下文表征由不变性蒸馏主导,使单一预训练模型兼顾下游判别任务与高质量波形生成。

See & Sniff: Learning Visuo-Olfactory Representations

本文利用"气味身份在语义类别内对视觉变换保持不变"这一关键洞见,将仅含气味传感数据的 SmellNet 数据集扩展为视觉-嗅觉配对数据集 SmellNet-V,并设计了基于密集局部对比对齐的自监督双流框架 See & Sniff,在气味分类、跨模态检索和新引入的像素级气味定位三个任务上均显著超越仅使用气味的基线方法。

Sparsity-Inducing Divergence Losses for Biometric Verification

Q-Margin 将 margin 惩罚从几何化的 logit 修改迁移到 α-散度损失的概率化参考测度中,在保持后验稀疏性的同时在 IJB-B/C 和 VoxCeleb 低 FAR 场景下一致超越 ArcFace/CosFace 基线,并通过精确 top-K 截断将训练吞吐开销从 27% 降至 5%。

Step-by-Step Video-to-Audio Synthesis via Negative Audio Guidance

针对现有视频到音频(V2A)模型只能一次性生成整段声音、无法像 Foley 艺术家那样逐层补声的痛点,本文提出 Negative Audio Guidance(NAG):训练一个以「已生成音轨」为条件的分支,采样时把它反向使用,把当前生成推离已有声音,从而只用普通单参考音视频数据集就实现了分步生成互补音轨、混合成高质量合成音。

SwiftAudio: Data-Efficient Caption-Only Distillation for One-Step Text-to-Audio Diffusion-based Generation

SwiftAudio 将 Variational Score Distillation(VSD)适配到音频域,仅使用约 45K 文本描述(无需配对音频数据)就将多步扩散教师蒸馏为一步文生音频生成器,配合时序全变分正则化约束潜空间的时间连贯性,在 AudioCaps 和 Clotho 上达到一步方法中的 SOTA,并大幅缩小了与多步扩散系统的差距。


🔎 AIGC 检测 (3)

Efficient Document Tampering Localization with Multi-Level Discrepancy Features and Unified DCT-Quantization Embedding

DiffNet 通过两项互补设计——多层差异变换将特征金字塔从内容信号转为符号不变的差异强度信号,以及统一 DCT-量化联合嵌入用离散 embedding 替代传统高开销频率感知头(FPH)——在跨域和人工篡改文档定位上以更低计算成本取得了约 30% 的 F1 提升,吞吐量最高提升 7 倍。

Multi-Task Bayesian In-Context Learning

本文提出多任务贝叶斯上下文学习(Multi-Task Bayesian ICL),将先验信息通过辅助数据集前缀的形式嵌入到上下文学习序列中,使Transformer能在推理时根据前缀可控地调整后验预测分布,无需重新训练即可在不同先验族间自适应迁移。

Trustworthy Image Authentication using Forensic Knowledge Graphs

把图像取证的「找证据」和 VLM 的「说人话」拼成一套系统:先用自监督学到的取证指纹把图像切成来源一致的区域、判定每块区域的源/后处理/压缩历史,组织成一张结构化的「取证知识图谱」,再让 VLM 依图逐条给出可核验的自然语言判据,在检测、伪造类型/定位、取证解释三个维度全面超过纯取证器和纯 VLM。


🧊 3D 视觉 (67)

AC3S: Adaptive Conditioning for 3D-Aware Synthetic Data Generation

本文提出AC3S,通过自适应视觉提示调制器动态衰减ControlNet的条件注入强度,并辅以多智能体VLM系统生成与几何结构一致的文本提示,在保持3D姿态精确对齐的前提下大幅提升合成图像的逼真度和多样性,FID相较基线3D-DST降低15.95点,下游分类和姿态估计任务均取得显著提升。

AerialMetric: Benchmarking and Adapting UAV Monocular Metric Depth Estimation in the Real World

本文构建了包含四个互补子集的大规模无人机航拍单目度量深度基准 AerialMetric(52K 真实 + 16K 合成图像-深度对),系统性揭示了现有 SOTA 模型在空域视角下 δ1 接近 0 的严重域差距,并通过 LoRA 参数高效微调 MoGe2 在几乎不损失地面泛化能力的前提下将空域 δ1 提升至 84% 以上。

Agentic Collaborative Cognition for Zero-Shot 3D Understanding

这篇论文把零样本 3D 场景理解改造成 Planning Agent 与 Perception Agent 围绕显式 holistic cognitive map 反复协作的过程,通过主动补关键视角、跨视角记录物体属性和反馈式候选过滤,在 ScanRefer / Nr3D / SQA3D / ScanQA 等 6 个基准上明显优于已有零样本方法。

AirZoo: A Unified Large-Scale Dataset for Grounding Aerial Geometric 3D Vision

AirZoo 构建了一个百万级航空合成数据集,通过 AirSim-Cesium-Unreal 三位一体仿真管线从 Google 3D Tiles 自动渲染出带像素级深度和 6-DoF 地理参考位姿的无人机航拍序列,覆盖 22 个国家 377 条多天气轨迹,在航空图像检索、跨视角匹配和多视图三维重建三个任务上微调现有 SOTA 模型均取得显著提升,尤其是真实场景零样本泛化能力大幅增强。

AnyMatch: Supercharging Universal Multi-Modal Image Matching with Large-Scale Single-View Images

AnyMatch 提出一种从海量单视图图像零成本合成多模态多视角匹配数据的框架,通过单目深度估计+3D重投影+扩散补全实现几何一致的视角变换,结合跨模态图像翻译实现红外/深度/法向/事件四种模态生成,并用样本级几何一致性验证(SGCV)过滤生成瑕疵;在 Any-syn 合成数据集上微调 LoFTR/EDM/RoMa 后,跨模态匹配性能大幅超越 MINIMA 等现有合成方法,且在未见医学/遥感模态上展现出强零样本泛化能力。

Audio-Visual Camera Pose Estimation with Passive Scene Sounds and In-the-Wild Video

本文提出首个利用被动场景音频辅助视觉进行相对相机位姿估计的方法,通过到达方向谱与双耳化嵌入组成的空间音频编码器(SAE)与SOTA视觉位姿估计模型Reloc3r进行晚期融合,在真实场景与仿真数据集上均取得显著提升。

BrepLLM: Enabling Large Language Models to Understand Boundary Representations

BrepLLM 是首个让大语言模型直接解析和推理原生 B-rep(边界表示)CAD 模型的框架:通过自适应 UV 采样将 B-rep 转为面-边拓扑图,用层级化 BrepEncoder 提取面/边/拓扑三支解耦特征,再经 CLIP 对比预训练和两阶段渐进式 LLM 微调,最终在 3D 物体描述和分类任务上全面超越基于点云和图像的基线模型。

Capacity-Controlled Multi-View Stylization of 3D Gaussian Splatting

本文提出基于容量控制最优传输的3D高斯泼溅多视角风格化框架:用半平衡最优传输替代贪心最近邻匹配,通过列容量约束抑制many-to-one问题,同时引入跨视角匹配引导保证相邻视角的风格一致性,辅以几何正则化增强重建质量,在风格质量、内容保真和多视角一致性上全面超越现有方法。

DefenseSplat: Enhancing the Robustness of 3D Gaussian Splatting via Frequency-Aware Filtering

DefenseSplat 通过小波变换分解输入图像、滤除高频子带来抑制对抗扰动,并引入 ReLU 形式的尺度正则化损失限制拉长高斯体的生成,在没有干净真值监督的条件下显著提升 3DGS 对对抗攻击的鲁棒性。

DeWorldSG: Depth-Aware 3D Semantic Scene Graph Generation via World-Model Priors

DeWorldSG 提出一种从 RGB-D 序列生成时空鲁棒 3D 语义场景图(SSG)的框架:用 SAM 掩码引导的双域深度过滤为每个物体估计实例级概率 3D 高斯分布,再通过 V-JEPA 2 世界模型积累跨帧关系证据并以不确定性感知融合精炼谓词边,在 3DSSG 上关系召回率提升 77.4%、谓词召回率提升 23.2%。

查看全部67篇「3D 视觉」论文 →


🎯 目标检测 (18)

Adaptive Spectrum-Aware Feature Disentangled Network for Small Object Detection

SFDNet将特征在频谱域显式解耦为低/中/高三频分量,分别为每个频谱设计专属的Mamba扫描策略进行上下文建模后自适应融合,同时构造类别级原型通过对比蒸馏压缩同类目标特征分布,在AI-TOD和SODA-D/SODA-A上大幅超越此前SOTA。

CMDS-AD: Cross-Modal Dual-Stream Decoupling for Few-Shot Anomaly Detection

提出 CMDS-AD,一个面向少样本多模态异常检测的跨模态双流解耦框架;通过将扩散法线估计器重新用作非线性低通滤波器来构建纯低频的辅助估计流,锚定全局结构模板,让保留耦合高低频分量的真实流更精确地捕获局部微缺陷,配合坐标感知分层特征映射器与乘性异常评分机制,在 MVTec 3D-AD 和 EyeCandies 上 1-shot 设置下分别取得 5.7% 和 7.7% 的 I-AUROC 绝对提升。

Denoising-Enhanced Coarse-to-Fine Infrared Small Target Detection with Attention Prior-Guided Knowledge Distillation

提出 ECFNet 粗到细红外小目标检测框架:粗阶段用 RBCN 将全图稠密预测降为网格二分类 + 引入去噪辅助训练(DAT)迫使网络学目标-背景上下文,细阶段用轻量检测器 + 交叉注意力先验蒸馏(APKD)让学生关注关键目标区域,在三个红外数据集上以 31.7G FLOPs 达到 SOTA。

Efficient RGB-T Object Detection via Sparse Cross-Modality Fusion

提出 SFEDet 稀疏融合框架,先用 YOLOv8-Small 级别的轻量单模态检测器高召回率筛选全图候选前景区域,再仅在稀疏的 RoI 上执行跨模态融合驱动的精确检验与多步框精炼,以约 1/3 的计算成本和 1/5 的参数量达到与 SOTA 相当甚至更优的检测精度。

Following the Flow: Advection-Consistent Modeling for Event-based Small Object Detection

PACT 将事件流特征演化显式建模为平流方程约束下的物理传输过程,通过轨迹级一致性让微弱目标响应沿速度场累积、噪声自然衰减,在 EV-UAV 数据集上将 IoU 从 55.18% 提升至 75.90%。

LogiCo: A Unified Framework for Logical and Structural Anomaly Detection

LogiCo 提出统一的组件级特征重构范式,通过离散化预训练特征到组件级空间并合成伪逻辑异常来训练重构网络,同时引入交叉注意力结构重构和分割图判别器,在保持空间结构的前提下同时检测逻辑异常和结构异常,在 MVTec-LOCO 等四个基准上达到 SOTA。

M4-SAR: A Multi-Resolution, Multi-Polarization, Multi-Scene, Multi-Source Dataset and Benchmark for optical-SAR Object Detection

本文提出 M4-SAR——首个大规模光学-SAR 配对旋转目标检测数据集(112,174 对图像、981,862 实例、6 类),配套统一评测工具 MSRODet 和端到端融合检测框架 E2E-OSDet(FAM + CMIM + AFM),融合后 mAP 比最优单源提升 5.1%,复杂环境下增益尤为显著。

MATCH: Flow Matching for Multi-View Anomaly Detection

MATCH 是首个基于 Flow Matching 的多视图异常检测方法,用 ODE 形式的连续归一化流在预训练特征空间上做密度估计,通过省略散度项实现实时推理(18.77 FPS),在 Real-IAD 和 MANTA-Tiny 两个基准上均取得 SOTA 的检测和分割性能。

MSPL: Multi-Step Pseudo-Labeling for Open-Vocabulary Object Detection

MSPL 将开放词汇目标检测的伪标签生成从单步 CLIP 图像-文本对齐重构为「定位验证→类别识别→背景接地」三步可解释推理管线,利用 SAM 类无关分割与 MLLM 零样本推理生成高质量伪标签,再通过区域-文本对齐和对比式背景学习两个对比学习信号进行在线训练,在 OV-COCO 和 OV-LVIS 上均达到新 SOTA,新类 AP50 提升 9.4 个点。

PS-MOT: Cultivating Instance Awareness from Point Seeds for Multi-Object Tracking

把多目标跟踪的每帧密集框标注换成"每个目标一个点"的点标注,用 SAM 闭环 + 频域边界幻化 + 不确定性高斯损失三层设计,把无尺度的点种子逐步"养成"尺度准确、身份连续的实例表示,在 DanceTrack 上以纯点监督拿到 52.3 HOTA、标注成本约省 64%。

查看全部18篇「目标检测」论文 →


✂️ 语义分割 (14)

AFFMAE: Scalable Vision Pre-Training for High-Resolution Microscopy Segmentation on Desktop Hardware

AFFMAE 将 AutoFocusFormer 的自适应离网(off-grid)令牌合并机制融入 MAE 框架,在保持仅编码可见令牌的高效不对称设计的同时,实现了层次化骨干的掩码友好预训练,使得高分辨率显微图像分割预训练可在单张消费级 GPU 上完成,以同等参数量匹配 ViT-MAE 分割精度,预训练吞吐提升 2 倍、高分辨率微调吞吐最高提升 5 倍。

Delayed Bidirectional Alignment via Disentangled Audio Semantics for Audio-Visual Segmentation

DDAVS 通过原型记忆库锚定的可学习查询来解耦多源音频语义,并引入仅在深层进行的延迟双向交叉注意力对齐视听模态,在 AVSBench 和 VPO 多源/多类/多实例场景上全面超越此前 SOTA。

ET-SAM: Efficient Point Prompt Prediction in SAM for Unified Scene Text Detection and Layout Analysis

ET-SAM 用轻量 Point Decoder 预测词级热力图以提取稀疏前景点,替代 Hi-SAM 从像素级分割中随机采样上千个点的做法,配合可学习任务提示和联合训练策略统一利用多粒度异构标注数据,在 HierText 上以约 3 倍推理加速达到有竞争力性能,并在 Total-Text/CTW1500/ICDAR2015 上平均 F-score 提升 11.0%。

FeVOS: Foresight Expression Video Object Segmentation

提出FeVOS(Foresight Expression Video Object Segmentation)任务——根据观察帧中的视觉线索预测未来事件并分割相关目标,构建包含968视频和14525条预测性表达的数据集并附带2904条合成思维链标注,设计FeVOS-R1两阶段训练框架(CoT监督微调冷启动 + GRPO强化学习纯IoU奖励精炼推理),在FeVOS上达到42.3 J&F,较微调Sa2VA基线提升6.5个点,同时在ReVOS(60.3)和MeViS(49.5)上展现出强零样本泛化能力。

Forget, Anticipate and Adapt: Test Time Training for Long Videos

提出 Frame Forgetting Network(FFN),通过只处理滑动窗口中退出/进入两帧的「遗忘—预测—适应」机制,将长视频测试时训练的计算复杂度从 O(k) 降至常数,并基于「惊异度」动态决定何时执行 TTT,在密集分割、深度估计和动作分类上达到更优的精度-效率权衡。

Hierarchical Spatial and Channel Aggregation for Cross-domain Few-shot Segmentation

本文提出 DHANet,通过沿空间维度进行层次聚合以缓解语义过对齐、沿通道维度进行层次聚合以缓解属性过对齐,并利用在线概率语义库在推理时提供额外支持信息,在四个跨域少样本分割基准上取得 SOTA。

MobileManiBench: Simplifying Model Verification for Mobile Manipulation

本文提出 MobileManiBench——一个基于 Isaac Sim 的大型移动操作仿真基准,通过强化学习自动生成 300K 多样化操作轨迹(含语言指令、多视角 RGB-D 图像、物体/机器人状态与动作),覆盖 2 种机器人平台、630 个物体、5 种技能和 100 个场景,并在此基准上系统评估了多个 VLA 模型,为移动操作的 VLA 架构验证提供了标准化平台。

ModuSeg: Decoupling Object Discovery and Semantic Retrieval for Training-Free Weakly Supervised Segmentation

ModuSeg 将弱监督语义分割显式解耦为"类无关目标发现"和"语义检索"两个独立阶段——用通用 Mask Proposer 提取几何提案、用离线特征银行进行非参数检索,在完全不需微调的情况下以训练集仅图像级标签达到 VOC 86.3 mIoU 的 SOTA。

Residual-Guided Expert Specialization for Incomplete Multimodal Learning

MARS 提出一种混合专家(MoE)框架,通过计算完整模态与缺失模态表征之间的残差来捕获模态缺失导致的表征偏移模式,以此引导专家特化;同时引入双路由器蒸馏和差异感知噪声正则化解决训练-推理路由不一致问题,在不完备多模态分类和分割四个数据集上全面超越 SOTA。

SARIF: Segment Anything for Robust Image Forensics

SARIF 同时运行一个冻结的原始 SAM 编码器和一个 LoRA 微调编码器,计算两者在各全局注意力层的残差作为篡改特定线索,再与上一轮预测掩码融合成提示、驱动 SAM 原有轻量解码器做 5 步渐进精化,在跨数据集篡改定位上达到了最强的平均性能。

查看全部14篇「语义分割」论文 →


🖼️ 图像恢复 (12)

CogSENet: Blind Image Deblurring with Blur-Conditioned Semantic Routing and Explicit Frequency Fusion

CogSENet 将盲图像去模糊从被动的像素回归重塑为主动的语义对齐重建过程,通过模拟鹰眼视觉系统的主动扫查扫描、视网膜功能分化和焦距适应,提出语义驱动的状态空间模块(SDSSM)、双频融合块(BFFB)和连续模糊场+CLIP语义联合调制三大核心设计,以仅 8.9M 参数在 GoPro、HIDE、RealBlur 上超越 EVSSM、FFTformer 等 SOTA 方法。

Fabric Image Demoiréing Benchmark from Synthesis to Restoration

本文首次系统研究织物图像去摩尔纹问题,提出基于物理成像链仿真的残差注入合成框架 PRISM(含 16,050 对数据的首个织物摩尔纹基准)与专为织物频谱纠缠特性设计的保守式恢复网络 FaDeNet,在 PSNR/SSIM/LPIPS 上大幅超越现有屏幕去摩尔纹方法。

Fidelity- and Perception-Aware Local Implicit Attention for Arbitrary-Scale Image Super-Resolution

FPLIA 提出一个双流框架,将回归骨干的保真度特征与扩散模型的感知特征通过非对称双向交叉注意力(FPAM)和逐像素自适应选择(FPSM)融合,在 ASISR 上同时实现了高保真度和高感知质量。

FlowDec: Temporal Conditional Flow Decorruptor for Robust Continuous Vision-Language Navigation

FlowDec 提出一种基于条件流匹配的图像去损坏框架,通过混合时序条件策略和动作质心引导过滤,在不修改 VLN 导航骨架的前提下增强其对多种视觉损坏的鲁棒性,在 R2R-CE 和 RxR-CE 上相对导航成功率分别提升 25.33% 和 9.38%,推理速度比扩散类 TTA 方法快 3-8 倍。

FMA-Net++: Motion- and Exposure-Aware Joint Video Super-Resolution and Deblurring

FMA-Net++ 提出基于 HRBA 层次化双向聚合块的非循环序列级框架,通过曝光时间感知调控模块(ETM)将帧级曝光信息注入特征,配合曝光感知的流引导动态滤波(FGDF)联合建模运动与曝光时变退化,在 VSRDB 任务上达到 SOTA 精度和推理速度。

FreeMEF: 可灵活处理任意帧数的多曝光融合Transformer

FreeMEF 提出"先去后回"(There and Back Again)的双阶段范式——先用循环状态空间模块将任意帧数的多曝光特征渐进聚合为全局表征,再以极端感知混合注意力引导基准帧恢复——在支持 2/3/5 帧灵活推理的同时显著抑制鬼影、提升动态范围。

FreqOrtho-SR: Frequency-Guided Orthogonal Expert Learning for Real-World Image Super-Resolution

FreqOrtho-SR 提出频域引导的 LoRA 专家混合(FreqMoE)和正交梯度投影(OGP)两个核心模块,通过 FFT 退化特征驱动的自适应专家路由和像素-语义子空间正交约束,在单步扩散模型框架下实现退化自适应的真实世界图像超分辨率,在多个基准上取得最优或次优的保真度-感知质量平衡。

LogicIR: Logic Gate Networks for Image Restoration

LogicIR 是首个专为图像恢复设计的逻辑门网络(LGN),通过全逻辑门 UNet 架构、可微比特解码层和 Index Shuffling 跨组通信机制,在去噪、去块、去雨任务上以远低于 BNN 和 LUT 方法的运算量(BOPs)达到竞争性恢复质量,证明了纯逻辑门计算在图像恢复中的可行性。

Personalization as Inverse Planning: Learning Latent Design Intents for Agentic Slide Generation via Structural Denoising

Spire 将页面级幻灯片个性化(PSP)建模为逆规划问题,通过对黄金幻灯片施加离散结构扰动构建自监督"去噪"信号,训练 Critic 和 Planner 两个 7B 级智能体在 RL 下协同迭代修正设计方案,无需依赖特定执行器即可推断用户的隐式设计意图,在视觉相似度和 VLM-as-Judge 评分上均显著优于基于 GPT 的强基线。

Spectral and Trajectory Regularization for Diffusion Transformer Super-Resolution

StrSR 提出非对称判别蒸馏 + 频域分布匹配的联合框架,以 CLIP-ConvNeXt 判别器替代 DiT 判别器避免模型坍塌,并用频域分布损失(FDL)抑制 DiT 特有的网格状周期伪影,首次在 DiT 架构上实现高质量单步真实图像超分辨率。

查看全部12篇「图像恢复」论文 →


🛰️ 遥感 (1)

Tessellating The Earth

TTE 用可学习的球面Voronoi划分替代固定基函数(球谐函数/傅里叶特征)来编码地理坐标,让站点在训练中自动向高判别性区域迁移以集中表示容量,同时引入全局语义Token作为跨区域语义共享通道,在多项地理空间分类与回归任务上达到新SOTA。


🧑 人体理解 (18)

BackTranslation2.0 -- A Linguistically Motivated Metric to Assess Sign Language Production

提出 BackTranslation2.0,一个语言学驱动的文本到手语翻译评估指标,通过两阶段智能体框架(10 个专用工具提取证据 + 4 个 LLM 交叉比对模块)在语法正确性、音系准确性、运动流畅度和生成保真度四个维度上给出确定性评分,在已知损坏和合成数据上与人类判断达到 Pearson r=1.00 / Spearman ρ=1.00,远超现有反向翻译和运动相似度基线。

Dress-ED: Instruction-Guided Editing for Virtual Try-On and Try-Off

Dress-ED 构建了首个统一 VTON(虚拟试穿)、VTOFF(虚拟试脱)和文本指令驱动服装编辑的大规模基准数据集(146k 已验证四元组),并提出一套基于 MLLM + 双路径连接器 + DiT 的统一多模态扩散基线模型 Dress-EM,在指令驱动的服装编辑任务上全面超越通用编辑模型和领域专用 VTON 模型。

FaceMoE: Mixture of Experts for Low-Resolution Face Recognition

FaceMoE 将 Transformer 中单一 FFN 替换为多个稀疏激活的 MoE 专家加 Top-k 路由器,使不同专家自动特化于人脸不同语义区域(高频纹理/低频平滑/关键点),实现分辨率感知的特征提取;在 BRIAR、IJB-S、TinyFace 三个低分辨率基准上全面超越 SOTA,同时几乎不损失 HR 预训练性能。

FlowerDance: MeanFlow for Efficient and Refined 3D Dance Generation

FlowerDance 将 MeanFlow(用区间平均速度替代瞬时速度预测的流匹配变体)与物理一致性约束、双向 Mamba 骨干和通道级跨模态融合相结合,仅需 5-20 步采样即可生成高质量的 3D 舞蹈,在 FineDance 和 AIST++ 上达到 SOTA 的同时推理速度(2008 FPS)远超此前最佳方法(MatchDance 345 FPS),为实时 3D 渲染留出充足算力空间。

InterEdit: Navigating Text-Guided 3D Dyadic Human Motion Editing

InterEdit 提出了文本引导双人3D运动编辑(TMME)这一新任务,构建了首个大规模双人运动编辑数据集 InterEdit3D(5161组源-目标-文本三元组),并设计了基于条件扩散模型的 InterEdit 方法——通过语义感知计划令牌对齐捕获高层编辑意图、交互感知频率令牌对齐利用DCT频段能量约束交互节奏——在编辑忠实度和运动真实性上显著超越四种基线方法。

Multi-scale Object-Aware Gaze Estimation via Geometric Reasoning

将视线目标估计从像素级回归重新建模为层次化推理问题,先用目标级语义表征建立候选注意对象,再用视线方向构造视场锥几何先验约束空间,最后通过多尺度残差融合精确定位,在 GazeFollow/VideoAttentionTarget/ChildPlay/GOO-Real 上以 7.1M 参数取得 SOTA。

Odoriko: A Shape-Aware Multimodal Diffusion Framework for Human Motion

Odoriko 提出首个统一的多模态人体运动生成框架,通过将性别和 SMPL 体形参数作为显式条件信号分层注入扩散骨干网络,使生成的运动能够反映主体的生物形态学特征,同时在文本到运动、音乐到舞蹈、视频到运动估计三个任务上以极少的参数量达到甚至超越当前专用方法的性能。

PIAvatar: Physically Interactive Avatars via Deformation Gradient Decoupling

PIAvatar 提出基于 MPM 的物理可交互 3D 人体化身框架,通过将用户定义的 kinematic velocity 从变形梯度更新中显式解耦,消除运动驱动时产生的非预期内部应力,并嵌入骨骼结构以闭式优化实现形变后姿态的实时追踪,首次在统一 MPM 仿真框架内同时支持人-人、人-物的双向物理交互与非刚性表面形变。

Reweighting Framewise Attention in Video Transformers for Facial Expression Understanding

MiRA 提出一种零额外参数的即插即用帧边缘注意力重分配模块,通过帧级置信度和帧内集中度两种互补统计量重新分配 ViT 自注意力,使模型在不依赖人脸对齐的前提下更精准地聚焦细微面部动态变化,在 DFEW、MAFW、FERV39k 等基准上取得 video-only 方法的 SOTA,其 FlashLite 近似还可兼容 FlashAttention 实现在线高效重分配。

Self-supervised Garment Dynamics with Persistent Wrinkles

提出首个自监督神经网络服装仿真器,通过动态静止弯曲能量和物理启发的课程学习,显式建模织物的弹塑性变形,首次在自监督框架下生成自然的持久褶皱,在多种服装、体形和动作上均优于现有方法。

查看全部18篇「人体理解」论文 →


📹 视频理解 (12)

Bridging VideoQA and Video-Guided Agentic Tasks via Generalized Keyframe Extraction

本文提出 TASKER,一种将关键帧提取形式化为图搜索问题的通用算法——MLLM 同时评估任务相关性(缺什么信息)和场景动态(哪里变化大)来指导搜索方向,配合双路置信度投票决定何时终止,在 EgoSchema 和 NExT-QA 上分别以仅约 15% 的帧数超越此前最佳基线 2.0% 和 1.8%,并配套发布 VG-GUI-Bench 基准以评估模型从视频教程中学习操作步骤并迁移到 GUI agent 任务的能力。

EgoExo-Con: Exploring View-Invariant Video Temporal Understanding

本文提出 EgoExo-Con 基准(1,148 对同步 ego-exo 视频 + 2,269 条人工精炼的时序查询),首次系统评估 Video-LLM 在不同视角下时序理解的一致性,发现现有模型跨视角一致性仅勉强达到单视角性能的一半;并提出 View-GRPO 强化学习框架,通过语义对齐与结构一致性双重推理奖励,显著提升跨视角时序理解的鲁棒性和一致性。

HieDG: A Hierarchical Discrete Geometry-Guided Framework for Multi-Animal Tracking

HieDG 将多动物追踪中不稳定的连续几何信号(位置、尺度、速度)通过两级残差码本离散化为结构化 token,再与视觉特征融合注入 query-based 追踪器,在 AnimalTrack / BFT / BuckTales 三个动物追踪基准上取得 SOTA 关联性能(HOTA、AssA、IDF1 显著提升),并在 DanceTrack / SportsMOT 上验证了泛化性。

MASS: Motion-Aligned Selective Scan for Refinement in Flow-Based Video Frame Interpolation

MASS 将视频帧插值中 SSM 的特征扫描从静态空间网格重新定义为沿光流轨迹的动态序列建模,通过可学习非线性路径积分和速度感知自适应扫描,在保持高效计算的同时显著提升大位移和复杂遮挡场景下的插值质量,在 SNU-FILM Extreme 子集上以 26.04 dB PSNR 超越此前最优方法 0.38 dB。

MAVFusion: Efficient Infrared and Visible Video Fusion via Motion-Aware Sparse Interaction

MAVFusion 提出运动感知稀疏交互机制,将红外-可见光视频融合的跨帧跨模态交互按光流先导的运动区域检测拆分为"静态背景弱交互 + 动态区域稀疏全局注意力"两条路径,在三个基准上达到 SOTA 融合质量的同时,计算量仅为现有视频融合方案的 5% 左右。

OnPoint: Offline-to-Online Multi-Level Distillation for Point-Supervised Online Temporal Action Localization

OnPoint 提出离线到在线的多级蒸馏框架,用仅需单帧点标注的离线教师模型生成伪段标签、帧级类激活序列(CAS)和窗口级动作预期信号,通过实例级、帧级、窗口级三层蒸馏注入严格在线的学生模型,辅以动作性校准注意力解码和锚点级原始点监督来稳定训练,在五个数据集上一致超越强基线(THUMOS 上平均 mAP 提升 4.8%,最高 +7.0%),首次打通了点监督在线时序动作定位(POTAL)这一新任务。

PA-VAD: 基于扩散模型的纯伪异常视频异常检测

PA-VAD 提出一个无需任何真实异常视频的框架,通过 CLIP 引导的初始帧选择和 VLM 提示词精炼驱动视频扩散模型合成类感知的伪异常片段,并设计领域对齐正则化模块(DARM)抑制伪异常在特征空间中的幅度偏差,在 ShanghaiTech (98.2% AUC)、UCF-Crime (82.5%) 和 XD-Violence (95.1%) 上超越 UVAD SOTA,甚至超过部分使用真实异常视频的 WVAD 方法。

SFDATrack: Generalized Source-Free Domain Adaptive Tracking Under Adverse Weather Conditions

SFDATrack 提出首个面向恶劣天气下视觉跟踪的源数据无关域自适应框架,通过均值教师结构中的双向交互 Mamba 模块和超球面原型投影模块,在不访问任何源域数据的情况下鲁棒适应多种天气条件,在合成与真实恶劣天气跟踪基准上取得最佳性能。

Sink-Token-Aware Pruning for Fine-Grained Video Understanding in Efficient Video LLMs

本文发现注意力剪枝中高注意力但无语义的"sink token"是细粒度视频理解崩溃的关键障碍,提出 SToP 方法——定义跨帧 sink score 量化 token 的 sink 倾向,并分别注入空间剪枝(STSP,降低 sink token 保留优先级)和时序剪枝(STTP,提高 sink token 被剪概率),在 10% 极端保留率下将幻觉和组合推理的性能损失大幅收窄(如 FastVid 从 15.69% 降至 6.32%,VisionZip 从 16.79% 降至 6.87%)。

Towards Long-Form Spatio-Temporal Video Grounding

本文定义并首次探索长视频时空定位(LF-STVG)问题,提出 ART-STVG——一种记忆增强的自回归Transformer架构,将视频视为流式输入逐帧处理,通过空间/时间记忆库加选择性检索策略和级联时空解码设计,在不依赖额外长视频训练数据的前提下,在 1-5 分钟级别的长视频定位任务上大幅超越现有方法。

查看全部12篇「视频理解」论文 →


🚗 自动驾驶 (33)

2K Retrofit: Entropy-Guided Efficient Sparse Refinement for High-Resolution 3D Geometry Prediction

本文提出 2K Retrofit,一种无需修改或重训练基座模型即可让现有 3D 基础模型(如 Depth Anything、VGGT)输出 2K 分辨率几何预测的通用框架——核心思路是用冻结的基座做快速粗预测,再通过熵引导的稀疏细化机制只对高不确定性像素区域做全分辨率修正,在大幅降低计算和显存开销的同时达到或超越全分辨率方法的精度。

单调最小调节时间PI整定:基于切触恒等式的FOTD系统无超调控制

本文针对一阶加纯滞后(FOTD)被控对象,推导了严格单调(零超调)阶跃响应下最小化2%调节时间的PI整定问题的精确解析解——核心是一个描述输出斜率在单调边界处切触零点条件的切触恒等式,由此将二维搜索降为一维嵌套标量条件,给出了显式闭式规则、基于响应的精确降阶和无仿真超越方程组三种不同精度的求解方案,并将2%调节时间相比Lambert-W临界阻尼消去设计降低14%–52%。

ASTAD: 非对称风格迁移实现自动驾驶合成到真实域的适应

ASTModel 针对自动驾驶场景中「合成图有完美标注、现实风格参考图无标注」的非对称约束,提出两阶段无训练框架——先用 DINO 原型匹配从无标签风格图提取粗语义先验,再在扩散逆过程中通过多层语义投票精化先验、鲁棒中位数阈值过滤和像素比例调制混合 AdaIN 实现类一致风格注入,在保持语义结构前提下 3.2x 提速生成逼真的目标域风格数据。

CooperScene: Multi-Modal Cooperative Autonomy Benchmark with C-V2X Communication Characterization

CooperScene 是首个在真实道路场景中同步采集 C-V2X 通信特征(吞吐量、延迟、丢包率、抖动)与多模态传感器数据(LiDAR、相机、GNSS/IMU)的协同自动驾驶数据集,覆盖 3 辆智能车和 1 个路侧单元在路口、高速匝道、停车场等多样场景的交互,基于该数据集的基准评测表明,现有协同感知方法在真实 C-V2X 带宽约束下的 mAP 相比理想网络假设最多下降 49%,揭示了理想化评测与可部署性能之间的巨大鸿沟。

Deconfounded Lifelong Learning for Autonomous Driving via Dynamic Knowledge Spaces

DeLL 首次将终身学习引入闭环端到端自动驾驶,利用 Dirichlet 过程混合模型构造显式和隐式双动态知识空间,并将动态生长的知识锚点作为中介变量实现前门调整去混杂,在 Bench2Drive 上以零额外存储开销取得优于 PackNet 和 ER 的终身学习性能。

Driver-WM: A Driver-Centric Traffic-Conditioned Latent World Model for In-Cabin Dynamics Rollout

把「舱内驾驶员未来会怎么动」当成一个在潜在空间里、由舱外交通事件因果驱动的 rollout 问题来做:用冻结的 Qwen3-VL 特征当感知接口,双流分别编码交通和驾驶员,再用一个「门控因果注入」让外部环境单向调制驾驶员内部状态的自回归演化,最终解码成未来 5 步的人体骨架轨迹(外加行为/情绪语义作辅助正则),在 AIDE 上于安全攸关的高动态片段上取得稳健的长时预测。

DriveVA: Video Action Models are Zero-Shot Drivers

DriveVA 提出一种统一的视频-动作世界模型,将未来视频预测与轨迹规划放在同一个 DiT 扩散生成过程中联合解码,利用大规模视频生成模型(Wan2.2-TI2V-5B)的时空先验实现强零样本跨域泛化,在 NAVSIM 上达到 90.9 PDMS,并在 nuScenes 和 Bench2Drive 上分别降低 78.9% 和 52.5% 的平均 L2 误差与 83.3% 和 52.4% 的碰撞率。

DriveWeaver: Point-Conditioned Video Inpainting for Controllable Vehicle Insertion in Autonomous Driving Simulation

DriveWeaver 提出以车辆点云渲染图为像素级条件的视频扩散修补框架,通过轻量 PointAdapter 将几何条件注入冻结的 Wan2.1 差分变换器骨干,生成光照融合一致且几何精确的前景车辆,并设计全局-局部分层修补策略消除长时序漂移,生成结果可进一步蒸馏为 3D 高斯泼溅实现实时渲染。

ExploreVLA: Dense World Modeling and Exploration for End-to-End Autonomous Driving

提出统一理解-生成框架 ExploreVLA,在 VLA 驾驶模型中引入未来 RGB + 深度图像生成作为密集世界建模目标,并利用世界模型的图像预测不确定性作为内在探索奖励,通过安全门控 GRPO 让策略超越模仿学习分布、发现多样且安全的驾驶行为,在 NAVSIM 上取得 93.7 PDMS 和 88.8 EPDMS 的 SOTA。

FLM-Occ: Feed-forward Likelihood Maximization for Efficient Indoor Occupancy Prediction

FLM-Occ 将室内单目占用预测从体素分类重新定义为体素分布估计,通过最大似然估计(MLE)训练网络以前馈方式预测场景的混合模型参数,仅用 32 个超二次曲面原语即可超越此前需 1200 个高斯原语的最优方法,同时推理速度提升 3.7 倍。

查看全部33篇「自动驾驶」论文 →


🤖 机器人/具身智能 (15)

A scalar per patch from pre-trained ViTs enables fast moving navigation in the real world

这是一项在真实办公楼里跑了 966 次真机导航(累计 24km、0.7 m/s 快速移动)的大规模实证研究,系统对比了 DinoV2/DinoV3/VC-1/AM-Radio/Dune 等冻结视觉编码器在纯 RGB 点目标导航上的表现,并提出一种极简投影层 PAP(Pure Attention Projection):把每个图像 patch 压成一个标量注意力值喂给下游 agent,既不掉导航性能,又让「可通行区域 / 障碍 / affordance」这类可解释热力图自发涌现。

Affogato: Open-Vocabulary Affordance Grounding with Automated Data Generation at Scale

Affogato通过串联Gemma3、Molmo、MobileSAM三个基础模型构建全自动标注管线,从Objaverse的15万3D资产中生成了750K规模的开放词汇affordance热力图数据集(Affogato-750K),并设计跨模态统一架构Espresso-3D/2D验证了该数据集作为通用监督信号的有效性——预训练后在3D和2D affordance grounding基准上一致提升,尤其在unseen类别上增益最大。

AutoSpeed: Annotation-Free Stage-Adaptive Motion Speed Learning for Robot Manipulation

AutoSpeed 提出一种模型无关的训练框架,在不需要阶段或速度标注的情况下,通过将不同速度下的未来轨迹作为候选优化目标、用复合代价函数(预测误差 vs 预测时域)选择最优候选,让视觉运动策略端到端地学会在简单阶段加速执行、在精细阶段减速执行,在多个仿真和真实机器人任务上同时提升成功率和执行效率。

E-VLA: Event-Augmented Vision-Language-Action Model for Dark and Blurred Scenes

E-VLA 将事件相机流通过最近计数窗口转化为类帧累积表示,再以零参数叠加或 13M 分层适配器两种轻量方式融入 SmolVLA 视觉编码管线,使机器人在 20 lux 极低照度下 Pick-Place 成功率从 0% 跃升至 90%,在 1000 ms 严重运动模糊下从 0% 恢复至 25%,并在 OOD 泛化测试中仅靠 200 lux 训练数据即在 20 lux 保持 45%。

MuSix: Multi-scale Mixture of World Models for Embodied Agents in Evolving Environments

提出 MuSix 框架,通过建构水平理论(CLT)启发的经验距离驱动两阶段尺度感知路由,显式解耦世界模型的"尺度确定"与"模型选择";同时引入尺度依赖的遗忘率和门控跨尺度知识传递,让低层即时知识快速刷新、高层抽象知识持续稳定,实现具身智能体在动态环境中的多尺度自适应演化。

LIBERO-Safety: A Comprehensive Benchmark for Physical and Semantic Safety in Vision-Language-Action Models

本文提出 LIBERO-Safety,一个通过参数化场景定义语言(UBDDL)程序化生成安全性关键场景、以 keypose 驱动的大规模无碰撞演示数据管线(19664 条)、以及五维安全任务分类体系(75 个任务)来系统评估 VLA 模型物理安全与语义安全的全面基准,揭示了当前 VLA 模型在泛化能力与安全执行之间存在根本性张力——高多样性训练虽能提升安全轨迹质量,但任务成功率仍受制于次优轨迹合成与语义错配。

NavWM: A Unified Navigation World Model for Foresight-Driven Planning

NavWM 提出一个统一导航世界模型,在共享的双向 Mamba 主干上联合学习潜在世界推理(深度/语义场景抽象)、锚点式多模态轨迹预测和 Flow Matching 条件视觉生成,使得世界模型本身能充当"视觉预见"闭环规划器——对每条候选轨迹模拟未来观测并选出最优路径——在五个机器人数据集上离线生成质量(PSNR 14.17→17.34)和零样本导航成功率(44%)均达到 SOTA。

PolicyTrim: Boosting Intrinsic Policy Efficiency of Vision-Language-Action Models

PolicyTrim 提出两阶段 GRPO 后训练框架,通过动态执行窗口探索扩展可靠动作块长度、配合节省步数奖励与群锚定稳定性正则消除冗余物理步骤,在不改架构、不增示范数据的前提下将 VLA 机器人端到端部署速度提升最高 5.83 倍。

Pondering the Way: Spatial-perceiving World Action Model for Embodied Navigation

SWAM 提出将视觉导航中的轨迹规划与未来观测生成合二为一,用单次扩散推理从起始/目标 RGB 图像直接联合生成中间 RGB-D 帧序列和对应的行动轨迹,摒弃了传统"采样-验证"两阶段范式,在精度、效率和零样本泛化上全面超越基线。

Pose Anything Anywhere: Model-free Object Poses from Arbitrary References

PANY提出统一的无模型6D位姿估计框架,将多视图几何推理与跨视图对应学习联合端到端训练,从任意数量的稀疏参考图(含可选无位姿辅助视图)中直接估计未见物体的6D位姿,无需CAD模型或预注册,在YCB-V、LM-O等基准上大幅超越此前方法。

查看全部15篇「机器人/具身智能」论文 →


🎮 强化学习 (1)

ELVA: Exploring Ranking-Driven Universal Multimodal Retrieval

ELVA 提出基于规则的可验证奖励 RL 框架,通过排序奖励和间隔奖励联合优化 MLLM 的检索排序能力,解决对比学习适配检索任务时产生的"粒度盲区"(grain blindness)问题,在 M-BEIR 和自建多粒度基准 MRBench 上均取得 SOTA,其中 MRBench 提升 13.1%。


🔄 自监督/表示学习 (3)

ExPLoRe: Expert Patch-Level Loss Routing for Multi-Objective Masked Image Modeling

ExPLoRe 将 Soft-MoE 的调度权重 (dispatch weights) 重新用作多目标掩码图像建模中逐 patch、可学习的损失系数,通过损失耦合 (loss-coupling) 机制让路由器依据不同区域的语义特性动态调整各目标的权重,在 ImageNet-1K 上以更低的推理计算量(11.93 GFLOPs vs. 17.45)达到了 80.6% linear probe 和 85.3% finetuning 精度,并提出了三组下游迁移策略(Freeze Routing / Expert Dropout / Freeze Attention)将语义分割的 mIoU 差距从 2.5–2.9 完全弥合。

From Phase to Phenomenon: Self-Supervised Learning of Subsurface Scattering with Minimal Phase-shift Inputs

提出一套自监督预训练框架,利用投影仪-相机系统仅需8张高频相移条纹(PSP)图像即可学习通用的次表面散射(SSS)表征,再通过解码器预测各向异性散射足迹,实现零样本重光照,将新物体的数据采集量从数千张降至8张。

LoT-Pass: Long-term-robust Image Watermarking for Image to Video Generation

LoT-Pass 提出双向鲁棒策略——训练阶段用时序演变模拟主动扩大水印的鲁棒距离,推理阶段用光流反演把严重漂移帧"拉回"可提取状态——首次在 I2V 生成场景下实现超过 95% 的视频级水印提取准确率。


📐 优化/理论 (2)

RBE-Flow: Recurrent Bayesian Estimation on Feature Manifolds for Cross-Modal Registration

将跨模态密集光流估计重新建模为特征流形上的闭环递归贝叶斯状态估计问题,通过 RMO(递归流形优化)生成带不确定性的流观测、UAPU(不确定性自适应概率更新)用 Sigma 点投影进行 MMSE 最优贝叶斯融合并将后验协方差反馈调节下一次优化,在 OSdataset、WHU-OPT-SAR 和 RoadScene 三个跨模态数据集上一致达到 SOTA,AEPE 相比此前最佳方法降低 45.4%。

SON-GOKU:图着色实现多任务学习的无冲突调度

SON-GOKU 通过实时测量多任务学习中各任务的梯度冲突,构建冲突图并利用贪心图着色算法将任务动态划分为低冲突组,每个训练步只激活一组任务,周期性重着色以适应梯度演化,在六个数据集上一致提升了多种 MTL 基线方法的效果。


🔗 因果推理 (1)

FD\(^2\): A Dedicated Framework for Fine-Grained Dataset Distillation

FD\(^2\) 针对现有解耦式数据集蒸馏方法在细粒度数据集上忽略了判别性局部区域的问题,通过引入反事实注意力学习(CAL)提取判别性注意力图和类别原型,并在蒸馏阶段加入细粒度特征约束和同类样本相似度约束,作为即插即用模块显著提升 SRe2L++ 和 FADRM+ 在 CUB-200-2011、FGVC-Aircraft、Stanford Cars 等细粒度数据集上的蒸馏质量,IPC=1 时最大提升 +15.1%。


🔬 可解释性 (2)

Evaluating the Interpretability of Sparse Autoencoders with Concept Annotations

本文提出一套基于人类概念标注的 SAE 可解释性评估框架,包含支持多对一匹配的 FBMP 算法和基于目标属性扰动的 TAPAScore 因果验证指标,并构建了 synCUB/synCOCO 两个合成扰动数据集;实验表明现有自动评估指标(FMS、MS、CKNNA)无法通过健全性检验,而本文的匹配指标和 TAPAScore 能可靠区分训练/未训练 SAE,且过完备度增加反而会降低扰动对齐质量。

On the Faithfulness of Post-Hoc Concept Bottleneck Models

这篇论文系统分析了 post-hoc CBM 中概念投影(concept projection)的忠实性(faithfulness)问题,证明了分类器准确率不能作为瓶颈层质量的代理指标(随机投影也能达到竞争性能),识别出两个导致不忠实的根本原因——辅助数据集的协变量偏移和 VLM 代理标签的系统性错误——并提出了对应的诊断指标(\(\mathcal{H}\Delta\mathcal{H}\)-散度 和 误差-激活相关性)。


📦 模型压缩 (11)

Condensing Large-Scale Datasets Directly with Minimal Information Loss

本文指出主流大规模数据集蒸馏(SRe2L 系)的「数据→模型→图像」双重压缩过程会造成严重信息损失、并使蒸馏图像偏离真实分布从而拖垮 Relabel,提出 CIM:用一个可计算的「有效信息 gap」度量,直接在原图上最小化合成集与真实集的信息差,绕开昂贵的 recover 阶段,在 ImageNet-1K IPC=10 上以单卡 80 分钟拿到 48.7% Top-1(ResNet-18)。

Distill on a Diet: Efficient Knowledge Distillation via Learnable Data Pruning

本文提出 IF-Beta 框架, 用影响力函数(IF)作为无需重训的样本重要性评分器, 配合可学习的 Beta 分布采样策略, 通过特征空间双层优化高效搜索最优剪枝子集, 使学生在更少数据和算力下超越全量数据蒸馏的性能.

Distill Once, Adapt Life-Long: Exploring Dataset Distillation for Continual Test-Time Adaptation

DO-ALL 在部署前用数据集蒸馏(DD)将源域压缩为一小组合成锚点(每个锚点包含合成样本、源模型软标签和潜在特征),测试时通过特征空间余弦相似度为每个目标样本匹配语义最近的锚点,用锚点回放、目标-锚点 MixUp 正则化和多层 MMD 特征对齐稳定模型更新,并辅以有害自适应混合机制按参数组梯度有害程度选择性回退到源模型初始化,以即插即用方式一致提升 EATA、RMT、ROID、ASR 等多种 CTTA 方法在 ImageNet-C 和 CCC 基准上的长期鲁棒性。

MambaRaw: Selective State Space Modeling for Efficient 4K Raw Image Reconstruction

MambaRaw 将状态空间模型(SSM/Mamba)引入 JPEG 引导的元数据 RAW 图像重建框架的熵参数估计中,通过能量引导的分块选择性扫描(TileMambaBlock)与能量感知特征精炼(EAR)两个轻量模块,在 4K 分辨率下同时提升了重建质量(PSNR 提升 1.2–1.4 dB)并降低了编码延迟(约 9%)。

MixTTA: Low-Rank Cross-Channel Mixing for Reliable Test-Time Adaptation

MixTTA 在归一化层的逐通道仿射变换基础上,插入一个低秩残差跨通道混合模块,使测试时自适应(TTA)能够纠正分布偏移引起的通道间相关结构变化,配合解耦投影和谱投影两个正则手段防止对角泄露与秩一坍缩,在标准与 wild TTA 场景下即插即用地提升 Tent / EATA / SAR / DeYO / ReCAP 五大基线的精度和稳定性。

MLVC: 面向真实部署的多平台学习式视频编解码器

把熵编码所需的 scale 参数从「网络实时算出来」改成「通过 hyperprior 确定性地传出来」,让神经视频编解码器第一次能在 Apple / Intel / Qualcomm 等异构 NPU 上「A 端编码、B 端解码」而不崩溃,同时靠门控记忆、ReGLU、长期参考帧恢复等一系列改进把跨平台约束带来的码率损失补回来,在视频会议基准上相对硬件 HEVC 拿到 >70% 的 BD-rate(MOS) 提升、三平台平均 100 FPS。

On the Vulnerability of Parameter-Level Defenses to Model Merging

本文揭穿了「用线性变换让模型不可合并」这类参数级防御的根本漏洞——被保护的任务向量比预训练锚点小 2~3 个数量级,于是提出 Anchor-Guided Attack(AGA):把公开预训练模型当静态锚点,用最小二乘 + 匈牙利算法解析地还原出防御方藏起来的变换矩阵,几乎无损地恢复受保护模型;同时给出抗攻击的 Anchor-Repulsive Fine-tuning(ARF)防御作为补救。

RaysUp: Ultra-light Universal Feature Upsampling via Geometry-Aware Ray Representation

提出一个仅 0.14M 参数、同时任务无关和 VFM 无关的极轻量通用特征上采样框架 RaysUp,通过空间解耦引导编码器、光线位置编码(RayPE)和几何感知邻域交叉注意力三个关键设计,将特征重建从 2D 像素平面提升到 3D 光线域,在语义分割、深度/法向估计、视频目标分割和开放词汇分割等多种密集预测任务上达到 SOTA 或接近 SOTA,推理速度比此前唯一的 VFM-agnostic 方法 AnyUp 快约 7 倍。

Structural Assessment for Understanding and Guiding Dataset Distillation in Discrete Token Space

本文通过离散视觉token空间的统计分析方法,提出了结构评分(Structural Score)来评估蒸馏数据集质量,并基于此设计了TGDD(Token-Guided Dataset Distillation)框架,利用结构评分引导扩散模型生成高质量蒸馏数据。

Structured Hyperedge Adaptation for Parameter-Efficient Fine-Tuning of Vision Transformers

把 ViT 的 adapter 微调从「每个 token 各自单独更新」搬到「超边空间」——先用可学习原型把 patch token 软路由成若干组(超边),在超边上做低秩瓶颈适配,再把更新扩散回 token,用极小的参数量(<0.5% backbone)在 VTAB-1K 上把结构化推理任务的准确率显著拉高。

查看全部11篇「模型压缩」论文 →


🏥 医学图像 (14)

3D Field of Junctions: A Noise-Robust, Training-Free Structural Prior for Volumetric Inverse Problems

提出 3D Field of Junctions (3D FoJ),将 2D FoJ (ICCV 2021) 的显式几何参数化推广到三维体积——用三平面交于顶点的 junction 对每个 3D patch 建模,逐 patch 离散坐标下降初始化后全局联合梯度精炼,无需任何训练数据即可在极低 SNR 下保留锐利边角,并可作即插即用的近端正则项嵌入任意体积逆问题(低剂量 CT、冷冻电镜、点云去噪均验证有效)。

A Mechanism-Driven Theory of Phase Transitions in Active Learning

本文提出一种机制驱动的主动学习相变理论:将 PAC 泛化界的四个分量(经验风险、分布差异、模型复杂度、置信项)重新解释为动态交互项,证明其主导地位沿标注轨迹必然发生切换,并用可测代理指标和分段回归识别出"数据驱动—过渡—模型驱动"三阶段分类法,解释了为什么代表性、覆盖性、不确定性策略在不同预算阶段各擅胜场。

基于扰动高斯集合的层析成像主动视角选择

针对稀疏CT中X射线主动视角选择难题,提出基于辐射3DGS的扰动高斯集合框架:通过随机扰动低密度Gaussian基元的密度参数构建轻量模型集合,用候选视角投影的结构相似性(SSIM)方差量化认知不确定性,选择最能暴露几何伪影的视角作为下一最佳采集角度。

BioMedVR: Confusion-Aware Mixture-of-Prompt Experts for Biomedical Visual Reprogramming

BioMedVR 首次将视觉重编程(Visual Reprogramming)引入医学影像领域,通过双专家解耦的混淆感知 MoPE 架构——正专家负责主类判别、负专家借助 LLM 生成的混淆属性抑制易混淆类别,配合一个带边距的混淆抑制损失(CS Loss)显式拉大正负分数间距——在 11 个医学数据集(9 种成像模态)和 7 个自然图像基准上一致超越现有 VR 和提示学习方法,参数量仅为全模型微调的 1/500。

BrainFIBRE: A Foundation Model via Information Decomposition for Brain Microstructure

BrainFIBRE 是首个面向脑组织微结构的基础模型,把 NODDI 派生的三张微结构图(NDI/ODI/FWF)当成三个模态,用「自监督偏信息分解 SPID + 反事实候选构造 CCC」在 UK Biobank 5.5 万人上预训练一个混合专家网络,无标签地把三模态的独有/冗余/协同信息拆开,在跨种族多队列的年龄/性别/脑血管与神经退行标记/认知等下游任务上全面刷到 SOTA,且专家权重可解释。

BrainRiem: Riemannian Prototype Learning for Source-Free Cross-Site Brain Network Diagnosis

BrainRiem 提出在黎曼流形上通过双层优化学习紧凑的脑网络原型(prototype),实现无需源数据访问的跨站点脑功能连接诊断,在 ABIDE 和 REST-meta-MDD 多站点基准上大幅超越现有方法,且学得的原型具有生物可解释性。

Dual-Prior Guided Null-Space Learning with Mixture-of-Splines for Arbitrary Medical Slice Super-Resolution

本文将医学切片任意倍率超分辨率重新建模为受约束的逆问题,通过零-值空间分解实现测量一致性硬约束,并在零空间内用混合B样条专家按局部解剖特征自适应分配连续性阶数,严格保证已采集切片不变的同时生成解剖合理的插值细节。

From Reconstruction to Decision: A Post-Encoder Plug-in Adapter for Curvilinear Segmentation

本文提出 PEPA,一个轻量级后编码器即插即用适配器,通过目标条件蛇形上采样(TCSU)和目标自适应可微二值化(TADT)两个模块,在冻结基础模型编码器的条件下显著提升血管、裂缝等曲线结构分割的拓扑连续性,仅增加 0.26M 参数即可在五个医学与工业基准上取得平均 +2.6% IoU 和 +2.8% clDice 的提升。

Histopathology Multi-modal Embedding for Pathology Composed Retrieval

HOMIE 提出一个模型无关的两阶段适配框架,将任意生成式 MLLM 转化为病理检索专家:第一阶段用纯文本 LoRA 训练让 LLM 学会判别式度量空间(解决任务错配),第二阶段通过原生分辨率处理、染色增强和渐进知识课程注入病理形态学先验(解决领域错配),在作者新提出的 PCR 组合检索基准上,2B 参数版本即大幅超越 7B 专用病理 MLLM 和双编码器模型。

MedCAGD: Context-Aware Gated Decoder for Efficient Medical Image Segmentation

MedCAGD 提出一种以解码器为中心的医学图像分割框架,通过上下文感知门控解码器系统性地调控跳跃连接融合和多尺度上下文聚合,在 11 个医学图像分割基准上以 30.60M 参数和 5.0 GFLOPs 的轻量计算代价,一致超越 CNN、Transformer、Mamba 及 SOTA 解码器方法。

查看全部14篇「医学图像」论文 →


🛡️ AI 安全 (7)

A Classifier-Agnostic Zero-Shot Adversarial Attack Detection via CLIP

提出 A4D,一个完全黑盒、零样本的对抗攻击检测框架——利用 CLIP 对微小扰动的敏感性,通过将图像嵌入与一组精心设计的文本提示词比较余弦相似度,再经 PCA 聚合为单一检测分数,无需知道攻击类型或分类器结构即可检测对抗样本,在多个攻击/数据集/分类器上达到 SOTA。

Exploiting Local Flatness for Efficient Out-of-Distribution Detection

本文首次系统分析了 OOD 样本与 ID 样本在损失景观曲率上的差异,发现 OOD 输入的 Hessian 曲率更大且随分布偏移加剧而增大;基于此提出轻量级 OOD 检测器 Fold,用特征空间 Hessian 替代昂贵的参数空间曲率近似,配合部分特征归一化增强 ID-OOD 可分性,并用自监督 logit 遮蔽(AutoFold)自动标定归一化参数,在多个 benchmark 上平均 AUROC 提升 1.63%、FPR95 降低 2.30%,计算开销仅与单次前向传播相当。

Beyond IID: How General Are Tabular Foundation Models, Really?

本文构建了首个统一、跨学科的表格数据基准 BeyondArena(含 142 个数据集、覆盖 IID/时序/分组任务),系统评测 11 个主流表格基础模型后发现:当前模型仅在中小规模 IID 数据上领先,而在非 IID、大规模、高维度场景中传统树模型和深度学习模型仍占主导。

Improving Adversarial Robustness via Activation Amplification and Attenuation

本文提出 A3(Activation Amplification and Attenuation),一个轻量的可学习激活缩放模块,通过同一组参数实现激活放大与衰减两种模式——训练时利用放大模式的降级预测作为负参考构造对比/排名损失,推理时仅用衰减模式即可在不引入显著计算开销的前提下提升对抗鲁棒性。

IREU: Identity-Related Encoder-Only Unlearning for Customized Portrait Generation

IREU 首次针对定制人像生成(CPG)提出身份遗忘问题,通过 Face-Swap 定位嵌入空间中的身份相关维度、仅在这些维度上做特征扰动,实现只更新图像编码器即可去除目标身份生成能力、同时保持其他身份生成保真度的遗忘管线,且遗忘后的编码器可零微调迁移到不同 CPG 生成器。

Moiré Video Authentication: A Physical Signature Against AI Video Generation

本文提出利用莫尔干涉条纹作为物理签名来认证视频真伪:将紧凑的双层光栅结构放置在拍摄场景中,通过计算条纹相位变化与光栅图像平移位移之间的 Pearson 相关系数区分真实视频与 AI 生成视频——真实视频中两者由光学几何定律严格耦合(相关系数均值 0.87),而当前最强视频生成模型(Veo 3.1、Grok Imagine、LTX-2)在最优配置下也无法精确复现这种耦合(相关系数均值 0.57),Cohen's d 达 1.71,差异高度显著。

ProtoFair: Fair Self-Supervised Contrastive Learning via Pseudo-Counterfactual Pairs

ProtoFair 提出一种即插即用的公平性正则项,在不修改现有自监督对比学习目标的前提下,通过动量更新的无监督聚类原型发现「同语义内容但不同敏感组」的伪反事实对,在嵌入空间中拉近这些跨组样本,迫使编码器学习对敏感属性不变的表征;在 CelebA、UTKFace 和 NIH Chest X-rays 上搭配 SimCLR / SupCon / BarlowTwins / BYOL 均能显著降低 Equalized Odds 同时保持竞争力准确率。


📂 其他 (17)

Articulat3D: Reconstructing Articulated Digital Twins From Monocular Videos with Geometric and Motion Constraints

Articulat3D 提出一个两阶段优化框架,从单目随意拍摄视频中重建铰接物体的可交互数字孪生:第一阶段用低维运动基(motion bases)对 3D 点轨迹做结构化部分级运动分解,第二阶段用显式运动学基元(旋转/平移关节的轴、枢轴、逐帧标量)约束运动使其满足物理刚体规律,在合成和真实数据上均达到 SOTA 精度且无需静态预扫描。

FedLAS: Feature-Modulated Bidirectional Label Smoothing for Neural Network Calibration

提出 FeDLaS(Feature-modulated Bidirectional Label Smoothing),利用隐藏层特征 L1 范数作为置信度代理以绕过 softmax 饱和缺陷,搭配双向校准门控实时判断每个样本的过置信/欠置信状态,逐样本动态调制标签平滑强度,在保持 Top-1 精度的前提下显著降低 ECE 和 AECE。

Geometric Gradient Rectification for Safe Open-Set Semi-Supervised Learning

本文提出 GGR(Geometric Gradient Rectification),一种即插即用的梯度空间校正框架:以有监督梯度为锚点,将与之冲突的无监督辅助梯度投影到安全半空间内,使辅助更新在所选参数块上与有监督方向保持一阶非对抗,从而在不依赖精确 OOD 检测的前提下同时提升闭集泛化与开集鲁棒性。

Geometry-Anchored Transport Framework for Exemplar-Free Class-Incremental Learning

本文提出 Geometry-Anchored Transport Framework,将特征传输从解耦的后处理范式转变为训练时的几何约束,通过解析几何锚点(Sylvester 方程闭解)抑制宏观各向异性漂移,配合拓扑感知演化约束局部流形退化,在无样本约束下稳定地传输旧类高斯统计量以实现可靠 Mahalanobis 评估。

Hybrid Event–Frame Sensors: Modeling, Calibration, and Simulation

本文首次提出混合事件-帧传感器的统一统计噪声模型、标定流程和仿真器 H-ESIM,通过 APS 与 EVS 共享光度信号的联合建模,从真实传感器数据中估计噪声参数,并生成与硬件噪声统计一致的 RAW 帧和事件流,在视频帧插值和去模糊任务上验证了仿真到真实域的迁移有效性。

Intrinsically Stable Spiking Neural Networks: Overcoming the Performance Barrier in the Absence of Batch Normalization

IS-SNN 通过拓扑感知的权重标准化和改进的残差连接,在完全移除激活归一化层(Batch Normalization)的情况下,使深度脉冲神经网络的发放率保持稳定,训练完成后将标准化操作折叠进静态权重,推理时零归一化开销,在 ImageNet 上达到 68.05% 精度且 FPGA LUT 资源消耗降低 96.4%。

Lie Group Diffusion Models for Hardware-Aware Quantum Circuit Synthesis

提出了一种基于SU(2)李群流形上的扩散模型进行硬件感知量子电路综合的方法,将量子电路设计拆分为离散的电路骨架选择(骨架选择器)与连续的单量子比特门参数生成(条件扩散先验)两部分,在哈密顿模拟任务上显著超越Haar随机采样和生成搜索基线。

Lost in the Tail: Addressing Geographic Imbalance in Urban Visual Place Recognition

本文发现城市级视觉位置识别数据集存在严重的长尾地理分布问题(头尾类样本比达 300:1),提出 DAPR 框架——训练阶段用 Low-visit Bias 损失逆频率加权并校准分类器偏差,推理阶段用特征函数距离在频域实现分布感知的重排序,在 SF-XL 基准上超越此前最佳混合管线 18.3% R@1。

Match-Any-Events: Zero-Shot Motion-Robust Feature Matching Across Wide Baselines for Event Cameras

本文提出首个实现零样本跨数据集泛化的事件相机宽基线特征匹配模型,通过分离式时空注意力骨干(TAg)和稀疏感知Token自适应剪枝(SETS)实现高效多时间尺度事件特征学习,结合大规模合成(E-MegaDepth)与真实(ECM)宽基线数据集训练,在多个基准上相比此前最佳方法提升37.7%。

NURBS Splatting: A Unified Differentiable Rendering Framework for Vector Graphics

本文提出NURBS Splatting,通过将NURBS曲线沿弧长自适应采样为各向同性高斯核并使用基于tile的高斯溅射光栅化器进行可微渲染,首次将有理权重和非均匀节点向量纳入2D图像空间端到端优化,在书法重建、分层图像矢量化和单笔画图像抽象等任务上显著超越基于多项式基元的现有方法。

查看全部17篇「其他」论文 →