跳转至

📷 CVPR2026 论文汇总

4063篇CVPR2026论文解读,涵盖 3D 视觉(751篇)、图像生成(490篇)、多模态 VLM(418篇)、视频理解(187篇)、视频生成(182篇)、医学图像(173篇)、自动驾驶(157篇)、人体理解(151篇)等 46个方向。每篇含一句话总结、核心思想、方法详解、实验结果与局限性分析,5分钟读懂一篇论文核心思想。


💡 LLM Reasoning (16)

Scaling Agentic Reinforcement Learning for Tool-Integrated Reasoning in VLMs

本文提出可规模化的视觉工具智能体训练环境 VISTA-Gym(7 类任务、13 个数据集、26 个标准化视觉工具),并在其中用「模仿学习预热 + 多轮 GRPO 在线 RL」训练出 VISTA-R1,让 8B 级 VLM 学会在推理过程中动态选择/调用/协同视觉工具,在 11 个推理密集型 VQA 基准上比同体量 SOTA 高出 9.51%–18.72%。

Latent Chain-of-Thought World Modeling for End-to-End Autonomous Driving

LCDrive 提出潜在链式思考(Latent CoT)框架,用动作提议token和世界模型预测token替代自然语言CoT进行推理,通过冷启动+RL后训练实现更低延迟、更好轨迹质量的端到端自动驾驶。

Revisiting the Necessity of Lengthy Chain-of-Thought in Vision-centric Reasoning Generalization

作者用可控的迷宫导航任务系统对比了语言 CoT、grounding CoT、视觉 CoT 三类「think with image」式监督格式,发现更长/更花哨的视觉 CoT 只能加快收敛、抬不高最终天花板,而只保留最少 grounding 信息的极简 CoT(一条坐标路径)反而泛化最好,提出「short is long」效应并给出构造可泛化视觉推理 SFT 数据的实操指南。

Think-as-You-See: Streaming Chain-of-Thought Reasoning for Large Vision-Language Models

TaYS 把大视觉语言模型(LVLM)的视频推理从「看完整段再想」的批处理范式,改造成「边看边想」的流式范式——通过流式注意力掩码、解耦位置编码和并行双 KV 缓存三件套,让推理与视频帧同步增量推进,在 VideoEspresso 上把首 token 延迟从 10.6s 压到近乎为零、推理-事件偏差降低 55%,同时推理准确率提升 2.9%。

ReLaX: Reasoning with Latent Exploration for Large Reasoning Models

ReLaX 不再像现有方法那样在 token 层面强行抬高熵来对抗 RLVR 的熵坍缩,而是用 Koopman 算子把大推理模型的隐状态动力学线性化、提出"动态谱发散(DSD)"这个量化策略内部计算灵活度的指标,再把它整形进 GRPO 目标,在 7 个多模态 + 6 个纯文本推理基准上刷新同规模 SOTA。

FireScope: Wildfire Risk Raster Prediction with a Chain-of-Thought Oracle

用一个 GRPO 微调、会写思维链的 VLM(Oracle)先把卫星图+气候推理成一个标量野火风险分,再用 FiLM 把这个分喂给轻量视觉 Encoder-Decoder 去生成高分辨率连续风险栅格——在「美国训练、欧洲测试」的跨洲设定下,显式语言推理显著提升了分布外泛化,且推理痕迹可被野火专家复原、可解释。

E-comIQ-ZH: A Human-Aligned Dataset and Benchmark for Fine-Grained Evaluation of E-commerce Posters with Chain-of-Thought

构建首个面向中文电商海报的多维度质量评估框架 E-comIQ-ZH,包含18K专家标注数据集(含CoT推理链)、专用评估模型 E-comIQ-M(SFT+GRPO训练)和标准化基准 E-comIQ-Bench。

Reasoning Palette: Modulating Reasoning via Latent Contextualization for Controllable Exploration for (V)LMs

这篇论文用一个 VAE 学到的隐空间给 (V)LM 注入一个"推理调色板"——每采一个隐变量就解码成一段可学习前缀贴到 prompt 前面,让模型在生成第一个 token 之前就选定某种推理风格,从而把 RL 里的"token 级随机采样"升级成"策略级结构化探索",在多个数学推理 benchmark 上稳定超过标准 GRPO/RLOO。

APPO: Attention-guided Perception Policy Optimization for Video Reasoning

APPO 发现「视频推理瓶颈在感知而非推理」,于是用模型自身对视频帧的注意力把稀疏 outcome reward 转成 token 级稠密奖励——让不同回答里聚焦同一关键帧的「组内感知 token」按高/低奖励差异化加权学习,在 Qwen2.5-VL-3/7B 上稳定超过 GRPO 和 DAPO(0.5%∼4%)。

EagleVision: A Dual-Stage Framework with BEV-grounding-based Chain-of-Thought for Spatial Intelligence

提出EagleVision双阶段框架,宏观感知阶段用语义-视角融合DPP(SPF-DPP)在SE(3)空间联合优化语义相关性和视角多样性选择关键帧,微观验证阶段让模型在BEV平面上主动查询新视角帧进行迭代空间CoT推理(假设→查看→验证闭环),查询策略纯RL训练无需人工标注,在VSI-Bench和SQA3D上达开源SOTA。

查看全部16篇「LLM Reasoning」论文 →


🦾 LLM Agent (42)

JarvisEvo: Towards a Self-Evolving Photo Editing Agent with Synergistic Editor-Evaluator Optimization

JarvisEvo 把"会修图的设计师"做成一个单模型 Agent:它一边调用 Lightroom 工具迭代修图、一边对中间结果做视觉自评、再据此反思纠错,并用一套"编辑器自奖励 + 评估器人标校准"的双环 RL(SEPO)让它不靠外部奖励模型就能自进化,在 ArtEdit-Bench 上像素保真度比 Nano-Banana 高 44.96%。

Resolving Evidence Sparsity: Agentic Context Engineering for Long-Document Understanding

针对长文档问答里"关键证据稀疏散落、冗余上下文干扰判断"的痛点,提出免训练多智能体框架 SLEUTH,用"检索→线索挖掘+视觉筛选→难度评估→决策"的 coarse-to-fine 流水线,把噪声满满的 top-K 检索页蒸馏成简洁且证据密集的多模态上下文,在四个长文档基准上以模型无关方式刷到 SOTA。

Agent4FaceForgery: Multi-Agent LLM Framework for Realistic Face Forgery Detection

用一套 LLM 驱动的多智能体系统去"扮演"造假者和社交网络上的吃瓜群众,模拟人脸伪造从创作到传播的完整生命周期,合成出带文图一致性标注的训练数据,让 deepfake 检测器在跨域、跨伪造算法的真实场景下涨点显著(如 Celeb-DF AUC 从 70% 级提到 87.1%)。

REALM: An MLLM-Agent Framework for Open World 3D Reasoning Segmentation and Editing on Gaussian Splatting

提出 REALM 框架,利用 MLLM 的推理能力通过全局到局部空间定位策略在 3DGS 上进行开放世界 3D 推理分割,无需 3D 后训练即可处理隐式指令,在 LERF 上 mIoU 达 92.88%,远超基线方法 40+ 个百分点,并支持物体移除、替换和风格迁移等编辑任务。

HATS: Hardness-Aware Trajectory Synthesis for GUI Agents

提出难度感知的轨迹合成框架 HATS,通过 hardness-driven exploration 和 alignment-guided refinement 的闭环机制,专注采集和修正语义歧义动作的训练轨迹,大幅提升 GUI Agent 在复杂真实场景中的泛化能力。

HAVEN: Hierarchical Long Video Understanding with Audiovisual Entity Cohesion and Agentic Search

HAVEN 提出音视频实体凝聚 + 层次索引 + Agent搜索的统一框架,通过说话人身份作为跨模态一致性信号,构建全局-场景-片段-实体四级层次数据库,在LVBench上达到84.1%整体准确率的SOTA。

OS-Oracle: A Comprehensive Framework for Cross-Platform GUI Critic Models

针对"看屏幕操作电脑"的 GUI agent 缺乏可靠的逐步判错器这一痛点,OS-Oracle 用一条从正样本轨迹自动伪造四类典型错误动作的数据流水线造出 31 万条 critic 样本,再用 SFT + 一致性保持的 CP-GRPO 两阶段训练出 7B critic 模型,并配套首个覆盖移动/网页/桌面的人工标注 critic 基准 OS-Critic Bench,开源模型里拿到 SOTA 并能实测提升 UI-TARS 的任务成功率。

SAGE: Training Smart Any-Horizon Agents for Long Video Reasoning with Reinforcement Learning

SAGE 把长视频推理从"一口气塞进上千帧、单轮直答"的 DIRECT 范式,改造成"像人一样按需多轮检索、简单题直接答"的 AGENT 范式:用一个会编排 6 种工具的 orchestrator VLM(SAGE-MM)+ 低成本合成数据 + 多奖励 GRPO 后训练,在自建的 SAGE-Bench 上开放式问答提升最高 6.1%、>10 分钟长视频最高提升 14.6%。

Think, Then Verify: A Hypothesis-Verification Multi-Agent Framework for Long Video Understanding

提出 VideoHV-Agent,将长视频问答重新建模为"假设-验证"过程:Thinker 将答案选项改写为可测试假设,Judge 提取区分性线索,Verifier 在视频中定位证据进行验证,Answer 综合证据给出最终答案,在 EgoSchema/NextQA/IntentQA 三个基准上取得 SOTA,同时推理效率优于现有 Agent 方法。

Refer-Agent: A Collaborative Multi-Agent System with Reasoning and Reflection for Referring Video Object Segmentation

Refer-Agent 把指代视频目标分割(RVOS)拆成「帧选择→意图分析→目标定位→掩码生成」的分步推理流水线,再叠一层由提问者-回答者构成的双阶段 Chain-of-Reflection(存在性反思 + 一致性反思)在推理与反思之间交替自纠,从而在完全免训练、仅用 9B 开源 MLLM 的条件下,于 5 个 RVOS 基准上同时超过 SFT 方法和接入 GPT-4o 的零样本方法。

查看全部42篇「LLM Agent」论文 →


👥 Multi-Agent (2)

Visual Document Understanding and Reasoning: A Multi-Agent Collaboration Framework with Agent-Wise Adaptive Test-Time Scaling

MACT 把"单模型一把梭"的视觉文档问答拆成规划、执行、判断、回答四个分工明确的智能体,并按每个智能体的认知负荷自适应分配测试时算力(而非统一堆参数),在 15 个基准上以 <30B 参数稳进前三、平均比基座模型提升 9.9–11.5%。

AgentDet: A Shared-Blackboard Multi-Agent Framework for Zero-/Few-Shot Object Detection

AgentDet 把零/少样本目标检测拆成 Scout / Pinner / Curator / Judge 四个 LLM 智能体,通过一块"共享黑板"+一个 patch 级"知识库"协作:把视觉证据碎片化存进知识库、组合成整体文本线索喂给 LLM 做框预测,并且只训练 Judge 一个智能体,就在 PASCAL VOC / COCO 的 ZSOD/FSOD 上做到了与 SOTA 强竞争的结果。


⚖️ 对齐 / RLHF (12)

SafeGRPO: Self-Rewarded Multimodal Safety Alignment via Rule-Governed Policy Optimization

SafeGRPO 把"可验证的规则化奖励"塞进 GRPO,让多模态大模型在无需人工偏好标注的情况下自奖励地学会"先按视觉/文本/组合三层逐步推理安全性、再决定回答还是拒答",在多个安全基准上同时提升越狱防御、安全意识与稳定性,且几乎不损伤通用能力、不引入过度拒答。

EcoAlign: An Economically Rational Framework for Efficient LVLM Alignment

EcoAlign 把视觉语言大模型(LVLM)的推理时对齐重新框定为"有限算力预算下的最优路径搜索"问题:在动态构建的思维图上用一个类似净现值(NPV)的前瞻函数给每个候选动作打分,权衡安全、效用与成本,并用"最弱环节"原则定义路径安全,从而在更低算力下达到甚至超过现有方法的安全与效用。

Bridging Human Evaluation to Infrared and Visible Image Fusion

针对红外-可见光图像融合(IVIF)长期只优化手工指标、与人眼审美脱节的问题,本文构建了首个大规模 IVIF 人类反馈数据集,训练了一个"融合导向奖励模型"来量化感知质量,再用 SAM 辅助的 GRPO 把融合网络对齐到人类偏好,在主流基准上取得 SOTA 且融合结果更"好看"。

Principled Steering via Null-space Projection for Jailbreak Defense in Vision-Language Models

提出 NullSteer,一种基于零空间投影的激活转向防御框架,通过将转向操作限制在良性激活的零空间中,在不损害模型通用能力的前提下有效抵御视觉越狱攻击。

Thinking with Frames: Generative Video Distortion Evaluation via Frame Reward Model

REACT 是一个面向生成视频「结构失真」的帧级奖励模型:先建一套八类失真分类体系并标注 1.5 万对帧偏好数据,用 grounding 重构 + Gemini-2.5-Pro 低成本合成 6K 条 CoT,再以「掩码 SFT + GRPO 成对奖励」两阶段训练 Qwen2.5-VL-7B,推理时用动态采样聚焦最可能失真的帧,在偏好对齐和失真识别两项任务上都显著超过现有视频/图像评估器。

Video-CoE: Reinforcing Video Event Prediction via Chain of Events

针对多模态大模型在"看视频预测未来事件"(VEP)上既缺乏逻辑推理、又不看画面只猜选项的两大毛病,本文提出 Chain of Events(CoE)范式——让模型先把视频切成带时间戳的历史事件链、再基于事件链做因果推理,并用一套两阶段训练(CoE-SFT 注入推理 + CoE-GRPO 用稠密奖励强化事件链构造)把 Qwen2.5-VL-7B 在 FutureBench 上从 52.9% 拉到 75.0%,刷新 VEP 的 SOTA。

DRM: Diffusion-based Reward Model With Step-wise Guidance

本文把预训练扩散模型本身当作奖励模型骨干(DRM),利用它能给任意去噪步的噪声潜变量打分这一独特能力,分别设计了密集逐步奖励的 Step-GRPO(训练)和"探索-择优"的 Step-wise Sampling(推理),在不增参数的前提下显著提升 SD3.5-Medium 的生成质量,且收敛速度快 2.5–3.5 倍。

MorphSeek: Fine-grained Latent Representation-Level Policy Optimization for Deformable Image Registration

MorphSeek 把可变形医学图像配准重新定义为「在编码器隐空间里做策略优化」——在 U-Net 编码器顶层接一个高斯策略头把隐特征当作可采样的动作,先无监督 warm-up 稳定隐空间,再用 GRPO 做多轨迹多步弱监督微调,配合 LDVN 让上万维隐空间里的策略梯度稳定下来,在三个 3D 配准基准上用极少标签把 Dice 提了 2–4%、把折叠率(NJD)降了 30–60%。

Uncertainty-Aware Exploratory Direct Preference Optimization for Multimodal Large Language Models

UE-DPO 把多模态大模型(MLLM)幻觉抑制的优化重心,从"模型已经看得懂的视觉敏感 token"挪向"模型看不懂、却很关键的认知盲区 token"——用 token 级认识不确定性(epistemic uncertainty)量化这些盲区,再按不确定性给 preferred / dispreferred 两支非对称地调节 DPO 梯度强度,在多个幻觉 benchmark 上以更小数据量超过 TPO/V-DPO 等同类方法。

Anchoring the Mind of Multimodal Reasoners: Cognitive Bias as a Vector for Jailbreak Attacks

本文发现多模态大推理模型(MLRM)的安全判断存在"锚定效应"——会被最先看到的信息严重带偏,据此提出 RA-Attack:先用一张"看起来安全"的结构化思维导图加教育语境文本把模型的推理链锚定到安全基调,再顺势把有害意图包装成这条推理链的自然延伸,在 7 个主流 MLRM 上把越狱成功率(ASR)刷到 92%(Gemini-2.5-Pro)、82%(GPT-4o)的 SOTA。

查看全部12篇「对齐 / RLHF」论文 →


🔒 LLM 安全 (12)

Elastic Weight Consolidation Done Right for Continual Learning

本文从梯度视角系统分析了 EWC 及其变体在权重重要性估计上的根本缺陷(EWC 的梯度消失和 MAS 的冗余保护),并提出了一个极其简单的 Logits Reversal 操作来修正 Fisher 信息矩阵的计算,在无样例类增量学习和多模态持续指令微调任务上大幅超越原始 EWC 及其所有变体。

SineProject: Machine Unlearning for Stable Vision–Language Alignment

针对多模态大模型(MLLM)在机器遗忘过程中投影层 Jacobian 严重病态导致视觉-语言对齐漂移的问题,提出 SineProject——通过对投影层权重施加正弦调制(sin(ΔW))来约束参数范围至 [-1,1],从而将 Jacobian 条件数降低 3-4 个数量级,在完全遗忘目标知识的同时将良性查询误拒率(SARR)降低 15%。

The Blind Spot of Adaptation: Quantifying and Mitigating Forgetting in Fine-tuned Driving Models

系统研究 VLM 微调到自动驾驶场景时的灾难性遗忘问题,构建 180K 场景大规模基准 FidelityDrivingBench,并提出 Drive Expert Adapter (DEA) 通过提示空间路由在不腐蚀基础参数的前提下增强驾驶任务性能。

AutoDebias: An Automated Framework for Detecting and Mitigating Backdoor Biases in Text-to-Image Models

提出 AutoDebias——首个同时检测和缓解 T2I 模型中恶意后门偏见的统一框架,利用 VLM 开放集检测发现触发词-偏见关联并构建查找表,再通过 CLIP 引导的分布对齐训练消除后门关联,在 17 种后门场景中将攻击成功率从 90% 降至接近 0 且保持图像质量。

Designing to Forget: Deep Semi-parametric Models for Unlearning

提出"Designing to Forget"理念,设计了一族深度半参数模型 (SPM),在推理时通过简单删除训练样本即可实现遗忘(无需修改模型参数),在 ImageNet 分类上将与重训基线的预测差距减少 11%,遗忘速度提升 10 倍以上。

Learning from Oblivion: Predicting Knowledge-Overflowed Weights via Retrodiction of Forgetting

提出KNOW prediction:通过在逐步缩小的数据子集上sequential fine-tuning诱导结构化遗忘过程,收集权重转变轨迹,然后用meta-learned hyper-model(KNOWN)反转forgetting方向,预测"仿佛在更大数据集上训练"的虚拟知识增强权重。跨多数据集(CIFAR/ImageNet/PACS等)和多架构(ResNet/PVTv2/DeepLabV3+)持续超越naive fine-tuning及多种weight prediction基线,在图像分类、语义分割、图像描述、域泛化等下游任务上均有显著提升。

Select, Hypothesize and Verify: Towards Verified Neuron Concept Interpretation

提出 SIEVE(Select–Hypothesize–Verify)框架,通过筛选高激活样本、生成概念假设、再用文生图验证的闭环流程来解释神经元功能,生成的概念激活对应神经元的概率约为现有 SOTA 的 1.5 倍。

⊘ Source Models Leak What They Shouldn't ↛: Unlearning Zero-Shot Transfer in Domain Adaptation Through Adversarial Optimization

发现无源域自适应(SFDA)方法会不经意地将源域独有类别的知识泄漏到目标域(零样本迁移现象),提出 SCADA-UL 框架通过对抗生成遗忘样本和重缩放标签策略,在域自适应过程中同时完成类别遗忘,达到接近从头训练的遗忘效果。

Machine Unlearning via Adaptive Gradient Reweighting and Multi-stage Objective Optimization

针对机器遗忘里"对所有样本/类别一视同仁"和"遗忘目标与保留目标梯度互相打架"两大问题,本文提出自适应梯度重加权(按样本记忆深度/类别脆弱度给不同权重)+ 三阶段目标优化(方向纠偏 → 时间平滑 → 自适应组合),在 CIFAR-10/100、Tiny-ImageNet 上把随机遗忘的 Avg Gap 从 SOTA 的 0.85 压到 0.19。

Omni-Attack: Adversarial Attacks on Open-Ended VQA in Black-Box Multimodal LLMs

针对"开放式 VQA/OCR 任务没有显式攻击目标、现有对抗鲁棒性评测各用各的协议"两大空白,本文先建了统一的定向攻击基准 AdvRobustBench(1000 题,VQA+OCR),再提出迁移式黑盒攻击 Omni-Attack(用 LLM 生成"问题条件化"的文本/视觉目标 + OCR 位置感知扰动 + 四种迁移正则),在 GPT-4.1 上 \(\epsilon=8/255\) 就把定向攻击成功率打到 71.8%。

查看全部12篇「LLM 安全」论文 →


👻 幻觉检测 (33)

Cross-Modal Attention Calibration for LVLM Hallucination Mitigation

针对 LVLM 幻觉,本文提出免训练的跨模态注意力校准框架 CMAC:用 IMD 模块在注意力层"外科手术式"地遮蔽跨模态高权重的 value 向量来构造更精准的幻觉分布做对比解码,并用 CMPC 模块缩放图像 token 的位置索引来缓解 RoPE 带来的位置偏置,在 POPE/CHAIR/MME 上全面超过现有对比解码方法。

Thinking in Uncertainty: Mitigating Hallucinations in MLRMs with Latent Entropy-Aware Decoding

本文发现多模态推理模型(MLRM)的幻觉高度集中在 because/however/wait 这类转折词附近、而这些位置恰好是高熵(高不确定)步,于是提出免训练的 LEAD 解码策略:高熵步把采样得到的单个 token 换成「按概率加权的连续嵌入」以保留多条推理假设、并注入视觉锚点强化看图,低熵步回到常规离散解码,从而在多个 MLRM 与多个基准上稳定降低幻觉。

Tell Model Where to Look: Mitigating Hallucinations in MLLMs by Vision-Guided Attention

提出Vision-Guided Attention (VGA),一种免训练的方法,通过利用视觉token的语义特征构建精确的视觉定位,引导模型注意力聚焦于相关视觉区域,有效缓解MLLM幻觉,且兼容FlashAttention。

Residual Decoding: Mitigating Hallucinations in Large Vision-Language Models via History-Aware Residual Guidance

提出 Residual Decoding (ResDec)——一种训练免的即插即用解码策略,通过分析历史 token 的 logit 分布中的 U 型 JSD 模式发现语义锚定阶段,聚合该阶段的历史 logits 作为残差引导融入当前解码,以近乎零的额外推理开销有效抑制 LVLM 中的语言先验幻觉。

Zina: Multimodal Fine-grained Hallucination Detection and Editing

Zina 提出了多模态细粒度幻觉检测与编辑任务,设计了两阶段系统(detector MLLM + reviewer MLLM)将 token 复制委托给确定性函数以简化模型负担,同时构建了 VisionHall 数据集(6.9K 人工标注 + 20K 图结构合成数据),在检测 F1 上超过 GPT-4o 达 15.8 个点。

Same Attention, Different Truths: Put Logit-Lens over Visual Attention to Detect and Mitigate LVLM Object Hallucination

本文用 Logit-Lens 重新审视 LVLM 物体幻觉,发现真实物体与幻觉物体在中后层"注意力强度其实一样",关键不在"看多少"而在"看的地方解码出来是不是同一个东西",据此把幻觉分成"视觉不确定"与"上下文先验"两类,并提出免训练的"检测—缓解"框架(LLCC 检测 + HARM 掩码 + VEED 解码增强),在多个幻觉基准上取得 SOTA。

Beyond the Global Scores: Fine-Grained Token Grounding as a Robust Detector of LVLM Hallucinations

提出基于 patch 级别的 LVLM 幻觉检测框架,发现幻觉 token 表现出弥散注意力模式和低语义对齐两个特征标志,据此设计注意力弥散分数(ADS)和跨模态接地一致性(CGC)两个轻量指标,检测准确率达 90%。

Lyapunov Probes for Hallucination Detection in Large Foundation Models

把 (M)LLM 看成在表示空间里演化的高维动力系统、把"幻觉"重新定义为"输入落在稳定平衡点附近还是不稳定的知识边界区域",用一个带 Lyapunov 单调衰减约束的轻量探针网络(吃多层隐状态 + 扰动信息)来判别,AUPRC 在多个 LLM/MLLM 上稳定超过普通探针 4–8%。

MoD-DPO: Towards Mitigating Cross-modal Hallucinations in Omni LLMs using Modality Decoupled Preference Optimization

提出 MoD-DPO(Modality-Decoupled DPO),通过不变性正则化、敏感性正则化和语言先验去偏三个机制解耦多模态 LLM 中各模态的贡献,有效缓解跨模态幻觉(如用听觉信息回答视觉问题),并推导出闭式最优策略。

Understanding and Mitigating Hallucinations in Multimodal Chain-of-Thought Models

本文系统分析了多模态 CoT 模型中幻觉的成因,发现模型在凭联想自由发挥的推理步骤(论文称之为"发散思维" divergent thinking)中最易产生幻觉,并提出基于视觉熵的免训练检测+解码干预策略,在 Object HalBench 上将 CHAIRS 降低超过 30%,同时保持甚至提升通用推理能力。

查看全部33篇「幻觉检测」论文 →


⚡ LLM 效率 (8)

Gated KalmaNet: A Fading Memory Layer Through Test-Time Ridge Regression

把线性状态空间模型(SSM)的状态更新重新解释成"对全部历史做一次测试时岭回归",用卡尔曼滤波的精确增益替代现有 SSM 的一步梯度近似,并通过自适应正则 + Chebyshev 迭代解决低精度数值不稳与并行训练两大障碍,在短/长上下文及 ImageNet 上都超过 Mamba2、Gated DeltaNet 等线性 SSM。

Generalizable Video Quality Assessment via Weak-to-Strong Learning

不依赖任何人工打分标签,用现成 VQA 模型当"弱老师"去监督一个高容量多模态大模型"强学生",再把学生回收成下一轮老师做迭代,最终在域内持平、在 OOD 上大幅超越所有老师,把 VQA 的 OOD 整体 SRCC 从 0.59 推到 0.745。

ParallelVLM: Lossless Video-LLM Acceleration with Visual Alignment Aware Parallel Speculative Decoding

针对 Video-LLM 投机解码在长视频上"draft 和 target 互相干等"以及"提速比和模型对齐相互掣肘"两大瓶颈,ParallelVLM 把预填充和解码都做成 draft/target 并行流水线,并用基于视觉-文本相似度变化(而非注意力分数)的无偏剪枝 UV-Prune 扩大草稿窗口,在 LLaVA-OneVision-72B / Qwen2.5-VL-32B 上分别取得 3.36× / 2.42× 的无损加速,且免训练、即插即用。

Rejection Mixing: Fast Semantic Propagation of Mask Tokens for Efficient DLLM Inference

ReMix 在扩散语言模型(DLLM)的「掩码态→词元态」离散解码之间插入一个可迭代刷新的「连续混合态」,让并行解码的多个位置在落子前先在连续空间里互相协调、并用一条拒绝规则把不稳定的位置打回掩码重算,从而在不训练、不掉点的前提下把推理提速 2–8×,很多任务上准确率还反而上升。

E\(^2\)-SCI: Elastic Edge-Cloud Speculative Decoding via Credit Inertia

本文发现边云投机解码中相邻窗口的 token 接受率存在强时序一致性(称为"信用惯性"),据此用历史接受率动态调节验证阈值,再配合异步流水线(PLC)把草稿生成与云端验证并行起来,在 DeepSeek-R1-Distill-Qwen (1.5B/32B) 上达到 9.4+ tokens/s、相对 FSD 基线提速 88.5% 且不损精度。

Few-Shot Hybrid Incremental Learning: Continually Learning under Data Scarcity and Task Uncertainty

本文提出"小样本混合增量学习(FSHIL)"这一更贴近现实的新范式——数据稀缺且任务类型(新类/新域/二者皆有)随机出现,并用「条件元扩展混合专家(CME-MoE)」在特征层调和稳定与可塑、用「自扩展原型分类器(SEPC)」在分类层建模多分布边界,在 5 个数据集、3 种增量设定上全面超过现有 FSIL 与 HIL 方法。

JUMP-Hand: Learning Joint-wise Uncertainty to Gate Mixture of View Experts for Multi-View 3D Hand Reconstruction

JUMP-Hand 把多视图 3D 手部重建重新表述成"每个视图是一个专家"的 MoE 问题,用逐关节、逐视图的概率不确定性当显式门控信号——既驱动粗阶段的不确定性加权三角测量,又驱动精修阶段的不确定性门控跨注意力,从而在严重遮挡下自适应地放大可靠视图、压制噪声视图,在三个多视图基准上取得 SOTA。

QuietPrune: Query-Guided Early Token Pruning for Vision-Language Models

QuietPrune 提出查询引导的早剪枝:在 ViT 前向过程中、而非传统的 ViT 之后,就把与文本查询无关的视觉 token 剪掉——通过把 VLM 投影器做逆变换得到的轻量适配器,把文本查询转成一个视觉域的 [Q-CLS] token 来提供文本指导,再以 2×2 分组的半结构化方式剪枝并聚合冗余 token,在 Qwen3-VL / InternVL3 上把 prefill 延迟最多降 19.0%、同时比现有晚剪枝方法精度高 4.2%。


📚 预训练 (5)

Watch and Learn: Learning to Use Computers from Online Videos

提出 Watch & Learn (W&L) 框架,通过逆动力学模型 (IDM) 将互联网上的人类计算机操作视频自动转化为可执行的 UI 轨迹数据,生成 53K+ 高质量轨迹,作为 ICL 示例或 SFT 训练数据显著提升各类 CUA 性能。

Linking Modality Isolation in Heterogeneous Collaborative Perception

提出 CodeAlign 框架,通过码本构建离散代码空间和跨模态 Feature-Code-Feature (FCF) 翻译,首次解决异构协同感知中不同模态从未在训练数据中共现的"模态隔离"问题,仅需 HEAL 8% 训练参数、通信量降低 1024 倍,同时达到 SOTA 感知性能。

Exploring Visual Pretraining for Learning Language Intelligence

这篇论文提出 MAPLE:不把 PDF 抽成文本喂给 LLM,而是直接拿文档页面图像做掩码自回归预训练,让 LLM 通过"为遮挡区域生成隐式假设"来学语言智能,在四个数学推理基准上相对纯文本预训练平均提升至多 40.2%。

Reconstructing CLIP for Open-Vocabulary Dense Perception

DenseRC 针对"如何为 CLIP 构建好的密集特征"这一被忽视的问题,揭示 cls token 的泛化语义其实来自多层 value embedding、而空间聚合会放大语义错位,于是用多层 value 作基底、配一个轻量的头选择门控(HSG)只在 head 维重加权,造出与全局语义对齐的密集表示,在开放词汇检测和分割多个基准上刷新 SOTA。

Unlocking Pre-trained Weights: Parameter Inheritance for Zero-Shot Initialization

PITH 用图超网络给目标网络动态生成「投影矩阵」,把预训练大模型的内部权重直接投影到任意尺寸的目标 ViT 上完成初始化,使得初始化后的网络无需任何训练就能直接用——在 ImageNet-1K 上 ViT-Base 零样本精度 53.35%,比上一代 SOTA(TAL)高 6.54%。


✏️ 知识编辑 (2)

Attribution-Guided Model Rectification of Unreliable Neural Network Behaviors

提出归因引导的动态模型纠正框架,将rank-one model editing从领域适配重定位为行为纠正,通过Integrated Gradients量化各层可编辑性自动定位嫌疑层,仅需1个清洁样本即可修复后门攻击、虚假相关和特征泄漏三类不可靠行为。

SAME: Sparse and Anchored Model Editing for Heterogeneous Incremental Learning under Limited Data

把大语言模型里的「定位—编辑 FFN 键值对」思路搬到 CLIP 这类视觉语言模型上,提出在无任务标识、跨域、少样本的「异构增量学习(HIL)」新设定下,用稀疏微调 + 双锚约束 + 闭式求解把每个新任务的知识直接写进 FFN 输出投影矩阵,不加任何额外参数,平均精度比现有持续学习方法高 6.8%、保留 oracle 性能的 95.8%。


💬 LLM 其他 (3)

Single-step Diffusion-based Video Coding with Semantic-Temporal Guidance

S2VC 把一个单步扩散生成器塞进条件视频编码框架,用从解码特征缓冲里抽取的「上下文语义引导(CSG)」替代文本 prompt、再用插进 U-Net 的「时序一致性引导(TCG)」做跨帧对齐,在 0.02 bpp 以下的极低码率下拿到 SOTA 感知质量,相比上一代感知编解码器平均省 51.62% 码率(DISTS BD-Rate)。

OmniDocLayout: Towards Diverse Document Layout Generation via Coarse-to-Fine LLM Learning

针对现有文档版面生成数据「只有学术论文、样式单一」的痛点,作者先造了首个百万级、覆盖六类文档的多样化版面数据集 OmniDocLayout-1M,再用一个 0.5B 的小 LLM 通过「先在多域粗标签上学版面通则、再用少量细标签适配具体领域」的由粗到精范式,在 M6Doc 上同时超过专用版面生成模型和 GPT-4o/Gemini/Claude 等通用大模型。

LLM-Guided Probabilistic Fusion for Label-Efficient Document Layout Analysis

本文把文本预训练 LLM 当作"结构先验生成器"塞进半监督版面检测的伪标签精化环节——用 OCR+LLM 推断文档层级区域,再和教师检测器输出做逆方差概率融合(含可学习的实例自适应门控),仅用 5% 标注就在 PubLayNet 上达到 88.2 AP(轻量骨干)/89.7 AP(LayoutLMv3),并对标题/页眉等稀有版面元素提升最大。


🎨 图像生成 (490)

OmniGen2: Towards Instruction-Aligned Multimodal Generation

OmniGen2 用「解耦 VLM + 扩散」的统一架构(VLM 理解、扩散出图,靠 VLM 变长隐状态 + VAE 特征作条件)配上 Omni-RoPE 位置编码与一套「先建强基座、再渐进式 RL 对齐」的两阶段训练,让一个模型在文生图、图像编辑、上下文生成上都能精准跟随复杂指令,GenEval 拿到 0.95。

Improved Mean Flows: On the Challenges of Fastforward Generative Models

论文诊断出 MeanFlow(一步生成框架)的两个病根——训练目标依赖网络自身、CFG 引导尺度训练前被写死——并分别用"把目标重写成网络无关的 v-loss + 用预测的边际速度当 JVP 输入"和"把引导尺度当作可变条件 + 多 token in-context 条件注入"对症下药,得到的 iMF 在 ImageNet 256×256 上单次函数评估(1-NFE)从零训练拿到 1.72 FID,比原 MeanFlow 相对提升约 50%,逼近多步方法且全程不蒸馏。

DDT: Decoupled Diffusion Transformer

DDT 把传统"只有解码器"的扩散 Transformer 拆成一个专职提语义的 condition encoder 和一个专职回归速度场的 velocity decoder,解开了"语义编码"与"高频解码"的优化矛盾,在 ImageNet 256×256 上仅用 256 epoch 就拿到 1.31 FID(比 REPA 快约 4×),并顺带利用相邻步自条件的高度相似性做动态规划共享,把推理再提速近 3×。

PixelDiT: Pixel Diffusion Transformers for Image Generation

PixelDiT 提出完全基于Transformer的双层像素空间扩散模型:patch级DiT捕捉全局语义 + pixel级DiT细化纹理细节,无需VAE即可在ImageNet上达到1.61 FID,并直接在1024分辨率像素空间训练文本到图像模型。

Pico-Banana-400K: A Large-Scale Dataset for Text-Guided Image Editing

作者用 Nano-Banana(Gemini-2.5-Flash-Image)在真实照片(OpenImages)上批量生成约 40 万条指令式图像编辑样本,并用 Gemini-2.5-Pro 做自动质检,构建出一个覆盖 35 种编辑类型、同时支持单轮 SFT、偏好学习和多轮编辑研究的开源数据集 Pico-Banana-400K。

DeCo: Frequency-Decoupled Pixel Diffusion for End-to-End Image Generation

DeCo 提出频率解耦的像素扩散框架,用轻量像素解码器处理高频细节并让DiT专注低频语义建模,配合频率感知flow matching损失,在ImageNet上达到FID 1.62(256)和2.22(512),缩小了像素扩散与潜空间扩散的差距。

MakeAnything: Harnessing Diffusion Transformers for Multi-Domain Procedural Sequence Generation

MakeAnything 用 Flux(DiT)的 in-context 能力,通过把"绘画/手工/烹饪"等创作过程的多帧排成网格、再用非对称 LoRA 微调,第一次实现了跨 21 个领域的"分步教程"生成,既支持文本→过程,也支持上传成品图反推制作步骤(ReCraft)。

GRPO-Guard: Mitigating Implicit Over-Optimization in Flow Matching via Regulated Clipping

本文发现 FlowGRPO 在用 GRPO 微调流匹配模型时,重要性比率分布系统性左移且各去噪步方差不一致,导致 PPO 裁剪对"过自信的正样本"完全失效、模型陷入隐性奖励作弊;GRPO-Guard 用 RatioNorm 把比率标准化回均值 1、再用 \(1/dt\) 梯度重加权均衡各步梯度,在不依赖重 KL 正则的前提下显著缓解过优化、保住生成质量。

DiP: Taming Diffusion Models in Pixel Space

提出 DiP,一个高效的像素空间扩散框架,通过将 DiT backbone 在大patch上建模全局结构 + 轻量 Patch Detailer Head 恢复局部细节,实现了与LDM可比的计算效率但无需VAE,在ImageNet 256×256上达到1.79 FID。

StreamDiT: Real-Time Streaming Text-to-Video Generation

StreamDiT 提出了一套完整的流式视频生成方案(包括训练、建模和蒸馏),通过在 Flow Matching 中引入带渐进去噪的移动缓冲区和混合分区训练策略,结合时变 DiT 架构和窗口注意力,以及定制化的多步蒸馏方法,使 4B 参数模型在单 GPU 上达到 512p@16FPS 的实时流式视频生成。

查看全部490篇「图像生成」论文 →


🎬 视频生成 (182)

Infinity-RoPE: Action-Controllable Infinite Video Generation Emerges From Autoregressive Self-Rollout

提出 ∞-RoPE,一个训练免调的推理时框架,通过 Block-Relativistic RoPE、KV Flush 和 RoPE Cut 三个组件,将仅在5秒视频上训练的自回归视频扩散模型扩展为支持无限时长生成、精细动作控制和电影级场景切换的系统。

Scaling Instruction-Based Video Editing with a High-Quality Synthetic Dataset

本文提出数据合成框架 Ditto,用「图像编辑先验 + 深度视频」驱动一个 in-context 视频生成器、配合蒸馏加速与 VLM 智能体自动控质,耗费 1.2 万 GPU-天造出百万级指令视频编辑数据集 Ditto-1M,并用「模态课程学习」训出能纯靠文本指令编辑视频的模型 Editto,在自动指标和人评上都刷新了指令视频编辑的 SOTA。

Reward Forcing: Efficient Streaming Video Generation with Rewarded Distribution Matching Distillation

Reward Forcing 把双向视频扩散模型蒸馏成几步自回归学生模型,用 EMA-Sink 压缩历史上下文防止"复制初始帧"、用 Re-DMD 把分布匹配梯度按运动质量奖励加权偏向高动态样本,在单张 H100 上以 23.1 FPS 实时生成高质量流式视频,VBench 总分超过所有同规模 baseline。

HoloCine: Holistic Generation of Cinematic Multi-Shot Long Video Narratives

HoloCine 在 Wan2.2 这类 DiT 视频扩散模型上,用「窗口交叉注意力」把每个镜头对齐到自己的分镜文本、用「稀疏镜头间自注意力」把全序列自注意力的二次复杂度降到近线性,从而一次性整体生成一整场分钟级、角色一致、可精确控制转场的多镜头电影化叙事。

DriveLaW: Unifying Planning and Video Generation in a Latent Driving World

提出 DriveLaW,一个通过共享潜在空间将视频生成与运动规划统一的驾驶世界模型,将视频生成器的中间潜在特征直接注入扩散规划器,在 nuScenes 视频预测和 NAVSIM 规划基准上同时达到 SOTA。

UniAVGen: Unified Audio and Video Generation with Asymmetric Cross-Modal Interactions

UniAVGen 提出了一个基于对称双分支 DiT 的音视频联合生成框架,通过非对称跨模态交互机制人脸感知调制模块实现精确的时空同步,仅用 1.3M 训练样本就在唇音同步、音色一致性和情感一致性上全面超越使用 30M 数据的竞品。

MultiShotMaster: A Controllable Multi-Shot Video Generation Framework

MultiShotMaster 在一个约 1B 参数的预训练单镜头 T2V 模型上,只靠改造两种 RoPE(叙事相移 + 时空定位)加一个注意力掩码,就实现了"镜头数/时长可变、每镜头独立文本、主体可指定位置与运动、背景可定制"的多镜头视频生成,且不引入额外 adapter,在文本对齐、跨镜头一致性、转场精度、叙事连贯性上全面超过 CineTrans / EchoShot / VACE / Phantom。

Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm

本文提出"Thinking with Video"(用视频思考)这一新的多模态推理范式,主张让 Sora-2 这类视频生成模型把推理过程画进视频帧里,并构建了覆盖"几何直觉→视觉归纳→抽象规则→空间规划→语言推理"五级能力的 VideoThinkBench 来系统评测——发现 Sora-2 在 eyeballing 几何题上反超 GPT-5 约 10%,在 MATH 上拿到 92% 音频准确率,证明视频生成模型有望成为统一理解与生成的推理载体。

Unified Camera Positional Encoding for Controlled Video Generation

本文提出 UCPE,把相机的完整几何(6-DoF 位姿 + 内参 + 镜头畸变)统一编码进 Transformer 注意力:用「相对射线编码」把位置编码从相机级降到射线级以兼容鱼眼/广角等非线性镜头,再用「绝对朝向编码」补上 pitch/roll 的全局参考,最后用一个 <1% 参数的空间注意力适配器注入预训练视频 DiT,在相机可控文生视频上同时刷新可控性与画质。

LoL: Longer than Longer, Scaling Video Generation to Hour

针对自回归超长视频生成中"画面突然倒退回开头几帧"的 sink-collapse 现象,本文先把它的根因定位到 RoPE 周期性导致的"多维相位同步 + 多头注意力同质化",再用一个免训练的 Multi-Head RoPE Jitter(逐头微扰 RoPE 基频)打散这种同步,配合因果 VAE 滑窗解码,首次实现实时、流式、近乎无质量衰减的无限长视频生成(演示出 12 小时连续视频)。

查看全部182篇「视频生成」论文 →


🧩 多模态 VLM (418)

VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction

VLM-3R 把一个度量尺度的前馈式 3D 重建模型(CUT3R)接到 VLM 上,从纯单目视频里抽出隐式的场景几何 token 和相机运动 token,再用跨注意力融进视觉特征做指令微调,让模型不靠深度传感器、不靠预建点云地图就能做空间和时序推理,在 VSI-Bench、新提出的 VSTI-Bench 上都拿到开源模型第一。

LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning

针对"当前多模态大模型几乎全是自回归范式、扩散路线尚未被验证"的空白,本文把视觉指令微调嫁接到掩码扩散语言模型 LLaDA 上,做出纯扩散的多模态大模型 LLaDA-V——靠双向注意力更好地捕捉视觉空间关系,在 18 个基准上不仅刷新纯扩散 MLLM 的 SOTA,还在相同训练数据下于 11 个任务上超过自回归基线 LLaMA3-V。

Molmo2: Open Weights and Data for Vision-Language Models with Video Understanding and Grounding

Molmo2 是一个完全开放(权重、数据、代码、训练配方全开,且数据不从任何闭源 VLM 蒸馏)的视频-语言模型家族,靠自建的 9 个新数据集 + 三阶段训练,把"在视频里用点和轨迹做 grounding"这一连闭源模型都欠缺的能力补齐,8B 模型在视频计数、指点、跟踪上大幅超越同级开源模型,部分任务甚至压过 Gemini 3 Pro。

Scaling Spatial Intelligence with Multimodal Foundation Models

SenseNova-SI 通过系统化构建800万级多样化空间数据(SenseNova-SI-8M),在 Qwen3-VL、InternVL3 和 Bagel 等多模态基础模型上培养空间智能能力,在 VSI-Bench、MMSI 等多个空间基准上取得前所未有的性能,同时保持通用多模态理解能力。

Multi-SpatialMLLM: Multi-Frame Spatial Understanding with Multi-Modal Large Language Models

针对 MLLM 只会单图空间推理、连左右都分不清的问题,本文用已标注的 3D/4D 场景数据集自动生成 2700 万条多帧空间问答(MultiSPA),把深度、视觉对应、动态感知三大基础能力灌进 InternVL2,训出的 Multi-SpatialMLLM 在自建 benchmark 上平均比基座涨 36%,甚至追平闭源大模型和专用 3D 模型。

OneCAT: Decoder-Only Auto-Regressive Model for Unified Understanding and Generation

OneCAT 把"理解 + 生成 + 编辑"塞进同一个 decoder-only Transformer,靠一个按模态硬路由的 MoE(文本/理解/生成三类专家)实现 encoder-free 推理,并首次把多尺度自回归生成搬进 LLM(配 Scale-Aware Adapter),在统一模型里同时拿到 SOTA 性能和约 10× 于扩散模型的生成速度。

TimeLens: Rethinking Video Temporal Grounding with Multimodal LLMs

系统调查构建MLLM视频时间定位(VTG)能力的关键因素,从数据质量和算法设计两个维度出发,发布高质量基准TimeLens-Bench和训练集TimeLens-100K,并通过交错文本时间编码+thinking-free RLVR训练范式构建TimeLens系列模型,在开源模型中达到SOTA并超越GPT-5和Gemini-2.5-Flash。

ArtiMuse: Fine-Grained Image Aesthetics Assessment with Joint Scoring and Expert-Level Understanding

ArtiMuse 用一个 InternVL-3-8B 基座的多模态大模型,同时输出 8 维细粒度专家级美学文字分析和一个连续美学分数,靠新提出的 Token As Score 把连续打分塞进 LLM 的离散 token 生成里,并配套发布了首个 10000 张专家逐维标注的 ArtiMuse-10K 数据集,在多个美学评分基准上刷新 SOTA。

TUNA: Taming Unified Visual Representations for Native Unified Multimodal Models

TUNA 把一个 VAE 编码器和一个语义表示编码器级联起来,得到一套同时适配「理解」和「生成」的连续统一视觉表示,再配上自回归文本头 + 流匹配生成头,让 1.5B/7B 规模的单一原生模型在图像/视频理解、图像/视频生成、图像编辑上全面拿到 SOTA(MMStar 61.2、GenEval 0.90)。

AToken: A Unified Tokenizer for Vision

AToken 把图像、视频、3D 资产统一编码进一个共享的稀疏 4D latent 空间,用一套纯 Transformer + 无对抗 Gram 损失同时做到高保真重建和语义理解,单模型在三种模态上都拿到接近专用方法的成绩(图像 0.21 rFID / 82.2% ImageNet,视频 3.01 rFVD,3D 28.3 PSNR / 90.9%)。

查看全部418篇「多模态 VLM」论文 →


🧠 VLM Reasoning (150)

Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens

本文提出 Mirage 框架,让 VLM 在解码时把自己的隐藏状态当作「隐式视觉 token」直接续写进文本序列,从而在不生成任何真实像素图像的前提下进行图文交错的多模态推理;配合「先视觉锚定、再文本放松」的两阶段微调加 RL,在空间规划、拼图、空间关系等多个基准上稳定超越纯文本解码与显式生图的基线。

Thinking With Videos: Multimodal Tool-Augmented Reinforcement Learning for Long Video Reasoning

VITAL 给多模态大模型(MLLM)配一个「视频裁剪」工具,让它在推理链中按需把可疑时间段稠密重采样成新帧、形成「多模态思维链」,再用难度感知的 DGRPO 强化学习把多任务训练稳住,从而在长视频问答和时序定位上做到 7B 级别的 SOTA。

LongVT: Incentivizing "Thinking with Long Videos" via Native Tool Calling

LongVT 让多模态大模型像人一样"先全局速览、再放大可疑片段"地看长视频——把模型自带的时序定位能力封装成一个原生的 crop_video 工具,在推理链中交错调用、反复"再看一眼"以纠错,并配套自建的 VideoSIAH 数据套件与三阶段训练,在四个长视频基准上刷新开源 SOTA。

Think with 3D: Geometric Imagination Grounded Spatial Reasoning from Limited Views

3DThinker 让 VLM 在推理链里直接吐出一段「3D 隐 token」、并把它对齐到 3D 基础模型 VGGT 的几何特征,从而在不输入任何 3D 先验、不依赖稠密标注的前提下,仅凭有限的几张 2D 视图就能「在脑子里想象 3D 场景」做空间推理;在 8 个空间理解 benchmark 上稳定超越强基线,最大模型甚至压过 o3。

Grounded Chain-of-Thought for Multimodal Large Language Models

提出"接地链式思考(GCoT)"新任务和 MM-GCoT 基准:让多模态大模型在回答前逐步说出推理并给出每一步的坐标依据,再用"答案-接地一致性"指标量化视觉幻觉,结果发现 12 个先进 MLLM 普遍"答对但看错",且幻觉与模型规模无关。

OneThinker: All-in-one Reasoning Model for Image and Video

用一个 8B 模型同时把图像和视频上的 10 类基础视觉任务(问答、描述、时空 grounding、跟踪、分割)统一成「先 think 再结构化输出」的推理范式,靠新提出的 EMA-GRPO 解决多任务 RL 里不同任务奖励量纲/密度差异巨大导致的优化失衡,在 31 个 benchmark 上全面超越同规模专用模型。

Chain-of-Frames: Advancing Video Understanding in Multimodal LLMs via Frame-Aware Reasoning

本文提出 Chain-of-Frames(CoF),让视频 LLM 在单阶段推理里直接用「Frame-k」这样的帧编号去引用关键帧、把时序定位写进 CoT 文本本身,再用一条低成本数据管线造出 16.4 万条带帧引用的训练样本微调 InternVL,在 5 个视频理解 benchmark 上平均涨 3.8%~5.1%,且发现纯合成数据就能带来显著提升。

G\(^2\)VLM: Geometry Grounded Vision Language Model with Unified 3D Reconstruction and Spatial Reasoning

G2VLM 用一个「混合 Transformer 专家(MoT)」架构,把前馈式 3D 重建专家和语义理解专家塞进同一个 VLM 里、靠共享自注意力互相增益,让一个 2B 的模型既能像 VGGT 那样直接预测深度/点云/相机位姿,又能在空间推理任务上反超 GPT-4o(SPAR-Bench 上高 18.5 分)。

CodeV: Code with Images for Faithful Visual Reasoning via Tool-Aware Policy Optimization

这篇论文发现"会用图思考"的视觉智能体常常答对但工具用得不忠实(裁错区域却蒙对答案),提出 CodeV——把视觉工具表示成可执行 Python 代码、并用 Tool-Aware Policy Optimization (TAPO) 在 GRPO 上加一个只看工具输出、不看思维链的过程级稠密奖励,结果在 10 个基准上保持甚至超越准确率的同时,把忠实工具调用率提升到基线的 1.3–2 倍。

AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs

针对多模态大模型"数不清楚"的老毛病,本文一手做了 CG-AV-Counting——首个面向长视频、跨音视频模态、带细粒度"计数线索"标注的可解释计数基准;一手提出 AV-Reasoner,用 GRPO + 课程学习从定位/问答等相关任务里迁移出计数能力,在多个音视频推理基准上刷到 SOTA,但也诚实地指出语言空间里的显式推理在域外几乎没帮助。

查看全部150篇「VLM Reasoning」论文 →


⚡ VLM Efficiency (63)

Accelerating Streaming Video Large Language Models via Hierarchical Token Compression

针对流式视频大模型(streaming VideoLLM)实时部署慢的问题,提出即插即用的两级 token 压缩框架 STC:STC-Cacher 在 ViT 编码阶段缓存并复用相邻帧的静态特征、只重算动态 token,STC-Pruner 在进 LLM 之前用「时空双锚点」剪掉冗余 token,在 ReKV 上保留约 99% 精度的同时把 ViT 编码延迟降 24.5%、LLM 预填充延迟降 45.3%。

OmniZip: Audio-Guided Dynamic Token Compression for Fast Omnimodal Large Language Models

OmniZip 是首个面向全模态大模型(OmniLLM)音视频联合理解的免训练 token 压缩框架:它用音频 token 的注意力分布作为「信息密度 / 事件边界」先验,在每个时间窗内动态地决定视频 token 的剪枝率,再用交错时空压缩模块(ISTC)压缩视频 token,在 Qwen2.5-Omni 上实现 3.42× prefill 加速、1.4× 显存下降,且几乎不掉点。

Variation-Aware Vision Token Dropping for Faster Large Vision-Language Models

提出 V2Drop,首次从 token 变化量(variation)视角出发,通过渐进式丢弃 LLM 内部变化量最小的"懒惰"视觉 token,实现无训练、无位置偏差、兼容高效算子的 LVLM 推理加速,在图像和视频理解任务中分别保留 94.0% 和 98.6% 原始性能,同时降低 LLM 生成延迟 31.5% 和 74.2%。

Hybrid Token Compression for Vision-Language Models

针对"把视觉 token 压到 1 个时,连续压缩丢语义、离散量化丢细节"的两难,HTC-VLM 用连续通道(ViT patch 保细节)+ 离散通道(MGVQ 量化出 4 个语义锚点)双路解耦,再经解耦注意力掩码与 <voco> 瓶颈把 580 个 token 压成 1 个,在 7 个基准上把性能保持率从 81.0% 提到 87.2%。

Prune2Drive: A Plug-and-Play Framework for Accelerating Vision-Language Models in Autonomous Driving

首个面向多视角自动驾驶 VLM 的即插即用 token 剪枝框架,通过 T-FPS(token 级最远点采样)保持语义与空间多样性,配合视图自适应剪枝率优化自动分配各摄像头 token 预算,在 DriveLM 上仅保留 10% token 即实现 6.40× prefill 加速且性能仅降 3%。

AdaptVision: Efficient Vision-Language Models via Adaptive Visual Acquisition

提出 AdaptVision,通过由粗到精的主动视觉机制和强化学习训练,让 VLM 自主决定每个样本所需的最少视觉 token 数量,配合解耦式多轮策略优化 (DTPO) 实现效率与精度的最优平衡。

LiteVGGT: Boosting Vanilla VGGT via Geometry-aware Cached Token Merging

针对 3D 基础模型 VGGT 在长序列上全局注意力的二次复杂度瓶颈,LiteVGGT 提出"几何感知 + 跨层缓存"的 token 合并策略——按几何重要性挑出关键 token 不动、把冗余 token 合并到锚点、并跨层复用合并索引,配合微调与 FP8 量化,在 1000 张图输入下相比 VGGT 提速约 10× 且几乎不掉点。

MoDES: Accelerating Mixture-of-Experts Multimodal Large Language Models via Dynamic Expert Skipping

提出 MoDES,首个面向 MoE 多模态大模型的训练免调专家跳过框架,通过全局调制的局部门控(GMLG)和双模态阈值(DMT)机制自适应跳过冗余专家,在跳过 88% 专家时仍保留 97%+ 原始性能,并实现 2.16× prefill 加速。

Better, Stronger, Faster: Tackling the Trilemma in MLLM-based Segmentation with Simultaneous Textual Mask Prediction

STAMP 把 MLLM 分割重述为对所有图像 patch 的并行"填空"分类任务,用一次非自回归前向同时预测整张掩码,从而在不损害对话能力的前提下同时拿到高分割精度和快推理速度,破解了 MLLM 分割长期存在的"对话/性能/速度"三难。

VQRAE: Representation Quantization Autoencoders for Multimodal Understanding, Generation and Reconstruction

VQRAE 把 RAE(用预训练视觉基座当编码器的表示自编码器)做成向量量化版,一个 tokenizer 同时吐出连续语义特征供理解、离散 token 供生成与重建,并首次证明:量化语义特征时码本要用高维度(1536)才能 100% 利用、不塌缩,彻底摆脱了双编码器和 CNN 像素编码器。

查看全部63篇「VLM Efficiency」论文 →


🎵 音频/语音 (22)

Pushing the Frontier of Audiovisual Perception with Large-Scale Multimodal Correspondence Learning

PEAV(Perception Encoder Audiovisual)是 Meta 提出的「音-视-文」统一对比编码器家族:靠一个两阶段合成字幕数据引擎为 O(100M) 音视频对造出高质量的音频/视觉/音视频三类字幕,再用最多十组跨模态对比损失把音频、视频、文本对齐到同一空间,在声音、音乐、语音、视频四类零样本基准上全面刷新 SOTA(如 AudioCaps T→A 从 35.4 提到 45.8 R@1,VGGSound 分类 36.0→47.1),还首次让「语音→转写文本」检索从近 0 做到 85.6。

Tri-Subspaces Disentanglement for Multimodal Sentiment Analysis

提出 TSD 框架,将多模态特征显式分解为全局共享/成对共享/模态专属三个互补子空间,并通过子空间感知跨注意力融合模块自适应整合三层信息,在 CMU-MOSI/MOSEI 上全面 SOTA。

UniM: A Unified Any-to-Any Interleaved Multimodal Benchmark

提出首个统一的任意到任意交错多模态基准 UniM(31K 样本、7 种模态、30 个领域),配套三维评估体系和基于可追溯推理的智能体基线 UniMA,揭示现有 MLLM 在交错多模态范式下的严重不足。

AMUSE: Audio-Visual Benchmark and Alignment Framework for Agentic Multi-Speaker Understanding

本文提出 AMUSE——一个面向「多说话人、对话密集」场景的音视频 Benchmark(6 个 agentic 任务 × 零样本/引导/agentic 三种评测模式),揭示了 GPT-4o、Qwen3-Omni 等主流 MLLM 在「谁在说、何时说、跨场景因果」上的系统性短板;并配套提出 RAFT 对齐框架(反思式奖励 + 选择性参数适配),用极少标注就把开源模型在该 Benchmark 上的准确率最高提升 39.52%(相对)。

AudioStory: Generating Long-Form Narrative Audio with Large Language Models

AudioStory 把 LLM 的叙事推理和 DiT 扩散音频生成器拼成一个端到端框架,先让 LLM 把复杂指令拆成带时间戳的子事件、再逐段生成短音频拼成长篇叙事音频,靠"语义 token + 残差 token"两路解耦桥接保证段内对齐与跨段连贯,能稳定生成最长 150 秒的多场景音频故事。

BabyVLM-V2: Toward Developmentally Grounded Pretraining and Benchmarking of Vision Foundation Models

提出BabyVLM-V2框架,从婴儿第一视角的SAYCam纵向语料构建三种格式预训练数据(768K图像对+181K视频对+63K交错序列),设计基于NIH Baby Toolbox®的DevCV Toolbox(10个发育认知任务),从零训练的紧凑模型在部分数学任务上超越GPT-4o,首次系统探索人工发育智能(ADI)。

EchoFoley: Event-Centric Hierarchical Control for Video Grounded Creative Sound Generation

针对现有视频配音模型「视觉主导、听不懂文本指令、做不了细粒度编辑」的问题,本文提出 EchoFoley 任务(用符号化「发声事件」表示 + 三层控制粒度),配套 6k 规模密标注 benchmark,并设计了 training-free 的 agentic 框架 EchoVidia(slow-fast thinking + 动作池),在可控性上比最强 baseline 提升约 40.7%、感知质量提升 12.5%。

Hierarchical Codec Diffusion for Video-to-Speech Generation

HiCoDiT 把"哑视频→语音"这件事重新拆成沿 RVQ 离散 token 层级逐层生成的掩码扩散任务——低层 token 负责内容与音色、由唇动和身份引导,高层 token 负责韵律、由表情通过双尺度 AdaLN 调制,从而在 LRS2/LRS3 上跨数据集零训练就拿下自然度、可懂度和唇同步的领先成绩。

Omni-MMSI: Toward Identity-Attributed Social Interaction Understanding

提出 Omni-MMSI 任务——从原始音视频输入(而非预处理的 oracle 社交线索)理解多人社交交互,并设计 Omni-MMSI-R 参考引导流水线,通过工具生成身份归因社交线索 + 链式思维推理实现准确的社交交互理解。

Cleaning the Pool: Progressive Filtering of Unlabeled Pools in Deep Active Learning

提出 Refine 集成主动学习方法,通过两阶段策略——渐进过滤(多策略迭代精炼无标签池)+ 覆盖选择(从精炼池中选择多样性高价值样本)——在不预知最佳策略的情况下一致超越单一 AL 策略和现有集成方法。

查看全部22篇「音频/语音」论文 →


🔎 AIGC 检测 (10)

Common Inpainted Objects In-N-Out of Context

作者用扩散修复(Stable Diffusion inpainting)系统性地替换 COCO 图像里的物体,造出 9.7 万张「同一物体在情境内 / 情境外」的图,再用 72B 多模态大模型三模型共识标注「位置 / 尺寸 / 共现」三维上下文标签,构建出首个带上下文标注的修复假图数据集 COinCO,并演示了细粒度上下文分类、由情境反推物体、以及无需微调就能增强 SOTA 假图定位三个下游任务。

Fine-grained Image Aesthetic Assessment: Learning Discriminative Scores from Relative Ranks

定义"细粒度图像美学评估"新任务,构建含32,217张图像/10,028个系列的FGAesthetics基准,提出FGAesQ模型:通过差异保留Tokenization(DiffToken)+ 对比文本辅助对齐(CTAlign)+ 排序感知回归(RankReg)从相对排序中学习判别性审美评分,在细粒度场景准确率0.779的同时保持粗粒度SRCC 0.770。

Locate-Then-Examine: Grounded Region Reasoning Improves Detection of AI-Generated Images

LTE 让视觉语言模型先"全局扫描定位可疑区域"再"放大裁剪复核给出最终判定",把一次性分类升级为两阶段的区域接地(region-grounded)推理,并配套构建带框级标注与取证解释的 TRACE 数据集,在准确率、鲁棒性和可解释性上同时获得提升。

Investigating Self-Supervised Representations for Audio-Visual Deepfake Detection

这是一篇系统性"调查"论文:作者把 12 个现成的自监督编码器(音频、视觉、音视频)冻结,只在上面训一层线性探针,从「检测有效性、可解释性、跨模态互补性」三个维度横向评测它们做音视频深度伪造检测的能力,发现"音频信息驱动"的表征泛化最好(BRAVEn 的视觉编码器拿到 SOTA),而真实世界数据的难点来自数据集本身的内在难度而非特征抓了浅层捷径。

Learning Where to Look and How to Judge: Resolution-agnostic Image Quality Assessment with Quality-aware Saliency

针对无参考图像质量评价(NR-IQA)"为迁就预训练分辨率而暴力 resize、跨分辨率不泛化、多数据集 MOS 尺度不一难联训、超高清算力爆炸"四大通病,本文提出 ReLIQS:在原分辨率及缩放变体上采样固定尺寸 patch 并用 CLIP 编码,用轻量"感知重要性估计器(PIE)"学出 IQA 专属显著性来挑出少量关键 patch,再用"潜在质量轴模块(LQAM)"把多尺度嵌入聚合成单一分数,在真实/合成/AIGC 多种失真与分辨率上以更低算力超过 CNN、CLIP、MLLM 系强基线。

NOWA: Null-space Optical Watermark for Invisible Capture Fingerprinting and Tamper Localization

在相机光圈处插入一块可学习的相位掩膜,把认证信号编码进成像算子的零空间(拍摄时完全不可见),再用一个保证测量一致性的零空间网络(NSN)重建高质量图像并锚定该水印;篡改会破坏零空间投影里的统计结构,从而在像素级被检测器定位,在 AIGC 编辑下 F1 超过 EditGuard(0.993 vs 0.97)且对未知伪造者天然不可伪造。

Enabling Supervised Learning of Generative Signatures for Generalized AI-Generated Images Detection

针对"AI生成图像里的生成痕迹没有干净配对、无法监督式提取"这个死结,本文用一个随机变结构的图像重建器在真实图上人工"造痕迹"、把重建残差当伪标签去训练一个生成签名(GenSign)提取器,再用 GenSign + RGB 双流分类器做检测,在四个 benchmark 上把跨模型泛化刷到 SOTA。

Inconsistency-aware Multimodal Schrodinger Bridge for Deepfake Localization

IaMSB 把音视频深度伪造的「时间区间定位」重新表述成一个薛定谔桥(Schrödinger Bridge)生成问题——用桥的传输代价直接读出跨模态一致性分数,再据此把计算步数非对称地分配给更可疑的那个模态,从而在严格 IoU([email protected])上比现有方法高 3~10%。

Learning Forgery-Aware Lip Representations Without Forgery Priors

针对说话人认证系统被个性化"说话人脸生成"(TFG)伪造攻破的问题,本文提出一个只用真实视频训练、完全不依赖任何伪造样本的检测器:靠真帧混合伪造 + 非对称对比 + 高斯正则把真实唇动特征压成一个紧致球面,把球外一切(伪造和冒名者)当离群点,在 8 种现代伪造、10 个 SOTA 对比下把错误率压低 10% 以上。

PPM-CLIP: Probabilistic Prompt Modeling for Generalizable AI-Generated Image Detection

PPM-CLIP 把"判别一条静态决策边界"的 AIGC 检测范式换成"生成式概率推理"——用归一化流为每张图生成一族自适应 prompt(多个假设),再对全部假设的余弦相似度取平均消噪做判定,并配一个频域引导的 patch 对比学习让 CLIP 编码器盯住高频伪造痕迹,在 Ojha / GenImage / DRCT 上的跨生成器泛化显著超过 SOTA。


🧊 3D 视觉 (751)

SAM 3D: 3Dfy Anything in Images

SAM 3D 是一个从单张自然图像出发、为图中任意物体重建完整 3D 形状/纹理/布局的生成式基础模型,靠"模型在环 + 人类标注"的数据飞轮和 LLM 式多阶段训练突破了真实世界 3D 数据稀缺的壁垒,在真实物体与场景上对此前 SOTA 拿到至少 5:1 的人类偏好胜率。

Native and Compact Structured Latents for 3D Generation

本文是 TRELLIS 原班团队的续作 TRELLIS.2,提出一种从原生 3D 数据直接学习的结构化隐空间表示。其核心是无场(field-free)的全能体素 O-Voxel,用柔性对偶栅格统一编码任意拓扑的几何与 PBR 材质;再配一个稀疏压缩 VAE(SC-VAE)做到 16× 空间下采样,把 1024³ 全纹理资产压成约 9.6K token。最后训练约 4B 参数的三阶段 Flow-matching 模型做图生 3D,在重建保真度、材质质量和生成速度上都大幅超越现有方法。

PointWorld: Scaling 3D World Models for In-The-Wild Robotic Manipulation

PointWorld 把场景状态和机器人动作统一表示为同一套 3D 点流(3D point flow),用一个大型预训练点云骨干在约 200 万条轨迹上学习"给定动作后全场景点会怎么动",从而让一个 checkpoint 在零样本、单张 RGB-D 输入下驱动真实机械臂完成刚体推、形变物体、铰接物体和工具使用等任务。

SpatialVID: A Large-Scale Video Dataset with Spatial Annotations

SpatialVID 从 2.1 万小时野外网络视频里,用「分层过滤 + 几何/语义标注 + 平衡采样」三段式 pipeline 蒸馏出 271 万段、共 7089 小时的动态片段,每段都带逐帧相机位姿、深度、动态掩码、结构化字幕和序列化运动指令,是目前规模最大、标注最全的"动态场景 + 显式几何"视频数据集。

FastGS: Training 3D Gaussian Splatting in 100 Seconds

提出 FastGS,一个基于多视角一致性的 3DGS 加速框架,通过多视角一致性密集化(VCD)和多视角一致性剪枝(VCP)策略精准控制 Gaussian 数量,在 Mip-NeRF 360 等数据集上实现约 100 秒完成场景训练,相比 vanilla 3DGS 加速 15× 以上,且渲染质量可比。

LATTICE: Democratize High-Fidelity 3D Generation at Scale

LATTICE 提出一种半结构化的 3D latent 表示 VoxSet——把 VecSet 那套紧凑的 latent token 锚定到粗体素网格上,从而能给扩散 transformer 注入位置信息;配合"先生成粗结构、再细化几何"的两阶段 pipeline,用纯 transformer 架构把 image-to-3D 模型规模化到 4.5B,同时实现了 3D 生成里少见的 token-level test-time scaling,在重建/生成质量上超过此前 SOTA。

Efficiently Reconstructing Dynamic Scenes One D4RT at a Time

D4RT 用一个统一的 encoder-decoder Transformer,把视频先编码成一份固定的全局场景表征,再用「独立查询任意时空点的 3D 位置」这一个解码接口同时拿到深度、点云、3D 点轨迹和相机内外参,在动态 4D 重建与跟踪上全面刷新 SOTA,且速度比 VGGT 快约 9×、比 MegaSaM 快约两个数量级。

SAGE: Scalable Agentic 3D Scene Generation for Embodied AI

SAGE 把 3D 室内场景生成做成一个在 MCP 协议下运行的智能体:它按需调用布局/资产生成器,再用"视觉评审 + 物理评审(Isaac Sim 在环验证)"形成闭环自我修正,产出可直接放进仿真器训练机器人策略的、物理稳定的开放词表场景,并通过多层增强批量扩展数据。

MoVieS: Motion-Aware 4D Dynamic View Synthesis in One Second

提出 MoVieS,一个前馈式 4D 动态场景重建框架,通过 动态溅射像素 (Dynamic Splatter Pixel) 表示将外观、几何和运动统一建模,从单目视频在约 1 秒内完成 4D 重建,并支持新视角合成、3D 点跟踪、场景流估计和运动物体分割等多种任务。

NeoVerse: Enhancing 4D World Model with in-the-wild Monocular Videos

NeoVerse 提出了一个可扩展的 4D 世界模型,通过前馈式无位姿 4DGS 重建和在线单目退化模拟,使整个训练流程可以利用海量野外单目视频(百万级),在 4D 重建和新轨迹视频生成上均达到 SOTA。

查看全部751篇「3D 视觉」论文 →


🎯 目标检测 (99)

Detect Anything via Next Point Prediction

把目标检测重新表述成"用 MLLM 生成量化坐标 token 序列",靠三件套——可学习坐标 token + 自建数据引擎造 2200 万标注 + SFT 后接 GRPO 强化训练修行为——做出一个 3B 模型 Rex-Omni,在 COCO 等基准上零样本超过 DINO / Grounding DINO 这类回归式检测器,同时还能做指代、指点、GUI 定位、OCR 等八类任务。

PALM: Progress-Aware Policy Learning via Affordance Reasoning for Long-Horizon Robotic Manipulation

提出 PALM,一个统一的 VLA 框架,通过结构化的细粒度可供性预测(全局/局部/空间/动态四类)作为隐式推理锚点,结合连续子任务进度估计实现无缝任务切换,在 CALVIN ABCD 上平均完成长度达 4.48(超越前 SOTA 12.5%),LIBERO-LONG 成功率 91.8%,真实世界长时域泛化测试中达到基线 2 倍以上。

YOLO-Master: MOE-Accelerated with Specialized Transformers for Enhanced Real-time Detection

YOLO-Master 把稀疏 MoE(ES-MoE 块)塞进 YOLO 的 backbone,让网络按图像复杂度动态激活不同专家,在 MS COCO 上以 1.62ms 延迟拿到 42.4% AP,比 YOLOv13-N 高 0.8% mAP 且快 18%。

VisualAD: Language-Free Zero-Shot Anomaly Detection via Vision Transformer

重新审视零样本异常检测(ZSAD)中文本分支的必要性,提出 VisualAD——一个纯视觉框架:在冻结 ViT 中插入两个可学习 token(anomaly/normal),配合 Spatial-Aware Cross-Attention 和 Self-Alignment Function,去掉文本编码器仍在 13 个工业+医学基准上取得 SOTA。

Fourier Angle Alignment for Oriented Object Detection in Remote Sensing

利用傅里叶旋转等变性在频域估计目标主方向并对齐特征,提出 FAAFusion 和 FAA Head 两个即插即用模块分别解决 FPN 跨尺度方向不一致和检测头分类-回归任务冲突,在 DOTA-v1.0/v1.5 和 HRSC2016 上取得新 SOTA。

Seeing Through the Noise: Improving Infrared Small Target Detection and Segmentation from Noise Suppression Perspective

针对红外小目标检测中"增强高频特征会同步抬高虚警率"的痛点,本文从频域视角提出噪声抑制型特征金字塔 NS-FPN,用低频引导的特征净化模块(LFP)和螺旋感知的特征采样模块(SFS)替换 FPN 里的 1×1 卷积与上采样,在几乎不增加计算量的前提下大幅压低虚警并提升定位精度。

RC-NF: Robot-Conditioned Normalizing Flow for Real-Time Anomaly Detection in Robotic Manipulation

提出 Robot-Conditioned Normalizing Flow (RC-NF),通过条件归一化流对机器人状态与物体运动轨迹的联合分布建模,实现 <100ms 实时异常检测,可作为 VLA 模型(如 π₀)的即插即用监控模块,支持任务级重规划和状态级轨迹回滚。

SubspaceAD: Training-Free Few-Shot Anomaly Detection via Subspace Modeling

SubspaceAD 证明了在强视觉基础模型(DINOv2-G)特征上做一次 PCA 拟合就足以超越所有需要训练/记忆库/提示调优的少样本异常检测方法,1-shot 下在 MVTec-AD 上达 98.0% 图像级 AUROC 和 97.6% 像素级 AUROC。

WeDetect: Fast Open-Vocabulary Object Detection as Retrieval

把开放词表检测彻底当成「区域 × 文本」的检索匹配问题来做:用无跨模态融合的双塔结构 WeDetect 拿到实时 SOTA 检测,再冻结它派生出通用提议生成器 WeDetect-Uni(顺带支持局部物体检索这一新任务),最后用一个把 REC 改造成「LLM 当分类器、一次前向并行打分」的 WeDetect-Ref,在 15 个 benchmark 上同时刷到高精度和高吞吐。

GS-CLIP: Zero-shot 3D Anomaly Detection by Geometry-Aware Prompt and Synergistic View Representation Learning

提出GS-CLIP两阶段框架,通过几何缺陷蒸馏模块将3D点云的全局形状和局部缺陷信息注入文本提示,并用LoRA双流架构协同融合渲染图和深度图,在四个大规模数据集上实现零样本3D异常检测SOTA。

查看全部99篇「目标检测」论文 →


✂️ 语义分割 (122)

Exploring the Underwater World Segmentation without Extra Training

针对水下场景缺数据、缺模型的困境,本文一方面造了首个细粒度水下开放词汇分割数据集与基准(AquaOV255 / UOVSBench),另一方面提出 training-free 框架 Earth2Ocean——用几何自相似先验修正 CLIP 视觉特征、再用 MLLM 推理增强文本嵌入,无需任何水下训练就把陆地 VLM 迁到水下,平均 mIoU 提升 6+。

INSID3: Training-Free In-Context Segmentation with DINOv3

提出INSID3,一种仅依赖冻结DINOv3特征的无训练上下文分割方法,通过位置偏差消除、细粒度聚类和种子聚类聚合三阶段pipeline,在语义/部件/个性化分割任务上以单一自监督骨干网络超越了依赖SAM或微调的方法,平均mIoU提升+7.5%。

MixerCSeg: An Efficient Mixer Architecture for Crack Segmentation via Decoupled Mamba Attention

提出 MixerCSeg,通过解析 Mamba 的隐式注意力机制将通道解耦为全局/局部分支,分别用 Self-Attention 和 CNN 增强,配合方向引导边缘门控卷积,以 2.05 GFLOPs / 2.54M 参数实现裂缝分割 SOTA。

F2Net: A Frequency-Fused Network for Ultra-High Resolution Remote Sensing Segmentation

F2Net 把超高分辨率(UHR)遥感图像在频域上拆成高频和低频分量分路处理——高频分支保全分辨率抠边界细节、低频分支降采样后再分短程/长程两个子分支抠语义,用一个混合频率融合模块(HFF)整合三路特征,并配两个跨频损失稳住多分支训练,在 DeepGlobe / Inria Aerial 上分别拿到 80.22 / 83.39 mIoU 的 SOTA。

Pointer-CAD: Unifying B-Rep and Command Sequences via Pointer-based Edges & Faces Selection

提出基于指针 (Pointer) 机制的命令序列表示,将 B-Rep 几何实体(边/面)显式引入自回归 CAD 生成,首次在命令序列方法中支持 chamfer/fillet 操作,同时大幅降低量化误差导致的拓扑错误。

SAMTok: Representing Any Mask with Two Words

SAMTok 把任意区域 mask 压成两个离散文本 token,让普通 MLLM(如 QwenVL)只靠 next-token prediction 就能像处理文字一样理解和生成 mask,无需任何分割解码头或定制损失,并因为 mask 变成了"文字"而首次可以用纯字符匹配的奖励做强化学习。

SARMAE: Masked Autoencoder for SAR Representation Learning

提出 SARMAE 框架,通过百万级 SAR 数据集 SAR-1M、散斑感知表征增强 (SARE) 和光学语义锚约束 (SARC),实现噪声鲁棒的 SAR 自监督预训练,在分类、检测和分割多个下游任务上取得 SOTA。

MatAnyone 2: Scaling Video Matting via a Learned Quality Evaluator

提出学习型 Matting Quality Evaluator (MQE),在无 ground-truth 条件下逐像素评估 alpha 质量,既作为在线训练引导又作为离线数据筛选器,构建了 28K 片段 / 240 万帧的真实世界视频抠图数据集 VMReal,配合参考帧训练策略,显著超越所有现有方法。

PRUE: A Practical Recipe for Field Boundary Segmentation at Scale

本文对18个分割和地理空间基础模型(GFM)进行了系统性评估,提出PRUE——一种结合U-Net骨干、复合损失函数和针对性数据增强的农田边界分割方案,在FTW基准上达到76% IoU和47% object-F1,分别比baseline提升6%和9%,同时提出了一套评估部署鲁棒性的新指标。

VidEoMT: Your ViT is Secretly Also a Video Segmentation Model

提出 VidEoMT,一种纯编码器(encoder-only)视频分割架构,通过 query propagation 和 query fusion 将分割与时序关联统一在单个 ViT 编码器中,在保持与 SOTA 可比精度的同时实现 5×–10× 加速(ViT-L 达 160 FPS)。

查看全部122篇「语义分割」论文 →


🖼️ 图像恢复 (135)

DiffDecompose: Layer-Wise Decomposition of Alpha-Composited Images via Diffusion Transformers

针对玻璃、雾气、水印、X 光等半透明/透明遮挡场景,这篇论文把"从单张合成图里拆出前景层和背景层"重新定义成一个生成式后验推断问题,配套发布了首个大规模 AlphaBlend 数据集,并用扩散 Transformer 框架 DiffDecompose(核心是"上下文分解 ICD"+"图层位置编码克隆 LPEC")实现无需掩码的多层分解,在多个去除/分解子任务上 RMSE 平均比次优方法低约 36%。

Hybrid Agents for Image Restoration

针对真实图像恢复中「外行不会选工具」和「逐个去退化会误差传播」两个痛点,提出 HybridAgent——用「快/慢/反馈」三个智能体协同调度,配合一套三阶段训练得到的单退化 + 混合退化恢复工具,让简单指令走轻量快路、复杂退化走 MLLM 慢路并闭环反馈,从而又快又稳地完成自动图像恢复。

FoundIR-v2: Optimizing Pre-Training Data Mixtures for Image Restoration Foundation Model

FoundIR-v2 发现「不同恢复任务的训练数据混合比例」本身就是决定 all-in-one 图像恢复性能的关键变量,于是用一套「数据均衡调度(动态调比例)+ MoE 驱动的扩散调度器(动态分配任务自适应生成先验)」的双调度方案在 SDXL 上做生成式预训练,单模型覆盖 50+ 子任务并在多基准上超过现有 SOTA。

One-Step Diffusion Transformer for Controllable Real-World Image Super-Resolution

基于 Qwen-Image 的一步式扩散 Transformer(ODTSR),用「噪声混合视觉流」让保真度和提示可控性可以同时拿到、并由一个保真度权重 \(f\) 连续调节,再配合「保真度感知对抗训练」把多步去噪压成单步推理,在通用真实超分和中英文文字图超分上都达到 SOTA。

PnP-CM: Consistency Models as Plug-and-Play Priors for Inverse Problems

把一致性模型(consistency model, CM)重新解释成"先验的近端算子",塞进 ADMM 形式的即插即用(PnP)框架,再用噪声注入和动量两招把迭代压到 2–4 个神经网络评估(NFE),就能统一求解线性/非线性逆问题,并首次把 CM 训练应用到 MRI 重建。

Multinex: Lightweight Low-light Image Enhancement via Multi-prior Retinex

Multinex 把 Retinex 分解从「重建目标」改写成「加性残差先验」,再用一组解析计算出的多视角亮度/色度先验喂给两个超轻量融合网络,只用 45K(甚至 0.7K)参数就在 7 个低光基准上把同量级轻量 SOTA 全面压过、逼近百万级大模型。

Enhancing Unregistered Hyperspectral Image Super-Resolution via Unmixing-based Abundance Fusion Learning

针对"低分辨率高光谱图 + 一张未配准高分辨率参考图"的超分任务,本文用光谱解混把空间和光谱信息解耦,让网络只去增强解混出的丰度图(而非直接做易受错位干扰的空谱耦合融合),再配合由粗到细的可变形聚合、空间-通道丰度交叉注意力和调制融合模块,在 ICVL/REAL 数据集上以约一半参数量刷出 SOTA(×4 上 PSNR 41.84/42.05 dB)。

Scan Clusters, Not Pixels: A Cluster-Centric Paradigm for Efficient Ultra-high-definition Image Restoration

针对超高清(4K)图像恢复中 Mamba 仍要逐像素扫描、显存爆炸的瓶颈,C2SSM 把"逐像素扫描"改成"逐聚类中心扫描"——先用一个神经参数化的混合分布把上百万像素蒸馏成几个语义质心,只对质心跑 Mamba,再把全局上下文按相似度分布扩散回所有像素,从而在五项 UHD 恢复任务上同时拿下 SOTA 和最低 FLOPs(0.407G)。

Time-Aware One Step Diffusion Network for Real-World Image Super-Resolution

TADSR 指出现有单步扩散超分都把 student 的 timestep 写死在 999,白白浪费了 SD 在不同时间步上各异的生成先验;它给 VAE encoder 加时间嵌入、让同一张图随 timestep 编出不同 latent,再用一个映射把 student 和 teacher 的 timestep 绑起来,从而单步就能拿到一致的生成引导,并且只靠调一个 \(t_s\) 就能在保真度和真实感之间无级滑动,多个真实/合成数据集上无参考指标全面 SOTA。

Flickerformer: A Duet of Periodicity and Directionality for Burst Flicker Removal

揭示闪烁伪影具有周期性和方向性两个内在物理特性,设计Flickerformer三模块(PFM/AFFN/WDAM)分别针对帧间/帧内周期性和方向性建模,以3.92M参数量在BurstDeflicker基准上达到31.226dB PSNR,超越第二名AST +0.580dB且仅用其19.70%参数。

查看全部135篇「图像恢复」论文 →


🛰️ 遥感 (63)

TESSERA: Temporal Embeddings of Surface Spectra for Earth Representation and Analysis

TESSERA 把每个 10m 地表像素的多年 Sentinel-1/2 时间序列编码成一个 128 维 int8 嵌入向量,靠"对随机时间采样保持不变"的自监督目标学到鲁棒的物候表征,发布成覆盖全球的"嵌入即数据"产品,下游只需挂一个轻量 MLP/UNet 头就能在分类、分割、回归任务上达到 SOTA,且在极低标注下优势巨大。

OlmoEarth: Stable Latent Image Modeling for Multimodal Earth Observation

OlmoEarth 用一套专为地球观测设计的自监督配方(冻结随机投影做目标编码器的 Latent MIM Lite + 模态感知掩码 + 模态内对比损失),在潜空间里稳定地训练时空多模态基础模型,在 24 个嵌入任务里 15 个、29 个微调任务里 19 个超过其他 12 个基础模型,并落地成服务公益组织的端到端平台。

ZoomEarth: Active Perception for Ultra-High-Resolution Geospatial Vision-Language Tasks

针对超高分辨率(UHR)遥感影像「整张喂进去信息冗余、缩小又丢细节」的死结,ZoomEarth 让一个 3B 的 VLM 像人一样先看全局再「放大」感兴趣区域:模型自己预测 ROI 框、从原始高清图裁出局部回喂细看,靠 SFT + GRPO 两阶段训练,并用一个新的「区域引导奖励」缓解 IoU 奖励在 UHR 上恒为零的稀疏问题,在自建基准 LRS-GRO 和三个公开 UHR 遥感基准上零样本拿下 SOTA。

UniGeoSeg: Towards Unified Open-World Segmentation for Geospatial Scenes

作者构建了首个百万级遥感指令分割数据集 GeoSeg-1M(590K 图、117 类、1.1M 三元组)与配套 benchmark GeoSeg-Bench,并提出统一框架 UniGeoSeg——用任务自适应文本增强(TATE)+ 潜在知识记忆(LKM)+ 渐进式任务调度(PTS)把 referring / interactive / reasoning 三类分割塞进一个模型,在 GeoSeg-Bench 与多个公开 benchmark 上全面 SOTA 且零样本泛化强。

SegEarth-R2: Towards Comprehensive Language-guided Segmentation for Remote Sensing Images

针对遥感场景里"小目标 + 多粒度 + 多目标 + 隐式指令"四类复杂语言引导分割需求,本文先造了第一个系统覆盖这四个维度的大规模数据集 LaSeRS(40k 掩码、122 类、30k QA 三元组),再提出仅 3B 参数的 MLLM 分割模型 SegEarth-R2,靠"空间注意力监督 + 灵活分割查询"两个机制在多个基准上超越 7B/8B 甚至 13B 大模型。

Data Leakage Detection and De-duplication in Large Scale Geospatial Image Datasets

本文用感知哈希(perceptual hashing)对三个常用建筑物足迹遥感数据集做质量审计,发现 AICrowd Mapping Challenge 数据集存在严重的重复(约 89% 训练图为精确/增广重复)与跨切分泄漏(约 93% 验证图出现在训练集),并给出一条轻量、可复用的去重+泄漏检测流水线,揭示出大量"SOTA"方法实为过拟合到泄漏数据。

Asking like Socrates: Socrates helps VLMs understand remote sensing images

揭示遥感VLM中的"伪推理"现象(显式推理链反而导致性能下降),归因于"一瞥效应"(单次粗浅感知不足),提出RS-EoT(Evidence-of-Thought)迭代证据搜索范式,通过SocraticAgent自博弈合成推理轨迹做SFT冷启动,再用两阶段渐进RL(grounding→VQA)增强和泛化,RS-EoT-7B在多个遥感VQA和grounding基准上达SOTA。

GeoBridge: A Semantic-Anchored Multi-View Foundation Model Bridging Images and Text for Geo-Localization

GeoBridge 用一段「位置感知的统一文本描述」当语义锚点,把无人机、街景全景、卫星三种视角的图像绑到同一个语义空间里,从而摆脱传统「以卫星为中心」的定位范式,既能做任意视角两两双向匹配,又能用文字检索图像;配套的 GeoLoc 数据集(36 国 5 万+ 三视角对齐三元组)让它在跨视角、跨模态检索上都刷到 SOTA。

UniChange: Unifying Change Detection with Multimodal Large Language Model

UniChange 把二值变化检测(BCD)和语义变化检测(SCD)统一进一个基于 MLLM 的框架,靠 [T1][T2][CHANGE] 三个特殊 token 的嵌入作为"查询"去驱动分割解码器,用文本提示替代固定分类头,从而能在类别定义互相冲突的多源遥感数据集上联合训练,在 WHU-CD、S2Looking、LEVIR-CD+、SECOND 四个基准上 IoU 分别达 90.41 / 53.04 / 78.87 / 57.62,全面刷新 SOTA。

APEX: A Decoupled Memory-based Explorer for Asynchronous Aerial Object Goal Navigation

APEX 把"无人机找目标物"这个空中目标导航任务拆成三个解耦模块——用 MLLM 动态构建 3D 时空语义地图当记忆、用 PPO 强化学习把地图翻译成动作、用开放词表检测器做最后的目标确认——再用异步并行框架让三者以不同频率同时跑,从而绕开大模型推理延迟,在 UAV-ON benchmark 上比之前 SOTA 提升 +4.2% SR 和 +2.8% SPL。

查看全部63篇「遥感」论文 →


🔍 异常检测 (7)

RAID: Retrieval-Augmented Anomaly Detection

RAID 把无监督异常检测(UAD)重新解读为检索增强生成(RAG)流程:先用一个三层向量库(类原型→语义原型→实例 token)做由粗到细的检索,再用一个"引导式 MoE 滤波器"对检索得到的匹配代价体去噪,从而抑制匹配噪声、画出边界清晰的异常图,在 MVTec/VisA/MPDD/BTAD 的全样本、少样本、多数据集设定下都拿到 SOTA。

Anomaly-Related Residual Fields for Cross-domain Anomaly Detection

针对扩散模型残差里"噪声大、单看幅值无法区分异常"的难题,本文提出残差演化场(REF):从扩散反向过程的残差时空轨迹中分离出"持续不被吸收的非平稳异常信号",再用跨域场对齐(CFA)把有标签源域学到的检测器迁移到无标签目标域,在 9 个跨域迁移任务上平均 AUROC 95.22%,比最强基线高 13 个百分点。

Defect Cue-Preserved Structural Feature Refinement for Few-Shot Anomaly Detection

本文指出少样本异常检测(FSAD)的核心难点在于细微缺陷线索在深层特征提取流水线里被逐层"稀释"掉,提出 DCP-SFR:先用可学习提示词把早期弱信号"放大"成高对比异常线索图,再用这张图引导重建式定位,最后做结构感知的边界精修,在 MVTec AD / VisA 上拿到图像级 97.3%、像素级 98.2% 的 AUROC。

Dual-Prototype-Guided Multi-task Learning for Unsupervised Anomaly Detection and Classification

PG-SFD 把"无监督异常检测(像素级定位)+ 弱监督异常分类(区域级分类)"建模成一个双原型协同优化问题,用正常原型与类别原型显式解耦正常/异常语义、用差分门控把正常先验注入分类分支、用几何正则缓解多任务梯度冲突,在 MVTec-AD 上拿到 I-AUROC 99.4% 且同时支持细粒度缺陷分类。

Hunting Normality from Query Sample via Residual Learning for Generalist Anomaly Detection

针对通用异常检测(GAD)中「直接建模残差分布」会因残差与实例特征不一致而误判的问题,本文不再直接对残差分类,而是把残差当成向导:用可学习代理从残差里抽取模式(RFL),再借这些残差代理从支持集聚合查询相关的「正常性代理」(NLS),最后用正常性代理去查询特征里搜寻正常区域(HNQ)来定位异常,在工业→工业、工业→医学的跨域基准上取得有竞争力的少样本性能。

LayoutAD: Exploring Semantic-Geometric Misalignment Reasoning for Scene Layout Anomaly Detection

LayoutAD 提出"场景布局异常检测"这一新任务,用无监督方式给图像里每个物体打出对象级异常分——它把场景拆成语义图与几何图,通过跨图注意力推理两者之间的"错配",从而发现诸如"五条腿的狗""停在湖面上的车"这类像素级检测器看不见的布局级幻觉。

Multi-Prototype Compactness and Boundary-Aware Synthesis for Unsupervised Anomaly Detection

针对单原型假设在类内方差大时决策边界过松的问题,本文提出 PGBL 框架:用多原型紧凑约束(MPCC)把正常特征结构化为多个紧凑子簇,再在子簇拓扑边界处合成伪异常(BAAS),最后用判别器(DBR)精修决策面,在 MVTec-AD / VisA / Real-IAD 上的检测与定位均超越此前方法。


🧑 人体理解 (151)

SAM 3D Body: Robust Full-Body Human Mesh Recovery

SAM 3D Body(3DB)是一个 SAM 风格的可提示单图全身人体网格恢复模型:它用共享编码器 + 身体/手部双解码器架构,基于解耦骨骼与体型的 MHR 表示,配上一个能挖掘困难样本、产出 700 万张高质量标注的数据引擎,在野外图像上把身体和手部姿态同时做到 SOTA。

UniDex: A Robot Foundation Suite for Universal Dexterous Hand Control from Egocentric Human Videos

提出UniDex机器人基础套件——包含跨8种灵巧手的大规模数据集(50K+轨迹/9M帧)、功能-执行器对齐的统一动作空间(FAAS)和3D VLA策略(UniDex-VLA),在真实世界工具使用任务上达到81%平均任务进度(vs π₀的38%),并展示了空间、物体和零样本跨手泛化能力。

Avatar Forcing: Real-Time Interactive Head Avatar Generation for Natural Conversation

把"说话人头像生成"从单向播报升级成真正的双向对话:用因果 diffusion forcing 在运动隐空间里边收用户音频/动作、边自回归生成 avatar 头部运动,配合 KV cache 把延迟压到约 500ms(比基线快 6.8×),再用"丢掉用户条件造负样本"的免标注 DPO 让 avatar 学会点头、跟笑等富有表现力的反应,人类评测中超 80% 偏好率胜过最强基线。

AVATAR: Reinforcement Learning to See, Hear, and Reason Over Video

提出AVATAR框架,通过离策略训练架构(分层重放缓冲区)和时间优势塑形(TAS,U形加权强调推理链首尾)两个核心组件改进GRPO,解决其数据低效、优势消失和均匀信用分配三大问题,在音视频推理基准上显著超越GRPO基线。

RAM: Recover Any 3D Human Motion in-the-Wild

RAM 提出统一的多人 3D 运动恢复框架,集成运动感知语义跟踪器 SegFollow(基于 SAM2 + 自适应卡尔曼滤波)、记忆增强的时序人体网格恢复模块 T-HMR、轻量运动预测器和门控组合器,在 PoseTrack 和 3DPW 等基准上实现零样本跟踪稳定性和 3D 精度的 SOTA,且推理速度比之前方法快 2-3 倍。

InterPrior: Scaling Generative Control for Physics-Based Human-Object Interactions

InterPrior 用「大规模模仿蒸馏 + RL 微调」的三阶段配方,把一个全参考模仿专家蒸馏成目标条件的变分策略,再用 RL 把它打磨成能从稀疏目标(快照/轨迹/接触)生成全身人-物交互、并在失败后自我纠正的可泛化生成式控制器。

LLaMo: Scaling Pretrained Language Models for Unified Motion Understanding and Generation with Continuous Autoregressive Tokens

LLaMo 用"按模态分参数的 Mixture-of-Transformers + 连续因果运动 token + 流匹配解码头 + 退出头"把预训练 LLM 扩成既能"看懂动作(motion-to-text)"又能"生成动作(text-to-motion)"的统一大模型,关键是冻结文本模块从而不损伤 LLM 原有语言能力,并支持实时(≥30 FPS)流式、任意长度的运动生成。

M4Human: A Large-Scale Multimodal mmWave Radar Benchmark for Human Mesh Reconstruction

M4Human 是迄今规模最大的毫米波雷达人体网格重建(HMR)多模态基准——66.1 万帧、50 个动作、20 个被试,同步提供 RGB/深度/原始雷达张量(RT)/雷达点云(RPC)四模态与基于光学动捕的高保真 3D 网格标注,并首次给出直接在 RT 上做 HMR 的轻量基线 RT-Mesh。

PHASE-Net: Physics-Grounded Harmonic Attention System for Efficient Remote Photoplethysmography Measurement

从Navier-Stokes方程出发,通过严格数学推导揭示rPPG脉搏信号遵循二阶阻尼谐振子模型,其离散解形式等价于因果卷积算子,从而为TCN架构的选择提供了第一性原理依据,设计出仅0.29M参数的PHASE-Net在多个数据集上达到SOTA。

UniLS: End-to-End Audio-Driven Avatars for Unified Listening and Speaking

提出首个端到端统一说话-倾听面部表情生成框架UniLS,通过两阶段训练范式(先学内在运动先验、再用双轨音频微调),仅需双方音频输入即可同时生成自然的说话和倾听面部动作,倾听指标提升高达44.1%。

查看全部151篇「人体理解」论文 →


📹 视频理解 (187)

WorldMM: Dynamic Multimodal Memory Agent for Long Video Reasoning

提出 WorldMM,一个基于多模态记忆的视频推理 agent,构建情景记忆(多时间尺度文本知识图)、语义记忆(持续更新的关系知识图)和视觉记忆(帧级检索库)三类互补记忆,通过自适应多轮检索 agent 动态选择最相关的记忆源和时间粒度,在五个长视频 QA 基准上平均超越前 SOTA 8.4%。

StreamingTOM: Streaming Token Compression for Efficient Video Understanding

提出 StreamingTOM,一个无需训练的两阶段流式视频理解框架:Causal Temporal Reduction (CTR) 在 LLM 前通过因果时序选择将每帧 token 从 196 压缩到 50,Online Quantized Memory (OQM) 在 LLM 后通过 4-bit 量化和按需检索限制 kv-cache 增长,实现 15.7× 压缩比、1.2× 更低峰值显存和 2× 更快 TTFT。

VideoITG: Multimodal Video Understanding with Instructed Temporal Grounding

VideoITG 把"根据用户指令挑帧"做成一个独立的时序定位任务:先用 GPT-4o 驱动的 VidThinker 三阶段流水线自动标出 40K 视频里"哪些帧和这条指令相关",造出 50 万条指令对齐标注,再训练一个即插即用的帧选择器接到各种 Video-LLM 前面,用 16~32 帧就追平甚至超过均匀采样 64 帧的效果。

FluxMem: Adaptive Hierarchical Memory for Streaming Video Understanding

提出 FluxMem,一个无需训练的流式视频理解框架,通过层级化记忆设计(短期/中期/长期)和两个自适应 token 压缩模块(TAS 去时间冗余 + SDC 去空间冗余),在丢弃 60-70% 视觉 token 的同时在 StreamingBench 和 OVO-Bench 上取得新 SOTA。

Time Blindness: Why Video-Language Models Can't See What Humans Can?

作者构造了一个"信息只存在于帧间时序、单帧全是噪声"的合成基准 SpookyBench:人类靠运动分组能以 98% 准确率读出其中的文字/物体,而 15 个最强 Video-VLM(含 GPT-4o、Gemini 2.5 Pro、Qwen2.5-VL-72B)全部 0% 准确率,从而干净地暴露出当前视频模型"时间盲"——只会读单帧空间特征、根本没有纯时序信息的处理机制。

SDTrack: A Baseline for Event-based Tracking via Spiking Neural Networks

本文提出首个完全基于脉冲神经网络(SNN)的 Transformer 事件跟踪管线 SDTrack:用 Global Trajectory Prompt(GTP)把异步事件流聚合成富含轨迹信息的三通道事件帧,再用一个全脉冲驱动的 SNN Transformer 跟踪器(含 IPL 内禀位置学习)端到端预测目标框,在三个事件跟踪基准上以最低参数量和能耗(Tiny 版 19.61M / 8.16mJ)拿到接近或达到 SOTA 的精度。

StreamReady: Learning What to Answer and When in Long Streaming Videos

提出就绪性感知的流式视频理解范式,通过可学习的 <RDY> token 和 Answer Readiness Score (ARS) 指标,让模型不仅回答正确,还能在证据出现的恰当时刻作答,在 9 个流式/离线视频基准上取得 SOTA。

MA-Bench: Towards Fine-grained Micro-Action Understanding

提出 MA-Bench 微动作理解基准,包含 1000 个视频和 12000 个结构化 QA 对,通过"感知-理解-推理"三层评估架构系统测试 23 个 MLLM 的细粒度微动作理解能力,并构建 20.5K 训练语料 MA-Bench-Train 用于模型微调提升。

GoalForce: Teaching Video Models to Accomplish Physics-Conditioned Goals

提出 Goal Force 框架,通过多通道物理控制信号(目标力、直接力、质量)在简单合成数据上训练视频生成模型,使其学会从目标效果逆向规划因果链,实现零样本泛化到工具使用、人-物交互等复杂现实场景。

SoccerMaster: A Vision Foundation Model for Soccer Understanding

SoccerMaster 用一个共享的时空 ViT 编码器 + 五个轻量任务头,把球员检测识别、球场配准、事件分类、视觉-语言对齐这四类"空间感知 + 语义推理"任务塞进一次监督式多任务预训练,再配套一条自动标注流水线 SoccerFactory 量产稠密空间标签,最终在检测、跟踪、相机标定、解说生成等下游任务上全面超过通用视觉基础模型(SigLIP 2 / DINOv3)和足球专用模型 MatchVision。

查看全部187篇「视频理解」论文 →


🚗 自动驾驶 (157)

DriveMoE: Mixture-of-Experts for Vision-Language-Action Model in End-to-End Autonomous Driving

DriveMoE 把混合专家(MoE)同时塞进 VLA 自动驾驶模型的感知端和决策端——感知端用 Vision MoE 动态挑选关键摄像头视角省 token,决策端用 Action MoE 为不同驾驶技能分配专属专家,在 Bench2Drive 闭环上把驾驶分从 55.85 拉到 74.22、成功率从 30% 拉到 48.64%。

WOD-E2E: Waymo Open Dataset for End-to-End Driving in Challenging Long-tail Scenarios

Waymo 从 640 万英里真实路测里挖出 4,021 段(约 12 小时)发生频率低于 0.03% 的长尾驾驶片段做成数据集 WOD-E2E,并提出基于人类专家偏好打分的开环指标 RFS(Rater Feedback Score)来替代只对单一未来轨迹算距离误差的 ADE,从而能在「多种合理轨迹并存」的安全攸关场景里公允评测视觉端到端驾驶模型。

SimScale: Learning to Drive via Real-World Simulation at Scale

提出 SimScale 框架,通过对现有驾驶日志进行轨迹扰动 + 反应式环境仿真 + 神经渲染生成大规模高保真模拟数据,配合伪专家轨迹监督和 sim-real co-training 策略,使端到端规划器在 NAVSIM v2 上取得显著提升(navhard +8.6 EPDMS),且性能随仿真数据量平滑扩展。

SGDrive: Scene-to-Goal Hierarchical World Cognition for Autonomous Driving

SGDrive 给视觉语言模型(VLM)显式注入一套「场景几何—关键智能体—短期目标」的分层世界知识,用一组可训练的 <world> 查询去预测当前与未来世界状态,再用 DiT 扩散规划器把这套知识翻译成轨迹,在 NAVSIM 仅相机赛道上拿到 SOTA(PDMS 87.4,加 RL 后 91.1)。

GaussianDWM: 3D Gaussian Driving World Model for Unified Scene Understanding and Multi-Modal Generation

GaussianDWM 用「语言增强的 3D Gaussian」作为统一场景表征,把每个高斯椭球嵌入 CLIP 语言特征实现文本与 3D 几何的显式对齐,再经任务感知采样把紧凑 3D token 喂给 LLM,既能做场景理解(描述/2D-3D grounding/规划),又用双条件扩散做 RGB-D 时空生成,在 NuInteract 理解任务上把平均分从 52.12 提到 59.23、在 nuScenes 空间生成上把 ±2m 偏移 FID 压到 11.27。

SpaceDrive: Infusing Spatial Awareness into VLM-based Autonomous Driving

SpaceDrive 把 VLM 端到端驾驶里"把坐标当文本数字逐位生成"的老做法换成"把坐标当统一的 3D 位置编码(PE)"——同一套正余弦 PE 既叠加到视觉 token 上、又替换文本里的坐标 token、还编码自我状态,最后用一个回归式 PE 解码器直接吐出轨迹坐标,在 nuScenes 开环拿到 VLM 方法里的 SOTA、Bench2Drive 闭环拿到 78.02 的次优分。

GuideFlow: Constraint-Guided Flow Matching for Planning in End-to-End Autonomous Driving

GuideFlow 用「流匹配 + 能量模型」做端到端驾驶规划,把安全/物理硬约束直接嵌进生成过程(约束速度场 CVF、约束流状态 CF、能量精修 RFE 三招),既缓解模仿学习的多模态模式崩塌,又免去生成式方法事后再优化的环节,在 NavSim Navhard 上拿到 43.0 EPDMS 的 SOTA。

ActiveAD: Planning-Oriented Active Learning for End-to-End Autonomous Driving

ActiveAD 为端到端自动驾驶设计了一套"规划导向"的主动学习策略:用几乎免费的元信息(天气/光照/驾驶指令/车速)做多样性初始化解决冷启动,再用位移误差、软碰撞、Agent 不确定性三个免标注准则挑出最该标的场景,只标 30% 数据就在 nuScenes 开环和 CARLA 闭环上追平用 100% 数据训练的 SOTA。

LEAD: Minimizing Learner-Expert Asymmetry in End-to-End Driving

这篇论文指出 CARLA 里"学车(student)学不会老司机(privileged expert)"的根因不是模型不够强,而是专家用了学生看不到/测不准的特权信息、以及导航意图给得太稀疏;通过把专家的感知和决策约束到学生能观测的范围(LEAD 专家+数据集)、并重构学生策略的目标点注入方式(TFv6),在 Bench2Drive 上拿到 95 DS、在 Longest6 v2 / Town13 上把此前最好成绩翻倍以上。

WorldLens: Full-Spectrum Evaluations of Driving World Models in Real World

WorldLens 提出一个覆盖「生成 / 重建 / 动作跟随 / 下游任务 / 人类偏好」五个维度、共 24 个细粒度指标的驾驶世界模型全谱评测基准,并配套 26K 人工标注数据集 WorldLens-26K 与从中蒸馏出的可解释自动评测器 WorldLens-Agent,系统揭示出当前世界模型「看着真但行为不真」——没有任何一个模型能在所有维度上同时领先。

查看全部157篇「自动驾驶」论文 →


🤖 机器人/具身智能 (146)

Motus: A Unified Latent Action World Model

Motus 用一个 Mixture-of-Transformers 架构把「理解 / 视频生成 / 动作」三个预训练专家缝在一起,靠共享自注意力(Tri-model Joint Attention)+ UniDiffuser 式异步调度,在单一模型里统一了 VLA、世界模型、IDM、视频生成、视频-动作联合预测这 5 种具身范式;再用光流提炼出像素级「潜在动作」让动作专家也能在海量无标注视频上预训练,最终在仿真上比 π0.5 高 45%、比 X-VLA 高 15%,真机提升 11~48%。

InternData-A1: Pioneering High-Fidelity Synthetic Data for Pre-training Generalist Policy

InternData-A1 用一条全解耦、自主运行的仿真合成管线造出 63 万条、7433 小时的高保真机器人操作数据,首次证明「纯合成数据」单独预训练的 VLA 模型能在 49 个仿真 + 9 个真机任务上追平用闭源真机数据 π-dataset 训练的官方 π0。

RehearseVLA: Simulated Post-Training for VLAs with Physically-Consistent World Model

RehearseVLA(World-Env)用一个「物理一致的视频世界模型」当虚拟训练场,让 VLA 策略在想象出来的未来观测里安全地做强化学习后训练,再配一个 VLM 反思器给连续奖励并实时判定任务完成,从而在每个任务只有 5 条专家示范的极端数据稀缺下把 LIBERO 平均成功率从 74.85% 提到 79.6%。

VIRAL: Visual Sim-to-Real at Scale for Humanoid Loco-Manipulation

VIRAL 完全在仿真里训练人形机器人「边走边操作」(loco-manipulation)的视觉策略,靠「特权教师 → RGB 学生」蒸馏 + 大规模视觉域随机化 + 真到仿对齐,把只看 RGB 图像的策略零样本部署到 Unitree G1,能连续 54 个循环在两张桌子间走动、抓取、放置物体,接近专家级遥操作水平。

Evo-1: Lightweight Vision-Language-Action Model with Preserved Semantic Alignment

Evo-1 用一个仅 0.77B 参数的原生多模态 VLM 当主干,配上纯交叉注意力的流匹配扩散动作专家和一套"先冻结后微调"的两阶段训练,在完全不做机器人数据预训练的前提下,靠保住 VLM 的语义空间在 Meta-World / RoboTwin / LIBERO 上拿到 SOTA,真机 78% 成功率且推理频率 16.4 Hz、显存仅 2.3 GB。

AGENTSAFE: Benchmarking the Safety of Embodied Agents on Hazardous Instructions

AGENTSAFE 是首个系统评测「具身 VLM 智能体执行危险指令」安全性的 benchmark:它用一个可对接任意 agent 的对抗仿真沙盒(SAFE-THOR)+ 9,900 条按「机器人三定律」分类的危险指令(SAFE-VERSE)+ 跨「感知-规划-执行」三阶段的细粒度诊断协议(SAFE-DIAGNOSE),评测了 9 个 VLM 与 2 套 agent workflow,揭示出当前智能体「能看出危险却无法把这种认知落到规划和执行上」的系统性失效,并给出一个思维层防御模块 SAFE-AUDIT。

CoMo: Learning Continuous Latent Motion from Internet Videos for Scalable Robot Learning

提出 CoMo,通过早期时序差分(Td)和时序对比学习(Tcl)两个机制协同解决连续隐运动学习中的捷径学习问题,从互联网视频中提取精细的连续伪动作标签,使视频数据与机器人动作在统一连续分布下联合训练,显著提升策略性能。

OctoNav: Towards Generalist Embodied Navigation

OctoNav 把 ObjNav / PointNav / ImgNav / Ins-ImgNav / VLN 五类彼此割裂的导航任务统一进一条"自由形式、多模态、多能力"指令里,配套放出 45k+ 指令-轨迹对的 OctoNav-Bench 与带推理链的 TBA-CoT 数据集,并训练出一个"先思考再行动"的 VLA 模型 OctoNav-R1(LLaMA-VID 底座 + 三阶段 SFT/GRPO/在线 RL 混合训练范式),把统一设定下的整体成功率从此前最好的 9.2% 提到 19.4%。

ACoT-VLA: Action Chain-of-Thought for Vision-Language-Action Models

把 VLA 的"中间推理"从语言子任务或目标图像换成动作空间里的粗粒度参考动作序列(Action Chain-of-Thought),用一个显式动作推理器生成参考轨迹、一个隐式动作推理器从 VLM 的 KV cache 里抽动作先验,两路共同给动作头做条件,在 LIBERO/LIBERO-Plus/VLABench 三个仿真基准和真机上都刷到 SOTA。

Gallant: Voxel Grid-based Humanoid Locomotion and Local-navigation across 3D Constrained Terrains

Gallant 把车载 LiDAR 点云体素化成机器人中心的占据栅格,用一个「把 z 轴当通道」的轻量 2D CNN 端到端映射到全身控制策略,再配上能模拟机器人自身肢体的高保真 LiDAR 仿真,让单个策略零样本迁移到真机,在爬楼、上高台等任务上首次做到 >90% 成功率,并覆盖地面、侧向、头顶三类障碍。

查看全部146篇「机器人/具身智能」论文 →


🎮 强化学习 (25)

CME-CAD: Heterogeneous Collaborative Multi-Expert Reinforcement Learning for CAD Code Generation

针对"从二维工程三视图直接生成可执行、可编辑 CAD 代码"这一工业场景,CME-CAD 让多个异构预训练大模型分别扮演风格各异的"专家",先用各自的推理风格做监督微调(MEFT),再在强化学习阶段(MERL)让强专家通过 KL 蒸馏把好策略传给弱专家、并用难例缓冲机制反复攻克最难的样本,最终在自建的工业级基准 CADExpert 上把 IoU 从 71.84% 提升到 80.71%、代码可执行率提到 98.25%。

PlannerRFT: Reinforcing Diffusion Planners through Closed-Loop and Sample-Efficient Fine-Tuning

PlannerRFT 给基于扩散的自动驾驶规划器做强化微调:用「策略引导去噪」把模态坍缩的扩散采样变成多样且场景自适应的轨迹群,再用 GRPO + PPO 双分支闭环优化,配合自研 10× 加速仿真器 nuMax,在 nuPlan 上拿到 SOTA 闭环规划性能。

ReAG: Reasoning-Augmented Generation for Knowledge-based Visual Question Answering

提出 ReAG,一个推理增强的多模态 RAG 方法,结合粗细粒度检索与 Critic 过滤模型减少噪声,并通过 GRPO 强化学习训练生成器进行显式推理,在知识密集型 VQA 上达到新 SOTA。

GeoWorld: Geometric World Models

GeoWorld 将预测式世界模型的潜在表征从欧氏空间映射到双曲流形上,通过 Hyperbolic JEPA 保持几何结构和层级关系,并提出 Geometric Reinforcement Learning 来优化多步规划,在 CrossTask 和 COIN 上实现了约 3% SR(3步)和 2% SR(4步)的提升。

PanoEnv: Exploring 3D Spatial Intelligence in Panoramic Environments with Reinforcement Learning

针对 VLM 在 360° 等距柱状投影(ERP)全景图上 3D 空间推理几乎崩溃的问题,本文构建了 14.8K 题、五类几何对齐标注的 PanoEnv-QA 基准,并用「按题型路由的真值奖励 + 两阶段课程」的 GRPO 后训练把一个 7B 模型的总精度从 49.34% 提到 52.93%、开放式问答精度从 6.39% 提到 14.83%,反超 32B 模型。

MSRL: Scaling Generative Multimodal Reward Modeling via Multi-Stage Reinforcement Learning

提出多阶段强化学习(MSRL)方法,通过先在大规模文本偏好数据上学习奖励推理能力,再逐步迁移到多模态任务,解决多模态奖励模型训练中标注数据稀缺的瓶颈问题,在 VL-RewardBench 上将准确率从 66.6% 提升至 75.9%。

CCCaption: Dual-Reward Reinforcement Learning for Complete and Correct Image Captioning

提出 CCCaption 双奖励强化学习框架,通过 completeness reward(基于多 MLLM 生成的视觉 query 集)和 correctness reward(基于 caption 分解后的子 query 幻觉检测)联合优化图像描述的完整性和正确性,2B 模型超越 32B 基线。

Talk2Move: Reinforcement Learning for Text-Instructed Object-Level Geometric Transformation in Scenes

Talk2Move 把"按文字指令平移/旋转/缩放场景中某个物体"建模成一个 RL 问题,用 Flow-GRPO 在扩散轨迹上做带空间奖励的探索,免去成对监督数据,并通过早退步采样把训练加速 2×,在空间精度和场景一致性上显著超过 GPT-Image-1、Flux-Kontext、QwenImageEdit 等编辑模型。

Cloning Deterministic Worlds: The Critical Role of Latent Geometry in Long-Horizon World Models

作者用一个"oracle"诊断实验证明:在确定性环境里,世界模型长程崩溃的瓶颈不是动力学模型而是潜在表示的几何结构,进而提出 GRWM——把时序对比学习当作几何正则项,重塑自编码器潜在空间使其对齐环境真实状态流形,作为即插即用模块显著拉长各类世界模型的保真预测视野。

EVA: Efficient Reinforcement Learning for End-to-End Video Agent

EVA 把长视频理解建模成一个"先规划、后感知"的马尔可夫决策过程,让 MLLM 智能体仅凭文本问题就决定"看哪段、看几帧、看多清",再用 SFT 冷启动 → KTO 离线纠偏 → 数据增强 GRPO 的三段式训练把它从"格式模仿者"练成"会主动探索的看视频高手",在 6 个视频基准上以约 1/10 的视觉 token 取得比通用 MLLM 高 6–12%、比已有自适应智能体高 1–3% 的精度。

查看全部25篇「强化学习」论文 →


🔄 自监督/表示学习 (91)

Franca: Nested Matryoshka Clustering for Scalable Visual Representation Learning

Franca 是首个完全开源(数据+代码+权重+中间检查点)的视觉基础模型,在 DINOv2 框架上引入「嵌套 Matryoshka 多头聚类」让特征沿维度逐层细化语义、用 CyclicMask 平衡掩码空间分布、再用 RASA 后训练把绝对位置信息从稠密特征里剥离出去,仅用公开数据就在分割、OOD 检测、3D 理解等任务上匹配甚至反超 DINOv2 / SigLIP 2 等闭源模型。

NitroGen: An Open Foundation Model for Generalist Gaming Agents

NitroGen 把「玩家在直播画面里叠加的手柄按键 overlay」当成天然动作标签,从 4 万小时、1000+ 款游戏的公开视频里自动抽出 (画面, 动作) 对,用 flow-matching 训练一个单一的视觉-动作 Transformer,让一个模型在 2D/3D 多种游戏里直接玩,且预训练权重微调到没见过的游戏上成功率最高相对提升 52%。

Vision Transformers Need More Than Registers

这篇论文认为 ViT 在标签监督、文本监督和自监督下普遍存在的 dense feature 伪影,本质上不是单纯的 high-norm token 问题,而是模型在粗粒度监督和全局注意力共同作用下学会了用背景 patch 充当全局语义捷径;作者据此提出 LaSt-ViT,用频域稳定性引导的选择性聚合替代原始 CLS 聚合,在 12 个基准上稳定改善定位、分割和开放词汇任务。

Residual Connections Harm Generative Representation Learning

作者发现残差连接里那条"恒等捷径"会把浅层的高频细节直接灌进深层、压制语义抽象,于是提出随层深单调衰减恒等捷径权重这一行架构改动(只多一个超参 \(\alpha_{\min}\)、零额外参数),把 MAE 在 ImageNet-1K 上的 KNN 精度从 27.4% 拉到 63.9%、线性探测从 67.8% 提到 72.7%,同时改善扩散模型的生成质量。

OpenVision 2: A Family of Generative Pretrained Visual Encoders for Multimodal Learning

OpenVision 2 把上一代 OpenVision 里的文本编码器和对比损失全删掉,只留"图像编码器 + 文本解码器"做 caption-only 的纯生成式预训练,再随机掩掉约 2/3 视觉 token,在几乎不掉点的前提下把 ViT-L/14 训练时间砍掉 ~1.5×、显存砍掉 ~1.8×,并得以把视觉编码器一路扩到 10 亿参数。

In Pursuit of Pixel Supervision for Visual Pre-training

作者把 MAE 重新拉回 web 级数据规模,提出基于重建损失的"空间数据自筛选"策略 MetaCLIP-S,再配合四处极简的算法改造(更深解码器、更大掩码块、多 CLS token),训出名为 Pixio 的模型,在深度估计、前馈 3D 重建、分割等稠密预测任务上追平甚至超过经过大量 benchmark 定制筛选的 DINOv2/v3。

How Much 3D Do Video Foundation Models Encode?

作者提出第一个模型无关的探针框架,用「冻结视频基础模型特征 + 浅层前馈头预测 3D 点云/深度/相机位姿」来量化各类视频模型内部隐含了多少 3D 理解,结论是:只在 2D 视频上训练的前沿视频生成模型(如 WAN2.1-14B)涌现出强 3D 感知,在跨域场景上甚至超过专门用 3D 数据训练的专家模型 Fast3R。

Can You Learn to See Without Images? Procedural Warm-Up for Vision Transformers

在 ViT 正式看图像之前,先用形式文法生成的「平衡括号」之类纯符号、无任何视觉内容的序列做一段轻量 masked-token 预训练(warm-up),逼模型内化栈式层级、长程依赖这类通用计算机制;之后再接标准图像训练,仅花 1% 训练预算就能在 ImageNet-1K 上把 top-1 提升 +1.72%,相当于替代了 28% 的图像数据。

TeFlow: Enabling Multi-frame Supervision for Self-Supervised Feed-forward Scene Flow Estimation

提出TeFlow——首个将多帧监督引入自监督前馈场景流估计的方法:通过时序集成策略构建运动候选池并基于共识投票聚合时序一致的监督信号,在Argoverse 2上Three-way EPE达3.57cm(媲美优化方法Floxels)同时保持实时推理(8s vs 24min),较SeFlow++提升22.3%。

DiverseDiT: Towards Diverse Representation Learning in Diffusion Transformers

通过系统分析发现 DiT 各 block 间的表示多样性是有效学习的关键因素,提出 DiverseDiT:用长残差连接多样化输入 + 表示多样性损失显式促进 block 间特征差异化,无需外部引导模型即可加速收敛并提升生成质量。

查看全部91篇「自监督/表示学习」论文 →


📐 优化/理论 (22)

DC-Merge: Improving Model Merging with Directional Consistency

DC-Merge 发现模型合并的关键在于保持合并后多任务向量与原始单任务向量之间奇异空间方向的一致性,通过奇异值平滑 + 共享正交子空间投影两步操作,在 Vision 和 Vision-Language 任务上均取得 SOTA 合并效果。

Learning to Learn Weight Generation via Local Consistency Diffusion

Mc-Di 把元学习的双层优化和扩散式权重生成结合起来,并把原本只学"全局最优权重"的扩散过程改造成"局部一致性扩散"——让模型沿优化轨迹上的多个中间权重逐段重建,从而在迁移学习、小样本、域泛化、语言模型微调等需要频繁更新权重的任务上同时拿到更高精度和更低推理延迟。

UniFusion: A Unified Image Fusion Framework with Robust Representation and Source-Aware Preservation

提出 UniFusion 统一图像融合框架,利用 DINOv3 自监督语义先验构建跨模态共享特征空间,通过重建对齐机制保留源图信息,并以双层优化策略解耦重建与融合目标,在红外-可见光、多曝光、多焦点、医学图像等多任务上均达到 SOTA。

Enhancing Visual Representation with Textual Semantics: Textual Semantics-Powered Prototypes for Heterogeneous Federated Learning

针对联邦原型学习中现有方法破坏类间语义关系的问题,提出FedTSP方法利用预训练语言模型构建保留语义结构的文本原型,在异构联邦学习中显著提升性能并加速收敛。

Model Merging in the Essential Subspace

提出 ESM 框架,通过对参数更新引起的激活偏移做 PCA 构建"本质子空间"(而非直接对参数做 SVD),并用三级极化缩放增强关键参数、抑制噪声,在 ViT-B/32 的 20 任务合并中比 Iso-CTS 提升 3.2%(绝对准确率)。

Defending Unauthorized Model Merging via Dual-Stage Weight Protection

提出 MergeGuard,一种主动式双阶段权重保护框架:Stage 1通过L2正则化分散任务关键权重,Stage 2注入结构化扰动破坏合并兼容性,在保持保护模型<1.5%性能损失的同时使合并模型精度下降高达90%。

Fed-ADE: Adaptive Learning Rate for Federated Post-adaptation under Distribution Shift

提出 Fed-ADE 框架,通过 uncertainty dynamics estimation 和 representation dynamics estimation 两个轻量级分布漂移信号,为每个客户端在每个时间步自适应调整学习率,实现联邦部署后无监督适应。

ACE-Merging: Data-Free Model Merging with Adaptive Covariance Estimation

本文从理论上证明了微调参数差蕴含输入协方差信息,据此提出 ACE-Merging,通过自适应协方差估计、集体结构先验和谱精炼三步实现无数据闭式模型合并,在 GPT-2 上比之前方法平均提升 4%,在 RoBERTa-Base 上提升 5%。

Conditional Factuality Controlled LLMs with Generalization Certificates via Conformal Sampling

提出 CFC(Conditional Factuality Control),一种后验保形框架,通过增广分位数回归学习特征条件化的接受阈值,为LLM/VLM采样输出提供条件覆盖率保证,在保持紧凑预测集的同时显著改善难题子群的可靠性。

Mapping Networks

本文提出 Mapping Networks——一种"元参数化"方法,用一个低维可训练隐向量 \(z\)(配合固定的、被 \(z\) 调制的映射权重)来生成目标网络的全部参数,从而把训练从高维权重空间搬到低维隐空间,在图像分类、deepfake 检测、分割等任务上以约 500× 更少的可训练参数达到甚至超过原网络的精度,同时显著抑制过拟合。

查看全部22篇「优化/理论」论文 →


🔗 因果推理 (4)

Retrieving Counterfactuals Improves Visual In-Context Learning

提出 CIRCLES 框架,通过属性引导的 composed image retrieval 检索反事实示例,构建因果+相关性双通道 in-context demonstration,显著提升 VLM 的细粒度视觉推理能力。

MaskDiME: Adaptive Masked Diffusion for Precise and Efficient Visual Counterfactual Explanations

提出 MaskDiME,一个免训练的扩散框架,通过自适应双掩码机制将全局分类器引导转化为决策驱动的局部编辑,实现精确高效的视觉反事实解释,推理速度比 DiME 快 30 倍以上,GPU 内存仅为 ACE/RCSB 的十分之一。

A Polynomial Chaos Framework for Causal Discovery in Nonlinear Uncertain Systems

把噪声项用多项式混沌展开(PCE)嵌进结构方程,得到 PCE-LiNGAM,证明在轻度稀疏条件下因果 DAG 可唯一辨识,并用「PCE 签名污染检验 + 递归找 sink」的多项式时间算法在极端非高斯工业数据上把平均 F1 从 0.50 提到 0.756,同时顺手给出基于 Sobol 指数的不确定性量化。

CGU-Bayes: Causal Graph Uncertainty-Guided Bayesian Inference for Domain Generalization

针对"用结构因果模型(SCM)做领域泛化时、因果图在数据稀缺/含噪下估不准"的问题,本文不再点估计单一因果图,而是对因果图的后验做贝叶斯推断,从采样出的多张图里各选一套因果马尔可夫毯(CMB)特征训练预测器,再用每张图与测试样本的"对齐不确定性"当权重做加权集成,在 BLT、CMNIST 等强分布偏移数据集上拿到 SOTA。


🔬 可解释性 (34)

Where Culture Fades: Revealing the Cultural Gap in Text-to-Image Generation

作者发现多语言文生图模型在"只给名词"的提示下会产出文化中立或偏英语的图,并通过注意力 + 稀疏自编码器探针证明这是"激活不足"而非"知识缺失"——文化信号其实只集中在文本编码器的少数几层、少数几个神经元里;据此提出免训练放大这些神经元和只微调文化层两种轻量方案,在自建的 15 国基准 CultureBench 上把文化识别准确率(CultureVQA)从 ~22 提到 36.6。

ERMoE: Eigen-Reparameterized Mixture-of-Experts for Stable Routing and Interpretable Specialization

ERMoE 提出在正交特征基(eigenbasis)中重参数化MoE专家权重,并用特征基分数(cosine similarity)替代传统路由logits,无需辅助负载均衡损失即可实现稳定路由和可解释的专家特化。

SafeDrive: Fine-Grained Safety Reasoning for End-to-End Driving in a Sparse World

提出 SafeDrive 端到端规划框架,通过轨迹条件化的稀疏世界模型(SWNet)模拟关键实体的未来行为,再由细粒度推理网络(FRNet)进行逐实例碰撞评估和逐时刻可行驶区域合规评估,在 NAVSIM 上 PDMS 达 91.6、仅 0.5% 碰撞率,Bench2Drive 驾驶分 66.8%。

Cut to the Chase: Training-free Multimodal Summarization via Chain-of-Events

提出 CoE,一个免训练的多模态摘要框架,通过构建层次事件图(HEG)引导链式事件推理,在8个数据集上超越SOTA视频CoT基线,平均提升 +3.04 ROUGE、+9.51 CIDEr、+1.88 BERTScore。

HUMORCHAIN: Theory-Guided Multi-Stage Reasoning for Interpretable Multimodal Humor Generation

HUMORCHAIN 把不和谐-消解、良性冒犯、优越论、宣泄论四大幽默理论显式编码成一条"视觉解析→按图类型选幽默策略→生成→判别器闭环反馈"的多阶段 LLM 推理链,并训练一个 Qwen3-VL-4B 幽默判别器做"生成-评估-改写"闭环,在三个幽默图像描述数据集上的人类偏好、Elo/BT 分和语义多样性全面超过现有方法。

RiskProp: Collision-Anchored Self-Supervised Risk Propagation for Early Accident Anticipation

提出 RiskProp,一种以碰撞帧为锚点的自监督风险传播范式,通过未来帧正则化损失和自适应单调约束损失,仅依赖碰撞帧标注即可学习时序连贯的风险演化曲线,在 CAP 和 Nexar 数据集上达到 SOTA。

Edit-As-Act: Goal-Regressive Planning for Open-Vocabulary 3D Indoor Scene Editing

将开放词汇的3D室内场景编辑重新定义为目标回归规划问题,设计PDDL风格的EditLang符号语言,通过LLM驱动的Planner-Validator循环从目标状态逆向推导最小编辑序列,在63个编辑任务上同时实现指令忠实度(69.1%)、语义一致性(86.6%)和物理合理性(91.7%)三个指标的最佳平衡。

Missing No More: Dictionary-Guided Cross-Modal Image Fusion under Missing Infrared

提出首个在系数域(而非像素域)进行红外缺失条件下跨模态融合的框架:通过共享卷积字典建立 IR-VIS 统一原子空间,在系数域完成 VIS→IR 推理和自适应融合,配合冻结 LLM 提供弱语义先验进行热信息补全,在仅输入可见光图像的条件下达到接近双模态融合方法的性能。

Rethinking Concept Bottleneck Models: From Pitfalls to Solutions

提出 CBM-Suite 框架,系统性解决概念瓶颈模型的四大缺陷——缺乏概念相关性预评估指标、线性问题导致概念瓶颈被绕过、与黑盒模型的精度差距、以及不同视觉骨干/VLM 影响的研究空白——通过熵度量、非线性层和蒸馏损失显著提升 CBM 的精度与可解释性。

Improving Sparse Autoencoder with Dynamic Attention

这篇论文把稀疏自编码器(SAE)重写成一个共享概念向量的交叉注意力结构,并用 sparsemax 取代 softmax,让每个样本按自身复杂度自动决定激活几个概念,从而摆脱 TopK 里"K 该设多少"的老问题,在图像和文本上都拿到更低重构误差和更清晰的概念。

查看全部34篇「可解释性」论文 →


📦 模型压缩 (108)

Phased DMD: Few-step Distribution Matching Distillation via Score Matching within Subintervals

针对「一步 DMD 蒸馏容量不足、多样性差,而直接多步扩展又显存爆炸、用随机梯度截断(SGTS)则退化回一步」的困境,本文提出 Phased DMD:把 SNR 区间切成子区间、每个阶段只蒸馏一个专家并渐进推向更高 SNR(中间阶段在中间时刻而非干净样本处停止),再为「无干净样本」推导出无偏的子区间分数匹配目标,从而天然产出少步 MoE 生成器,在 Qwen-Image-20B、Wan2.2-28B 等大模型上同时改善运动动态、视觉保真和生成多样性。

SelecTKD: Selective Token-Weighted Knowledge Distillation for LLMs

SelecTKD 把 LLM 蒸馏的关注点从"用什么散度度量教师-学生差距"转向"在哪些 token 上施加监督",借鉴投机解码用"提议-验证"机制给每个 token 打上 \(\{0,\beta,1\}\) 的权重,只在教师高置信、师生一致的 token 上施加全损失,在指令跟随、数学、代码和 VLM 上即插即用地刷新了小模型 SOTA。

Bilevel Layer-Positioning LoRA for Real Image Dehazing

提出 BiLaLoRA,通过双层优化自动定位 LoRA 应插入的最优网络层,配合 H2C Loss(基于 CLIP 语义方向的无监督去雾损失),实现合成数据预训练的去雾模型向真实场景的高效适配——训练时间降低 77.7%,性能持平全量微调,跨模型跨域均有效。

Fixed Anchors Are Not Enough: Dynamic Retrieval and Persistent Homology for Dataset Distillation

RETA解耦数据蒸馏中残差匹配的两个失败模式(fit-complexity gap和pull-to-anchor effect),通过动态检索连接(DRC)自适应选择real patch anchor并用持久同调拓扑对齐(PTA)保持类内多样性,在ImageNet-1K ResNet-18 IPC=50上达到64.3%(+3.1% vs FADRM)。

HierAmp: Coarse-to-Fine Autoregressive Amplification for Generative Dataset Distillation

提出 HierAmp,在视觉自回归(VAR)模型的粗到细生成过程中,向每个尺度注入可学习的类别 token 识别语义显著区域,并通过正 logit 偏置放大这些区域的注意力,使蒸馏数据在粗尺度获得更丰富多样的布局、在细尺度聚焦于类别相关细节,在多个数据集蒸馏基准上达到 SOTA。

Progressive Supernet Training for Efficient Visual Autoregressive Modeling

VARiant 发现视觉自回归(VAR)模型存在"尺度-深度非对称依赖"——早期低分辨率尺度极度依赖网络深度、后期高分辨率尺度对深度很鲁棒,据此把一个 30 层 VAR 训成共享权重的弹性深度 supernet(早尺度走全网络、晚尺度走 2–16 层子网),再用三阶段动态比例渐进训练打破固定比例的 Pareto 前沿,在 ImageNet 上让 d16/d8 子网几乎不掉点(FID 2.05/2.15 vs 1.95)却省 40–65% 显存。

Towards Generalizable AI-Generated Image Detection via Image-Adaptive Prompt Learning

提出 Image-Adaptive Prompt Learning (IAPL),在推理时根据每张测试图像动态调整 CLIP 编码器的 prompt,通过测试时 token 调优和条件信息学习器实现对未见生成器的强泛化,在 UniversalFakeDetect 和 GenImage 上分别达到 95.61% 和 96.7% 平均准确率的 SOTA 性能。

Masking Teacher and Reinforcing Student for Distilling Vision-Language Models

Masters 通过"先把大教师按权重幅度掩码、再随训练逐步解掩还原满血"的渐进策略缩小师生容量鸿沟,并叠加一个用准确性奖励 + 蒸馏可迁移性奖励驱动的离线 RL,让小学生 VLM 稳定吸收大教师知识,在 13 个多模态评测上超过同尺寸紧凑模型、部分超过大模型。

ThinkingViT: Matryoshka Thinking Vision Transformer for Elastic Inference

ThinkingViT 把"先用少量注意力头快速预测、不确定就扩大子网重新思考"的渐进机制塞进一个嵌套 ViT,并用 Token Recycling 把上一轮的特征喂回下一轮,在同等吞吐下比 MatFormer / HydraViT 等嵌套基线在 ImageNet-1K 上高出最多 2.0 个点。

UniComp: Rethinking Video Compression Through Informational Uniqueness

提出基于信息唯一性(而非注意力)的视频 token 压缩框架 UniComp,通过帧组融合、token 分配和空间动态压缩三个模块在时序-空间-全局维度上最大化保留唯一信息,在仅保留 10% token 时仍能超越未压缩基线性能。

查看全部108篇「模型压缩」论文 →


🕸️ 图学习 (8)

Graph2Eval: Automatic Multimodal Task Generation for Agents via Knowledge Graphs

提出 Graph2Eval,一个知识图谱驱动的 agent 评估任务自动生成框架——通过从文档/网页构建结构化知识图谱、子图采样、LLM 条件生成和多阶段过滤,自动产出语义一致(+20%)且可解(+17%)的多模态 agent 任务,构建了包含 1319 个任务的 Graph2Eval-Bench。

Robo-SGG: Exploiting Layout-Oriented Normalization and Restitution Can Improve Robust Scene Graph Generation

针对鲁棒场景图生成(在噪声/模糊/天气等损坏图像上推理)里"视觉特征发生域偏移导致性能暴跌"的痛点,本文提出即插即用的 Robo-SGG:用实例归一化抹掉损坏带来的域特异统计、再用布局感知注意力把全局结构特征找回来(NRM),并用门控融合自适应平衡视觉与坐标特征(LEE),插到现有 SGG 模型上即在 VG-C 上把 PredCls/SGCls/SGDet 的 mR@50 相对提升 6.3% / 11.1% / 8.0%。

ViterbiPlanNet: Injecting Procedural Knowledge via Differentiable Viterbi for Planning

将过程知识图(PKG)通过可微Viterbi层端到端嵌入规划模型,使神经网络只需学习发射概率而非记忆完整过程结构,在CrossTask/COIN/NIV上以仅5-7M参数(比扩散/LLM方法少1-3个数量级)达到SOTA成功率,并建立了统一的评估基准。

Adaptive Learned Image Compression with Graph Neural Networks

GLIC 把学习图像压缩里的非线性变换从固定卷积或窗口注意力,改造成由图神经网络驱动的内容自适应连接:先用双尺度图决定“连到哪里”,再用复杂度感知机制决定“连多少”,从而更好地建模局部与远程冗余,在三个标准数据集上都显著超过传统编解码器和近期 LIC 强基线。

Mario: Multimodal Graph Reasoning with Large Language Models

提出 Mario,针对多模态图(MMG)上的 LLM 推理,通过图条件视觉语言模型(GVLM)实现拓扑感知的跨模态对齐,再用模态自适应提示路由器(MAPR)为每个节点选择最优模态配置,在节点分类和链接预测上达到 SOTA。

M3KG-RAG: Multi-hop Multimodal Knowledge Graph-enhanced Retrieval-Augmented Generation

提出M3KG-RAG,通过轻量多Agent流水线构建多跳多模态知识图谱(M3KG),并设计GRASP机制进行实体定位和选择性剪枝,仅保留查询相关且有助回答的知识,大幅提升MLLM的音视觉推理能力。

R2G: A Multi-View Circuit Graph Benchmark Suite from RTL to GDSII

提出 R2G,首个标准化的多视图电路图基准套件,在 30 个 IP 核上提供 5 种阶段感知的图表示(具有信息对等性),系统研究发现图表示选择比 GNN 模型选择对性能影响更大。

Mixture-of-Experts based Feature Decoupling for Open Vocabulary Scene Graph Generation

针对开放词表场景图生成(OVSGG)里"只套用现成 VLM 特征、缺乏判别性属性、物体与关系语义割裂"的痛点,本文提出 MoE-FD:用混合专家自适应地把物体/关系特征解耦成形状、纹理、空间等子属性,再用迭代跨注意力让节点与边互相精炼,最终在 Visual Genome 全开放词表设定下把新类 R@100 大幅刷高(OvD+R 新关系 R@20 比 ACC 高 4.24%)。


🤝 联邦学习 (19)

FedHarmony: Harmonizing Heterogeneous Label Correlations in Federated Multi-Label Learning

针对联邦多标签学习中各客户端只见到局部标签空间、学出的标签相关性互相打架(标签相关性漂移)的问题,FedHarmony 用"多数客户端的共识相关性"当全局教师在本地训练时纠偏,并在服务器聚合时同时按数据量和相关性质量给客户端加权,在 FLAIR / COCO-80 / VOC2007 三个非 IID 联邦基准上一致超过现有 SOTA(FLAIR mAP +11.4)。

Fine-Tuning Impairs the Balancedness of Foundation Models in Long-tailed Personalized Federated Learning

本文先实证揭示「在长尾联邦场景里微调 CLIP 会破坏其天生的类别均衡性、甚至跌破 zero-shot」,再提出 FedPuReL:用 zero-shot 预测把本地梯度「净化」成不破坏均衡的方向来训一个均衡的全局模型,并把个性化重构成冻结全局模型之上的「残差修正」,从而在 8 个长尾数据集上的全局模型和个性化模型都超过现有 SOTA。

Fully Decentralized Certified Unlearning

针对"无中心协调者的去中心化网络"这一被忽视的场景,本文提出 RR-DU——一个随机游走式的认证遗忘算法:只在发起删除的客户端上对遗忘集做带噪投影梯度上升、其余客户端继续做无噪下降,配合子采样高斯噪声和信任域投影,证明了 \((\varepsilon,\delta)\) 网络遗忘证书、收敛性与删除容量边界,且噪声不随遗忘集大小 \(m\) 增长,在图像分类上把后门攻击成功率压到随机猜测水平同时保住干净精度。

Generalized and Personalized Federated Learning with Black-Box Foundation Models via Orthogonal Transformations

FEDOT 把冻结的黑盒基础模型当成纯特征提取器,每个客户端在它输出的 embedding 上叠一个本地正交变换做个性化、所有客户端共享并聚合一个全局分类器做泛化;作者证明正交约束(条件数 \(\kappa=1\))能把跨客户端的梯度冲突上界压到最小,从而在严重 non-IID 下同时拿到 SOTA 级的泛化和个性化,且全程不碰 FM 内部参数。

HiLoRA: Hierarchical Low-Rank Adaptation for Personalized Federated Learning

HiLoRA 把每个客户端的 LoRA 更新拆成"根—簇—叶"三层正交子空间,分别承载全局共识、子群共性与客户端个性,再配上一个基于 LoRA 子空间相似度的自适应聚类,在 CIFAR-100 与 DomainNet 上同时把个性化和对新客户端的泛化都做到 SOTA。

Taming Noise-Induced Prototype Degradation for Privacy-Preserving Personalized Federated Fine-Tuning

针对原型化个性化联邦学习(ProtoPFL)在共享类原型时为满足局部差分隐私而注入各向同性高斯噪声、却把判别性维度也一并淹没的问题,本文提出客户端即插件 VPDR:用方差自适应的 VPP 把噪声预算从判别子空间挪向冗余子空间、用蒸馏引导的 DCR 让特征范数主动贴近裁剪阈值,在同等 LDP 保证下显著改善隐私-效用权衡。

FedRG: Unleashing the Representation Geometry for Federated Learning with Noisy Clients

针对联邦学习里"客户端标注有噪声 + 数据非独立同分布"的双重难题,FedRG 抛弃了不可靠的 small-loss 启发式,改从表征几何判断样本干净与否——先用自监督在超球面上学出与标签无关的表征,再用 vMF 混合模型把"几何证据"和"标注标签证据"在同一空间里做一致性比对来挑出噪声样本,最后用个性化噪声吸收矩阵做鲁棒优化,在多个数据集和四种噪声场景下都拿到 SOTA。

From Selection to Scheduling: Federated Geometry-Aware Correction Makes Exemplar Replay Work Better under Continual Dynamic Heterogeneity

针对联邦持续学习里"光会挑样本、不会用样本"的痛点,FEAT 不改回放策略,而是用一组所有客户端共享的固定 ETF 原型,在训练时做几何结构蒸馏拉齐各客户端的特征角度、在推理时用基于能量的几何校正把尾类特征从头类子空间里"拽回来",作为即插即用模块叠在 Re-Fed+/FedCBDR 上即可稳定涨点。

Personalized Federated Training of Diffusion Models with Privacy Guarantees

PFDM 把扩散模型的反向去噪过程拆成"客户端私有去噪器 + 服务器共享去噪器"两块,客户端只上传经裁剪并前向加噪后的数据,从而对每个数据点给出形式化的本地差分隐私(LDP)保证;共享模型只见加噪数据、单独无法复现任何客户端样本,而协同又能显著提升少数类/欠表示类的生成质量。

Single-Round Scalable Analytic Federated Learning

SAFLe 用「特征分桶 + 打散分组 + 稀疏嵌入求和」搭出一个确定性的非线性分类头,并证明它在数学上等价于一个高维稀疏线性回归,从而能直接套用解析联邦学习(AFL)的单轮闭式聚合律——既拿到非线性的表达力,又保留 AFL「一轮通信 + 对数据异质性完全不变」的两大优势,在三个视觉联邦基准上同时超过线性 AFL 和多轮 DeepAFL。

查看全部19篇「联邦学习」论文 →


📈 时间序列 (7)

STCast: Adaptive Boundary Alignment for Global and Regional Weather Forecasting

提出STCast框架,通过Spatial-Aligned Attention(SAA)用可学习的全球-区域分布替代静态边界来自适应融合全球大气信息到区域预报,并用Temporal Mixture-of-Experts(TMoE)按月动态路由专家增强时序建模,在全球预报、高分辨率区域预报、台风路径预测和集合预测四个任务上全面超越现有方法。

PFGNet: A Fully Convolutional Frequency-Guided Peripheral Gating Network for Efficient Spatiotemporal Predictive Learning

提出 PFGNet,一种纯卷积时空预测框架,通过像素级频率引导门控(PFG)动态调制多尺度大核外周响应并施加可学习中心抑制,模拟生物视觉的 center-surround 带通滤波机制,在 Moving MNIST、TaxiBJ、KTH、Human3.6M 四个基准上以极少参数和计算量达到 SOTA 或近 SOTA 性能。

Probabilistic Precipitation Nowcasting with Rectified Flow Transformers

本文提出 FREUD——一个用整流流(rectified flow)Transformer 充当"压缩第一阶段"的框架:帧级编码器独立编码每帧、联合视频解码器一次性重建所有帧,把确定性解码换成概率式解码,从而在压缩阶段就能量化不确定性;配合潜空间整流流临近预报模型,在 SEVIR 降水临近预报基准上取得 SOTA 的 CRPS(0.0190)和 SSIM。

SATTC: Structure-Aware Label-Free Test-Time Calibration for Cross-Subject EEG-to-Image Retrieval

提出SATTC,一个无标签的测试时校准头,通过几何专家(被试自适应白化+自适应CSLS)和结构专家(互最近邻+双向top-k排名+类别流行度)的乘积专家融合,在冻结的EEG和图像编码器上直接操作相似度矩阵,显著改善跨被试EEG-to-image检索的Top-1精度并降低hubness效应。

Real-Time Long Horizon Air Quality Forecasting via Group-Relative Policy Optimization

本文针对东亚长程(48–120 小时)PM 浓度预测,先发布一套观测对齐的区域数据集 CMAQ–OBS,再用「带时间累积损失的 SFT + 带类别 AQI 奖励的 GRPO」两阶段训练(FAKER-Air),把 MSE 训练固有的「过预报、误报多」问题对齐到真实的运营成本上,在保持 F1 的同时把误报率(FAR)相对 SFT 基线降低 47.3%。

Stable Spike: Dual Consistency Optimization via Bitwise AND Operations for Spiking Neural Networks

提出 Stable Spike 双一致性优化框架,利用硬件友好的 AND 位运算从多时间步脉冲图中解耦稳定脉冲骨架,并注入振幅感知脉冲噪声增强泛化,在超低延迟(T=2)下将神经形态物体识别精度提升最高 8.33%。

Towards Uncertainty-aware Unsupervised Domain Adaptation for Videos and Time-Series with Causal Optimal Transport

本文提出 Causal-OT:把通道间的 Granger 因果图嵌进最优传输(OT)的代价矩阵里做跨域对齐,同时用基于熵的不确定性筛选伪标签,让时序与视频的无监督域适应既保住时间-因果结构、又不被过自信的伪标签带偏,在 6 个时序基准上平均涨 4.5% 准确率、4 个视频基准上涨 2.5%。


🏥 医学图像 (173)

Generative Vision-Language Multiple Instance Learning for Weakly Supervised Neonatal Fundus Screening and Reporting

GVL-MIL 用少量逐图专家描述适配生成式视觉语言模型,将中间层视觉证据与生成文本的语义分别聚合、按预测熵融合,在 NFSD 测试集取得患儿级 AUC 92.14 ± 0.72%,同时提供逐图临床描述。

LEMON: A Large Endoscopic MONocular Dataset and Foundation Model for Perception in Surgical Settings

构建了包含 4194 个手术视频(938 小时)的大规模内窥镜数据集 LEMON,并提出基于增强知识蒸馏的自监督基础模型 LemonFM,在手术阶段识别、工具检测、动作识别和语义分割四大下游任务上全面超越现有手术基础模型。

VoxTell: Free-Text Promptable Universal 3D Medical Image Segmentation

VoxTell 是一个 3D 视觉-语言分割模型,用一句话(单词到整段临床报告)作为提示就能直接生成体积掩码,靠在 UNet 解码器每一层反复注入文本引导(多阶段融合)+ 深监督,在 11 个未见数据集上零样本平均 Dice 70.85,远超此前最强文本可提示方法 SAT(51.23)。

LLaDA-MedV: Exploring Large Language Diffusion Models for Biomedical Image Understanding

把通用域的掩码扩散语言模型 LLaDA 通过视觉指令微调首次搬进生物医学影像理解领域,得到第一个扩散式生物医学 VLM——在开放式医学对话上超过 LLaVA-Med,在三个 VQA benchmark 的闭式子集上刷新 SOTA,还能显式控制响应长度生成更详尽的答案。

Med-CMR: A Fine-Grained Benchmark Integrating Visual Evidence and Clinical Logic for Medical Complex Multimodal Reasoning

Med-CMR 把"医学多模态复杂推理"拆成 3 个视觉维度 + 4 个推理维度共 7 类任务,用 20,653 条经人类专家与模型双重审核的 VQA(覆盖 11 个身体系统、12 种成像模态)评测 18 个主流 MLLM,发现 GPT-5 以 57.81% MCQ 准确率领跑、长尾泛化是公认最难项、而医学微调模型并不能稳定胜过通用大模型。

MedMO: Grounding and Understanding Multimodal Large Language Model for Medical Images

MedMO 以 Qwen3-VL 为底座、用 26M+ 跨模态医学数据走"通用医学 SFT → 高分辨率定位 SFT → 指令微调 → 带边界框奖励的 GRPO 强化学习"四阶段后训练,把医学影像的理解(VQA / QA / 报告生成)和细粒度空间定位(bbox 接地)统一进一个开源 VLM,在多类临床任务上超过现有开源医学 MLLM。

fMRI-LM: Towards a Universal Foundation Model for Language-Aligned fMRI Understanding

fMRI-LM 用一套"先把脑信号离散成与文本嵌入空间对齐的 token、再让预训练 LLM 把脑活动当作可预测可描述的'语言'来建模"的三阶段框架,配上一套人工合成的 fMRI→文本描述语料补齐天然配对的缺失,在 7 个数据集上实现了用单一模型零样本/少样本完成性别、年龄、流体智力、AD/ADHD/ASD 诊断等多种任务,且 LoRA 微调即可达到甚至超过全量微调的效果。

OralGPT-Omni: A Versatile Dental Multimodal Large Language Model

OralGPT-Omni 是首个牙科专用多模态大模型,通过构建模仿放射科医生诊断流程的 TRACE-CoT 思维链数据 + 四阶段渐进训练,在覆盖五模态五任务的统一基准 MMOral-Uni 上拿到 51.84 分,远超 GPT-5 的 15.42。

MedTVT-R1: A Multimodal LLM Empowering Medical Reasoning and Diagnosis

MedTVT-R1 把同一病人的心电图(时序)、胸片(图像)和化验单(表格)三种异构数据统一喂进一个 MLLM,靠"模态感知层 + 证据链指令数据 + GRPO 强化微调"实现可解释的多病共诊,在临床效价(F1、AUC)和长文本诊断生成上同时超过通用与医疗专用 MLLM。

OctoMed: Data Recipes for State-of-the-Art Multimodal Medical Reasoning

不靠新架构、不靠更大的 backbone,而是系统研究"训练数据怎么配"——用强教师蒸馏 + 拒绝采样筛出 800 万条带结构化推理链的医学样本(68 亿 token),把一个 7B 学生模型(Qwen2.5-VL-7B)微调成 OctoMed,在多个分布外医学基准上取得开源 SOTA,且模型能在没有显式监督的情况下自适应调整推理链长度。

查看全部173篇「医学图像」论文 →


🩺 医疗 LLM (1)

Towards Efficient Medical Reasoning with Minimal Fine-Tuning Data

提出 Difficulty-Influence Quadrant (DIQ) 数据选择策略,联合考量样本难度和梯度影响力,使 VLM 语言骨干仅用 1% 精选数据即可匹配全量 SFT 性能,10% 数据则可超越全量训练。


🧬 计算生物 (21)

Stronger Normalization-Free Transformers

通过系统分析逐点函数替代归一化层所需的四个关键属性(零中心性、有界性、中心敏感性、单调性),在大规模搜索中发现 \(\text{Derf}(x) = \text{erf}(\alpha x + s)\) 是最优的归一化层替代函数,在视觉识别、图像生成、语音表示和DNA序列建模等多个领域持续超越LayerNorm和DyT,且性能增益主要来自更强的泛化而非拟合能力。

CARE: A Molecular-Guided Foundation Model with Adaptive Region Modeling for Whole Slide Image Analysis

提出 CARE,一种病理学 slide-level 基础模型,通过自适应区域生成器(ARG)将 WSI 划分为形态学相关的不规则区域(类似 NLP 中的词级 token),并结合 RNA/蛋白质表达谱的跨模态对齐进行两阶段预训练,仅用主流模型约 1/10 的数据即在 33 个下游任务上取得最优平均性能。

Multimodal Protein Language Models for Enzyme Kinetic Parameters: From Substrate Recognition to Conformational Adaptation

提出ERBA(Enzyme-Reaction Bridging Adapter),将酶动力学参数预测重新建模为分阶段多模态条件生成问题——先通过MRCA注入底物信息捕获底物识别特异性,再通过G-MoE整合活性位点3D结构捕获构象适应,配合ESDA分布对齐保持PLM语义先验。

FEAST: Fully Connected Expressive Attention for Spatial Transcriptomics

FEAST 把"从 H&E 病理大图预测空间基因表达"这件事从依赖预定义稀疏图的 GNN 范式,改造成一个全连接注意力框架——用自注意力天然建模所有 spot 两两交互,再补上能表达"抑制关系"的负向注意力和补全栅格空隙信息的 off-grid 采样,在三个公开 ST 数据集上 9 个指标里拿下 7 个 SOTA。

From Spots to Pixels: Dense Spatial Gene Expression Prediction from Histology Images

本文把"从病理切片预测空间基因表达"从逐 spot 回归任务改写成稠密预测任务,提出 PixNet:先用病理基础模型抽金字塔特征,再 U-Net 式逐层解码出一张全图的稠密基因表达图,最后对任意位置/任意半径的 spot 做圆形区域聚合得到表达值,从而在多个空间尺度(2µm 单细胞级到 100µm)上都超过现有 SOTA。

HINGE: Adapting a Pre-trained Single-Cell Foundation Model to Spatial Gene Expression Generation from Histology Images

提出HINGE框架,首次将预训练的表达空间单细胞基础模型(sc-FM, CellFM)改装为组织学图像条件的空间基因表达生成器,通过恒等初始化的SoftAdaLN调制轻量注入视觉上下文、表达空间掩码扩散过程对齐预训练目标、warm-start课程稳定训练,在三个ST数据集上达SOTA并保持优越的基因共表达一致性。

Hyperbolic Busemann Neural Networks

利用 Busemann 函数将多类逻辑回归(MLR)和全连接层(FC)内蕴地提升到双曲空间,提出 BMLR 和 BFC 两个统一组件,在 Poincaré 球和 Lorentz 模型上同时适用,且在图像分类、基因组序列、节点分类、链接预测四类任务上均优于已有双曲层。

TRIDENT: A Trimodal Cascade Generative Framework for Drug and RNA-Conditioned Cellular Morphology Synthesis

TRIDENT 用「VAE 编码(药物+扰动前 RNA)→ 潜在条件 z → Diffusion Transformer 生成细胞形态」的级联框架,首次显式建模「RNA→形态」这条因果链,在自建的 MorphoGene 三模态数据集上把 FID 相比 SOTA 降低 5–7 倍,并能泛化到未见过的化合物。

Advancing Cancer Prognosis with Hierarchical Fusion of Genomic, Proteomic and Pathology Imaging Data from a Systems Biology Perspective

HFGPI 把"基因 → 蛋白质 → 组织形态"的系统生物学级联显式建模成一条分层融合管线,用图感知交叉注意力刻画基因对蛋白的调控、用超图把蛋白连到病理 patch,在 5 个 TCGA 队列上把生存预测的平均 C-index 推到 0.753,超过所有 SOTA。

Cell-Type Prototype-Informed Neural Network for Gene Expression Estimation from Pathology Images

提出 CPNN,利用公开单细胞 RNA-seq 数据构建细胞类型原型(cell-type prototype),将 slide/patch 级基因表达建模为原型的加权组合,在基因表达估计任务上取得 SOTA 并提供可解释性。

查看全部21篇「计算生物」论文 →


⚛️ 物理/科学计算 (2)

AviaSafe: A Physics-Informed Data-Driven Model for Aviation Safety-Critical Cloud Forecasts

AviaSafe 把"先用掩码定位云在哪、再回归云有多浓"的层级化思路和航空气象里验证多年的"结冰条件指数(IC)"嵌进一个 Swin Transformer 预报骨干里,第一次实现了全球、逐 6 小时、可分相态(冰/液/雨/雪)的云微物理量预报,在 93.7% 的变量-时效组合上优于 FuXi 基线,并在 7 天时效的关键背景变量上追平甚至超过业务级数值预报 ECMWF HRES。

Spatial-Spectral Residuals Informed Diffusion Neural Operator for Pan-sharpening

SRINO 把全色锐化的扩散去噪骨干从注意力换成 Galerkin 型神经算子(把生成过程搬到连续函数空间、显著省 FLOPs 和显存),再在每一步反向采样里直接把像素级的空间/光谱一致性残差当条件喂进去做闭环引导,在 WV3/GF2/QB 三个数据集上既超过现有 SOTA 又比注意力扩散省好几倍算力。


🧮 科学计算 (3)

NESTOR: A Nested MOE-based Neural Operator for Large-Scale PDE Pre-Training

提出嵌套式 MoE 神经算子 NESTOR,通过 image-level MoE 捕获不同 PDE 类型的全局特征 + token-level Sub-MoE 捕获物理场内局部相关性,在 12 个 PDE 数据集上实现大规模预训练并有效迁移到下游任务。

Continuous Exposure-Time Modeling for Realistic Atmospheric Turbulence Synthesis

提出曝光时间依赖的调制传递函数(ET-MTF),将曝光时间建模为连续变量,构建了大规模合成湍流数据集 ET-Turb(5083视频、200万帧),显著提升湍流复原模型在真实数据上的泛化能力。

EHETM: High-Quality and Efficient Turbulence Mitigation with Events

提出EHETM,首次利用事件相机的微秒时间分辨率突破传统多帧湍流缓解(TM)方法的精度-效率瓶颈,发现两个关键物理现象——湍流诱导事件的极性交替与清晰梯度相关、动态物体形成时空相干"事件管"——设计极性加权梯度和事件管约束两个互补模块,数据开销降低77.3%、系统延迟降低89.5%,尤其在动态物体场景显著超越SOTA。


🌍 地球科学 (2)

SIGMA: A Physics-Based Benchmark for Gas Chimney Understanding in Seismic Images

本文提出首个带真值标注的物理合成地震图像数据集 SIGMA——用波动方程正演+逆时偏移把含气烟囱的速度模型转成地震图像,同时给出像素级气烟囱掩码(用于检测)和"退化—干净"配对图(用于增强),并在两类任务上 benchmark 多个基线,揭示现有方法在该数据上集体吃力。

PhyOceanCast: Global Ocean Forecasting with Physics-Informed Diffusion

PhyOceanCast 把全球海洋预报建模成一个残差扩散问题,用球面图注意力网络(SGAN-MOC)解决"高纬投影畸变 + 变量耦合"、用物理小波时序模块(PWTC)解决"多尺度动力学 + 守恒约束",一次预报 145 个海洋变量、36 个深度层,30 天预报 RMSE 相对最优 baseline 降低约 13.7%。


📡 信号/通信 (2)

CLAY: Conditional Visual Similarity Modulation in Vision-Language Embedding Space

CLAY 提出免训练的条件视觉相似度计算方法,通过在 VLM 嵌入空间中构建文本条件子空间来调制相似度,无需重新计算数据库特征即可适应不同检索条件,并支持多条件检索。

AcTTA: Rethinking Test-Time Adaptation via Dynamic Activation

本文提出 AcTTA,一种基于动态激活函数调制的测试时自适应框架,通过将传统固定激活函数重参数化为可学习形式(包含激活中心偏移和非对称梯度斜率),在推理时自适应调整激活行为以应对分布偏移,在 CIFAR10-C/CIFAR100-C/ImageNet-C 上一致超越基于归一化层的 TTA 方法。


👥 社会计算 (3)

Instance-level Visual Active Tracking with Occlusion-Aware Planning

OA-VAT 用一张参考图离线构建判别性"实例原型"来对抗相似干扰物,在线 EMA 增强原型 + 置信度自适应卡尔曼滤波保持稳定跟踪,并训练一个以目标框为条件的扩散轨迹规划器在目标被遮挡时主动绕障找回——在 UnrealCV 上平均 SR 0.93、真实图像平均 CAR 90.8%、真机无人机 TSR 81.6%,且 RTX 3090 上 35 FPS 实时。

Bridging Pixels and Words: Mask-Aware Local Semantic Fusion for Multimodal Media Verification

提出 MaLSF 框架,利用掩码-标签对作为语义锚点,通过双向跨模态验证(BCV)和层级语义聚合(HSA)模块实现主动式局部语义冲突检测,在 DGM4 和假新闻检测任务上取得 SOTA。

Revisiting Unknowns: Towards Effective and Efficient Open-Set Active Learning

提出 E2OAL,一个无需额外检测器的开放集主动学习框架,通过标签引导聚类发现未知类潜在结构、Dirichlet 校准辅助头联合建模已知/未知类别,并设计两阶段自适应查询策略,在多个基准上同时实现高准确率、高查询纯度和高训练效率。


🛡️ AI 安全 (145)

Skyra: AI-Generated Video Detection via Grounded Artifact Reasoning

Skyra 把"AI 生成视频检测"从黑盒二分类改造成可解释的伪影推理任务:先用人工精标的 ViF-CoT-4K 数据集做冷启动 SFT,让 MLLM 学会在时空上定位伪影并给出 grounded 解释,再用带非对称奖励的 GRPO 强化学习激发模型主动找伪影,最终在自建 ViF-Bench 上比次优方法绝对准确率高 26.73%。

Scaling Up AI-Generated Image Detection with Generator-Aware Prototypes

作者发现"用越多生成器训练 AIGI 检测器、效果反而先升后降"(Benefit then Conflict)这一悖论,归因于生成图像特征过度异质 + 冻结编码器的能力瓶颈,提出 GAPL——先用 PCA 把上千个生成器蒸馏成一小撮"生成器感知原型",再用交叉注意力把任意图像特征重组到这个低方差原型空间,配合两阶段 LoRA 微调,在 6 个基准上平均准确率 90.4%、超过此前 SOTA 3.5%。

When Robots Obey the Patch: Universal Transferable Patch Attacks on Vision-Language-Action Models

提出 UPA-RFAS 框架,学习一个单一物理对抗补丁,通过特征空间偏移、注意力劫持和语义错位三管齐下,实现对 VLA 机器人策略的通用、可迁移黑盒攻击。

The Coherence Trap: When MLLM-Crafted Narratives Exploit Manipulated Visual Contexts

揭示现有多模态篡改检测忽视了MLLM能生成语义一致的欺骗性叙事这一核心威胁,构建441k样本的MDSM语义对齐篡改数据集,并提出基于Artifact Token和操纵导向推理的AMD框架,在跨域检测中以仅0.27B参数达到88.18 ACC / 60.25 mAP / 61.02 mIoU的最优泛化性能。

UniGame: Turning a Unified Multimodal Model Into Its Own Adversary

UniGame 提出首个针对统一多模态模型(UMM)的自对抗后训练框架,通过在共享视觉 token 接口安装轻量扰动器,让生成分支主动创造语义一致的对抗样本来挑战理解分支,形成极小极大自博弈,显著提升一致性 (+4.6%)、理解 (+3.6%)、生成和鲁棒性。

RemedyGS: Defend 3D Gaussian Splatting Against Computation Cost Attacks

RemedyGS 提出首个针对 3DGS"计算开销攻击"(Poison-splat 这类通过毒化输入图像触发高斯爆炸、耗尽 GPU 资源造成拒绝服务的攻击)的黑盒防御框架,用"检测器+净化器+对抗训练"两阶段流水线,只对被判定为中毒的图做净化,从而把计算开销拉回正常水平的同时几乎不损伤正常用户的重建质量。

V-Attack: Targeting Disentangled Value Features for Controllable Adversarial Attacks on LVLMs

发现 ViT 中 Value 特征相比 Patch 特征具有更解耦的局部语义表示,提出 V-Attack 通过自增强 Value 特征 + 文本引导语义操控实现精确可控的 LVLM 局部语义攻击,ASR 平均提升 36%。

RunawayEvil: Jailbreaking the Image-to-Video Generative Models

本文提出 RunawayEvil——首个针对「图生视频(I2V)」模型的多模态越狱攻击框架,用「策略-战术-行动」范式让攻击在文本与图像两个模态上协同、并通过强化学习+LLM 自我进化,在 COCO2017 上把攻击成功率比现有方法提升 58.5%–79%。

LaSM: Layer-wise Scaling Mechanism for Defending Pop-up Attack on GUI Agents

通过系统分析弹窗注入攻击如何扭曲 GUI Agent 的逐层注意力,作者发现深层注意力在"答对/答错"样本间会出现分歧,进而提出 LaSM——一种免训练、即插即用的逐层缩放机制,只放大中层语义层的注意力与 MLP 权重,把弹窗攻击下 Qwen2-VL-7B 的防御成功率从约 19% 提到 66% 以上,且几乎不损害正常任务能力。

POUR: A Provably Optimal Method for Unlearning Representations via Neural Collapse

针对现有机器遗忘只改分类头、特征里仍残留被遗忘类信息的问题,本文把"遗忘"提升到表征层面,借助 Neural Collapse 的 simplex-ETF 几何证明"去掉一个类 = 沿其方向做正交投影后 ETF 依然是 ETF",由此给出闭式投影算子 POUR-P 和蒸馏变体 POUR-D,在 CIFAR-10/100、PathMNIST 上同时刷新分类级和表征级遗忘指标,并形式化证明其在表征级弱遗忘定义下是最优的。

查看全部145篇「AI 安全」论文 →


📂 其他 (105)

UniMERNet: A Universal Network for Real-World Mathematical Expression Recognition

UniMERNet 把公式图像转 LaTeX 这件事重新做了一遍:它构造了百万级、覆盖四类真实场景的 UniMER-1M 数据集,并基于「解码器注意力天然呈光栅扫描(先横后纵)」这一观察,提出 Raster-Scan Attention 把二维注意力拆成水平、垂直两次一维计算,把复杂度从 \(O(NH^2W^2D)\) 降到 \(O(NHWD(H+W))\),在 313M 参数下推理省 ~10× 显存、快 5×,同时四个真实场景的 CDM 全面超过 Texify、GOT 乃至 72B/78B 的多模态大模型。

FlashVSR: Towards Real-time Diffusion-Based Streaming Video Super Resolution

FlashVSR 把基于扩散的视频超分(VSR)做成第一个「一步 + 流式」框架:用三阶段蒸馏把全注意力教师压成单步块稀疏因果学生、用局部约束稀疏注意力消除训练/推理分辨率鸿沟、再加一个吃 LR 帧做条件的微型解码器替掉占 70% 耗时的 VAE 解码,在单张 A100 上做到 768×1408 视频约 17 FPS、比最快的一步扩散 VSR 还快 11.8×,且能稳定泛化到 1440p。

PAI-Bench: A Comprehensive Benchmark For Physical AI

PAI-Bench 把"物理 AI"拆成感知和预测两条能力线、再落到视频生成 / 条件视频生成 / 视频理解三个赛道,用 2,808 个真实世界样例配上任务对齐的物理合理性指标,系统评测了 15 个视频生成模型、4 个可控生成模型和 16 个多模态大模型,发现它们画面好看却普遍学不会物理规律、理解能力也远落后于人类。

Upsample Anything: A Simple and Hard to Beat Baseline for Feature Upsampling

Upsample Anything 把经典联合双边上采样(JBU)和 2D 高斯泼溅统一成一个逐像素各向异性高斯核,靠每张图各跑 50 步「RGB 自重建」的测试时优化学出这套核,再把核原封不动搬到基础模型的低分辨率特征上做纯混合上采样——不需要任何数据集级训练、224×224 图只要约 0.419 秒,却在分割、深度、深度图/概率图上采样上全面达到或逼近 SOTA。

VideoWorld 2: Learning Transferable Knowledge from Real-world Videos

VideoWorld 2 提出"动态增强潜在动态模型 (dLDM)",用预训练视频扩散模型 (VDM) 接管外观重建、把潜码逼着只编码与任务相关的动作动态,从而第一次从原始真实世界视频里学到可迁移、可执行的长程任务知识,在分钟级手工折纸任务上 7 步连续成功率从 baseline 的 0% 提升到 68.8%,并能把 Open-X 上学到的操作知识迁移到 CALVIN。

ViT3: Unlocking Test-Time Training in Vision

系统性探索Test-Time Training(TTT)在视觉任务中的设计空间,总结六条实用设计洞察,提出ViT3——一个线性复杂度的纯TTT视觉架构,在分类/生成/检测/分割任务中匹配或超越Mamba和线性注意力方法。

SimRecon: SimReady Compositional Scene Reconstruction from Real Videos

提出 SimRecon 框架,通过"感知→生成→仿真"三阶段流水线,从真实视频自动构建仿真就绪的组合式 3D 场景,核心创新在于主动视角优化(AVO)为单物体生成寻找最优投影视角和场景图合成器(SGS)引导物理可信的层级化组装。

The SA-FARI Dataset: Segment Anything in Footage of Animals for Recognition and Identification

SA-FARI 是迄今最大的野外多动物跟踪(MAT)数据集——汇集横跨 4 大洲、741 个站点、99 个物种、长达 10 年的 11,609 段相机陷阱视频,并首次提供大规模人工核验的时空分割 masklet(16,224 条个体轨迹、94 万个框/掩码),实验证明用它训练能让 SAM 3 在 HOTA 类指标上提升 20 点以上。

A2GC: Asymmetric Aggregation with Geometric Constraints for Locally Aggregated Descriptors

针对视觉地点识别(VPR)中"特征聚合靠对称 Sinkhorn"这一假设的失效,A2GC 把最优传输求解器改成非对称(行列归一化平均 + 源/目标边缘分别校准),再叠加一个几何约束分支(用可学习坐标嵌入让空间相邻的特征更倾向分到同一簇),在 Pitts30k 上把 Recall@1 推到 95.6%。

Customized Fusion: A Closed-Loop Dynamic Network for Adaptive Multi-Task-Aware Infrared-Visible Image Fusion

提出闭环动态网络 CLDyN,让一个冻结的融合网络在不重训的前提下,通过一个仅 0.46M 参数的"需求驱动语义补偿(RSC)"模块接收下游任务(检测/分割/显著性)反馈的语义特征、动态定制卷积结构来做任务专属补偿,从而用一套模块同时适配多个任务,在 M3FD/FMB/VT5000 上既保住融合质量又取得领先的多任务适应性。

查看全部105篇「其他」论文 →