🎞️ ECCV2026 论文汇总¶
2907篇ECCV2026论文解读,涵盖 3D 视觉(519篇)、图像生成(337篇)、多模态 VLM(238篇)、视频生成(172篇)、VLM Reasoning(171篇)、自动驾驶(160篇)、机器人/具身智能(129篇)、人体理解(120篇)等 45个方向。每篇含一句话总结、核心思想、方法详解、实验结果与局限性分析,5分钟读懂一篇论文核心思想。
🦾 LLM Agent (36)¶
- MolmoWeb: Open Visual Web Agent and Open Data for the Open Web
-
MolmoWeb 将结构化网页教师产生的轨迹、人工示范与 GUI 感知监督统一为截图条件下的动作学习,使 8B 视觉网页智能体在 WebVoyager 上达到 78.2% 的单次成功率,并通过并行尝试达到 94.7% 的 pass@4;主要贡献是可复现的数据与训练配方,而非新规划架构。
- QuantV2X: A Fully Quantized Multi-Agent System for Cooperative Perception
-
QuantV2X 提出首个全量化多智能体 V2X 协作感知系统,通过端到端量化神经网络模型和通信消息表征,在 INT4/INT8 低比特下保持全精度模型 99.8% 的感知精度,同时将系统端到端延迟降低 3.2 倍,在 V2X-Real 数据集上 mAP30 反超全精度基线 +9.5。
- GUI-AIMA: Aligning Intrinsic Multimodal Attention with a Context Anchor for GUI Grounding
-
GUI-AIMA 用末尾锚点词元、按指令自适应的注意力头加权和图块监督,将多模态模型已有的注意力转化为 GUI 点击定位器,3B 模型用 509k 条指令训练后在 ScreenSpot-Pro 上达到单步 53.8%、裁剪放大两步 61.5% 的准确率。
- PPTArena: A Benchmark for PowerPoint Editing
-
PPTArena 将真实演示文稿的原位编辑变成同时检查结构正确性和视觉质量的基准,并以混合代码/OOXML 执行及反思校验的 PPTPilot 获得全量 IF/VQ 2.57/2.69,但距离可靠完成复杂编辑仍有明显差距。
- A Benchmark and Multi-Agent System for Instruction-driven Cinematic Video Compilation
-
论文提出影视指令混剪基准 CineBench,以及先理解原片、再规划并执行剪辑的免训练系统 CineAgents,在该基准上取得 64.13 的镜头级 F1、52.09% 的时序正确率和 87.23% 的不可能指令拒绝率。
- Automatic Method Illustration Generation for AI Scientific Papers via Drawing Middleware Creation, Evolution, and Orchestration
-
FigAgent 把论文方法图中的常用视觉组件变成可调用、可进化的绘图函数,再由多智能体通过前瞻搜索组合成可编辑 SVG,在 FigAgentBench 上将节点对齐 F1 从 PaperBanana 的 46.3 提高到 51.4。
- Narrative-Driven Paper-to-Slide Generation via ArcDeck
-
ArcDeck 先用篇章关系树保留论证依赖,再以全局承诺约束多智能体修订大纲,最后生成可编辑幻灯片;在 ArcBench 上,GPT-4o 生成、GPT-5 评审时的叙事流评分为 43.25,高于 SlideGen 的 30.75,但尚未达到作者制作幻灯片的整体质量。
- GUIDE: Resolving Domain Bias in GUI Agents through Real-Time Web Video Retrieval and Plug-and-Play Annotation
-
GUIDE 是一个免训练、即插即用的框架,通过从 YouTube 教程视频中自动检索并提取领域专用的规划知识(Planning)和定位知识(Grounding),注入 GUI Agent 的对应模块来消除领域偏置(domain bias),在 OSWorld 上为三种不同架构的 agent 带来 +4.47 到 +7.48 个百分点的提升。
- Exploratory, Communicative, and Deployable: Vision-Driven Embodied Agents for Open-World Mobile Manipulation
-
REAL 让 Qwen3-VL-8B 在不读取特权物体状态的工具接口中学习“先探索、必要时询问、再操作”,经 SFT 和在线 GSPO 后在 REAL-Bench 的交互子集达到 56.9% 成功率,并将高层策略零样本迁移到真机,在 60 次任务中达到 78.3%。
- HippoCamp: Benchmarking Contextual Agents on Personal Computers
-
HippoCamp 将个人电脑中的异构文件组织为三个隔离的用户原型环境,用 581 个有文件证据的问题同时评测事实保留与用户画像;最强受测系统的画像回答正确率仅为 48.3%,说明找到相关文件距离可靠理解用户仍有明显差距。
⚖️ 对齐 / RLHF (6)¶
- Omni-RRM: Advancing Omni Reward Modeling via Automatic Rubric-Grounded Preference Synthesis
-
Omni-RRM 先用双教师共识合成带五维评分准则解释的偏好数据,再以 SFT→GRPO 学习跨图像、视频和音频的成对回答判别,使 7B 奖励模型的五基准平均准确率由骨干的 60.2% 提升到 70.4%,并能在不更新生成器参数的情况下改善候选回答选择。
- Don't Let the Video Speak: Audio-Contrastive Preference Optimization for Audio-visual Language Models
-
针对音视频语言模型(AVLM)"看着画面编声音"的跨模态幻觉,本文提出 ACPO:沿输出与输入两条正交轴构造偏好对——用音轨被替换的输入惩罚"用视觉字幕回答听觉问题",并要求同一句回答在音轨被换掉后必须变得不再可信——只微调音频投影层,就把 AVHBench 音频幻觉 F1 从 79.0 提到 80.4、单模态音频字幕 CIDEr 从 33.0 提到 43.6。
- D2PO: Optimizing Diffusion Samplers via Dynamic Preference
-
将扩散采样器参数优化从传统的固定教师回归范式重塑为直接偏好对齐问题,通过能量代理模型、预训练分数多尺度能量度量与动态自进阶教师机制,在极低采样步数下显著提升生成图像的感知质量与高频纹理。
- HumanTracker: Towards Comprehensive and Human-Aligned Motion Tracking Benchmark
-
针对传统运动学指标与人类视觉感知严重脱节以及现有测试集规模小、缺乏接触挑战的问题,HumanTracker 构建了涵盖 150 小时、2.4 万段精细分类的光学动捕基准,并提出了基于 1.2 万对人类偏好数据训练的时序 Transformer 奖励模型 HumanScore,实现了高达 92.91% 的人类偏好预测对齐率。
- Reward Modeling for Computer-Using Agent from Video Execution
-
针对计算机使用智能体(CUA)轨迹评估严重依赖手工规则或特定中间动作格式的问题,本文提出了基于无偏界面执行视频的奖励模型 ExeVRM,通过构建 53k 规模数据集 ExeVR-53k、对抗指令翻译合成负样本,以及无损关键微小 UI 变化的时空 Token 剪枝算法(STP+TTP),实现了在 720p 长程视频下超越 GPT-5.2 与 Gemini-3 Pro 的任务完成判定与精准首错时间归因。
- VERTIGO: Visual Preference Optimization for Cinematic Camera Generation
-
首个将视觉偏好优化引入相机轨迹生成的后训练框架 VERTIGO,利用实时图形引擎(Unity)将 3D 相机路径渲染为 2D 预览帧,通过经过电影语料微调的 VLM 进行逆向描述与嵌入相似度打分,并借助 DPO 对齐镜头语言意图与构图质量,将拍摄目标脱幅率从 38.7% 骤降至 0.8%。
🔒 LLM 安全 (20)¶
- BBQ-V: Benchmarking Visual Stereotype Bias in Large Multimodal Models
-
BBQ-V 用真实多人图像和信息不足的开放式问题评测多模态模型是否作出缺乏依据的群体归因;其 4,497 张图像组成 14,144 个图像—问题对,图像输入消融表明“看得更多”不等于判断更审慎。
- DualTAP: A Dual-Task Adversarial Protector for Mobile MLLM Agents
-
DualTAP 在手机截图上传前施加面向任务的对抗扰动,用对比注意力定位隐私敏感区域、用双任务目标保留正常操作能力,在 PrivScreen 上将 GPT-5 的泄露率从 97.14% 降至 23.33%,同时将任务准确率维持在 91.00%。
- Towards Benign Memory Forgetting for Selective Multimodal Large Language Model Unlearning
-
提出"良性记忆遗忘"新范式与 S-MLLMUn Bench 评测基准,并设计 SMFA(Sculpted Memory Forgetting Adapter)框架,通过保留锚点引导的参数掩码精确抹除 MLLM 中的隐私敏感知识,同时不损伤模型的基础视觉理解能力。
- Attention Misses Visual Risk: Risk-Adaptive Steering for Multimodal Safety Alignment
-
MoRAS 用简短图像描述改善多模态风险识别,再依据风险分数对原始请求的早期响应激活施加拒绝引导,在 LLaVA-1.5-7B 上将 MM-Safety 的攻击成功率从 40.1% 降至 2.6%,同时保持表中通用任务总分。
- SlowBA: An efficiency backdoor attack towards VLM-based GUI agents
-
SlowBA 首次提出针对 VLM-based GUI agent 的效率后门攻击:通过两阶段奖励级后门注入(RBI),在 SFT 中教会 agent 生成超长回复、再在 RL 中用触发感知的奖励函数区分带触发器/干净输入,使 agent 在遇到弹窗类触发器时产生极高延迟响应,而任务准确率基本不变。
- Rethinking Visual Privacy: A Compositional Privacy Risk Framework for Severity Assessment with VLMs
-
本文把视觉隐私从「图像是否私密」的二分类改成组合式分级风险估计:提出按独立可识别性与组合危害潜力分层的四级 CPRT 分类体系、一个满足字典序占优的连续严重度评分函数,以及一个 6.7K 图像 / 22 属性的标注数据集;在 8 个开放与前沿 VLM 上的评测显示,前沿模型在给定 taxonomy 时能较好对齐组合式严重度(Gemini 3 Flash ρ=0.872),却系统性地低估由聚合产生的中间风险,而一个 8B LoRA 微调模型能把这一能力蒸馏到可端侧部署的规模。
- Safe Responses Matter: Output-Aware Safety Guardrail Mitigate Over-Refusal in MLLMs
-
OutGuard 不再因输入敏感就直接拦截,而是用实际回答的安全标签训练隐藏状态分类器,通过多实例对比学习和跨层投票识别真正有害的输出,在同分布测试中把两种 MLLM 的 ARSP 降至 0.0749 和 0.0634,但仍存在漏检、分布外退化与较高的困难良性查询误拒率。
- GEO-Detective: Unveiling Location Privacy Risks in Images with LLM Agents
-
本文提出模拟人类推理与工具调用行为的图像地理位置推断智能体 GEO-Detective,通过自适应难度评估、经验增强提示词、特征分割以及视觉反向搜索,系统揭示了多模态大模型智能体在图像地理位置隐私推断上的严重泄露风险。
- Learning to Compose: Revisiting Proxy Task Design for Zero-Shot Composed Image Retrieval
-
FoCo(Focus-then-Complete)将零样本组合图像检索(ZS-CIR)中的视觉-文本组合建模为可学习的"先聚焦后补全"两阶段过程,通过文本锚定的视觉聚合和上下文条件化的语义补全两个代理任务联合训练,配合跨实例对比损失防止捷径学习,在四个 ZS-CIR 基准上全面超越已有方法,且推理时不依赖 LLM。
- Neural Gate: Mitigating Privacy Risks in LVLMs via Neuron-Level Gradient Gating
-
本文提出 Neural Gate,一种神经元级梯度门控的 LVLM 隐私风险缓解方法。核心思路是先通过可学习向量在隐私主体特征上测量各神经元对隐私目标的贡献一致性,将神经元分为强激活、弱激活、非激活三类,再在模型编辑时仅对强激活隐私神经元的梯度做参数更新,其余神经元梯度被截断。在 MiniGPT 和 LLaVA 上,Neural Gate 在敏感查询拒绝率超过 94% 的同时几乎不损失通用任务性能,且在分布外隐私类别上展现出强泛化能力。
👻 幻觉检测 (20)¶
- Anatomy of a Lie: A Multi-Stage Diagnostic Framework for Tracing Hallucinations in Vision-Language Models
-
CAD 将视觉语言模型的“证据生成—最终回答”压缩为三个可解释的信息指标,再用正常样本的高斯混合密度识别异常轨迹,在 POPE 对抗子集上取得平均 0.858 的检测 AUC,同时区分感知不稳定、证据依赖异常与决策不确定性。
- HIVE: Understanding Post Hallucination Reasoning in Vision Language Models
-
HIVE 把忠实描述与幻觉描述作为配对输入,研究视觉语言模型在幻觉进入上下文之后如何继续推理,发现部分视觉任务准确率明显提高,但这种收益既不普遍,也不意味着虚构证据值得信任。
- Looking Back and Forth: Cross-Image Attention Calibration and Attentive Preference Learning for Multi-Image Hallucination Mitigation
-
本文把多图幻觉归因于自回归因果注意力造成的单向跨图信息流,提出 CAPL:在注意层面用「只让关键 token 跨图双向可见」的选择性跨图注意力做校准,再用「完整跨图交互 vs 屏蔽跨图」两种掩码分别生成正负样本做 DPO 加 NLL 的偏好学习,在 BLINK/MUIRBench 上稳定提升 1–3.6 个点且不损伤单图能力。
- No Place to Hide: Benchmarking Video Hallucination with Background-Controlled Pairs
-
本文提出 VidPair-Halluc 视频幻觉 benchmark,用「背景高度相似、前景语义显著不同」的对抗视频对,把模型出错的原因从背景变化里剥离出来、干净地归因到前景幻觉;配套的 PairFlow 三阶段生成流水线借助 T2I / 视频生成模型自动造出 1K 高质量视频对与 11K 时空 QA,评测显示主流大视频模型在这种受控设置下普遍大幅掉点。
- Seeing to Ground: Visual Attention for Hallucination-Resilient MDLLMs
-
这篇论文把多模态扩散语言模型(MDLLM)的幻觉归因于并行掩码解码的「目标失配」——解码器只按文本似然给候选 token 排序、从不核验局部视觉支撑,据此提出免训练的解码期重排框架 VISAGE:用最后一层跨注意力在图像 token 上的空间熵估计「落地证据」,经 β-分位跨头共识聚合成惩罚乘子,把排序分数从置信度 \(c_i\) 换成 \(c_i(1+H_i)^{-\alpha}\),在 MMMU-val 上相对基线提升 8.59%、HallusionBench 提升 7.75%,同时几乎不损伤通用能力。
- TARS: MinMax Token-Adaptive Preference Strategy for Hallucination Reduction in MLLMs
-
TARS 在训练时扰动与图像关联较弱的提示词 token,并联合 DPO 与频谱偏好对齐,使 LLaVA-v1.5-7B 仅用 4.8k 偏好样本就将 AMBER 幻觉率由标准 DPO 的 26.4% 降至 13.2%,同时提高描述覆盖率。
- Context Blindness in DPO: Mitigating Object Hallucination in MLLMs via Context-Calibrated Preference Optimization
-
揭示了现有直接偏好优化(DPO)在多模态大模型对齐中存在的“上下文盲区”现象,提出上下文校准直接偏好优化(C2-DPO),通过显式最大化上下文偏好增益并锚定退化输入排序,显著削减目标幻觉且不损通用推理。
- Disentangling Hallucinations: Orthogonal Semantic Projection for Robust Interpretability
-
揭示了多模态可解释性归因方法普遍存在“解释幻觉”的根源是高维嵌入空间中的线性语义泄漏,并提出基于正交匹配追踪的即插即用几何干预方法 OSP,通过对文本嵌入做正交语义投影消除伪影信号。
- Do Not Leave a Gap: Hallucination-Free Object Concealment in Vision-Language Models
-
针对传统物体隐藏攻击通过暴力抑制视觉特征而诱发 VLM 脑补幻觉的缺陷,本文提出保持背景连续性重编码(BCR),通过在视觉编码器深层对目标区域实施统计对齐与背景字典流形投影,在抹除目标物体语义的同时消除表征空洞,实现近乎无幻觉的高保真物体隐藏。
- From Hallucination to Grounding: Diagnosing Visual Spatial Intelligence via CRISP
-
CRISP 是一个结构诊断式视觉空间智能评测基准,通过 Spatial QA + 3D Scene Graph 双任务范式与跨任务一致性协议,揭示 VLM 的空间推理究竟是真正的 3D 几何理解还是依靠语言先验的语义捷径。
📊 LLM 评测 (3)¶
- SVGEval: A Vision-Grounded Framework for Perceptual-Quality Benchmarking and Evaluation in Text-to-SVG Generation
-
SVGEval 把 text-to-SVG 的评测对象从「SVG 代码」改成「人真正看到的渲染结果」,用涵盖美学、语义、空间布局、几何结构四个维度的评分协议构建了 500 例二值诊断 + 500 例 1–5 打分的双任务基准(标注经多轮人工标注与专家裁决),并据此蒸馏训练出一个「看渲染图 + 读代码」、同时输出分维度分数与证据化理由的可解释评分器,MAE 从最强通用模型的 0.71 降到 0.58、±1 邻域准确率从 66.6% 提到 72.0%。
- ExpertEdit: Learning Skill-Aware Motion Editing from Expert Videos
-
针对运动技能提升缺少成对新手-专家数据与推理时细粒度指令的痛点,ExpertEdit 提出仅利用非成对专家演示视频学习技能流形,并在推理时通过运动学峰值掩码与双向动作补全(contextual motion infilling)实现端到端技能自适应动作编辑。
- LASER: A Corrective Lens for LVLMs via Visual Attention Preservation and Sink Suppression
-
针对多模态大模型长程思维链推理中的视觉遗忘与注意力汇元坍缩问题,LASER 通过在强化学习后训练中联合引入视觉基础保持奖励与汇元抑制奖励,从时间和空间分布双维度纠正视觉注意力偏离,大幅提升多模态推理与感知鲁棒性。
📚 预训练 (15)¶
- 360Anything: Geometry-Free Lifting of Images and Videos to 360°
-
360Anything 提出一种几何无关(geometry-free)的扩散Transformer框架,将透视输入和全景目标统一视为 token 序列、通过序列拼接让模型自行学习二者间的几何对应,无需任何相机元数据即可将任意视角图像/视频提升为重力对齐的无接缝 360° 全景图,在图像和视频两个任务上全面超越依赖真实相机参数的此前最优方法。
- FAIR: Feature-Augmented Implicit Regularization for AI-generated Fake Image Detection
-
FAIR 引入与纹理正交的场景构图结构(SCS)作为特权几何先验,在训练期扩增特征空间以平滑决策超平面并抑制局部纹理捷径学习,在推理期完全丢弃先验特征,以零计算与架构开销大幅提升跨生成器检测泛化性。
- GryphOne: Symbol-Aware Masked Diffusion for Structural Refinement in Offline Handwritten Mathematical Expression Recognition
-
GryphOne 将手写数学表达式识别(HMER)从自回归序列生成重新定义为离散掩码扩散的迭代符号精炼过程,通过符号感知分词(SAT)保持局部编辑的语法一致性,并用随机掩码互学习(RMML)提升精炼稳定性,在 MathWriting 上以 5.51% CER 和 59.9% ExpRate 全面超越重实现的自回归基线及商用 HMER 系统。
- Invisible Shortcuts: Why Vision Encoders Know Your Camera
-
揭示了视觉表征编码器对不可见相机与图像处理元数据(如 JPEG 参数、光圈、焦距)敏感的根源在于预训练数据中元数据与语义标签的伪相关性捷径学习,并提出了贯穿训练期增强与后处理对抗解耦的消除方案。
- Map2World: Segment Map Conditioned Text to 3D World Generation
-
针对世界级 3D 数据匮乏导致的场景生成不完整与领域泛化局限,Map2World 提出以任意形状分割图为界面的 3D 世界生成框架,利用 TRELLIS 结构化隐空间的 3D MultiDiffusion 融合、频域初始噪声优化及条件式细节增强器,实现了任意布局可控、尺度一致且细节丰富的大尺度 3D 场景生成。
- PolyLayout: Multi-room Manhattan Layout Estimation
-
PolyLayout 将室内多房间布局参数化为具有共享朝向与层高的三维曼哈顿多边形,基于 DINOv2 提取的特征图、边缘图与置信度构建可微目标函数,通过粗到细的 Levenberg-Marquardt 优化并结合自适应分裂/合并拓扑变换,实现了精准且强泛化的多房间 3D 布局重建。
- Reflecting Process Expertise in Procedural Material Generation
-
MaterialApprentice 将过程化材质生成从传统的静态图空间合成重新定义为基于专家示范的检索时过程推理,通过从教程视频中提取过程轨迹并由编译器具象化为着色器图,使生成的材质具备专业级分层结构与极高可编辑性。
- Robustness Emerges Early in Training Dynamics, but Is Not Preserved
-
本文发现深度神经网络在训练初期浅层子网络会自发形成高鲁棒性表征与平坦损失地形,但在标准经验风险收敛过程中会被侵蚀磨灭,据此提出早期阶段稳定化(EPS)与非对称权重回退(AWR)两种无参数轨迹干预策略,无需修改结构即可显著提升自然扰动鲁棒性。
- SceneDiff: A Benchmark and Method for Multiview Object Change Detection
-
针对非重合相机轨迹下的场景物体变化识别难题,本文构建了首个涵盖 350 组视频与稠密实例标注的 SceneDiff 基准,并提出结合基础模型的前馈 3D 几何配准与区域级多线索对比的免训练算法。
- SyntheticDoc: A Large Synthetic Dataset for Document Unwarping and Illumination Correction
-
针对文档形变矫正与光照修复长期受限受困于小规模低质数据的瓶颈,本文基于 ArcSim 物理仿真与 Blender 路径追踪构建了包含 100 万高分辨率合成样本的大规模数据集 SyntheticDoc,配备密集 UV 图与阴影图等全套像素级真值,仅凭简单轻量基线即全面刷新 DocUNet 基准 SOTA。
🔍 信息检索/RAG (8)¶
- TSEmbed: Unlocking Task Scaling in Universal Multimodal Embeddings
-
TSEmbed 用输入相关的 MoE-LoRA 分担多模态任务冲突,再在专家预热后根据路由相似度加权困难负样本,使仅使用 MMEB 训练的 2B/7B 模型分别达到 70.5/74.7 的总体分数,超过同设置 B3 基线 2.4/2.7 个百分点。
- LightSTAR: Efficient Visual Document Retrieval via Lightweight Selection with Vision-Adaptive Refinement
-
LightSTAR 针对视觉文档检索中 MLLM 全量编码页面太慢的问题,先用 LLM-free 轻量视觉选择模块高召回筛出候选,再只对候选做视觉自适应语义精排,在 ViDoRe 上达到 89.1 NDCG@5,同时把 5000 页端到端延迟降到 123.9s。
- FlowCIR: Semantic Transport via Flow Matching for Zero-Shot Composed Image Retrieval
-
FlowCIR 将零样本组合图像检索重新建模为视觉语言模型嵌入空间中以参考图像为条件的连续语义传输问题,利用条件流匹配与 Top-K 难负样本对比监督实现高效单步传输,并在推理期引入多负向导向策略抑制否定概念坍缩,仅需单卡 3090 训练 0.5 小时即可刷新多项基准。
- HyFL-CLIP: Hyperbolic Fine-Tuning of CLIP for Robust Long-Context Understanding
-
HyFL-CLIP 将预训练 CLIP 的欧氏图文对齐蒸馏到双曲空间(Lorentz 模型),通过爱因斯坦中点聚合建模"全局描述--局部成分"的层次蕴涵关系,使模型在长文本被扰动(重排、删除、丢词)时仍能稳定检索正确图像,在扰动词下比最强基线提升最高 19.5%。
- ME-IQA: Memory-Enhanced Image Quality Assessment via Re-Ranking
-
针对推理增强型视觉语言模型在图像质量评价中严重的离散坍缩问题,ME-IQA 提出一种无需重训的即插即用测试时记忆重排序框架,通过混合记忆库检索对齐邻居、利用 VLM 成对偏好在瑟斯顿 Case V 模型下融合序数证据,大幅提升了细粒度失真敏感度与评分连续性。
- What Images Cannot Say: Language-Guided Olfactory Representation Learning
-
针对图像无法直接观测全场景气味弥散源与环境背景的问题,SCENT 提出利用视觉语言模型(VLM)生成涵盖物体、环境与推测气味的文本先验作为语义桥梁,结合双投影对齐与气味隐空间解耦机制,在电子鼻气味-图像/文本检索任务上取得 SOTA 表现。
- MMAgent-R2: Learning to Rerank and Reject for Agentic mRAG
-
MMAgent-R2 将视觉重排序(Visual Reranking)与主动拒绝(Active Rejection)统一为智能体的内部校验机制,配合步级验证奖励的 GRPO 强化学习,解决了现有多模态 RAG 受困于全局特征检索失真及静态候选池的实体混淆难题。
- Multi-Anchor Distillation with Text-Guided Analytic Classifier for Continual Learning
-
针对 CLIP 类增量学习中编码器特征累积漂移与梯度分类器决策边界覆盖双重遗忘,本文提出多锚点历史蒸馏结合闭式正交解析分类器的免样本持续学习框架,大幅刷新长任务序列 SOTA。
💻 代码智能 (2)¶
- Coding with Eyes: Visual Feedback Unlocks Reliable GUI Code Generating and Debugging
-
本文先从 Flathub 真实桌面应用中整理出 984 个可执行的多页 GUI 开发任务与可编程的交互评测脚本 IES(InteractGUI Bench),再提出让 MLLM 直接"看"渲染界面并动手操作的三角色多智能体框架 VF-Coder,把 Gemini-3-Flash 的任务成功率从 21.68% 提到 28.29%、视觉相似度从 0.4284 提到 0.5584。
- PrintAnything: Learning Geometric Plan Map for 3D Printing G-code Generation from Unoriented Point Clouds
-
针对传统3D打印切片依赖水密网格且点云表面重构极易引入拓扑拓印伪影的瓶颈,PrintAnything提出了切片级点云投影与紧凑的几何规划图(G-plan Map)表征,首次实现了从未定向点云端到端直接编译生成物理可执行的3D打印G代码。
💬 LLM 其他 (13)¶
- ProAct: Agentic Lookahead in Interactive Environments
-
ProAct 把"前瞻"从推理期搬进数据构建期:先用真实环境的 MCTS 探出未来轨迹、压缩成"观察→分析→结论"的因果推理链做 SFT(GLAD),再用无参数、靠随机策略批量 rollout 估值的蒙特卡洛批判器(MC-Critic)稳定 PPO/GRPO 训练,让一个 4B 模型在 2048 与 Sokoban 上大幅超过同规模与更大的开源基线。
- Embedding Rotation Invariance for Provable Multi-Oriented Scene Text Recognition
-
针对多方向场景文本识别中依赖显式朝向预测与数据增强导致误差累积和推理负担的问题,本文提出 RISTER,在编码器嵌入旋转等变性(群等变卷积与自注意力结合的 RELG)、在解码器嵌入旋转不变性(基于交叉注意力的 RITD),构建了具有理论保证的端到端旋转不变识别系统,在多方向基准上准确率大幅领先 SOTA 达 4.0%。
- ExpoMotion: A Large-Scale Benchmark and A Householder Projection Network for Multi-Exposure Fusion
-
针对动态多曝光融合中真实运动基准匮乏与传统相似度对齐引入伪影的难题,本文提出了包含 1,738 个序列的大规模真实动态基准 ExpoMotion,并提出基于豪斯霍尔德正交投影的解耦网络 HOP,实现了曝光预对齐与运动伪影的几何投影滤除。
- GRE-Diff: Gaussian Room Embeddings for Structured Layout Diffusion
-
提出高斯房间嵌入(Gaussian Room Embedding, GRE)将房间建模为连续空间高斯分布以指导矢量扩散过程,结合多条件 GuidanceNet 与双注意力 DenoisingNet,在 RPLAN 上实现了 FID 4.36 与 99.21% F1BC-RC 的高质量户型图生成与无损局部交互编辑。
- Learning Probabilistic Prompt for Continual Learning
-
针对基于提示的类增量持续学习中固定确定性提示极易趋同的“提示坍塌”(Prompt Collapse)难题,本文提出将提示建模为高斯概率分布,根据输入图像查询特征动态构建混合分布并随机采样加权,配合连续步间的分布正则化 KL 散度约束,在不增加额外网络分支的前提下显著提升提示多样性并跨越式提升多基准准确率。
- Prior-Conditioned Gaussian Discriminants for Generalizable AI-generated Image Detection
-
将AI生成图像(AIGI)检测形式化为由训练先验、冻结表征与决策规则构成的三元迁移系统,构建包含嵌套协方差假设的解析高斯判别器阶梯作为诊断基准,揭示当前众多微调分类头并未超越冻结特征的低阶几何可分性。
- SAM2Matting: Generalized Image and Video Matting
-
SAM2Matting 提出一种解耦的"跟踪器到抠图"框架,将视频抠图拆分为高层跟踪(冻结的 VOS 跟踪器如 SAM2/SAM3 负责时序一致性)和低层抠图(可训练的 ROI 检测器 + 渐进式 Alpha 预测器负责细粒度透明度估计),仅用图像抠图数据训练就在视频抠图基准上以 zero-shot 方式达到 SOTA,同时支持多种 prompt 类型、维持强时序一致性、在人类和开放场景下均泛化良好。
- Debiased Textual Prompt Tuning for Enhancing Unknown Class Discovery
-
针对开放世界半监督学习中文本引导微调偏向已知类和图拓扑稀疏的两大痛点,提出基于最优传输解偏的文本提示微调与双模态图增强标签传播框架,在千类规模未知类识别准确率上取得 20.7% 的相对提升。
- Direct Preference Optimization for Perceptual Alignment via Vision-Language Consistency
-
提出无需人工标注或专有商业模型的视语言一致性直接偏好优化框架 VLC-DPO,通过互补生成图像响应与描述响应构建 VLC 评分筛选偏好对,并引入一致性差异动态惩罚权重,在大幅抑制多模态幻觉的同时显著提升零样本 VQA 推理能力。
- Leveraging Cross-Modal Knowledge Transfer for Knowledge-Aware Concept Customization
-
针对传统概念定制依赖罕见标记导致生成不稳定且缺乏常识关联的缺陷,本文提出知识感知概念定制任务与 MoKus 框架,基于跨模态知识迁移机制将文本编码器中编辑的自然语言知识无缝投影至视觉锚点表征,实现高效、高保真的定制图像生成。
🎨 图像生成 (337)¶
- MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE
-
MixGRPO 把流匹配模型的随机探索与 GRPO 更新集中到由粗到细移动的短窗口,窗口外使用确定性采样,在 FLUX.1-dev 的 HPDv2 测试中以更少更新步改善偏好评分;表 1 的基本版与最快 Flash* 版分别将单次训练迭代耗时降低约 49% 和 71%。
- TIIF-Bench: How Does Your T2I Model Follow Your Instructions?
-
TIIF-Bench 将文生图评测拆为分层的长短配对提示、逐属性二元检查与专用文本/风格指标,并把 Qwen3VL-8B 训练为可解释评估器,在人工标注验证集上达到 91.07% 准确率。
- Distribution Matching Distillation Meets Reinforcement Learning
-
DMDR 将少步扩散蒸馏与偏好优化放进相互约束的两阶段训练流程,使 4 步学生在多个总体指标上超过多步教师,但偏好收益仍伴随生成多样性的下降。
- Towards Scalable Pre-training of Visual Tokenizers for Generation
-
VTP 让视觉分词器同时学习重建、视觉语义与图文对齐,使增加分词器预训练投入能够改善下游扩散生成,在 ImageNet 256×256 上以 675M 生成模型训练 600 epochs 后取得有引导 gFID 1.11。
- Continuous Speculative Decoding for Autoregressive Image Generation
-
本文首次将推测解码从离散分布扩展到连续分布,通过去噪轨迹对齐(denoising trajectory alignment)提升 draft-target 接受率,再配合接受-拒绝采样(acceptance-rejection sampling)解决修正分布无解析表达式的采样难题,在 MAR、xAR、Harmon 等多个连续视觉 AR 模型上实现超过 2 倍墙钟加速且保持生成质量不变,全程无需额外训练。
- SRUM: Fine-Grained Self-Rewarding for Unified Multimodal Models
-
SRUM 提出一种自奖励后训练框架,让统一多模态模型(UMM)的理解模块扮演内部评估器,通过全局-局部双奖励系统为生成模块提供细粒度纠正信号,显著提升复杂文本到图像生成的质量。
- GenAgent: Scaling Text-to-Image Generation via Agentic Multimodal Reasoning
-
GenAgent 把生成器作为冻结工具,让一个经过冷启动和智能体强化学习的多模态模型负责改写、看图判断与迭代反思,在最多两轮生成的主实验中将 FLUX 的 GenEval++ 分数从 0.325 提升到 0.561。
- Query-Kontext: An Unified Multimodal Model for Image Generation and Editing
-
Query-Kontext 用可训练的多模态查询 token 把 VLM 的语义与粗粒度视觉规划传给扩散模型,再以低层图像条件补足细节,实现统一生成与编辑,在使用提示词改写的 GenEval 上获得 0.88,在 GEdit-Bench 英文和中文全量集上分别获得 7.66 和 7.65。
- RealGen: Photorealistic Text-to-Image Generation via Detector-Guided Rewards
-
RealGen 把合成图检测器变成写实度奖励,先优化 Qwen3 的提示词改写,再优化 FLUX 的图像生成,使完整系统在 RealBench 的模型裁判对真实照片比较中达到 50.15% 胜率,但这不等于所有人类观察者都无法辨别真伪。
- Learning on the Manifold: Unlocking Standard Diffusion Transformers with Representation Encoders
-
RJF 将表示编码器潜空间中的直线流匹配改为球面测地线流匹配,并按曲率导致的误差传播加权训练,使无需加宽的 131M 参数 DiT-B 在 ImageNet 256 类条件生成上达到 FID 4.95,加入引导后为 3.37,均训练 200 epoch。
🎬 视频生成 (172)¶
- End-to-End Training for Autoregressive Video Diffusion via Self-Resampling
-
Resampling Forcing 用模型自身重采样得到带真实模型误差的历史,再以干净视频为目标训练因果扩散预测器,无需额外教师或判别器,并在原生 15 秒训练下改善长视频时间质量。
- ShotStream: Streaming Multi-Shot Video Generation for Interactive Storytelling
-
ShotStream 将多镜头视频生成改为基于历史画面的下一镜头预测,用稀疏历史条件、显式区分镜头边界的双缓存和两阶段自强制蒸馏,在单张 H200 上以 15.95 FPS 生成视频,并取得 0.978 的镜头切换控制分数。
- MemRoPE: Training-Free Infinite Video Generation via Evolving Memory Tokens
-
MemRoPE 不更新生成器权重,而是把离开局部窗口的历史内容持续汇入长短期 EMA 记忆,并在注意力计算时才给未旋转的键施加 RoPE,在固定缓存下支持小时级生成,LongLive 上 1 小时视频的 VBench-Long 均值为 87.99,对照方法为 87.01。
- AnyFlow: Any-Step Video Diffusion Model with On-Policy Flow Map Distillation
-
AnyFlow 将视频蒸馏从“每次预测干净终点”改为“学习任意时间区间的流映射”,再通过三段捷径反向模拟与分布匹配修正学生自身轨迹,使 14B 因果模型在 4 NFE 达到 84.05 VBench,并在 32 NFE 提升到 84.41。
- PhyGDPO: Physics-Aware Groupwise Direct Preference Optimization for Physically Consistent Text-to-Video Generation
-
PhyGDPO 提出了一种面向物理合理视频生成的成组直接偏好优化框架,用真实视频作为必胜样本、Plackett-Luce 成组概率模型替代两两对比以捕捉全局偏好,配合 VLM 引导的物理奖励重加权和 LoRA 切换参考机制,在 14B 参数量级下高效实现了优于 Sora2 和 Veo3.1 的物理一致性。
- VGGRPO: Towards World-Consistent Video Generation with 4D Latent Reward
-
VGGRPO 将视频潜变量直接接入几何基础模型,用相机平滑与重投影一致性两种奖励做 GRPO 后训练,在 Wan2.2-5B 的动态场景测试中取得 66.00% 的运动质量胜率,并将奖励计算时间从 54.73 s 降至 41.33 s。
- Taming Text-to-Sounding Video Generation via Advanced Modality Condition and Interaction
-
针对「从文本同时生成画面 + 同步音效」(T2SV)任务,本文用一个双 agent 的字幕改写框架(CRR)给视频塔和音频塔分别喂互不干扰的模态纯净字幕,再用双塔扩散 BridgeDiT 以双向交叉注意力(DCA)在两塔之间搭桥交换特征,在三个基准上多数指标取得 SOTA。
- Anchor Forcing: Anchor Memory and Tri-Region RoPE for Interactive Streaming Video Diffusion
-
Anchor Forcing 将提示切换时的证据保留与长时间生成时的位置分布对齐分别交给锚点引导重缓存和三区域 RoPE,在 60 秒交互视频上将 LongLive 基线的动态程度从 26.37 提升至 73.00、质量分数从 78.92 提升至 82.25。
- HiAR: Efficient Autoregressive Long Video Generation via Hierarchical Denoising
-
HiAR 让视频块依赖前序块在当前去噪步的输出,而非完全干净的预测,并用双向注意力下的教师轨迹正则防止运动坍缩,在 20 秒视频上取得 VBench 总分 0.821、Drift 0.257 和报告的 30 fps 吞吐量。
- PackForcing: Short Video Training Suffices for Long Video Sampling and Long Context Inference
-
PackForcing把视频历史分为完整保留的起始锚点、压缩并动态检索的中段历史、完整保留的近期上下文,结合时间RoPE校正,让基于Wan2.1的模型用约5秒训练窗口生成120秒视频,在所测方法中取得最高的60秒与120秒VBench动态程度,但“固定活跃上下文”与“全部历史存储恒定”需要区分。
🧩 多模态 VLM (238)¶
- ViewSpatial-Bench: Evaluating Multi-perspective Spatial Localization in Vision-Language Models
-
ViewSpatial-Bench 用相机与人物参照系下的五类空间定位任务暴露视觉语言模型的视角转换短板,并通过约 43K 条定向监督数据将 Qwen2.5-VL-3B 的基准准确率从 35.85% 提升到 82.09%,提高 46.24 个百分点,而不是相对提高 46.24%。
- Visual Spatial Tuning
-
VST 不增加专用 3D 编码器,而是先用多模态几何数据教 VLM 感知空间,再用 BEV 辅助生成的文本重建思维链与强化学习训练空间推理,使 Qwen2.5-VL-7B 的 MMSI-Bench 得分从 25.9 提升至 34.8、VSI-Bench 从 38.9 提升至 61.2。
- Robobench: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models as Embodied Brain
-
RoboBench 用覆盖五类具身认知的 6092 道问答和基于动作依赖图的 MLLM 世界模拟裁判评估 18 个模型,发现较强的通用问答与规划表述能力仍不能保证隐式需求理解、空间落地和真实执行错误诊断。
- Render-in-the-Loop: Vector Graphics Generation via Visual Self-Feedback
-
Render-in-the-Loop 让 Qwen3-VL-8B 在生成每段 SVG 后观察累计画布,通过专门的多轮监督训练和推理时重复过滤,用 0.85M 训练样本在 MMSVGBench 上超过多种更大数据规模的自回归基线,但增加约 1.50 倍的 VSF 推理时延。
- Real5-OmniDocBench: A Full-Scale Physical Reconstruction Benchmark for Robust Document Parsing in the Wild
-
Real5-OmniDocBench 将 OmniDocBench v1.5 的全部 1,355 页文档各自重建为五种真实采集版本,用 6,775 个内容配对样本检验解析鲁棒性,显示数字文档上的能力不等于物理场景可靠性,且本次评测中 0.9B 的 PaddleOCR-VL-1.6 以 93.19 综合分领先所列大型通用模型。
- Towards Interactive Global Geolocation Assistant
-
MG-Geo 用地理元数据、图像线索和多轮推理对话训练 GaGA,使街景定位从一次性猜坐标变为可接收事实约束的交互过程,在 GWS15k 上取得 63.06% 国家准确率和 6.28% 城市准确率,但细粒度坐标精度并非全面领先。
- How to Teach Large Multimodal Models New Skills
-
本文将多模态模型的部分遗忘解释为任务诱发的输出偏置,并发现只训练注意力投影或 MLP 的 Gate&Up 层,就能在 LLaVA-OneVision 五任务连续学习中分别取得 +24.9 / +30.5 个百分点的当前任务增益,同时将通用评测变化限制在 -0.6 / -2.1 个百分点。
- MMR-Bench: A Comprehensive Benchmark for Multimodal LLM Routing
-
MMR-Bench 将图文查询在异构多模态大模型之间的选择做成可复用的离线评测,比较不同特征与路由策略的成本—性能曲线;作者报告某个路由工作点能以最强单模型约 33% 的成本匹配其精度,但该结论不是所有方法和任务都成立的统一节省比例。
- UniRec-0.1B: Unified Text and Formula Recognition with 0.1B Parameters
-
UniRec-0.1B 用约 4000 万多粒度样本、显式行段监督和文本/公式解耦分词,从头训练一个 0.1B 编码器—解码器,在 UniRec-Bench 上达到 0.100 平均编辑距离,并在论文规定的单卡测试条件下将平均块识别耗时降至 0.37 秒。
- DiaDem: Advancing Dialogue Descriptions in Audiovisual Video Captioning for Multimodal Large Language Models
-
DiaDem 在 AVoCaDO-7B 上结合对话感知合成数据与难度分阶段 GRPO,使完整视听描述更准确地回答“谁说了什么”,在 DiaDemBench 上达到 REF 65.9、ASR 79.3,同时保持有竞争力的通用描述质量。
🧠 VLM Reasoning (171)¶
- Video-Holmes: Can MLLM Think like Holmes for Complex Video Reasoning?
-
Video-Holmes 用 270 部悬疑短片的 1,837 道问题检验模型能否自行找到并串联分散线索,主表最佳模型 Gemini-3.0-Pro 仅达 49.6%,而单次观看的人类基线为 96.3%。
- Chain-of-Visual-Thought: Teaching VLMs to See and Think Better with Continuous Visual Tokens
-
CoVT 让 VLM 在回答前生成受分割、深度和语义专家监督的连续视觉 token,用 16 个潜在感知状态代替单纯文字化的中间观察,在 Qwen2.5-VL-7B 上将 CV-Bench 从 74.5 提至 80.0,其中深度子任务提高 14.0 个百分点。
- LEGO-Puzzles: How Good Are MLLMs at Multi-Step Spatial Reasoning?
-
LEGO-Puzzles 用从基础空间问答到带干扰项的装配规划、再到逐轮生成中间状态的递进评测,发现 29 个多模态模型仍有明显能力缺口:GPT-5 在 Lite 子集落后人类 21.8 个百分点,在规划测试中从一步的 90% 降到八步的 0%。
- TIR-Bench: A Comprehensive Benchmark for Agentic Thinking-with-Images Reasoning
-
TIR-Bench 将视觉推理评测从裁剪搜索扩展到 13 类图像操作任务,在 1215 个样本上揭示工具执行能显著改善模型表现,但最强的 o3-TU 总分仍只有 46.0,且复杂空间规划与工具选择远未解决。
- Vision-as-Inverse-Graphics Agent via Interleaved Multimodal Reasoning
-
VIGA 让视觉语言模型反复执行“写代码、渲染、主动检查、修改”,用语义技能和有限历史记忆维持可编辑场景的一致性,无需训练便在 BlenderBench 上报告相对单次生成的平均提升 124.70%。
- Reinforcing Video Reasoning with Focused Thinking
-
TW-GRPO 用组内同位置 token 分布的差异重新分配学习强度,并对多答案问题给予受假阳性约束的部分奖励,使 Qwen2.5-VL-7B 在仅 1K CLEVRER 训练样本下将 CLEVRER 准确率从同设置 GRPO 的 41.1% 提升到 50.4%,但收益并非覆盖所有视频基准。
- UniREditBench: A Unified Reasoning-based Image Editing Benchmark
-
UniREditBench 将图像编辑评测扩展到真实世界交互与游戏规则推理,用文本和目标图像共同约束裁判,并通过合成思维链数据训练 UniREdit-Bagel,使其域内总分达到 78.15,但域外 RISEBench 仍落后于最强闭源模型。
- Embed-RL: Reinforcement Learning for Reasoning-Driven Multimodal Embeddings
-
Embed-RL 让冻结的嵌入器用检索反馈训练独立推理器,并把思维链中的图像框、视频关键帧和文本关键词交给嵌入器,使 Embed-RL-4B 在 MMEB-V2 的总体分数达到 68.1,比 UME-R1-7B 高 3.6 分。
- Video Streaming Thinking: VideoLLMs Can Watch and Think Simultaneously
-
VST 将视频推理前移到用户提问之前,以因果训练的流式思考不断更新文本记忆,使 VST-7B 在 StreamingBench 达到 79.5%,并在 VideoHolmes 上以 0.56 秒查询响应延迟取得 41.9% 准确率。
- LaViT: Aligning Latent Visual Thoughts for Multi-modal Reasoning
-
LaViT 让 Qwen2.5-VL-3B 在回答前生成四个连续视觉 token,同时学习 32B 教师的视觉语义与关注区域,并通过逐渐开放直接看图路径的门控避免绕过这些 token,在 BLINK 相对深度任务上由 61.29% 提升至 78.23%。
⚡ VLM Efficiency (62)¶
- RoMa v2: Harder Better Faster Denser Feature Matching
-
RoMa v2 用冻结 DINOv3 上的多视图粗匹配、解耦训练的高效细化和像素级不确定度预测,兼顾困难视角匹配与亚像素精度,在 AerialMegaDepth 上将 RoMa 的 EPE 从 25.05 降至 4.12 像素,但并未在极端跨模态泛化或绝对速度上全面领先。
- Towards Scalable Pre-training of Visual Tokenizers for Generation
-
VTP 让视觉分词器同时学习重建、视觉语义与图文对齐,使增加分词器预训练投入能够改善下游扩散生成,在 ImageNet 256×256 上以 675M 生成模型训练 600 epochs 后取得有引导 gFID 1.11。
- FlashVLM: Text-Guided Visual Token Selection for Large Multimodal Models
-
FlashVLM 在视觉编码器与语言模型的接口处,用查询相关性和视觉显著性的融合分数选出关键区域,再补充非冗余背景,在 LLaVA-1.5-7B 上将 576 个视觉 token 压到 128 个时报告 100.6% 的相对性能,但这不代表所有任务都无损。
- ResilPhase: Plug-and-Play Phase Mapping and Noise-Resilient Macro-Trajectory Extrapolation for Diffusion Acceleration
-
ResilPhase 将 DiT 免训练加速从逐层导数外推范式重构为 ODE 空间中的宏观轨迹外推:用端到端 Global Drift 消除逐层误差级联,用无导数 Barycentric Lagrange 插值绕过导数混沌噪声,再用 Chebyshev/Balanced 相位映射将离散时间步投影到有界相位空间以抑制 Runge 现象,在 FLUX.1-dev 上以约 5 倍加速仍保持 SOTA 画质。
- TinyHistory: Lightweight Video History Embeddings via Two-Stage Context Learning
-
TinyHistory 先让轻量历史编码器学会从任意时间位置查询画面,再与视频扩散模型联合学习续写,在 Wan 2.1 的 480p 评测中将历史上下文降至 195 tokens/s,同时获得高于滑动窗口的角色一致性与用户偏好。
- Fast-dVLA: Accelerating Discrete Diffusion VLA to Real-Time Performance
-
Fast-dVLA 把离散扩散 VLA 改造成可缓存前缀、可跨块并行去噪的模型,以少量非对称蒸馏完成适配,在 LIBERO 上将 Dream-VLA 的解码吞吐从 98.8 提高到 313.1 tokens/s,并在实机任务报告 30 Hz 执行频率。
- Why and When Visual Token Pruning Fails? A Study on Relevant Visual Information Shift in MLLMs Decoding
-
本文发现静态视觉 token 剪枝难以跟上多步推理中的视觉证据转移,提出免训练插件 DSTP,在解码时检测注意力变化并临时恢复相关 token,使 Qwen3-VL-4B 在初始保留 33.3% token 时的 MathVerse 准确率从 FastV 的 32.23% 提升到 52.54%,但仍低于完整模型的 61.29%。
- DC-Gen: Post-Training Diffusion Acceleration with Deeply Compressed Latent Space
-
DC-Gen 先对齐输入与输出接口,再用 LoRA 将预训练扩散主干迁移到更少 token 的深压缩潜空间,在多类生成任务上接近原模型质量;论文报告 FLUX 4K 生成最高 53.8 倍加速,但计时仅覆盖 Transformer 主干。
- Spatial-TTT: Streaming Visual-based Spatial Intelligence with Test-Time Training
-
Spatial-TTT 将在线更新的快权重、局部滑窗注意力与少量全注意力层结合,用稠密三维场景描述教会模型保留空间证据,使 2B 模型在 VSI-Bench 上取得 64.4 分,并在 1024 帧输入时比 Qwen3-VL-2B 使用更少显存与计算。
- ToDRE: Effective Visual Token Pruning via Token Diversity and Task Relevance
-
ToDRE 先在 LLM 输入前贪心保留多样的视觉 token,再在跨模态交互衰减的深层移除全部剩余视觉 token,无需训练即可让 LLaVA-NeXT-7B 在仅保留 10% 输入视觉 token 时维持八项图像任务平均 95.0% 的相对性能,并在四任务消融计时中达到约 2.6× 加速。
🎵 音频/语音 (25)¶
- MGM-Omni: Scaling Omni LLMs to Personalized Long-Horizon Speech
-
MGM-Omni 将多模态理解与语音合成拆成脑口双轨,用双音频编码器增强理解、分块并行解码稳定长语音生成,在自建 Long-TTS-Eval 上以 2B SpeechLM 达到英文 WER 4.98% 和 RTF 0.19,并支持参考音色控制。
- JAM-Flow: Joint Audio-Motion Synthesis with Flow Matching
-
JAM-Flow 把 LivePortrait 的低维嘴部表情关键点与 F5-TTS 的梅尔谱当成同一个流匹配框架下两个可互相遮罩的模态,用半量共享注意力的双流 MM-DiT、RoPE 时序对齐和模态非对称注意力掩码联合训练,一个约 500M 的模型同时覆盖说话头生成、TTS、动作→音频与自动配音,20 秒视频在单张 RTX A6000 上 45 秒生成。
- InfiniteDance: Scalable 3D Dance Generation Towards in-the-wild Generalization
-
InfiniteDance 将互联网舞蹈视频转成经过物理与足部修复的 100.69 小时三维动作数据,再用连续嵌入、参考舞蹈检索和节奏混合专家训练 ChoreoLLaMA,在本数据集上将运动学 FID 从 Lodge 的 89.52 降至 30.54,但其真实场景泛化仍受慢音乐评价和长序列结构限制。
- Progressive Representation Learning for Multimodal Sentiment Analysis with Incomplete Modalities
-
PRLF 把「此刻哪个模态可信」拆成分类置信度与 Fisher 信息两个互补信号、逐样本选出主导模态,再让辅助模态经过 4 步迭代先自我精炼、后与主导模态做投影对齐与残差去噪,在 CMU-MOSI / CMU-MOSEI / SIMS 的模态间与模态内缺失设定下分别取得 77.02 / 76.24 / 81.19 的平均 F1。
- CoSyncDiT: Cognitive Synchronous Diffusion Transformer for Movie Dubbing
-
CoSyncDiT 将电影配音中的音色学习、口型节奏校准和文本对齐依次组织到流匹配 Transformer 中,再用帧级对比学习与 CTC 约束对齐,在 CinePile-Dub 零样本 Setting 2 上取得 47.24% 说话人相似度、7.53% WER 和 0.319 Sync-KL(原文表 5)。
- DecepGPT: Schema-Driven Deception Detection with Multicultural Datasets and Robust Multimodal Learning
-
DecepGPT 用结构化视听报告监督和 SICS、DMC 两个训练组件改进数据集内的欺骗分类,在 DOLOs 达到 73.23% 准确率,但这些结果不构成可靠现实测谎的证据。
- Music-to-Dance Generation via Atomic Movements
-
把舞蹈显式建模成一串语义可读、可复用的「原子动作」,先用离散扩散模型在整首音乐的条件下规划出每个原子动作的类型、时长与时间位置(相当于一张符号谱),再用过渡感知的连续扩散生成器补全动作之间的过渡、并按时长最近原则检索实例后加掩码噪声重绘,在 AIST++ 上取得最低的 FID(25.26 / 9.03)、最高的 BAS(0.2470)与最高的结构一致性 R(26.6)。
- Step-by-Step Video-to-Audio Synthesis via Negative Audio Guidance
-
针对现有视频到音频(V2A)模型只能一次性生成整段声音、无法像 Foley 艺术家那样逐层补声的痛点,本文提出 Negative Audio Guidance(NAG):训练一个以「已生成音轨」为条件的分支,采样时把它反向使用,把当前生成推离已有声音,从而只用普通单参考音视频数据集就实现了分步生成互补音轨、混合成高质量合成音。
- HumanOmni-Speaker: Identifying Who said What and When
-
针对全模态大模型在多说话人交互中无法准确判定“谁在何时说了什么”以及依赖低帧率静态视觉捷径的缺陷,本文提出了视觉注册说话人日志与识别任务(VR-SDR)及基准,并设计了通过视觉残差编码器(以 25 fps 抽取残差并压缩至每帧 6 个 token)实现高频时空对齐的 HumanOmni-Speaker 模型。
- JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing
-
JoVA 提出了一个流线型的音视频联合生成与编辑统一框架,摒弃割裂的跨模态交叉注意力模块,改用原生联合自注意力与通道级条件注入,配合自适应局部嘴部流匹配损失,在单一模型中实现了高质量音视频生成、参考图引导合成以及指令驱动的音视频协同编辑。
🔎 AIGC 检测 (9)¶
- Beyond Artifacts: Real-Centric Envelope Modeling for Reliable AI-Generated Image Detection
-
REM 不再主要追逐已知生成器的伪影,而是用受控重建样本学习真实图像的特征包络,并约束该包络跨退化保持稳定,在 RealChain 链式退化测试中达到 84.2% 平衡准确率,比 DDA 高 18.4 个百分点。
- Code-in-the-Loop Forensics: Agentic Tool Use for Image Forgery Detection
-
本文提出 ForenAgent:把 12 个低层取证算子(FFT、DWT、重采样周期、SRM、Bayar、PRNU、JPEG Ghost 等)做成 MLLM 可直接调用的工具箱,让模型在多轮交互中自主生成并执行 Python 代码、再把沙箱回注的取证图当观测继续推理,配合"冷启动 + 四阶段过程奖励 GRPO"两阶段训练,在自建的 10 万图三分类基准 FABench 上把整体准确率从最强基线的 81.2% 提升到 89.5%,并在 SIDA-Test 上以 83.1% 取得最好的跨数据集泛化成绩。
- SPLIT: Training-Free AI-Generated and Partially Edited Video Detection via Spatial Patch-Level Incoherence and Temporal Roughness
-
SPLIT 用一个完全免训练的检测器在冻结视觉编码器的 patch token 上算两个统计量——两步时间粗糙度(TTR,比较 1 步与 2 步累积位移)与局部空间运动不一致(LSMI,特征空间运动场的空间梯度)——乘性融合并做 γ 校正后,仅用真实视频标定阈值,在 FakeParts / GenVideo / ViF-Bench 三个基准的 FPR = 0.1% 操作点上取得最高 Fake Recall(FakeParts 74.45%,远超最强监督基线 ReStraV 的 35.67%)。
- Caption Bottleneck Models
-
CaBM 将图像先转成去除类别名称的自然语言描述,再由独立的纯文本分类器识别类别,并从分类证据中发现概念,在切断视觉特征旁路的同时取得有竞争力但并非全面领先的分类表现。
- From Masks to Pixels and Meaning: A New Taxonomy, Benchmark and Metrics for VLM Image Tampering
-
现有篡改基准用对象掩码标注"哪里被改",与真实的生成编辑信号严重错位;本文把 VLM 图像篡改重定义为像素级 + 语义 + 语言感知的任务,发布 42 万图像对的 PIXAR 基准(8 类编辑原语、阈值化像素标签 \(M_\tau\) 与语义类标签),并配套五损失联合训练框架和像素/语义/语言三档指标,在同骨干下把篡改定位 IoU 从 11.8% 提到 18.1%。
- Efficient Document Tampering Localization with Multi-Level Discrepancy Features and Unified DCT-Quantization Embedding
-
DiffNet 通过两项互补设计——多层差异变换将特征金字塔从内容信号转为符号不变的差异强度信号,以及统一 DCT-量化联合嵌入用离散 embedding 替代传统高开销频率感知头(FPH)——在跨域和人工篡改文档定位上以更低计算成本取得了约 30% 的 F1 提升,吞吐量最高提升 7 倍。
- Trustworthy Image Authentication using Forensic Knowledge Graphs
-
把图像取证的「找证据」和 VLM 的「说人话」拼成一套系统:先用自监督学到的取证指纹把图像切成来源一致的区域、判定每块区域的源/后处理/压缩历史,组织成一张结构化的「取证知识图谱」,再让 VLM 依图逐条给出可核验的自然语言判据,在检测、伪造类型/定位、取证解释三个维度全面超过纯取证器和纯 VLM。
- Asymmetric Anchoring: Opening the Black Box of MLLMs for Forgery Detection
-
AAP 在多模态大模型内部只把真实图像的中间表示拉向冻结视觉编码器提供的参考,同时把逐位置的对齐误差交给定位解码器,使 AAP-lisa 在 SID-Set 上达到 97.1% 检测准确率和 56.8% 定位 IoU。
- Q-REAL: Towards Naturalness and Distortion Evaluation for AI-Generated Content
-
针对文生图质量评估仅依赖单标量评分且缺乏可解释归因信号的缺陷,本文提出了包含10K张图像、3.2万余个实体级问答与归因描述的细粒度基准Q-Real,并构建了“对象判别-全图定位推理-CoT质量回归”三阶段训练管线,显著提升了多模态大模型在AI生成图像瑕疵检测与可解释质量评分上的综合能力。
🧊 3D 视觉 (519)¶
- V-JEPA 2.1: Unlocking Dense Features in Video Self-Supervised Learning
-
V-JEPA 2.1 把视频潜空间预测的监督扩展到可见位置和多个网络深度,在增强局部时空结构的同时恢复全局语义能力,其 ViT-G 在冻结特征评测中达到 NYUv2 深度 RMSE 0.307 和 SSv2 动作识别准确率 77.7%。
- RoMa v2: Harder Better Faster Denser Feature Matching
-
RoMa v2 用冻结 DINOv3 上的多视图粗匹配、解耦训练的高效细化和像素级不确定度预测,兼顾困难视角匹配与亚像素精度,在 AerialMegaDepth 上将 RoMa 的 EPE 从 25.05 降至 4.12 像素,但并未在极端跨模态泛化或绝对速度上全面领先。
- Ultra3D: Efficient and High-Fidelity 3D Generation with Part Attention
-
Ultra3D 先用紧凑 VecSet 确定物体粗布局,再用沿部件边界组织的注意力生成稀疏体素潜特征,在支持 1024 分辨率网格的同时,相对全注意力基线取得部件自注意力 6.7×、DiT 推理 3.3× 的加速。
- P3-SAM: Native 3D Part Segmentation
-
P3-SAM 利用约 3.7 million 个原生 3D 资产的部件监督,训练单点提示的两阶段多掩码网络,再用质量预测与去重实现自动分割,在 PartObj-Tiny 不利用连通性的设置下达到 59.88 的平均 IoU,高于 PartField 的 53.93。
- VolSplat: Rethinking Feed-Forward 3D Gaussian Splatting with Voxel-Aligned Prediction
-
VolSplat 将前馈 3D Gaussian Splatting 的基元预测范式从逐像素对齐改为逐体素对齐:先将多视图 2D 特征通过深度图反投到 3D 空间形成体素特征网格,经稀疏 3D U-Net 残差精化后逐体素预测高斯参数,从而从根本上解耦 3D 表征与输入图像分辨率的刚性绑定,实现自适应高斯密度分配。
- LoGeR: Long-Context Geometric Reconstruction with Hybrid Memory
-
LoGeR 将视频按块重建,用滑窗注意力保留邻块细节、用测试时训练更新的快权重记忆传递全局几何,带前馈位姿对齐的 LoGeR* 在 KITTI 上将平均 ATE 从 TTT3R 的 72.86 m 降至 18.65 m,但超长序列结果包含周期性状态重置。
- MVGS: Multi-view Regulated Gaussian Splatting for Novel View Synthesis
-
MVGS 将高斯泼溅的单视角逐步拟合改为多视角联合更新,并结合跨内参引导与两类增密,在 Mip-NeRF 360 上将 3DGS 的 PSNR 从 28.69 提高到 29.61,但训练时间也从 0.3 小时增加到 2.4 小时。
- Skyfall-GS: Synthesizing Immersive 3D Urban Scenes from Satellite Imagery
-
Skyfall-GS 用卫星影像约束城市的粗几何与外观,再通过由高到低的视角课程将扩散模型生成的立面细节逐轮写回 3D 高斯场景,在 DFC2019 上取得 FIDCLIP 27.03、CMMD 2.110,并支持离线优化后的实时漫游。
- XYZ-IBD: Benchmarking Robust 6D Object Pose Estimation under Real-World Industrial Complexity
-
XYZ-IBD 用多传感器真实料箱数据、喷涂辅助几何标注及噪声匹配仿真建立工业 6D 位姿基准,在 15 种零件上揭示现有方法的明显性能缺口,其中 SAM6D 的 XYZ-IBD 6D AP 为 0.578,而其 BOP-Core 5 平均值为 0.704。
- Generation Models Know Space: Unleashing Implicit 3D Priors for Scene Understanding
-
VEGA-3D 把冻结的 Wan2.1 视频生成模型用作空间特征提取器,通过中等强度加噪、中间层取特征及逐 token 门控融合增强多模态模型,使 ScanRefer [email protected] 从 51.7 提高到 56.2,同时在空间推理和操作任务上取得幅度不一的收益。
🎯 目标检测 (81)¶
- RT-DETRv4: Painlessly Furthering Real-Time Object Detection with Vision Foundation Models
-
RT-DETRv4 在训练时用冻结视觉基础模型监督 AIFI 的深层特征,并按该模块的梯度占比自适应调整监督强度,使 L 型在保持 8.07 ms 推理延迟的同时将 COCO AP 从 DEIM-L 的 54.7 提升至 55.4。
- M4-SAR: A Multi-Resolution, Multi-Polarization, Multi-Scene, Multi-Source Dataset and Benchmark for optical-SAR Object Detection
-
本文提出 M4-SAR——首个大规模光学-SAR 配对旋转目标检测数据集(112,174 对图像、981,862 实例、6 类),配套统一评测工具 MSRODet 和端到端融合检测框架 E2E-OSDet(FAM + CMIM + AFM),融合后 mAP 比最优单源提升 5.1%,复杂环境下增益尤为显著。
- Low-latency Event-based Object Detection with Spatially-Sparse Linear Attention
-
SSLA 把线性注意力的全局状态拆成几何路由的局部子状态,以并行训练、逐事件递归推理支持低延迟检测,SSLA-L 在 Gen1 上达到 0.375 mAP,单事件计算量为 0.724 MFLOPS,实测单核处理延迟为 7.20 微秒。
- VLOD-TTA: Test-Time Adaptation of Vision-Language Object Detectors
-
针对 YOLO-World、Grounding DINO 这类视觉语言目标检测器在测试时遇到分布偏移就掉点的问题,VLOD-TTA 用「IoU 加权熵最小化」把自适应聚焦到空间上密集重叠的候选框簇,再用「图像条件下的提示选择」挑出与当前图片最匹配的文本提示,只更新极少量 adapter 参数,就能在艺术风格、恶劣驾驶、低光、常见退化等多种偏移下稳定超过已有 TTA 基线和上一代专用方法,且开销远低。
- DroneFINE: Domain-Aware Parameter-Efficient Fine-Tuning of Vision-Language Detectors for Drone Images
-
DroneFINE 在冻结的 GroundingDINO 上只用 1.54M 可训练参数(全量微调 27.5M 的 5.6%),用「前景感知的动态多路卷积适配器 HyperAdapter + 基于背景词表的门控查询重排 SemanticGate」两个域感知模块,把无人机图像检测拉到 VisDrone 38.4 mAP / 61.2 mAP50、UAVDT 26.5 mAP / 43.6 mAP50,与全量微调持平甚至在 UAVDT 上反超,并保持了对 COCO 的泛化。
- RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios
-
本文构建了首个面向复杂真实场景的大规模 RGB-Thermal 视觉定位基准 RGBT-GroundBench(21,535 对 RGB-TIR 图像、38,760 条指代实例、场景/环境/物体三级标注),配套给出支持 RGB-only、TIR-only、RGB+TIR 的统一评测协议并评测 11 个 VG 模型,同时提出参考基线 RGBT-VGNet,在三个子数据集上取得最高 [email protected]。
- What is the Right Embedding Space for Contrastive Learning in Referring Expression Counting?
-
论文把指代计数(REC)里的对比学习从"图像-文本嵌入空间"整体搬到"纯图像嵌入空间",用二分匹配在现场划出正负样本、把负样本池从个位数扩到上百个图内视觉 token,并只让正类 token 充当锚点;这套即插即用的 C-REX 在三种检测式 REC 架构上一致涨点,REC-8K 上 MAE 最多降 28%、RMSE 最多降 24.5%,还能迁移到类别无关计数。
- DetPO: In-Context Learning with Multi-Modal LLMs for Few-Shot Object Detection
-
DetPO 把少量标注图像转化为可反复验证的文本类别定义,用误检收紧概念、用漏检拓宽概念,在冻结多模态大语言模型的前提下提升少样本检测,并通过可选的逐框 VQA 重评分进一步改善检测排序。
- MOCHA: Multi-modal Objects-aware Cross-arcHitecture Alignment
-
MOCHA 让冻结的 LLaVa 教师按「检测框 + 类名」这个组合产出对象级多模态嵌入,用一个通道注意力翻译模块把 YOLO 学生的多尺度区域特征映射到该嵌入空间,再用「逐点对齐 + 关系几何保持」的双目标损失监督,使 3.2M 参数的轻量检测器在四个个性化检测基准上比 YOLOv8n 基线平均高 10.1 个点,推理仅增加 3 ms/图。
- Rethinking IRSTD: Single-Point Supervision Guided Encoder-only Framework is Enough for Infrared Small Target Detection
-
SPIRE 把红外小目标检测从轮廓分割改为中心响应回归,用单点生成局部结构化监督、用轻量纯编码器预测热图,再直接提取目标中心,在 SIRST-UAVB 上以约 0.29M 参数取得 97.05% F1。
✂️ 语义分割 (97)¶
- LlamaSeg: Image Segmentation via Autoregressive Mask Generation
-
LlamaSeg 用冻结的 VQGAN 把掩码变成离散视觉 token,让 LLaMA 风格模型根据图像和文字逐 token 生成掩码,384 像素版在 ADE20K 达到 55.9 mIoU,但指代分割精度和延迟仍不及专用判别式方法。
- Delayed Bidirectional Alignment via Disentangled Audio Semantics for Audio-Visual Segmentation
-
DDAVS 通过原型记忆库锚定的可学习查询来解耦多源音频语义,并引入仅在深层进行的延迟双向交叉注意力对齐视听模态,在 AVSBench 和 VPO 多源/多类/多实例场景上全面超越此前 SOTA。
- EM3M: An Electron Micrograph Dataset for Microstructural Segmentation and Generation
-
EM3M 用 5,091 张真实电子显微图像、2,985,660 个实例标注和九维结构化描述建立材料微结构基准,并通过 SDXL 合成增强与改进的流场分割基线 UniAIMS,将全量评测的 [email protected] 从真实数据训练的 0.800 提升到混合训练的 0.809。
- Masked BRep Autoencoder via Hierarchical Graph Transformer
-
本文保持 CAD 边界表示的拓扑不变,掩去面与边的原始几何和属性,用双分辨率跨尺度注意力及局部消息传递重建它们,从而获得可迁移的表示,在 MFInstSeg 的 0.1% 标注设置下取得 88.75% 面级准确率。
- Segmenting Visuals With Querying Words: Language Anchors For Semi-Supervised Image Segmentation
-
HVLFormer 将预训练视觉语言模型的类别语义转化为数据集与图像感知的多尺度文本查询,再用逐层跨视图一致性稳定掩码解码,在 SigLIP2 配置下以 92 张 VOC 标注和 232 张 COCO 标注分别达到 89.1% 与 58.8% mIoU。
- Beyond Aesthetics: Quantifying Information Loss in Turbid Scenes
-
本文用可跨浑浊等级传递真实掩码的 TUB 数据集和相位一致性梯度熵 PCD,区分“看起来变差”与“任务所需结构消失”:PCD 在文中真实及合成浑浊实验中与分割表现的相关性最强,但不能把它当成跨任意场景通用的可识别性分数。
- DGSeg: Dynamic Gating of Semantic-Spatial Guided Predictions for Reasoning Segmentation
-
DGSeg 让 MLLM 同时产出「目标是什么」的文本语义描述和「目标在哪」的边界框空间定位作为两类互补线索,分别送入两条独立的分割分支,再用一个轻量动态门控模块逐像素估计两支的融合权重,在 ReasonSeg 零样本设定下把 7B 模型的 gIoU 推到 69.6(val)/ 67.3(test),超过 Seg-Zero、CoPRS、SAM-Veteran 等强基线。
- ET-SAM: Efficient Point Prompt Prediction in SAM for Unified Scene Text Detection and Layout Analysis
-
ET-SAM 用轻量 Point Decoder 预测词级热力图以提取稀疏前景点,替代 Hi-SAM 从像素级分割中随机采样上千个点的做法,配合可学习任务提示和联合训练策略统一利用多粒度异构标注数据,在 HierText 上以约 3 倍推理加速达到有竞争力性能,并在 Total-Text/CTW1500/ICDAR2015 上平均 F-score 提升 11.0%。
- Fast and Flexible Robustness Certificates for Semantic Segmentation
-
本文把语义分割的认证鲁棒性做成"一次前向 + 一次排序":用 Lipschitz 约束网络给出逐像素不变半径,再把"攻击者最多能让多少像素出错"归约成容量为 \((L\epsilon)^2\) 的一维背包问题,从而在 Cityscapes 的 1024×1024 图像上以约 0.1 秒给出像素精度、FNR、稳定性与类别 IoU 的确定性最坏情况下界,比随机平滑快约 600 倍。
- Learning Probabilistic Embeddings for Unsupervised Action Segmentation
-
PEOT 用局部时序图预测每帧的高斯嵌入,以多次采样驱动最优传输伪标签和交叉熵训练,测试时只用均值,在 Desktop Assembly 上相对代码复现的 ASOT 将 MoF 从 59.0 提高到 71.2、F1 从 63.7 提高到 75.8,但并非所有数据集的所有指标都领先。
🖼️ 图像恢复 (73)¶
- Lumina-OmniLV: A Unified Multimodal Framework for General Low-Level Vision
-
OmniLV 在 Lumina-Next 生成先验上,通过文本与图像分离编码、视觉示例投影相加及浅层条件适配器联合训练,用一个模型处理四类低层视觉任务,在指令对齐和多项感知指标上表现较强,但并未全面超过专用模型。
- Denoising the Deep Sky: Physics-Based CCD Noise Formation for Astronomical Imaging
-
本文不改造去噪网络,而是用校准帧估计 CCD 特有的空间响应与读出噪声,从高信噪比叠加代理合成训练对,使标准 U-Net 在 MuSCAT-3 与跨仪器 MuSCAT-4 上分别取得平均 39.91 和 39.87 dB 的真实观测注入源 FLUX-SNR。
- QualiTeacher: Quality-Conditioned Pseudo-Labeling for Real-World Image Restoration
-
QualiTeacher 把教师伪标签的质量分数变成学生网络的控制条件,再用质量排序与裁剪一致性约束输出,使不完美监督支持可控的真实图像恢复,在 RTTS 去雾中将 CORUN 配合 Colabator 的 FADE 从 0.824 降至 0.590。
- Stream-DiffVSR: Low-Latency Streamable Video Super-Resolution via Auto-Regressive Diffusion
-
Stream-DiffVSR 用四步扩散去噪、光流对齐的历史输出引导和时序解码,逐帧恢复高清视频,在不读取未来帧的条件下取得 REDS4 LPIPS 0.099 与 RTX 4090 上 720p 首帧延迟 0.328 秒,但尚非通常意义的实时高清视频处理。
- SparkVSR: Interactive Video Super-Resolution via Sparse Keyframe Propagation
-
SparkVSR 让用户先修好少量关键帧,再以低分辨率视频为运动约束传播这些视觉先验,在 MovieLQ 上用 PiSA-SR 参考取得 MUSIQ 68.88、DOVER 0.6212,同时允许通过参考引导强度选择更忠实或更具生成细节的结果。
- Spectral and Trajectory Regularization for Diffusion Transformer Super-Resolution
-
StrSR 提出非对称判别蒸馏 + 频域分布匹配的联合框架,以 CLIP-ConvNeXt 判别器替代 DiT 判别器避免模型坍塌,并用频域分布损失(FDL)抑制 DiT 特有的网格状周期伪影,首次在 DiT 架构上实现高质量单步真实图像超分辨率。
- λSplit: Self-Supervised Content-Aware Spectral Unmixing for Fluorescence Microscopy
-
λSplit 用层次 VAE 学习细胞结构先验,再将预测的荧光团浓度图通过已知光谱重新混合,以观测重建实现无需解混真值的训练;在 CellAtlas 的 5 ms、32 波段模拟实验中,PSNR 达到 34.03 dB,而该设置下最强对照 RLU 为 28.91 dB。
- Calibrated Harmonic Overlaid Implicit Neural Representations for Multi-Dimensional Data
-
CHOIR 把深度周期 INR 的「逐层函数复合」改造成「β 门控的加性谐波叠加」,并用自然图像的 1/f 幂律先验同时校准每个神经元的频率分布与输出幅度,使周期 INR 能稳定加深到 12–15 层,在 2D 图像拟合、NeRF 新视角合成以及高光谱/多光谱/视频的缺失补全与混合退化恢复上全面超过 SIREN、FINER、FreSh、LRTFR、CRNL 等基线。
- RL-AWB: Deep Reinforcement Learning for Auto White Balance Correction in Low-Light Night-time Scenes
-
RL-AWB 用夜间灰像素统计估计器 SGP-LRD 承担光源估计,再用仅需少量训练图像的 SAC 策略逐图调整灰像素比例与聚合指数,在 LEVI 训练、NCC 测试时取得 1.99° 的中位角度误差。
- Experts-Guided Unbalanced Optimal Transport for ISP Learning from Unpaired and/or Paired Data
-
EGUOT 不改 ISP 推理网络,而用内容锚点、非平衡最优传输和颜色/结构/频域专家联合训练,在 ZRR 的同一 Restormer 非配对设置下取得 21.69 dB PSNR,并支持配对监督。
🛰️ 遥感 (39)¶
- OpenEarthAgent: A Unified Framework for Tool-Augmented Geospatial Agents
-
OpenEarthAgent 把视觉感知、GIS、光谱指数和地理配准栅格操作接到统一执行器上,再用经过回放校验的轨迹微调 Qwen3-4B,使自建测试集上的严格工具顺序匹配率从 14.71% 提升到 67.24%,但非生成任务答案准确率仍只有 45.26%。
- MMEarth-Bench: Global Model Adaptation via Multimodal Test-Time Training
-
MMEarth-Bench 用五个全球环境任务和十二种对齐模态检验遥感模型的地理泛化,并通过测试时重建这些模态来调整编码器;相对联合训练基线,TTT-MMR 在各任务与两种测试划分的汇总评估中获得改善,地理分批尤其有助于长尾样本。
- Moonstone: A Multimodal Foundation Model and Benchmark for Lunar Remote Sensing
-
Moonstone 把五台月球轨道器、七类仪器的 28 个通道对齐成一张 128 ppd(约 237 m/像素)的全球底图,用「按物理模态分组的分词器 + 共享 ViT + 覆盖率自适应掩码 + 缺失模态注意力掩码」的自监督掩码自编码器 MG-MAE 预训练,并在首个月球多模态下游基准(6 个分类/回归/分割任务)上全面超过从头训练、ImageNet、地球观测基础模型与原生 MAE 基线,地质分类 +16.2%、撞击坑分割 +14.7 mIoU。
- TerraDiT-Ω: Unified Spatial Control for Satellite Image Synthesis with Any Geospatial Primitive
-
TerraDiT-Ω 让扩散 Transformer 直接拿原生地理图元(多边形、折线、边界框、点)当空间控制信号:统一图元编码器把四类图元压成同一套实例 token,Geometry-Aware Local Attention 再把"旋转各向异性高斯 + 空间几何场"的几何先验显式乘进注意力 logits,三种条件格式下都优于稠密栅格与稀疏点基线,并用同一个模型为 4 个遥感下游任务生成增广数据。
- Beyond 2D Matching: A Unified Single-Stage Framework for Geometry-Aware Cross-View Object Geo-Localization
-
GAGeo 用 CMA-Loc 的建筑跨视角配对与相机标注适配三维基础模型 π3,把查询提示、目标定位和相机预测放进一次前向传播,并以卫星视角为对比学习桥梁,在未训练的地面到无人机组合上达到 43.86 mAcc、57.88 mIoU。
- CROSS: Cascaded Distillation and Dual-Constraint Grounding for Remote Sensing Referring Segmentation
-
CROSS 把 SAM 2 编码器里"文本过滤后的 patch 对几何亲和"作为软正则蒸进 SigLIP 2 的浅/深/末三层以补上 VLM 缺的空间结构,再用"感知式困难负样本 + 空间反事实文本"的双约束对比学习打破物体中心捷径,在 RefSegRS 上把 cIoU 推到 83.25、[email protected] 提到 41.32。
- G-ZAP: A Generalizable Zero-Shot Framework for Arbitrary-Scale Pansharpening
-
G-ZAP 用带尺度条件的隐式神经表示(INR)做全色锐化的融合骨干,配一套「全分辨率无监督光谱一致性 + 两级降分辨率构造监督」的三级协同训练,仅用测试图像对本身现场训练就能在任意放大倍率下输出 HRMS,并且训好的权重可直接复用到未见的图像对、场景与传感器上。
- GeoSolver: Scaling Test-Time Reasoning in Remote Sensing with Fine-Grained Process Supervision
-
GeoSolver 用高熵树搜索和视觉幻觉注入训练词元级 GeoPRM,再将其接入过程感知 Tree-GRPO 与测试时搜索,使遥感模型不仅优化最终答案,也受到中间视觉证据的约束;原文表 3 中,生成预算为 32 时视觉定位得分由 58.19 提升至 68.04。
- PKINet-v2: Towards Powerful and Efficient Poly-Kernel Remote Sensing Object Detection
-
PKINet-v2 用异构卷积核兼顾遥感目标的形状与尺度,再将训练时的多分支聚合等价合并以加速部署,在单尺度 DOTA-v1.0 上以 80.46% mAP 和 54.60 FPS 超过 PKINet-v1-S 的 78.39% 与 14.05 FPS。
- Recurrent Cross-View Object Geo-Localization
-
ReCOT 用携带查询目标语义的可学习 token 反复读取卫星图特征,并以 SAM 蒸馏和参考特征增强改善循环输入,在 CVOGL 测试集上达到地面到卫星 48.10%、无人机到卫星 72.05% 的 [email protected],模型参数为 29.9M。
🔍 异常检测 (8)¶
- Pistachio: Towards Synthetic, Balanced, and Long-Form Video Anomaly Benchmarks
-
Pistachio 用场景约束故事线驱动连续视频生成,构建兼顾异常检测与文本理解的合成基准,暴露复杂正常行为和长时理解的困难,并在 CLIP-TSA 实验中以合成数据结合 10% UCF-Crime 训练数据超过仅用完整 UCF-Crime 训练集的结果。
- Anomaly Factory 3D: A Modular Framework for Diverse Pseudo-Anomaly Synthesis in Unsupervised 3D Anomaly Detection
-
AF3AD 把局部几何形变做成独立的伪异常生成器,通过局部坐标、空间核、方向门控和随机预设扩展训练缺陷类型,配合改进的偏移预测器,在 AnomalyShapeNet 与 Real3D-AD 上分别达到 91.5% 和 85.2% 的物体级 AUROC。
- DeltaDeno: Zero-Shot Anomaly Generation via Delta-Denoising Attribution
-
DeltaDeno 用正常与异常提示驱动两条同步扩散轨迹,将去噪后的潜变量差异累积成缺陷定位图,再用该图约束局部生成,在不微调生成器、不使用真实异常样本的条件下,将 MVTec AD 下游图像级 AUROC 从 AnomalyAny 的 77.6 提升至 84.7。
- IMMoE: Incomplete Multi-View Anomaly Detection via Mixture of View Experts Fusion
-
IMMoE 用局部特征丢弃缓解遮挡模式过拟合,再以视图专家融合引导正常特征重建,在产品区域遮挡 50% 的 RIMAD 上取得 84.7 I-AUROC / 33.1 P-AP,但这不是对真实遮挡下隐藏缺陷可恢复性的完整证明。
- ArcAD: Anomaly-Rectified Calibration for Cold-Start Supervised Anomaly Detection
-
ArcAD 不替换重建式工业异常检测器,而是在训练时用均衡的超球面正常原型、受原型约束的伪异常和少量真实缺陷校准潜在空间,使 Dinomaly 在 Real-IAD 多类别冷启动设置下的图像级 AUROC 从 88.8% 提升到 92.5%,推理仍使用原有重建误差。
- BAAF: Universal Transformation of One-Class Classifiers for Unsupervised Image Anomaly Detection
-
BAAF 通过不相交分袋、袋外异常评分和多数投票先清洗训练图像,再训练一个原样的单类检测器,在 MVTec AD 的 10% 训练污染设置下,使八种检测器的平均图像级 AUROC 从 0.762 提升至 0.933,而不增加测试时的模型数量。
- A Comprehensive Analysis about Unsupervised Outlier Detection for Images
-
VUOD 先用细粒度聚类与距离排序一致性筛选可靠正常/异常伪标签,再训练轻量特征映射并接入 OCSVM,使同一无监督图像离群检测框架能覆盖自然、工业和医学图像,CIFAR-10 的汇总 AUROC 从 FlexUOD 的 0.942 提升至 0.972。
- Beyond Common Sense: Grounding Logical Anomaly Detection in Inspection Criteria
-
SCAN 将工业逻辑异常检测改为“拿图像逐条核验显式检验规则”,通过 FLAW 数据、结构化监督微调和规则级强化学习,让 8B 模型在 MVTec-LOCO 上的严格评分准确率从 56.73% 提高到 64.58%,但高精度并不意味着已经解决漏检。
🧑 人体理解 (120)¶
- FlowerDance: MeanFlow for Efficient and Refined 3D Dance Generation
-
FlowerDance 将 MeanFlow(用区间平均速度替代瞬时速度预测的流匹配变体)与物理一致性约束、双向 Mamba 骨干和通道级跨模态融合相结合,仅需 5-20 步采样即可生成高质量的 3D 舞蹈,在 FineDance 和 AIST++ 上达到 SOTA 的同时推理速度(2008 FPS)远超此前最佳方法(MatchDance 345 FPS),为实时 3D 渲染留出充足算力空间。
- ReMoMask: Retrieval-Augmented Masked Motion Generation
-
ReMoMask 让动作检索、训练掩码和生成时的证据融合共享身体结构,通过 HBM、TSM 与 SSTA 改善文本到动作生成,在 HumanML3D 主实验中取得 FID 0.026 和 R-Precision Top-1 0.566。
- Human Mesh Modeling for Anny Body
-
Anny 将 MakeHuman 的人工形变资产改造为可微、无需扫描数据学习体型空间的人体模型,再用 WHO 统计校准采样并生成 780k 张 Anny-One 图像,在保持成人扫描毫米级拟合能力的同时改善儿童人体网格恢复。
- RoboMirror: Understand Before You Imitate for Video to Humanoid Locomotion
-
RoboMirror 先把视频语义生成式地重建为运动潜变量,再通过经过物理仿真蒸馏的扩散策略输出机器人动作,在 Motion-X 的姿态驱动对比中将整条流程耗时从 9.22 秒降至 1.84 秒,同时将成功率从 0.94 提高到 0.95。
- Forge4D: Feed-Forward 4D Human Reconstruction and Interpolation from Uncalibrated Sparse-View Videos
-
Forge4D将动态人体与交互物体的重建拆成尺度一致的流式3D高斯预测和双向稠密运动匹配,再通过遮挡感知融合生成中间时刻;在DNA-Rendering的新时刻与新视角联合评测中达到29.0378 dB PSNR,无需输入相机标定参数。
- VersatileMotion: A Unified Framework for Motion Synthesis and Comprehension
-
VersatileMotion 通过保留世界坐标的因果人体分词器 VerMoVQ,把文本、音频和多人动作组织为统一的下一 token 预测问题,在同一个模型中覆盖九项动作任务,并在作者评测协议下取得有竞争力的生成与理解结果。
- Fast Sam 3D Body: Accelerating SAM 3D Body for Real-Time Full-Body Human Mesh Recovery
-
Fast SAM 3D Body 在冻结 SAM 3D Body 权重的前提下重排身体与手部的计算依赖、精简解码,再用单独训练的 MLP 加速 MHR 到 SMPL 的转换,使人体重建更接近交互速度,但收益必须连同数据集、硬件和精度变化一起理解。
- ECHO: Ego-centric Modeling of Human-Object Interactions
-
ECHO 将人体动作、物体轨迹与接触作为相互约束的扩散变量,在已知物体几何的前提下从头部和双腕追踪恢复完整交互,并通过混合动作数据训练与平滑修补,在 BEHAVE 上实现 6.8±0.1 cm 的人体 MPJPE 和 33.5±0.5 cm 的物体顶点误差。
- ActionPlan: Future-Aware Streaming Motion Synthesis via Frame-Level Action Planning
-
ActionPlan 先生成与时间轴对齐的动作语义计划,再通过逐潜变量噪声调度重叠生成 3D 人体动作,使同一模型兼顾离线质量与流式输出,在 HumanML3D-272 测试集上将流式 FID 从 MotionStreamer 的 11.790 降至 5.735。
- UniMotion: A Unified Framework for Motion-Text-Vision Understanding and Generation
-
UniMotion 把人体运动当作与 RGB 平权的连续模态塞进一个共享 LLM,用连续运动 VAE(CMA-VAE)+ 双路 embedder 替代离散 token,配合双后验 KL 对齐(DPA)注入视觉语义先验、潜空间重建对齐(LRA)解决运动通路冷启动,在 Motion-Text-RGB 三模态的理解、生成、编辑七个任务上做到统一并全面 SOTA。
📹 视频理解 (110)¶
- EventMemAgent: Hierarchical Event-Centric Memory for Online Video Understanding with Adaptive Tool Use
-
EventMemAgent 用按事件组织的分层记忆压缩视频历史,再让 Qwen3-VL-8B 通过强化学习掌握检索、OCR 和目标检测的调用时机,在最多 32 帧短期缓存下实现 OVO-Bench 60.75% 的总体成绩。
- History-Aware Transformation of ReID Features for Multiple Object Tracking
-
HATReID-MOT 将已有轨迹当作在线伪类别,用时序加权的 Fisher 线性判别构造当前视频专用的 ReID 子空间,再融合原始相似度,在不额外训练网络的条件下使 SportsMOT 测试集的默认外观基线 HOTA 从 67.3 提升到 78.1。
- MegaFlow: Zero-Shot Large Displacement Optical Flow
-
MegaFlow 用预训练视觉几何先验建立跨帧特征,以全局匹配确定大运动的落点,再用局部与时序信息细化,在四帧 Sintel Final 零样本评测取得 1.83 EPE,并支持无需跟踪监督的点跟踪迁移。
- TAR: Temporal Anchor-Constrained Reasoning for Video Temporal Grounding
-
TAR 把可与真实时间区间核验的中间锚点写进视频推理链,用渐进修正与数量惩罚约束强化学习,再通过同规模模型自举数据完成冷启动,使 7B 模型在 Charades-STA 上达到 61.1 mIoU。
- Bounding-Box Trajectories Matter for Video Anomaly Detection
-
TrajVAD 把检测跟踪已产生的边界框轨迹提升为主要异常信号,用类别感知归一化流学习正常运动;纯轨迹版在 ShanghaiTech 达到 87.7 AP,加入可靠性门控姿态分支后达到 88.6 AUROC 和 90.9 AP,但姿态并非在所有数据集上都有收益。
- CurveStream: Boosting Streaming Video Understanding in MLLMs via Curvature-Aware Hierarchical Visual Memory Management
-
CurveStream 用视觉特征轨迹的转向程度识别语义变化,再以在线双阈值决定帧的高清保留、低清保留或丢弃,在不训练模型的条件下,将 Qwen2.5-VL-7B 的 StreamingBench / OVOBench 准确率从 73.31% / 59.90% 提升到 84.00% / 73.48%。
- EgoExo-Con: Exploring View-Invariant Video Temporal Understanding
-
本文提出 EgoExo-Con 基准(1,148 对同步 ego-exo 视频 + 2,269 条人工精炼的时序查询),首次系统评估 Video-LLM 在不同视角下时序理解的一致性,发现现有模型跨视角一致性仅勉强达到单视角性能的一半;并提出 View-GRPO 强化学习框架,通过语义对齐与结构一致性双重推理奖励,显著提升跨视角时序理解的鲁棒性和一致性。
- Em-Garde: A Propose-Match Framework for Proactive Streaming Video Understanding
-
Em-Garde 把每帧都要完成的复杂“是否回答”推理改写为查询时一次性的视觉提案生成与流内轻量匹配,在 OVO-Bench 上取得 30.99 平均 F1、在 StreamingBench 上取得 38.0% 主动响应准确率,并以约 13 fps 维持恒定长度的流式计算。
- OmniScript: Towards Audio-Visual Script Generation for Long-Form Cinematic Video
-
OmniScript 将电影视频转写为带时间定位的分层剧本,通过角色记忆辅助的数据构建、视听深层融合、剧情思维链与事件级分段奖励,使 8B 模型在 5 分钟视频上的事件 Overall F1 达到 37.7、[email protected] 达到 69.3,但尚未全面超过闭源模型。
- Small Vision-Language Models are Smart Compressors for Long Video Understanding
-
Tempo 用 2B 小型视觉语言模型把视频片段压缩成查询相关记忆,再交给 4B 全局语言模型回答问题,并在推理时按相关性分配 token;在最多 1024 帧、4K 视觉预算下,LVBench 得分达到 52.7,超过 VideoChat-Flash 的 48.2。
🚗 自动驾驶 (160)¶
- Masked Depth Modeling for Spatial Perception
-
MDM 将传感器缺失深度变成有物理来源的掩码,在完整 RGB 与剩余深度的联合注意力中学习几何表征,使 NYUv2 极端缺失设置的 RMSE 从 PromptDA 的 0.324 降至 0.167,并改善真实机器人抓取。
- MindDrive: A Vision-Language-Action Model for Autonomous Driving via Online Reinforcement Learning
-
MindDrive 用共享语言模型、独立 LoRA 的决策专家与动作专家,把在线探索限制在离散驾驶意图上,再由实际轨迹的闭环奖惩优化决策;3B 版本在 Bench2Drive 上达到 80.59 DS、58.26% SR,但验证范围仍限于 CARLA 仿真。
- UniDrive-WM: Unified Understanding, Planning and Generation World Model for Autonomous Driving
-
UniDrive-WM 在单一 VLM 框架中联合实现场景理解、轨迹规划和轨迹条件未来图像生成,通过规划→生成的可微双向耦合,在 Bench2Drive 闭环评估中将 Driving Score 从 77.74 提升至 79.31,L2 轨迹误差降低 7.3%、碰撞率降低 10.4%,并在两个互补的图像生成分支(离散自回归与连续扩散)之间系统分析了速度-保真度的权衡关系。
- DriveVA: Video Action Models are Zero-Shot Drivers
-
DriveVA 提出一种统一的视频-动作世界模型,将未来视频预测与轨迹规划放在同一个 DiT 扩散生成过程中联合解码,利用大规模视频生成模型(Wan2.2-TI2V-5B)的时空先验实现强零样本跨域泛化,在 NAVSIM 上达到 90.9 PDMS,并在 nuScenes 和 Bench2Drive 上分别降低 78.9% 和 52.5% 的平均 L2 误差与 83.3% 和 52.4% 的碰撞率。
- SparseDriveV2: Scoring is All You Need for End-to-End Autonomous Driving
-
SparseDriveV2 不动态生成轨迹,而是把路径和速度曲线组成超密静态候选空间,再通过因子级粗筛与轨迹级精评分选出驾驶动作,以 ResNet-34 在 NAVSIM v1/v2 分别取得 92.0 PDMS 和修正协议下的 90.1 EPDMS。
- Driver-WM: A Driver-Centric Traffic-Conditioned Latent World Model for In-Cabin Dynamics Rollout
-
把「舱内驾驶员未来会怎么动」当成一个在潜在空间里、由舱外交通事件因果驱动的 rollout 问题来做:用冻结的 Qwen3-VL 特征当感知接口,双流分别编码交通和驾驶员,再用一个「门控因果注入」让外部环境单向调制驾驶员内部状态的自回归演化,最终解码成未来 5 步的人体骨架轨迹(外加行为/情绪语义作辅助正则),在 AIDE 上于安全攸关的高动态片段上取得稳健的长时预测。
- UniDriveDreamer: A Single-Stage Multimodal World Model for Autonomous Driving
-
UniDriveDreamer 将视频与 LiDAR 潜变量校准后送入同一个生成 Transformer,通过双向交互联合合成多传感器序列,在 nuScenes 上获得 FID 2.81、FVD 11.44,并带来受控检测实验中的数据增强收益。
- ExploreVLA: Dense World Modeling and Exploration for End-to-End Autonomous Driving
-
提出统一理解-生成框架 ExploreVLA,在 VLA 驾驶模型中引入未来 RGB + 深度图像生成作为密集世界建模目标,并利用世界模型的图像预测不确定性作为内在探索奖励,通过安全门控 GRPO 让策略超越模仿学习分布、发现多样且安全的驾驶行为,在 NAVSIM 上取得 93.7 PDMS 和 88.8 EPDMS 的 SOTA。
- Beyond Imitation: Learning Safe End-to-End Autonomous Driving from Hard Negatives
-
BeyondDrive 不只让规划器靠近专家轨迹,还让它远离“离专家很近却不安全”的生成轨迹,在优化后 LTF 基线上将 NAVSIM v1 PDMS 从 88.7 提升到 89.7、NAVSIM v2 EPDMS 从 89.1 提升到 90.1,并展示跨规划器及 HUGSIM 零样本迁移结果。
- CausalDrive: Real-time Causal World Models for Autonomous Driving
-
CausalDrive 仅以初始前视图、自车轨迹和全局交互提示生成可反应的驾驶视频,通过因果自回归教师与上下文强制 DMD 将推理压缩到 1–4 步,在单张 A100 上达到 12.4 FPS,并在 SocioDrive-Bench 的 Polite 条件下取得 82.0% 的让行率,但并未消除所有虚假碰撞。
🤖 机器人/具身智能 (129)¶
- VLA-JEPA: Enhancing Vision-Language-Action Model with Latent World Model
-
VLA-JEPA 让只看到初始图像与指令的视觉语言模型产生潜在动作,通过预测未来的 V-JEPA2 状态表示学习操作语义,再用流匹配生成机器人动作;正文表 1、表 3 的 LIBERO 和 LIBERO-Plus 成功率分别为 97.2% 和 78.1%。
- VLA-R1: Enhancing Reasoning in Vision-Language-Action Models
-
VLA-R1 以 Qwen2.5-VL-3B 为骨干,先用 VLA-CoT-13K 学习有几何标注约束的具身推理,再用 GRPO 优化区域、轨迹与格式奖励,在域内评测中取得 36.51% IoU 和 91.74 的平均轨迹误差,但真实机器人结果仍需结合小样本设置及原文数字冲突解读。
- RoboClaw: An Agentic Framework for Scalable Long-Horizon Robotic Tasks
-
RoboClaw 让同一个 VLM 智能体负责机器人数据采集与任务执行,用正逆动作配对实现自动复位、用在线监督组织多个 VLA 策略,在真实机器人实验中降低人工采集时间,并使四类操作策略随闭环数据迭代持续改善。
- Robobench: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models as Embodied Brain
-
RoboBench 用覆盖五类具身认知的 6092 道问答和基于动作依赖图的 MLLM 世界模拟裁判评估 18 个模型,发现较强的通用问答与规划表述能力仍不能保证隐式需求理解、空间落地和真实执行错误诊断。
- EchoVLA: Robotic Vision-Language-Action Model with Synergistic Declarative Memory for Mobile Manipulation
-
EchoVLA把“环境中有什么、在哪里”的体素场景记忆与“刚才做过什么”的情景记忆分开维护,经粗细粒度检索共同引导底盘和机械臂扩散策略,在RoboCasa移动操作上取得0.31平均成功率,高于同表π0.5的0.20。
- World Models for Learning Dexterous Hand-Object Interactions from Human Videos
-
DexWM 用手部关键点差分与相机运动驱动潜在世界模型,并通过手部一致性监督保留局部细节;在人类与平行夹爪视频预训练、约 4 小时目标机器人仿真探索微调后,通过模型内规划实现真机抓取 10/12 次成功,零样本指未见目标具身上的测试技能且无真机微调,而不是完全不使用目标具身数据。
- RL from Physical Feedback: Aligning Large Motion Models with Humanoid Control
-
RLPF 将人形机器人在仿真中的动作跟踪成败与文本语义匹配共同作为强化学习奖励,微调大动作模型,并通过 Hierarchical RLPF 交替改进生成器和控制器,使动作更可执行而不退化为与指令无关的简单站立。
- Scaling Verification Can Be More Effective than Scaling Policy Learning for Vision-Language-Action Alignment
-
CoVer-VLA 在不修改部署策略参数的情况下,用成功示范训练的对比验证器联合筛选指令改写与动作块,使 PolaRiS 上的平均任务进度由 40.0% 升至 53.9%、成功率由 3.8% 升至 13.1%,表明验证可以成为扩大策略训练之外的一条有效路径,但其收益受候选质量和额外计算开销约束。
- MobileVLA-R1: Reinforcing Vision-Language-Action for Mobile Robots
-
MobileVLA-R1 用多粒度思维链监督建立可解析的推理与动作接口,再以离线 GRPO 奖励优化连续运动方向、离散行为和输出格式,在 R2R-CE Val-Unseen 达到 68.3% SR,并通过固定机载与远端混合部署验证四足机器人闭环执行。
- Towards Generalizable Robotic Manipulation in Dynamic Environments
-
针对现有 VLA 只会抓静止物体、面对运动目标就失灵的痛点,本文构建了含 11.7 万条轨迹、35 个任务的动态操作基准 DOMINO,并提出用「历史光流 + 物体级未来特征预测」武装 VLA 的 PUMA 架构,在动态任务上把成功率绝对提升 6.3%。
🎮 强化学习 (12)¶
- ELVA: Exploring Ranking-Driven Universal Multimodal Retrieval
-
ELVA 提出基于规则的可验证奖励 RL 框架,通过排序奖励和间隔奖励联合优化 MLLM 的检索排序能力,解决对比学习适配检索任务时产生的"粒度盲区"(grain blindness)问题,在 M-BEIR 和自建多粒度基准 MRBench 上均取得 SOTA,其中 MRBench 提升 13.1%。
- Teaching an Agent to Sketch One Part at a Time
-
本文先把矢量草图自动标注为语义部件,再以 SFT 和多轮过程奖励 GRPO 训练视觉语言智能体,使其观察当前画布、逐部件添加曲线;用户研究中,完整模型相对 SketchAgent 的最终质量偏好率为 77.5%。
- GoStop: Reinforcement Learning for Adaptive Temporal Aggregation in Event-Based Feature Tracking
-
针对传统事件特征跟踪采用固定时间窗导致在剧烈变速或微小运动下崩溃的难题,GoStop 首次将事件累积建模为时序决策过程,通过带特权信息引导的强化学习智能体动态决定继续累积(go)还是触发推理(stop),在大幅降低推理延迟的同时显著提高跟踪精度与鲁棒性。
- FedDO: Dynamic Client Optimization for Adaptive Federated Learning
-
FedDO 将联邦学习中的客户端协同建模为连续动作控制问题,利用带三重精化的分布软行动者-评论家(DSAC-T)强化学习代理动态分配各客户端的数据使用比例,并引入低秩参数化重构支持大规模扩展,有效克服了统计异质性与样本规模不平衡导致的梯度漂移。
- From Illusion to Intention: Visual Rationale Learning for Reliable Evidence Acquisition
-
针对多模态大模型在“以图思考”时因仅受结果奖励监督而出现的动作与推理脱节、“思考幻觉”及冗余裁剪问题,本文提出视觉意图学习(ViRL),通过端到端强化学习结合证据对齐数据、阶梯式保真度奖励与细粒度信用分配,实现了忠实且高效的视觉证据获取。
- HERO: Enhancing Multimodal Faithfulness via Dynamic Entropy-Aware Reinforcement Learning
-
提出 HERO 在线强化学习框架,揭示多模态 CoT 推理在图像退化下退守语言先验导致低熵高置信幻觉的“置信度陷阱”,通过动态熵感知加权反向严惩高置信错误,并结合方差门控采样高效挖掘困难负样本,显著提升多模态忠实度。
- Molecular Identifier Visual Prompting and Verifiable Reinforcement Learning for Chemical Reaction Diagram Parsing
-
针对化学反应图解析中视觉化学实体与预训练先验割裂及序列化监督失配问题,本文提出基于分子标识符的视觉提示策略(IdtVP)与反应级可验证强化学习算法(Re3-DAPO),显著提升零样本理解与跨年代扫描文献的泛化鲁棒性。
- Reinforcement Learning for Multimodal Diffusion Language Models via Bidimensional Trajectory and Thought Optimization
-
针对多模态扩散语言模型在后训练中忽视去噪时序与空间推理二维特性的难题,Bi-VRL 提出了融合时序轨迹级价值分配与空间思维级细粒度对齐的双维度强化学习框架,在离散视觉 token 与连续视觉特征架构上均取得显著推理性能提升。
- Table-MCR2TR: Merged-Cell-Aware Table Recognition via Reinforced Multimodal Language Models
-
Table-MCR2TR 针对表格识别中合并单元格难以准确解析的痛点,构建了富含复杂合并单元格的 MCT-350K 数据集,并通过多任务渐进式对齐与基于 GRPO 的三元协同奖励强化学习(M-CRL),使 3B 规模模型在多基准上超越 Gemini-2.5-Pro 等顶尖模型。
- TiCRL: Textual Image Classification with Reinforcement Learning-Based Curriculum Learning
-
TiCRL 提出了一种无需 OCR 的视觉-文本混合难度度量器与基于 DDPG 的动态训练调度器,通过强化学习根据分类器训练反馈自适应调控样本难度门限,在仅用约 58%~82% 训练样本的情况下显著超越全量数据基线与预设课程学习方案。
🔄 自监督/表示学习 (22)¶
- V-JEPA 2.1: Unlocking Dense Features in Video Self-Supervised Learning
-
V-JEPA 2.1 把视频潜空间预测的监督扩展到可见位置和多个网络深度,在增强局部时空结构的同时恢复全局语义能力,其 ViT-G 在冻结特征评测中达到 NYUv2 深度 RMSE 0.307 和 SSv2 动作识别准确率 77.7%。
- The Prism Hypothesis: Harmonizing Semantic and Pixel Representations via Unified Autoencoding
-
UAE 将预训练视觉表示拆成需要保留语义的低频基底和可以学习像素细节的高频残差,通过选择性蒸馏与高频掩码重建统一两种能力,表 1 的 DINOv2-B 配置在 ImageNet-1K 上达到 PSNR 32.17、SSIM 0.92 和 rFID 0.35。
- DSeq-JEPA: Discriminative Sequential Joint-Embedding Predictive Architecture
-
DSeq-JEPA 在 I-JEPA 的潜在空间预测目标上加了两个归纳偏置——先用目标编码器的 CLS–patch 相似度显著图挑出并按判别性给区域排序(决定「预测哪里」),再让预测器沿这个顺序逐区域预测下一个区域的嵌入(决定「按什么顺序预测」)——在 ImageNet 线性探针上比 I-JEPA 提升 1.1/0.8/1.3 个点(ViT-B/L/H),并在细粒度识别、COCO/ADE20K 与 CLEVR 上一致获益,而推理端零额外开销。
- Towards Geometry-Grounded Dense Semantic Matching with VGGT Priors
-
本文把 VGGT 从同实例跨视角重建迁移到跨实例稠密语义匹配,通过直接预测双向采样网格、合成稠密监督和循环一致性训练,同时改善对应精度、局部结构保持与不可见区域的可靠性估计。
- GhostPoint: Self-Supervised Representation Learning by Hallucinating Occluded LiDAR Structure
-
GhostPoint 指出 LiDAR 自监督预训练的学习信号几乎只定义在可见表面的回波点上、对遮挡与无回波区域不加约束,于是用「实例体素膨胀」在伪实例周围生成同时含可见、掩码与无回波体素的邻域体素集,让一个轻量预测器从观测上下文幻觉出这些位置的特征,并用不对称教师目标(占据体素对齐教师编码器、无回波体素对齐教师预测器)把伪遮挡与真遮挡统一到同一个自蒸馏目标下,在 nuScenes 与 Waymo 上把预训练骨干的下游 3D 检测推到 SOTA(全参数微调后 nuScenes 67.5 mAP / 71.2 NDS)。
- Human-like Object Grouping in Self-supervised Vision Transformers
-
本文把经典「双点同/异物体判断」心理物理学范式放大成 255 张 COCO 自然场景、1020 个试次的人类行为基准,用两个点所在 patch 特征的简单 MLP 读出预测人的判断与逐试次反应时,发现 DINO 系自监督 ViT 对齐最好(分组准确率最高 91.9%),并提出基于亲和图 ROC 的「物体中心性 AUC」——该指标跨 9 个模型与行为对齐强相关(Spearman r=0.950),最后用 Gram 矩阵蒸馏把监督模型的分组准确率提升约 8–18 个百分点。
- Implicit Neural Representation Facilitates Unified Universal Vision Encoding
-
本文把面向图像的隐式神经表示(INR)超网络训练成统一视觉编码器 HUVR:同一套 ViT 骨干既输出标准 token、又输出最多小 96 倍的压缩 token(TinToks)和逐 patch 的 INR 调制量,以像素重建加教师蒸馏做自监督预训练,使同一份表示在分类、语义分割、深度估计和图像重建上同时可用。
- Vision-TTT: Efficient and Expressive Visual Representation Learning with Test-Time Training
-
本文把 NLP 里的测试时训练(Test-Time Training, TTT)搬进视觉,把一张图的 token 序列当成一个数据集、用自监督重建的梯度下降在线更新每个 head 的隐状态,并用「双数据集策略 + Conv2d 数据集预处理」把只会单向建模的 TTT 改造成有 2D 感受野的视觉主干,ImageNet 上 Vittt-T/S/B 达 77.7/81.8/82.7 Top-1,1280×1280 分辨率下比 DeiT-T 省 79.4% FLOPs、快 4.72×、省 88.9% 显存。
- Bottom-up modeling of repeated elements via single image analysis-by-synthesis
-
本文通过可调外观的共享二维原型、单图裁剪课程优化和整图筛选精修,把重复元素发现转化为可解释的重建问题;在精选的 116 张 FSC-147 图像上,整图 PSNR 达到 23.76,计数 MAE 为 14.11,但这并不意味着整个系统没有预训练或尺度先验。
- DP-BOA: Dirichlet-Process Birth-or-Assign for On-the-Fly Category Discovery
-
DP-BOA 将逐样本的在线类别发现改写为“已有类归属证据与新类出生证据”的贝叶斯比较,通过已知类先验校准、全协方差预测和在线统计更新,在 CUB 上达到 53.4% 总体、51.6% 新类聚类准确率,但并非所有数据集或已知类指标都领先。
📐 优化/理论 (13)¶
- LDC-MTL: Balancing Multi-Task Learning through Scalable Loss Discrepancy Control
-
LDC-MTL 用双层优化显式约束任务损失差异,再通过省略一个经验上很小的梯度项实现单循环一阶训练,在 CelebA 上取得 -1.31 的综合相对性能下降指标,训练耗时为线性标量化基线的 1.07 倍。
- HSFM: Hard-Set-Guided Feature-Space Meta-Learning for Robust Classification under Spurious Correlations
-
HSFM 冻结 ERM 预训练骨干,把一小撮训练样本在特征空间里的嵌入当作可学习参数,用"模型自己在高损失样本上的表现"构造双层元目标(内层适配线性头、外层最小化硬集损失)来优化这些嵌入;只需单卡几分钟,就在 Waterbirds、Dominoes 等伪相关基准上取得与使用组标签的方法相当的最差组精度,还能把优化出的特征位移经 unCLIP 解码回图像、直观暴露模型的伪相关依赖。
- Why Can Accurate Models Be Learned from Inaccurate Annotations?
-
论文把「不准的标注为什么还能训出准模型」拆成可分析的问题:错误标注只把噪声沉积在分类权重矩阵的低阶奇异分量上,中等错误率下主奇异子空间几乎不旋转,因而任务相关知识仍在——作者用奇异值谱、Grassmann 子空间相似度和 Davis-Kahan 角度界从实证与理论两侧论证这一点,并据此提出免训练后处理插件 LIP(保留前 k 个奇异分量 + 用训练集重估被压平的尾部奇异值),在 11 个基线、6 个真实部分标签数据集与 CIFAR/CUB 噪声设置上普遍涨点。
- Coordinate Singularities Break Conformal Coverage for Gaze and Head Pose
-
揭示了视线与头部姿态估计中由于采用偏航-俯仰或欧拉角等局部坐标图定义符合预测非符合性度量,会导致奇异点附近出现严重的局部覆盖率坍塌(名义90%覆盖率在极点附近暴跌至38.9%),证明了标量自适应校准无法修复形状畸变,并提出基于流形内蕴测地距离的免重训、零开销解决方案。
- Dive into the implicit biases of low-rank vision-language alignment
-
本文挑战了视觉语言对齐必须进行全参数微调的传统认知,实证发现低秩对齐在大幅降低训练开销的同时全面超越全参数基线,并从行为、特征几何与优化理论三个维度揭示了低秩对齐保留模态共性结构、抑制线性可分性崩溃(LS-curse)并偏好平坦鲁棒子空间的隐式偏差机制。
- RBE-Flow: Recurrent Bayesian Estimation on Feature Manifolds for Cross-Modal Registration
-
将跨模态密集光流估计重新建模为特征流形上的闭环递归贝叶斯状态估计问题,通过 RMO(递归流形优化)生成带不确定性的流观测、UAPU(不确定性自适应概率更新)用 Sigma 点投影进行 MMSE 最优贝叶斯融合并将后验协方差反馈调节下一次优化,在 OSdataset、WHU-OPT-SAR 和 RoadScene 三个跨模态数据集上一致达到 SOTA,AEPE 相比此前最佳方法降低 45.4%。
- SUM: Unified Geometric Surgery on Spatio-Temporal Adaptation Vectors for Federated Class Incremental Learning
-
将联邦类增量学习(FCIL)重塑为统一多任务学习框架,在纯服务端通过几何投影对客户端与任务间的时空适应向量执行正交化手术与符号共识合并,在不增加客户端任何计算/通信开销的前提下大幅消除空时灾难性遗忘。
- AnaPFL: When Closed-Form Solutions Meet Generalization and Personalization in Personalized Federated Learning
-
AnaPFL 在冻结视觉特征上先解析聚合全局主分支、再为各客户端解析拟合局部残差,只需一轮聚合,在三个视觉数据集的 18 种设置下比各设置最强基线提高 1.57–16.71 个准确率百分点。
- Can Vision Models Truly Forget? Mirage: Representation-Level Certification of Visual Unlearning
-
针对视觉模型遗忘验证仅依赖输出端指标而掩盖表征残留的严重缺陷,本文提出表征级审计框架 Mirage,通过线性探针恢复度、CKA 全局对齐、特征可分性与逐层追踪四项诊断,揭示了“输出遗忘但表征残留”的遗忘假象以及效用、行为遗忘、表征遗忘无法兼得的三难困境。
- H-SFP: Hierarchical Federated Learning with Decoupled Split-Model Prototyping
-
针对传统切分联邦学习跨层传输高维激活与反向传播梯度的带宽瓶颈,H-SFP 提出解耦统计原型机制,仅上传类别一阶均值与二阶方差并在边缘与云端合成高斯特征分布进行分层训练,在削减超两个数量级通信开销的同时显著抑制非独立同分布下的客户端漂移。
📐 学习理论 (1)¶
- Pay Attention to Attention Distribution: A New Local Lipschitz Bound for Transformers
-
本文把注意力概率分布引入自注意力 Jacobian 的局部上界,以更紧的 softmax 谱估计构造 JaSMin 正则项,在 ViT-B 上提高部分对抗攻击下的准确率,同时揭示鲁棒性、干净准确率与梯度传播之间的取舍。
🔗 因果推理 (3)¶
- CausalVAE as a Plug-in for World Models: Towards Reliable Counterfactual Dynamics
-
把 CausalVAE 的因果层拆成一个只作用于隐空间的即插即用模块,插在任意「编码器 + 动作条件转移」主干之间,用一个可学习的 DAG 邻接矩阵组织隐变量,在不改动主干预测架构的前提下显著抬高干预场景下的反事实检索(Physics 3-body 上 GNN_NLL 的 CF-H@1 从 11.0 涨到 41.0),同时基本保住事实预测精度。
- SPARC: Scalable Path-Specific Counterfactual Fairness via Causal Conditional Independence
-
SPARC 将高维输入上的路径特定反事实公平性转化为标签条件下的敏感属性独立性目标,以互信息预训练保留诊断信息、以条件对抗掩码抑制不公平路径,在三个医学数据集上改善公平性,但相对无约束模型仍存在预测性能代价。
- FD\(^2\): A Dedicated Framework for Fine-Grained Dataset Distillation
-
FD\(^2\) 针对现有解耦式数据集蒸馏方法在细粒度数据集上忽略了判别性局部区域的问题,通过引入反事实注意力学习(CAL)提取判别性注意力图和类别原型,并在蒸馏阶段加入细粒度特征约束和同类样本相似度约束,作为即插即用模块显著提升 SRe2L++ 和 FADRM+ 在 CUB-200-2011、FGVC-Aircraft、Stanford Cars 等细粒度数据集上的蒸馏质量,IPC=1 时最大提升 +15.1%。
🔬 可解释性 (31)¶
- CFM: Language-aligned Concept Foundation Model for Vision
-
CFM 将语言对齐视觉特征分解成有空间位置、层级关系和文本名称的稀疏概念,在基本保留分类、分割与图像描述性能的同时,让下游预测能够被概念化解释和干预。
- On the Reliability of Cue Conflict and Beyond
-
本文系统质疑了被广泛使用的 cue-conflict 基准在刺激构造与度量两端的可靠性,指出风格迁移线索纠缠、线索信息量失衡、比率型偏差掩盖绝对敏感度、受限标签空间扭曲预测四类问题,并用"人类感知定义 + 可控纯化生成 + 全标签空间 MRR 敏感度度量"的 REFINED-BIAS 框架给出替代方案,在 32 个训练策略模型、多类架构、OpenCLIP/DINOv2 大模型与多级量化模型上消解了原基准无法解释的矛盾结论。
- Seeing Through Circuits: Faithful Mechanistic Interpretability for Vision Transformers
-
把 ViT 的计算图形式化为残差流上的有向图,用「语义分割 + 修复」构造干净/腐化输入对、以目标 logit 差为准则做顺序边剪枝(Vi-CD),在 ViT-B 与 OpenCLIP 上自动发现保真且比最强基线稀疏约 10 倍的类专属电路,并证明这些电路能作为因果开关去抵御 CLIP 排版攻击、压低 RoCOCO 危险检索分数。
- Caption Bottleneck Models
-
CaBM 将图像先转成去除类别名称的自然语言描述,再由独立的纯文本分类器识别类别,并从分类证据中发现概念,在切断视觉特征旁路的同时取得有竞争力但并非全面领先的分类表现。
- DEX-AR: A Dynamic Explainability Method for Autoregressive Vision-Language Models
-
DEX-AR 把每个生成步的注意力图对中间 logit 的梯度当作归因信号,再用"视觉 vs 文本最大梯度差"动态筛选注意力头与生成 token,为自回归 VLM 同时产出逐 token 与整句两个级别的图像热图,在 ImageNet/VQAv2 的扰动评测与 PascalVOC 的分割定位上稳定超过 Grad-CAM、注意力类与扰动类基线。
- From Drop-off to Recovery: A Mechanistic Analysis of Segmentation in MLLMs
-
本文不在 MLLM 上加任何新模块,而是用三组可干预的实验拆解适配器式 MLLM 的分割能力:逐层线性探针发现 adapter 把视觉特征投影进语言空间时出现表示 drop-off,而 LLM 各层又逐步把 mIoU 找回来;注意力阻断证明这种恢复不是残差连接的被动副作用,而是靠跨 token 注意力让分类正确的 token 充当「语义锚点」把误判邻居拉回正确标签;最后指出因果掩码让序列最前面的图像 token 缺乏全局上下文,这一损失可由图像 token 之间的双向注意力消除。
- ProLaViT: Learning Progressive Latent Visual Thoughts in Structured Latent Space
-
ProLaViT 将程序合成的视觉操作轨迹蒸馏为四步连续潜在状态,再按步骤距离约束状态差异,使 Qwen2.5-VL-7B-Instruct 不调用推理时视觉工具也能逐步推理,BLINK-Jigsaw 准确率由基座的 59.33% 提升至 76.00%。
- This Looks Distinctly Like That: Grounding Interpretable Recognition in Stiefel Geometry against Neural Collapse
-
AMP 将每类原型改成 Stiefel 流形上的正交基,再用稀疏容量和空间约束筛选、定位不同证据,在 CUB 的 ResNet50 设置下取得 88.4% 准确率,但其严格保证针对基向量的秩,并不自动等于语义部件互异。
- Towards Robustness against Typographic Attack with Training-free Concept Localization
-
本文把排版攻击的脆弱性定位到 CLIP ViT 中少数「读文字」的注意力头上:在注意力头子空间里随机采样概念方向、用梯度归因打出文本聚焦分数 nTAS 来挖出这些头,再在推理期免训练地对它们做注意力重加权或零消融,在 5 个 CLIP 主干和 4 个排版攻击基准上把目标分类准确率平均提升 6 个百分点以上,同时把文字混淆率压低 10–36 个百分点。
- World Knowledge in the Weights: Reading Concept Circuits of Vision Transformers
-
该工作把跨层转码器(CLT)从语言模型移植到 ViT,直接从输入不变的编码/解码权重读出全局概念电路(模型的"世界知识")、从稀疏激活读出实例概念电路;共激活重加权后的全局权重经均值消融验证确实承载功能重要性,由此实现无人工标注的自动伪相关发现(Freight Car→graffiti、Hummingbird→bird feeder)与 Waterbird 最差组 +23% 的干预去偏,CLT 电路在忠实性/完备性上全面超过 SAE 基线。
📦 模型压缩 (92)¶
- GenRecal: Generation after Recalibration from Large to Small Vision-Language Models
-
GenRecal 在训练时用 Recalibrator 将小型视觉语言模型的隐藏特征接入教师的语言头,绕过跨 tokenizer 的直接 token 对应问题,使 InternVL2.5-8B 的 MMMU 从 56.0 提升至 68.1,部署时则移除全部辅助模块,保持学生原有架构。
- Towards Consistent and Efficient Dataset Distillation via Diffusion-Driven Selection
-
本文把预训练扩散模型从图像生成器改作真实数据的区域选择器,通过类别条件差异定位和 DIFT 聚类构建可复用的压缩训练集,在 ImageNet-1K、IPC=50 的主实验中取得 \(61.0\pm0.3\%\) 分类准确率。
- Enhancing Pretrained Model-based Continual Representation Learning via Guided Random Projection
-
SCL-MGSM 用首任务标签和残差逐批筛选随机投影基,再冻结表示并递归更新岭回归分类器,在不保存历史样本的类增量学习中改善表达能力与数值稳定性,ImageNet-R 的 B-0 Inc-10 最终准确率达到 77.12%。
- Quick ViTs: Speeding up Vision Transformers through Equivariance
-
Quick ViTs 将旋转与反射等变性变成傅里叶域线性层的结构化稀疏和权重共享,使 H8(ViT-H/14) 在 ImageNet-1K 监督分类中以 102.3G 而非 167.8G FLOPs 达到 85.0% 而非 84.6% Top-1,同时说明理论 FLOPs 节省为何不等于同倍率实际加速。
- PuzLM: Solving Jigsaw Puzzles with Sequence-to-Sequence Language Models
-
PuzLM 用轻量的边界词元化把图像拼块变成符号序列,再让标准编码器–解码器模型预测每块的网格位置,在 ImageNet 3×3 上取得 92.2% 拼块位置准确率和 87.1% 完整拼图准确率。
- Audio-Visual Continual Test-Time Adaptation without Forgetting
-
AVReCAP 在视听模型持续测试时适应中,用输入统计检索并复用历史融合层参数,而非一直覆盖同一状态;在 VGGSound-2C 上平均准确率达到 43.51%,比不适应的源模型高 6.28 个百分点,并显著缓解源域遗忘。
- LANCE: Low Rank Activation Compression for Efficient On-Device Continual Learning
-
LANCE 在微调开始前用一次高阶奇异值分解(HOSVD)为每层激活标定一组固定的低秩投影子空间,训练时只把激活压缩成核张量存进内存、反向用同一组正交因子重投影出梯度贡献,把激活峰值显存压到全量 BP 的 1/25 到 1/380;同一套固定子空间还可以在离线标定阶段按任务分配到彼此正交的零空间里,从而在不存回放样本、不驻留大矩阵的前提下做端侧持续学习。
- Pathryoshka: Compressing Pathology Foundation Models via Multi-Teacher Knowledge Distillation with Nested Embeddings
-
Pathryoshka 把三位大型病理基础模型的全局与空间知识压入一个支持前缀截断的学生,在 86M 参数下取得十项分类基准 85.6 的准确率中位数,同时降低编码与特征存储成本。
- Shared LoRA Subspaces for almost Strict Continual Learning
-
Share 将不断到来的数据或 LoRA 适配器整合进一组持续更新的共享基,以少量任务系数替代独立适配器,在无回放 CIFAR-100 类增量实验中达到 94.20% 最终准确率,但一般设置仍保留任务系数,且 Share-full 允许访问旧数据,不能把所有结果都称为严格持续学习。
- Stay Unique, Stay Efficient: Preserving Model Personality in Multi-Task Merging
-
DTS 不强迫所有任务使用完全相同的权重,而是用低秩分解和四组阈值编码保存可重建的任务残差,在 ViT-B/32 八任务合并中以每任务 0.98% 额外存储取得 90.17% 平均准确率,并用任务语义相似度组合残差以支持未见任务。
🕸️ 图学习 (1)¶
- MG2-RAG: Multi-Granularity Graph for Multimodal Retrieval-Augmented Generation
-
针对多模态检索增强生成中扁平向量检索忽略结构依赖、传统图检索依赖昂贵 MLLM 抽取文本三元组导致视觉细节丢失的问题,MG2-RAG 结合轻量句法解析与实体驱动开放词表分割构建统一多模态节点,并通过密集相似度聚合与重启随机游走实现跨模态高保真多跳检索与推理。
🤝 联邦学习 (2)¶
- Neural Collapse-Inspired Multi-Label Federated Learning under Label-Distribution Skew
-
FedNCA-ML 先从图像中提取逐类特征,再用各客户端共享的固定等角紧框架及正负特征正则统一表示几何,在多标签 CIFAR-10 的一个偏斜设置中将 macro-AUC 从最佳对照的 83.63 提高到 87.55,但收益并不覆盖所有微平均指标。
- Prevention over Correction: Learning Aligned Representations in One-shot Federated Learning
-
FACE 把单轮联邦学习中的跨客户端表征对齐提前到本地训练,通过共享固定类别方向和防塌缩正则化,让服务器无需再校准即可融合特征,在极端异质划分下将 CIFAR-10 准确率从最佳比较方法的 60.28% 提高到 69.21%。
📈 时间序列 (7)¶
- RainODE: Continuous-Time Precipitation Forecasting with Latent Neural ODEs
-
RainODE 用离散教师引导的潜在神经常微分方程学习连续降水轨迹,再以 Brownian Bridge 随机细化强度与细节,在支持未见时间间隔查询的同时,将 RAPID-60min 的 CSI-M 从 SimVP 的 0.141 提升到 0.220,但不保证逐像素误差同步下降。
- Social-Mamba: Socially-Aware Trajectory Forecasting with State-Space Models
-
Social-Mamba 将无序邻居关系组织成可扫描的社交网格,用 Cycle Mamba 支撑时间、自我和目标三路交互,在 NBA-Full 上以 1.9M 参数获得 0.72/0.92 米 ADE/FDE,但低计算量不等于所有场景下延迟最低。
- Video2Reaction: Mapping Video to Audience Reaction Distribution in the Wild
-
针对真实场景下视频受众反应多样且随时间演化的难题,本文构建了首个包含 10,348 个电影片段、389 小时视频与 21 类细粒度情绪标签分布的大规模基准数据集 Video2Reaction,提出两阶段多智能体 LLM 标注流水线,并系统评测了经典分布学习与微调视觉语言模型在受众反应预测上的表现。
- Forecasting Animal Motion
-
将稠密点轨迹确立为行为建模的视觉 Token,结合局部 DINOv3 视觉特征与相机运动补偿管线,构建了基于扩散 Transformer(DiT)的无序轨迹预测架构,实现了跨物种、免 3D 骨架先验且具备长尾泛化能力的野生动物非刚性运动预测。
- Geometry-Aware Visual Representation for Remaining Useful Life Prediction
-
针对振动信号时频表征忽略系统本征动力学几何结构的问题,提出相空间密度图像(PSDI)与全局锚定重构机制,将退化过程显式建模为吸引子空间发散,并结合滑动窗口时间聚合与紧凑知识蒸馏实现高鲁棒 RUL 预测。
- NeuralDMD: Interpretable Untrained Neural Network for Imaging from Sparse and Noisy Observations
-
提出无需数值仿真训练与预设物理方程的单实例重建框架 NeuralDMD,将动态模态分解(DMD)的空间模态参数化为连续坐标神经网络,并通过联合时序约束与可微分观测算子直接从极度稀疏、带噪的直接或间接观测中重建并外推时空动力学。
- PMGC-SimVP: Parametric Multi-scale Gated Convolution for Global Ionospheric TEC Prediction
-
针对空间天气强扰动下全球电离层总电子含量(TEC)剧烈非平稳与纬度异质性问题,本文提出基于纯卷积骨干的 PMGC-SimVP,通过双阶段低秩时间适配器、纬度分带参数调制与双基线残差学习,在参数量缩减 95% 的同时显著提升了磁暴期预报精度与长程稳定性。
🏥 医学图像 (112)¶
- Comprehensive language–image pre-training for 3D medical image understanding
-
COLIPRI 将胸部 CT 的图文对齐、病变肯定/否定短句判别、报告生成和多分辨率掩码重建联合起来,使同一视觉编码器兼顾全局语义与局部结构;完整版本在 RAD-ChestCT 的零样本 AUROC 达到 73.23%,但并非所有任务都需要报告生成分支。
- MedSynapse-V: Bridging Visual Perception and Clinical Intuition via Latent Memory Evolution
-
MedSynapse-V 将医学分割编码器的解剖先验压缩成连续记忆,用区域遮蔽反事实奖励训练模型利用这些记忆,再蒸馏到无需外部编码器的自主分支,在七项离线医学基准上取得论文报告的 59.6 平均分,但这不构成临床有效性证据。
- FlexiBrain: Resolution-Agnostic Voxel-Level Encoding for Native fMRI
-
FlexiBrain 将 fMRI 补丁定义在毫米与秒上,通过动态调整共享编码核、物理坐标位置编码和 Mamba-JEPA,直接学习不同分辨率的原生空间数据,在五项疾病分类中取得四项最高准确率,同时避免耗时的模板空间配准。
- MOOZY: A Patient-First Foundation Model for Computational Pathology
-
MOOZY 先通过掩码自蒸馏学习切片空间表示,再用病例 Transformer 和 333 项临床任务联合训练患者级表示,在 16 个留出任务上取得 0.769 的宏平均加权 F1 和 0.702 的宏平均平衡准确率,但宏平均 AUC 仍略低于 TITAN。
- Render-FM: Feedforward Model for Real-time Photorealistic Volumetric Rendering
-
Render-FM 提出一个基于 nnU-Net 风格 3D U-Net 的前馈模型,在单次 2.8 秒前向传播中直接从 CT 体数据回归 6D 高斯泼溅(6DGS)参数,消除逐扫描优化瓶颈(约 500 倍加速),并通过解剖引导初始化(AGP)将分割掩码和传递函数作为结构与外观先验,桥接自然场景重建与医学体积渲染的领域鸿沟,支持实时交互渲染(328+ FPS)和零额外开销的器官组合可视化。
- ECHO: Efficient Chest X-ray Report Generation with One-step Block Diffusion
-
ECHO 将医学自回归模型转成块扩散模型,再用教师多步轨迹中的条件分布蒸馏出每块单步的学生,在论文的归一化胸片报告测试集上保持较高临床内容分数,并以块长 8 达到 274.21 tokens/s。
- RAU: Reference-based Anatomical Understanding with Vision-Language Models
-
RAU 先让 Qwen2.5-VL-7B 学会比较参考图与目标图的解剖空间关系,再把分割标记作为软提示接入 SAM2 参考记忆,在仅用 RAOS 和 Arcade 训练的分割设置下,取得 CAMUS 的 Dice 0.7503 与 LERA 的 Dice 0.7010。
- Atlas is Your Perfect Context: One-Shot Customization for Generalizable Foundational Medical Image Segmentation
-
AtlasSegFM 用一例带标注的解剖图谱自动提示冻结的医学分割基础模型,再通过测试时学习的逐体素融合保留两者优势,在 SegRap 上把 nnInteractive 五点击基线的 Dice 从 50.02 提高到 69.19,但仍依赖支持病例与目标病例的解剖对应关系。
- Discrete Diffusion Models with MLLMs for Unified Medical Multimodal Generation
-
MeDiM 将预训练 Liquid 改造成带双向注意力和时间步条件化的离散扩散模型,以同一套去噪网络支持医学报告到图像、图像到报告及图像报告联合生成,在 MIMIC-CXR 和 PathGen 上分别取得 16.60 与 24.19 的图像生成 FID。
- MedSPOT: A Workflow-Aware Sequential Grounding Benchmark for Clinical GUI
-
MedSPOT 是第一个面向临床软件界面的「工作流感知顺序接地」基准:在 10 个真实医学影像软件上录制 216 个交互任务、标注 597 个关键帧,把 GUI 接地重写成 2–3 步状态依赖的点击序列,并用「首次错误即终止」的严格协议与六类失败分类体系评测 16 个 MLLM——最强模型 GUI-Actor 的任务完成率仅 43.5%,而人类标注者达到 82.22%。
🧬 计算生物 (7)¶
- Synthetic Visual Genome 2: Extracting Large-scale Spatio-Temporal Scene Graphs from Videos
-
SVG2 将真实视频自动标注扩展到 636K 视频规模,并训练轨迹条件模型 TraSeR,以分割对齐和全局/局部双重采样器生成时空场景图,在 SVG2test 上达到 79.0% 对象准确率和 27.1% 属性召回率,但关系预测并未全面超过 GPT-5。
- CellFluxRL: Biologically-Constrained Virtual Cell Modeling via Reinforcement Learning
-
CellFluxRL 不改动生成架构,而是把七项可自动计算的生物学评估器(MoA 一致性、核是否被胞质包含、核圆度、核与胞质的尺寸/数量统计)当作奖励,对已训练好的流匹配虚拟细胞模型 CellFlux 做 RL 后训练,把「看起来逼真」的细胞图像推向「生物学上可信」,七项奖励全部优于基线,再用 best-of-N 测试时扩展进一步放大收益。
- FPicker: Topology-Guided Evolution for Filament Tracing in Low-SNR Microscopy
-
清华大学团队提出 FPicker,通过中心-端点表示构建粗粒度拓扑骨架先验,并结合截断边界的开曲线图卷积演化网络与桥接渐进学习策略,攻克了冷冻电镜极低信噪比(SNR = -20 dB)下连续细丝蛋白追踪的拓扑断裂与端点收缩难题。
- Revisiting Scene Graph Generation from the Perspective of Detector-Conditioned Reachability
-
本文从目标检测器条件可达性(Detector-Conditioned Reachability)的新视角,首次定量揭示了基于检测器与基于查询的两类场景图生成方法在预测行为上的互补性,并提出了融合自顶向下(TD-Qs)与自底向上(BU-Qs)双重查询的 Dual-SGG 框架,在无需后验校准的前提下取得了显著的性能提升。
- Score-Based Matching with Target Guidance for Cryo-EM Denoising
-
针对冷冻电镜(Cryo-EM)显微图像极低信噪比与无洁净真值监督的瓶颈,提出结合低通参考三维结构投影先验的目标引导分数匹配(TSM)框架,通过自适应置信度加权与退火学习,在有效抑制结构化低频背景的同时保全弱颗粒微细结构,显著提升下游颗粒拾取与高分辨率三维重构质量。
- Together, Then Apart: Balancing Alignment and Distinctiveness for Multimodal Survival Analysis
-
针对多模态生存分析中过度跨模态对齐导致模态特异性信息塌陷的痛点,提出“先聚合、后分离(Together, Then Apart, TTA)”框架,通过共享原型与带课程调度松弛质量的不平衡最优传输捕获共有预后模式,再通过模态特异性锚点与对比正则化显式保留各自独特生物学信号,在五个 TCGA 癌症队列上取得显著超越 SOTA 的一致提升。
- Trust-Region Noise Search for Black-Box Alignment of Diffusion and Flow Models
-
针对扩散与流匹配模型在推理时对齐面临的高显存开销、无法支持黑盒昂贵奖励及易脱离数据流形等瓶颈,本文提出置信域噪声搜索(TRS),仅对源噪声进行结构化扰动与动态尺度调整,在文生图、小分子和蛋白质生成任务上均显著超越现有黑盒与序列搜索基线。
⚛️ 物理/科学计算 (5)¶
- High-speed Imaging through Turbulence with Event-based Light Fields
-
针对高速动态场景穿透大气湍流成像中运动模糊与几何抖动交织的顽疾,本文构建了首个纯事件光场成像系统,利用万花筒光学获取 9 个子孔径视角,基于“跨视角强相关的场景运动 vs 跨视角弱相关的湍流扰动”统计解耦原理,结合循环神经重建网络,在强湍流下实现了高达 12,000 fps 的清晰无畸变视频重建。
- Resolution-Agnostic Neural Operators for Multi-Rate Sparse-View CT
-
本文提出了首个面向稀疏视角 CT 重建的神经算子框架 CTO,利用函数空间中的离散-连续(DISCO)卷积以及正弦图频空双分支滤波,实现了单模型跨多采样率与网格分辨率的零样本高保真重建。
- ELHINN: Unifying Dense Crowd Simulation Across Scales via Eulerian–Lagrangian Hydrodynamics
-
针对密集人群模拟中宏观集体流动与微观个体真实感割裂的根本矛盾,提出跨尺度欧拉-拉格朗日流体力学网络 ELHINN,以可学习控制方程结合 KAN 残差修正演化宏观速度场,并将其作为物理先验引导微观个体轨迹求解与碰撞规避。
- Event-based Sparse-view Background-Oriented Schlieren Tomography
-
针对高速气流三维层析成像中传统帧相机受限高帧率带宽与强光照补偿的瓶颈,本文提出首个基于事件相机的稀疏视角背景纹影(EventBOS)层析方法,利用可微折射光线追踪将神经隐式流体场与异步对数亮度变化事件流对齐,并融入热对流 Navier-Stokes 物理正则化与边界约束,在单视角与正交双视角下均超越了 1000 fps 传统帧相机重建质量。
- TurboMPLE: Joint Infrared Turbulence Mitigation and Physical Fields Estimation via Mutual Progressive Layered Extraction
-
针对红外成像中大气湍流引起的光学畸变、模糊与灰度漂移,TurboMPLE 首创端到端多任务架构,通过双向特征互引导与大气物理定律约束,同步实现高质量视频湍流去除与四个动态二维物理场的高精度反演。
🌍 地球科学 (4)¶
- Lessons and Open Questions from a Unified Study of Camera-Trap Species Recognition Over Time
-
本文把相机陷阱物种识别从「跨站点泛化」重构为「固定站点随时间流式评测」,构建了覆盖 17 个数据集 / 546 个相机点的 StreamTrap 基准,系统回答生态实践者的四个部署问题,发现朴素累积微调甚至会低于零样本,并给出 LoRA + 平衡 Softmax(BSM)加后处理的可用适配配方以及一串明确的开放问题。
- Mapping Dark-Matter Clusters via Physics-Guided Diffusion Models
-
本文发布迄今最大的星系团质量制图数据集 DARKCLUSTERS-15K(15,000 组配对的表面质量密度图与 HST 三波段光度仿真观测),并在此之上训练一个以光度为条件的扩散先验,把强、弱引力透镜的物理前向模型写成似然引导项,用 DAPS 退火后验采样在几分钟内自动输出 512×512 的无参数质量图与校准的逐像素不确定度,在 TNG/SIMBA 留出测试集上全面超过 Kaiser-Squires、Napier et al. 与 UNet 基线,并在真实星系团 MACS 1206 上逼近专家调优的重建结果。
- RainODE: Continuous-Time Precipitation Forecasting with Latent Neural ODEs
-
RainODE 用离散教师引导的潜在神经常微分方程学习连续降水轨迹,再以 Brownian Bridge 随机细化强度与细节,在支持未见时间间隔查询的同时,将 RAPID-60min 的 CSI-M 从 SimVP 的 0.141 提升到 0.220,但不保证逐像素误差同步下降。
- Less Tokens, Better Forecasts: Sparse Residual Routing for Efficient Weather Prediction
-
针对数据驱动气象预报中全图令牌均质计算导致的严重冗余与显存瓶颈,Sparse-Reslim 提出免参数的稀疏残差路由架构,仅让 25% 空间令牌通过深层变换块并以残差增量散射回原序列,不仅实现约 2.5× 训练加速与 2.2× 显存节省,更在确定性与扩散模型下全面超越全量稠密基线的预报精度。
📡 信号/通信 (8)¶
- FreqPhys: Repurposing Implicit Physiological Frequency Prior for Robust Remote Photoplethysmography
-
FreqPhys 在每轮条件扩散去噪中引入心率频带约束、可学习频谱调制和带内噪声选择,再用跨域注意力恢复脉搏波形,在六个数据集上展示较强鲁棒性,其中 BUAA 的心率 RMSE 为 1.31 bpm,但并非所有数据集上的所有指标均最优。
- Experts-Guided Unbalanced Optimal Transport for ISP Learning from Unpaired and/or Paired Data
-
EGUOT 不改 ISP 推理网络,而用内容锚点、非平衡最优传输和颜色/结构/频域专家联合训练,在 ZRR 的同一 Restormer 非配对设置下取得 21.69 dB PSNR,并支持配对监督。
- MixCompress: Mixture of Experts for Variable Rate Learned Image Compression
-
针对传统稠密调制可变码率图像压缩中高低码率梯度严重冲突的痛点,MixCompress 通过引入率条件门控的稀疏混合专家(MoE)与自适应深度扩展(MoD),结合条件辅助小波变换(CAT),在单一模型内实现了超越独立单码率模型的最优率失真性能。
- Raw-JPEG Adapter: Efficient Raw Image Compression with JPEG
-
针对原始 Raw 图像体积庞大且无法直接适配标准 JPEG 编解码流水线的问题,本文提出了一种轻量、可逆且自监督学习的 Raw-JPEG 适配器,通过神经网络预测通道查找表、频域 DCT 缩放及像素级 Gamma 参数并嵌入 JPEG 注释段,实现了小于 64 KB 额外开销下极低解码延迟的高保真 Raw 图像压缩与重建。
- Incentive Noise and Structural Prior Infusion for Multi-Modal Object Re-Identification
-
针对多模态目标重识别中文本噪声干扰与跨光谱细粒度几何结构失配难题,本文提出将不确定文本重塑为任务感知正激励噪声以自适应调制视觉全局特征,并联合 DINOv3 结构先验提示与上下文引导稀疏融合,大幅提升异构传感器与恶劣工况下的检索鲁棒性。
- MaterialFlow: Attribute-Disentangled Material Transfer via Trajectory-Aware Velocity Modulation
-
针对材质迁移中参考特征纠缠与反演累积漂移导致的结构畸变问题,MaterialFlow 在预训练 Rectified Flow 模型上提出了无需反演的轨迹感知速度调制与颜色-纹理-中尺度结构三维属性解耦范式,实现了高保真且结构严格保持的免训练材质迁移。
- Pol-CACTI: A System and dataset forHigh-Speed Polarized Video Compressive Imaging
-
针对传统 DoFP 偏振相机无法捕获高帧率动态以及两阶段重建严重放大物理误差的瓶颈,本文提出 Pol-CACTI 硬件系统、大规模高质量偏振视频数据集与融合偏振感知反投影(PA-LBP)的物理驱动联合重建网络,实现了单帧快照下高保真高速偏振视频重构。
- Prototype-Conditioned Imagination for Compositional Zero-Shot Learning
-
针对视觉语言模型在组合零样本学习(CZSL)中存在的视觉-文本原语对齐模糊以及属性-对象相互孤立的问题,本文提出了结合最优传输双向解耦与属性原型驱动仿射调制的两阶段认知想象框架 PCI,在四大基准测试中显著提升了未见组合的泛化性能。
👥 社会计算 (7)¶
- Dual-Margin Embedding for Fine-Grained Long-Tailed Plant Taxonomy
-
针对真实生态监测中细粒度差异、长尾类别分布与开放世界域偏移并存的挑战,本文提出 TaxoNet,通过双边界惩罚损失抑制头部类别对尾部原型的排斥梯度,结合范数引导的样本选择策略,显著提升了植物层级分类在罕见类别与跨域场景下的泛化能力。
- Evidence Triangulation for Multimodal Fact-Checking in the Wild
-
针对真实社交网络多模态误导信息缺乏自然训练基准及现有核查架构推理割裂的问题,本文构建了首个源自 X (Twitter) Community Notes 的众包基准 X-POSE,并提出了基于三路交叉注意力与蕴涵/矛盾关系融合的轻量级证据三角互证模型 TRENT。
- Fourier Self-Supervision for Fine-Grained Generalized Category Discovery
-
针对细粒度广义类别发现中类间差异微弱导致难以聚类新类的问题,本文提出基于傅里叶变换的双频自监督对比学习框架,通过信噪比确定自适应截止频率并解耦表征空间,以低频提取粗粒度抽象层级、高频捕捉微小判别特征,显著提升新已知类别的发现精度。
- HCSU: A Dataset and Benchmark for Fine-Grained Historical Calligraphy Style Understanding
-
针对视觉语言模型在书法艺术上“通晓文字却不懂笔墨”的认知断层,HCSU 构建了首个解耦真迹墨迹(Tie)与石刻拓本(Bei)的大规模细粒度书法风格理解基准(39,307 字/49 位名家/10 个朝代),并引入层次化专家美学描述以驱动风格判别与可解释美学推理。
- Coarse-to-fine Contrast: A Hybrid Self-supervised Method for Non-rigid 3D Shape Matching
-
本文提出了一种由粗到细的混合自监督非刚体 3D 形状匹配方法,通过在正交拉普拉斯基底与非正交弹性基底构建的对称双分支中引入空间、谱域及跨域的由粗到细对比约束,并彻底舍弃耗时的最小二乘求解器与推理期微调,在保持高效计算的同时显著刷新了非等距变形与拓扑噪声场景的匹配精度。
- MED-LCDS: Multi-Expert-Domain CLIP Classification via Logit Calibration
-
针对独立微调的多个特定领域 LoRA 专家合并到统一模型时因 logit 尺度不一致导致的跨域干扰与虚高置信度问题,本文提出 MED-DSLC(MED-LCDS),结合领域监督门控路由与可学习的领域级温度校准,恢复跨领域全局 logit 可比性,在联合类别空间下取得大幅性能提升。
- PanoRec: Spatially-Structured Sequence Modeling for Multi-Granularity Panoramic Retrieval
-
针对传统视觉语言模型将全景图压缩为单一全局向量导致的严重语义稀释难题,PanoRec 通过将无畸变六面体投影面、下采样全局全景图与可学习空间锚点标记序列化,结合动态 MaxSim 路由与联合空间 InfoNCE 目标,在单次前向传播中实现了高效的多粒度全景图跨模态检索。
🛡️ AI 安全 (45)¶
- Scaling Laws for Black-box Adversarial Attacks
-
本文发现,在缓解代理模型间梯度冲突后,视觉对抗迁移成功率在一定规模区间内近似随集成模型数量的对数线性增长,并用分类器、防御模型和多模态模型验证这一有条件的经验规律。
- Contextual Image Attack: How Visual Context Exposes Multimodal Safety Vulnerabilities
-
CIA 把有害查询改写成一段视觉上自洽的场景(黑板上的教学演示、路线图上的步骤、论文里的条目、漫画对话框),让多模态大模型在「这是一道正常题目」的错觉下把有害内容当成待完成的任务来回答,从而在 GPT-4o 与 Qwen2.5-VL-72B 上分别拿到 86.83% 与 91.02% 的攻击成功率。
- Stealthy Multi-task Adversarial Attacks
-
本文提出 SMTA2,把「只打坏多任务模型中的某一个任务、同时不打坏其余任务」写成一个带保持约束的多目标优化问题,用「目标任务正权、非目标任务负权」的加权损失把它松弛成一次普通的一阶迭代攻击,再用逐迭代的自动权重搜索在线平衡攻击与保持,在 NYUv2 与 Cityscapes 上对未防御模型和对抗训练模型都做到了目标任务大幅退化、非目标任务守住干净基线。
- SPQR: A Multi-Dimensional Benchmark for Safety Alignment under Benign Model Adaptation
-
SPQR 把"部署后的良性微调"形式化为无意攻击并提升为一个评测轴,用安全(S)、提示服从(P)、视觉质量(Q)、微调后稳健性(R)四个归一化指标经调和平均合成单一分数,在 SD v1.5/XL/v3 上评测 11 种 T2I 安全对齐方法,暴露出"效用不降反升、安全静默崩塌"这一单轴基准完全看不见的失效模式。
- Unsafe by Reciprocity: How Generation–Understanding Coupling Undermines Safety in Unified Multimodal Models
-
本文把统一多模态模型(UMM)中理解与生成之间的"互惠"本身当作结构性攻击面,提出无需任何外部模型、也无需梯度优化的 RICE 攻击框架,顺着 G→U 与 U→G 两条内部回路搬运中间信号,在 5 个越狱基准和 3 个不安全图像生成基准上把 ASR 推到最高(Bagel / Janus-Pro-7B 上 AdvBench 分别为 89.62% / 92.69%)。
- Neural Collapse-Inspired Multi-Label Federated Learning under Label-Distribution Skew
-
FedNCA-ML 先从图像中提取逐类特征,再用各客户端共享的固定等角紧框架及正负特征正则统一表示几何,在多标签 CIFAR-10 的一个偏斜设置中将 macro-AUC 从最佳对照的 83.63 提高到 87.55,但收益并不覆盖所有微平均指标。
- WebEyeTrack: Scalable Eye-Tracking for the Browser via On-Device Few-Shot Personalization
-
WebEyeTrack 将单目度量头姿、轻量眼部编码器 BlazeGaze 和端侧少样本个性化结合,以初始 9 点校准支持浏览器眼动追踪,在 GazeCapture 上达到 2.32 cm 注视点误差,但其主要优势是部署效率与抗漂移能力,而非所有数据集上的最高精度。
- A Classifier-Agnostic Zero-Shot Adversarial Attack Detection via CLIP
-
提出 A4D,一个完全黑盒、零样本的对抗攻击检测框架——利用 CLIP 对微小扰动的敏感性,通过将图像嵌入与一组精心设计的文本提示词比较余弦相似度,再经 PCA 聚合为单一检测分数,无需知道攻击类型或分类器结构即可检测对抗样本,在多个攻击/数据集/分类器上达到 SOTA。
- Adversarial Attack and Disturbance Detection by Hadamard-Coded Output Representations for Object Detection and Semantic Segmentation
-
HadamardNet 将视觉模型的类别输出改成冗余码字,通过概率单纯形投影同时获得类别概率与一致性残差,在单次前向传播中检测异常扰动;其价值是提供额外的可靠性信号,而不是保证受扰动后的预测正确。
- Anti-Prompt: Image Protection against Text-Guided Image-to-Video Generation
-
Anti-Prompt 在图像所有者发布图片前加入微小保护性扰动,通过削弱文本条件、增强视觉通路的相对主导性并扰乱图像编码,使未经授权的图生视频更难保持连贯;在 CogVideoX 白盒实验中,其视频评估均分为 3.25,低于复现 I2VGuard 的 3.92,表示更强的保护效果。
📂 其他 (61)¶
- The Prism Hypothesis: Harmonizing Semantic and Pixel Representations via Unified Autoencoding
-
UAE 将预训练视觉表示拆成需要保留语义的低频基底和可以学习像素细节的高频残差,通过选择性蒸馏与高频掩码重建统一两种能力,表 1 的 DINOv2-B 配置在 ImageNet-1K 上达到 PSNR 32.17、SSIM 0.92 和 rFID 0.35。
- PAI-Studio: Cinematic Video Background Replacement with Camera-Aware Motion
-
PAI-Studio 将前景视频和 1–3 张背景参考图作为联合生成条件,用真实镜头数据、时间位置编码克隆及双向注意力同时学习背景运动、前景保持和重光照,在 Cine-Restore 多参考图设置下获得 MSE 0.00645、SSIM 0.789 和 LPIPS 0.197。
- Seeing Touch from Motion: A Unified Modality-Aware Visuo-Tactile Policy with Tactile Motion Correlation
-
针对光学触觉传感器难以分辨细粒度接触状态的老问题,本文发现「瞬时运动」与「累积运动」的点积能显式区分「正在接触 / 稳定接触 / 正在松开」等状态,据此提出触觉运动相关性表征 TMC,并用 Mixture-of-Transformers 把它作为独立模态与视觉、原始触觉、本体状态融合,在四个真实接触密集操作任务上刷出更高成功率。
- TSEmbed: Unlocking Task Scaling in Universal Multimodal Embeddings
-
TSEmbed 用输入相关的 MoE-LoRA 分担多模态任务冲突,再在专家预热后根据路由相似度加权困难负样本,使仅使用 MMEB 训练的 2B/7B 模型分别达到 70.5/74.7 的总体分数,超过同设置 B3 基线 2.4/2.7 个百分点。
- Articulat3D: Reconstructing Articulated Digital Twins From Monocular Videos with Geometric and Motion Constraints
-
Articulat3D 提出一个两阶段优化框架,从单目随意拍摄视频中重建铰接物体的可交互数字孪生:第一阶段用低维运动基(motion bases)对 3D 点轨迹做结构化部分级运动分解,第二阶段用显式运动学基元(旋转/平移关节的轴、枢轴、逐帧标量)约束运动使其满足物理刚体规律,在合成和真实数据上均达到 SOTA 精度且无需静态预扫描。
- Match-Any-Events: Zero-Shot Motion-Robust Feature Matching Across Wide Baselines for Event Cameras
-
本文提出首个实现零样本跨数据集泛化的事件相机宽基线特征匹配模型,通过分离式时空注意力骨干(TAg)和稀疏感知Token自适应剪枝(SETS)实现高效多时间尺度事件特征学习,结合大规模合成(E-MegaDepth)与真实(ECM)宽基线数据集训练,在多个基准上相比此前最佳方法提升37.7%。
- FedLAS: Feature-Modulated Bidirectional Label Smoothing for Neural Network Calibration
-
提出 FeDLaS(Feature-modulated Bidirectional Label Smoothing),利用隐藏层特征 L1 范数作为置信度代理以绕过 softmax 饱和缺陷,搭配双向校准门控实时判断每个样本的过置信/欠置信状态,逐样本动态调制标签平滑强度,在保持 Top-1 精度的前提下显著降低 ECE 和 AECE。
- Multi-Hypothesis Test-Time Adaptation to Mitigate Underspecification
-
本文把熵最小化的测试时自适应(TTA)重解释为一个欠定条件下的后验推断问题——低熵解有很多个、决策边界却彼此迥异——于是不再赌单点解,而是维护 K 组只适应归一化层的"适应粒子"分别去探索不同的低熵盆地,并在输出、参数、优化器、输入四个层级施加多样化约束防止它们塌缩到同一个解,推理时聚合多假设预测;在 ImageNet-C 的批大小 1、标签偏移与混合偏移场景上稳定优于 Tent / SAR / DeYO,并且能当插件套到已有 TTA 方法上。
- Quantile‑Adaptive Temperature Scaling for Confidence Calibration
-
QaTS 用校准集中的置信度分位数决定每个样本的温度,仅拟合两个正参数便能在保留类别预测的同时改善校准,例如 CIFAR-100、RN-50 的 ECE 从标准 TS 的 5.32 降至 2.56。
- Unified Removal of Raindrops and Reflections: A New Benchmark and A Novel Pipeline
-
本文建立雨滴与反射联合去除任务 UR3 及实拍数据集 RDRF,并用初步恢复、双条件扩散和保真解码组成 DiffUR3,在 RDRF-testing 上取得 29.41 dB PSNR、0.9372 SSIM 和 0.0813 LPIPS。
📄 transfer_learning (1)¶
- Dual Masked Generative Adversarial Transformer for Unsupervised Domain Adaptation
-
针对大域间隙下掩码图像建模仅在样本级正则化而忽略分布级域差距的瓶颈,提出双向掩码生成对抗 Transformer(Dual-MGAT),在全局 [CLS] 特征空间解耦并消除信息空缺与域分布差异,构建源域与目标域的双向生成对抗对齐通道。