🧩 多模态 VLM¶
🎞️ ECCV2026 · 39 篇论文解读
📌 同领域跨会议浏览: 📷 CVPR2026 (418) · 🔬 ICLR2026 (211) · 💬 ACL2026 (82) · 🧪 ICML2026 (89) · 🤖 AAAI2026 (74) · 🧠 NeurIPS2025 (107)
🔥 高频主题: 多模态 ×16 · 对齐/RLHF ×4 · LLM ×4 · 少样本学习 ×3 · 遥感 ×2
- AdaBoosting Text Prompts for Vision-Language Models
-
本文提出 Text Prompt Boosting (TPB),将 AdaBoost 框架引入 VLM 的文本提示构造中——把每个类别的提示词集合视为一个弱分类器,通过迭代重加权困难样本、逐轮构造新的提示弱分类器并集成为强分类器,从而在少样本场景下实现样本数驱动的性能持续提升(shot scalability),且该自然语言提示集成可在异构 VLM 间直接重嵌入迁移,保持跨模型迁移后的性能增益。
- ADAPT: Attention Dynamics Alignment with Preference Tuning for Faithful MLLMs
-
ADAPT 从早期解码的多层交叉注意力中提纯语义对齐的视觉锚点,在推理时以锚点为参照在线监测注意力保真度、仅检测到显著退化时稀疏纠正,并通过视觉条件对比的偏好优化强化模型对视觉证据的依赖,在多个幻觉基准上降低 40–60% 幻觉率,仅 1.42 倍推理开销。
- Anchored, Not Graded: Vision-Language Models Fail at Slant-from-Texture Perception
-
本文系统评估了多种VLM在纹理驱动斜面感知任务上的表现,发现VLM的零样本预测严重锚定在少数离散值(0度、±25度、±45度)上,与人类和自监督CNN展现的连续有偏感知完全不同,且这种锚定来源于语言输出端的读取瓶颈而非视觉编码器的几何信息缺失。
- Curvature-Guided Mixing for MLLM Adaptation
-
提出Curvature-Guided Mixing(CGM)框架,通过对预训练和微调两个损失曲面进行二阶泰勒展开与Hessian对角近似,推导出基于相对曲率的闭式软混合比(CGM),并进一步设计基于曲率感知评分的稀疏硬混合策略(CGM†),在MLLM微调中实现下游适应与通用知识保留的最优平衡。
- DiCoBench: Benchmarking Multi-Image Fine-Grained Perception via Differential and Commonality Visual Cues
-
DiCoBench 提出首个以隐式视觉线索(差分与共性)驱动的高分辨率多图像细粒度感知 benchmark,包含 765 个高质样本、8 种任务,用 MCQ 范式消除 n-gram 评测偏差;18 个 MLLM 中最好的 Gemini-3-Pro 仅 58.1%(人类 98.3%),揭示了现有模型在自主视觉线索发现上的严重不足。
- Domain Arithmetic: One-Shot VLA Adaptation under Environmental Shifts
-
DART 提出一种基于权重空间类比运算的 VLA 模型 one-shot 域适配方法:用单个源域+目标域 demonstration 分别微调,通过子空间对齐过滤后相减提取纯域向量,再将其加回基座模型,在 LIBERO 多视角、视觉扰动、跨实体和真实机器人场景下,仅用 1 条 demonstrations 就显著超越现有适配基线。
- Edges Before Embeddings: A Confidence-Aware Blur Gate for Vision-Language Pipelines
-
本文提出 MagikaDocumentFromPixel,一个轻量级 CPU 友好型模糊检测门控器,通过 Laplacian 边缘先验模块 (EPM) 作为第 4 输入通道注入频域信息,搭配多尺度测试时增强和 max-softmax 选择性预测阈值,在 ~7ms CPU 推理时间内以 F1=0.9803 的质量为 VLM/OCR 管线提供清晰/模糊/不确定三路路由决策。
- EgoSAT: A Comprehensive Benchmark of Egocentric Streaming Interaction Understanding
-
EgoSAT 是首个面向第一人称(egocentric)流式交互理解的系统性基准,将过去(回顾)、现在(实时)、未来(前瞻)三类推理统一在严格的在线协议下,通过可回答性量化与置信度诊断揭示当前 VLM 不仅在时序推理上表现薄弱,更存在严重的"自信地犯错"(confidently wrong)校准失效问题。
- EraseLoRA: MLLM-Driven Foreground Exclusion and Background Subtype Aggregation for Dataset-Free Object Removal
-
EraseLoRA 提出一种无数据集的物体移除框架:先用 MLLM 对单张图像做三路分割(目标前景 / 非目标前景 / 背景子类型),再通过测试时 LoRA 自适应优化将多个背景子类型聚合重建到 mask 区域,全程不需要任何训练数据、不做 self-attention 的显式遮挡或重定向,在背景保真度上比此前 dataset-free 方法提升至少 23%、前景再生率近乎减半,且超越所有 dataset-driven 方法。
- Evaluating and Enhancing Negation Comprehension in Remote Sensing MLLMs
-
针对遥感 MLLM 在否定查询下性能严重退化的问题,本文构建首个遥感否定理解基准 RS-Neg(22K 样本,覆盖区域级到场景级四类任务),并提出测试时自适应方法 NeFo,将否定的逻辑角色(真值翻转算子)显式建模为优化目标,仅用约 5% 无标签测试样本即可显著提升多个基座模型的否定理解能力,并在未见任务上展现强泛化性。
- Explicit Logic Channel for Validation and Enhancement of MLLMs on Zero-Shot Tasks
-
提出显式逻辑通道(ELC),与 MLLM 黑箱通道(ILC)并行运行,通过 LLM 提取语义事实、VFM 视觉接地、概率逻辑推理三步产生可解释的决策;定义一致性率 CR 作为无标注下的模型质量代理指标,并通过跨通道对齐融合提升零样本 VLC 任务性能,在 3 个 benchmark 上对 11 个 MLLM 验证有效。
- Generating a Paracosm for Training-Free Zero-Shot Composed Image Retrieval
-
Paracosm 首次将 LMM 的图像编辑能力引入零样本组合式图像检索,对多模态查询直接生成"心理图像"(mental image)并同时为数据库图像创建合成对等物,将查询和数据库统一到一个合成空间(paracosm)中进行匹配,以无训练方式大幅超越此前所有零样本方法,甚至媲美有监督方法。
- GKDT: General Keypoint Detection Transformer
-
本文构建了包含130万实例的大规模统一关键点数据集MegaKPT,并提出基于DINOv3的通用关键点检测Transformer GKDT,通过Kernel Generation机制将视觉/文本关键点原型转化为动态卷积核,在22个测试集上以单一模型于多数类别实现90%+ [email protected]精度。
- Identifying and Resolving Pitfalls of Knowledge-Based VQA Benchmarks: Auditing, Repairing, and Augmenting
-
对知识驱动视觉问答(KB-VQA)基准 InfoSeek 和 E-VQA 进行系统性审计,揭示答案-证据错位、问题欠指定和单实体视觉捷径三类普遍缺陷,提出四阶段修复协议和受控多实体增强协议,实验表明修复后模型排名反转、增强后检索召回和 QA 精度大幅下降,说明当前 KB-VQA 评估对知识接地推理能力的衡量严重失真。
- Invoice Haystack: Benchmarking Document Retrieval and Visual Question Answering Under Strong Visual Homogeneity
-
本文发现现有多文档 VQA benchmark 因文档类型高度多样化而人为制造了嵌入空间的可分性、掩盖了真实企业场景中模板化文档的检索困境,定量提出了"嵌入塌缩"概念(视觉相似文档平均余弦相似度 0.73 vs 已有基准 0.31-0.38),并构建 Invoice Haystack 压力测试基准(1500 张发票 + 200 个判别性 QA 对),同时提出 VL-RAG 双流融合 + VLM 验证过滤框架,在最强同质性设置下 Recall@1 达 50.0%,将此前 SOTA 从 40.0% 提升 10 个百分点。
- Layer-Specific Prompt Fusion Discovery via Differentiable Search in Vision Foundation Models
-
本文把视觉 prompt tuning 里「prompt 与 image token 怎么融合」这件一直被写死为拼接/相加的事,重新表述成一个双层优化问题,用可微架构搜索(DARTS)为冻结 ViT 的每一层各自挑选一个融合算子(concat / add / affine / cross-attention),在只调 0.75% 参数的前提下把 VTAB-1k 均值刷到 77.01%,并揭示「融合方式本身」是 prompt tuning 里此前被忽视的一阶变量。
- Learning from Failure: Inference-Time Self-Improvement for Computer-Use Agents
-
提出一个失败驱动的推理时自我改进循环:LLM 作为元控制器分析 Agent 在 GUI 任务中积累的失败轨迹,归纳出 grounding 错误、能力缺口、知识不足和冗余循环四类瓶颈,分别为每类设计推理时优化策略(视觉搜索 / 终端执行 / 知识支持 / 重复告警),以代码补丁形式注入 Agent 工作流,在 OSWorld 上将 OpenCUA-72B 的 success rate 从 42.3% 提升至 48.9%(+6.6 点),零额外训练开销,仅增加约 8% 推理计算量。
- Learning to Deny: Action Denial in Multimodal Large Language Models
-
本文提出 UCF101-AD 基准(1.1 万条「动作在场/动作缺席」配对视频)专门测 MLLM 能否在「场景、物体、人都在但定义性动作没发生」时正确否定该动作,发现 20 个 SOTA 模型正样本识别 >85% 却在否定样本上普遍跌破 50%;再提出 CausalAct 因果图框架(把场景拆成 P/O/L/S/I/M/A 七节点的 DAG,用自然语言 prompt + 图概念微调),显著降低误报、证明「否定」是可学习的推理技能。
- Magic-MM-Embedding: Towards Visual-Token-Efficient Universal Multimodal Embedding with MLLMs
-
Magic-MM-Embedding 在 InternVL3 基础上引入无参数视觉 token 压缩(降至 25%)并搭配三阶段渐进式训练(生成恢复→对比预训练→MLLM裁判精调),不仅克服了压缩带来的性能损失,还在 MMEB / VisDoc / 跨模态检索上全面超越先前 SOTA 同时大幅降低推理延迟。
- MIRROR: Aligning Semantic Relations from Language to Image via Gromov-Wasserstein
-
MIRROR 提出 Semi-Inverse Gromov-Wasserstein(SI-GW)几何正则化框架,通过闭式解将语言空间中概念间的关系结构映射到视觉空间,在不引入额外参数和推理开销的前提下显著提升 MLLM 的关系推理能力。
- MotionAtlas: Detailed Region Captioning for Motion-Centric Videos
-
MotionAtlas 把「描述整段视频运动」这个难以量化评测的任务,收窄为「给定视频 + 时空掩码,只描述目标区域内的运动」,并配套交付了一个 2073 题 MCQ 的诊断性 benchmark、一条能规模化产出 15.9 万条高保真运动描述的自举数据流水线,以及一套让 Qwen3-VL / Molmo2 在八个运动理解 benchmark 上普遍涨点的训练配方。
- MoVA:非对称双投影实现模块化长视频-文本对齐
-
MoVA将视频-文本对齐问题建模为潜变量识别问题,提出非对称双投影架构——文本侧时域遮罩网络逐帧筛选相关文本概念、视频侧概念遮罩网络隔离文本相关的视觉因子——配合模块化对比学习目标实现长视频与长文本的结构化解耦对齐。
- Multi-modality Image Fusion under Adverse Weather: Mask-Guided Feature Restoration and Interaction
-
AMG-Fuse 提出掩码引导的恶劣天气多模态图像融合框架,通过从"伪真值"(Pseudo Ground Truth)中解耦模态贡献掩码,结合掩码引导特征提取模块(MFEM)中的跨模态交叉注意力(MCCA)、掩码引导学习策略(MGLS)和任务耦合退化感知学习策略(TDAS),在统一网络中同时完成特征恢复与跨模态交互,在雪/雨/雾三类恶劣天气及真实场景下全面超越 SOTA,并在下游目标检测任务中取得最优 mAP。
- NegAS: Negative Label Guided Attention and Scoring for Out-of-Distribution Object Detection with Vision-Language Models
-
NegAS 针对 VLM 目标检测器在 OOD 场景下的两个特有挑战——文本引导注意力的背景区域无差别处理和 sigmoid 多标签输出与 softmax OOD 评分不兼容——分别提出负标签引导注意力模块 NegA 和负标签引导评分函数 NegS,在 YOLO-World 和 Grounding DINO 上均大幅改善 OOD 检测性能,且推理时零额外开销。
- PanoGrounder: Bridging 2D and 3D with Panoramic Scene Representations for VLM-based 3D Visual Grounding
-
用「全景渲染图」当作 2D 和 3D 之间的中间表示,让预训练的 2D VLM(CogVLM-17B)在一张 360° 全景图上直接输出 2D 框,再把多视角预测提升融合成 3D 框,从而把 2D VLM 的强语言推理能力搬到 3D visual grounding 上,在 ScanRefer 和 Nr3D 上取得 SOTA 并对未见场景/改写文本泛化良好。
- ProactiveBench: Benchmarking Proactiveness in Multimodal Large Language Models
-
本文提出 ProactiveBench——首个评测多模态大模型「主动性」的基准,把 7 个现有数据集改造成「初始画面模糊、需要用户干预才能答对」的多轮交互环境,评测 22 个 MLLM 后发现它们几乎都不会主动求助(要么弃答要么幻觉),且主动性不随模型规模涌现,但用 GRPO 加定制奖励微调可以让模型学会主动、并泛化到没见过的场景。
- Rank-Aware Hyperbolic Alignment for Vision–Language Dataset Distillation
-
把图文特征 lift 到 Lorentz 双曲空间做对比对齐(hITC),再把真实批次图文协方差按累积能量 SVD 拆成 range(主共享方向)与 residual(弱耦合方向)两个子空间,分别用 Sinkhorn 最优传输匹配相关性分布并加非对称正则,从而在极限压缩预算下只选择性对齐信息量大的共享结构、放行模态私有多样性,取得更好的跨架构迁移与鲁棒性。
- MedRegion-CT: Region-Aware Multimodal Large Language Model via SlowFast Tokenization and Pseudo-Mask Guidance for 3D CT Report Generation
-
MedRegion-CT 提出一套区域感知的 3D CT 报告生成框架,通过区域 SlowFast Tokenizer、掩码驱动视觉提取器和病灶属性文本编码三个模块,将放射科医生的层级化诊断流程显式建模到 MLLM 中,在结构化胸部 CT 报告生成基准上达到 SOTA。
- RSICCLLM: A Multimodal Large Language Model for Remote Sensing Image Change Captioning
-
RSICCLLM 是首个面向遥感图像变化描述(RSICC)的大模型后训练框架:先利用二值变化掩码作为几何先验、借助 Qwen-VL-Max 自动生成大规模指令数据集 RSICI,再通过差分感知监督微调(CDC 几何纹理提取 + Hough 投票 + Cross-Attention 融合)显式注入变化表征,最后以双负样本偏好优化(DNPO)精炼输出质量,仅 7B 参数即在全部 8 项指标上超越 Qwen3-VL-235B、InternVL-3.5-241B 等数百 B 级通用模型和 RSICC 专用模型。
- Skin-R1: Clinical Knowledge-Guided Dermatological Diagnosis Using Vision-Language Models
-
Skin-R1 提出三阶段训练框架——先由权威皮肤科教科书自动构建分层感知和鉴别诊断推理轨迹数据集 SkinRationale,再通过 SFT 初始化模型的临床推理能力,最后用 GRPO 强化学习配合层次化奖励设计将推理能力泛化到大规模稀疏标注数据集,在多项皮肤病诊断基准上全面超越现有 Med-VLM。
- Solving Semi-Supervised Few-Shot Learning from an Auto-Annotation Perspective
-
本文从自动标注的现实视角研究半监督小样本学习(SSFSL),发现现有SSL方法直接微调VLM时会因VLM产生"平坦"的softmax概率分布而完全失效(未标注数据利用率为零、训练监督不足),提出用两个简单的温度参数(置信度温度 \(T_{conf}\) 和损失温度 \(T_{loss}\))来锐化softmax输出并增强训练信号,结合三阶段分步训练与外部开放数据检索,在5个细粒度基准上超越现有方法约5个点,甚至媲美全监督学习。
- StarDojo: Benchmarking Open-Ended Behaviors of Agentic Multimodal LLMs in Production–Living Simulations with Stardew Valley
-
本文基于《星露谷物语》构建了 StarDojo——首个把「生产活动」与「社交生活」耦合在一起评测的开放世界 MLLM 智能体基准,含 1000 个精标任务,最强的 GPT-4.1 也只有 12.7% 成功率,暴露出当前 MLLM 在视觉理解、多模态推理与低层控制上的严重短板。
- Staying VIGILant: Mitigating Visual Laziness via Counterfactual Visual Alignment in MLLMs
-
针对 MLLM「明明看到了正确视觉证据却被语言先验带偏」的视觉惰性问题,本文提出 VIGIL,把一个「屏蔽视觉注意力的反事实盲态」当作负锚点塞进 DPO 偏好优化,用几何约束显式拉大「看得见」与「看不见」两种状态下的对数似然差距,从而强迫模型的高置信度回答因果地锚定在像素上——仅用 25% 偏好数据就超过 SOTA,还意外涌现出空间定位能力。
- StochasT: Learning with Stochastic Turn Depth for Visual Instruction Tuning
-
StochasT提出在LVLM视觉指令微调时随机剪裁对话历史上下文,将固定链条展开为对话树,训练出一个隐式多深度集成模型,使单轮与多轮评估性能同时达到最优,并配套提出基于平衡拉丁方的鲁棒性评估框架与CRA/CRA+指标。
- UniTac: A Unified Multimodal Model for Cross-Sensor Tactile Understanding and Generation
-
UniTac 是第一个把「理解」与「生成」统一到单一框架里的触觉多模态大模型,通过同时建模「物体级语义」和「传感器级配置」这两层信息,在跨 GelSight/DIGIT/Duragel 等异构触觉传感器上既能推理物体物理属性、又能合成逼真的触觉信号。
- VisNec: Measuring and Leveraging Visual Necessity for Multimodal Instruction Tuning
-
VisNec 通过对比多模态模型在「有图 vs 无图」两次前向传播的损失差,量化每条训练样本对视觉输入的依赖程度,进而筛选出真正需要跨模态推理的高价值子集——仅用 15% 的 LLaVA-665K 数据就恢复甚至超越全量训练的性能。
- VisReflect: Latent Visual Reflection for Fine-Grained Perception in Long Visual Context
-
VisReflect 提出潜空间视觉反射机制,让 LVLM 在生成
<VR>特殊令牌时用其隐状态直接召回图像/视频中与查询相关的视觉特征,从而在单次前向传播内实现注意力重聚焦,避免现有"缩放-重编码"范式中的坐标预测误差与多次前向开销,在图像和视频细粒度感知任务上分别提升 4.1% 和 1.8%,推理速度比多轮缩放方法快 44%。 - Wake up for Touch! Mask-isolated Tactile Alignment Learning in MLLMs
-
本文提出 Splash,一种掩码隔离的触觉对齐框架,通过 Wanda 风格的重要性评分将小 MLLM 的 LLM 参数划分为"休眠"与"关键"两个子空间,只更新休眠子空间来编码触觉能力,冻结的关键子空间则作为稳定锚点保持原有视觉语言推理不受损害。
- When Sinks Help or Hurt: Unified Framework for Attention Sink in Large Vision-Language Models
-
本文把大视觉语言模型里的"视觉注意力汇聚点"拆成来自视觉编码器的 V-sink 和在 LLM 深层新生的 L-sink 两类,揭示它们编码全局场景先验、有利于粗粒度推理却压制细粒度感知的双刃剑效应,并提出一个冻结主干、只训练轻量 MLP 的逐层门控 LSG,按输入和层深动态调整 sink 的 Key 缩放,在多模态 benchmark 上普遍涨点。