🧩 多模态 VLM¶
🧠 NeurIPS2026 · 9 篇论文解读
📌 同领域跨会议浏览: 🎞️ ECCV2026 (238) · 📷 CVPR2026 (418) · 🔬 ICLR2026 (211) · 💬 ACL2026 (82) · 🧪 ICML2026 (89) · 🤖 AAAI2026 (74)
🔥 高频主题: 多模态 ×7
- Beyond Prediction: Steering VLM Agents with Retrospective World Modeling
-
RWM 让 VLM 智能体根据相邻观测的文本信念状态反推前一轮动作,并把动作与转移的一致性转成训练奖励;完整配置在四类交互任务上取得原表报告的 0.81 Overall 成功率,但其提升同时涉及回溯推理、双层 GAE、外部评审和 SCR,不能全部归因于 SCR。
- Binding Multiple Modalities via Multimodal Wasserstein Barycenter
-
BaryBind 用可学习的 Wasserstein 重心映射替代固定模态锚点,再围绕重心对多模态差向量做体积对比学习,在 VAST 骨干上的零样本检索与分类实验中取得提升,但其公开公式的对偶推导、势函数抵消及部分实验数字存在需要核实的不一致。
- Exemplar2VQA: A Scalable Exemplar-Driven Visual Question Answering Generation Framework via Multi-Agent Coding
-
Exemplar2VQA 将空间问答样例编译成可复用的仿真采图与几何标注程序,以四角色协作及执行反馈减少生成错误,仅用约 10K 合成样本便将 Qwen2.5-VL-3B 在 VSI-Bench 多项选择子集上的作者报告平均分从 35.3 提升至 42.9。
- MulTaBench: Benchmarking Multimodal Tabular Learning with Text and Image
-
MulTaBench 用“多模态确有互补收益”和“目标感知表示优于冻结嵌入”两道经验筛选,构建包含 20 个图像–表格与 20 个文本–表格任务的基准,并发现表示适配的收益可推广到新学习器,但并非每个入选数据集都稳定受益。
- SemMSA: Latent Semantic-Aided Robust Multimodal Sentiment Analysis with Incomplete Data
-
SemMSA 将残缺的文本、视觉和音频证据送入冻结 LLM,递归追加连续隐状态获得辅助语义,再用实例内核谱对齐和实例间分离学习稳健表示,在十档模态内缺失率平均评测中取得 MOSI Acc-2 74.36/73.91、MOSEI 79.61/79.38、SIMS 75.46。
- Spherical Interpolation for Backward-Compatible Multimodal Representations
-
在不重建旧图库索引的条件下,先用 Procrustes 将新模型查询对齐到旧空间,再与同一输入的旧模型查询做球面插值;多数平均检索增益来自两端表示的互补,而支持集选权重进一步提高兼容成功率。
- The Alignment Illusion in Multimodal Large Language Models
-
本文在 13 个多模态大语言模型中用等范数噪声与无关图像检验内部视觉—文本对齐,发现共享 MLP 权重足以制造高相似度,并提出主角度间隙区分单方向塌缩与多方向结构,但明确指出几何结构不能单独证明模型使用了与问题相关的视觉内容。
- Uncertainty Quantification for Computer-Use Agents: A Benchmark across Vision-Language Models and GUI Grounding Datasets
-
Argus 用统一的单步 GUI 点击记录比较不同可观测接口下的不确定性方法,发现固定模型时方法排序较易跨数据集迁移,而跨模型与开放权重到 API-only 的迁移明显减弱,且错误识别能力不能代替概率校准或空间覆盖检验。
- Who Says What: Symbolic Trimodal Binding Mechanisms in Audio-Visual LLMs
-
本文在受控成功轨迹上用表征分析和激活干预解释视听大模型如何经由时间与位置 ID 绑定“谁说了什么”,据此以现成活跃说话人检测器生成视觉提示,并通过可选轻量微调改善对话理解,但免训练收益依赖模型的视觉标记理解能力。