🔍 信息检索/RAG¶
🎞️ ECCV2026 · 8 篇论文解读
📌 同领域跨会议浏览: 🔬 ICLR2026 (81) · 💬 ACL2026 (73) · 🧪 ICML2026 (26) · 🤖 AAAI2026 (21) · 🧠 NeurIPS2025 (25) · 📹 ICCV2025 (5)
- TSEmbed: Unlocking Task Scaling in Universal Multimodal Embeddings
-
TSEmbed 用输入相关的 MoE-LoRA 分担多模态任务冲突,再在专家预热后根据路由相似度加权困难负样本,使仅使用 MMEB 训练的 2B/7B 模型分别达到 70.5/74.7 的总体分数,超过同设置 B3 基线 2.4/2.7 个百分点。
- LightSTAR: Efficient Visual Document Retrieval via Lightweight Selection with Vision-Adaptive Refinement
-
LightSTAR 针对视觉文档检索中 MLLM 全量编码页面太慢的问题,先用 LLM-free 轻量视觉选择模块高召回筛出候选,再只对候选做视觉自适应语义精排,在 ViDoRe 上达到 89.1 NDCG@5,同时把 5000 页端到端延迟降到 123.9s。
- FlowCIR: Semantic Transport via Flow Matching for Zero-Shot Composed Image Retrieval
-
FlowCIR 将零样本组合图像检索重新建模为视觉语言模型嵌入空间中以参考图像为条件的连续语义传输问题,利用条件流匹配与 Top-K 难负样本对比监督实现高效单步传输,并在推理期引入多负向导向策略抑制否定概念坍缩,仅需单卡 3090 训练 0.5 小时即可刷新多项基准。
- HyFL-CLIP: Hyperbolic Fine-Tuning of CLIP for Robust Long-Context Understanding
-
HyFL-CLIP 将预训练 CLIP 的欧氏图文对齐蒸馏到双曲空间(Lorentz 模型),通过爱因斯坦中点聚合建模"全局描述--局部成分"的层次蕴涵关系,使模型在长文本被扰动(重排、删除、丢词)时仍能稳定检索正确图像,在扰动词下比最强基线提升最高 19.5%。
- ME-IQA: Memory-Enhanced Image Quality Assessment via Re-Ranking
-
针对推理增强型视觉语言模型在图像质量评价中严重的离散坍缩问题,ME-IQA 提出一种无需重训的即插即用测试时记忆重排序框架,通过混合记忆库检索对齐邻居、利用 VLM 成对偏好在瑟斯顿 Case V 模型下融合序数证据,大幅提升了细粒度失真敏感度与评分连续性。
- What Images Cannot Say: Language-Guided Olfactory Representation Learning
-
针对图像无法直接观测全场景气味弥散源与环境背景的问题,SCENT 提出利用视觉语言模型(VLM)生成涵盖物体、环境与推测气味的文本先验作为语义桥梁,结合双投影对齐与气味隐空间解耦机制,在电子鼻气味-图像/文本检索任务上取得 SOTA 表现。
- MMAgent-R2: Learning to Rerank and Reject for Agentic mRAG
-
MMAgent-R2 将视觉重排序(Visual Reranking)与主动拒绝(Active Rejection)统一为智能体的内部校验机制,配合步级验证奖励的 GRPO 强化学习,解决了现有多模态 RAG 受困于全局特征检索失真及静态候选池的实体混淆难题。
- Multi-Anchor Distillation with Text-Guided Analytic Classifier for Continual Learning
-
针对 CLIP 类增量学习中编码器特征累积漂移与梯度分类器决策边界覆盖双重遗忘,本文提出多锚点历史蒸馏结合闭式正交解析分类器的免样本持续学习框架,大幅刷新长任务序列 SOTA。