Personalizing MLLMs via Reinforced Multimodal Reference Game¶
会议: ECCV 2026
论文: ECCV 官方页面
领域: 多模态 VLM
关键词: 多模态大模型 / 个性化 / 强化学习 / 参考博弈 / GRPO
一句话总结¶
将多模态大模型个性化重塑为「说话者-听者」多模态参考博弈,利用难正例(视角/状态变化)与难负例(同类干扰)构建概率归一化的可验证对比奖励,并通过 GRPO 强化学习训练说话者生成本质、判别且状态无关的概念描述,在三项基准上全面刷新个性化生成与问答表现。
研究背景与动机¶
多模态大语言模型(MLLMs)在通用图文理解上展现了强大能力,但面对用户私有概念(如特定的一件衣服、特定宠物或专属纪念品)时,模型往往缺乏先验知识。为了赋予模型识别用户自定义概念并生成个性化回答的能力,早期方案多借鉴生成模型的测试时优化策略(如 MyVLM 和 Yo'LLaVA),为每个私有概念学习专门的伪标记或隐向量。然而这类测试时微调方法不仅推理开销极大,且每次引入新概念都需重新训练,无法适应动态开放的应用场景。近期基于检索增强与文本指纹的方案(如 R2P)尝试在测试阶段利用模型自身生成的概念描述进行图文比对,显著降低了计算成本,但标准 MLLM 生成的图像描述严重受制于通用图文预训练偏置。
标准视觉大语言模型在描述特定概念时存在三大核心痛点:首先,模型极易提及物体的瞬态物理状态(例如“挂在衣柜前”或“折叠放置”),当物体状态改变或负样本具有相同状态时,便会严重误导匹配;其次,描述常混入多余的背景与空间上下文线索,难以跨视点泛化;最关键的是,独立生成的描述缺乏对比聚焦性,无法指出该概念与同类高相似物体之间的本质区别(例如一件衬衫上独特的红色碎花纹理)。现有尝试引入强化学习(如 RePIC)的方法又往往直接训练识别器给出概念名称,导致模型倾向于走捷径过拟合而非学习本质表征。
本文的切入角度是:如果一个概念的描述能够让一个仅凭文本的“听者”在一堆高度相似的混淆项以及跨视角的同款目标中准确挑出目标物品,那么该描述就必然抓住了概念的不变性与独特性。核心 idea:将多模态大模型的个性化重塑为协同式多模态参考博弈(Multimodal Reference Game),让同一模型分别扮演「说话者」与「听者」,通过结合难正例与难负例的可验证对比奖励,借助 GRPO 强化学习端到端训练说话者生成具有细粒度判别力且排除背景/状态干扰的本质概念表征。
方法详解¶
整体框架¶
Reinforced Reference Game(RRG)将个性化概念描述学习解耦为离线博弈强化学习与在线检索推理两个阶段。在训练阶段,模型无需真实的人工标注描述,而是将同一个基座 MLLM 同时实例化为说话者 \(\Phi_\text{speak}\)(引入 LoRA 参数 \(\theta\))与听者 \(\Phi_\text{list}\)。给定目标概念的某张视图,说话者生成一段文本描述;听者则根据该描述,从包含目标概念另一挑战视图(难正例)以及同语义类别的其他物体视图(难负例)组成的候选集池中进行匹配竞猜。听者猜中与否及其置信度构成可验证奖励,通过 GRPO 优化说话者策略。在推理阶段,训练完成的说话者为用户私有概念提取鲁棒的判别性文本指纹,存入多模态数据库,进而赋能下游的检索、个性化问答与生成。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["目标概念图像与候选集输入"] --> B["双角色多模态参考博弈<br/>说话者生成紧凑判别描述"]
C["难正例与难负例构建<br/>跨视角/状态正例与同类干扰负例"] --> B
B --> D["听者二值探测匹配<br/>计算候选概念匹配置信度"]
D --> E["概率归一化可验证对比奖励<br/>GRPO 在线强化学习更新说话者 LoRA"]
E --> F["指纹检索与闭集推理<br/>多模态数据库检索与下游任务推理"]
关键设计¶
1. 双角色多模态参考博弈:将个性化描述重塑为协同通信任务 以往方法要么依赖耗时的测试时参数微调,要么直接提示冻结的通用 MLLM 生成描述,但后者生成的往往是泛化的密集图像描述,无法用于概念级重识别。针对这一痛点,RRG 将个性化抽象为一个受经典“猜猜看(Guess Who?)”启发的参考博弈。说话者 \(\Phi_\text{speak}\) 观察目标概念的一张图像 \(v_i^\text{tgt}\) 并生成描述 \(d\);听者 \(\Phi_\text{list}\) 无法直接接触 \(v_i^\text{tgt}\),仅依据描述 \(d\) 在候选集 \(V\) 中寻找对应的目标图像。由于说话者在生成时无需同时接触所有其他候选概念,保证了描述的独立性与模块化,当用户加入新概念时无需全局重算;同时博弈概念集 \(C\) 与测试阶段的私有概念集 \(P\) 严格不相交(\(C \cap P = \emptyset\)),迫使说话者学会的是通用、可迁移的判别性特征抽象机制,具备优异的零样本泛化能力。
2. 难正例与难负例构建:剥离瞬态干扰并锁定细粒度判别属性 博弈的挑战程度直接决定了说话者表征的质量。如果候选集仅仅是粗粒度的不相关图像,说话者只需输出宏观类别名(如“一件衬衫”)即可获胜,无法学到细粒度属性;而如果测试图像与训练图像视角背景完全一致,说话者又容易过拟合到背景杂波。为此,本文设计了双重难样本机制:难正例选自同一目标概念在不同光照、视点、背景甚至不同物理状态(例如同一件衣服悬挂与折叠)下的图像 \(v_j^\text{tgt}\)(\(i \neq j\)),强迫模型丢弃背景与瞬态环境信息;难负例 \(\bar{V}_\text{tgt}\) 则选自相同语义大类下的 \(U\) 个不同物体的图像(如不同人的同色系长袖衬衫),强迫模型摒弃粗粒度类别描述,聚焦于独一无二的局部花纹、材质、剪裁等本质属性。候选集合并为 \(V = \{v_j^\text{tgt}\} \cup \bar{V}_\text{tgt}\),使博弈成为高灵敏度的概念辨析测试。
3. 概率归一化可验证对比奖励:驱动说话者策略的 GRPO 在线优化 现有视觉语言模型处理长上下文多图输入时容易出现注意力涣散与跨图混淆,直接让听者一次性比对所有候选图极不稳定。RRG 将听者匹配转化为单图二值探测机制,对候选池中每一个图像 \(v_u \in V\),听者使用探测提示词评估匹配概率: $\(\rho_u = \text{Prob}_{\Phi_\text{list}}(\text{Yes} \mid v_u, d, \text{prompt}_m)\)$ 最终听者的预测为得分最高的候选 \(\text{guess} = \arg\max_u \rho_u\)。为了避免传统二值奖励(猜中为 1,猜错为 0)丢失置信度细节,本文提出了基于匹配后验归一化的可验证对比奖励: $\(r_\text{match} = \begin{cases} \frac{\rho_\text{guess}}{\sum_u \rho_u}, & \text{若 } \text{guess} = \text{tgt} \\ 0, & \text{其他} \end{cases}\)$ 该奖励将听者对真实目标的确定性与混淆项的区分度有机结合。随后采用 Group Relative Policy Optimization(GRPO),针对每个样本采样 \(S\) 条说话者生成路径 \(\{d_s\}_{s=1}^S\),在组内计算优势值并引入与参考策略 \(\pi_\text{ref}\) 的 KL 散度约束,使得模型在没有人工描述真值监督的情况下,端到端演化出高效且精确的个性化表述。
4. 指纹检索与闭集推理:无缝赋能下游个性化生成与问答 在测试阶段,系统利用训练好的说话者为每个用户概念 \(p \in P\) 构建离线多模态指纹数据库 \(\mathcal{D} = \{t_p, v_p, d_p, f_p^V, f_p^T\}_{p \in P}\),其中 \(f_p^V\) 和 \(f_p^T\) 分别为参考图像和生成描述的特征嵌入。给定用户查询图像 \(Q\),系统通过视觉与文本联合余弦相似度检索 Top-\(K\) 个最相关的候选概念,将开放集识别规约为候选空间内的闭集推理。随后将候选概念的名称与判别性描述拼接为上下文选项 \(O = \{(t_p, d_p)\}\),交由听者模型在用户任务提示词引导下生成最终的个性化回答或描述。当用户查询显式提及概念名称时,更可直接索引描述绕过检索阶段,极大兼顾了推理效率与识别精度。
损失函数 / 训练策略¶
训练过程采用 GRPO 算法优化说话者 LoRA 参数 \(\theta\)。对每个博弈样本在说话者当前策略下采样 \(S\) 条不同描述输出,计算其对比奖励 \(r_\text{match}\) 并进行组内归一化得到优势值 \(\hat{A}_t^s\)。目标函数采用带裁剪的 PPO 风格替代物,并添加策略与参考策略之间的 KL 散度惩罚: $\(\mathcal{R}(\theta) = \mathbb{E}\left[ \frac{1}{S}\sum_{s=1}^S \frac{1}{|d_s|}\sum_{t=1}^{|d_s|} \min\left(r_t^s(\theta)\hat{A}_t^s, \, \text{clip}(r_t^s(\theta), 1-\epsilon, 1+\epsilon)\hat{A}_t^s\right) - \beta D_\text{KL}(\pi_\theta \parallel \pi_\text{ref}) \right]\)$ 其中 \(r_t^s(\theta)\) 为重要性采样概率比率,\(\beta\) 调节 KL 散度约束强度。训练在 PerVA 数据集的 30 个概念上展开,而评估则直接推广到 PerVA 剩余 269 个未见概念、MyVLM 及 Yo'LLaVA 等跨域基准上。
实验关键数据¶
主实验¶
在 MyVLM、Yo'LLaVA 和 PerVA 三大个性化评测基准上,RRG 在物体识别(Recognition)与个性化图像描述(Captioning)任务中全面对比了基于测试时训练的模型(MyVLM、Yo'LLaVA)、基于检索大模型(RAP-LLaVA、RAP-Qwen)、基于强化学习的识别模型(RePIC)以及无训练文本指纹基线(R2P-Qwen)。
| 数据集 | 方法 | 识别 Pos. (↑) | 识别 Neg. (↑) | 识别 Wtd (↑) | 描述 Prec. (↑) | 描述 Rec. (↑) | 描述 F1 (↑) |
|---|---|---|---|---|---|---|---|
| MyVLM | MyVLM | 96.6 | 90.9 | 93.8 | - | - | - |
| Yo'LLaVA | 97.0 | 95.7 | 96.4 | - | - | - | |
| R2P-Qwen | 86.9 | 95.4 | 91.5 | 94.4 | 94.1 | 93.4 | |
| RAP-Qwen | 97.2 | 94.8 | 95.5 | 88.6 | 85.2 | 84.9 | |
| RePIC | 98.1 | 95.6 | 96.8 | 84.2 | 73.2 | 76.7 | |
| RRG (本文) | 91.5 | 92.0 | 91.8 | 95.7 | 95.4 | 95.0 | |
| Yo'LLaVA | Yo'LLaVA | 94.9 | 89.8 | 92.4 | - | - | - |
| R2P-Qwen | 86.2 | 95.3 | 90.8 | 89.8 | 87.5 | 86.3 | |
| RAP-Qwen | 97.2 | 87.5 | 92.3 | 76.3 | 70.7 | 69.4 | |
| RePIC | 91.9 | 91.1 | 91.5 | 79.5 | 57.7 | 62.7 | |
| RRG (本文) | 97.0 | 92.3 | 94.7 | 91.9 | 89.3 | 88.6 | |
| PerVA | MyVLM | 66.0 | 58.5 | 62.2 | - | - | - |
| Yo'LLaVA | 75.1 | 69.0 | 72.0 | - | - | - | |
| R2P-Qwen | 88.2 | 91.8 | 90.0 | 73.0 | 67.7 | 67.3 | |
| RAP-Qwen | 93.2 | 92.9 | 93.1 | 66.0 | 50.4 | 52.8 | |
| RePIC | 88.8 | 96.5 | 92.6 | 62.4 | 44.3 | 48.9 | |
| RRG (本文) | 94.0 | 88.3 | 91.1 | 89.5 | 87.9 | 86.9 |
在个性化 VQA 任务中(Yo'LLaVA 基准),RRG 达到 95.3% 的回答准确率,超越了 R2P-Qwen(94.1%)、大规模预训练的 RAP-LLaVA(93.2%)、Yo'LLaVA(92.9%)以及 GPT-4V+Vprompt(86.6%)。
消融实验¶
为了验证各个模块的贡献,论文对描述优化路径与奖励函数形式进行了深度消融分析。
表 1:描述优化机制与不同训练策略消融(MyVLM & Yo'LLaVA) | 训练配置 | MyVLM 识别 Wtd | MyVLM 描述 F1 | Yo'LLaVA 识别 Wtd | Yo'LLaVA 描述 F1 | 说明 | |---|---|---|---|---|---| | zs-speaker | 89.3 | 89.3 | 89.3 | 84.6 | 原始未微调的零样本说话者生成描述 | | listener-training | 89.7 | 92.0 | 90.4 | 86.3 | 冻结说话者,仅用强化学习训练听者识别能力 | | speaker-training | 92.2 | 92.3 | 93.9 | 87.0 | 用 MLLM 判别器直接打分优化说话者(无博弈) | | RRG (本文完整方案) | 91.8 | 95.0 | 94.7 | 88.6 | 基于参考博弈与归一化奖励优化说话者 |
表 2:强化学习奖励函数形式消融 | 奖励函数形式 | MyVLM 识别 Wtd | MyVLM 描述 F1 | Yo'LLaVA 识别 Wtd | Yo'LLaVA 描述 F1 | 说明 | |---|---|---|---|---|---| | binary reward | 92.3 | 93.4 | 93.9 | 85.5 | 仅根据猜对与否赋予 1 或 0 离散奖励 | | \(r_\text{match}\) (本文归一化概率) | 91.8 | 95.0 | 94.7 | 88.6 | 融入听者模型输出分布与置信度归一化 |
关键发现¶
- 说话者优化显著优于听者优化:相比于直接训练听者识别有瑕疵的描述(listener-training),训练说话者生成更高质量、排除状态杂质的判别性描述(RRG)对最终个性化性能的提升更加决定性(Yo'LLaVA 描述 F1 提升达 +2.3%)。垃圾输入直接限制了听者的上限。
- 参考博弈优于单体判别器:speaker-training 表明,即使对说话者进行强化微调,缺乏多候选竞争环境的判别器仍会使模型产生冗余描述;而引入难正例与难负例的参考博弈能迫使模型提取跨状态、强区分的本质属性。
- 平滑的概率奖励防止梯度坍缩:与离散的 binary reward 相比,采用归一化概率奖励 \(r_\text{match}\) 能够反馈听者对正负样本置信度差异的细微变化,在描述生成任务上带来了大幅收益(Yo'LLaVA F1 从 85.5 提升至 88.6)。
- 缓解双图幻觉瓶颈:在 MyVLM 识别任务中,因需要同时输入参考图与查询图,导致多模态模型产生将目标虚构存在的偏置;而在仅依赖文本描述作为桥梁的 Captioning 任务中,RRG 彻底释放了优势,在 PerVA 困难基准上 F1 达到 86.9,相对第二名取得近 20 个百分点的飞跃。
亮点与洞察¶
- 将概念辨识抽象为认知通信博弈:借用博弈论中的参考博弈设计,巧妙将“提取不可变且具判别力的视觉属性”这一难以人工标注的任务,转化为可直接自动判定的“听者竞猜成功率”,思路极具启发性。
- 软性归一化对比奖励设计:利用听者单图二值探测的“Yes”标记概率归一化作为奖励,巧妙规避了 MLLM 难以直接处理复杂多图输入的固有缺陷,同时保留了连续置信度梯度。
- 可迁移的零样本描述能力:仅在 PerVA 的 30 个日用概念上进行博弈训练,获得的描述策略即可无缝迁移到建筑、地标、人物等未见开放领域,展现了出色的概念无关特征抽象能力。
局限与展望¶
- 作者承认的局限:目前的参考博弈仅在单向通信中完成,说话者与听者尚未实现自适应的多轮双向交互演化;此外下游推理仍依赖检索流程,当私有数据库规模极其庞大时检索开销依然存在。
- 未提及的潜在局限:听者在训练时仅基于 LoRA 说话者生成的样本给出反馈,由于听者模型本身冻结,听者固有的多模态推理偏置与盲区可能反向塑形说话者的表达偏好;且难负例构建依赖语义大类标签,在无标签的任意开放场景下构建强负样本候选集可能受限。
- 未来改进方向:可探索说话者与听者的双智能体对抗/协同交替共进化(Co-evolution)训练策略;引入主动提问机制,允许听者对模糊特征向用户或说话者发起澄清式交互。
相关工作与启发¶
- vs R2P (ICCV 2025): R2P 依赖冻结大模型生成模板化概念指纹并依赖昂贵的多图成对推理,其描述容易充斥物体瞬时状态与背景杂质。RRG 引入强化学习参考博弈,生成的指纹具备状态不变性与细粒度判别力,免除了复杂成对推理且性能大幅领先。
- vs RePIC (NeurIPS 2025): RePIC 采用强化学习直接微调 MLLM 去预测个性化名称,容易诱导模型记忆捷径而破坏多模态推理基础。RRG 则将强化学习约束在生成判别性语言描述上,保留并放大了模型通用的推理与泛化能力。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ [将认知参考博弈与 GRPO 引入 MLLM 个性化,设计精巧且无需文本真值标注]
- 实验充分度: ⭐⭐⭐⭐⭐ [覆盖三大基准、三类下游任务,包含详细消融、预言机检索测试与质性分析]
- 写作质量: ⭐⭐⭐⭐⭐ [问题痛点剖析深刻,博弈形式化表述清晰严谨,行文流畅自然]
- 价值: ⭐⭐⭐⭐⭐ [为多模态模型个性化与无监督细粒度表征学习提供了极具落地前景的新范式]