Finding Highlight Images In Your Albums: From Benchmark To Agentic MLLMs¶
会议: ECCV 2026
论文: ECCV 2026 Poster
代码: https://github.com/naninasm/Finding-Highlight-Images-In-Your-Albums-From-Benchmark-To-MLLM
领域: 多模态 VLM
关键词: 相册精彩图像推荐、多模态大语言模型、智能体工作流、高光分布聚合、主观认知属性
一句话总结¶
针对相册精彩图像推荐(AHR)中主观歧义大与基准缺失的难题,本文重标注构建了包含 1,010 个相册、9.7 万张图像的三套基准(含首个机主真实标注的 C-AHR-100),并提出结合局部高光分布聚合与全局多模态参考再推荐的两阶段智能体框架 Highlight4U。
研究背景与动机¶
随着移动智能终端普及和拍摄存储门槛大幅降低,用户个人相册中的照片呈现爆发式冗余增长,催生了事件识别、照片集摘要和相册精彩推荐(Album Highlight Recommendation, AHR)等相册级视觉分析任务。相比于具有客观真值的事件分类,AHR 旨在从海量照片中自动挑选兼具个人回忆、审美欣赏与社交分享价值的“高光瞬间”。然而,照片是否属于“高光”高度依赖观看者的主观情感、美学认知与个性偏好,这种固有的主观歧义性导致高质量标注极其匮乏,成为制约该领域发展多年的核心瓶颈。
以往研究通常受困于两大数据与建模壁垒:在数据层面,传统开源相册缺乏针对精彩程度的细粒度标注,单人打标偏差大,且公共评委共识能否泛化至机主私人偏好始终缺乏定量验证;在建模层面,现有方案多沿用单图独立打分范式,割裂了相册内丰富的事件时序脉络与上下文语义关联。实验表明,单图打分在筛选头部前 5% 的极高光图像时尚能奏效,但在召回扩大至长尾区间(如前 5%~15%)时性能急剧崩溃,无法模拟人类在真实相册挑选时“先定基准锚点、再比照补选”的全局对比心理机制。
针对上述挑战,本文选择从数据基准与模型架构两端同时突破。在数据端,系统性重标注了 PEC 和 CUFED 两个公开相册数据集,并采集了由 100 位真实手机机主标注的私有基准 C-AHR-100;在模型端,以 Qwen3-VL-8B-Instruct 为底座构建兼具局部细粒度打分与全局参考对比的智能体。核心 idea:将相册高光推荐解构为“单图局部概率分布回归”与“多模态全局参考对比再评分”的两阶段智能体流程,用高光分布聚合克服离散打分断裂,再以高分参考锚点引导长尾精准挖掘。
方法详解¶
整体框架¶
Highlight4U 整体采用局部到全局(Local-to-Global)的两阶段智能体协同架构。在第一阶段(局部评分阶段),微调后的视觉语言智能体接收单张输入图像并输出预测评分的 Token 分布,由高光分布聚合(HDA)模块将其映射为连续的局部高光得分 \(\hat{S}\),从而依据局部得分筛选出每个相册中最具代表性的 Top-\(M\) 张图片作为全局基准。在第二阶段(参考抽取与全局再评分阶段),智能体为上述基准图生成描述性文本,构建图文多模态全局参考集 \(\mathbf{R}\);随后以此为上下文,驱动全局重评分智能体对比相册中的其余候选图像,输出相对高光增量得分 \(E\),进而合并输出最终的推荐集合。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["相册原始图片集<br/>{X_j}"] --> B["局部高光打分智能体<br/>预测评分Token分布 P"]
B --> C["高光分布聚合 HDA<br/>映射连续局部得分 Ŝ"]
C --> D["全局参考集抽取<br/>选取Top-M高光图像"]
D --> E["多模态参考表征构建<br/>生成图像描述并拼接 R"]
E --> F["全局参考再推荐智能体<br/>对比上下文重评分 E"]
F --> G["合并输出推荐集<br/>Top-M基准 + 补充候选"]
关键设计¶
1. 细粒度高光标注体系构建:多标注者聚合与机主真实偏好验证
传统相册任务常依赖单一二值标签,无法反映主观审美的梯次性。为此,研究团队首先清洗重组了公共相册数据集 PEC(500 个相册)与 CUFED(410 个相册),每本相册由 5 位独立标注者进行二值标注(推荐高光比率建议约为 20%)。通过对每个样本的 5 份二值判定求和,构建出 0 到 5 分的连续高光显著度:0 分为公认非高光,1~2 分为少数人偏好的主观高光,3~5 分为多数人认可的共识高光。统计一致性分析(Gwet's AC1 > 0.6,且在 5 人时趋于饱和)证实高光认知存在显著跨观察者共识。此外,团队征集了 100 位真实手机机主、共计 10,000 张自备照片并由机主本人打标,创建了 C-AHR-100 数据集,搭建起从“群体公共共识”跨域迁移到“机主私有偏好”的黄金评测桥梁。
2. 高光分布聚合模块(HDA):消除离散打分惩罚对称性与序数截断
直接利用 MLLM 输出离散评分 Token(如 0~5)存在严重的序数关系割裂:交叉熵分类损失对“将 3 分误判为 4 分”和“误判为 0 分”施加完全相同的惩罚,且贪婪解码丢弃了模型在整个概率向量上保留的模糊认知。为此,Highlight4U 引入高光分布聚合模块(HDA),从 Qwen3-VL 预测的评分 Token 概率分布 \(\mathbf{P} = \{p_i\}_{i=0}^{5}\) 映射出连续的高光得分 \(\hat{S}\)。论文提出了两种实现:一种是无需训练的概率加权期望方案: $\(\hat{S} = \sum_{i=0}^{5} i \times \frac{\exp(p_i)}{\sum_{j=0}^{5}\exp(p_j)}\)$ 另一种是参数化的轻量 MLP 回归模块,将归一化概率分布输入 MLP 预测连续值,采用均方误差损失 \(\mathcal{L}_{MSE}\) 进行优化。该设计保留了分布中的不确定性过渡信息,将前 5% 的推荐精度大幅提升了 6.5% 以上。
3. 全局参考再推荐智能体:以图文锚点驱动长尾高光挖掘
孤立评分忽略了人类挑选照片时的全局对比机制以及相册特有的事件一致性。单图打分在头部表现良好,但在 Top-5%~15% 的长尾区间极易被单调构图或异常噪声带偏。Highlight4U 设计了基于全局参考的再推荐机制:首先选定局部打分最高的 Top-\(M\) 张图像(实验证明 \(M=5\) 为最优黄金平衡),由文本生成分支生成语义描述,组合为图文并茂的多模态参考上下文 \(\mathbf{R} = \{(\hat{\mathbf{X}}^i, \text{Cap}(\hat{\mathbf{X}}^i, \mathbf{Q}_2))\}_{i=0}^{M-1}\)。随后,全局重推荐智能体以 \(\mathbf{R}\) 为参考提示词,对相册中剩下的候选样本逐一打分输出对比高光得分 \(E\)。最终目标推荐数 \(\hat{N}\) 由最初的 \(M\) 张锚点图与按 \(E\) 排序截取的 \((\hat{N}-M)\) 张增量高光联合构成,彻底拉齐了长尾区间的召回率与美学质量。
一个完整示例¶
假设用户相册包含 100 张海滨度假照片,目标输出 15 张(Top-15%)精彩合影: 1. 局部打分:Qwen3-VL 对 100 张照片分别提取得分 Token 概率向量。例如照片 A(构图优美但微有逆光),Token 概率在 3 分(0.4)与 4 分(0.5)之间震荡,HDA 期望加权得出连续分 3.65;而纯离散预测仅截断为 4。 2. 基准锁定:根据 \(\hat{S}\) 排出前 5 张最高分照片(如切蛋糕瞬间、清晰全家福海滨大合照),智能体自动生成文本描述并打包为参考集 \(\mathbf{R}\)。 3. 全局比照:剩余 95 张图像带着 \(\mathbf{R}\) 作为上下文输入全局智能体。例如某张抓拍跑入浪花的侧影照片 B,孤立打分仅 2.1 分;但在以海滩场景为参考后,模型识别出其对度假主题的情感充实度与互动动态,赋予相对高光分 \(E=3.8\),成功击败光线平庸的静态风景照,补选进入最终推荐,实现从候选 100 缩减至精准 15 张的闭环。
损失函数 / 训练策略¶
模型训练在 8 张 NVIDIA A40 GPU 上通过 LLaMA-Factory 框架展开,底座采用 Qwen3-VL-8B-Instruct,基于 LoRA(秩 \(r=16\)、缩放因子 \(\alpha=32\))进行微调。局部评分模型与全局参考模型分别训练 5 个 epoch,全局批大小均为 256。优化器使用 AdamW,采用余弦退火学习率调度(最大学习率 \(1\times 10^{-4}\),warmup 比例 0.1)。在分辨率设计上,局部模型处理单图细节,将最大分辨率设为 \(1024 \times 1024\);全局模型需要同时输入 5 张参考图像和 1 张目标图像,为控制显存峰值与注意力序列长度,将图像分辨率调整为 \(512 \times 512\)。
实验关键数据¶
主实验¶
论文在 PEC、CUFED 以及私有机主数据集 C-AHR-100 上进行了多组跨领域与跨模型对比。下表汇总了代表性基线模型在 Top-5% 与 Top-15% 推荐设置下的精度(P@)、召回率(R@)及平均得分(S@)。
| 数据集 | 模型 / 方法 | 类型 | P@5% | R@5% | S@5% | P@15% | R@15% | S@15% |
|---|---|---|---|---|---|---|---|---|
| PEC | ConvNeXt-B (Reg.) | 经典视觉 (回归) | 68.8 | 22.0 | 3.20 | 54.9 | 50.8 | 2.71 |
| PEC | CLIP-ViT-B (Reg.) | 经典视觉 (回归) | 72.4 | 23.1 | 3.28 | 54.3 | 50.6 | 2.69 |
| PEC | GPT-4o | 零样本 MLLM | 29.7 | 10.1 | 1.70 | 28.2 | 26.6 | 1.66 |
| PEC | Qwen3-VL-8B (SFT) | 微调 MLLM 基线 | 66.9 | 23.9 | 3.18 | 55.4 | 53.2 | 2.71 |
| PEC | Highlight4U (无训HDA) | 本文方法 | 74.1 | 26.5 | 3.34 | 61.4 | 60.0 | 2.89 |
| PEC | Highlight4U* (MLP-HDA) | 本文方法 | 74.4 | 26.7 | 3.33 | 61.1 | 59.8 | 2.89 |
| CUFED | CLIP-ViT-B (Reg.) | 经典视觉 (回归) | 61.4 | 22.8 | 2.91 | 46.6 | 50.8 | 2.39 |
| CUFED | Qwen3-VL-8B (SFT) | 微调 MLLM 基线 | 50.2 | 20.5 | 2.55 | 39.9 | 45.5 | 2.17 |
| CUFED | Highlight4U (无训HDA) | 本文方法 | 63.1 | 26.3 | 3.03 | 53.4 | 61.3 | 2.65 |
| C-AHR-100 | GPT-4o | 零样本 MLLM | 28.4 | 9.0 | - | 25.1 | 23.3 | - |
| C-AHR-100 | CLIP-ViT-B (Reg.) | 经典视觉 (回归) | 31.7 | 9.8 | - | 28.5 | 26.4 | - |
| C-AHR-100 | Highlight4U (无训HDA) | 本文方法 (零样本泛化) | 36.0 | 11.6 | - | 31.7 | 29.6 | - |
注:在真实机主相册 C-AHR-100 上,模型直接采用在 PEC 公共标注上训练的权重进行零样本跨域迁移测试,真值为机主本人标注。
消融实验¶
在 PEC 数据集上拆解 Highlight4U 各核心组件对推荐性能的影响:
| Baseline | 微调 (SFT) | HDA (无训) | HDA* (MLP) | 参考图像 | 参考文本 | P@5% | R@5% | P@15% | R@15% | 说明 |
|---|---|---|---|---|---|---|---|---|---|---|
| ✓ | 28.6 | 9.8 | 26.1 | 24.6 | 原始未微调 Qwen3-VL 判别 | |||||
| ✓ | ✓ | 66.9 | 23.9 | 55.4 | 53.2 | 基础指令微调(离散分类) | ||||
| ✓ | ✓ | ✓ | 73.4 | 26.2 | 58.4 | 56.6 | 引入无训练分布期望聚合 | |||
| ✓ | ✓ | ✓ | 73.5 | 26.4 | 58.6 | 56.8 | 引入 MLP 参数化分布回归 | |||
| ✓ | ✓ | ✓ | ✓ | 73.3 | 26.2 | 60.0 | 58.7 | 引入局部打分选出的纯图像参考 | ||
| ✓ | ✓ | ✓ | ✓ | ✓ | 74.1 | 26.5 | 61.4 | 60.0 | 完整多模态参考全局再评分 | |
| ✓ | ✓ | ✓ | ✓ | ✓ | 74.4 | 26.7 | 61.1 | 59.8 | 完整模型(MLP 变体) |
关键发现¶
- 离散打分的致命伤与 HDA 增益:直接对 MLLM 采用离散分类微调时,P@5% 仅为 66.9%,弱于简单视觉回归模型(CLIP 的 72.4%)。一旦加入 HDA 概率分布聚合,精度立即跳升至 73.4%(+6.5%),证明大模型未被截断的软概率表征富含连续的认知强度。
- 全局参考在长尾区间的显著拉升:在只使用局部打分时,召回区间从 Top-5% 扩展至 Top-15% 时模型抗噪能力不足,R@15% 仅为 56.6%。加入全局多模态参考后,R@15% 飙升至 60.0%(相比 CLIP 的 50.6% 提升了 9.4%),证实了参考锚点在抑制后期漂移、消除相册冗余上的关键作用。
- 参考数量 \(M\) 的黄金平衡:实验表明,当参考图片数 \(M=1\) 或 \(2\) 时全局上下文不足,增益有限;当 \(M \ge 9\) 时,过多的参考图反而引入了噪声参考并摊薄显存与注意力。\(M=5\) 为最优设计点。
- 从大众共识到私人偏好的迁移可行性:在纯粹由机主私人打标的 C-AHR-100 上,Highlight4U 取得了 36.0% 的 P@5%,显著战胜商业闭源旗舰 GPT-4o(28.4%)与传统回归器(31.7%),验证了基于共识训练的大模型具有强大的个人审美迁移能力。
亮点与洞察¶
- 多标注求和消歧与真实机主私有集构建:利用 5 人二值打标求和将主观偏好转化为 0~5 的连续高光谱系,并首创包含 100 个相册的机主真实基准 C-AHR-100,填补了该领域多年缺乏客观量化评测体系的空白。
- 免训练 HDA 与多模态全局再推荐的低成本闭环:无需重度改造模型结构,仅提取输出 Token 的 Softmax 概率即把离散分类升级为平滑打分;随后用自生成的描述文本与基准图搭建上下文,巧妙模拟了摄影师挑选照片时比对参照的认知逻辑。
- 语义理解压倒纯局部纹理特征:实验中基于语义对齐的 CLIP 显著强于专注空间几何表征的 DINOv2,这一洞察清晰揭示了“相册精彩感”是一项高阶语义认知任务,指明了 MLLM 是解决此类主观任务的必然趋势。
局限与展望¶
- 作者承认的局限:受制于 GPU 显存限制,全局参考智能体不得不将图像输入分辨率从 \(1024 \times 1024\) 降至 \(512 \times 512\),且参考图数量固定为 \(M=5\),限制了超大相册中更丰富全局上下文的捕获能力。
- 外部观察的局限:模型尚未建模相册的时间轴序列关系与 GPS 地理聚集信息(如同一天同一角度连拍的严格去重机制),仍存在一定程度的近似姿态冗余风险;此外针对特定用户的少样本偏好自适应提示仍有挖掘空间。
- 未来改进方向:可结合轻量高效的长上下文多图像编码器,引入基于时序聚类的动态参考选择器,并在终端设备上探索基于机主交互点赞历史的轻量化端侧强化学习或测试时适应(TTA)。
相关工作与启发¶
- vs 相册事件识别与摘要(Bossard et al., ICCV 2013; Yu et al., EMNLP 2017):事件识别追求客观分类,相册摘要追求完整故事线覆盖;本文聚焦更偏主观审美与社交价值的 AHR 任务,强调跨越个体偏好差异的共识感知。
- vs 通用图像美学与质量评估(Q-Align, Wu et al., 2023; AVA 数据集):传统 IQA/IAA 仅评估单张图片的画质和构图,而相册高光强依赖于相册全局主题与特定事件上下文。实验中 Q-Align 与 CLIP-IQA 在 AHR 任务上全面落后,证明相册高光无法单纯用无上下文的通用美学指标替代。
评分¶
- 新颖性: ⭐⭐⭐⭐☆ 首次为 AHR 任务构建大规模多打标者与真实机主双重基准,并提出了局部到全局对比的智能体闭环。
- 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 3 套数据集、多类模型形态(传统CNN/ViT、美学专有模型、开源与闭源前沿MLLM),对比与消融十分详实。
- 写作质量: ⭐⭐⭐⭐⭐ 问题表述清晰,动机阐述切中痛点,架构图与实验逻辑链条严丝合缝。
- 价值: ⭐⭐⭐⭐☆ 无论对手机厂商终端相册智能选图、社交媒体自动成片,还是对主观多模态认知建模,都具备极高的实用与学术价值。