TRINITY: A Multi-Perspective Benchmark for Personal-Style Video Highlight Detection¶
会议: ECCV 2026
论文: ECCV 原文
代码: https://huggingface.co/datasets/vanilladucky/TRINITY
领域: 可解释性
关键词: 视频高光检测, 个人视频, 多视角基准, 共享-专用专家架构, 异构显著性建模
一句话总结¶
针对传统视频高光检测局限于单一事件驱动显著性的弊端,本文构建了将高光解耦为事件、情感与自然风景三个互补维度的 TRINITY 基准,并提出结合共享时序主干与视角专用专家的多分支并行预测架构,在 Mr. HiSum 与 YouTube Highlights 等基准上取得显著 SOTA 表现。
研究背景与动机¶
视频高光检测旨在自动定位未剪辑长视频中吸引人类注意力和记忆的关键片段。然而,现有主流基准(如针对体育赛事、电视节目或文本检索式片段定位任务)普遍建立在狭隘且场景绑定的显著性假设上,通常将高光严格等同于语义事件的高潮或叙事峰值。这种单视角形式在规则明确的受控场景中表现良好,但在面对以日常生活记录、个人 Vlog 为代表的非结构化个人视频时往往面临失效。在无剧本、缺乏专业剪辑与剧烈动作的个人视频中,精彩瞬间往往是异构、多成因且高度依赖主观视角的,可能来自于博主生动的情绪反应,也可能来自令人心旷神怡的沿途风光。
这种局限性的核心症结在于将本质上多维度的显著性认知强行压缩为单一标量监督。当一段视频同时包含壮丽风景与人物互动时,单一视角的标签不仅造成显著性定义模糊,还迫使模型在不同诱因的特征之间产生混淆与梯度干扰。现有方案由于缺乏多视角标签体系,既无法捕捉不同显著性维度的时序特征差异(例如情绪高光短暂爆发,而风景高光平稳舒展),也无法赋予用户根据个性化偏好筛选不同类型高光的灵活性。
为了打破这种单一维度的束缚,本文提出必须将高光建模从单一场景监督转向视频内异构显著性机制的显式解耦。核心 idea:将个人视频高光显著性统一解耦为事件演进(Event)、面部情感(Emotion)与风景美学(Nature)三个互补正交的维度,构建包含全自动可复现标注流水线的 TRINITY 基准,并设计「全局共享主干 + 视角专用专家」的多分支网络实现并行多视角高光检测。
方法详解¶
整体框架¶
本文将个人视频高光检测建模为包含事件(\(t=e\))、情感(\(t=m\))与自然(\(t=n\))三个维度的多任务时序片段评分问题。输入视频首先按固定的 5 秒无重叠窗口划分为 \(N\) 个时序片段,并通过冻结的 CLIP ViT-B/32 编码器提取 512 维片段特征序列。模型整体由一个全局共享时序主干网络与三个视角专用的私有专家主干网络并行构成,各时序主干均采用注入一维旋转位置编码(1D RoPE)的 Transformer 编码器结构。共享主干捕捉任务通用的全局上下文依赖,而各私有专家聚焦本视角的局部显著性激活;两者的特征在片段维度拼接后,经由独立的预测头分别回归对应维度的归一化高光分数。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["输入视频片段序列<br/>CLIP 512维特征"] --> B["三维度显著性解耦基准构建<br/>Event/Emotion/Nature"]
B --> C["共享-私有双流时序编码<br/>共享主干 + 视角专用专家"]
C --> D["任务条件确定性路由与多任务训练<br/>轮询采样与联合反向传播"]
D --> E["多视角并行高光输出<br/>事件/情感/风景独立评分"]
关键设计¶
1. 三维度显著性解耦基准构建:从单一事件走向互补正交的异构标注体系 传统数据集将所有高光混合为一个标量,无法应对个人视频的多成因特征。TRINITY 建立了涵盖三个维度的标注流水线:对于事件维度(Event),沿用 Mr. HiSum 汇聚的群体回放热度统计(Most Replayed),通过 5 秒窗口均值池化并保留峰值最大值以防峰值稀释,获得反映语义演进的连续得分;对于情感维度(Emotion),设计了两阶段级联标注流水线,Stage-1 先以 1 fps 提取帧序列并通过面部表情识别模型 EmotiEffLib 预测 7 种基本情绪类别,筛选至少连续 3 帧维持相同非中性情绪的稳定片段以滤除微表情噪声,Stage-2 将候选片段向外扩展 2 秒边界构建上下文窗口,送入视觉语言大模型 Qwen2-VL-7B 验证多模态语境一致性,仅在两阶段判定类别完全一致时保留为二值高光标签;对于风景维度(Nature),同样采用两阶段方案,Stage-1 借助 YOLOv8n 检测人物框并剔除人体占比超过 30% 的视频,再利用 CLIP 计算与风景/人物预定义提示词集的语义相似度筛选自然风景片段,Stage-2 调用 Everypixel UGC 图像质量评估服务,综合评估清晰度、曝光与构图生成连续美学质量分作为回归目标。该体系确保了三维度的正交性与高可信度。
2. 共享-私有双流时序编码:兼顾全局语境连贯与专用显著性激活 针对不同维度高光在时序模式上的异质性(例如情感高光平均持续仅 4.87 秒,高度集中且突发;而自然风光高光平均持续 10.34 秒,平滑延展),单一 Transformer 编码器容易出现表征退化。本文设计了一个共享主干 \(T_s\) 与三个私有主干 \(\{T_p^t\}_{t \in \{e, m, n\}}\)。两流通过完全独立的投影矩阵将输入片段序列 \(X \in \mathbb{R}^{N \times 512}\) 映射到不同的潜在子空间: $$ \begin{aligned} Q_s &= X W_Q^{(s)}, \quad K_s = X W_K^{(s)}, \quad V_s = X W_V^{(s)} \ Q_p^t &= X W_Q^{(p, t)}, \quad K_p^t = X W_K^{(p, t)}, \quad V_p^t = X W_V^{(p, t)} \end{aligned} $$ 各主干内部均配置 5 层 Transformer 编码层(隐藏维度 512,注意力头数 8),并利用 1D RoPE 注入精确的相对时间顺序信息。共享流提炼长程跨视角时序结构,私有流专精于单维度的尖锐脉冲激活。最终将两个分支在当前片段的隐表征直接拼接,由包含多层线性变换与 ReLU 激活的任务专用预测头 \(C^t\) 生成该视角的最终概率输出: $$ \hat{y}_i^t = \sigma\left(C^t\left([T_s(x_i), T_p^t(x_i)]\right)\right) $$
3. 任务条件确定性路由与多任务训练:消除多任务负迁移与梯度对抗 在多任务学习中,不同视角的监督信号来源差异巨大(连续回放分布、二值分类与美学回归混杂),传统的软性 MoE 门控极易导致不同任务的梯度在主干发生破坏性干涉。本文抛弃动态门控,采用纯任务条件的确定性路由机制:为三个任务维护三个独立的 DataLoader,每个训练迭代按轮询方式依次送入各任务的 mini-batch。每个批次仅激活共享主干 \(T_s\) 和对应的私有分支 \(T_p^t\)。三路前向完成后分别计算二值交叉熵(BCE)损失: $$ \mathcal{L}t = \frac{1}{BN} \sum^t\right) $$ 三路损失等权汇总为 }^B \sum_{i=1}^N \mathrm{BCE}\left(y_{b, i}^t, \hat{y}_{b, i\(\mathcal{L}_{total} = \sum_{t \in \{e,m,n\}} \lambda_t \mathcal{L}_t\)(其中 \(\lambda_e = \lambda_m = \lambda_n = 1\)),在轮询收集完整梯度后统一执行反向传播与参数更新。这一设计确保了私有分支专注于特定视角的表征学习,共享主干充分吸收跨任务共性特征,且梯度余弦相似度分析证明各任务梯度在训练中迅速收敛至相互正交(相似度稳定在 0 附近),从根本上避免了灾难性遗忘与任务冲突。
损失函数 / 训练策略¶
模型采用 AdamW 优化器,在 TRINITY 的三组数据子集上联合预训练。初始学习率设为 \(5 \times 10^{-5}\),权重衰减为 0.01,批大小为 16,Dropout 比例设为 0.2。若验证集性能在连续 3 个 epoch 内未能在所有任务上获得提升,则触发早停策略。在下游基准测试微调时,保持全局共享主干与非目标分支参数冻结,仅微调目标视角对应的私有分支与预测头。
实验关键数据¶
主实验¶
在公开事件基准(Mr. HiSum、YouTube Highlights)以及情感理解基准(VEATIC)上,本文方法均大幅超越了此前顶尖方案。
| 数据集 / 基准 | 评估指标 | 本文模型 (Ours) | 次优基准方法 | 性能提升 |
|---|---|---|---|---|
| Mr. HiSum | \(\text{mAP}_{\rho=15\%}\) | 40.98 | 33.83 (SummDiff) | +7.15 |
| Mr. HiSum | \(\text{mAP}_{\rho=50\%}\) | 69.06 | 65.44 (SummDiff) | +3.62 |
| YouTube Highlights (Average) | mAP | 83.82 | 73.00 (PLD-VHD) | +10.82 |
| YouTube Highlights (Gymnastics) | mAP | 91.89 | 75.80 (RASL) | +16.09 |
| YouTube Highlights (Skating) | mAP | 83.95 | 72.50 (SL-Module) | +11.45 |
| YouTube Highlights (Surfing) | mAP | 87.33 | 79.00 (PLD-VHD) | +8.33 |
| VEATIC | SAGR ↑ | 0.8185 | 0.8040 (VDFS) | +0.0145 |
| VEATIC | RMSE ↓ | 0.1749 | 0.1820 (VDFS) | -0.0071 |
在 TRINITY 基准内三个视角(Nature, Emotion, Event)的横向评测中,本文方法同样展现出全面领先优势:
| 视角与指标 | 本文 (Ours) | PGL-SUM | SL-Module | CSTA | Qwen3-VL-235B (Zero-shot) |
|---|---|---|---|---|---|
| Nature \(\text{mAP}_{\rho=15\%}\) | 58.74 | 46.40 | 38.68 | 36.47 | 27.91 |
| Nature \(\text{mAP}_{\rho=50\%}\) | 68.05 | 61.84 | 62.23 | 39.67 | 58.29 |
| Emotion \(\text{mAP}_{\rho=15\%}\) | 67.42 | 62.47 | 50.55 | 64.96 | 26.42 |
| Emotion \(\text{mAP}_{\rho=50\%}\) | 71.32 | 73.81 | 67.57 | 67.29 | 56.90 |
| Event \(\text{mAP}_{\rho=15\%}\) | 40.98 | 33.61 | 31.46 | 35.97 | 18.10 |
| Event \(\text{mAP}_{\rho=50\%}\) | 69.06 | 61.84 | 62.71 | 40.77 | 52.82 |
消融实验¶
针对架构解耦与多任务机制的有效性,作者在 TRINITY 上进行了系统的架构消融(设置 S1-S4)与数据监督消融(设置 D1-D3):
| 配置代号 | 主干构成与机制 | Event 15% | Nature 15% | Emotion 15% | 全局平均 15% | 全局平均 50% |
|---|---|---|---|---|---|---|
| S1: 单任务基线 | 1 个独立主干,无多任务 | 32.85 | 43.16 | 61.05 | 45.69 | 68.06 |
| S2: 纯共享多任务 | 1 个共享主干 + 3 个预测头 | 37.97 | 44.41 | 65.20 | 49.19 | 68.97 |
| S3: 纯独立专家 | 3 个独立主干,各自训练 | 37.54 | 44.78 | 63.27 | 48.53 | 69.70 |
| S4: 共享-私有专家 (Ours) | 1 个共享 + 3 个私有专家 (4主干) | 40.98 | 58.74 | 67.42 | 55.71 | 69.48 |
| D1: 仅 Event 监督 | S4 架构下仅用 Event 训练 | 40.25 | 31.25 | 40.83 | 37.44 | 66.93 |
| D2: Event + Nature | S4 架构下联合训练两项 | 39.98 | 57.89 | 45.98 | 48.25 | 64.32 |
| D3: 全视角监督 (Ours) | Event + Nature + Emotion 全量 | 40.98 | 58.74 | 67.42 | 55.71 | 69.48 |
关键发现¶
- 共享与私有协同收益显著:对比 S2(纯共享)与 S3(纯独立),共享主干增强了全局长程建模,而私有专家抑制了任务间特征挤压。两两结合的 S4 相比 S3 在严格指标 \(\text{mAP}_{\rho=15\%}\) 上使全局均分跃升了 7.18 个点,尤其在风景维度暴涨 13.96 个点(44.78 \(\rightarrow\) 58.74),表明风景美学高度依赖专用特征抽取。
- 正交监督无负迁移:在数据消融中,从 D1 加入 Nature 监督演进到 D2 时,Nature 性能由 31.25 飙升至 57.89(+26.64),而原有的 Event 性能仅出现微小波动(40.25 \(\rightarrow\) 39.98);进一步加入 Emotion 训练(D3)时,各维度指标全线达到顶峰,证明三个视角的互补设计使得联合学习具有正向互促效应。
- 梯度冲突几乎为零:梯度余弦相似度分析显示,在经历初期极短暂的轻微波动后,三任务之间的梯度相似度在全训练过程中均贴近于 0,验证了确定性轮询路由与独立参数分支有效避免了多任务对抗。
亮点与洞察¶
- 从单一标量到多维分解的范式革新:传统方法试图用单一网络预测一个含混的高光分数值,而本文通过将显著性拆分为事件演进、面部情感和自然美学,把高光检测推进到更贴合真实人类认知与多视角审美的层面。
- 巧妙的自动化标注流水线:没有依赖昂贵且主观波动大的人工逐帧打分,而是借助成熟的细粒度模型(EmotiEffLib、YOLOv8n、CLIP、Everypixel)与多模态大模型(Qwen2-VL-7B)构成级联检验闭环,实现了数万视频量级的高一致性标签构建。
- 时序注意力解耦清晰:注意力可视化表明,三个视角的专家分支在同一视频上分别激活了对话转折、喜悦表情与自然地标,且自发对镜头抖动和运动模糊等无效片段施加极低权重,展现出天然的时间滤波器特性。
局限与展望¶
- 作者承认的局限:情感分支主要聚焦于高频显式的面部表情(如喜悦、惊讶等),而对微妙的情绪转变、稀有负面情绪以及依赖深层语境的声音线索覆盖有限;此外基准的泛化性尚未涵盖专业影视工业级的复杂剪辑规则。
- 探索与改进方向:当前模型输入仅依赖视觉特征(CLIP ViT-B/32),未深度融合音频模态(如环境音、笑声、背景音乐节奏等),而音频在真实视频高光判断中往往起决定性作用;未来可引入多模态音视频联合建模,并将视角维度进一步扩展至社会互动或专业摄影运镜视角。
相关工作与启发¶
- vs Mr. HiSum / YouTube Highlights: 传统基准仅提供单一聚合标注,迫使模型学习场景交织的折中表征;TRINITY 显式解耦出事件、情感与风景三条主线,提供了细粒度分析与个性化检索基准。
- vs QVHighlights / UMT / TR-DETR: 检索式高光定位严重依赖测试时的自然语言文本 Query,无法在无输入查询的自动化相册生成和 Vlog 剪辑中工作;本文基于纯文本无关(Text-Agnostic)多视角建模,能全自动输出多维度高光曲线。
- vs 传统 MoE 多任务网络: 传统 MoE 采用数据驱动的门控加权,容易出现路由退化与梯度对抗;本文采用任务条件下的确定性硬路由与轮询梯度累积,保证了专家表征的纯粹性与共享表征的泛化力。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ 首次系统性提出面向个人视频的多视角高光解耦基准,立意新颖切中痛点。
- 实验充分度: ⭐⭐⭐⭐⭐ 涵盖多个主流公开基准横向对比、多维度多任务消融、梯度冲突监测及注意力可视化。
- 写作质量: ⭐⭐⭐⭐⭐ 逻辑严密,标注流水线与网络结构阐述透彻。
- 价值: ⭐⭐⭐⭐⭐ 为非结构化视频理解、智能相册高光生成与个性化视频摘要开辟了极具实用价值的新方向。