A Dual-Transformer Architecture with Cross-Attention for Multi-Camera View Recommendation¶
会议: ECCV2026
Paper: https://eccv.ecva.net/virtual/2026/poster/5242
PDF: https://media.eventhosts.cc/Conferences/ECCV2026/pdfs/9556.pdf
代码: https://gitlab.com/UOC/aiwell/automated-video-editing-research/eccv2026-dualtransformer
领域: 视频理解
关键词: 多机位视角推荐、交叉注意力、时序记忆、视频剪辑、焦点损失
一句话总结¶
本文把“理解已播出的镜头历史”和“评估当前候选机位”分开建模,让候选视角通过交叉注意力查询历史记忆;配合冻结的 SwinV2-Tiny 和焦点损失,在 TVMCE 上取得 69.65% 的 [email protected],但这一指标不是强制六选一的准确率。
研究背景与动机¶
多机位剪辑不是找出单帧中最清晰、最显眼的画面,而是在已经播出的镜头之后,选择叙事上合适的下一个视角。 同一时刻的全景、近景和侧面镜头可能都合理,但它们与前面镜头的衔接关系不同,单看当前图像无法判断是否重复、是否延续了当前主体。 TVMCE 提供同步的真实原始机位素材以及专业剪辑结果,避免了用已剪视频中的非同步帧伪装成候选机位的问题。 先前的 TC-Transformer 联合建模历史与候选,Lee 等人的后续方法又加入时间偏移和相机身份,使模型能利用“之前播过什么、是哪台机位”等编辑线索。
本文沿着这条路线改架构,而不是增加新的剪辑规则或多模态数据。 作者认为,把历史镜头和候选机位拼在一个序列中,会让“总结过去”与“比较当前选项”过早混合:历史应当形成相对稳定的上下文,不同候选则需要有针对性地读取它。 这里的实际任务边界也很重要:输入已经对应一个编辑决策点,模型选择机位,而不是同时确定整段视频应该在何时切镜头。 因此,方法适合归入视频理解与剪辑推荐,而不是人体理解;演员动作并不是其主要预测对象。
交叉注意力提供了一个直接的结构约束:先让过去形成记忆,再让每个候选提出自己的查询,最后在读取历史后相互比较。 这样既保留候选间的竞争关系,又不用让候选参与历史记忆本身的编码。 核心 idea:把剪辑上下文做成独立时序记忆,让候选机位以查询的方式读取相关历史,再通过候选间自注意力完成推荐,而不是把历史和候选一次性混合。
方法详解¶
整体框架¶
每个样本包含 16 个历史视觉输入和 6 个同步候选视角,输出是每个候选的独立推荐分数。 论文在不同段落中交替使用“past frames”和“past shots”,因此这里将它们统称为历史视觉输入,不额外假定具体的跨镜头采样细则。 所有图像经共享、冻结的视觉骨干提取特征,并线性投影到 768 维。 随后依次完成时序记忆、候选查询和候选精炼三个环节;身份嵌入、时间编码、预测头分别服务于这些环节,而不是独立的额外任务。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["历史与候选图像<br/>冻结骨干及投影"] --> B["时序记忆<br/>历史编码器"]
A -->|"候选特征与身份"| C["候选查询<br/>候选编码器及交叉注意力"]
B -->|"历史键和值"| C
C --> D["候选精炼<br/>自注意力及预测头"]
D --> E["六个推荐分数<br/>阈值筛选或最高分选择"]
训练时,历史与候选两个编码器、嵌入、投影、交叉注意力和预测头学习编辑选择,视觉骨干不更新。 推理时不需要微调就能应用一般模型;针对单个视频的适配是额外实验,不是每次推荐必需的步骤。 分数经过 sigmoid 后既可按阈值保留多个候选,也可按最高分强制选择一个机位,这两种使用方式对应不同评测口径。
关键设计¶
1. 时序记忆:先形成不受当前候选干扰的历史表示
历史分支把视觉特征、时间偏移编码和相机身份信息相加,再送入一层 Temporal Transformer Encoder。 时间编码采用基于整数帧偏移的正弦位置编码,偏移上限截断为 500;它表达某个历史输入离当前决策有多远,而不只是序列中排第几。 相机身份采用可学习嵌入;方法第 3.2 节具体写的是当前相机身份,因此不能把它擅自扩展成论文未说明的逐历史镜头相机轨迹。 编码器在历史内部执行自注意力,输出仍然保留 16 个位置的记忆,而不是把所有过去压成一个平均向量。
这个分支的作用不是直接选机位,而是准备供候选读取的上下文。 它的输出成为后续交叉注意力的键和值,候选不会反过来改写该轮历史记忆。 相较于拼接式编码,结构上明确限制了信息流向:先总结已经播出的内容,再评估尚未选择的画面。 这是一种归纳偏置,并不意味着论文已经从理论上证明统一编码器无法学到相同关系。
2. 候选查询:每个机位读取与自己相关的过去
候选分支将每个当前画面的视觉特征与对应机位身份嵌入相加,不把它们接到历史序列尾部。 这些候选先经过一层 Candidate Transformer Encoder,在读取历史之前就能知道其他可用视角是什么。 因此,“每个候选独立查询历史”不应误读为候选之间完全独立:前面的候选编码器已经允许它们互相交换信息。 经过候选编码后的表示作为查询,历史记忆作为键和值,用 8 头交叉注意力进行匹配与读取。
若用 \(Q\) 表示已经编码的候选、\(M\) 表示历史记忆,核心残差更新可按原文式(5)写成:
每个查询根据自身内容对历史位置赋权,再把取回的上下文加回候选表示。 这使近景与全景可以关注不同的历史证据,而不是只能共享一个整体历史摘要。 残差保留候选自身的视觉信息,避免推荐分数仅由过去决定。 论文没有额外监督这些注意力权重,也没有显式写入镜头正反打等规则;它们由编辑标签间接学习。
3. 候选精炼:读完历史后再比较,输出可阈值化的推荐分数
交叉注意力之后还有一层浅的候选自注意力,使用 4 个注意力头。 它让各候选在获得历史上下文以后再次交互,与交叉注意力之前的候选编码器用途不同:前者比较已经结合过去的选项,后者比较当前选项。 若只写成“查询历史后直接打分”,就会漏掉这一实际组件。 最终预测头包含 Layer Normalization、GELU 和两层 MLP,隐藏层宽度为 192,每个候选输出一个 logit。
模型没有用六类 softmax 强制所有候选概率之和为一,而是将每个候选视为一个二元判断。 一次决策可能有多个分数高于阈值,也可能全部低于阈值;这对理解 [email protected] 至关重要。 焦点损失用于缓解一个正候选与其余负候选之间的不平衡,把较少训练权重分给容易判对的样本。 它改变的是监督方式,不是额外引入一个负责剪辑风格的网络。
一个完整示例¶
以一个已经确定的切镜头时刻为例,系统拿到过去 16 个视觉输入,以及当前 6 台机位的画面。 历史分支先编码已经播出的内容,候选分支则分别表示当前有哪些视角可选。 一个近景候选可以通过交叉注意力读取与当前主体有关的历史位置,一个全景候选则可以从其他位置获得不同上下文;这只是机制示意,不是论文可视化直接验证的注意力解释。 读完历史后,六个候选再次交换信息并分别得到分数,推荐端可以保留高于阈值的项,或者只取最高分。 如果两个候选超过 0.5,其中一个是标注机位,那么该样本的 precision 是 \(1/2\);即使正确机位排第一,也不能把这个数当作 top-1 准确率。 这个例子说明了为什么同一个模型需要同时报告阈值指标和 Recall@1,而非只看排序图。
损失函数 / 训练策略¶
第 3.3、4.1 节使用二元交叉熵上的焦点加权:正确类别概率越高,乘上的难度权重越小。 焦点损失参数为 \(\alpha=0.25\)、\(\gamma=2.0\);正文对比同时保留普通 BCE 版本,便于区分架构变化与损失变化。 默认骨干是 ImageNet-1K 预训练的 SwinV2-Tiny,冻结权重,只训练后续模块。 优化器为 AdamW,学习率 \(10^{-5}\),训练 30 个 epoch。 局部视频适配从通用 TVMCE 模型开始,使用目标视频局部训练数据的不同份额,并在该视频独立的局部测试划分上评估。
实验关键数据¶
主实验¶
TVMCE 包含 88 小时原始视频与 14 小时已剪视频,覆盖演唱会、体育、晚会和比赛等场景。 下表节选原文表 1 的 TVMCE 基准评测,指标均为 [email protected](%,越高越好);它不是训练集拟合结果。 论文称沿用基准协议,但正文没有给出全局训练、验证、测试的具体样本数,复现时仍需核对数据划分。
| 方法 | 骨干与损失 | [email protected] ↑ | 对比含义 |
|---|---|---|---|
| TC-Transformer,已有结果 | 原始配置 | 22.50 | 早期联合编码基线 |
| Lee 等,已有结果 | 原始配置 | 37.16 | 论文引用的先前最佳结果 |
| 单 Transformer,作者复现 | SwinV1 + BCE | 47.97 | 同骨干同损失的架构参照 |
| 单 Transformer,作者复现 | SwinV2 + BCE | 54.06 | 更换骨干后的复现基线 |
| 双 Transformer | SwinV1 + BCE | 52.60 | 相对同配置复现基线增加 4.63 个百分点 |
| 双 Transformer | SwinV1 + Focal | 56.60 | 相对上一行增加 4.00 个百分点 |
| 双 Transformer | SwinV2 + Focal | 69.65 | 最佳组合,不等于单独架构增益 |
Lee 等没有公开代码与权重,因此表中的单 Transformer 是本文作者依据描述进行的复现,并非原作者实现。 37.16% 与 47.97% 的差距说明实现和训练设置本身影响明显;把 69.65% 相对 37.16% 的全部差距归因于交叉注意力不公平。 同骨干同损失的 47.97% → 52.60% 更接近架构贡献,但论文仍未把交叉注意力、额外编码器和末端自注意力分别拆开消融。
消融实验¶
下表节选原文表 2,数据与指标沿用 TVMCE 基准;所有行固定双 Transformer 和 Focal Loss,只更换视觉骨干。 它属于骨干敏感性实验,不是逐个移除核心注意力模块的消融。
| 视觉骨干 | [email protected](%)↑ | 观察 |
|---|---|---|
| SwinV2-Tiny | 69.65 | 所列配置中最好 |
| MaxViT-Tiny | 58.63 | 另一种层次化视觉骨干 |
| SwinV1-Tiny | 56.60 | 与 SwinV2 的差距为 13.05 个百分点 |
| ConvNeXtV2-Tiny | 56.23 | 卷积路线也有竞争力 |
| ResNet-50 | 46.74 | 低于上述较强骨干 |
| ViT-Base | 25.85 | 本设置下表现较弱 |
作者据此认为层次化窗口特征适合区分相近机位,但不同骨干的预训练与表示能力也会影响结果。 表 2 没有提供统一延迟、参数量或多次运行方差,因此不能仅凭这一表断言某种注意力机制在效率或统计显著性上胜出。
关键发现¶
- 阈值会改变结论。 表 3 在验证集上按宏平均 F1 选出 \(\tau=0.3\),对应验证 F1 为 81.41%;固定该阈值后,测试 precision/recall/F1 为 74.66%/80.35%/76.52%。这些值不能与阈值 0.5 的主表混为同一设置。
- 平均方式也会改变最佳阈值。 表 4 的微平均评测先汇总全体 TP、FP、FN,在验证集上选择 \(\tau=0.4\),测试 F1 为 76.11%。宏平均则先对每个决策计算指标,再对样本平均。
- 强制单选更直接。 第 4.4 节报告 Recall@1 为 76.31%,即最高分机位与标注机位一致的样本比例,无需阈值。
- 适配收益并非单调泛化。 表 5 使用各视频局部训练数据的 20% 时,同视频测试的 [email protected] 分别从 74.44% 到 83.65%(video_0000)、从 81.76% 到 84.12%(video_0001);但在 video_0000 上适配后迁移到 video_0001,仅为 76.47%,低于未适配的 81.76%。
[email protected] 的核心定义是对每个样本计算 \(TP_i/(TP_i+FP_i)\),再在样本上平均,其中超过阈值且选对标注机位才算 TP。 正文没有明确说明一个候选也未超过阈值时如何处理零分母;这属于复现需要核实的细节,而不是可自行补齐的约定。
亮点与洞察¶
- 改的是信息流而非特征堆叠。 时间和相机身份来自已有路线,关键变化是候选查询历史的非对称结构;这比笼统地说“使用 Transformer 理解剪辑”更准确。
- 保留查询前后两次候选交互。 当前可用视角之间的关系,以及结合历史后的竞争关系,不必由同一层完成;但两次交互各有多大贡献仍需独立实验。
- 评测考虑实际推荐方式。 阈值筛选适合候选推荐,Recall@1 更接近自动单机位选择;把两者一起看,能避免把概率校准改善误当成排序能力改善。
局限与展望¶
- 作者指出的范围。 当前主要处理视觉机位选择,结论把引入音频动态和演员运动、完善“何时切镜头”作为未来工作,尚不是完整的自主导演系统。
- 读者判断:个性化证据有限。 只有两个目标视频,且是同一视频的局部划分;无法排除场景、机位布局或人物分布适配的作用,不能直接等同于识别了独立于内容的编辑风格。
- 读者判断:可复现细节不足。 文本未完整交代全局划分规模、无正预测样本的指标处理以及重复运行波动,局部数据比例也不应直接理解成整段视频时长比例。
- 读者判断:证据不支持强机制断言。 注意力结构和准确率提升不足以证明模型掌握了通用“电影语言”,骨干敏感性结果也不足以唯一定位增益原因。
- 原文数值有内部不一致。 引言写 SwinV2 为 69.95%、20% 适配为 83.89%,但表 1、表 2、结论使用 69.65%,表 5 列出两个视频分别为 83.65% 与 84.12%;本笔记采用可直接核对的表格数字。
相关工作与启发¶
- 对比 TC-Transformer(Rao 等,2022)。 两者都利用历史与当前候选,本文用独立记忆与交叉注意力替代混合编码,不是重新定义 TVMCE 任务。
- 对比 Lee 等(2025)。 相机身份与时间偏移不是本文首次引入;同骨干、同 BCE 的复现对照最适合讨论结构变化,已有论文分数则只提供历史背景。
- 对比 Gonzálbez-Biosca 等(2025)。 后者面向古典音乐会的多模态剪辑,区分何时切与如何切;本文集中于同步候选中的视觉推荐,不应把跨任务结果读成全面剪辑质量优劣。
评分¶
- 新颖性: 3/5 — 任务相关的信息流拆分清楚,但构成模块和监督目标均较成熟。
- 实验充分度: 3/5 — 有骨干、阈值与局部适配分析,缺少核心模块逐项消融和方差报告。
- 写作质量: 3/5 — 方法主体可复述,但指标边界、采样表述和引言数字存在需核对之处。
- 价值: 4/5 — 为多机位选择提供较直接的架构改进与更完整的评测视角,外部泛化仍待验证。