From Script to Shot: A Benchmark for Grounding Screenplays in Movies¶
会议: ECCV 2026
论文: ECCV 2026
代码: https://github.com/jungucho92/script2shot
领域: 视频理解 / 语义分割
关键词: 剧本镜头对齐 / 视频Grounding / 电影叙事理解 / 多模态检索 / 场景分割
一句话总结¶
提出了首个涵盖跨越9个年代50部完整故事片、超过5.5万个经过人工校验的剧本场景到电影镜头对齐基准“From Script to Shot”,揭示了对白与视觉通道在叙事Grounding中的互补性与“对白锚定效应”,并在零样本场景分割与文本生成视频导向提示中验证了下游泛化价值。
研究背景与动机¶
近年来,视频-语言多模态理解取得了显著进展,但大多数突破严重依赖于以 MSR-VTT、VATEX、HowTo100M 和 WebVid 为代表的短视频数据集。这类数据通常仅包含数秒到数十秒的单一动作片段与平铺直叙的字面描述标题,无法覆盖长时间跨度中的复杂时序依赖,更难以建模电影这类完整故事作品的高阶叙事组织结构。电影在叙事维度上由场景(Scene)构成,并在视觉画面上具象为数百至数千个离散的摄影镜头(Shot);而剧本(Screenplay)作为电影摄制的叙事蓝本,不仅包含台词对话,更内嵌了场景标题、动作调度、镜头机位以及环境情境等多层次指示。
然而,现有长视频检索与剧本对齐工作长期陷入严重的片面性瓶颈。早期方法(如 Cour 等人的 Movie/Script)几乎完全依赖外挂字幕与剧本台词的文本字符串重叠来进行词法匹配,将对齐简化为文本检索问题;而以 CLIP、CLIP4Clip、DiffusionRet 和各类时序时段定位(Temporal Grounding)为代表的多模态模型,原本只面向短片段的均质图文描述设计,在直接面对包含大量非对白情境、舞台指示和剧本特有行文格式的长达两小时的电影时,往往发生严重的领域迁移与跨尺度失效。此前领域内始终缺乏一个能系统解耦“对白匹配”与“纯视觉Grounding”贡献的高质量全片级对齐评测基准。
面对剧本与镜头之间天然存在的“一对多”模糊映射、剪辑重排或未拍场景等工业现实,本文从 MovieNet 中严格筛选并校验出横跨近一个世纪的50部故事片,构建了全人工复核的双通道对齐基准。核心 idea:构建首个包含5.5万镜头级场景真值的故事片剧本对齐基准,建立解耦对白与视觉信号的标准化评测协议,揭示对白锚定带动无对白场景对齐的协作机制,为长视频多模态叙事理解提供系统性基准与下游表征支撑。
方法详解¶
整体框架¶
本文构建的“From Script to Shot”基准将剧本到镜头的跨模态映射形式化为单调序约束下的全局分配问题。输入包含电影剧本中的场景集合 \(S = \{s_1, \dots, s_M\}\) 与视频切分后的镜头集合 \(V = \{v_1, \dots, v_N\}\)。每个剧本场景被结构化解析为包含场景标题(Heading)、舞台与动作指示(Narrative direction)、角色名称(Character)和对白(Dialogue)的标签化文本序列;每个镜头则由抽取出的关键帧图像序列及时间重叠字幕构成。
评测系统统一采用两阶段解耦对齐流水线:第一阶段由具体候选模型(词法检索、对比编码器、视频检索模型或多模态大模型嵌入)分别在单模态或融合模式下计算镜头与场景的相似度打分矩阵 \(S \in \mathbb{R}^{N \times M}\);第二阶段固定采用支持丢弃离群场景的动态时间规整算法 Drop-DTW 配合基于文本长度的高斯位置先验,将相似度矩阵解码为单调的时间对齐路径 \(\phi: \{1, \dots, N\} \to \{1, \dots, M\}\)。这种两阶段解耦设计保证了不同算法在评测指标上的优劣纯粹反映其跨模态语义相似度建模的能力,而不受搜索解码算法差异的干扰。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["输入:剧本文本 + 电影镜头流"] --> B["结构化预处理与时间投影"]
B --> C["跨模态解耦相似度计算"]
C --> D["时序约束全局序列对齐"]
D --> E["双通道诊断评测与下游泛化应用"]
关键设计¶
1. 结构化预处理与时间投影:建立无歧义的双通道多模态输入表征
由于原始电影剧本存在大量排版异构且缺乏统一标注,直接比对会导致严重的格式噪声。针对这一痛点,基准首先通过剧本解析器识别场景标题(Scene Headings)并将剧本切割为独立场景单元 \(s_j = \{(t_k, x_k)\}_{k=1}^{L_j}\),其中标签 \(t_k \in \{\text{H}, \text{N}, \text{C}, \text{D}\}\) 分别标记标题、动作指示、角色与对白。在视频端,由于源数据集 MovieNet 缺失精确帧率元数据,导致镜头与独立时间码字幕之间无法直接对齐;本文利用部分已有的镜头级字幕重叠标注进行反向估计,精准反推每部电影的字幕时间偏移与视频帧率,将全量字幕流精确投影至离散镜头时间轴上,使每个镜头 \(v_i = (f_i, u_i)\) 同时具备关键帧特征 \(f_i\) 与对应的对白文本 \(u_i \in \{u, \emptyset\}\)。这一设计将原本松散的剧本与视频数据标准化为对白与视觉通道完全解耦的对齐基元。
2. 跨模态解耦相似度计算:涵盖四大范式的统一相似度评估矩阵
为了全面剖析现有各技术路线在长篇叙事理解上的能力边界,评测流水线将相似度计算划分为四大主流范式: - 纯对白词法范式(Dialogue):利用 BM25 与 TF-IDF 将场景内所有对白视作文档,将镜头关联字幕视作查询计算稀疏词频匹配,亦复现经典的词级 DTW 与 Jaccard 词重叠基线 M/S; - 纯视觉语义范式(Visual):丢弃全部字幕,采用 CLIP、SigLIP、InternVideo2、FG-CLIP 2 以及最新的 Qwen3-VL-Embedding,对镜头关键帧与场景内的动作描述及文本块计算多模态嵌入的余弦相似度; - 时序时段定位与视频文本检索范式(Temporal Grounding & VTR):评估 TAN、MATR、T-MASS、CLIP4Clip、DiffusionRet 和 DiscoVLA,检验短视频检索预训练向全片长篇剧本场景迁移的能力; - 自适应双通道多模态融合(Adaptive Multimodal Fusion):当镜头包含字幕(\(u_i \neq \emptyset\))时,将行归一化后的词法相似度与视觉相似度进行凸组合;当镜头缺少对白(\(u_i = \emptyset\))时直接回退至纯视觉相似度:
超参数 \(\alpha\) 严格通过5折电影级交叉验证确定,确保多模态打分既能吸纳对白的精确匹配,又具备对无对白镜头的视觉泛化力。
3. 时序约束全局序列对齐:带高斯先验的鲁棒动态规划解码
电影在实际剪辑后往往伴随剧本场景删减、旁白插入或跨场景交叉剪辑,标准的严格动态时间规整(DTW)极易因未拍场景而导致后续全局对齐发生雪崩式错位。基准在第二阶段统一部署 Drop-DTW 算法,显式引入场景跳过机制,允许剧本中未被实际拍摄的场景(约占全剧本20%)在解码路径中不与任何镜头匹配。同时,为了规避全局搜索在极长序列下的漂移,解码过程结合基于场景文本相对长度的高斯时序先验,对镜头分配施加柔性位置窗偏置,从而将相似度矩阵高效、单调且稳健地解码为最终的全局镜头-场景分配映射 \(\phi\)。
损失函数 / 训练策略¶
本基准主要评估现有模型在免微调 / 零样本迁移下的跨模态表征与匹配能力,统一流水线无需在目标测试集上端到端反向传播训练。在融合权重确定上,作者采用严格的5折电影级交叉验证(Movie-level 5-fold CV),严禁在测试集上偷窥调优 \(\alpha\);在评测指标上,设计了场景交并比(Scene IoU):
并分别计算对白场景均值 \(\text{mSIoU}_d\) 与非对白场景均值 \(\text{mSIoU}_{nd}\),以及边界容差评测指标 \(\text{BndF1}\)、检索召回率 \(\text{R@1}\)、\(\text{R@5}\) 和中位数排名 \(\text{MedR}\)。
实验关键数据¶
主实验¶
评测涵盖14种代表性方法及融合配置,在50部完整电影上的整体对齐质量如下表所示:
| 范式 | 方法 | mSIoU | BndF1 | IoUd | IoUnd | R@1 | R@5 | MedR |
|---|---|---|---|---|---|---|---|---|
| 对白 (Dialogue) | BM25 | 0.399 | 0.543 | 0.505 | 0.190 | 0.389 | 0.573 | 5.82 |
| 对白 (Dialogue) | TF-IDF | 0.396 | 0.546 | 0.507 | 0.175 | 0.346 | 0.576 | 5.65 |
| 对白 (Dialogue) | M/S (Cour et al.) | 0.324 | 0.480 | 0.412 | 0.156 | 0.446 | 0.545 | 6.10 |
| 视觉 (Visual) | Qwen3-VL-Embedding | 0.500 | 0.629 | 0.521 | 0.456 | 0.257 | 0.536 | 6.40 |
| 视觉 (Visual) | FG-CLIP 2 | 0.317 | 0.497 | 0.329 | 0.289 | 0.174 | 0.417 | 10.70 |
| 视觉 (Visual) | CLIP (ViT-B/32) | 0.252 | 0.434 | 0.253 | 0.252 | 0.144 | 0.375 | 11.88 |
| 视觉 (Visual) | InternVideo2 | 0.222 | 0.429 | 0.227 | 0.205 | 0.128 | 0.306 | 19.52 |
| 视觉 (Visual) | SigLIP | 0.023 | 0.189 | 0.020 | 0.035 | 0.048 | 0.167 | 30.58 |
| 时序Grounding | T-MASS | 0.130 | 0.300 | 0.123 | 0.141 | 0.088 | 0.261 | 21.02 |
| 时序Grounding | MATR | 0.016 | 0.205 | 0.014 | 0.028 | 0.023 | 0.078 | 66.49 |
| 时序Grounding | TAN | 0.009 | 0.181 | 0.006 | 0.015 | 0.003 | 0.026 | 67.32 |
| 视频检索 (VTR) | CLIP4Clip | 0.012 | 0.213 | 0.010 | 0.017 | 0.006 | 0.043 | 58.57 |
| 视频检索 (VTR) | DiffusionRet | 0.011 | 0.217 | 0.008 | 0.016 | 0.014 | 0.059 | 67.30 |
| 视频检索 (VTR) | DiscoVLA | 0.013 | 0.221 | 0.011 | 0.026 | 0.013 | 0.059 | 69.80 |
| 多模态融合 | Qwen3-VL-Emb. + BM25 (\(\alpha=0.7\)) | 0.599 | 0.695 | 0.654 | 0.496 | 0.448 | 0.686 | 2.70 |
| 多模态融合 | CLIP + BM25 (\(\alpha=0.5\)) | 0.531 | 0.633 | 0.597 | 0.403 | 0.416 | 0.594 | 4.50 |
| 多模态融合 | FG-CLIP 2 + BM25 (\(\alpha=0.5\)) | 0.526 | 0.638 | 0.598 | 0.378 | 0.426 | 0.606 | 4.30 |
消融实验¶
在自适应融合中通过5折交叉验证探索视觉权重 \(\alpha\) 的敏感度,验证多模态增益并非测试集过拟合;同时在 MovieNet-SSeg 基准上评估零样本场景分割能力:
| 评估配置 / 任务 | 核心配置或模型 | 关键指标 1 | 关键指标 2 | 说明 |
|---|---|---|---|---|
| 5折CV: CLIP + BM25 | 选定 \(\alpha=0.5\) (5/5折一致) | mSIoU = 0.531 | BndF1 = 0.633 | 各折结果稳定 (0.452~0.615) |
| 5折CV: Qwen3-VL + BM25 | 选定 \(\alpha=0.7\) (4/5折胜出) | mSIoU = 0.599 | BndF1 = 0.695 | 编码器越强,最优视觉权重越大 |
| 零样本电影场景分割 | 本文对齐导出边界 (Zero-shot) | F1 = 25.61% | mIoU = 32.24% | 免微调逼平经典无监督方法 DP (32.00%) |
| 场景分割边界吻合度 | 容差 \(\pm 3\) 镜头 F1 | F1 = 0.752 | Cohen's \(\kappa\) = 0.425 | 77.5%人工歧义边界落在对齐边界 \(\pm 2\) 镜头内 |
关键发现¶
- 对白锚定效应(Dialogue Anchoring Effect):纯视觉模型(如 CLIP)在无对白场景下表现孱弱(\(\text{IoUnd}=0.252\)),但与 BM25 融合后,无对白场景的对齐指标大幅跃升至 \(0.403\)(提升达 60%)。这是因为 BM25 依靠精准的台词重合将对白场景牢牢固定在时间轴的正确定位上,Drop-DTW 的单调时序连续性约束将这些强锚点传递给相邻的无对白场景,极大地缩减了视觉匹配的搜索空间。
- 短视频模型在整片尺度下的灾难性崩溃:在短视频片段检索上表现优异的 CLIP4Clip、DiffusionRet、DiscoVLA 以及 TAN/MATR 在完整电影对齐任务上几乎彻底失效(mSIoU \(\le 0.016\),MedR 超过50)。这暴露出面向单点描述句的跨模态模型对剧本专业行文(包含转场、环境音、心理描述)极度不适应,且欠缺全片尺度的长程判别力。
- 视觉叙事编码仍然存在实质瓶颈:即使表现最强的大模型视觉嵌入 Qwen3-VL-Embedding 与 BM25 融合后,对白场景与无对白场景的性能差距仍然高达 0.158(\(\text{IoUd}=0.654\) 对比 \(\text{IoUnd}=0.496\)),这表明现有视觉编码器难以充分理解剧本中富含镜头调度与抽象动作的舞台指示。
亮点与洞察¶
- 提出首个50部经典电影级剧本-镜头Grounding基准:跨越近一个世纪与16类题材,人工精确双重复核5.3万个镜头的场景归属,填补了长程电影叙事多模态对齐的数据空白。
- 发现并量化了“对白锚定效应”的跨模态协同机制:证明在非均质多模态长序列对齐中,离散强语义通道(台词)不仅提供自身定位,更能作为时序锚点显著约束弱语义连续通道(画面),为未来非对称多模态推理架构提供了关键范式借鉴。
- 打通影视生成与分割的下游实际落地:对齐生成的场景边界直接提供语义富集的零样本场景分割伪标签;对齐图文对更可作为 Few-shot 示例指导大模型将抽象剧本重写为高度具象的视听 Prompt,在 Kling、Sora/Veo 等主流视频生成工具中成功还原电影经典视觉风格。
局限与展望¶
- 数据集来源受限于单一语种和西方电影工业:当前50部电影全部来自 MovieNet,语种集中于英语好莱坞叙事结构,在非线性剪辑、艺术电影或非英语电影中的适用性仍待验证。
- 未建模剧本未拍场景的联合检测:当前场景 IoU 指标排除了 20% 未在最终公映版中拍摄的剧本场景,模型尚未具备直接判别“剧本中哪些段落被剪辑丢弃”的主动推理能力。
- 未来方向:需要开发专门针对剧本叙事文体(舞台指示、机位缩写、戏剧动作)的多模态预训练目标,并在视频生成端构建剧本级连贯叙事长视频生成流水线。
相关工作与启发¶
- vs Movie/Script (Cour et al., ECCV 2008):早期工作仅依靠台词与字幕的词级 DTW 匹配,在缺乏对白的场景下完全丧失对齐能力;本文建立了包含50部电影的系统化基准,将对白与视觉Grounding深度融合,并在全场景下进行综合评测。
- vs MovieNet (Huang et al., ECCV 2020):MovieNet 仅提供基础标注与未对齐的多模态源文件,本文在其基础上完成了反向帧率估计、剧本结构化拆解与5.5万镜头的人工对齐校验,开辟了剧本到镜头的全新基准任务。
- vs 传统视频-文本检索 (CLIP4Clip, UCoFiA):传统 VTR 仅在几秒短视频与单一字面描述间建立一对一检索,本文验证了这类模型在整部电影长程异构剧本上的严重退化,为长视频多模态表征设计指明了新挑战。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ 首次系统性定义长视频剧本到镜头对齐基准,建立了首个大规模人工双审真值集。
- 实验充分度: ⭐⭐⭐⭐⭐ 涵盖四大范式14种主流方法,解耦评测对白与视觉贡献,并通过交叉验证与两项下游应用严格验证。
- 写作质量: ⭐⭐⭐⭐⭐ 逻辑结构严谨清晰,问题定义数学化且具象,实验诊断与洞察深刻透彻。
- 价值: ⭐⭐⭐⭐⭐ 为长篇电影理解、跨模态时间定位以及AI辅助影视制作(智能剪辑与剧本生视频)奠定了坚实的基础设施。