跳转至

A Benchmark and Multi-Agent System for Instruction-driven Cinematic Video Compilation

会议: ECCV2026
论文: https://eccv.ecva.net/virtual/2026/poster/3921
PDF: https://media.eventhosts.cc/Conferences/ECCV2026/pdfs/3708.pdf
领域: 多智能体
关键词: 影视混剪、层次化叙事记忆、迭代叙事规划、多智能体协作、指令遵循

一句话总结

论文提出影视指令混剪基准 CineBench,以及先理解原片、再规划并执行剪辑的免训练系统 CineAgents,在该基准上取得 64.13 的镜头级 F1、52.09% 的时序正确率和 87.23% 的不可能指令拒绝率。

研究背景与动机

自动剪辑不等于生成新画面,也不只是从长视频里找出几个相关片段。 用户可能要求围绕某个角色重组剧情、先展示结果再回到前因,或者把多个来源中的同一主题剪到一起,同时加入标题、音乐和转场。 既有面向日常视频的系统通常先按指令检索镜头,再排序拼接;预告片、精彩片段检测等影视方法又往往绑定固定目标。 这两类路线都不足以检验系统能否满足开放式的影视剪辑意图,因此需要既有复杂叙事要求、又有专业参考剪辑的基准。

电影中的一个镜头往往不能独立说明“谁正在对谁说什么”以及“为什么此时发生这件事”。 只把每个镜头压成一句描述,会遗失人物关系、对话归属和跨场景情节;把所有描述直接塞进上下文,又容易产生冗余和叙事误判。 即使检索到了指令中的人物和物品,如果遗漏承接事件,或者机械保持原片顺序,结果仍可能违背用户要求。 论文把前一种问题称为上下文坍缩,后一种称为时序碎片化;它们分别要求改善素材表示,以及改善基于素材的叙事决策。

CineBench 用专业剪辑师制作的指令与参考成片覆盖这些需求,CineAgents 则将创意提出和素材核验分开。 它不让模型直接猜一串镜头编号,而是先建立可反复查询的多层叙事记忆,再把创意逐层落实为实际镜头。 核心 idea:把影视混剪从“检索后排序”改成“先设计再组装”,以人物与对白支撑叙事记忆,以导演—编排者之间的证据核验循环约束最终剪辑。

方法详解

整体框架

输入是用户文本指令和一组已有影视视频,输出是重新选择、排列并加工这些视频镜头得到的成片。 系统不训练视频生成模型,也不重新合成故事中的主体画面;创作发生在镜头选择、叙事顺序和剪辑操作层面。 管理智能体解析指令并组织四类专门角色:剧本智能体、导演智能体、编排智能体和剪辑智能体。

剧本智能体先完成身份与对白对齐,再建立层次化叙事记忆,形成可复用的素材分析结果。 导演智能体根据用户意图提出故事蓝图,编排智能体检查蓝图能否由原片支持,两者通过迭代叙事规划逐层确定镜头。 最后,受监督工具执行将确认的脚本交给剪辑智能体,并利用共享历史让管理智能体检查流程或恢复已有状态。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["已有影视视频"] --> B["身份与对白对齐"]
    B --> C["层次化叙事记忆"]
    C --> D["迭代叙事规划"]
    U["用户剪辑指令"] --> D
    D -->|"证据不足,修改蓝图"| D
    D --> E["受监督工具执行"]
    E --> F["最终混剪视频"]

关键设计

1. 身份与对白对齐:先解决人物是谁、台词属于谁

剧本逆向工程首先建立人物身份锚点,而不是让每次镜头描述重新猜测角色名字。 系统利用 Wikipedia 等元数据构造人物信息库:正面人物由 InsightFace 匹配,非正面情况下使用 SOLIDER 的人物表征。 相似外观的检测结果被组织为时间轨迹,锚点身份沿轨迹传播,使遮挡、侧身等场景仍有机会继承可靠的人物身份。 这里的关键不是提出新的识别网络,而是把已有视觉识别输出变成整部影片中相对稳定的身份参照。

对白也不能仅依靠语音转写,因为出现于画面中的人物不一定正在说话,画外音又可能来自未露面的角色。 系统先通过 OCR 提取画面字幕,结合 InsightFace 关键点和 ResNet 分类器检测嘴部活动,建立可确认的视听说话人锚点。 接着用 WeSpeaker 提取这些锚点的声音特征,再以 K-means 聚类为角色绑定声纹,建立人物与对白的关联。 对白角色匹配即消融中的 DCM;它让后续摘要能够区分角色发言和他人回应,而不只记录“画面里有人讲话”。 这种设计依赖字幕、人物元数据和感知模块的可靠性,并不是无条件解决任何影视素材的身份识别问题。

2. 层次化叙事记忆:把局部镜头提升为可查询的故事上下文

AutoShot 将原片切分为镜头后,剧本智能体结合视觉信息、角色身份和对白生成镜头摘要。 为避免孤立解释当前画面,每次摘要还读取此前 10 个镜头的多模态信息缓冲。 这个局部上下文能帮助模型把动作理解成事件的发展,而不是重复输出人物和场景的外观描述。 随后系统借助 BaSSL 将镜头组织为连贯事件,再概括故事,并根据事件生成角色档案。 最终记忆同时保留镜头、事件、故事和角色四个层级,细节与高层语义并存,而不是只保存一篇全片梗概。

保留多层表示有明确的检索意义:用户提出抽象主题时可以先定位故事与人物关系,再下钻到承载该事件的具体镜头。 反过来,镜头编号与低层摘要仍提供最终剪辑所需的可执行落点,避免高层描述正确却无法定位素材。 它与单纯增大长上下文窗口不同:信息经过结构化组织,规划者不必从海量平铺字幕里一次猜中整个时间线。 消融中的 HNM 指的就是这种层次化叙事记忆;去掉它时,系统只依赖镜头级信息。 原文给出了层级生成流程,但没有充分展开事件合并阈值和角色档案的完整数据结构,不能将这些实现细节自行补成确定算法。

3. 迭代叙事规划:创意可以提出,但必须由原片证据支持

导演智能体把用户意图写成故事蓝图,按开端、发展、高潮等叙事阶段组织剪辑目标。 编排智能体不是另一个自由创作者,而是负责核验:这个角色是否属于目标影片,这段情节是否存在,计划中的叙事阶段能否找到具体素材。 核验从故事和角色层开始;双方确认后,蓝图吸收已验证上下文,再下降到事件和镜头层。 若某个提议找不到支持,编排者要求导演修订,而不是把不相关镜头勉强塞进去。

这个循环持续到各项需求落实为明确镜头,输出包含具体镜头 ID 的最终脚本。 因此,排序不是检索完成后的附加步骤,而是蓝图的一部分:用户要求倒叙时,系统应围绕其叙事阶段安排素材,而非默认原片时间顺序就是正确答案。 同一机制也为识别不可能指令提供依据,例如用户把角色安排在其未出现过的影片中时,不应通过模糊语义匹配伪造“近似满足”。 不过,论文没有给出独立拒绝分类器的详细阈值,也没有完整报告迭代预算、终止上限和失败回退协议。 能确认的是“提议—验证—修订”的证据约束机制,以及最终脚本落到真实镜头,而不是存在某种保证收敛的搜索算法。

4. 受监督工具执行:把已确认脚本变成可修改的实际成片

管理智能体确认流程无错误、脚本符合要求后,剪辑智能体组装镜头并调用外部工具。 论文列出四类后期操作:添加背景音乐、插入摘要或标题、生成视频封面、应用转场效果。 这些操作由用户意图和最终脚本共同决定;它们负责实现剪辑要求,不替代前面的剧情理解和镜头选择。 因此,即使工具执行成功,也不能据此推断故事已经连贯,执行成功率与叙事指标必须分开观察。

所有智能体在共享的影视混剪工作空间内通过结构化消息交互,每次动作及响应写入共享历史。 历史既提供后续决策的动态上下文,也作为可恢复的版本日志,使用户二次修改时能够加载已有剪辑状态,而不必重新分析整部影片。 管理者可以据此追踪错误并进行针对性干预,避免让某个中间失败无声传到最终视频。 论文将这套编排和日志机制与前面的视频记忆区分开来:前者记录任务执行状态,后者保存源素材知识,两者的复用对象不同。

一个完整示例

以原文图 2 中《绿皮书》的非线性剪辑需求为例,用户希望先呈现感谢场景,再回到人物帮忙修改书信及收信反应的相关情节,并加入封面和效果。 身份与对白对齐先确保相关对话归属于正确人物,层次化叙事记忆则将“感谢”和“书信帮助”关联到各自的故事事件。 导演提出“结果在前、原因在后”的蓝图,编排者依次查证事件与镜头,避免把原片的自然顺序直接当作剪辑顺序。 确认后的镜头脚本才交给剪辑智能体添加封面与效果;这些是机制层面的流程解释,不是论文提供的逐轮运行日志。

损失函数 / 训练策略

CineAgents 是免训练系统,主要依赖 Gemini-2.5-pro 组织智能体推理,未提出新的端到端训练损失。 实验使用配备四张 NVIDIA A100 的服务器;这不能被解读成 Gemini 本身运行在这些本地显卡上,因为论文同时报告了其 API 费用。 第 6.3 节报告,单部电影或剧集建立叙事记忆平均耗时约 1 小时、API 费用约 14 美元,之后单条指令平均约 6 分钟、0.62 美元。 预处理可以跨指令复用,所以应将冷启动分析成本与后续单次剪辑成本分开,而不能将 6 分钟描述成任意新影片的端到端耗时。

实验关键数据

主实验

CineBench 包含 500 多组指令—混剪配对,来源超过 70 部中英文电影和剧集,覆盖 1930—2020 年的作品。 指令拆为素材来源、目标内容、时序要求和剪辑操作四个维度;五名专业剪辑师参与标注。 随机抽取 20% 数据检查标注一致性,Cohen's Kappa 为 0.61;其中 30% 样本是含事实冲突的负指令。 原文没有明确给出训练、验证、测试划分;以下结果是论文表 1 的 CineBench 评测,而非额外推断出的独立测试集成绩。

方法 镜头 F1 ↑ TCS ↑ ARR ↑ CQ ↑
Gemini-2.5-pro 41.59 37.41% 23.85% 8.67
MetaGPT 55.73 46.21% 52.31% 8.85
LAVE 44.60 35.37% 40.28% 8.53
CineAgents 64.13 52.09% 87.23% 9.01

来源:表 1 主比较区;指标定义见第 3.3 节,全部越高越好。 F1 对照专业参考剪辑计算镜头选择准确性,数值沿用原表量纲;原文未交代清楚跨样本聚合方式,不应拿表中平均 Precision、Recall 重新计算并替换它。 TCS 是正确排序镜头序列的总时长占生成视频总时长的比例;ARR 是事实不可能指令被正确拒绝的比例。 CQ 是 VLM 对最终成片整体质量的评分,范围为 1—10,不是成功率。

这不是所有基线从原始视频独立起步的严格同构比较:VLLM 基线和 MetaGPT 使用 CineAgents 生成的脚本。 VLLM 基线还采用先检索、再重排的两阶段 CoT 提示,以聚焦比较混剪能力。 因此,Gemini 基线与完整系统的差距支持结构化规划的价值,但不能完全归因于更好的视觉解析;也没有等推理预算的隔离实验。

消融实验

CineBench 配置 镜头 F1 ↑ ARR ↑ ESR ↑
完整 CineAgents 64.13 87.23% 92.76%
去掉对白角色匹配 DCM 61.17 85.34% 89.91%
去掉层次化叙事记忆 HNM 58.04 72.96% 84.60%
用检索排序替换迭代叙事规划 INP 59.52 78.81% 85.07%

来源:表 1 消融区和完整系统行,变体定义见第 5.3 节;ESR 表示无系统错误完成指令的比例。 在相同基准上,去掉 HNM 的 F1 降低 6.09,ARR 降低 14.27 个百分点,是这三种消融中下降最大者。 替换 INP 后,F1 降低 4.61,ARR 降低 8.42 个百分点,说明证据核验不仅影响顺序安排,也影响对不可能要求的识别。 这些是原表差值,不是多次运行的统计显著性结论;论文未提供相应误差条或置信区间。

关键发现

  • 对 MetaGPT,完整系统 F1 提高 8.40、TCS 提高 5.88 个百分点,改进同时体现在选镜头和排顺序,而不只是一项审美打分。
  • HNM 消融比 INP 消融下降更大,提示准确的素材知识是规划的前提;不能据此断言所有任务中记忆都比规划重要。
  • 人类偏好研究每项随机取 50 个样本、招募 25 位志愿者,考察提示对齐、顺序对齐、叙事连贯和整体质量;动画扩展另涉及 10 部影片和 50 条指令。
  • 正文报告系统在这些偏好比较中领先,但本地文本未保留图 5 的具体柱状数值,因此不报告无法核对的偏好百分比。

亮点与洞察

  • 叙事表示比单纯增加角色数量更关键。 人物身份、对白归属和事件层级把智能体共享的信息变得可查证,否则多个智能体也可能一起依赖错误镜头描述。
  • 把创意自由限制在已有素材内。 导演负责构思,编排者负责证据落实,这一分工适合“不能创造不存在事实”的媒体重组任务。
  • 将素材记忆与执行历史分开复用。 前者摊薄长片解析成本,后者支持同一剪辑的二次修改,两种复用共同解释了系统的工作流价值。

局限与展望

  • 作者明确承认: 现成视觉模型在复杂影视场景中的角色检测和追踪可能失败,错误会级联到后续剪辑;作者将更强感知模块作为未来方向。
  • 读者观察: 依赖字幕、人物元数据和声纹锚点使输入条件较强;缺字幕、配音差异及特殊角色外观下的可靠性尚未被单独量化。
  • 读者观察: 多项质量指标使用 VLM,而系统本身也依赖 Gemini;人类偏好实验提供补充,但不足以排除评判器偏差或参考剪辑的主观性。
  • 复现边界: 当前全文没有附录,未提供完整提示词、迭代预算、清晰数据划分和误差统计,也未发现可确认的项目代码链接。
  • 使用边界: 原文说明影视素材仅用于非商业学术研究;基准上的技术效果不构成对影视素材再分发或商业使用的授权。

相关工作与启发

  • 对比 LAVE: LAVE 面向日常视频编辑辅助,本工作突出电影中的人物、事件因果和非线性叙事,不能仅靠局部内容相关性完成要求。
  • 对比 MetaGPT: 通用多智能体框架提供协作组织方式,CineAgents 进一步加入影视专用记忆与由粗到细的素材核验;实验说明领域表示不能被通用协作直接替代。
  • 对比 FilmAgent / MovieAgent: 后者围绕新影视内容的生成展开,本文只能选择和重组已有镜头,重点不是像素生成质量,而是素材约束下的叙事正确性。

评分

  • 新颖性:4/5。将开放式影视混剪基准与证据约束的多智能体流程结合,贡献主要在任务和系统设计。
  • 实验充分度:3/5。有主比较、真实消融与人类偏好实验,但数据划分、预算控制和统计不确定性说明不足。
  • 写作质量:3/5。问题与角色分工清楚,部分实现和评测细节不足以支持完整复现。
  • 价值:4/5。对长视频素材管理及可修改剪辑工作流有启发,但仍受感知误差、成本和素材许可约束。