Towards Effective Long Video Understanding: Dynamic MAS Construction via Meta-Agent¶
会议: ECCV 2026
论文: ECCV 2026 Poster
领域: 视频理解
关键词: 长视频理解、动态多智能体系统、元智能体、MAS-as-Code、可验证奖励强化学习
一句话总结¶
针对长视频理解中传统多智能体系统固定静态架构带来的计算冗余与推理刚性问题,本文提出 DyMAC 框架,通过视觉语言元智能体将多智能体系统建模为有向计算图并端到端生成代码,结合 SFT 与两阶段可验证奖励强化学习(RLVR),实现按视频-问题对动态定制轻量高效的协作系统。
研究背景与动机¶
长视频理解面临海量时空数据输入与上下文窗口限制的双重挑战,信息负荷与细粒度检索要求极高。近年来,基于大语言模型(LLM/VLM)的智能体方法成为主流突破方向,通过外部工具调用、层级采样与多步推理将长程视频拆解为局部子任务,有效规避了内存爆炸与信息过载。然而,现有的长视频多智能体系统(MAS)几乎全部依赖人工设计的静态、“一刀切”工作流;为了覆盖最极端的长时程因果推理或细粒度定位需求,这些系统通常堆叠了复杂的流水线或固定的多轮辩论机制。
这种静态架构的核心矛盾在于:视频理解问题的复杂度具有高度的实例异质性。对于简单的单镜头物体识别或粗粒度时间戳定位,复杂的全局多智能体协作会强制执行大量冗余的视觉解析与跨智能体交互,造成严重的推理延迟与计算资源浪费;而在面对高难度长时程逻辑推演时,固定的线性或拓扑结构又缺乏根据中间线索动态扩展验证分支的灵活性。
本文的切入角度是打破人工静态拓扑的范式,将多智能体系统的构建抽象为元层级的程序生成任务。核心 idea:由中央视觉语言元智能体(Meta-Agent)针对特定视频与问题输入,端到端生成代表多智能体系统的可执行代码(MAS-as-Code)并编译为有向计算图,同时引入 SFT 与结合准确率及计算开销的可验证奖励强化学习(RLVR),动态构建最优且计算精简的实例级多智能体协作架构。
方法详解¶
整体框架¶
DyMAC(Dynamic MAS Construction)将长视频多智能体系统构建定义为单次前向代码生成与计算图编译执行流程。输入长视频 \(V\) 与用户查询 \(Q\) 组成的联合多模态输入 \(X = (V, Q)\),中央元智能体(Meta-Agent,采用 Qwen2.5-VL-7B)通过单次解码直接生成标准可执行的 LangGraph 规范代码(MAS-as-Code)。随后,该代码被确定性编译为异构有向计算图(MAS-as-Graph)\(G = (V, E)\),图中每个节点 \(v_i\) 代表一个具备特定任务指令、基座模型容量、外部工具集与思维模式的专有智能体,有向边 \(E\) 则定义了各智能体之间的数据流与条件执行分支。系统自起始节点触发,经过各子智能体的高效并行感知、层级检索或多轮辩论,最终在汇聚节点综合观测并输出最终答案。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
IN["多模态输入<br/>长视频 V + 用户查询 Q"] --> META["元智能体生成 MAS-as-Code<br/>基于 Qwen2.5-VL-7B 单次前向解码"]
META --> GRAPH["确定性编译为 MAS-as-Graph<br/>异构有向计算图 G=(V,E)"]
GRAPH --> EXEC["动态工作流协同执行<br/>按四元元属性分配 3B/7B 模型与推理模式"]
EXEC --> RLVR["两阶段训练与奖励对齐<br/>SFT 语法注入 + RLVR 强化决策"]
RLVR --> OUT["最终答案输出<br/>高精度与低推理延迟均衡"]
关键设计¶
1. MAS-as-Code 生成与确定性图编译:将动态多智能体编排转化为代码生成
传统动态多智能体方法多依赖多轮搜索或运行时反复自省协商,在长视频场景下会导致无法承受的 API 交互开销与推理延迟。DyMAC 借鉴程序化智能体设计思想,将复杂的协作拓扑决策形式化为单次生成的代码块 \(C \sim \pi_\theta(\cdot \mid X)\)。代码中显式声明了拓扑节点添加、条件转移边及状态字典传递函数。编译后形成的异构有向图 \(G = (V, E)\) 具备高度的拓扑灵活性,能够根据任务需求自然实例化为并行扇出(如针对总结任务的多片段并发分析)、循环回溯(如针对复杂因果推演的状态自审)或扇入验证结构。
2. 智能体节点四元元属性规范:精细化分配算力与认知模式
为避免静态多智能体系统中统一采用大模型或单一推理范式带来的资源错配,DyMAC 为计算图中的每个智能体节点 \(v_i \in \mathcal{V}\) 定义了四元元属性元组: $\(v_i = \langle \mathcal{I}_i, \mathcal{M}_i, \mathcal{T}_i, \mathcal{P}_i \rangle\)$ 其中 \(\mathcal{I}_i\) 为面向特定子任务的定制系统提示词;\(\mathcal{M}_i\) 为动态路由的基础模型规模(按子任务难度在轻量级 Qwen2.5-VL-3B 与全量 7B 之间灵活切换);\(\mathcal{T}_i\) 为授权调用的离散工具集(如 FrameQA、ClipQA、时序定位 API 等);\(\mathcal{P}_i\) 为指定的认知思维模式,涵盖 Chain-of-Thought (CoT)、ReAct、Plan-and-Execute、Self-Refine、LLM-Debate 以及 Self-Consistency 六大范式。这种异构属性分配确保了简单抽取任务消耗极小算力,而歧义验证任务能调用多模型辩论。
3. SFT 与可验证奖励强化学习(RLVR):精度与执行效率联合对齐
未经训练的元智能体会产生大量语法错误与死循环图结构,而仅凭监督学习又无法学习到架构的紧凑性权衡。DyMAC 提出两阶段训练机制:第一阶段利用从 CG-Bench(>20分钟视频)中合成的高质量样本构建包含 3,519 条样本的 \(\mathcal{D}_{SFT}\) 数据集,借助 AST 抽象语法树复杂度最大化筛选并执行自回归微调;第二阶段采用基于可验证奖励的强化学习(RLVR),通过 GRPO 算法优化策略 \(\pi_\theta\)。联合奖励函数设计为: $\(\mathcal{R}(C, X) = \lambda_1 \mathcal{R}_{acc}(C, X) + \lambda_2 \mathcal{R}_{eff}(C)\)$ 其中 \(\mathcal{R}_{acc} \in \{0, 1\}\) 为答案与真实标签一致的客观可验证奖励;\(\mathcal{R}_{eff}\) 为效率惩罚的群内归一化反转值。系统统计图中每条有效执行路径 \(p \in \mathcal{P}\) 的累计开销 \(\sum_{v_i \in p} w(\mathcal{M}_i) \cdot t_i\)(\(t_i\) 为节点消耗 token 数,\(w(\mathcal{M}_i)\) 为模型参数量加权权重),取最长路径开销作为整体惩罚 \(P_{eff}(C)\) 并映射至 \([0, 1]\)。该机制迫使元智能体在保证精度的前提下自主剪枝冗余节点与边。
一个完整示例¶
以复杂长视频问答“视频中跑步男子穿的鞋子是什么颜色?”为例: - 元智能体规划:Meta-Agent 观察到视频时长较长且跑步阶段伴随剧烈运动模糊,直接生成包含 5 个节点的“Fan-out & Fan-in”协作图。 - 并行分析(Fan-out):时序定位器(Node I,3B 模型)定位跑步前准备与跑步中的两个时段,分别分发给准备阶段视觉分析器(Node IIa,3B 模型)与跑步阶段视觉分析器(Node IIb,3B 模型)并发抽取鞋部特写与动态表现。 - 跨时序辩论与综合(Fan-in):验证审查器(Node III,7B 模型,LLM-Debate 模式)对两路结果进行交叉对比,解决运动模糊导致的颜色歧义,确认准备阶段高清白色运动鞋与跑步画面的对应关系;最终合成器(Node IV)输出确定性答案 Option C(白色)。
实验关键数据¶
主实验¶
在 Video-MME、MLVU、LVBench 和 LongVideoBench(LVB)四大主流长视频基准上,与端到端 MLLM、多轮工具调用及现有智能体方法对比结果如下:
| 方法 | 模型规模 | Video-MME | MLVU | LVBench | LVB | 平均准确率 (%) | 平均耗时 (s/min视频) |
|---|---|---|---|---|---|---|---|
| Vanilla | 7B | 65.1 | 68.8 | 45.3 | 56.0 | 58.8 | 1.5 |
| Video-o3 | 7B | 66.5 | 72.1 | 47.6 | 60.5 | 61.7 | 0.9 |
| ReAct | 7B | 68.0 | 71.2 | 47.5 | 57.5 | 61.1 | 8.3 |
| VideoRAG | - | 62.1 | 72.4 | - | 58.7 | - | 20.8 |
| Vgent | 7B | 68.9 | 72.1 | - | 59.7 | - | 24.1 |
| VideoLucy | 7B+671B | 72.5 | 76.1 | 58.8 | - | - | 19.9 |
| DyMAC (本文) | 7B (主控) | 70.6 | 73.2 | 55.6 | 60.7 | 65.0 | 4.6 |
消融实验¶
针对训练阶段与多模态输入条件在 MLVU、Video-MME 及 LVB 上的消融对比:
| 配置 | MLVU | Video-MME | LVB | 平均准确率 (%) | 说明 |
|---|---|---|---|---|---|
| Vanilla | 68.8 | 65.1 | 56.0 | 63.3 | 基础单模型直接问答 |
| MAS-Text (无训练) | 55.3 | 50.8 | 46.6 | 50.9 | 纯文本输入生成图,大量代码编译错误 |
| MAS-Text + SFT | 67.7 | 66.0 | 55.6 | 63.1 | 语法学习后基本消除编译故障 |
| MAS-Text + SFT + RL | 69.5 | 67.8 | 56.0 | 64.4 | 文本输入强化微调 |
| MAS-Visual (无训练) | 54.3 | 51.2 | 48.0 | 51.2 | 视觉+文本多模态输入,未经微调 |
| MAS-Visual + SFT | 70.9 | 68.5 | 57.2 | 65.5 | 引入视频特征后拓扑合理性显著增强 |
| MAS-Visual + SFT + RL (Full) | 73.2 | 70.6 | 60.7 | 68.2 | 两阶段完整训练,达到最优权衡 |
另外,在奖励函数消融中(MLVU / Video-MME / 耗时): - 仅准确率奖励(Accuracy):72.7% / 70.0% / 13.2s - 联合奖励(Accuracy + Efficiency):73.2% / 70.6% / 4.6s,推理速度提升近 3 倍且准确率进一步提升。
关键发现¶
- 双模态感知的必要性:仅凭查询文本生成的智能体拓扑(MAS-Text + RL,64.4%)明显弱于同时感知视频视觉特征的系统(MAS-Visual + RL,68.2%),证明根据视频先验复杂度分配架构至关重要。
- 效率惩罚带来正则化增益:联合效率奖励不仅将每分钟视频推理耗时从 13.2s 压缩至 4.6s,还促使模型舍弃带来噪声的冗余智能体,使 MLVU 准确率从 72.7% 反升至 73.2%。
- 视频长度与图规模严格正相关:在 Video-MME 子集统计中,短视频(Short)生成的计算图平均仅 3.4 个节点,中等长度(Medium)为 4.7 个节点,超长视频(Long)自动扩展至 6.0 个节点,验证了系统对长程任务的自适应弹性。
亮点与洞察¶
- 多智能体架构的代码化与单次生成:将多智能体系统的拓扑构建革新为“MAS-as-Code”代码生成问题,借助成熟代码编译器规避了传统动态 MAS 依赖昂贵的多轮 LLM 运行时自我调整的缺陷。
- 可验证奖励的软硬兼顾机制:在 GRPO 框架下,将长视频 QA 的精确正确性作为硬指标,与路径最大参数-token 加权开销构成软惩罚,实现了大模型系统级“按需定制架构”的自适应对齐。
- 异构子智能体动态路由:打通了 3B 轻量模型与 7B 主力模型、单步检索与多轮辩论范式的联合决策空间,为具身智能与大模型智能体协同架构提供了通用设计范例。
局限与展望¶
- 代码生成鲁棒性与异常回退:虽然 SFT 与 RLVR 极大地降低了编译错误率,但在极小概率生成非法代码语法或死锁拓扑时,系统仍需回退机制或安全兜底逻辑支持。
- 元智能体对视频抽样帧的依赖:目前 Meta-Agent 接收 32 帧稀疏采样进行全局架构规划,对于关键视觉线索处于极窄时间窗口的极端微小事件,元智能体在初始规划阶段可能低估任务难度。
- 未来方向:探索在图执行过程中允许节点发起轻量动态重规划(局部动态子图修剪与增补),并将更广泛的专用感知工具(如 3D 轨迹预测、音频事件检测等)集成至元属性池。
相关工作与启发¶
- vs VideoLucy / VideoExplorer:VideoLucy 依赖 671B 级超大模型与深度记忆回溯,单次推理耗时高达 19.9s;VideoExplorer 侧重在固定拓扑中优化单智能体动作轨迹。DyMAC 核心优势在于将优化维度提升至“智能体系统拓扑与异构属性级”,在仅 7B 主控参数下取得了更佳的精度与显著更低的推理延迟(4.6s)。
- vs Vgent / LongVideoAgent:Vgent 与 LongVideoAgent 预设了固定的图检索流程或主从架构,对简单问题存在严重的计算浪费。DyMAC 采用 Meta-Agent 动态按需编译,在不同长度视频与问题类型间展现出显著更强的架构弹性。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ 首次将实例自适应的动态多智能体代码生成与 RLVR 引入长视频理解领域。
- 实验充分度: ⭐⭐⭐⭐⭐ 覆盖四大长视频基准,涵盖主结果、多维消融(模态/奖励/模型/推理范式)及拓扑规模分析。
- 写作质量: ⭐⭐⭐⭐⭐ 框架图逻辑清晰,数学符号与系统定义严密规范。
- 价值: ⭐⭐⭐⭐⭐ 为长视频乃至更广泛的多模态复杂推理智能体系统的效率与自适应架构设计提供了里程碑式的参考。