跳转至

LangDriveCTRL: Natural Language Controllable Driving Scene Editing with Multi-modal Agents

会议: ECCV 2026
论文: ECCV 2026 · 项目页
领域: 自动驾驶
关键词: 驾驶场景编辑、多模态智能体、场景图、轨迹生成、视频扩散

一句话总结

LangDriveCTRL 把每段真实驾驶视频重建成「静态背景 + 带轨迹的动态对象节点」的 3DGS 场景图,再由一个 LLM 编排智能体调度多模态对象接地、节点编辑、行为编辑、行为评审、视频扩散与视频评审等智能体和工具,把自然语言指令落实为对象级删除/插入/替换与多对象行为改写,指令对齐率接近此前最优方法的两倍,同时保持照片级逼真、原场景结构不变与交通合理性。

研究背景与动机

合成数据被越来越多地用来弥补真实驾驶日志在场景多样性上的稀缺,尤其是那些采集成本高到不现实的极端安全场景。传统模拟器(CARLA、AirSim)能生成多样场景,但要靠人工制作 3D 资产、工程师手写场景脚本、再靠人工反馈逐轮精修,扩展性很差。于是近年出现了两条用自然语言驱动场景编辑的路线:一条是把场景显式重建到 3D 表示、再用 LLM 编排模块化工具的智能体流水线(ChatSim、ChatDyn、AutoVFX 等),另一条是直接在像素空间按文本编辑视频的隐式世界模型(Cosmos)。

这两条路线各自缺一块,而且缺的正好是对方有的。智能体流水线有三处硬伤:它只在文本模态里推理,完全没有把场景的多模态上下文接进来,因此既难以准确锁定指令指的那个对象,也难以生成贴合的轨迹;插入对象时只是把背景和新物体直接贴在一起,视角一大、光照一复杂就露馅;最要命的是它不做任何中间校验,每一步的误差会一路累积到最终视频里。世界模型这一支反过来——画面极其逼真、行为也合理,但可控性差:它没有对象级编辑接口,会擅自改动背景甚至插入用户没要求的物体,而且同样是前馈的,错了也没有回退机制。

于是核心矛盾就很清楚了:要同时拿到「可控」和「逼真」,语言推理必须既有多模态的场景证据支撑,又有一条能把中间结果打回去重做的回路;而现有工作把这两件事拆在了两个阵营里。本文的切入角度是:把「编辑」这件事锚定在一张显式场景图上,让所有智能体与工具都围绕这张图读写,并在行为生成与视频渲染两处各插入一个评审智能体,把前馈流水线改造成带反馈的闭环。核心 idea:以 3DGS 场景图作为语言与 3D 场景之间的共享接口,用编排智能体把指令拆成对象级子任务,由多模态接地智能体用外观/行为/位置三路证据定位目标节点、行为编辑智能体用反事实行为组合驱动多对象扩散模拟器生成轨迹,再由行为评审与视频评审两个闭环分别校正轨迹与渲染,从而同时拿到指令对齐、结构保持、照片级逼真与交通合理性。

方法详解

整体框架

系统的输入是一段真实驾驶视频、一条自由形式的自然语言指令和场景地图(原始对象轨迹与地图被假定已知),输出是同一段视频在对象组成、对象行为与由此带来的相机视角上被按指令改写后的版本。它不像世界模型那样直接在像素空间生成,而是先把视频重建为一张可读写的显式场景图,再让所有智能体(有推理能力,由 LLM/VLM 驱动)与工具(无推理能力,只做原子操作)围绕这张图协作。

场景图把第 \(t\) 帧的场景写成一静态背景加 \(K\) 个动态对象的集合:

\[SG(t) = \{\, N_{\mathrm{bg}},\ \{N^{i}_{\mathrm{asset}}(t)\}_{i=1}^{K} \,\}\]

\(N_{\mathrm{bg}}\) 是整个视频共享的静态背景高斯,\(N^{i}_{\mathrm{asset}}(t)\) 是第 \(i\) 个动态对象节点(车、行人)按自身位姿变换后得到的时变高斯。每个对象节点由一份规范(canonical)高斯和一条运动轨迹组成,渲染时按轨迹把规范节点摆到对应位姿。这个表示选择直接决定了两件事:改对象只需改节点,背景天然不动;改行为只需改轨迹,外观不受牵连。场景图由场景重建工具按 OmniRe 的方式一次性建好(3DGS 分解出静态背景高斯与带轨迹变换的规范对象节点),之后被所有模块共享——这也正是整条流水线可解释、能到处插校验点的前提。

在此之上是一个编排智能体:它用上下文学习配置的现成 LLM(GPT-4)充当大脑,而实现方式很直接——把各模块提供的能力封装成模块化函数,让 LLM 直接产出调用这些函数的可执行 Python 脚本。脚本先按目标对象把用户指令拆成子指令,再对每个对象依次走流程:对象接地定位 → 按编辑类型(删除/插入/替换)改写节点并更新场景图 → 若指令涉及轨迹则调用行为编辑与行为评审 → 所有对象处理完后粗渲染 → 视频扩散谐调 → 视频评审闭环。整条链路上有两个反馈点,分别作用在「轨迹」和「像素」两级,这是本文与前馈式智能体流水线最本质的区别。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["驾驶视频 + 指令 + 地图"] --> B["场景图构建<br/>静态背景 + 动态对象节点"]
    B --> C["多模态对象接地与节点编辑<br/>外观 / 行为 / 位置三路证据"]
    C --> D["反事实行为组合与多对象轨迹模拟<br/>行为组合作 LangTraj 文本条件"]
    D --> E["行为评审闭环<br/>调 CFG 与避让引导"]
    E -->|未对齐或碰撞 / 越界| D
    E -->|轨迹通过| F["粗渲染<br/>3DGS 光栅化 + 网格深度合成"]
    F --> G["视频评审闭环<br/>谐调后调去噪强度与 L2 引导"]
    G -->|未达标,重跑扩散| G
    G -->|达标| H["编辑后视频"]

关键设计

1. 多模态对象接地与节点编辑:把开放词汇描述落到正确的场景图节点上

开放词汇检测/跟踪算法(Grounded-DINO、Grounded-SAM 一类)和 3DGS 语言场(LangSplat、4D LangSplat)在类别级识别上已经够用,但用户指令里真正起区分作用的是「左边那辆白色车」「ego 前面的黑色 SUV」这种描述——颜色、车型、空间关系、甚至运动状态。类别级方法在这种属性级区分上经常挑错对象,而接地一旦挑错,后续所有编辑都会作用在错误目标上,这个错误还会被下游的渲染放大成一段看起来「改对了」的视频。

这一路的关键在于接地智能体拿到的不是单张图,而是三路互补证据:外观上,把每个节点投影回像素空间并用 SAM 分割出它的外观;行为上,用启发式规则从轨迹里算出速度、朝向、变道等运动描述;位置上,用轨迹坐标与车道信息建立空间关系。定位分两阶段完成:先把 query 拆成 <参考节点, 目标节点, 空间关系> 三元组(例如「ego 左边那辆黑色 SUV」→ ),先按外观与行为匹配定位参考节点,再用空间关系过滤候选,最后在候选里用同一套匹配流程选出目标节点。论文在补充材料里给出该智能体相对 4D LangSplat 与 Grounded-SAM 的接地性能对比(本笔记未覆盖补充材料,具体数值以原文为准)。

定位之后就是改写节点,三种编辑的操作粒度都很轻:删除工具直接移除属于该节点的全部高斯;替换把删除与插入串起来,并让新节点继承原对象的轨迹(因此外观变了、行为不变);插入最麻烦,需要先由 text-to-3D 工具(Hunyuan3D)生成网格,再由智能体计算网格包围盒把它缩放到场景的真实尺度,并解决朝向对齐——做法是从固定坐标轴渲染这个网格、在渲染图里判断它面向哪一边,据此确定局部坐标轴,最后作为新节点挂进场景图。这一段是整个系统里「语言真正变成 3D 资产」的地方,也是为什么后面必须靠视频扩散来救画质:网格插入的光照与质感天生不自然。

2. 反事实行为组合与多对象轨迹模拟:只改指令要求的那部分行为

用户说「加速」的时候,并不想取消原来「从中道变到左道并左转」的行为。如果直接让语言条件生成模型按新指令重新生成整条轨迹,极容易把没被要求改的行为一起改掉,甚至生成地图上根本不存在的动作(在没有路口的地方左转)。这是语言到轨迹这条接口上最脆弱的地方。

行为编辑智能体的做法是先把原轨迹翻译成一串行为描述,本质上是一个行为组合(例如「减速、从中道变到左道、左转」)。随后做反事实生成:对组合里的每个行为施加 replace / remove / keep / add 四种操作,枚举出一份行为组合候选表;用地图信息滤掉不合理组合(没有路口不能左转),再滤掉自相矛盾的组合(同时出现「直行」和「静止」)。最后按用户指令与原行为从候选表里挑出最匹配的一整个组合,而不是挑单个行为:指令说「加速」、原行为是「减速、变道、左转」,选出来的就是「加速、变道、左转」。这样做有两个直接收益——把不合理行为挡在生成之前,同时尽可能保留对象原有行为。选定的组合作为文本条件送进 LangTraj:一个扩散式的、语言条件的多对象轨迹模拟器,由它一次性生成多个对象的轨迹,因此对象之间的交互(谁给谁让路)是在生成时就被联合考虑的,而不是事后拼接出来的。

3. 行为评审闭环:用校验函数把失败轨迹推回可控的引导参数

LangTraj 的输出仍可能对不上指令,或者越界、撞车,而前馈流水线会把这个错误一路带进视频里——ChatSim 插入车辆撞上车流就是这类典型失败。评审的做法不是在模拟器内部改模型,而是在推理期改它外面的几个可控旋钮。

评审智能体用一组轨迹校验函数逐条评估指令对齐与交通规则遵守情况,并把多对象场景里「已经对」和「还不对」的对象分开处理。已经满足要求的对象,其轨迹被保存下来,作为后续轮次生成的引导——这一条同时提供了两种好处:让已经对的对象不再被重新采样扰动,也让其他对象能真正和它发生交互。不满足要求的对象,则按失败类型调整 LangTraj 的引导配置:行为与指令不符就提高 classifier-free guidance(CFG)权重;越界或碰撞就注入对应的越界/碰撞避让引导并调整其权重。整个循环最多迭代 5 轮。这个设计的价值在于它把「失败模式 → 调哪个参数」做成了显式映射,而且复用了已经成功的子结果,既便宜又稳定。

4. 视频评审闭环:在去噪强度与 L2 引导之间按反馈调参

粗渲染工具把编辑后的场景图渲染出来——3DGS 背景走光栅化、插入的网格走 PyVista、再按深度合成——但结果明显不够看:新插入的物体往往很生硬,而且当新视角和原视角差得远(比如改了 ego 车轨迹)时,3DGS 的渲染质量会快速劣化。于是需要视频扩散工具来谐调,可它带来了新的对立:去噪强度越大画面越逼真,条件输入里的信息丢得也越多,插入车辆的车顶灯会消失、车型或颜色会变。逼真与外观保真在这一步是此消彼长的。

视频扩散工具以 CogVideoX 为骨干、用 TrajectoryCrafter 的预训练权重初始化,把粗渲染视频作为条件输入做增强;为了学会真实车辆外观与有效去噪,它用了两条微调策略:训练时把 3DGS 表示里的高斯原语替换成对象网格,让模型学到照片级的车辆外观;同时用 cycle reconstruction 策略构造「带噪高斯渲染—干净目标」配对,让模型学会去噪。而在推理期负责在这两个目标之间取舍的是视频评审智能体:它由 VLM 驱动,先以较高去噪强度跑一次(经验上这样最逼真),然后检查输出——如果外观被破坏(关键部件缺失、形状或颜色改变),就提高 L2 引导损失的权重;如果插入车辆看起来不真实(比如光照与环境不匹配),就提高去噪强度。L2 引导损失在每一步去噪时计算,衡量的是预测视频与条件视频在插入车辆区域上(隐空间内)的 L2 距离,相当于给扩散过程系了一根「这块内容别改太多」的绳子:

\[\mathcal{L}_{\mathrm{L2}} = \bigl\| (z^{\mathrm{pred}}_{t} - z^{\mathrm{cond}}_{t}) \odot M_{\mathrm{ins}} \bigr\|_2^2\]

⚠️ 原文只以文字描述该损失,上式按文字整理,精确形式与符号以原文为准。循环一直进行到逼真度与外观保真同时满足,或达到最大迭代次数(5 轮)。

一个完整示例

拿论文 Figure 3 的指令走一遍:「Insert a yellow taxi on the right of the ego vehicle, 6 meters ahead, and make it go straight.」编排智能体先把它拆成对象级子任务——目标是一个待插入的 yellow taxi,位置约束是 ego 右侧、前方 6 米,行为约束是直行。插入智能体调 Hunyuan3D 生成黄色出租车网格,缩放到真实尺度、对齐朝向,作为新节点挂到 ego 右侧 6 米处。因为带行为约束,行为编辑智能体把它转成「保持直行」的行为组合交给 LangTraj,行为评审用校验函数确认直行且无碰撞后放行。粗渲染给出第一版视频:位置对了,但出租车看起来像贴上去的。

接着进入视频评审循环,三轮的判据与调节方向正好交替:第 1 轮以较高去噪强度跑扩散,出租车看着很真实,但车顶灯没了——逼真度达标、外观保真不达标,评审提高 L2 引导权重;第 2 轮外观回来了,整车却过亮、光照与环境不匹配——外观保真达标、逼真度不达标,评审提高去噪强度;第 3 轮两者都满足,循环结束。这个例子说明了为什么单一的「更真」或「更像」旋钮都不够用:两个失败模式指向两个方向相反的参数。

需要真循环的场景看 Figure 6 的多对象例子:「Make the ego vehicle change to the middle lane and make car 2 change to the right lane.」第 1 轮两条轨迹都没变道,评审把两辆车的 CFG 权重都调高;第 2 轮 car 2 变道成功而 ego 仍失败,评审把 car 2 的成功轨迹存下来当后续引导,只继续调高 ego 的 CFG;第 3 轮两条轨迹都正确,循环终止。这里「成功轨迹当引导」不是锦上添花——它让已经对的对象在后续轮次里不再被重新采样打扰,剩下的预算全部花在还错的那个对象上。

损失函数 / 训练策略

推理阶段没有训练,只有 LLM/VLM 的上下文内调用(LLM 用 GPT-4,VLM 用 GPT-4o),两个评审闭环的最大迭代次数都设为 5。真正需要训练的是视频扩散工具:它以 CogVideoX 为骨干,从 TrajectoryCrafter 的预训练权重初始化,分两阶段微调——先在 33 帧短视频上跑 40k 次迭代,再在 81 帧长视频上跑 20k 次迭代,两阶段 batch size 均为 4,都在 4×H100 工作站上各训 48 小时。监督信号不是常规的成对数据,而是上面提到的两条构造策略:把 3DGS 里的高斯换成对象网格,得到照片级车辆外观样本;用 cycle reconstruction 造出带噪高斯渲染与干净目标的配对,让模型学会把粗渲染「洗」干净。推理侧用单张 A6000,单场景 8 秒、10 fps 视频的端到端编辑约 17.1 分钟。

实验关键数据

主实验

实验在 Waymo Open Dataset 上自建评测集:30 个场景,覆盖不同时段、道路类型与天气,并刻意选了行人较少的场景(本文聚焦车辆编辑)。每个场景由 GPT-4 生成 4 类指令(删除 / 替换 / 行为编辑 / 插入,每类 2-3 条)后经人工筛选。基线是 ChatSim(LLM 智能体路线)与 Cosmos(世界模型路线),两者都是各自方向的 SOTA 开源方法,且严格沿用原作者设置;此外作者还把图像编辑模型 ChronoEdit 与图生视频模型 Wan 2.2 直接串起来构造了一个朴素基线(主表未列其数值,细节在补充材料)。评测分五个方面:照片级逼真度(FID / FVD)、指令对齐(外观对齐由 GPT-4o 对比原视频与编辑视频、判断目标对象是否被正确删除/插入/替换;行为对齐先用 Grounded-SAM-2 跟踪编辑对象再把轨迹反投影回世界坐标、按地图判断是否符合指令)、结构保持(DINO 自相似矩阵之差,越低越好)、交通合理性(碰撞率与越界率,由 GPT-4o 抽帧检测)、用户研究(26 位参与者,每个方面在三种方法与「none」之间四选一)。

方法 FID ↓ FVD ↓ 逼真度用户票 (%) ↑ 外观对齐 (%) ↑ 行为对齐 (%) ↑ 对齐用户票 (%) ↑ 结构距离 ↓ 结构用户票 (%) ↑ 碰撞率 (%) ↓ 越界率 (%) ↓ 交通用户票 (%) ↑ 耗时 (min) ↓
Cosmos 33.42 797.51 34.60 46.25 32.86 10.50 74.07 19.10 3.16 3.95 35.5 16.9
ChatSim 47.70 605.69 4.80 42.33 26.64 3.90 46.52 7.40 27.62 24.71 5.60 19.3
本文 32.85 467.20 54.20 82.19 71.67 60.40 34.62 65.00 0.58 1.73 48.30 17.1

耗时一列均在单张 A6000 上测 8 秒 10 fps 视频。注意 ChatSim 与本文都需要一次约 2 小时/场景的 3D 重建预处理,该时间不计入上表的编辑耗时。

消融实验

行为评审闭环的消融用同一批 30 个场景、但重新生成 70 条更难的指令(同时指定多个对象的目标行为),并且直接评测生成轨迹而非编辑后的视频:

行为评审 行为对齐 (%) ↑ 碰撞 (%) ↓ 越界 (%) ↓ 整体成功率 (%) ↑
54.29 35.71 30.00 34.29
70.00 22.86 14.29 51.43

视频评审闭环的消融只使用插入与替换两类指令,以便暴露扩散模型改变插入车辆外观的问题:

视频扩散工具 视频评审 FID ↓ FVD ↓ 外观对齐 (%) ↑
43.54 613.72 87.69
36.83 501.84 65.47
36.78 493.25 85.28

此外作者还专门分析了扩散工具的幻觉:视频扩散谐调后,3D 一致性(WorldScore 指标)从 74.07 略降到 72.64,车道结构 NTL-IoU(DriveDreamer4D 指标)从 52.11 略降到 50.96,但两项仍高于 ChatSim(71.32 / 50.13)与 Cosmos(69.85 / 48.76)。

关键发现

  • 拉开差距的主要是指令对齐:外观对齐 82.19% vs Cosmos 46.25%(约 1.8 倍)、ChatSim 42.33%;行为对齐 71.67% vs 32.86%(约 2.2 倍)、26.64%。摘要里「接近两倍」的说法主要来自行为对齐这一项。
  • 逼真度要分开看:三者的 FID 其实接近(32.85 / 33.42 / 47.70),但 FVD 差距巨大(467.20 vs 797.51 / 605.69)。也就是说 Cosmos 的单帧画质很好,输在时序一致性;而 ChatSim 两项都差。本文的优势主要在时序一致性上。
  • 结构保持的排序很说明问题:本文结构距离 34.62 最好,ChatSim 46.52,Cosmos 74.07 最差。Cosmos 在像素空间编辑,画面越逼真越容易顺手改掉背景;用户票(65.00 / 7.40 / 19.10)与这一排序一致。
  • 交通合理性是差距最大的一项:碰撞率 0.58% vs 27.62%(ChatSim)/ 3.16%(Cosmos),越界率 1.73% vs 24.71% / 3.95%。消融显示这几乎完全归功于行为评审闭环——加上它,行为对齐从 54.29% 升到 70.00%,越界率从 30.00% 降到 14.29%,整体成功率从 34.29% 升到 51.43%(相对提升约 50%)。
  • 视频扩散这一步是「拿外观换逼真」的典型:跑一次扩散,FID 从 43.54 降到 36.83、FVD 从 613.72 降到 501.84,但外观对齐从 87.69% 崩到 65.47%;接上视频评审后,FID/FVD 基本没变(36.78 / 493.25),外观对齐却回到 85.28%——也就是说评审闭环用几乎为零的画质代价换回了外观保真,这是全文性价比最高的一处设计。
  • 耗时分布:端到端 17.1 分钟/场景,与 Cosmos(16.9)和 ChatSim(19.3)同量级。分模块看,对象节点编辑 6.1 分钟(主要是 text-to-3D)与视频迭代精修 7.6 分钟是大头,对象查询 1.4 分钟、粗渲染 0.5 分钟、行为编辑(已含反馈循环)1.5 分钟。可见反馈闭环本身并不贵,贵的是 3D 资产生成和扩散精修。
  • 论文承认扩散谐调会引入轻微幻觉(3D 一致性与车道 IoU 都小幅下降),但幅度有限,且仍优于两个基线。

亮点与洞察

  • 把「编辑」锚定在场景图上,语言的作用被压缩成「选节点 + 改轨迹」,这是结构保持能做到 34.62 的根本原因。像素空间的世界模型无论单帧多逼真,都缺少这个硬约束。
  • 两个评审智能体是同一思路的两次复用:不改生成模型,只在推理期调可控旋钮(CFG 权重、避让引导、去噪强度、L2 权重),并把已经成功的子结果冻结成下一轮的条件。这个 pattern 可以直接迁移到任何「生成器有若干旋钮但没有反馈」的流水线,例如视频生成里的运动幅度控制、3D 资产生成里的几何与材质一致性调节。
  • 「失败原因决定调哪个旋钮」做得很干净:行为不齐调 CFG、越界碰撞加避让引导、外观丢失调 L2 权重、光照不真实调去噪强度——四个失败模式对应四个参数,映射显式且互不干扰,这是闭环能稳定收敛而不是来回震荡的关键。
  • 反事实行为组合是一个成本极低但很有效的语言→轨迹接口:枚举 replace/remove/keep/add、用地图与矛盾性过滤、整组合匹配而非单行为匹配。它把「改一个行为毁掉其他行为」这个常见失败挡在了生成之前,而不是靠生成后再修。
  • 场景图 + 多智能体的接口设计让整条流水线天然可解释:每个中间产物(节点、轨迹、粗视频)都能被单独检查、单独替换,这正是它能在两级插入校验点的前提。

局限与展望

  • 方法依赖「原始对象轨迹与场景地图已知」这个前提,缺了它们,场景分解和行为评审的校验函数都无从建立。
  • 视频扩散带来的幻觉无法完全消除,3D 一致性与车道 NTL-IoU 在谐调后都有轻微下降,作者也只能把影响控制在有限范围内。
  • 评测规模偏小:30 个场景、26 位用户。作者明确说选的是行人较少的场景且主要面向车辆编辑,行人与更复杂的交互场景没有被覆盖。
  • 用户研究是含「none」的四选一偏好投票,得到的是相对排序而不是绝对质量分,跨方法比较时应留有余地。
  • 成本与依赖:约 2 小时/场景的一次性 3D 重建加 17 分钟/场景的编辑,且整条流水线重度依赖 GPT-4/GPT-4o 的 API 调用,复现成本与可复现性都受限。
  • 改进方向:把「失败模式→旋钮」的人工映射换成学出来的控制器;把 3D 重建从离线预处理改成按需增量;把评估扩展到行人、非机动车与更密集的多对象交互;补充主表缺失的 ChronoEdit + Wan 2.2 基线的数值,让「显式 3D + 闭环」这条路线相对纯生成路线的收益更可比。

相关工作与启发

  • vs ChatSim:同为 LLM 智能体式场景编辑,ChatSim 只用文本模态推理、用朴素合成贴图、且没有任何中间校验。本文的差别正好是三处:接地用外观/行为/位置三路证据、渲染交给微调过的视频扩散、行为与视频各配一个反馈闭环。结果上行为对齐 71.67% vs 26.64%、碰撞率 0.58% vs 27.62%,差距主要来自后两项。
  • vs Cosmos:Cosmos 是像素空间的世界模型,单帧逼真度与本文相当(FID 33.42 vs 32.85)且不需要 3D 重建,但可控性差——会擅自插入未请求的行人、改动背景(结构距离 74.07 为三者最差),也没有对象级编辑接口。本文用显式场景图加两级闭环换来了可控性与结构保持,代价是一次性的 3D 重建预处理。
  • vs LangTraj:LangTraj 是同一批作者提出的语言条件多对象轨迹模拟器,本文把它当作行为生成工具,并在其外面套了反事实行为组合与行为评审闭环。可以这样理解分工:LangTraj 解决「怎么按语言一次生成多条互相交互的轨迹」,本文解决「怎么保证生成的轨迹真的符合用户这一条指令、并且不违规」。
  • vs ChronoEdit + Wan 2.2 的组合:作者把「图像编辑 + 图生视频」两阶段直接串起来当作额外基线。这类拆分式方案在跨帧一致性与 3D 结构上没有约束,是「用通用生成模型替代显式 3D」这条思路的代表;论文在实验设置里提到它,但未在主表给出数值。

评分

  • 新颖性: ⭐⭐⭐⭐ 3DGS 场景图、语言条件轨迹模拟、视频扩散谐调单独看都有前作,新意在「三路证据接地 + 双层评审闭环」的组合,以及把失败模式显式映射到推理期旋钮的设计。
  • 实验充分度: ⭐⭐⭐⭐ 四类编辑、五类指标、用户研究、两个闭环消融加幻觉分析,覆盖面完整;但只有 30 个场景,且接地性能与反事实行为组合的消融放在补充材料里,主表看不到。
  • 写作质量: ⭐⭐⭐⭐ 流水线讲得清楚,Figure 2/3/6 分别对应整体框架、视频闭环、行为闭环,图与文配合好;代价是若干细节(校验函数、行为组合过滤规则)压在补充材料里。
  • 价值: ⭐⭐⭐⭐⭐ 用一套可解释的多智能体框架同时解决「可控」与「逼真」这对老矛盾,端到端耗时与基线持平,对合成数据生成这条线有直接可用价值。