Learning Zero-Shot Subject-Driven Video Generation Using 1% Compute¶
会议: ECCV 2026
论文: ECCV 2026
领域: 视频生成
关键词: 主体驱动视频生成 / 零样本定制 / 双任务学习 / 梯度正交 / 视频扩散模型
一句话总结¶
把主体驱动视频生成(SDV-Gen)拆成「从主体-图像对学身份注入」与「用 4,000 条任意视频守住运动感知」两个交替优化的子任务,在 CogVideoX-5B 上用 200K 主体-图像对 + 4,000 视频、288 A100 小时完成微调(约为既有零样本方案训练算力的 1%),推理时不做任何逐主体调优即可生成保身份、有运动的视频。
研究背景与动机¶
主体驱动视频生成要求生成「保持目标主体身份、但场景/动作/上下文可自由变化」的视频,是定制化内容创作的基础能力。现有做法分两派:一派为每个主体单独微调一份模型或 LoRA(DreamVideo、MotionBooth、Still-Moving、CustomCrafter),身份保真度高但扩展性差——光是给一个新主体做定制就要约 200 A100 小时(CustomCrafter),主体一多就无法承受;另一派训练一个可泛化到未见主体的单一模型(VideoBooth、Phantom、VACE、HunyuanCustom),看似解决了逐主体调优的问题,代价却转移到了训练阶段:它们默认「身份和运动都必须从主体-视频对里学」,于是需要百万级主体-视频对,微调开销落在 10K–210K A100 小时(VACE 约 70K–210K,Phantom 约 10K–30K)。这个门槛把大多数研究者挡在了门外。
一个自然的替代思路是:身份只从「主体驱动图像生成」(SDI-Gen)的数据学,也就是主体-图像对;运动先验则直接继承自预训练 T2V 骨干——主体-图像对给出的身份线索强,而骨干在预训练时已经编码了时间动态。但作者发现这条捷径并不成立:仅在主体-图像对上朴素微调会严重破坏帧间时序一致性,生成结果往往是运动崩塌成前后不一致的动态、甚至近乎静止的「冻结」画面。这说明身份建模与运动建模在优化时互相干扰,把 SDV-Gen 当成单一目标来训练存在根本性问题。级联方案(先用 SDI-Gen 生成图、再交给 I2V 生成视频)同样不可靠:当主体在首帧里很小或被遮挡时,I2V 模型会误判主体、编造细节,身份随后续帧逐级丢失(论文图 4 的「玩具车驶近镜头」就是典型失败)。
于是本文的切入角度是把适配过程显式解耦成两个互补子任务——身份注入只吃主体-图像对,运动感知保持只在少量任意视频上做——并用随机任务切换让二者交替优化,多数步走图像支、少数步走视频支。核心 idea:SDV-Gen 的适配不需要主体-视频对,只要把「身份」与「运动」拆成两个用不同数据源监督的目标并随机切换更新,二者的梯度会迅速演化到近乎正交的更新子空间,从而在没有梯度手术、没有逐主体调优的前提下稳定收敛。
方法详解¶
整体框架¶
方法本身不是新网络,而是一套「怎么用两小份数据把预训练 T2V 模型改造成零样本主体驱动视频模型」的适配配方。输入侧有两类数据:主体-图像对 \((\mathbf{I}_{\text{ref}}, \mathbf{I}_{\text{out}}, P)\),来自 OminiControl 的 Subject-200K,同一主体在不同姿态/视角/上下文下的两张图和一句提示词,用于教身份;以及约 4,000 条任意视频 \((P_{\text{vid}}, V)\)(Pexels 400K 的 1%),只用来守住时间动态。每个训练步抽一个均匀随机数决定这一步走哪一支:约 80% 的步用主体-图像对做身份注入,20% 的步用任意视频做 I2V 重建。可训练参数只覆盖与参考图 token 交互的部分注意力层与归一化层上的 LoRA,主干其余部分冻结。推理时不再有任何逐主体适配:给一张参考图和一句提示词,模型直接以零样本方式出视频。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["参考图 + 文本提示"] --> B["随机任务切换<br/>每步二选其一"]
B -->|"抽中视频支(p = 0.2)"| C["运动感知保持<br/>任意视频做 I2V 重建"]
B -->|"其余 80% 走图像支"| D["身份注入<br/>主体-图像对 + CLS 锚点"]
C --> E["LoRA 更新<br/>主干冻结"]
D --> E
E --> F["梯度正交性<br/>解释切换训练为何稳定"]
F --> G["零样本推理<br/>参考图 + 提示出视频"]
关键设计¶
1. 随机任务切换:把身份与运动拆成两个交替优化的子任务
这是全文的骨架。既然在主体-图像对上朴素微调会让运动崩塌,说明「身份」与「运动」不该被塞进同一个目标里联合优化——但本文的解决办法不是加正则或改损失权重,而是干脆让每一步只优化其中一个。具体地,每步抽 \(u \sim U(0,1)\),按下式二选一:
其中 \(\mathcal{L}_{\text{img}}\) 是主体-图像对上的身份注入损失,\(\mathcal{L}_{\text{vid}}\) 是任意视频上的文生视频/I2V 损失,\(p=0.2\) 为经验取值(论文 supplementary 给了更细的消融)。等价地看,参数更新的期望是 \(\mathbb{E}[g]=(1-p)\,g_{\text{img}}+p\,g_{\text{vid}}\),即 80% 的更新来自图像支、20% 来自视频支,作者把这种机制称作对视频分布的「随机代理回放」(stochastic proxy replay):视频样本不常出现,但足以持续提醒模型「时间维度还在」。
这个设计同时买到了两件事。其一是稳定性:因为每步只算一个任务的梯度,不存在同一批参数上同时下降两个方向相反的目标。其二是省算力:在 MM-DiT 的注意力下,token 数随视频帧数近似线性增长、注意力开销随帧数近似平方增长,\(T=13\) 时实测视频支单步开销约为图像支的 169 倍;带切换概率的每步期望开销为
远低于纯视频微调,这正是「1% Compute」能成立的直接原因之一。
2. 运动感知保持:用 I2V 目标在少量任意视频上守住时间动态
视频支要解决的痛点是:仅用图像对微调后,模型在推理时几乎不动。作者没有选择纯 T2V 目标,而是刻意采用 I2V 形式——从视频里均匀抽一帧当条件参考帧,要求模型重建整段视频。这样做的理由有两条:I2V(参考图→视频)与推理时的输入模态完全一致,避免了训练/推理的接口错位;同时它把「运动」从身份监督里隔离出来,视频支只承担时间动态的维护,不掺入任何主体身份信息。由于视频是任意挑选的(不要求与评测主体相关),这一支本质上是在做一件很轻的防遗忘:用极少量真实动态样本把骨干原有的运动先验「续上」。
单帧条件还会带来一个退化解——模型可以干脆把参考帧的外观沿时间复制一遍,既省事又「保真」。论文用两个几乎零成本的正则堵住它:一是随机参考帧采样,条件帧的位置 \(i\) 在整段视频上均匀采样而非固定取首帧,复制首帧不再是一个稳定解;二是图像 token dropout,以概率 \(p_{\text{drop}}\) 随机丢掉参考帧编码中的一部分 token,逼模型不能全靠复制输入来重建,而要动用自身的时间先验。这两个改动都很朴素,但直击 degenerate solution 的成因,作者在 supplementary 中给出了各自的消融。
3. 身份注入:把主体外观锚在
图像支沿用 OminiControl 的做法:参考图与输出图分别经 VAE 编码为 \(X_{\text{ref}}\) 与 \(X_{\text{out}}\),提示词经冻结的 T5 编码为 \(C_T\),训练 MM-DiT 在 \((X_{\text{ref}}, C_T)\) 条件下重建 \(X_{\text{out}}\);由于输入是单帧图像,RoPE 位置编码需要截断到一帧的 token 数,以保证与视频支的位置编码语义一致。适配范围上,LoRA 只加在与参考图 token 交互的那部分注意力层与归一化层上,主干其余参数全部冻结——这一点很关键,因为「运动先验」正是存在那些没被改动的权重里,动得越少,运动就丢得越少。
另一个小但有效的设计是在提示词前面拼一个特殊的 <CLS> token(例如「An <CLS> armchair in the living room」),把身份信息显式地锚定在条件流里,而不是只依赖参考图 token 与文本的隐式交互。论文的消融显示 <CLS> 能提升 CLIP-I 与 DINO-I 两项身份指标,且不损害运动质量。它与「随机任务切换」配合得起来:身份由 <CLS> + 参考图 token 这条通路携带,运动支不碰它,两边的职责在表示层面也是分开的。
4. 梯度正交性:解释为什么这套切换能稳,且不需要梯度手术
把两个目标交替优化,直觉上会担心梯度冲突(多任务学习里常见的失败模式),常规对策是 Gradient Surgery 一类方法:投影掉与其他任务冲突的分量,强行保证每步内积非负。本文的做法是先测再判断。作者在每个 checkpoint 上冻结模型、分别用两个数据集的小批量计算 \(g_{\text{img}}(t)\) 与 \(g_{\text{vid}}(t)\)(对可训练的 LoRA 与任务相关归一化层),记录其余弦相似度 \(\phi(t)\) 与各自的 \(\ell_2\) 范数。在 CogVideoX-5B 与 Wan 2.2-5B 上都能看到:初始化后不久 \(\phi(t)\) 就塌进零附近的一条窄带并一直保持,而两个梯度范数在最初下降后始终显著高于数值噪声、量级相当。也就是说,两目标确实在优化几乎不相交的参数子空间,而不是「都在变小所以余弦像零」的假象。作者还在局部二阶二次近似下给出命题,说明混合损失上的梯度下降会让两目标梯度的内积以 \(C\rho^{t}\) 的速度衰减(⚠️ 该命题是解释性模型,原文明确声明不构成 DiT 这类非凸问题的正式保证,以原文为准)。
有了这个观测,Gradient Surgery 就变成了不必要的开销:它需要每步同时算两个梯度再做投影,梯度计算成本大约翻倍,而随机切换每步只算一个梯度,最终效果(把冲突压下去)却是一样的。作者因此把简单切换作为默认选择。这个「先证明冲突会自己消失、再砍掉处理冲突的机制」的思路,是本文在方法论证上最漂亮的一步。
损失函数 / 训练策略¶
两个目标的损失形式分别是主体-图像对上的去噪重建损失 \(\mathcal{L}_{\text{img}}\) 与任意视频上的去噪重建损失 \(\mathcal{L}_{\text{vid}}\),按上面的切换规则交替使用,切换概率 \(p=0.2\)。优化用 AdamW,学习率 \(5\times10^{-5}\),cosine-with-restarts 调度,BF16 混合精度。CogVideoX-5B 微调 4,000 步,图像支/视频支批大小 256/32,LoRA rank 128;Wan 2.1-1.3B 与 Wan 2.2-5B 各微调 5,000 步,批大小 192/16,LoRA rank 32;LoRA dropout 统一 0.2。三个骨干各自的实测训练成本都约为 288 A100 小时。数据侧,主体-图像对用 Subject-200K 全集,另有 2,000/4,000 的子集用于数据效率研究;任意视频取约 4,000 条 Pexels 视频(Pexels-400K 的 1%)。作者还训练了两个采样率变体:与 CogVideoX 原始设定对齐的 8 FPS 版本,以及在 Pexels 视频上继续训练、用于提升高帧率下运动平滑度的 16 FPS 版本。
关于「1% Compute」的口径:这个数字指的是适配/微调阶段的训练算力(288 A100 小时,相对零样本基线自身的训练开销),既不是推理开销,也不是相对逐主体调优方法的单主体成本。具体地,相对 Phantom(约 10K–30K A100 小时)约为 2.8%,相对 VACE(约 70K–210K)约为 0.4%,取整后说成约 1%。推理时本方法仍需走完整的扩散去噪采样流程,它省掉的是「每来一个新主体就要重新训练一遍」这件事——逐主体调优方法每个主体要花约 200 A100 小时,而本文训练一次后对任意新主体的额外训练成本为 0。
实验关键数据¶
主实验¶
评测协议:从近期 SDI-Gen 基准与标准 DreamBooth 数据集中随机选 30 张参考图,每张用 GPT 生成 8 条提示词,共 240 组「参考图-提示词」生成视频,报 VBench 的 Motion Smoothness(时序一致性)、Dynamic Degree(运动幅度)、CLIP-T(文-视频对齐)、CLIP-I、DINO-I(主体保真)。消融用其中 120 段的子集(每张图 4 条提示词)。
表 1 是 VBench 上的主对比(Phantom 与 VACE 使用公开的 Wan-2.1 1.3B 版本):
| 方法 | Motion Smoothness↑ | Dynamic Degree↑ | CLIP-T↑ | CLIP-I↑ | DINO-I↑ |
|---|---|---|---|---|---|
| OminiControl → I2V(SDI-Gen 级联) | 98.40 | 47.92 | 33.06 | 72.09 | 52.61 |
| BLIP-Diffusion → I2V | 97.81 | 48.10 | 28.83 | 79.27 | 57.21 |
| IP-Adapter → I2V | 97.74 | 51.90 | 28.94 | 76.60 | 51.41 |
| VideoBooth | 96.89 | 53.33 | 29.59 | 65.65 | 34.17 |
| Phantom-1.3B | 98.70 | 67.08 | 33.50 | 73.00 | 53.55 |
| VACE-1.3B | 98.74 | 43.75 | 33.70 | 73.54 | 54.47 |
| MAGREF-480P | 98.86 | 65.09 | 33.00 | 71.15 | 48.50 |
| 本文(CogVideoX-5B) | 98.23 | 76.25 | 33.65 | 76.19 | 61.23 |
| 本文(Wan 2.1-1.3B) | 98.97 | 53.75 | 32.51 | 74.65 | 58.77 |
| 本文(Wan 2.2-5B) | 98.09 | 82.50 | 31.29 | 76.97 | 57.27 |
表 2 是 OpenS2V-Eval v1.1 的 Single-Domain 结果,Total 为其余各项的归一化加权和:
| 方法 | 训练成本 | Total↑ | Aes↑ | Smooth.↑ | Amp.↑ | FaceSim↑ | Gme↑ | Nexus↑ | Natural↑ |
|---|---|---|---|---|---|---|---|---|---|
| Vidu 2.0 | – | 52.90 | 43.32 | 91.88 | 17.52 | 36.19 | 66.96 | 44.84 | 66.11 |
| Pika 2.1 | – | 53.12 | 47.43 | 86.07 | 26.32 | 32.33 | 69.84 | 47.35 | 64.68 |
| Kling 1.6 | – | 56.67 | 45.97 | 85.76 | 47.17 | 39.27 | 65.36 | 49.30 | 73.63 |
| VACE-P1.3B | ≈70K hrs | 49.20 | 48.93 | 95.68 | 11.91 | 18.04 | 70.78 | 36.24 | 66.85 |
| VACE-1.3B | ≈70K hrs | 51.13 | 49.41 | 95.42 | 22.51 | 22.37 | 70.87 | 38.34 | 68.33 |
| VACE-14B | ≈210K hrs | 61.75 | 48.94 | 93.16 | 19.69 | 64.65 | 65.86 | 50.82 | 70.56 |
| Phantom-1.3B | ≈10K hrs | 54.50 | 49.00 | 93.70 | 16.38 | 44.03 | 69.54 | 37.72 | 66.76 |
| Phantom-14B | ≈30K hrs | 57.02 | 47.46 | 94.86 | 41.55 | 51.82 | 70.07 | 35.30 | 71.11 |
| SkyReels-A2-P14B | – | 55.06 | 40.85 | 85.54 | 26.41 | 54.42 | 61.81 | 48.60 | 61.85 |
| MAGREF-480P | – | 53.44 | 46.31 | 92.63 | 27.43 | 33.77 | 69.02 | 42.45 | 68.33 |
| 本文(CogVideoX-5B) | 288 hrs | 50.05 | 45.40 | 93.90 | 19.38 | 18.05 | 70.53 | 41.23 | 68.52 |
| 本文(Wan 2.1-1.3B) | 288 hrs | 51.45 | 43.80 | 93.68 | 17.55 | 13.90 | 71.12 | 45.21 | 75.65 |
| 本文(Wan 2.2-5B) | 288 hrs | 56.84 | 44.70 | 84.97 | 14.38 | 48.78 | 61.98 | 49.97 | 71.30 |
消融实验¶
表 3 比较三种训练策略(同一 120 段子集):
| 训练策略 | Motion Smoothness | Dynamic Degree | CLIP-T | CLIP-I | DINO-I |
|---|---|---|---|---|---|
| Image-only(只用主体-图像对) | 99.60 | 0.84 | 32.67 | 71.15 | 43.19 |
| Two-stage(先图像后 I2V 顺序微调) | 96.04 | 81.51 | 28.96 | 84.73 | 76.13 |
| Ours(双任务随机切换) | 98.45 | 69.64 | 32.69 | 77.14 | 62.88 |
表 4 考察主体-图像对规模的影响(同一 120 段子集,FE 为 flow entropy、衡量主体运动多样性,CS 为 copy score、衡量对参考主体的近刚性重复):
| 配置 | 主体-图像对 | Motion Smooth. | Dynamic Degree | CLIP-T | CLIP-I | DINO-I | FE↑ | CS↓ |
|---|---|---|---|---|---|---|---|---|
| Ours-tiny | 2,000 | 98.72 | 60.71 | 33.38 | 74.72 | 57.03 | 54.73 | 45.27 |
| Ours-mini | 4,000 | 97.99 | 78.33 | 33.22 | 75.87 | 58.86 | 58.91 | 41.09 |
| Ours | 200K | 98.45 | 69.64 | 32.69 | 77.14 | 62.88 | 63.77 | 36.32 |
表 4 中 Ours-mini 与 Ours 两行的列对齐,是依据原文正文所述趋势(配对增多 → CLIP-I/DINO-I/FE 上升、CS 下降)以及表 3 中 Ours 行的取值还原的,⚠️ 数值请以原文表格为准。
关键发现¶
- 「1% Compute」省的是训练,不是推理:288 A100 小时/每个骨干是微调开销,相对 Phantom 约 2.8%、相对 VACE 约 0.4%;相比逐主体调优方法每主体约 200 A100 小时,本文对每个新主体的额外训练成本为 0。推理仍需完整扩散采样。
- 图像支单独训练会彻底压死运动:image-only 的 Dynamic Degree 只有 0.84,同时 Motion Smoothness 高达 99.60——这个高平滑度是「几乎不动」的假象,正是本文要解决的失败模式。
- 顺序式两阶段微调是另一种极端:dynamic degree 冲到 81.51、CLIP-I 也最高(84.73),但 Motion Smoothness 掉到 96.04,并伴随严重伪影与身份遗忘;只有双任务切换同时把两者维持在可用区间(98.45 / 69.64)。
- 数据规模的两个方向:仅 2,000 对就足以学到基本身份映射(DINO-I 57.03),但会频繁出现 copy-paste 伪影——主体身份保住了,却像贴纸一样在帧间重复同一姿态与版式(图 7 的「冲浪的猪」例子:小数据模型不会转头、不会改变体态)。扩到 200K 后 CLIP-I/DINO-I 提升、FE 上升、CS 下降,说明更多主体-图像覆盖主要买的是高频细节与运动多样性,而不是「会不会做」。
- 梯度冲突确实会自己消失:无论 CogVideoX-5B 还是 Wan 2.2-5B,余弦相似度都在起步后迅速收敛到零附近的窄带,且两个梯度范数始终保持同量级、未跌入数值噪声,排除了「范数消失导致的假零」。因此不需要 Gradient Surgery 这类需要每步算两个梯度再投影(成本约翻倍)的做法。
- 配方可跨骨干迁移:CogVideoX-5B、Wan 2.1-1.3B、Wan 2.2-5B 都用同一套设置,且三个骨干的训练成本都在 288 A100 小时量级;Wan 2.2-5B 拿到 82.50 的最高 Dynamic Degree 与 56.84 的 OpenS2V Total(逼近训练成本高两个数量级的 Phantom-14B 的 57.02,并超过 Kling 1.6、Pika 2.1、Vidu 2.0 等商业模型),但其 Amp. 偏低(14.38),作者认为与 Wan 2.2 的 TI2V 骨干特性有关。
- 失败场景:级联式 SDI-Gen→I2V 在主体小或被遮挡时身份传递断裂(图 4);本文模型在强风格化与极端外观变化下仍会失败,人脸任务则因 Subject-200K 几乎不含人脸而依赖泛化。
亮点与洞察¶
- 把「训练数据从哪来」当成核心设计变量:不是发明新模块,而是重新划分监督信号——身份用已有的大规模主体-图像对,运动用 4,000 条与任务无关的普通视频。这让整个领域去掉了「必须构造 subject-video pair 数据集」这一前置条件,价值远超方法本身。
- 「先证明冲突会自己消失,再砍掉处理冲突的机制」:用余弦相似度 + 梯度范数的双测量排除了「范数消失」这一平凡解释,然后顺理成章地用单目标/步的随机切换替掉梯度手术,把成本压掉约一半。这套「测量 → 解释 → 简化」的论证方式可以直接搬到其他多任务适配场景。
- 随机参考帧采样 + 图像 token dropout:两个改动几乎零成本,却精准掐死了 I2V 微调里最常见的退化解(复制参考帧)。任何以单帧为条件、要求生成整段的模型都可以直接借用。
<CLS>token 做身份锚点:一个词元的开销换来 CLIP-I/DINO-I 的提升且不损运动,属于性价比极高的工程手感。- 可迁移思路:凡是「能力 A 的配对数据稀缺、但 A 与 B 各自都有独立数据源」的后训练场景(音频驱动、长视频一致性、多视角一致性),都可以先试「双任务随机切换 + 梯度正交性验证」;本文用 1% 规模的任意视频当防遗忘代理数据,本质上是 rehearsal 的一个极简版本,比记忆缓冲区或持续学习方法轻得多。
局限与展望¶
- 训练主力数据 Subject-200K 以物体为主、几乎不含人脸,人脸能力靠泛化获得,强风格化或极端外观变化下会失败;人脸场景的系统性评测缺失。
- 运动质量仍有差距:OpenS2V 的 Amp./Motion 分数低于头部 SDV-Gen 方法(作者也承认这一项有提升空间),Wan 2.2-5B 变体的 Amp. 只有 14.38。
- 评测规模有限:VBench 只用 240 段视频,OpenS2V 只报 Single-Domain,未给 Multi-Domain 结果;消融则全部在 CogVideoX 上做,Wan 系列的消融结论只能算外推。
- 方法依赖一个已经很强的 T2V 骨干(运动先验完全来自预训练),对弱骨干或从头训练的场景不适用。
- 我自己的观察:视频支只用约 4,000 条 Pexels 视频,运动类型覆盖受这 4,000 条的分布限制;切换概率 \(p=0.2\) 也是经验取值,不同数据规模下未必最优。进一步可以做的是:把固定 \(p\) 换成随训练进程变化的课程调度(早期多给视频、后期多给图像),或按梯度正交程度自适应调节切换概率。
- 「1% 相对的是零样本基线自身的训练预算」这一口径在多骨干实验里还隐含 288×3 的总量,与逐主体调优的「每主体 200 小时」并非同一度量,跨表比较时需要小心。
相关工作与启发¶
- vs VACE / Phantom:它们同样做零样本 SDV-Gen,但依赖百万级主体-视频对(Phantom-Data、OpenS2V-Nexus 等),训练开销 10K–210K A100 小时;本文完全不用主体-视频对,288 小时,在 VBench 的 DINO-I 与 Dynamic Degree 上反超,OpenS2V Total 也逼近 Phantom-14B。
- vs VideoBooth:同为「训练一次、泛化到未见主体」的零样本方法,但 VideoBooth 仍靠主体-视频对监督,且本体质量受限(DINO-I 34.17、Motion Smoothness 96.89),本文三个骨干的 DINO-I 都在 57 以上。
- vs SDI-Gen→I2V 级联(OminiControl / BLIP-Diffusion / IP-Adapter):级联管线常拿到很高的 CLIP-I(BLIP 的 79.27)但运动动态偏弱,且首帧主体小/被遮挡时身份传播会断;本文直接把主体条件注入视频扩散模型,在保真与运动之间取得更均衡的折中。
- vs 逐主体调优(CustomCrafter / Still-Moving):它们每来一个新主体就要约 200 A100 小时,且 CustomCrafter 在「泰迪熊」序列上仍有明显的形状/纹理漂移、Still-Moving 会丢失胡须这类细节;本文零样本推理,身份一致性在定性对比中更好。
- vs 多任务优化(Gradient Surgery)与持续学习(replay/记忆缓冲):Gradient Surgery 靠投影消除冲突,每步要两次梯度计算;持续学习靠回放缓冲防遗忘。本文用每步单目标的随机切换取得了类似效果,并且用梯度测量说明了为何够用——对「任务数少、子空间天然接近正交」的适配问题,简单调度可能比显式冲突处理更划算。
评分¶
- 新颖性: ⭐⭐⭐⭐ 没有新模块,但把 SDV-Gen 重新表述为「身份注入 + 运动保持」的双任务问题并去掉主体-视频对依赖,问题重构本身很有价值。
- 实验充分度: ⭐⭐⭐⭐ 三个骨干、VBench + OpenS2V 双基准、策略与数据规模消融、梯度测量都齐;扣分在消融集中在 CogVideoX、OpenS2V 只报 Single-Domain、评测集仅 240 段。
- 写作质量: ⭐⭐⭐⭐ 论证链清晰(失败观察 → 分解 → 梯度证据 → 砍掉冗余机制),公式节制;主要表格的列对齐在 PDF 里不够清晰,需要读者对照正文核对。
- 价值: ⭐⭐⭐⭐⭐ 把零样本 SDV-Gen 的算力门槛从 10K–210K A100 小时降到 288 小时,且配方可跨骨干复用,对资源有限的研究者具有很强的可操作性。