跳转至

Learning Zero-Shot Subject-Driven Video Generation Using 1% Compute

会议: ECCV 2026
论文: ECCV 2026
领域: 视频生成
关键词: 主体驱动视频生成 / 零样本定制 / 双任务学习 / 梯度正交 / 视频扩散模型

一句话总结

把主体驱动视频生成(SDV-Gen)拆成「从主体-图像对学身份注入」与「用 4,000 条任意视频守住运动感知」两个交替优化的子任务,在 CogVideoX-5B 上用 200K 主体-图像对 + 4,000 视频、288 A100 小时完成微调(约为既有零样本方案训练算力的 1%),推理时不做任何逐主体调优即可生成保身份、有运动的视频。

研究背景与动机

主体驱动视频生成要求生成「保持目标主体身份、但场景/动作/上下文可自由变化」的视频,是定制化内容创作的基础能力。现有做法分两派:一派为每个主体单独微调一份模型或 LoRA(DreamVideo、MotionBooth、Still-Moving、CustomCrafter),身份保真度高但扩展性差——光是给一个新主体做定制就要约 200 A100 小时(CustomCrafter),主体一多就无法承受;另一派训练一个可泛化到未见主体的单一模型(VideoBooth、Phantom、VACE、HunyuanCustom),看似解决了逐主体调优的问题,代价却转移到了训练阶段:它们默认「身份和运动都必须从主体-视频对里学」,于是需要百万级主体-视频对,微调开销落在 10K–210K A100 小时(VACE 约 70K–210K,Phantom 约 10K–30K)。这个门槛把大多数研究者挡在了门外。

一个自然的替代思路是:身份只从「主体驱动图像生成」(SDI-Gen)的数据学,也就是主体-图像对;运动先验则直接继承自预训练 T2V 骨干——主体-图像对给出的身份线索强,而骨干在预训练时已经编码了时间动态。但作者发现这条捷径并不成立:仅在主体-图像对上朴素微调会严重破坏帧间时序一致性,生成结果往往是运动崩塌成前后不一致的动态、甚至近乎静止的「冻结」画面。这说明身份建模与运动建模在优化时互相干扰,把 SDV-Gen 当成单一目标来训练存在根本性问题。级联方案(先用 SDI-Gen 生成图、再交给 I2V 生成视频)同样不可靠:当主体在首帧里很小或被遮挡时,I2V 模型会误判主体、编造细节,身份随后续帧逐级丢失(论文图 4 的「玩具车驶近镜头」就是典型失败)。

于是本文的切入角度是把适配过程显式解耦成两个互补子任务——身份注入只吃主体-图像对,运动感知保持只在少量任意视频上做——并用随机任务切换让二者交替优化,多数步走图像支、少数步走视频支。核心 idea:SDV-Gen 的适配不需要主体-视频对,只要把「身份」与「运动」拆成两个用不同数据源监督的目标并随机切换更新,二者的梯度会迅速演化到近乎正交的更新子空间,从而在没有梯度手术、没有逐主体调优的前提下稳定收敛。

方法详解

整体框架

方法本身不是新网络,而是一套「怎么用两小份数据把预训练 T2V 模型改造成零样本主体驱动视频模型」的适配配方。输入侧有两类数据:主体-图像对 \((\mathbf{I}_{\text{ref}}, \mathbf{I}_{\text{out}}, P)\),来自 OminiControl 的 Subject-200K,同一主体在不同姿态/视角/上下文下的两张图和一句提示词,用于教身份;以及约 4,000 条任意视频 \((P_{\text{vid}}, V)\)(Pexels 400K 的 1%),只用来守住时间动态。每个训练步抽一个均匀随机数决定这一步走哪一支:约 80% 的步用主体-图像对做身份注入,20% 的步用任意视频做 I2V 重建。可训练参数只覆盖与参考图 token 交互的部分注意力层与归一化层上的 LoRA,主干其余部分冻结。推理时不再有任何逐主体适配:给一张参考图和一句提示词,模型直接以零样本方式出视频。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["参考图 + 文本提示"] --> B["随机任务切换<br/>每步二选其一"]
    B -->|"抽中视频支(p = 0.2)"| C["运动感知保持<br/>任意视频做 I2V 重建"]
    B -->|"其余 80% 走图像支"| D["身份注入<br/>主体-图像对 + CLS 锚点"]
    C --> E["LoRA 更新<br/>主干冻结"]
    D --> E
    E --> F["梯度正交性<br/>解释切换训练为何稳定"]
    F --> G["零样本推理<br/>参考图 + 提示出视频"]

关键设计

1. 随机任务切换:把身份与运动拆成两个交替优化的子任务

这是全文的骨架。既然在主体-图像对上朴素微调会让运动崩塌,说明「身份」与「运动」不该被塞进同一个目标里联合优化——但本文的解决办法不是加正则或改损失权重,而是干脆让每一步只优化其中一个。具体地,每步抽 \(u \sim U(0,1)\),按下式二选一:

\[\mathcal{L}_{\text{total}}=\begin{cases}\mathcal{L}_{\text{vid}}, & u < p\\ \mathcal{L}_{\text{img}}, & \text{otherwise}\end{cases}\]

其中 \(\mathcal{L}_{\text{img}}\) 是主体-图像对上的身份注入损失,\(\mathcal{L}_{\text{vid}}\) 是任意视频上的文生视频/I2V 损失,\(p=0.2\) 为经验取值(论文 supplementary 给了更细的消融)。等价地看,参数更新的期望是 \(\mathbb{E}[g]=(1-p)\,g_{\text{img}}+p\,g_{\text{vid}}\),即 80% 的更新来自图像支、20% 来自视频支,作者把这种机制称作对视频分布的「随机代理回放」(stochastic proxy replay):视频样本不常出现,但足以持续提醒模型「时间维度还在」。

这个设计同时买到了两件事。其一是稳定性:因为每步只算一个任务的梯度,不存在同一批参数上同时下降两个方向相反的目标。其二是省算力:在 MM-DiT 的注意力下,token 数随视频帧数近似线性增长、注意力开销随帧数近似平方增长,\(T=13\) 时实测视频支单步开销约为图像支的 169 倍;带切换概率的每步期望开销为

\[\mathbb{E}[C]\approx(1-p)C_{\text{img}}+p\,C_{\text{vid}}\approx 0.8C_{\text{img}}+0.2\times169\,C_{\text{img}}\approx 34.6\,C_{\text{img}},\]

远低于纯视频微调,这正是「1% Compute」能成立的直接原因之一。

2. 运动感知保持:用 I2V 目标在少量任意视频上守住时间动态

视频支要解决的痛点是:仅用图像对微调后,模型在推理时几乎不动。作者没有选择纯 T2V 目标,而是刻意采用 I2V 形式——从视频里均匀抽一帧当条件参考帧,要求模型重建整段视频。这样做的理由有两条:I2V(参考图→视频)与推理时的输入模态完全一致,避免了训练/推理的接口错位;同时它把「运动」从身份监督里隔离出来,视频支只承担时间动态的维护,不掺入任何主体身份信息。由于视频是任意挑选的(不要求与评测主体相关),这一支本质上是在做一件很轻的防遗忘:用极少量真实动态样本把骨干原有的运动先验「续上」。

单帧条件还会带来一个退化解——模型可以干脆把参考帧的外观沿时间复制一遍,既省事又「保真」。论文用两个几乎零成本的正则堵住它:一是随机参考帧采样,条件帧的位置 \(i\) 在整段视频上均匀采样而非固定取首帧,复制首帧不再是一个稳定解;二是图像 token dropout,以概率 \(p_{\text{drop}}\) 随机丢掉参考帧编码中的一部分 token,逼模型不能全靠复制输入来重建,而要动用自身的时间先验。这两个改动都很朴素,但直击 degenerate solution 的成因,作者在 supplementary 中给出了各自的消融。

3. 身份注入:把主体外观锚在 与参考图 token 上

图像支沿用 OminiControl 的做法:参考图与输出图分别经 VAE 编码为 \(X_{\text{ref}}\)\(X_{\text{out}}\),提示词经冻结的 T5 编码为 \(C_T\),训练 MM-DiT 在 \((X_{\text{ref}}, C_T)\) 条件下重建 \(X_{\text{out}}\);由于输入是单帧图像,RoPE 位置编码需要截断到一帧的 token 数,以保证与视频支的位置编码语义一致。适配范围上,LoRA 只加在与参考图 token 交互的那部分注意力层与归一化层上,主干其余参数全部冻结——这一点很关键,因为「运动先验」正是存在那些没被改动的权重里,动得越少,运动就丢得越少。

另一个小但有效的设计是在提示词前面拼一个特殊的 <CLS> token(例如「An <CLS> armchair in the living room」),把身份信息显式地锚定在条件流里,而不是只依赖参考图 token 与文本的隐式交互。论文的消融显示 <CLS> 能提升 CLIP-I 与 DINO-I 两项身份指标,且不损害运动质量。它与「随机任务切换」配合得起来:身份由 <CLS> + 参考图 token 这条通路携带,运动支不碰它,两边的职责在表示层面也是分开的。

4. 梯度正交性:解释为什么这套切换能稳,且不需要梯度手术

把两个目标交替优化,直觉上会担心梯度冲突(多任务学习里常见的失败模式),常规对策是 Gradient Surgery 一类方法:投影掉与其他任务冲突的分量,强行保证每步内积非负。本文的做法是先测再判断。作者在每个 checkpoint 上冻结模型、分别用两个数据集的小批量计算 \(g_{\text{img}}(t)\)\(g_{\text{vid}}(t)\)(对可训练的 LoRA 与任务相关归一化层),记录其余弦相似度 \(\phi(t)\) 与各自的 \(\ell_2\) 范数。在 CogVideoX-5B 与 Wan 2.2-5B 上都能看到:初始化后不久 \(\phi(t)\) 就塌进零附近的一条窄带并一直保持,而两个梯度范数在最初下降后始终显著高于数值噪声、量级相当。也就是说,两目标确实在优化几乎不相交的参数子空间,而不是「都在变小所以余弦像零」的假象。作者还在局部二阶二次近似下给出命题,说明混合损失上的梯度下降会让两目标梯度的内积以 \(C\rho^{t}\) 的速度衰减(⚠️ 该命题是解释性模型,原文明确声明不构成 DiT 这类非凸问题的正式保证,以原文为准)。

有了这个观测,Gradient Surgery 就变成了不必要的开销:它需要每步同时算两个梯度再做投影,梯度计算成本大约翻倍,而随机切换每步只算一个梯度,最终效果(把冲突压下去)却是一样的。作者因此把简单切换作为默认选择。这个「先证明冲突会自己消失、再砍掉处理冲突的机制」的思路,是本文在方法论证上最漂亮的一步。

损失函数 / 训练策略

两个目标的损失形式分别是主体-图像对上的去噪重建损失 \(\mathcal{L}_{\text{img}}\) 与任意视频上的去噪重建损失 \(\mathcal{L}_{\text{vid}}\),按上面的切换规则交替使用,切换概率 \(p=0.2\)。优化用 AdamW,学习率 \(5\times10^{-5}\),cosine-with-restarts 调度,BF16 混合精度。CogVideoX-5B 微调 4,000 步,图像支/视频支批大小 256/32,LoRA rank 128;Wan 2.1-1.3B 与 Wan 2.2-5B 各微调 5,000 步,批大小 192/16,LoRA rank 32;LoRA dropout 统一 0.2。三个骨干各自的实测训练成本都约为 288 A100 小时。数据侧,主体-图像对用 Subject-200K 全集,另有 2,000/4,000 的子集用于数据效率研究;任意视频取约 4,000 条 Pexels 视频(Pexels-400K 的 1%)。作者还训练了两个采样率变体:与 CogVideoX 原始设定对齐的 8 FPS 版本,以及在 Pexels 视频上继续训练、用于提升高帧率下运动平滑度的 16 FPS 版本。

关于「1% Compute」的口径:这个数字指的是适配/微调阶段的训练算力(288 A100 小时,相对零样本基线自身的训练开销),既不是推理开销,也不是相对逐主体调优方法的单主体成本。具体地,相对 Phantom(约 10K–30K A100 小时)约为 2.8%,相对 VACE(约 70K–210K)约为 0.4%,取整后说成约 1%。推理时本方法仍需走完整的扩散去噪采样流程,它省掉的是「每来一个新主体就要重新训练一遍」这件事——逐主体调优方法每个主体要花约 200 A100 小时,而本文训练一次后对任意新主体的额外训练成本为 0。

实验关键数据

主实验

评测协议:从近期 SDI-Gen 基准与标准 DreamBooth 数据集中随机选 30 张参考图,每张用 GPT 生成 8 条提示词,共 240 组「参考图-提示词」生成视频,报 VBench 的 Motion Smoothness(时序一致性)、Dynamic Degree(运动幅度)、CLIP-T(文-视频对齐)、CLIP-I、DINO-I(主体保真)。消融用其中 120 段的子集(每张图 4 条提示词)。

表 1 是 VBench 上的主对比(Phantom 与 VACE 使用公开的 Wan-2.1 1.3B 版本):

方法 Motion Smoothness↑ Dynamic Degree↑ CLIP-T↑ CLIP-I↑ DINO-I↑
OminiControl → I2V(SDI-Gen 级联) 98.40 47.92 33.06 72.09 52.61
BLIP-Diffusion → I2V 97.81 48.10 28.83 79.27 57.21
IP-Adapter → I2V 97.74 51.90 28.94 76.60 51.41
VideoBooth 96.89 53.33 29.59 65.65 34.17
Phantom-1.3B 98.70 67.08 33.50 73.00 53.55
VACE-1.3B 98.74 43.75 33.70 73.54 54.47
MAGREF-480P 98.86 65.09 33.00 71.15 48.50
本文(CogVideoX-5B) 98.23 76.25 33.65 76.19 61.23
本文(Wan 2.1-1.3B) 98.97 53.75 32.51 74.65 58.77
本文(Wan 2.2-5B) 98.09 82.50 31.29 76.97 57.27

表 2 是 OpenS2V-Eval v1.1 的 Single-Domain 结果,Total 为其余各项的归一化加权和:

方法 训练成本 Total↑ Aes↑ Smooth.↑ Amp.↑ FaceSim↑ Gme↑ Nexus↑ Natural↑
Vidu 2.0 52.90 43.32 91.88 17.52 36.19 66.96 44.84 66.11
Pika 2.1 53.12 47.43 86.07 26.32 32.33 69.84 47.35 64.68
Kling 1.6 56.67 45.97 85.76 47.17 39.27 65.36 49.30 73.63
VACE-P1.3B ≈70K hrs 49.20 48.93 95.68 11.91 18.04 70.78 36.24 66.85
VACE-1.3B ≈70K hrs 51.13 49.41 95.42 22.51 22.37 70.87 38.34 68.33
VACE-14B ≈210K hrs 61.75 48.94 93.16 19.69 64.65 65.86 50.82 70.56
Phantom-1.3B ≈10K hrs 54.50 49.00 93.70 16.38 44.03 69.54 37.72 66.76
Phantom-14B ≈30K hrs 57.02 47.46 94.86 41.55 51.82 70.07 35.30 71.11
SkyReels-A2-P14B 55.06 40.85 85.54 26.41 54.42 61.81 48.60 61.85
MAGREF-480P 53.44 46.31 92.63 27.43 33.77 69.02 42.45 68.33
本文(CogVideoX-5B) 288 hrs 50.05 45.40 93.90 19.38 18.05 70.53 41.23 68.52
本文(Wan 2.1-1.3B) 288 hrs 51.45 43.80 93.68 17.55 13.90 71.12 45.21 75.65
本文(Wan 2.2-5B) 288 hrs 56.84 44.70 84.97 14.38 48.78 61.98 49.97 71.30

消融实验

表 3 比较三种训练策略(同一 120 段子集):

训练策略 Motion Smoothness Dynamic Degree CLIP-T CLIP-I DINO-I
Image-only(只用主体-图像对) 99.60 0.84 32.67 71.15 43.19
Two-stage(先图像后 I2V 顺序微调) 96.04 81.51 28.96 84.73 76.13
Ours(双任务随机切换) 98.45 69.64 32.69 77.14 62.88

表 4 考察主体-图像对规模的影响(同一 120 段子集,FE 为 flow entropy、衡量主体运动多样性,CS 为 copy score、衡量对参考主体的近刚性重复):

配置 主体-图像对 Motion Smooth. Dynamic Degree CLIP-T CLIP-I DINO-I FE↑ CS↓
Ours-tiny 2,000 98.72 60.71 33.38 74.72 57.03 54.73 45.27
Ours-mini 4,000 97.99 78.33 33.22 75.87 58.86 58.91 41.09
Ours 200K 98.45 69.64 32.69 77.14 62.88 63.77 36.32

表 4 中 Ours-mini 与 Ours 两行的列对齐,是依据原文正文所述趋势(配对增多 → CLIP-I/DINO-I/FE 上升、CS 下降)以及表 3 中 Ours 行的取值还原的,⚠️ 数值请以原文表格为准。

关键发现

  • 「1% Compute」省的是训练,不是推理:288 A100 小时/每个骨干是微调开销,相对 Phantom 约 2.8%、相对 VACE 约 0.4%;相比逐主体调优方法每主体约 200 A100 小时,本文对每个新主体的额外训练成本为 0。推理仍需完整扩散采样。
  • 图像支单独训练会彻底压死运动:image-only 的 Dynamic Degree 只有 0.84,同时 Motion Smoothness 高达 99.60——这个高平滑度是「几乎不动」的假象,正是本文要解决的失败模式。
  • 顺序式两阶段微调是另一种极端:dynamic degree 冲到 81.51、CLIP-I 也最高(84.73),但 Motion Smoothness 掉到 96.04,并伴随严重伪影与身份遗忘;只有双任务切换同时把两者维持在可用区间(98.45 / 69.64)。
  • 数据规模的两个方向:仅 2,000 对就足以学到基本身份映射(DINO-I 57.03),但会频繁出现 copy-paste 伪影——主体身份保住了,却像贴纸一样在帧间重复同一姿态与版式(图 7 的「冲浪的猪」例子:小数据模型不会转头、不会改变体态)。扩到 200K 后 CLIP-I/DINO-I 提升、FE 上升、CS 下降,说明更多主体-图像覆盖主要买的是高频细节与运动多样性,而不是「会不会做」。
  • 梯度冲突确实会自己消失:无论 CogVideoX-5B 还是 Wan 2.2-5B,余弦相似度都在起步后迅速收敛到零附近的窄带,且两个梯度范数始终保持同量级、未跌入数值噪声,排除了「范数消失导致的假零」。因此不需要 Gradient Surgery 这类需要每步算两个梯度再投影(成本约翻倍)的做法。
  • 配方可跨骨干迁移:CogVideoX-5B、Wan 2.1-1.3B、Wan 2.2-5B 都用同一套设置,且三个骨干的训练成本都在 288 A100 小时量级;Wan 2.2-5B 拿到 82.50 的最高 Dynamic Degree 与 56.84 的 OpenS2V Total(逼近训练成本高两个数量级的 Phantom-14B 的 57.02,并超过 Kling 1.6、Pika 2.1、Vidu 2.0 等商业模型),但其 Amp. 偏低(14.38),作者认为与 Wan 2.2 的 TI2V 骨干特性有关。
  • 失败场景:级联式 SDI-Gen→I2V 在主体小或被遮挡时身份传递断裂(图 4);本文模型在强风格化与极端外观变化下仍会失败,人脸任务则因 Subject-200K 几乎不含人脸而依赖泛化。

亮点与洞察

  • 把「训练数据从哪来」当成核心设计变量:不是发明新模块,而是重新划分监督信号——身份用已有的大规模主体-图像对,运动用 4,000 条与任务无关的普通视频。这让整个领域去掉了「必须构造 subject-video pair 数据集」这一前置条件,价值远超方法本身。
  • 「先证明冲突会自己消失,再砍掉处理冲突的机制」:用余弦相似度 + 梯度范数的双测量排除了「范数消失」这一平凡解释,然后顺理成章地用单目标/步的随机切换替掉梯度手术,把成本压掉约一半。这套「测量 → 解释 → 简化」的论证方式可以直接搬到其他多任务适配场景。
  • 随机参考帧采样 + 图像 token dropout:两个改动几乎零成本,却精准掐死了 I2V 微调里最常见的退化解(复制参考帧)。任何以单帧为条件、要求生成整段的模型都可以直接借用。
  • <CLS> token 做身份锚点:一个词元的开销换来 CLIP-I/DINO-I 的提升且不损运动,属于性价比极高的工程手感。
  • 可迁移思路:凡是「能力 A 的配对数据稀缺、但 A 与 B 各自都有独立数据源」的后训练场景(音频驱动、长视频一致性、多视角一致性),都可以先试「双任务随机切换 + 梯度正交性验证」;本文用 1% 规模的任意视频当防遗忘代理数据,本质上是 rehearsal 的一个极简版本,比记忆缓冲区或持续学习方法轻得多。

局限与展望

  • 训练主力数据 Subject-200K 以物体为主、几乎不含人脸,人脸能力靠泛化获得,强风格化或极端外观变化下会失败;人脸场景的系统性评测缺失。
  • 运动质量仍有差距:OpenS2V 的 Amp./Motion 分数低于头部 SDV-Gen 方法(作者也承认这一项有提升空间),Wan 2.2-5B 变体的 Amp. 只有 14.38。
  • 评测规模有限:VBench 只用 240 段视频,OpenS2V 只报 Single-Domain,未给 Multi-Domain 结果;消融则全部在 CogVideoX 上做,Wan 系列的消融结论只能算外推。
  • 方法依赖一个已经很强的 T2V 骨干(运动先验完全来自预训练),对弱骨干或从头训练的场景不适用。
  • 我自己的观察:视频支只用约 4,000 条 Pexels 视频,运动类型覆盖受这 4,000 条的分布限制;切换概率 \(p=0.2\) 也是经验取值,不同数据规模下未必最优。进一步可以做的是:把固定 \(p\) 换成随训练进程变化的课程调度(早期多给视频、后期多给图像),或按梯度正交程度自适应调节切换概率。
  • 「1% 相对的是零样本基线自身的训练预算」这一口径在多骨干实验里还隐含 288×3 的总量,与逐主体调优的「每主体 200 小时」并非同一度量,跨表比较时需要小心。

相关工作与启发

  • vs VACE / Phantom:它们同样做零样本 SDV-Gen,但依赖百万级主体-视频对(Phantom-Data、OpenS2V-Nexus 等),训练开销 10K–210K A100 小时;本文完全不用主体-视频对,288 小时,在 VBench 的 DINO-I 与 Dynamic Degree 上反超,OpenS2V Total 也逼近 Phantom-14B。
  • vs VideoBooth:同为「训练一次、泛化到未见主体」的零样本方法,但 VideoBooth 仍靠主体-视频对监督,且本体质量受限(DINO-I 34.17、Motion Smoothness 96.89),本文三个骨干的 DINO-I 都在 57 以上。
  • vs SDI-Gen→I2V 级联(OminiControl / BLIP-Diffusion / IP-Adapter):级联管线常拿到很高的 CLIP-I(BLIP 的 79.27)但运动动态偏弱,且首帧主体小/被遮挡时身份传播会断;本文直接把主体条件注入视频扩散模型,在保真与运动之间取得更均衡的折中。
  • vs 逐主体调优(CustomCrafter / Still-Moving):它们每来一个新主体就要约 200 A100 小时,且 CustomCrafter 在「泰迪熊」序列上仍有明显的形状/纹理漂移、Still-Moving 会丢失胡须这类细节;本文零样本推理,身份一致性在定性对比中更好。
  • vs 多任务优化(Gradient Surgery)与持续学习(replay/记忆缓冲):Gradient Surgery 靠投影消除冲突,每步要两次梯度计算;持续学习靠回放缓冲防遗忘。本文用每步单目标的随机切换取得了类似效果,并且用梯度测量说明了为何够用——对「任务数少、子空间天然接近正交」的适配问题,简单调度可能比显式冲突处理更划算。

评分

  • 新颖性: ⭐⭐⭐⭐ 没有新模块,但把 SDV-Gen 重新表述为「身份注入 + 运动保持」的双任务问题并去掉主体-视频对依赖,问题重构本身很有价值。
  • 实验充分度: ⭐⭐⭐⭐ 三个骨干、VBench + OpenS2V 双基准、策略与数据规模消融、梯度测量都齐;扣分在消融集中在 CogVideoX、OpenS2V 只报 Single-Domain、评测集仅 240 段。
  • 写作质量: ⭐⭐⭐⭐ 论证链清晰(失败观察 → 分解 → 梯度证据 → 砍掉冗余机制),公式节制;主要表格的列对齐在 PDF 里不够清晰,需要读者对照正文核对。
  • 价值: ⭐⭐⭐⭐⭐ 把零样本 SDV-Gen 的算力门槛从 10K–210K A100 小时降到 288 小时,且配方可跨骨干复用,对资源有限的研究者具有很强的可操作性。