跳转至

Leveraging Cross-Modal Knowledge Transfer for Knowledge-Aware Concept Customization

会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/HKUST-LongGroup/MoKus
领域: 知识编辑
关键词: 概念定制 / 知识编辑 / 跨模态知识迁移 / 扩散Transformer / 文本到图像生成

一句话总结

针对传统概念定制依赖罕见标记导致生成不稳定且缺乏常识关联的缺陷,本文提出知识感知概念定制任务与 MoKus 框架,基于跨模态知识迁移机制将文本编码器中编辑的自然语言知识无缝投影至视觉锚点表征,实现高效、高保真的定制图像生成。

研究背景与动机

以 DreamBooth、CustomDiffusion 和 Textual Inversion 为代表的主体驱动图像定制技术,近年来在视觉内容创作中取得了显著进展。这类方法普遍采用人为设定的罕见标记(如 <sks>)来指代用户指定的特定概念,并通过在少量参考图像上重构图像潜变量来绑定该概念的视觉外观。然而,这种基于罕见标记的定制范式存在两项根深蒂固的局限:其一是生成稳定性差,因为罕见标记在预训练语料中极少出现,当将其与复杂的上下文字符串进行组合时,文本编码器内部缺乏平滑的语义空间支撑,极易导致下游扩散模型生成失真或语义崩塌;其二是知识缺失(Knowledge Unaware),罕见标记仅以无先验符号的形式记录低层像素特征,完全脱离了目标主体固有的背景知识。例如,模型虽然能够通过 <sks> sculpture 还原小美人鱼雕像,但当输入“哥本哈根港口的青铜雕像”或“丹麦小美人鱼雕像”这类富有语义的客观知识描述时,模型便完全无法将其与目标外观建立关联。

知识感知概念定制面临着严苛的双重挑战。首先,在推理阶段,模型必须能够敏锐识别文本提示中蕴含的特定概念知识短语,并将其与周围的环境、风格、动作等修饰文本无缝融合成连贯画面;其次,现实世界中单个视觉概念往往关联着多维度的文本知识,既包含客观事实(如地理位置、生产背景),也包含主观指代(如“我最喜欢的雕塑”)。若沿用现有定制方案,基于罕见标记的方案每绑定一条新知识就必须耗时数十分钟重新微调扩散骨干网络,而基于图像编码器的前馈定制方法若要吸收自然语言知识,则需要重构海量图文对并执行昂贵的二次预训练。

探索更轻量、通用的解耦机制因此成为打破上述困境的关键。作者在分析预训练多模态扩散生成模型(基于大语言模型文本编码器与扩散 Transformer 骨干)时,发现了一种引人注目的跨模态知识迁移(Cross-Modal Knowledge Transfer)现象:仅在文本编码器内部通过闭式解知识编辑技术修改特定问答知识的回答,下游扩散生成模型在接收该问题提示词时,便会自动在其生成的图像中反映出更新后的视觉语义。核心 idea:将知识感知概念定制拆解为视觉概念学习与文本知识更新两阶段,先用极轻量 LoRA 将目标视觉外观绑定至文本空间的稀有标记作为视觉锚点,再通过闭式模型编辑将多条自然语言知识的问答投影至该锚点表征,利用跨模态知识迁移实现秒级知识绑定与鲁棒定制。

方法详解

整体框架

MoKus 整体架构建立在采用大语言模型(LLM)作为文本编码器 \(\phi\) 与多模态扩散 Transformer(MMDiT)作为生成骨干的图像扩散架构之上。整体流程分为视觉概念学习与文本知识更新两个清晰解耦的阶段。在视觉概念学习阶段,针对用户提供的少量目标概念图像集合,系统冻结预训练基础模型,仅在 MMDiT 的自注意力层注入低秩自适应(LoRA)参数,将参考图像的外观特征绑定到稀有标记构成的文本潜变量上,使其充当连接视觉形态与文本先验的“锚点表征”;在文本知识更新阶段,针对目标概念关联的多条自然语言知识,系统将其批量转换为结构化问答对,通过闭式正则化最小二乘法仅修改文本编码器中间 MLP 层的投影权重,将所有知识查询的输出表征直接对齐至预先构建的视觉锚点。在测试推理时,用户即可直接使用任意已绑定的自然语言知识短语与复杂场景提示进行组合,生成兼具高视觉保真度与高文本遵循度的定制图像。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入:概念参考图像集 + 多条文本知识"] --> B["阶段一:视觉概念学习<br/>MMDiT LoRA 拟合生成锚点表征"]
    B --> C["阶段二:文本知识更新<br/>问答转化与闭式最小二乘参数更新"]
    C --> D["测试生成:知识提示与场景文本组合推理"]

关键设计

1. 视觉概念学习:构建解耦的视觉外观锚点表征

传统定制方法直接将稀有标记作为最终生成的提示触发词,导致泛化时面临严重的语义鸿沟。针对这一缺陷,MoKus 将稀有标记(例如 <sks> dog)定位为纯粹的“中间视觉锚点(Anchor Representation)”,其核心目标是高精度记录目标物体的几何细节与纹理先验,而不直接面向终端用户的复杂提示交互。具体实现上,给定输入概念图像集合 \(X=\{x_i\}_{i=1}^M\),首先通过预训练变分自编码器(VAE)提取图像潜变量 \(z_0 = \mathcal{E}(x_i)\),并基于 Rectified Flow 机制在采样时间步 \(t \sim \text{Logit-Normal}(0, 1)\) 下合成加噪潜变量 \(z_t = t z_1 + (1 - t) z_0\)。文本编码器 \(\phi\) 仅前向提取稀有标记 \(P\) 的文本隐状态 \(h = \phi(P)\)。为了最大程度避免破坏扩散模型底座强大的先验生成能力,MoKus 冻结了 VAE 与 MMDiT 的全部主干参数,仅在 MMDiT 的自注意力层引入轻量化 LoRA 权重 \(\theta_v\),并通过最小化速度场预测误差进行微调:

\[\mathcal{L}(\theta_v) = \mathbb{E}_{x_i, z_1, t} \left\| v_{\theta_v}(z_t, t, h) - (z_1 - z_0) \right\|^2\]

通过该阶段训练,稀有标记被赋予了极高的视觉重构保真度,为后续知识的高效跨模态映射奠定了坚实的物理表征锚点。

2. 文本知识更新:基于闭式最小二乘的秒级多知识绑定

在获取视觉锚点后,关键挑战在于如何使模型理解诸如“我朋友心爱的狗”或“邻居家的新宠物”等多样化自然语言知识,并精确关联至该锚点。若直接对文本编码器或全模型执行梯度微调,往往会导致潜在语义空间分布崩塌或出现严重的灾难性遗忘。MoKus 创新性地将该问题转化为大语言模型中的“知识编辑”范式:对于给定的知识集合 \(K=\{k_i\}_{i=1}^N\),首先将每条非结构化短语转换为查询问答格式 \(q_i\)(例如“What is my friend's dog?”),并将第一阶段学得的锚点表征 \(y = \phi(P)\) 设定为所有问答的唯一样本目标 \(y\)。为了更新文本编码器中特定可编辑层(实验中选取深层 MLP 中的 Gate Projection 与 Up Projection 矩阵)的参数 \(\theta_t\),模型首先计算各查询的前向隐状态 \(h_i\) 与目标关于权重的梯度更新方向:

\[v_i = -\eta \cdot \|h_i\|^2 \cdot \nabla_{\theta_t} y_i\]

其中 \(\eta\) 为缩放因子。为了在满足新知识注入的同时严格限制参数漂移以保全语言常识,MoKus 求解带有更新范数惩罚项的正则化最小二乘优化问题:

\[\min_{\Delta \theta_t} \|H \Delta \theta_t - V\|^2 + \lambda \|\Delta \theta_t\|^2\]

由于该目标函数具备严格凸性,参数偏移量 \(\Delta \theta_t\) 存在确定性的闭式矩阵解:

\[\Delta \theta_t = (H^\top H + \lambda I)^{-1} H^\top V\]

更新后的权重直接通过叠加获得 \(\hat{\theta}_t = \theta_t + \Delta \theta_t\)。由于无需进行反向传播迭代优化,每条知识的绑定仅涉及一次矩阵乘法与求逆,耗时仅需约 7 秒。更新后的知识天然嵌入在自然语言流形中,使得后续与其他动作、背景提示词的组合具备极强的泛化鲁棒性。

损失函数 / 训练策略

MoKus 的训练在 8 张 H800 GPU 上基于开源 Qwen-Image 架构实现。阶段一视觉概念学习中,仅微调 MMDiT 自注意力层中注入的 LoRA 参数,使用 AdamW 优化器,学习率设为 \(2 \times 10^{-4}\),批大小按默认扩散配置执行;阶段二文本知识更新完全免除了迭代式梯度反向更新,采用 UltraEdit 的参数编辑策略,仅定位编辑大语言模型文本编码器第 18 至第 26 层的 MLP(共计 16 个参数矩阵)。更新超参数严格控制为批大小 \(m=1\),缩放系数 \(\eta = 1 \times 10^{-6}\)。极小的扰动量与精准的闭式解保证了预训练语言分布的完整性,同时实现知识向视觉域的无缝击穿。

实验关键数据

主实验

评估在作者专门构建的首个知识感知概念定制基准 KnowCusBench 上展开。基准包含 35 个涵盖日常玩具、毛绒玩偶、宠物、真实场景等多元类别的核心概念。评估分为知识直接重构(Reconstruction)与多知识场景组合生成(Generation)两大维度。主实验对比了全参数重复 DreamBooth 调优的 Naive-DB 以及微调文本编码器的 Enc-FT 基准。针对视觉主体保真度,评估采用了标准全图 CLIP-I 以及基于 SAM3 分割目标主体后的 CLIP-I-Seg,后者有效剔除了生成背景对主体评测的干扰;提示词忠实度与人类偏好则分别通过 CLIP-T 和 Pick Score 进行量化。

方法 (Method) 重构: CLIP-I ↑ 重构: CLIP-I-Seg ↑ 生成: CLIP-I ↑ 生成: CLIP-I-Seg ↑ 生成: CLIP-T ↑ 生成: Pick Score ↑ 训练用时 (Training Time) ↓
Naive-DB 0.874 0.758 0.789 0.717 0.291 20.80 ~27 min
Enc-FT 0.582 0.553 0.591 0.562 0.197 18.34 ~10 min
MoKus (本文) 0.867 0.764 0.761 0.718 0.305 21.30 ~6 min

消融实验

1. 知识绑定容量与可扩展性消融

考察在概念定制过程中,文本知识更新条数从 1 条线性增长至 5 条时,MoKus 的重构质量、生成泛化性能以及累计耗时变化情况。

绑定知识数量 (Knowledge Number) 重构: CLIP-I ↑ 重构: CLIP-I-Seg ↑ 生成: CLIP-I ↑ 生成: CLIP-I-Seg ↑ 生成: CLIP-T ↑ 生成: Pick Score ↑ 累计训练用时 (Time) ↓
1 条知识 0.868 0.761 0.767 0.722 0.304 21.29 331.3 s
2 条知识 0.868 0.762 0.762 0.718 0.305 21.30 338.3 s
3 条知识 0.867 0.761 0.762 0.719 0.305 21.30 345.1 s
4 条知识 0.868 0.761 0.763 0.718 0.305 21.30 352.1 s
5 条知识 0.867 0.764 0.762 0.718 0.305 21.30 360.0 s

2. 知识更新缩放因子 \(\eta\) 敏感性消融

探究文本知识更新闭式求解公式中缩放因子 \(\eta\) 对文本潜变量修改强度的控制作用。当 \(\eta\) 过大时,文本编码器表征空间发生失真;当 \(\eta\) 过小时,知识无法有效迁移至视觉域。

缩放因子 \(\eta\) 重构: CLIP-I ↑ 重构: CLIP-I-Seg ↑ 生成: CLIP-I ↑ 生成: CLIP-I-Seg ↑ 生成: CLIP-T ↑ 生成: Pick Score ↑
\(1 \times 10^{-4}\) 0.557 0.535 0.588 0.564 0.218 18.40
\(1 \times 10^{-5}\) 0.866 0.763 0.759 0.717 0.304 21.29
\(1 \times 10^{-6}\) (默认) 0.867 0.764 0.761 0.718 0.305 21.30
\(1 \times 10^{-7}\) 0.867 0.761 0.760 0.717 0.304 21.29
\(1 \times 10^{-8}\) 0.867 0.764 0.760 0.718 0.304 21.29

关键发现

  • 主体保真与文本遵循兼得:在最能真实反映主体孤立质量的 CLIP-I-Seg 指标上,MoKus 在重构(0.764 vs 0.758)和复杂场景生成(0.718 vs 0.717)中均超过耗时极长的全量微调 Naive-DB;在生成图与提示词的一致性(CLIP-T 0.305 vs 0.291)和人类审美倾向(Pick Score 21.30 vs 20.80)上优势更加显著。
  • 微调文本编码器导致灾难性崩塌:Enc-FT 在两项任务上的各项指标全面溃败(重构 CLIP-I 跌至 0.582,生成 CLIP-T 仅 0.197)。定性实验表明,直接梯度反传改变了文本编码器的全局隐空间流形,导致扩散 Transformer 完全失去图文协同对齐能力。
  • 极佳的多知识扩展线性度:消融表表明,每增加一条新知识,模型训练用时仅增加约 7 秒(从 331.3 s 到 360.0 s 仅增加 28.7 s 处理 4 条额外知识),各项精度指标保持完全水平稳定,证明闭式多编辑在此任务中不会引入交叉干扰。
  • 扩展性验证卓越:在世界知识基准 WISE 上,MoKus 成功在不微调扩散主干的前提下显著提升了模型理解冷门地理常识与人物实体的生成质量,整体 WiScore 从 0.81 跃升至 1.33;同时无缝支持虚拟概念创建与特定外观概念擦除。

亮点与洞察

  • 跨模态知识迁移现象的开创性实证:本文首次系统确立了大语言模型文本编码器局域参数编辑可直接外溢传导至多模态扩散生成器视觉输出的机制,纠正了此前 GapEval 和 UniSandbox 认为跨模态难以直接迁移知识的片面结论。
  • 将视觉概念解耦为中间锚点表征:摒弃将稀有标记作为终端提示的传统思路,将其转化为知识编辑的数学目标向量,既保留了轻量 LoRA 的高精度像素提取优势,又规避了稀有标记与普通词汇组合时的语用失效。
  • 闭式正则优化保障极端高效与空间保真:通过单次矩阵求逆解析更新参数,在几秒内完成单条知识绑定,避免了梯度优化带来的缓慢收敛与语言流形破坏,为大模型实时知识定制提供了通用范式。

局限与展望

  • 作者承认的局限:当前知识感知概念定制主要聚焦在静态单帧图像生成领域,尚未推广至视频生成或 3D 资产生成等动态、高维模态。此外,知识编辑目前依赖于两阶段管道,尚未实现端到端的一体化训练。
  • 评测与数据局限:KnowCusBench 现存评测指标主要依赖 SAM3 分割与通用 CLIP 相似度,对非常规属性绑定(如主观情感、功能性关联)的细粒度验证仍缺乏针对性的语义推理评测基准。
  • 未来改进方向:可进一步探索在统一端到端框架下,通过强化学习或自回归交织流直接完成视觉与多条知识的联合注入,并结合外部知识库检索构建支持无限规模知识更新的动态定制系统。

相关工作与启发

  • vs DreamBooth / CustomDiffusion 等经典定制方法:传统方法将稀有标记直接暴露在文本提示中,缺乏语义泛化能力且不支持自然语言知识查询;MoKus 引入两阶段架构,以稀有标记为底层锚点,通过上层知识编辑使模型支持任意自然语言多知识交互,同时绑定速度提升数倍。
  • vs Enc-FT / GapEval 等文本编码器微调探索:已有研究尝试微调文本编码器但发现跨模态迁移微弱且引发模型退化;MoKus 指出原因在于微调扰乱了全局分布,改用高精度定位的闭式最小二乘层编辑(UltraEdit 策略),实现了稳定的跨模态知识迁移。
  • vs ROME / MEMIT 等知识编辑算法:传统编辑聚焦于 LLM 的文本问答事实更新;MoKus 成功将其外延拓展至多模态生成管线,证明文本编辑产物可作为强条件引导下游视觉生成。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 首次提出知识感知概念定制新任务,并基于跨模态知识迁移发现提出了优雅的视觉锚点编辑框架。
  • 实验充分度: ⭐⭐⭐⭐⭐ 提出首个专用基准 KnowCusBench,涵盖严格的主体分割评测、详尽的多知识扩展消融与世界知识扩展实验。
  • 写作质量: ⭐⭐⭐⭐⭐ 论证脉络清晰,图表规范精美,从动机洞察到方法推导层层递进。
  • 价值: ⭐⭐⭐⭐⭐ 为轻量化、常识化的人性化图像创作与内容定制提供了开箱即用的落地范例。