跳转至

UniStitch: Unifying Semantic and Geometric Features for Image Stitching

会议: ECCV2026
论文: ECCV 原文
项目: UniStitch
领域: 多模态 VLM(当前归档);研究任务为图像拼接
关键词: 图像拼接、几何特征、语义特征、混合专家、自由形变

一句话总结

UniStitch 把稀疏关键点编码成与图像特征对齐的网格,再用自适应专家融合驱动全局到局部的拼接形变,在 UDIS-D 上达到 25.07 dB / 0.813,并通过低分辨率 TPS 与 B 样条恢复降低高分辨率形变的显存开销。

研究背景与动机

图像拼接需要把有重叠的不同视角放到同一个画布上,同时避免重影和结构扭曲。 传统方案先检测、匹配 SIFT 一类关键点,再根据对应关系求单应性或弹性形变;它的优势是几何证据明确,不必先从训练数据学会理解场景。 但在纹理很少、照明不佳或重复结构密集的画面中,可靠匹配可能不足,错误对应还会直接污染形变估计。 学习式方案则从两幅图像提取稠密特征,学习全局单应性以及局部薄板样条变换,在 UDIS-D 这类训练分布内通常更稳。 问题是,善于利用图像上下文不等于拥有跨场景稳定的几何约束,换到经典拼接数据集时,深度方法未必比传统方法强。

UniStitch 针对的不是“缺少更大的语义骨干”,而是两类证据没有在同一个表示空间里协作。 把关键点直接当作额外像素通道并不自然:点集是无序、稀疏、长短可变的,卷积特征却是位置固定的二维网格。 即使解决了形状不匹配,简单相加仍会让不可靠的模态干扰另一支,尤其是在训练中两支总是同时有效的情况下。 论文因此先解决点集如何带着坐标与描述子进入网格,再解决模型如何在单模态独立性和跨模态互补性之间选择。 这里的“多模态”指同一视觉输入的几何与语义表示,不是图像与语言,也不涉及语言模型。

另一个实际障碍出现在最终变换:高分辨率画布会使标准 TPS 产生很大的中间矩阵,即使特征网络能运行,重采样阶段也可能显存溢出。 作者把表示融合与形变计算分开处理,既改善用于估计形变的证据,也压缩真正执行形变的成本。 核心 idea:先把关键点变成空间对齐的几何特征图,再让独立专家与联合专家按可靠性融合,最后用低分辨率 TPS 加局部 B 样条恢复完成高分辨率拼接。

方法详解

整体框架

输入是一对参考图像与目标图像,以及各自的关键点坐标和描述子;输出是投影到共同画布上的拼接图像。 语义支使用 ResNet-18,几何支使用神经点变换,在原图的 \(1/8\)\(1/16\) 尺度形成空间大小一致的特征图。 随后,自适应混合专家分别融合两幅图像在各尺度上的语义和几何信息,提供给后续相关性计算及形变回归。 低分辨率融合特征用于全局单应性估计,再通过较细尺度的信息预测局部控制点残差。 全局变换先把两幅图投影到虚拟中间平面,局部变换再修正视差导致的剩余错位,而不是只把目标图硬贴到参考图上。 训练期额外加入潜在空间模态鲁棒化;推理期不需要随机丢弃或噪声扰动,跨域迭代适配则是另列结果的可选后处理。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
        Input["图像对与匹配关键点"] --> Alignment["点到网格对齐<br/>NPT + ResNet-18"]
        Alignment --> Fusion["可靠性自适应融合<br/>AMoE"]
        Robustifier["仅训练:潜在空间<br/>模态鲁棒化 MR"] -.-> Fusion
        Fusion --> Warp["低内存全局到局部形变<br/>单应性 + FFD-TPS"]
        Warp --> Output["共同画布与拼接结果"]

关键设计

1. 点到网格对齐:保留关键点证据,又让它进入稠密回归网络

神经点变换(Neural Point Transformer,NPT)采用“先变换、再投影”的顺序,并不只是给稀疏坐标绘制一张二值图。 每个输入点同时带有二维位置和描述子,PointNeXt 先对点集编码、下采样,生成具有局部上下文的高维点特征。 这样,几何支传递的不只是“这里有角点”,还包括这个点附近的可辨别结构;描述子提供了仅靠坐标无法区分的外观证据。 语义支独立处理完整图像,因此即使几何点没有覆盖某些区域,稠密图像信息仍然存在。 两支在这一阶段尚未融合,先各自保持适合自身输入的编码方式。

接下来,NPT 按点的位置把编码后的特征投影到零初始化网格,网格分辨率与对应尺度的语义特征图一致。 尺度为 \(1/8\) 时,一个网格单元对应原图的 \(8\times8\) 像素范围;尺度为 \(1/16\) 时,对应 \(16\times16\) 像素范围。 坐标乘尺度并向下取整后即可定位网格单元,同一单元内的多个点以逐通道最大池化聚合。 没有投影点的单元保持初始零值,因此“稠密”是指规则张量布局,不意味着作者凭空恢复了每个位置的几何观测。 这一转换让卷积和特征融合可以在同一空间位置操作,同时避免把输入点的排列顺序当成有效信息。 它也解释了表 5 中随机打乱点顺序几乎不改变结果的现象,但这项测试不能替代对所有扰动的鲁棒性证明。

实际几何输入的质量仍然重要:论文比较原始点与匹配后的点,后者表现更好,而不是点越多越好。 对 SIFT、SURF、ORB 使用 KNN 匹配,对 SuperPoint 使用 SuperGlue 或 LightGlue;最终采用 SuperPoint 与 LightGlue 的组合。 匹配先筛出跨视角更可信的对应,再让网络学习如何使用它们,因此该模型不是取消几何匹配,而是改变匹配证据进入形变回归的方式。 表 8 中保留描述子的 SuperPoint + LightGlue 为 24.91 / 0.808,只用坐标为 24.87 / 0.807,说明描述子在该消融设置下有增益。 这组数值来自几何特征比较,不应改写成最终完整模型的 25.07 / 0.813。

2. 可靠性自适应融合:既允许独立判断,也学习跨模态互补

自适应混合专家(Adaptive Mixture of Experts,AMoE)有三个残差式专家:语义专家、几何专家和异构专家。 前两者分别只处理自己的模态,异构专家处理两支特征的拼接,以学习只有结合两类证据才可见的关系。 线性门控路由器读取模态信息,用 Softmax 产生三个归一化权重,再对专家输出加权求和。 这与强迫全部特征经过同一个卷积融合块不同:一支不可靠时,网络仍有保留另一支独立表示的路径。 下面是依据第 7 页式 (4)–(6) 及相邻文字写出的等价简记,并非逐字转录损坏的公式排版:

\[ F_{\mathrm{fused}}=\sum_{\mathrm{expert}\in\{s,g,h\}}w_{\mathrm{expert}}H_{\mathrm{expert}},\qquad w_{\mathrm{expert}}\geq0,\quad\sum_{\mathrm{expert}\in\{s,g,h\}}w_{\mathrm{expert}}=1. \]

其中 \(s,g,h\) 分别代表语义、几何和异构专家,\(H\) 是专家输出,而不是原始输入图像。 这个融合在相应尺度上执行;原文描述的是三维权重向量,不宜擅自把它扩展为作者未说明的逐像素置信度图。 所有专家都参与加权聚合,论文没有把该模块描述成只激活 Top-k 专家的稀疏大模型路由。

只有门控还不够,因为训练时总能看到成对、完整的特征,网络可能学会依赖固定的模态共现关系。 潜在空间模态鲁棒化(Modality Robustifier,MR)在第二训练阶段冻结特征对齐分支,对专家分支特征施加随机丢弃或高斯噪声。 丢弃概率与加噪概率均设为 0.25,扰动覆盖语义、几何和异构分支的多尺度特征。 作者把扰动放在潜在空间,是为了不破坏原始像素和关键点之间已经建立的空间对应。 因此 MR 是融合设计的训练配套,而不是推理时必须另外调用的修复网络。 其作用可以用表 3 检验:加入 MR 后,Classic 从 18.56 / 0.581 提升到 18.80 / 0.596,域内也同步提高。

3. 低内存全局到局部形变:把昂贵 TPS 求值与最终像素数量分开

融合后的特征先预测全局单应性,再按 StabStitch++ 的方法分解为参考图与目标图各自的变换。 两幅图被映射到虚拟中间平面,全局变换给出局部 TPS 控制点偏移的初始值,后续回归的是剩余控制点偏移。 这样的全局到局部过程能先消除大范围视角差,再处理单个单应性无法解释的局部视差。 对比实验将 StabStitch++ 的空间形变适配为图像拼接,并使用与 UniStitch 相同的控制点数量,降低形变自由度不同造成的干扰。

标准薄板样条(Thin-Plate Spline,TPS)需要在大量输出坐标上求值,中间缓存随输出分辨率增长,成为高分辨率拼接的显存瓶颈。 作者先压缩输出坐标网格,再在低分辨率网格上执行 TPS,最后用自由形变(Free-Form Deformation,FFD)恢复全分辨率位移场。 低分辨率网格的尺寸经验上取 TPS 控制点分辨率的两倍,而不是对最终输出图像直接做模糊放大。 恢复使用三次 B 样条的局部支撑,每个输出位置只依赖低分辨率位移场中的 \(4\times4\) 局部邻域。 这样,昂贵的 TPS 运算面对较少的坐标,而高分辨率部分主要执行局部插值与图像重采样。 这是一种近似求值,不应理解为数学上与全分辨率 TPS 完全相同;表 7 中指标确实存在很小的变化。 例如 \(1329\times2000\) 时 mPSNR 从 17.14 变为 17.12,而显存从 13.99 GB 降至 8.57 GB。 因此合理结论是用很小的对齐差异换取更低成本,而不是所有分辨率、所有图像都严格无损。

损失函数 / 训练策略

总目标包含内容对齐、形状保持和专家正则化;前两项沿用 StabStitch++,用来约束重叠内容对齐及形变的结构合理性。 专家正则只约束 \(1/16\) 尺度的路由权重,正文解释包含平衡专家使用的方差项及与专家选择相关的熵项。 需要保留一个复现疑点:缓存式 (10) 的运算符损坏,且文字将负熵项解释为促进选择性,实际方向必须结合准确符号确认。 本笔记因此不猜写该正则公式;第 8 页超参数列表中的 \(w_b\) 与前文 \(w_r\) 命名也不一致。 原文列出的形状项、正则项和熵系数相关数值为 10、0.01、0.1,但正则权重名称应在原 PDF 或实现中复核。 缓存没有附录,内容对齐与形状保持损失的完整细节不能仅凭这份正文恢复。

训练数据为 UDIS-D 训练集;第一阶段从头训练 100 epochs,不启用 MR。 第二阶段再训练 100 epochs,冻结多模态特征对齐分支并启用 MR,让后端适应部分特征失效。 实验使用单张 NVIDIA RTX 5090、batch size 8、初始学习率 \(1\times10^{-4}\) 和指数衰减调度。 常规推理保留关键点提取与匹配、双分支编码、AMoE 和形变,不施加训练扰动。 带星号的 Classic 结果另外使用 UDIS++ 的迭代适配后处理,不能与不带星号的前向预测视为相同计算预算。

实验关键数据

主实验

表中保留原文表 1、表 2(第 10 页)的平均指标,mPSNR 单位为 dB,mSSIM 无量纲,均越高越好。 UDIS-D 测试集有 1,106 对图像,Classic 是 RopStitch 收集的 147 个跨域样本;指标衡量重叠区域的平均对齐质量。 作者为视觉比较统一采用平均融合,使重影和模糊更容易反映几何错位,而非由更强的融合后处理掩盖。

方法与设置 UDIS-D mPSNR UDIS-D mSSIM Classic mPSNR Classic mSSIM
APAP 22.39 0.726 18.92 0.628
UDIS++ 23.41 0.755 17.36 0.500
StabStitch++,空间形变适配 24.63 0.797 17.91 0.534
RopStitch,无迭代适配 24.70 0.800 18.44 0.568
UniStitch,无迭代适配 25.07 0.813 18.80 0.596
RopStitch*,迭代适配 未列出 未列出 19.74 0.645
UniStitch*,迭代适配 未列出 未列出 20.68 0.692

UDIS-D 上相对 RopStitch 的提升为 0.37 dB / 0.013;同样进行适配时,Classic 上的提升为 0.94 dB / 0.047。 但不适配的 UniStitch 在 Classic 上仍低于 APAP 的 18.92 / 0.628,因此不能把论文的跨域优势概括成“无需适配就超过所有传统方法”。

消融实验

下表来自原文表 3(第 12 页),两组结果均按 mPSNR / mSSIM 排列;Classic 不带迭代适配星号。

配置 UDIS-D Classic
仅几何点分支 24.22 / 0.784 18.02 / 0.553
仅图像分支 24.63 / 0.797 17.91 / 0.534
双分支 + AMoE 24.94 / 0.808 18.56 / 0.581
双分支 + AMoE + MR 25.07 / 0.813 18.80 / 0.596

几何分支单独使用时域内较弱,跨域则略强,直接支持“两类特征有不同适用条件”,而不是“一类全面替代另一类”。 MR 在 AMoE 之上带来 UDIS-D 的 0.13 dB / 0.005 和 Classic 的 0.24 dB / 0.015 增益。 原文表 6(第 13 页)还显示,简单相加在 Classic 只有 17.22 / 0.510,低于两种单分支,说明多输入本身并不保证互补。

下表来自原文表 7(第 14 页),时间取 10 轮平均,显存取峰值;不同分辨率行的质量指标不应作为同一难度样本横向排名。

分辨率 形变 时间(s) 峰值显存(GB) mPSNR mSSIM
566 × 800 标准 TPS 0.141 4.81 16.85 0.776
566 × 800 FFD-TPS 0.132 2.76 16.86 0.776
1329 × 2000 标准 TPS 0.202 13.99 17.14 0.475
1329 × 2000 FFD-TPS 0.177 8.57 17.12 0.474
2448 × 3264 标准 TPS 未完成 OOM 未测得 未测得
2448 × 3264 FFD-TPS 0.386 22.62 22.71 0.627

关键发现

  • \(566\times800\) 时 FFD-TPS 将峰值显存从 4.81 GB 降至 2.76 GB;这验证了形变阶段的压缩收益,不等于整个系统所有开销都按同一比例减少。
  • 完整模型的主要精度收益来自可靠的双分支融合及 MR,而高分辨率可运行性来自另一项 FFD-TPS 设计,两类贡献应分开评价。
  • 更好的点匹配和描述子依然有效,说明学到的融合没有消除几何前端质量的重要性。

亮点与洞察

  • 先对点集编码再投影,既保留适合稀疏数据的处理方式,又接上成熟的稠密拼接网络;关键在空间对应,而不是增加一个输入通道。
  • 同时保留单模态专家和联合专家,使融合可以拒绝有害协同;MR 再让这种退路在训练中真正被使用。
  • FFD-TPS 把形变表示的复杂度与输出像素密度区分开,为其他控制点驱动的图像变换提供了可迁移的计算思路,但迁移效果尚未实验验证。

局限与展望

  • 作者没有独立的局限章节;正文承认标准 TPS 的内存瓶颈,所提方案在最高分辨率仍需 22.62 GB,不能据此推断适合低显存设备。
  • 从表 2 看,跨域排名依赖是否进行迭代适配;实际部署还应比较适配次数、额外延迟及失败样本,而不仅比较最终质量。
  • 147 个 Classic 样本的 OOD 测试有价值,但不足以证明对所有极端视差、遮挡、弱纹理和动态场景都稳健,正文也未提供这些因素的完整分层统计。
  • 缓存公式提取损坏、附录缺失及正则符号命名不一致构成复现边界;本文只保留能由正文明确支持的机制,不把自补公式当成作者定义。

相关工作与启发

  • 对比 APAP、SPW、LPC:传统方法直接用点或线约束优化形变,UniStitch 将几何证据编码后参与学习式回归;APAP 的跨域表现提醒我们传统几何仍是强基线。
  • 对比 UDIS++、StabStitch++:继承全局到局部弹性变换及相关训练目标,新增贡献主要在几何表示融合、鲁棒训练和 TPS 求值效率,而不是重新发明整个拼接任务。
  • 对比 RopStitch:后者强化语义先验,UniStitch 显式引入关键点证据;同等适配设置下的对比比混用星号和非星号结果更有解释力。
  • 可延伸方向(读者推断):可研究匹配置信度能否直接校准专家权重,并按模态失效类型评估路由是否合理;本文并未完成这种因果层面的路由分析。

评分

  • 新颖性: 4/5。稀疏几何与稠密语义的表示级融合有明确任务针对性,但点编码器和混合专家本身来自已有技术。
  • 实验充分度: 4/5。覆盖组件、融合、点配置及内存消融,跨域规模和适配成本报告仍有限。
  • 写作质量: 3/5。整体流程清晰,但跨域概括需结合表格条件阅读,正则表述与缓存公式存在复核需求。
  • 价值: 4/5。对图像拼接的表示互补和高分辨率形变实现均有实用启发。