跳转至

iSyncTab: Learning Cross-Modal Feature Sequencing for Image-Tabular Data via Neural Synchrony

会议: ECCV 2026
论文: ECCV 2026
代码: https://github.com/zadid6pretam/iSyncTab
领域: 多模态 VLM
关键词: 神经同步, 图像-表格多模态学习, 跨模态特征排序, 神经AI, 内存增强Transformer

一句话总结

针对图像-表格多模态融合中特征无序导致自注意力优化失稳的痛点,本文提出 iSyncTab,利用神经同步机制计算能量与相位相干性完成跨模态特征聚类匹配与排序约束,并结合线性复杂度的内存增强 Transformer,在 6 个多模态基准上取得最优分类性能与轻量推理开销。

研究背景与动机

图像与结构化表格数据的多模态联合建模在智慧医疗、自动驾驶和科学计算等实际业务中具有核心价值。然而,不同于文本和像素天然具备固定的序列拓扑或二维网格空间先验,表格特征列本身不存在先验有序性。现有主流的多模态融合范式(如 STiL、TIP、MMCL 等)通常将图像与表格各自提纯后的表征进行简单扁平化拼接,随后直接送入自注意力层或跨模态交叉注意力模块。这导致模型被迫在任意随机的特征排列上学习依赖关系,掩盖了模态之间的精细对应模式,且自注意力运算对无序特征序列的离散度极度敏感,训练过程易受干扰且效率低下。

这种失败的核心矛盾在于:基于自注意力和前馈混合的序列感知算子对输入特征的相对位置和排列极为敏感,但多模态拼接特征的离散度与异构跨模态语义鸿沟缺乏有效结构先验的规整。现有的排列不变设计(如深度集合算子或集合重构)忽略了特征列依赖顺序对网络冗余暴露的积极影响;而传统单模态属性排序策略往往依赖低效的全排列搜索或启发式单变量打分,无法在多模态联合空间中建模视觉与表格特征的结构协调性。

本文的切入角度是引入神经认知科学中的“相干通信(Communication Through Coherence, CTC)”假说:大脑不同皮层之间通过神经振荡的相位匹配与能量平衡实现高带宽、低耗损的信息绑定。核心 idea:将多模态特征排序建模为列排列问题(Column Permutation Problem, CPP),通过神经同步机制对齐跨模态特征聚类的能量与相位相干性并利用匈牙利算法求解局部序列,驱动具有顺序一致性正则的内存增强 Transformer 进行高效融合。

方法详解

整体框架

iSyncTab 的端到端流水线包含模态独立编码、神经同步引导的配对特征排序(NS-PFS)以及顺序感知内存增强 Transformer(OMT)三大阶段。首先,视觉分支使用 ResNet-50 提取图像表征,表格分支采用专用 Transformer 编码器提纯结构化属性表征。随后,NS-PFS 对两模态的转置特征矩阵进行谱聚类,计算能量与相位同步矩阵并通过匈牙利算法求解最优二分图匹配,在模态对齐的联合聚类上局部最小化特征离散度生成全局最优排列 \(\pi_{\mathrm{NS-PFS}}\)。最后,排好序的多模态特征序列附加可学习的全局内存读出标记,送入具有线性时间复杂度的 Linformer 架构中,联合多分类交叉熵与特征排序一致性辅助损失进行端到端优化。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["图像与表格多模态输入<br/>X_vis ∈ R^{N×d_vis}, X_tab ∈ R^{N×d_tab}"] --> B["跨模态特征聚类与能量计算<br/>转置矩阵聚类得到 {I_a} 与 {T_b}"]
    B --> C["神经同步配对特征排序 (NS-PFS)<br/>能量-相位同步矩阵 + 匈牙利二分匹配"]
    C --> D["局部离散度最小化与全局排列拼接<br/>求解各联合簇 J_{(r)} 生成最优排列 π"]
    D --> E["顺序感知内存增强 Transformer (OMT)<br/>拼接可学习内存标记 T_mem + Linformer 线性编码"]
    E --> F["联合多任务监督输出<br/>分类交叉熵损失 + 排序预测一致性损失 L_FS"]

关键设计

1. 神经同步引导的配对特征排序(NS-PFS):跨模态聚类二分匹配消除特征空间离散度 为了消除随机特征拼接引入的高维离散度和异构特征干扰,NS-PFS 将特征排序建模为广义列排列问题(CPP)。传统算法直接对 \(m = d_{\mathrm{vis}} + d_{\mathrm{tab}}\) 维特征做全局组合优化面临 \(\mathcal{O}(m!)\) 组合爆炸。NS-PFS 将样本特征转置矩阵 \(G_{\mathrm{vis}} = X_{\mathrm{vis}}^\top \in \mathbb{R}^{d_{\mathrm{vis}} \times N}\) 和 \(G_{\mathrm{tab}} = X_{\mathrm{tab}}^\top \in \mathbb{R}^{d_{\mathrm{tab}} \times N}\) 分别聚类为 \(k_I\) 个视觉簇 \(\{I_1, \ldots, I_{k_I}\}\) 与 \(k_T\) 个表格簇 \(\{T_1, \ldots, T_{k_T}\}\)。对每个簇 \(C\),定义其在度量指标 \(M(\cdot)\)(如 KL 散度、方差、余弦相似度等)下的累积能量 \(\xi_C\) 与质心嵌入 \(\mu_C\): $\(\xi_C = \sum_{f \in C} M(f), \quad \mu_C = \frac{1}{|C|} \sum_{f \in C} \phi(f)\)$ 随后基于神经科学 CTC 理论,通过能量相干项 \(E_{ab} = 1 - \frac{|\xi_{I_a} - \xi_{T_b}|}{\xi_{I_a} + \xi_{T_b} + \epsilon}\) 与相位类比质心余弦相似度 \(S_{ab} = \frac{\langle \mu_{I_a}, \mu_{T_b} \rangle}{\|\mu_{I_a}\| \|\mu_{T_b}\|}\) 定义双模态同步分数 \(\Psi_{ab} = E_{ab} S_{ab}\)。通过匈牙利算法在 \(\mathcal{O}(K^3)\) 复杂度下求解完全二分图的最大权匹配 \(P^\star\),将对应簇合并为联合簇 \(J_{(a,b)} = I_a \cup T_b\)。该设计有效将跨模态语义关联强、振荡能量匹配的特征绑定到同一几何子空间中,规避了暴力全排列的计算陷阱。

2. 神经调节机制驱动的局部有序约束与全局拼接:分级调制与长程上下文协调 在完成视觉-表格簇二分匹配后,联合簇的重要性与耦合强度并非均质。NS-PFS 引入基于能量和相干阈值 \((\tau_L, \tau_H)\) 的四级状态调制 \(\rho_{ab} \in \{\mathrm{HH}, \mathrm{HL}, \mathrm{LH}, \mathrm{LL}\}\),分别对应生物神经网络中的高频伽马绑定同步(HH)、自上而下前馈/反馈调制(HL/LH)与大尺度背景相干(LL)。根据调制权重 \(\gamma(\rho_{ab}, \Psi_{ab})\),对每个联合簇 \(J_{(r)}\) 稀疏化边集 \(\mathcal{E}_{J_{(r)}}\) 内的特征对计算加权离散度: $\(\pi^\star_{J_{(r)}} = \arg\min_{\pi} \sum_{(u,v) \in \mathcal{E}_{J_{(r)}}} \gamma(\rho_{b_r}, \Psi_{a_r b_r}) |M(f_u) - M(f_v)| |\pi(u) - \pi(v)|\)$ 各局部簇按归一化能量重要度 \(\alpha_{J_{(r)}}\) 降序排列,依次串联拼接构成全局排列 \(\pi_{\mathrm{NS-PFS}} = [\pi^\star_{J_{(1)}} \parallel \ldots \parallel \pi^\star_{J_{(R)}}]\)。该设计保证高同步、高辨识度的核心特征优先排列聚集,显著降低 Transformer 注意力图的熵值。

3. 顺序感知内存增强 Transformer(OMT):全局记忆读出与辅助顺序一致性约束 排好序的多模态特征序列被映射为 \(L = n_{\mathrm{tab}} + n_{\mathrm{vis}}\) 个特征 token。标准自注意力计算复杂度随序列长度呈二次方增长 \(\mathcal{O}(L^2)\)。OMT 首先在特征 token 序列前端拼接触发机制的 \(n_{\mathrm{mem}}\) 个可学习连续内存标记 \(C_{\mathrm{mem}} \in \mathbb{R}^{n_{\mathrm{mem}} \times d_h}\),并利用 Linformer 线性投影注意力将计算复杂度降至 \(\mathcal{O}(L \cdot r_{\mathrm{LF}})\)。编码输出后,内存标记聚合状态 \(h = \frac{1}{n_{\mathrm{mem}}} \sum_{\ell=1}^{n_{\mathrm{mem}}} H_{\mathrm{mem},\ell}\) 直接作为整图全局表征喂入分类器,而数据标记序列 \(H_\pi\) 则接入辅助排序预测头,预测每个位置的归一化相对位置目标 \(\beta_{\pi,\ell} = \frac{\ell - 1}{L - 1}\)。全局目标函数联合两项损失: $\(\mathcal{L}_{\mathrm{total}} = \mathcal{L}_{\mathrm{CE}}(y, \hat{\mathbf{y}}) + \lambda_{\mathrm{FS}} \frac{1}{BL} \sum_{i=1}^B \sum_{\ell=1}^L (q_{i\ell} - \beta_{\pi,\ell})^2\)$ 辅助排序损失 \(\mathcal{L}_{\mathrm{FS}}\) 显式约束模型在潜空间中牢记特征的相干拓扑顺序,避免自注意力层退化或遗忘排序归纳偏置。

实验关键数据

主实验

在 6 个标准图像-表格基准数据集(DVM、HAM10000、DeepLesion、Pokémon、CheXpert、PetFinder)上,iSyncTab 与树模型、单模态自监督模型及前沿多模态融合 SOTA 方法进行了系统对比。

模型 模态 (I/T) DVM (%) HAM (%) DLes (%) Pok (%) CheX (%) Pet (%) 平均排名 (Avg. Rank ↓) 平均遗憾 (Avg. Regret ↓)
LGBM T 26.89 71.80 76.71 36.10 52.25 39.70 8.67 ± 3.14 36.66 ± 21.12
CatBoost T 27.30 72.05 77.18 36.59 53.19 39.40 7.67 ± 2.69 35.35 ± 21.20
TabSeq T 26.66 70.14 83.46 15.61 51.10 37.33 11.08 ± 4.25 41.46 ± 25.81
ResNet50 I 32.07 82.13 69.17 31.22 48.35 35.52 10.25 ± 3.16 39.10 ± 21.92
ViT I 88.00 82.33 69.17 35.61 48.70 34.94 8.58 ± 3.83 29.05 ± 18.93
DAFT I+T 74.22 74.88 77.07 18.05 67.75 45.45 7.42 ± 2.71 29.27 ± 19.86
Interact Fuse I+T 78.58 84.87 70.68 11.71 50.90 52.44 8.33 ± 4.71 30.65 ± 22.37
MMCL I+T 85.79 70.09 67.34 38.05 49.00 29.72 10.67 ± 5.19 27.75 ± 16.03
TIP I+T 98.27 70.39 69.17 37.56 87.50 83.86 6.00 ± 4.07 10.08 ± 8.09
STiL I+T 99.27 78.48 81.35 27.32 88.60 87.68 4.42 ± 2.83 11.73 ± 20.49
iSyncTab (本文) I+T 99.60 86.82 85.63 42.44 88.60 88.02 1.08 ± 0.19 0.00 ± 0.00

消融实验

在 DVM 和 HAM10000 上针对核心模块(内存标记、特征排序、辅助排序损失、骨干网络)进行消融分析:

配置 / 变体 DVM (未调优) DVM (调优) HAM (未调优) HAM (调优) 关键观察与机制解析
完整模型 (ResNet50 + NS-PFS + OMT) 99.80 99.60 78.72 86.82 完整结合神经同步排序与内存读出,效果最佳
换用骨干 (ResNeXt-50 + NS-PFS + OMT) 99.10 97.90 78.14 84.28 堆叠更大参数量视觉骨干未见增益,表明增益来自排序机制
去掉特征排序辅助损失 (w/o sequencing loss) 97.80 98.70 78.06 84.36 缺少排序监督导致潜在特征位置漂移,HAM 下跌 2.46%
去掉内存标记 (w/o memory tokens) 92.68 87.60 77.90 80.12 缺少全局压缩读出标记,DVM 调优后暴跌 12.00%
去掉特征排序模块 (w/o feature sequencing) 96.80 96.50 78.16 78.60 退化为普通未排序拼接,HAM 性能大幅下跌 8.22%
随机列重排 (w/ random column shuffle) 86.72 82.31 62.06 62.16 强行破坏特征邻近结构,HAM 性能断崖式下跌 24.66%
简单拼接基线 (Concat Fuse 无排序无内存) 96.50 96.20 76.58 78.42 基准朴素拼接对比,显著弱于 iSyncTab 完整设计

关键发现

  • 特征排序的质量对序列感知模型至关重要:完全随机的列重排使得 HAM 准确率直接崩塌至 62.16%(暴跌 24.66%),证明 Transformer 并非天然具备无序不变鲁棒性,合理的特征排列是极其关键的归纳偏置。
  • 内存标记(Memory Tokens)发挥全局信息压缩池作用:在 DVM 数据集上去除内存标记后准确率从 99.60% 降至 87.60%,说明在长多模态 token 输入下,直接均值池化易导致特征互相稀释。
  • 极佳的计算与资源效率:基于 Linformer 的 \(\mathcal{O}(L)\) 复杂度与聚类级匹配,iSyncTab 相比全自注意力基准节省了约 30%-40% 的推理显存和运行时间,在 DVM 的准确率-综合复杂度 Pareto 前沿上名列榜首。

亮点与洞察

  • 跨学科机制迁移:借鉴神经科学中的“相干通信(CTC)”理论,将相位和能量同步巧妙映射为特征聚类的方向相似性与能量匹配度,赋予了黑盒特征配对扎实的神经科学理论可解释性。
  • 分层二分图优化规避组合爆炸:放弃暴力特征级全排列搜索,先聚类为 \(k_I, k_T \le 15\) 的代表元进行匈牙利多项式匹配,再在局部块内快速降维排序,兼顾了理论严谨性与工业级计算效率。
  • 序列归纳偏置的新范式:证明了即使是在多模态领域,对于原本无拓扑结构的异构表征,人为诱导符合能量-几何相干的“有序化”能大幅降低自注意力学习成本,可直接迁移至语音-文本、时序-图谱等多源异构融合任务。

局限与展望

  • 聚类粒度与超参数敏感度依赖:聚类中心数 \(k_I, k_T\) 以及阈值 \((\tau_L, \tau_H)\) 仍需人工设定或网格搜索,缺乏动态数据驱动自适应确定聚类数量的机制。
  • 模态对齐受限于静态特征工程:当前排序仅在预提取或冻结的离散特征步执行,尚未将特征重排算子做成可微分端到端反向传播的连续松弛层。
  • 后续可探索将连续松弛排序算法(如 Gumbel-Sinkhorn)与本框架结合,实现聚类、排序与 Transformer 的全可微联合训练。

相关工作与启发

  • vs STiL & TIP: STiL 采用半监督分层交叉注意力,TIP 依赖自监督遮蔽与对比学习,二者均将多模态特征视为无序向量。iSyncTab 通过 NS-PFS 显式引入特征序列的结构相干偏置,在更轻量的骨干下全面胜出(平均排名 1.08 vs 4.42 / 6.00)。
  • vs COPER: COPER 探索了排列驱动的相关性用于无监督多视角聚类,而 iSyncTab 针对监督分类任务构建了神经同步局部 CPP 优化与内存增强 Transformer,端到端解决复杂判别问题。
  • vs TabSeq & Mambular: 单模态表格模型证明了列排序对自回归或状态空间模型的影响,iSyncTab 首次将该理念跨越并拓展至异构图像-表格联合建模领域。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 巧妙结合神经同步(CTC)与组合列排序(CPP),视角独树一帜。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 6 个多模态基准、噪声鲁棒性分析、效率 Pareto 前沿分析及音频-视频扩展。
  • 写作质量: ⭐⭐⭐⭐⭐ 逻辑严谨,数学公式与生物学机制映射清晰,实验分析详实到位。
  • 价值: ⭐⭐⭐⭐⭐ 为图像-表格多模态乃至更广泛的异构多模态融合提供了崭新的序列化建模范式。