跳转至

Learning Structurally Consistent Representations for Multi-View Radar Semantic Segmentation

会议: ECCV 2026
论文: ECCV 官方页面
领域: 语义分割
关键词: 毫米波雷达语义分割、多视角表征学习、可学习超图、非平衡最优传输、结构一致性

一句话总结

针对毫米波雷达多视角语义分割中点阵稀疏离散、回波多径碎片化以及跨投影视图测量密度不均的瓶颈,HyperRadar 提出利用可学习超图建模同一目标多处回波的高阶关联,并结合非平衡最优传输(UOT)实现松弛质量约束的免对应跨视角特征对齐,在 CARRADA 和 RADIal 基准上分别取得 63.8% 和 83.4% mIoU 的 SOTA 性能。

研究背景与动机

毫米波雷达(FMCW Radar)具备在恶劣天气(如雨、雪、浓雾)、强光眩光以及低照度等复杂环境下的全天候感知能力,因而是自动驾驶鲁棒感知栈的关键传感器。然而,相比于密集规则的相机图像与精确几何测距的激光雷达点云,雷达测量数据呈现高稀疏性、强散斑噪声、多径虚警杂波以及弱语义特征。传统雷达感知大多将 3D RAD(Range-Azimuth-Doppler)张量投影为 2D 网格张量(如 RD、RA、AD 视图),并直接套用标准卷积神经网络(CNN)或成对注意力机制。然而,这类密集网格预测架构隐式假设了局部平滑性与高信息密度,在面对分散破碎的雷达回波时极其脆弱。

这种局限性的核心矛盾在于物理反射特性与网络建模范式的不匹配:在雷达信号形成过程中,同一个物理目标(如一辆汽车)的多处局部反射点通常会跨越多个距离门和角度单元;传统的局部卷积核视野受限,成对图或标准注意力机制仅能建模两两像素关系,无法显式刻画同一实体反射群的高阶结构关联(Higher-order Relational Dependencies)。更棘手的是,当雷达信号投影至不同视角时,由于不同天线孔径积分与物理视角特性的差异,RD 视图中高信噪比的目标能量在 RA 视图中往往会展宽并稀疏化,导致跨视角间存在显著的测量密度不对称与部分可观测性。传统基于平衡质量守恒的最优传输或硬对应几何投影机制在面对雷达杂波与丢失回波时表现极脆。

本文的切入角度是:一方面通过超图建模打破成对局部交互的限制,将属于同一物体的多处雷达反射显式聚集在单条超边上以建立区域级高阶拓扑;另一方面引入非平衡最优传输(Unbalanced Optimal Transport, UOT),通过惩罚边缘分布偏差来容忍视角间的质量不守恒与缺失观测,实现无须显式几何对应的跨视角分布对齐。核心 idea:HyperRadar 框架联合构建了基于可学习超图的视角内高阶关系建模与基于非平衡最优传输的跨视角自适应特征对齐机制,从根本上克服了稀疏碎片化雷达回波的高阶语义缺失与多视角密度失衡痛点。

方法详解

整体框架

HyperRadar 接收雷达传感器在时间窗口 \(T\) 内的 3D 距离-角度-多普勒(RAD)张量,并提取出三种 2D 投影切片:距离-多普勒(Range-Doppler, RD)、距离-角度(Range-Azimuth, RA)以及角度-多普勒(Angle-Doppler, AD)。针对每个视角,独立的骨干编码器首先将其映射为紧凑的潜在特征 Token;随后通过视角内可学习超图(Learnable Hypergraph)对破碎的单点测量进行多对一的高阶结构汇聚与上下文重构;接着,针对 RD 与 RA 等监督输出分支,利用非平衡最优传输(UOT)求解各视角 Token 分布间的可微松弛传输计划,自适应拉取异构视角间的互补特征;最后,多视角融合特征送入自适应通道注意力(Adaptive Attention)完成级联去噪与加权,由轻量解码器直接预测各视角的密集语义分割掩码。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入雷达多投影视图<br/>(RD / RA / AD 2D 张量)"] --> B["视角独立编码器<br/>提取潜在特征 Token"]
    B --> C["可学习超图特征精化<br/>构建软关联关联矩阵并聚合高阶上下文"]
    C --> D["非平衡最优传输跨视角对齐<br/>Sinkhorn 求解松弛质量传输计划并融合"]
    D --> E["自适应注意力加权与解码<br/>级联通道门控降噪并输出预测掩码"]
    E --> F["联合一致性正则化与损失反传<br/>Dice + CE + 共享距离轴一致性约束"]

关键设计

1. 可学习超图特征精化:突破成对连接的高阶物体级结构建模

传统图神经网络或成对自注意力机制只能表达两个测量节点间的边连接,而雷达扩展目标(如车体、骑行者)在距离和多普勒维度上激发的强反射峰往往是簇状分布的一组回波。为了显式捕获这种群组相关性,作者为每个视角 \(v \in \{\text{RD}, \text{RA}, \text{AD}\}\) 构建超图 \(\mathcal{G}^{(v)} = (\mathcal{V}, \mathcal{E}^{(v)})\),包含 \(N_v\) 个潜在节点 Token \(X^{(v)} \in \mathbb{R}^{N_v \times C}\) 与 \(M\) 条可学习超边。模型放弃预设的固定空间邻域,而是通过投影权重矩阵 \(W_h \in \mathbb{R}^{C \times M}\) 计算可微的软关联关联矩阵(Soft Incidence Matrix):

\[H^{(v)} = \text{softmax}(X^{(v)} W_h) \in \mathbb{R}^{N_v \times M}\]

其中 softmax 沿超边维度归一化,使得每个雷达反射点自适应地将其隶属度分配到多条潜在语义超边中。随后,超边通过加权汇聚收集全图节点特征 \(Z^{(v)} = (H^{(v)})^\top X^{(v)}\),由双层轻量非线性映射 \(\phi(\cdot)\) 进行高阶特征提取,再通过关联矩阵转置投影回节点空间,形成残差增强结构:

\[X_{\text{hg}}^{(v)} = X^{(v)} + \gamma H^{(v)} \phi\left((H^{(v)})^\top X^{(v)}\right)\]

其中 \(\gamma\) 为可学习缩放标量。该机制使得属于同一目标的离散回波即便在空间上被杂波隔开,也能在同一超边内完成全局上下文信息互通,极大提升了模型在稀疏碎片化特征下的聚类与判别能力。

2. 非平衡最优传输跨视角对齐:容忍质量失衡的免对应特征融合

多视角雷达信号在物理上存在本质的能量分布差异。例如雷达硬件接收阵列在生成 RD 视图时会对天线孔径做完整积分,目标呈现尖锐致密的能量峰(通常仅占约 3 个网格);而在 RA 视图中,由于有限的角分辨率与旁瓣展宽效应,同一辆车的目标能量会横跨 15 个以上的网格单元。传统平衡最优传输(Balanced OT)强行要求输入输出边缘质量严格守恒,极易导致弱观测视角受到噪声过拟合或强行产生虚假对应。为此,HyperRadar 引入带熵正则化的非平衡最优传输(UOT),在 Wasserstein 距离基础上显式引入 Kullback-Leibler(KL)散度作为边缘违规惩罚项:

\[\mathcal{T}^{(p,q)} = \arg\min_{T \ge 0} \langle T, C^{(p,q)} \rangle + \tau \text{KL}(T \mathbf{1} \,\|\, a) + \tau \text{KL}(T^\top \mathbf{1} \,\|\, b) + \varepsilon \sum_{i,j} T_{ij} (\log T_{ij} - 1)\]

其中传输代价矩阵 \(C_{ij}^{(p,q)} = \|x_i^{(p)} - x_j^{(q)}\|_2^2\) 由各视角的超图增强特征计算,\(\tau\) 为边缘松弛惩罚超参数,\(\varepsilon\) 为熵平滑因子,\(a\) 与 \(b\) 为均匀先验参考分布。借助可微广义 Sinkhorn 算法经过 30 步迭代高效求解最优传输矩阵 \(\mathcal{T}^{(p,q)}\),模型能够自适应调整两视图的有效质量,自动过滤孤立杂波并在不要求显式几何校准的情况下,将视角 \(q\) 的补全特征精准拉取到视角 \(p\):

\[\widehat{X}^{(p \leftarrow q)} = \mathcal{T}^{(p,q)} X_{\text{hg}}^{(q)}, \qquad X_{\text{fused}}^{(p)} = X_{\text{hg}}^{(p)} + \sum_{q \in \mathcal{N}(p)} \beta_{p,q} \widehat{X}^{(p \leftarrow q)}\]

3. 自适应通道注意力与跨视角一致性正则化:抗噪门控与共享几何约束

经 UOT 融合后的潜在 Token 仍可能受到雷达瞬时杂波残余的干扰。为了进一步凸显富含语义的强回波并抑制各视角背景空域,HyperRadar 在解码器前置了级联自适应注意力机制(Adaptive Attention)。该模块通过全局平均池化提取视角全局语义描述子 \(g^{(p)} \in \mathbb{R}^C\),并经由轻量级多层感知网络 \(\psi(\cdot)\) 动态计算出通道注意力门控权重,以特征广播方式实现跨通道的特征自适应调制:\(\widetilde{X}^{(p)} = \psi(g^{(p)}) \odot X_{\text{fused}}^{(p)}\)。在最终部署配置中,采用 8 组级联注意力块,实现对弱小目标信号的渐进式信噪比增强。

在损失监督方面,为了拉紧 RD 与 RA 之间共同享有的距离轴(Range Axis)几何逻辑,模型在常规交叉熵与 Soft Dice 分割损失之外,设计了距离轮廓对齐正则项。通过分别对 RA 的方位角维度求最大响应以及对 RD 的多普勒维度求最大响应并进行 180° 方向矫正,提取出两视角的一维距离置信轮廓 \(Q^{(\text{RA})}\) 与 \(Q^{(\text{RD})}\),随后采用 \(L_2\) 范数一致性损失 \(\mathcal{L}_{\text{coh}}\) 与平滑 Huber 损失 \(\mathcal{L}_{\text{mv}}\) 进行约束:

\[\mathcal{L}_{\text{coh}} = \| Q^{(\text{RD})} - Q^{(\text{RA})} \|_2^2, \qquad \mathcal{L}_{\text{mv}} = \text{Huber}\left(Q^{(\text{RD})}, Q^{(\text{RA})}\right)\]

这确保了两分支预测在物理空间距离门上保持严格的拓扑一致性,杜绝单重视角在遮挡或噪声扰动下产生离群虚警。

实验关键数据

主实验

论文在公开车载雷达语义分割标准基准 CARRADA(多类别、多视角)和高分辨率基准 RADIal(单视角、结合检测)上进行了全面评测。在 CARRADA 测试集上,HyperRadar 全面超越了先前最佳雷达分割方法 TransRadar、PeakConv 和 TMVA-Net,尤其在稀疏细小目标(行人、骑行者)上取得了极其明显的性能提升。

评估视图 模型方法 背景 IoU (%) 行人 IoU (%) 骑行者 IoU (%) 汽车 IoU (%) 全局 mIoU (%) 全局 mDice (%)
RD 视图 U-Net (MICCAI'15) 99.7 51.1 33.4 37.7 55.4 68.0
RAMP-CNN (IEEE Sensors'20) 99.7 48.8 23.2 54.7 56.6 68.5
TMVA-Net (IEEE TIV'21) 99.7 52.6 29.0 53.4 58.7 70.9
PeakConv (IEEE TIV'23) - - - - 60.7 72.5
TransRadar (WACV'24) 99.7 56.7 30.2 61.7 62.1 73.4
HyperRadar (本文) 99.7 59.2 32.4 63.8 63.8 75.2
RA 视图 U-Net (MICCAI'15) 99.8 22.4 8.8 0.0 32.8 40.9
TMVA-Net (IEEE TIV'21) 99.8 26.0 8.6 30.7 41.3 51.0
PeakConv (IEEE TIV'23) - - - - 42.9 53.3
TransRadar (WACV'24) 99.9 29.9 6.5 35.3 42.9 52.6
HyperRadar (本文) 99.9 31.8 8.4 37.5 44.4 54.3

在 RADIal 高分辨率雷达数据集上,将 HyperRadar 骨干网络集成到 FFTRadNet 架构中,同样在目标检测与语义分割双重任务上刷新了 SOTA 表现:

骨干模型 检测 AP (%) ↑ 检测 AR (%) ↑ 距离误差 R (m) ↓ 角度误差 A (°) ↓ 分割 mIoU (%) ↑
FFTRadNet 96.8 82.2 0.11 0.17 74.0
C-M DNN 96.9 83.5 - - 80.4
TransRadar 97.3 98.4 0.11 0.10 81.1
HyperRadar (本文) 98.5 98.9 0.10 0.08 83.4

消融实验

在 CARRADA 数据集上针对各核心模块(超图 HG、非平衡最优传输 UOT、自适应注意力 Attn)的逐步消融分析,以及 UOT 关键松弛超参数 \(\tau\) 和熵参数 \(\varepsilon\) 的敏感性测试结果如下:

配置编号 超图 (HG) 非平衡传输 (UOT) 自适应注意力 (Attn) RD mIoU (%) RA mIoU (%) 平均 mIoU (%) 说明与增益
Baseline - - ✓ 62.1 42.9 52.5 纯注意力基线
w/ UOT only - ✓ - 61.7 42.2 52.0 仅非平衡最优传输
w/ UOT + Attn - ✓ ✓ 62.4 43.1 52.8 跨视角 UOT 对齐
w/ HG only ✓ - - 61.9 42.4 52.2 仅超图结构建模
w/ HG + Attn ✓ - ✓ 62.5 43.3 52.9 单视角超图精化
w/ HG + UOT ✓ ✓ - 63.0 43.7 53.4 缺失注意力滤波
Full Model ✓ ✓ ✓ 63.8 44.4 54.1 完整模型 (+1.6% Avg)

在 UOT 超参数敏度方面,当 \(\tau \in \{0.5, 0.8, 1.0\}\) 以及 \(\varepsilon \in \{0.01, 0.05, 0.10\}\) 范围内波动时,平均 mIoU 始终稳定维持在 53.6% 至 54.1% 之间,训练过程无任何梯度或数值发散;此外,当超边数设定在 \(M=8\) 左右时性能趋于平稳,说明框架对超参数具备优良的抗扰动鲁棒性。

关键发现

  • 两模块协同增益明显:单独加入超图(+0.4% Avg)提升了视角内局部碎片回波的语义聚类;单独加入 UOT(+0.3% Avg)解决了跨视角能量不守恒对齐问题;两者联合使用时带来了高达 +1.6% Avg mIoU 的叠加突破,说明“视角内高阶几何建模”与“跨视角非平衡分布对齐”形成了强有力的正交互补。
  • 细粒度与弱回波收益最大:在 CARRADA 极其严苛的 RA 视图下,弱小运动目标“骑行者”的 IoU 从 TransRadar 的 6.5% 跃升到 8.4%(相对提升达 29.2%),这充分印证了超图与 UOT 能从极低信噪比与稀疏多径中有效找回物体拓扑。
  • 推理效率不降反升:相较于强基线 TransRadar(1138.57 GFLOPs、3.25 GB 显存占用、9.60 FPS),HyperRadar 仅需 1132.13 GFLOPs 计算量与 3.18 GB 显存,推理速度逆势提高至 10.55 FPS,打破了复杂图结构建模必定显著拖慢计算的固有认知。

亮点与洞察

  • 将物理反射机理数学化转化为超图与 UOT 范式:作者洞悉了车载雷达天线孔径积分造成的 RD 与 RA 能量“致密-展宽”天然质量不平衡,创造性地用非平衡最优传输替代传统刚性对齐,立意极其深刻且直击雷达物理本质。
  • 轻量残差超图架构的高阶表达力:通过仅包含 \(M=8\) 条可学习超边的紧凑设计,避免了稠密图计算的巨大显存开销,用简单的软投影与残差映射实现了非局部多点反射的“群组聚合”。
  • 跨模态与跨视角任务的可迁移性:该套超图高阶建模搭配 UOT 松弛分布对齐的范式,天然契合所有存在测量不对称与严重丢包特性的传感器场景,例如多雷达拼图、事件相机与红外热成像多视角融合等。

局限与展望

  • 2D 投影切片丢失 3D 耦合细节:当前模型基于 2D RA/RD/AD 降维切片建模,虽然获得了极佳的计算与推理时延表现,但不可避免地剥离了 3D RAD 张量中原始的联立多普勒相位几何约束。
  • 跨视角物理约束仅限于共享 Range 轴:目前的几何一致性正则化仅在 RD 与 RA 共享的距离维上建立极值轮廓惩罚,缺乏全视角显式逆投影以及更长时序轨迹上的多拍时空平滑约束。
  • 多传感器与多任务拓展空间:未来工作可进一步探索层次化稀疏超图结构以直接处理原始 3D RAD 信号,并将 UOT 对齐扩展到 Radar-Camera、Radar-LiDAR 等异构多模态端到端融合建图与目标跟踪任务中。

相关工作与启发

  • vs TMVA-Net (IEEE TIV 2021):TMVA-Net 依靠传统 2D 卷积和多视角特征拼接与成对交互,容易受雷达虚警与局部断裂干扰;HyperRadar 引入超图建模高阶依赖,并使用 UOT 替代普通拼接,在 CARRADA RD/RA 上分别实现 +5.1% 与 +3.1% mIoU 的巨大领先。
  • vs TransRadar (WACV 2024):TransRadar 引入方向自适应 Transformer 建模长距离依赖,但成对注意力在面对视角间测量密度不对称时鲁棒性不足;HyperRadar 借助 UOT 允许质量松弛,在显著提升性能(RD +1.7%、RA +1.5%、RADIal +2.3% mIoU)的同时减少了计算量并提高了推理帧率。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 巧妙结合雷达物理散射规律,首创超图高阶聚合与非平衡最优传输跨视角对齐机制。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 CARRADA 与 RADIal 两个核心基准,提供了详尽的类目指标、组件消融、UOT 超参敏感度及运行开销对比。
  • 写作质量: ⭐⭐⭐⭐⭐ 物理问题剖析深刻,数学建模严谨清晰,实验论证条理分明。
  • 价值: ⭐⭐⭐⭐⭐ 为稀疏恶劣天气雷达感知以及多源异构非对称传感器特征融合提供了非常优雅的理论与工程范本。