RiO-DETR: DETR for Real-time Oriented Object Detection¶
会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/RicePasteM/RiO-DETR
领域: 目标检测
关键词: 旋转目标检测, 实时目标检测, Detection Transformer, 遥感图像目标检测, 正交注意力
一句话总结¶
针对传统旋转检测 Transformer 推理延迟高、几何与语义耦合导致角度学习不稳定的问题,RiO-DETR 通过几何解耦查询编码、旋转校正正交注意力、解耦周期性精炼与定向密集单对单训练,首次在 DETR 框架下实现了兼顾超低延迟(2.7~29.9 ms)与高精度(DOTA-1.0 78.4%~81.8% AP50)的端到端实时旋转目标检测。
研究背景与动机¶
旋转目标检测(Oriented Object Detection, OBB)将水平边界框扩展为带任意旋转角度的包围盒,在航空航天遥感、无人机巡检和场景文本检测中扮演着核心角色。近年来边缘计算与低空经济对检测算法提出了严苛的实时性要求,促使学术界从单纯追求检测精度转向精度与推理吞吐量的平衡。在 CNN 体系中,以旋转版 YOLO(如 YOLO26-obb)和 RTMDet-R 为代表的单阶段检测器已建立了强劲的工业级基线;而在水平框检测领域,RT-DETR 及其衍生架构也凭借轻量级混合编码器与端到端无 NMS 特性打破了 YOLO 的垄断。然而,面向旋转框的 Detection Transformer 依然深陷“重型结构、高延迟、难以落地”的困境,主流方案如 ARS-DETR、Oriented-DETR 和 RHINO-DETR 推理延迟普遍在 150~300 ms 之间。
深入探究 DETR 迁移至旋转框后的核心瓶颈,会发现这一性能落差并非简单的模型容量不足,而是根植于 OBB 任务本身的几何特性与传统 DETR 机制之间的系统性失配。首先是语义与几何的过度耦合及特征坍缩:传统旋转 DETR 习惯将 5 维元组 \((cx, cy, w, h, \theta)\) 整体送入位置查询编码,然而角度 \(\theta\) 在几何上具有多解性与周期性(如长边定义或车头朝向往往由外观纹理而非纯几何决定),强行将未收敛的 \(\theta\) 作为刚性位置先验会严重误导注意力的空间采样;同时,所有注意力头单一沿长轴采样容易忽略侧向上下文,引发特征坍缩。其次是角度精炼中的周期性失配:标准 DETR 解码器在逆 Sigmoid 空间中沿欧氏度量迭代加减偏移量,但角度 \(\theta\) 位于周期拓扑流形上,边界处(如 \(0 \leftrightarrow \pi\))的阶跃跳变会导致梯度剧烈震荡。最后是搜索空间倍增引起的收敛迟缓:旋转自由度的引入大幅扩展了二分匹配的空间复杂度,现有的密集监督策略缺乏角度维度的扰动多样性,无法有效加速角度回归。
为了从根本上消除上述架构瓶颈,本文摒弃了“在传统检测头外挂角度分支或暴力增加计算量”的妥协思路,提出了专为旋转检测量身定制的实时端到端框架 RiO-DETR。核心 idea:将角度预测从位置查询中显式解耦并交由语义内容特征驱动,配合正交注意力双向采样、由粗到细的有界周期更新机制以及注入旋转多样性的定向密集监督,彻底打通 DETR 范式在实时旋转目标检测中的精度与速度瓶颈。
方法详解¶
整体框架¶
RiO-DETR 构建于高效的混合编码器与单层/多层精炼解码器之上。输入航空遥感大图后,骨干网络(HGNetv2 家族)提取多尺度特征,并通过轻量级混合编码器进行跨尺度特征交互。解码阶段,物体查询(Object Queries)被显式拆解为位置查询和内容查询;位置查询仅对 4 维空间坐标 \((cx, cy, w, h)\) 生成位置编码,保持旋转不变性,而将角度信息隐藏在内容特征中进行语义推断。在多头可变形注意力层中,注意力头被对称划分为轴向与横向两组正交采样点,全方位捕捉目标的几何轮廓。随后,解码器通过解耦周期性精炼模块完成由粗到细的逐层角度修正,并在训练期结合定向密集单对单策略(Oriented Dense O2O)大幅加速角度分支收敛。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["输入遥感图像"] --> B["HGNetv2 骨干网络与混合编码器"]
B --> C["几何解耦查询编码<br/>位置查询仅编码 (cx, cy, w, h)"]
C --> D["旋转校正正交注意力<br/>主轴头 (θ) 与正交侧向头 (θ + π/2)"]
D --> E["解耦周期性精炼<br/>Tanh 有界逐层衰减与周期归一化"]
E --> F["定向密集单对单训练<br/>四象限独立旋转构建多样化监督"]
F --> G["无 NMS 端到端输出 (cx, cy, w, h, θ, 类得分)"]
关键设计¶
1. 几何解耦查询编码:解除刚性角度先验对注意力采样的误导
传统旋转 DETR 盲目将空间位置与旋转角度混合编码为 5 维位置查询,但旋转框在物理上存在等价参数化(例如 \((w, h, \theta)\) 与 \((h, w, (\theta + \pi/2) \bmod \pi)\) 指向同一矩形),且角度边界存在歧义。在网络训练初期,未成熟且充满噪声的参考角度 \(\theta_{ref}\) 一旦被注入位置查询,会作为刚性几何先验强制扭曲自注意力与交叉注意力的基准网格,干扰空间定位。为此,RiO-DETR 显式剥离角度信息,参考点 \(p_{ref} \in \mathbb{R}^{N \times 5}\) 仅截取前 4 维空间尺度生成位置编码:
使得位置查询 \(Q_{pos}\) 保持纯粹的旋转不变性,专门负责物体中心与尺度的粗定位;而物体的朝向与角度线索则完全交由内容查询 \(Q_{content}\) 结合视觉特征中的纹理流向、部件对称性及长宽分布隐式学习。这种语义驱动的角度推断从根本上避免了早期角度噪声对注意力几何采样的污染。
2. 旋转校正正交注意力:主轴与侧向双向采样消除特征坍缩
虽然将角度与位置编码解耦能够稳定收敛,但若采样点依然仅沿物体预测的主轴(长边)对齐,多头注意力将过度聚焦于纵向狭长区域,丢失边缘、轮廓短边及机翼/船舶两侧关键构件的侧向上下文,引发严重的特征坍缩。为兼顾几何对齐与全方位特征感知,RiO-DETR 提出了零额外计算开销的旋转校正正交注意力机制。假设多头可变形注意力包含偶数个注意力头 \(H\),模型将所有头均分为两组,分别沿预测航向角与正交垂直角进行特征采样:
对于第 \(q\) 个查询的第 \(k\) 个采样点,其学得的偏移量 \(\Delta p_{qk}\) 经尺度因子 \(s_q\) 缩放后,由对应头的旋转矩阵 \(R(\theta(h))\) 校正得到实际采样坐标:
前一半注意力头专门抓取目标主轴方向的连续纹理,后一半头则精准测量垂直方向的宽度与侧向边界,实现了长宽比与朝向信息的正交解耦,极大地提升了极大长宽比目标(如桥梁、港口货轮)的检测稳健性。
3. 解耦周期性精炼:有界粗到细更新与最短路径周期损失
传统 DETR 解码器采用无约束的欧氏加法更新框坐标,这一假设在平坦欧氏空间中的 \((cx, cy, w, h)\) 成立,但在拓扑结构为圆环 \(S^1\) 的周期性角度域中会彻底失效。当预测角度处于 \(0\) 与 \(\pi\) 的缝合边界附近时,哪怕几何朝向仅相差极小微弧度,欧氏相减也会得到接近 \(\pi\) 的巨大误差,导致反向传播梯度剧烈震荡并产生越界伪影。RiO-DETR 设计了解耦周期性精炼机制,在更新步长与损失函数两端同时保证周期拓扑自洽。在更新端,第 \(i\) 层解码器预测的原始角度偏移 \(\Delta \theta_i\) 先经 \(\tanh\) 限制振幅,并乘上层级衰减因子 \(\alpha_i = \alpha_0^{-i}\)(其中 \(\alpha_0 > 1\)):
前序解码层具备较大的旋转搜索半径用于快速纠正全局航向,后序解码层则被严格限制在微小区间内进行平滑微调。在优化端,模型摒弃标准 L1 损失,改用最短路径周期 L1 损失(Shortest-Path Periodic L1 Loss):
确保反向传播梯度永远沿着环面上的劣弧流动,彻底消除了周期性缝隙处的梯度跳变。
4. 定向密集单对单训练:象限独立旋转注入角度多样性
旋转框的高自由度导致二分图匹配空间极其庞大,使得 DETR 在前几十个 epoch 难以快速对齐正确的正样本角度。现有面向水平检测的密集监督技术(如 DEIM 的 Dense O2O)将四张复制图像拼贴为网格以增加真值密度,但四张子图朝向完全一致,未给网络提供额外的旋转不变性与多样性线索。RiO-DETR 提出定向密集单对单(Oriented Dense O2O)机制:在将四张图像拼接为复合大图前,对每个象限独立施加随机离散旋转 \(\theta_{rot} \in \{0^\circ, 90^\circ, 180^\circ, 270^\circ\}\)。这一计算零开销的数据组织方式使得单张训练图像内包含丰富的同类别多朝向目标,强制注意力机制在单次前向传播中学习跨朝向特征判别,将角度分支的高效收敛周期提前了近 30%,大幅降低了训练震荡。
损失函数 / 训练策略¶
在二分图匹配阶段,匹配代价 \(C_{match}\) 综合考虑分类与旋转几何对齐:
其中引入基于高斯分布建模的高斯柯西/KLD 距离与 Hausdorff 几何距离,保证正样本分配与形状和朝向严密贴合。最终监督损失函数由分类 Focal 损失、空间高斯度量 KLD 损失以及角度最短路径损失线性加权构成:
训练全程采用 D-FINE 的精细化匹配策略与 Dense O2O 机制,结合单阶段/两阶段渐进式优化,在测试期不依赖任何 NMS 即可实现端到端高精度推理。
实验关键数据¶
主实验¶
在 DOTA-1.0 官方单尺度训练与测试协议下,RiO-DETR 覆盖了从纳米级(Nano)到超大级(XLarge)的完整型号序列,在 NVIDIA T4 GPU(TensorRT FP16)上全面超越了主流 CNN 旋转检测器与非实时 DETR。
| 模型 | 骨干网络 | 参数量 | 计算量 (FLOPs) | 延迟 (ms) | AP50 (%) |
|---|---|---|---|---|---|
| LSKNet-S | LSKNet-S | 31.0M | 161G | 203.5 | 77.5 |
| PKINet-S | PKINet-S | 30.8M | 190G | 359.7 | 78.4 |
| Strip R-CNN-S | StripNet-S | 30.5M | 159G | 241.9 | 80.1 |
| ARS-DETR | Swin-T | 41.9M | 431G | 303.6 | 75.5 |
| RHINO-DETR | Swin-T | 50.8M | 609G | 242.6 | 79.4 |
| Oriented-DETR | Swin-T | 57.7M | 309G | 235.5 | 79.8 |
| YOLO26n-obb | YOLO26n | 2.5M | 14G | 2.8 | 77.7 |
| YOLO26s-obb | YOLO26s | 9.8M | 55G | 4.9 | 79.7 |
| YOLO26m-obb | YOLO26m | 21.2M | 183G | 10.2 | 80.0 |
| YOLO26x-obb | YOLO26x | 57.6M | 517G | 30.5 | 80.4 |
| RiO-DETR-n (本文) | HGNet-B0 | 4.0M | 17G | 2.7 | 78.4 |
| RiO-DETR-s (本文) | HGNet-B2 | 8.2M | 53G | 5.2 | 80.3 |
| RiO-DETR-m (本文) | HGNet-B2 | 18.6M | 158G | 8.8 | 80.9 |
| RiO-DETR-l (本文) | HGNet-B4 | 27.5M | 230G | 13.4 | 81.7 |
| RiO-DETR-x (本文) | HGNet-B5 | 62.5M | 527G | 29.9 | 81.8 |
消融实验¶
在 DIOR-R 验证基准上,以 RiO-DETR-m 为基线,逐步验证各新增模块对检测精度与推理延迟的增益表现:
| 配置阶段 | 参数量 | 计算量 (FLOPs) | 延迟 (ms) | AP50 (%) | 相对提升 |
|---|---|---|---|---|---|
| 从零实现的旋转 RT-DETRv2 基线 | 18.61M | 97.06G | 5.04 | 70.35 | 基准 |
| + Hausdorff 匹配与 KLD 损失 | 18.61M | 97.06G | 5.04 | 72.86 | +2.51 |
| + D-FINE 通用匹配策略 | 18.61M | 97.06G | 5.04 | 73.33 | +0.47 |
| + DEIM Dense O2O (强基线) | 18.61M | 97.06G | 5.04 | 73.47 | +0.14 |
| + 几何解耦查询编码 | 18.59M | 97.01G | 5.04 | 74.18 | +0.71 |
| + 旋转校正正交注意力 | 18.67M | 97.18G | 5.10 | 74.74 | +0.56 |
| + 解耦周期性精炼 | 18.67M | 97.18G | 5.10 | 75.46 | +0.72 |
| + 定向密集单对单 (完整 RiO-DETR-m) | 18.67M | 97.18G | 5.10 | 75.73 | +0.27 |
细分模块消融进一步表明: 1. 查询编码几何消融:仅编码中心 \((cx, cy)\) 为 72.56%,强行加入角度 \(\theta\) 反而滑落至 72.34%;加入尺寸后达到 73.57%,而仅编码 \((cx,cy,w,h)\) 保持角度解耦达到最优的 73.81%(未加正交注意力时)。 2. 正交注意力头比例:全头朝向 \(\theta\)(8:0)为 73.81%;不对称 6:2 分割为 74.02%;对称正交 4:4 分割达到峰值 74.18%;若分散为 4 个角度(2:2:2:2)则因各方向容量摊薄降至 73.95%。 3. 周期性精炼协同:单独使用 SP-L1 提升至 74.32%,单独使用周期更新因无配套梯度引导微降至 74.05%,二者联合达到 74.74%,证实拓扑结构与优化损失协同一致的必要性。
关键发现¶
- 解耦带来纯粹增益:将角度从位置嵌入中彻底剔除后,不仅没有损失方向感知能力,反而消除了早期迭代中的几何冲突,模型收敛速度和 AP50 稳步提升。
- 正交采样攻克大长宽比瓶颈:在直升机、大型港口桥梁等长宽比极端且朝向敏感的类别上,正交注意力通过补充侧向轮廓上下文,带来了最为显著的召回率跃升。
- 离散四向旋转优于连续随机旋转:在 Dense O2O 中,使用 \(\{0^\circ, 90^\circ, 180^\circ, 270^\circ\}\) 离散正交旋转达到了 73.88% AP50(第 60 epoch 达峰),明显优于连续任意角度旋转的 73.66%(第 62 epoch),原因是离散旋转避免了正方形近似目标在微小扰动下的等价参数化标签抖动。
亮点与洞察¶
- 将几何先验降级为语义表征:不同于以往盲目扩充高维几何嵌入的做法,文章敏锐意识到角度强依赖语义外观与定义约定,反直觉地将其从位置查询中解耦,用最轻量的改动解决了根本性优化冲突。
- 优雅且零负担的正交注意力:无需增加可变形采样点总数或引入可变形卷积大核,仅通过将现有多头按几何垂直方向做分组旋转变换,以几乎零 FLOPs 的代价根治了长轴注意力特征坍缩。
- 端到端旋转无 NMS 的突破:在保证 2.7 ms(Nano 版)与 29.9 ms(XLarge 版)极致推理效率的前提下,无需复杂的后处理和依赖超参的旋转 NMS 算子,极利于工业边缘芯片与 TensorRT 部署。
局限与展望¶
- 专用轻量级遥感骨干网络仍显不足:当前 RiO-DETR 仍依托通用视觉设计的 HGNetv2 系列,遥感图像特有的大尺度背景杂波、微弱密集小目标等问题尚需进一步定制高效遥感专用 Backbone。
- 极小角度对称歧义未完全根治:对于几乎完全呈正方形的目标(如集装箱、储油罐),其角度定义存在固有的 \(90^\circ\) 模糊度,当前依赖离散旋转缓解但仍存在偶发朝向抖动。
- 未来方向:探索结合多模态遥感文本先验或自适应几何分支,进一步提升极密集小目标场景下的角度解析精度。
相关工作与启发¶
- vs RHINO-DETR / ARS-DETR / Oriented-DETR: 此类方法聚焦于学术精度巅峰,采用深层复杂注意力机制与高维几何查询,模型参数多在 50M 左右且推理延迟普遍在 200 ms 以上;RiO-DETR 直面工业落地瓶颈,在精度匹敌或超越上述方法的同时,将推理速度提升了近一个数量级(低至 2.7 ms)。
- vs YOLO26-obb / RTMDet-R: 传统旋转 YOLO 依赖手工锚框或密集网格预测,且推理链条严重依赖耗时的旋转 NMS(Rotated NMS);RiO-DETR 首度证明纯 Transformer 架构能在相同延迟档位下完全替代甚至超越旋转 YOLO,免除了 NMS 超参敏感性与算子移植难题。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ 首次提出真正实时的旋转 DETR 框架,正交注意力与几何解耦设计思路新颖且洞察深刻。
- 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 DOTA-1.0(单尺度/多尺度)、DIOR-R、FAIR-1M-2.0 三大权威遥感旋转数据集,消融细致完备。
- 写作质量: ⭐⭐⭐⭐⭐ 逻辑严密,对 OBB 几何拓扑矛盾与现有 DETR 缺陷的剖析深入透彻。
- 价值: ⭐⭐⭐⭐⭐ 为遥感目标检测与边缘部署提供了极具实用价值的无 NMS 端到端实时基础模型。