title: "PKINet-v2: Towards Powerful and Efficient Poly-Kernel Remote Sensing Object Detection" description: "PKINet-v2 将轴向条带、空洞方形和密集小核组合成多核范围注意力,再以 HKR 合并部署分支;解读其遥感旋转目标检测机制、DOTA 实验与效率边界。" tags: - ECCV2026 - 目标检测 - 遥感 - 多尺度特征 - 结构重参数化 date: 2026-09-17
PKINet-v2: Towards Powerful and Efficient Poly-Kernel Remote Sensing Object Detection¶
会议: ECCV2026
论文: ECCV 原文
代码: https://github.com/NUST-Machine-Intelligence-Laboratory/PKINet
领域: 目标检测 / 遥感
关键词: 旋转目标检测、多核范围注意力、轴向条带卷积、多尺度感受野、异构核重参数化
一句话总结¶
PKINet-v2 用异构卷积核兼顾遥感目标的形状与尺度,再将训练时的多分支聚合等价合并以加速部署,在单尺度 DOTA-v1.0 上以 80.46% mAP 和 54.60 FPS 超过 PKINet-v1-S 的 78.39% 与 14.05 FPS。
研究背景与动机¶
遥感检测不仅需要判断图中有什么,还需要用旋转框定位任意朝向的目标。 同一幅航拍图里,细长桥梁、紧凑储罐、小车辆和大球场可能同时出现,形状差异与尺度差异因而不能割裂处理。 修改角度回归或旋转 RoI 可以改善框的表达,却不能自动保证骨干提取到了适合这些对象的特征。 Strip RCNN 从形状出发使用条带核,LSKNet 从上下文出发使用大方形核;本文认为,前者可能削弱紧凑目标与微小纹理的空间完整性,后者则容易在细长目标附近引入背景。 这不是说某种卷积核一概无效,而是单一几何偏置难以覆盖遥感场景内并存的对象。
PKINet-v1 已用并行多尺度方形核扩大覆盖范围,但仍受制于同类核的几何偏置。 它还有实际部署瓶颈:分支越多,独立算子启动、重复读写以及中间特征物化越容易拖慢 GPU 执行。 因此,参数少或理论运算量低不必然意味着吞吐量高,新的结构还需要考虑训练图能否转成高效的推理图。 论文表 1 中,v1-S 为 184G FLOPs、14.05 FPS,v2-S 为 173G FLOPs、54.60 FPS;算量变化远小于速度变化,说明不能只拿 FLOPs 解释部署效果。
本文将表征设计与部署转换配套考虑:训练时让不同形状、不同采样密度的核各自学习,部署时再消除可以代数合并的分支。 其中,覆盖大范围并不意味着放弃局部细节,中心区域反而需要更多密集响应来保护小目标。 核心 idea:用多核范围模块同时提供条带形状偏置、跨尺度上下文和密集局部线索,再用异构核重参数化把这些可合并的训练分支变成单个部署算子。
方法详解¶
整体框架¶
PKINet-v2 是特征提取骨干,不是独立替换全部检测流程的新检测头。 输入遥感图像经过四个阶段,每个阶段先用重叠 patch embedding 下采样并增加通道,再重复若干 PKINet-v2 block。 每个 block 包含多核范围模块所在的 PKS 残差子块,以及承担通道混合和特征细化的 FFN 残差子块。 PKS 子块还含前后两个全连接层;这些外围结构与残差路径不属于 HKR 的五分支合并范围。 骨干输出的分层特征交给 Oriented RCNN 等现有旋转检测框架,最终得到类别和旋转边界框。
对 \(1024\times1024\) 输入,四个阶段的空间分辨率依次为 \(256\times256\)、\(128\times128\)、\(64\times64\)、\(32\times32\)。 Small 版本的通道数依次为 64、128、320、512,block 数为 2、2、4、2。 Tiny 版本对应 32、64、160、256 通道,以及 3、3、5、2 个 block,不能把它简单理解为每层都少几个 block。 这些配置来自第 9 页表 2;该表的 13.6M 参数和 54.0G FLOPs 是 Small 骨干口径,不是完整检测器口径。
下面区分训练时的数据路径和训练完成后的部署转换;虚线表示参数转换,不表示额外监督或每张图像都执行的步骤。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
Input["遥感图像 / 阶段特征"] --> Embed["重叠 patch embedding"]
Embed --> PKS["多核范围模块(PKS)<br/>局部提取、异构聚合与门控"]
PKS --> Refine["残差与 FFN<br/>重复 block,形成四阶段特征"]
Refine --> Detector["旋转检测框架<br/>类别与旋转框"]
PKS -. "训练完成后的分支参数转换" .-> HKR["异构核重参数化(HKR)<br/>五分支变为单个部署卷积"]
HKR -. "替换聚合算子,其余结构保留" .-> Refine
关键设计¶
1. 多核范围模块(PKS):让几何偏置和采样密度共同塑造注意力
PKS 首先对输入特征使用 \(5\times5\) 深度卷积,得到局部特征,随后才让五条并行分支读取同一份局部特征。 深度卷积逐通道处理空间信息,不在这一操作中混合不同通道,因此能以较低成本设置较大的空间核。 第一条分支先做 \(1\times19\)、再做 \(19\times1\) 轴向条带卷积,两个方向是串联关系,而不是两条独立并行分支。 这种分解带来方向性的参数化方式,但两个条带串联后的覆盖范围是二维区域,不能把它误读为只看横竖两条线。 第二至第四条分支分别采用 \(7\times7\)、\(5\times5\)、\(3\times3\) 方形深度卷积,空洞率均为 3。 它们的空间跨度分别为 19、13、7,因此可以用稀疏采样引入不同距离的上下文。 第五条分支采用空洞率为 1 的密集 \(3\times3\) 核,专门保留邻近像素的细节响应。 这里的跨度只描述并行分支相对其输入的覆盖范围,不是包含前置 \(5\times5\) 卷积在内的整个 PKS 感受野。
各分支先经过各自的 Batch Normalization(BN),然后按元素求和,再由 \(1\times1\) 卷积进行通道融合,产生与模块输入同形状的空间注意力图。 这不是把五份特征沿通道拼接,也不是用 softmax 在五个核中选择一个。 最终注意力图与 PKS 的原始输入逐元素相乘;被调制的是输入特征,而不只是局部卷积后的特征。 论文正文将这一输出描述为乘法门控,没有在该位置给出额外 sigmoid,因此不能自行将其解释为必在 0 到 1 之间的概率图。 以下按第 7 页式(4)至(5)的正文关系整理记号,不逐字还原缓存中损坏的排版:
其中 \(X\) 是 PKS 输入,\(Z^{(m)}\) 是第 \(m\) 条分支从局部特征提取的响应,\(A\) 是注意力图,\(\odot\) 表示逐元素乘法。 这一结构把“从不同范围收集信息”与“用这些信息调制原特征”分开,让远处上下文参与判断而不直接替代局部表示。 作者在图 3 中将核覆盖解释为由外到内逐渐加密:大跨度分支提供较广覆盖,小跨度和密集分支向中心叠加贡献。 因此,桥梁需要的较长几何结构、球场需要的空间上下文与车辆需要的局部纹理,可以通过同一聚合模块共同影响输出。 覆盖重叠并不等于训练后的权重必然更大,也不保证网络学到严格旋转等变性;这里应理解为结构偏置。 同理,“全跨度”指这个核的有限空间范围,不是全图自注意力意义上的全局访问。
2. 异构核重参数化(HKR):把线性分支转换成可连续执行的部署算子
多分支适合训练时表达不同归纳偏置,但直接运行五个分支仍会产生多次算子启动和中间张量。 HKR 的目标不是裁掉低贡献分支,而是把同一个线性聚合结果换一种计算形式执行。 第一步是在评估模式下利用 BN 的运行均值、运行方差、缩放与偏移,把每条分支的 BN 折叠到对应卷积权重和偏置中。 这里依赖固定的 BN 统计量,不是用当前推理 batch 的统计量重新计算归一化。 第二步把方形分支的核按中心对齐写入共同的 \(19\times19\) 网格,空洞核按其采样间隔放置,其余位置补零。 对于串联的轴向条带核,先逐通道求两个一维核的外积,得到等价二维核,再放入同一个网格。 所有对齐权重相加、对应偏置相加,得到单个 \(19\times19\) 深度卷积。 这些步骤对应第 8 至 9 页 §3.4 与图 3,核心前提是待合并路径具有可组合的线性或仿射结构。
HKR 合并的是五分支及其 BN 所形成的求和部分;前置局部卷积、后置 \(1\times1\) 融合、乘法门控、残差和 FFN 仍然存在。 尤其是门控依赖输入内容,不能连同全部 PKS 一起视作固定线性卷积。 卷积 padding、偏置处理和 BN 模式必须与等价转换保持一致;本文笔记没有通过执行代码核验这些实现细节。 原文主张转换前后输出相同,表 9d 给出的直接实验依据是 T、S 两个版本在报告精度下 mAP 不变。 减少算子碎片的收益主要体现在硬件执行与内存访问,不应被表述为“分支合并必然降低所有 FLOPs”。 相对 v1 的速度差还包括骨干整体设计变化,不能全部归因于 HKR 这一个转换步骤。
一个完整示例¶
设想一块 \(1024\times1024\) 的港口影像同时出现细长船舶、紧凑储罐和小型车辆;这只是机制示例,不是新增实验。 第一阶段将其转成 \(256\times256\) 特征图,Small 版本在该阶段使用 64 个通道。 在一个 PKS 中,前置 \(5\times5\) 卷积先提取局部结构,五条分支再围绕同一位置读取不同范围的信息。 条带分支提供长跨度的方向分解,稀疏方形分支补充周边布局,密集分支保留车辆附近的细节。 这些响应经 BN、求和和通道融合后产生注意力,与输入特征相乘,再进入残差与 FFN 更新。 之后的阶段继续降低空间分辨率、扩大表示容量,由旋转检测框架利用分层特征产生目标框。 部署时并不会识别“这是船舶”再选择条带核;五条分支的参数已通过 HKR 合并,图像仍通过同样的内容相关门控。 这个例子说明的是特征处理路径,不能据此声称某个分支对某一类别存在独占分工。
损失函数 / 训练策略¶
本文贡献集中于骨干与部署转换,§4.1 没有提出新的检测损失,检测监督由所接入的检测框架承担。 训练先在 ImageNet-1K 上预训练骨干,再进行遥感检测训练;主实验预训练 300 epochs,消融仅预训练 100 epochs。 预训练使用 4 张 GPU、总 batch size 1024;不能将这个 batch size 套用到下游检测训练。 下游在 MMRotate 中训练 36 epochs,正文指定 AdamW、初始学习率 0.0001、权重衰减 0.05,并采用随机翻转。 DOTA-v1.0 与 DOTA-v1.5 裁成 \(1024\times1024\) 图块,相邻裁块重叠 200 像素;HRSC2016 与 DIOR-R 使用 \(800\times800\) 输入。 主实验使用 trainval 训练、test 测试,测试分辨率与训练一致,不使用测试时数据增强。 HRSC2016 与 DIOR-R 的本文 mAP 是 5 次运行的平均值;其余表格不能自动按相同统计口径解释。 HKR 在训练结束后进行,不需要额外监督信号或重新训练一套检测器。
实验关键数据¶
主实验¶
下表摘录主结果,采用 300 epochs ImageNet-1K 预训练;DOTA 为单尺度训练与测试,本文骨干接入 Oriented RCNN。 mAP 以百分数报告,提升均为百分点;HRSC2016 的 VOC 2007 与 VOC 2012 指标必须分开看。
| 数据集与指标 | PKINet-v1-S | PKINet-v2-S | 提升 | 原文位置 |
|---|---|---|---|---|
| DOTA-v1.0 mAP | 78.39 | 80.46 | +2.07 | 表 3,第 11 页 |
| DOTA-v1.5 mAP | 71.47 | 73.57 | +2.10 | 表 4,第 11 页 |
| HRSC2016 mAP (VOC 2007) | 90.70 | 90.75 | +0.05 | 表 5,第 12 页 |
| HRSC2016 mAP (VOC 2012) | 98.54 | 98.84 | +0.30 | 表 5,第 12 页 |
| DIOR-R mAP | 67.03 | 69.40 | +2.37 | 表 6,第 12 页 |
表 3 的 PKINet-v2-S 标准配置为 30.7M 参数、173G FLOPs;带 Strip Head 的配置另报 80.68% mAP、31.4M 参数、206G FLOPs,不能与标准配置混称。 表 1(第 3 页)在单张 NVIDIA A100-40G 上报告 v1-S 14.05 FPS、v2-S 54.60 FPS,即约 3.9 倍吞吐量;效率统计使用 \(1024\times1024\) 输入。 这不是 HRSC2016 在 \(800\times800\) 输入下的单独速度测量,也不是所有硬件上的部署承诺。
消融实验¶
表 9a(第 14 页)使用 DOTA-v1.0、Oriented RCNN 和 100 epochs 预训练;参数为骨干口径,FPS 为 HKR 后的结果。
| 核设计 | 骨干参数 | FPS | mAP (%) |
|---|---|---|---|
| Dense-only (3) | 13.2M | 54.6 | 78.57 |
| Strip-only (19) | 13.3M | 54.6 | 79.62 |
| Sparse-only (3,5,7) | 13.5M | 54.6 | 79.36 |
| Hybrid | 13.6M | 54.6 | 80.11 |
混合核较纯条带核提高 0.49 个百分点,较纯密集核提高 1.54 个百分点,支持不同核形状与范围的互补性。 这张表不是四个模型未经转换时耗时完全一样的证据,因为作者明确规定其中速度在 HKR 后测量。 表 9d(第 14 页)单独隔离 HKR,采用同一消融预训练设置和单张 A100-40G 的效率口径。
| 版本 | HKR | FPS | mAP (%) |
|---|---|---|---|
| T | 不使用 | 46.2 | 79.10 |
| T | 使用 | 58.0 | 79.10 |
| S | 不使用 | 43.4 | 80.11 |
| S | 使用 | 54.6 | 80.11 |
S 版本的独立 HKR 收益是 11.2 FPS,约为原速度的 1.26 倍;它不是相对 v1 的 3.9 倍跨模型收益。 该表只展示 mAP 保持不变,不展示逐像素输出误差或不同精度模式下的数值误差界。
关键发现¶
- 表 9b 的方形分支空洞率以 (1,3,3,3) 最好,mAP 为 80.11;扩大到 (1,4,4,4) 后为 80.01,说明范围更大不保证更准。
- 表 9c 中,1、3、4、5 分支分别得到 79.62、79.90、79.99、80.11 mAP,额外分支带来渐进收益,而不是只靠一条最大核。
- 表 3 中,桥梁 AP 从 v1-S 的 55.81 提升到 57.72,但环岛 AP 从 70.23 降到 67.76;整体改善不等于每个类别都改善。
亮点与洞察¶
- 训练参数化和部署计算图可以分开设计。本文用异构分支帮助学习,再用等价转换去掉执行碎片,而不是要求训练图天然只有一条路径。
- 感受野不只有“大小”一个维度。核形状、采样间隔以及中心重叠程度共同影响局部细节与上下文如何进入特征。
- 骨干创新能够与旋转检测头互补。表 7 在多个检测框架中验证了替换骨干的收益,价值不局限于一个专用检测头。
局限与展望¶
- 以下是阅读判断:效率主要在 A100-40G 上测量,缺少移动 GPU、CPU、不同 batch size 或部署后端的验证,不能直接推出边缘设备收益。
- 四个数据集均为遥感检测基准,尚不能据此断言对分割、自然图像检测或跨传感器域迁移同样有效。
- 混合条带核不是旋转等变性的证明;针对不同目标朝向和背景比例的受控分析,可以更直接验证其几何机制。
- HRSC2016 的 VOC 2007 改善仅 0.05 个百分点,虽然报告 5 次运行均值,但表中没有方差,无法据此判定统计显著性。
- 缓存多处公式排版损坏;本笔记只整理文字可确认的运算关系。表 8 的首个相对面积分箱显示为
0.01–0.01,边界存疑,因此未据此转录面积分箱结果。 - 原文没有独立局限章节;未来可优先检查 HKR 的混合精度误差与跨硬件吞吐,而不只继续扩大核或分支数。
相关工作与启发¶
- 对比 PKINet-v1:继承多尺度并行核思路,增加异构几何偏置并改变部署方式;本文优势来自表征和执行两方面,而非仅仅增大模型。
- 对比 LSKNet:LSKNet 强调大核与空间选择,本文强调条带、稀疏方形和密集小核的联合覆盖;两者关注上下文,但参数化不同。
- 对比 Strip RCNN:本文没有放弃条带核,而是补上方形与局部分支;带 Strip Head 的 80.68% 结果也说明骨干设计和检测头设计可以组合。
- 可延伸问题:固定部署核尺寸后,比较不同训练分支集合能否持续改善跨域泛化,是比单纯增加部署计算更有针对性的研究方向;这是阅读启发,不是本文已验证结论。
评分¶
- 新颖性: 4/5。异构核与重参数化各有前史,本文将其组织成有针对性的遥感骨干改进。
- 实验充分度: 4/5。四个基准、跨框架验证与独立 HKR 消融较完整,仍缺部署硬件多样性及误差统计。
- 写作质量: 4/5。问题与结构对应清楚,但缓存公式及个别表格标签降低了可核验性。
- 价值: 4/5。对同时关注旋转检测精度和实际吞吐的研究具有直接参考价值。