On-Orbit Real-Time Wildfire Detection Under On-Board Constraints¶
会议: ECCV 2026
论文: ECCV 原文
领域: 遥感
关键词: 野火检测、星上边缘计算、DenseMAE、非标定红外、轻量化分割
一句话总结¶
针对低轨热红外微卫星极度受限的星载算力与单波段非标定中波红外数据,提出轻量级全卷积掩码自编码器 DenseMAE 与高分辨率细化分割架构,在小于 1 MB 模型体积与 65 ms 推理延迟下实现 0.699 的像素级全分布 AP 和 0.744 的火灾事件级 F1 分数。
研究背景与动机¶
全球野火频发且破坏力急剧上升,及早发现并遏制初期火情对生态安全与应急响应至关重要。传统的卫星火灾遥感架构长期陷入时空分辨率的两难抉择:静止轨道气象卫星重访周期短,但空间分辨率仅为 2–3 km,无法捕捉早期弱小火点;低轨高分辨率卫星重访频次低,通常每天仅有过境数次,极易错失午后火灾高发窗口。为此,商业热红外微卫星星座(如 OroraTech OTC-P1 及先导星 FOREST-2)通过部署 200 m 地面分辨率的非制冷微测辐射热计,实现了午后关键窗口期的高频重访,并提出了从星上过境到火情告警全流程小于 10 分钟的端到端超低延迟指标。这一指标直接否定了先下行海量原始影像再地面处理的传统架构,强制要求算法必须在星载计算节点上实时完成推理。
然而,在轨自主野火分割面临着极度严苛的多维物理与计算约束。一方面,星载边缘硬件功耗被锁死在低能耗模式(NVIDIA Jetson Xavier NX,10 W 功耗模式,算力与内存带宽极度受限),模型尺寸必须限制在 1 MB 以内且批处理推理耗时需低于 150 ms。另一方面,为了省去星载辐射定标的巨大计算与时延开销,算法必须直接在未经定标的单通道中波红外(MWIR, 3.8 µm)原始数字量(DN)上运行,极易受到探测器非均匀条带噪声和太阳耀斑等强反射伪影的干扰。更为极端的是,火灾在早期往往表现为孤立的亚像素或单像素弱热异常,在真实全景数据中有效火灾像素仅占有效观测像素的 0.0182%,且标注样本极为稀缺,使得常规重型双波段或多光谱分割模型在此完全失效。
面对单波段原始噪声大、极端类别不平衡以及亚兆字节计算预算的复合挑战,本文的核心切入点是探索轻量级密集自监督表示学习在星载微红外体制下的迁移可行性。核心 idea:设计专属于单通道非标定中波红外的轻量分段卷积掩码自编码器(DenseMAE),通过排除无效像素的块级空域掩码重构挖掘热异常背景表征,并在下游引入浅层高分辨率特征跳跃细化头,实现免剪枝与量化下模型体积 <1 MB、批延迟 65 ms 的高精度在轨野火边缘分割。
方法详解¶
整体框架¶
算法围绕微卫星星载推理全链路展开,输入为单通道 224×224 分辨率的非标定 MWIR 灰度瓦片(经局部有效区域稳健归一化,剔除无效坏点)。系统整体分为两个核心阶段:自监督预训练阶段使用全卷积架构的 DenseMAE 编码器与轻量重构解码器,在海量无标注原始 MWIR 数据上学习鲁棒的多尺度空间上下文特征;下游微调与部署阶段则舍弃重构解码器,冻结或端到端微调 DenseMAE 编码器,并在其顶层挂载极简的 TensorRT 友好型分割头,结合来自浅层 Stem 的高分辨率原始特征跳接细化模块输出最终火灾概率图。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["单波段非标定 MWIR 瓦片<br/>1×224×224 Raw DN"] --> B["Stem 浅层高分辨率卷积<br/>H×W / 32 通道 (输出 f₀)"]
B --> C["DenseMAE 分段轻量编码器<br/>单次步长下采样 + 空洞卷积"]
B -.->|"高分辨率跳接 f₀"| E["高分辨率细化头<br/>HR Refinement Module"]
C --> D["密集嵌入特征图 z<br/>D×H/2×W/2"]
D --> E
E --> F["预测火灾分割概率图<br/>1×224×224"]
关键设计¶
1. DenseMAE 分段卷积掩码自编码器:针对单波段红外边缘端的高效预训练架构
标准的掩码自编码器(MAE)通常基于重型视觉 Transformer(ViT),其将图像打散为 patch token 并在密集自注意力中进行交互,不仅模型参数庞大,且在低算力嵌入式 GPU 上难以进行算子融合与低延迟推理。DenseMAE 采用纯卷积的分段架构:首先通过一个 3×3 卷积单元构成的 Stem 提取 \(H \times W\) 尺度且通道数为 32 的浅层特征 \(f_0\);随后仅在 Stage 1 执行一次步长为 2 的 3×3 下采样卷积,将空间特征图迅速压缩到 \(H/2 \times W/2\);接下来的 Stage 2 与 Stage 3 均在 \(H/2 \times W/2\) 分辨率上运行,并通过设置膨胀率 \(d \in \{1, 2, 4\}\) 逐步扩大感受野,最后经 1×1 投影卷积输出通道数为 \(D\)(如 32 或 64)的密集嵌入向量 \(z\)。整个编码器内部使用 GroupNorm(8 组)与 GELU 激活函数,确保在极小批次训练下的数值稳定性。在预训练过程中,输入图像应用块大小为 \(b\)、掩码比例为 \(r\) 的随机空间掩码 \(M\),并严格利用有效像素掩膜 \(V\) 剔除星载微测辐射热计的传感器坏点及边缘无效像素,仅对被掩码的有效像素计算降采样对齐的 L1 重构误差:
2. 高分辨率跳接细化头:兼顾微小弱火点亚像素级精确定位与极限推理吞吐
在仅有一次下采样的 \(H/2 \times W/2\) 特征图上进行预测,虽然大幅压缩了计算开销,但对于仅占单像素甚至亚像素强度的早期微小火灾,粗糙的网格容易丢失边缘锐度并削弱微弱异常的检出率。为此,下游分割头设计了解耦架构:在密集特征 \(z\) 上首先通过超轻量分割头(如 TRT-Head 或深度可分离残差块 DW-Res Head)获得粗略 logits 分布 \(L_c\);随后构建高分辨率细化模块 \(\phi\),将 Stem 层保留的原始分辨率细节特征 \(f_0\) 与粗略预测 \(L_c\) 进行通道拼接,通过极浅层的轻量卷积融合获得最终的预测 logits:
这一跳跃融合机制以极小的参数代价(不足 0.1 MB)将深层语义上下文与浅层高频边缘重新对齐,显著强化了对孤立微弱火点的响应强度。
3. 面向 TensorRT 引擎算子融合的极简下游部署头:打通边缘硬件的亚兆字节推理边界
为了使模型能够在 10 W 模式的 Jetson Xavier NX 上无缝编译为极速 TensorRT FP16 执行引擎,下游预测头摒弃了任何涉及复杂动态算子或高访存比结构的设计,精简为两种规范化头结构:其一是专为算子极限融合设计的 TRT-Head,仅由 1×1 通道投影、三层级联的 3×3 Conv-BatchNorm-SiLU 模块和 1×1 输出卷积构成,隐藏层宽度紧凑收敛至 32 通道,编译后的整体引擎大小仅 0.52 MB,单批次推理耗时缩短至 65.34 ms;其二是表征能力更强的深度可分离残差头(DW-Res Head),通过在隐藏层引入三层带空洞的深度可分离残差模块,兼顾了感受野扩展与局部热异常表征,引擎大小仍稳定压在 1 MB 以内。
损失函数 / 训练策略¶
针对火灾像素占比仅 0.0182% 的极端正负样本不平衡难题,下游训练策略在批次采样阶段实施正样本瓦片加权过采样,确保每个批次均包含充足的火灾形态。损失函数采用掩码二值交叉熵(Masked BCE),计算时严格通过有效掩膜 \(V\) 将传感器盲元与视场外填充区域彻底剔除。优化器选用 AdamW 配合混合精度训练与余弦退火学习率调度。对于自监督 checkpoint 的初筛,构建固定随机种子的分层平衡特征池计算 Probe AP,最终模型选择则严格依据完整测试集(全分布真实负样本瓦片流)的像素级全精度 AP 与连通域事件级 Fire-F1 双重指标。
实验关键数据¶
主实验¶
主实验在 9 颗不同卫星(FOREST-2 及 OTC-P1 的 FOREST-4 至 11)跨越两年的 839 景完整标注场景上展开。测试集包含 9,592 张切片,在真实的极端不平衡分布下计算全像素级 AP,并使用验证集选优阈值计算连通域事件级 Fire-F1;推理时延与引擎体积基于 Jetson Xavier NX(TensorRT FP16, \(224 \times 224\), Batch=8)实测。
| 模型配置 | 预训练/微调范式 | 测试 AP ↑ | 事件级 Fire-F1 ↑ | TRT FP16 延迟 (ms) ↓ | 引擎大小 (MB) ↓ |
|---|---|---|---|---|---|
| HR-U-Net++ (depth=2, h=32) | 全监督端到端 | 0.610 | 0.680 | 94.25 | 0.77 |
| HR-U-Net++ (depth=3, h=32) | 全监督端到端 | 0.635 | 0.690 | 97.53 | 1.62 |
| HR-U-Net++ (depth=4, h=32) | 全监督端到端 | 0.650 | 0.730 | 104.34 | 2.10 |
| DenseMAE (emb32) + TRT-Head | SSL 预训练 + 端到端微调 | 0.640 | 0.690 | 65.34 | 0.52 |
| DenseMAE (emb32) + DW-Res + HR | SSL 预训练 + 端到端微调 | 0.677 | 0.732 | 98.01 | 1.10 |
| DenseMAE (emb64) + TRT-Head | SSL 预训练 + 端到端微调 | 0.677 | 0.689 | 110.46 | 0.55 |
| DenseMAE (emb64) + DW-Res + HR | SSL 预训练 + 端到端微调 | 0.699 | 0.744 | 141.00 | 0.91 |
消融实验¶
消融实验深入验证了微调模式、自监督表征维度与架构机制对性能与下游鲁棒性的根本影响。
| 实验配置 | 预训练策略与迁移方式 | 全测试集 AP ↑ | 说明 |
|---|---|---|---|
| DenseMAE (emb64) + HR Head | DenseMAE 预训练 + 全参数微调 | 0.689 ± 0.004 | 基线最佳微调性能 |
| DenseMAE (emb32) + HR Head | DenseMAE 预训练 + 全参数微调 | 0.671 ± 0.005 | 紧凑特征维度,算力更轻 |
| DenseMAE (emb64) + HR Head | DenseMAE 预训练 + 冻结编码器 (Linear Probe) | 0.612 ± 0.006 | 仅更新浅层下游头,表征泛化强 |
| DenseMAE (emb64) + HR Head | 随机初始化 + 全参数微调 (从头训练) | 0.551 ± 0.008 | 相比预训练 AP 暴跌 13.8%,印证 SSL 必要性 |
| DenseMAE + Hybrid EMA 蒸馏 (\(\lambda=0.02\)) | 重构损失 + 动量教师一致性蒸馏 | 0.2796 (Probe) | 全流测试中对噪声鲁棒性收益微弱且偶有负迁移 |
关键发现¶
- 自监督预训练是小样本与极端不平衡下的性能压舱石:在相同网络结构下,由 DenseMAE 预训练初始化的模型相较于从头随机初始化(Random Init)AP 大幅提高约 13.8 个百分点(0.689 vs. 0.551),证明了在未定标红外探测器噪声强、真实标注极少的严苛场景下,无监督空间重构能够有效构建对背景热辐射基底与探测器条带的稳健表征。
- 高分辨率跳接细化头对微弱孤立火灾具有决定性增益:虽然像素级 AP 容易受到大面积火烧迹地的主导,但加入浅层跳接细化后,事件级 Fire-F1 获得了尤为显著的跃升(由 0.689 提升至 0.744),这说明浅层未降采样的高频信息重注入对于单像素弱火点的检出起到了关键支撑。
- 纯重构任务在强噪声红外域优于多任务混合蒸馏:实验表明,引入 EMA 动量一致性自蒸馏(Hybrid distillation)不仅无法带来持续增益,甚至在仅约束掩码区域时会导致全流测试性能倒退;在探测器条带噪声显著的单波段数据中,纯粹基于未遮蔽像素上下文去补全遮蔽区域的 L1 重构损失是最稳定、最有效的监督信号。
- 独立外场与 VIIRS 双星互验:在以 \(\pm 10\) 分钟同步过境时间与 800 m 缓冲区聚类与公认标杆 VIIRS 375 m 主动火灾产品对比中,联合检出集群达 103 处,且模型在 F002 卫星上成功抓住了多处由于空间分辨率优势(200 m vs. 375 m)而低于 VIIRS 探测极限的早期小火点。
亮点与洞察¶
- 将密集掩码自编码压缩至轻量全卷积范式:不同于常规重型 ViT-MAE,DenseMAE 针对遥感边缘计算定制了单次降采样与膨胀卷积组合,不仅将特征尺寸精准锚定在 \(H/2 \times W/2\),更完美兼顾了 GPU 访存局部性,是嵌入式边缘场景极为精巧的自监督实践。
- 星载极度受限条件下的免模型压缩端到端实现:在未借助知识蒸馏后处理、结构化剪枝或 INT8 精度量化压缩的前提下,仅依靠严密的网络层级控制与算子规范化,便直接通过 TensorRT FP16 编译达成了 0.52–0.91 MB 的亚兆字节引擎体积,为航天级边缘 AI 提供了可直接工业落地的示范模板。
- 物理先验驱动的假阳性几何解析:论文通过分析地表法向量与日-地-星半角矢量的点积几何指标 \(N \cdot H\)(镜面高光强度代理),精确定位了单波段算法 67% 的误报均集中在强镜面反射高光区(\(N \cdot H \approx 1.0\)),为后续结合天体物理几何剔除耀斑提供了明确指引。
局限与展望¶
- 单通道输入对太阳耀斑等强镜面反射的物理不适定性:由于不依赖辐射定标且缺乏长波红外(LWIR)或可见光/近红外(VNIR)通道辅助判别,单波段 MWIR 无法从光谱维彻底区分强烈的地表镜面反射(如水面、光伏板或金属建筑反射产生的强烈耀斑)与真实高温异常。未来需在算力预算微调下引入双通道比值滤波或注入粗粒度地表几何先验。
- 时序观测上下文的物理割裂:当前单次过境独立推理无法保留或比对历史过境帧,无法利用时序温度升温斜率排除静态高温背景。星载 Jetson Xavier NX 严苛的持久化内存分配机制与多进程同步开销限制了跨轨道时序缓存的建立。
相关工作与启发¶
- vs MODIS (MOD14) / VIIRS (375m) 传统上下文阈值算法:传统业务算法重度依赖经过严格精密辐射定标的物理亮温绝对值,并强依赖 MWIR 与 LWIR/TIR 两个不同波段的温差对比及多轮顺序决策树。本文面对无定标、单波段且硬件极度受限的环境,通过深度学习端到端自适应消除探测器背景噪声,在 200 m 分辨率下对早期微弱火情实现了同等甚至更灵敏的检出。
- vs 常规深度学习火灾分割网络(如 Fire-Net、Smoke-Unet):现有深度学习分割方法通常假设运行在地面高性能服务器端,依赖多波段输入且模型参数量普遍在数十兆字节以上。本文给出的 DenseMAE 方案证明了在严格锁死 10 W 功耗与 1 MB 体积的微纳卫星环境下,轻量全卷积自监督预训练同样可以取得超越全监督重型网络的泛化效果。
评分¶
- 新颖性: ⭐⭐⭐⭐ [针对星载单波段非标定中波红外的轻量全卷积 DenseMAE 与跳接细化设计极具工程落地与学术创新价值]
- 实验充分度: ⭐⭐⭐⭐⭐ [跨 9 颗真实运行卫星两年数据的严密评估,包含全像素级不平衡 AP、事件级 Fire-F1、真实硬件 TensorRT 实测及与 VIIRS 卫星的同步交叉互验]
- 写作质量: ⭐⭐⭐⭐⭐ [工程约束清晰、动机链条环环相扣,从数据失衡到边缘部署各维度论证扎实详尽]
- 价值: ⭐⭐⭐⭐⭐ [直接部署于商业低轨野火监测卫星星座,对全球重大森林火灾在轨超低延迟预警具备极高的实用价值]