跳转至

WiFlow: Estimating Optical Flow using WiFi Channel State Information

会议: ECCV 2026
论文: ECCV 原文
代码: https://visinf.github.io/wiflow
领域: 视频理解
关键词: WiFi感知 / 光流估计 / 信道状态信息 (CSI) / RAFT / 跨模态运动估计

一句话总结

WiFlow 首次探索了仅依靠商用 WiFi 信道状态信息(CSI)估计稠密二维光流场,提出了多天线商数预处理与解耦运动定位/流场估计的双分支网络架构,在无相机与黑暗环境下实现了准确的人体运动场预测与跨被试泛化。

研究背景与动机

运动是理解动态视觉场景最底层的线索,而在计算机视觉中,光流(Optical Flow)是刻画连续时间步间像素级表观运动的标准表征,支撑着动作识别、目标跟踪、视频插帧、无监督分割以及机器人导航等海量下游任务。然而,传统光流估计近乎完全依赖于光学相机拍摄的高清 RGB 图像帧。在室内居家监护、卫生间与卧室看护、私密办公等敏感场景中,部署光学摄像头面临着极其严峻的个人隐私泄露风险;与此同时,光学成像对光照条件极度敏感,在夜间无光、强光眩光或烟雾遮挡等恶劣环境中会彻底失效。

为了打破对光学镜头的刚性依赖,非接触式无线射频感知(WiFi Sensing)成为极具前景的替代路径。射频信号在空间传播时会受到室内墙壁、家具等静态环境以及运动人体的多径散射与多普勒频移影响,商用 WiFi 网卡在物理层解调时记录的信道状态信息(CSI)直接反映了物理信道的动态扰动。然而,现有基于 CSI 的感知系统绝大多数只输出特定高层离散任务结果(例如人体分类标签、离散手势、跌倒判定、关键点坐标或三维空间度量轨迹),或者试图直接端到端恢复 RGB 图像与人体网格。这类方案要么丢失了细腻连续的空间运动流场,要么在跨模态纹理重建上面临巨大的不适定性。

因此,能否直接从无源无线电物理扰动中推导并重构出像光学相机一样直观、密集的二维图像平面光流场,成为了连接射频物理感知与计算机视觉底层管线的核心难题。核心 idea:将无源 WiFi CSI 序列映射到连续二维图像平面光流场,通过商数归一化滤除硬件相位共模噪声,并设计解耦运动区域定位与流场迭代细化的组合架构(WiFlowCombo),在无需光学镜头的条件下稳健恢复动态场景的密集像素位移向量。

方法详解

整体框架

WiFlow 旨在仅使用一组分布式 WiFi 接收机采集的复数 CSI 测量张量,估计两连续时间戳之间对应的二维稠密光流场 \(F \in \mathbb{R}^{2 \times H \times W}\)。输入系统的数据由 1 个发射机(Tx,单天线)和 4 个分布式部署的四天线接收机(Rx,共计 16 根接收天线)采集,在 80 MHz 带宽、1 kHz 采样率下捕获子载波频率响应。整个预测管线包含三个核心阶段:首先通过天线间商数预处理消除硬件噪声与载波频偏,随后将频域时序张量输入特征提取网络,最后通过光流与掩码分支迭代解码出目标二维光流场。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入时序 CSI 测量<br/>16 通道 × 频域子载波 × N 快照"] --> B["多天线商数归一化预处理<br/>消除跨天线共模相位漂移与频偏"]
    B --> C["时空跨模态特征提取<br/>双分支提取上下文与时序关联特征"]
    C --> D["解耦流场与运动掩码解码<br/>并行预测密集流场与二值运动区域"]
    D --> E["掩码点乘加权与流场输出<br/>消除静态背景噪声,输出精准 2D 光流"]

关键设计

1. 多天线商数归一化预处理:消除硬件共模相位漂移与频偏 原始 WiFi CSI 数据极其嘈杂,商用无线网卡内部的时钟不同步、载波频率偏移(CFO)和采样时钟偏移(SDO)会导致测得的原始相位随时间产生剧烈而无序的随机漂移,如果直接将原始幅值与相位送入深度网络,模型极易学到硬件伪影而非真实人体运动。针对这一痛点,WiFlow 采用了基于参考天线的复数商数归一化机制(Quotient Normalization)。对于同一接收机上的每根天线 \(r\)、每个子载波 \(k\) 及时间步 \(t\),将其复数响应 \(H_{r,k}(t)\) 除以同设备指定参考天线 \(H_{\text{ref},k}(t)\) 的复数响应:

\[ \tilde{H}_{r,k}(t) = \frac{H_{r,k}(t)}{H_{\text{ref},k}(t)} \]

由于同一物理网卡上所有射频通道共享相同的本振振荡器和射频时钟,除法操作在复数域上直接相消了硬件引起的共模随机相位漂移,同时大幅保留并突显了人体在不同空间路径上引起的相对多径散射变化。消融实验证实,商数预处理相比原始数据、傅里叶变换或 Savitzky-Golay 滤波,能够显著降低运动区域光流误差达 22% 以上。

2. 基于 RAFT 的时空跨模态流场迭代回归:从频域扰动到稠密像素对应 从 WiFi 空间的一维天线与频域子载波维度直接映射到二维图像平面的连续像素运动场存在巨大的维度与物理意义割裂。WiFlow 引入并改造了光流领域经典的 RAFT 架构作为基础构建块(WiFlow Block)。该模块由三个子网络协同运作:首先是特征网络(Feature Network),以适应扩展输入维度的改进 ResNet 提取时间片 \(t_0\)\(t_1\) 的深层特征并构建全配对特征相关体;其次是上下文网络(Context Network),专门提取场景的基础空间结构特征;最后是基于卷积门控循环单元(ConvGRU)的细化网络(Refinement Network)。Refinement Network 在隐藏状态引导下,通过多轮迭代更新逐步修正流场估计量:

\[ F^{(m)} = F^{(m-1)} + \Delta F^{(m)}, \quad m=1,\dots,M \]

通过将高维射频能量扰动投影到隐式空间几何并借由 ConvGRU 逐级逼近真实像素位移,网络能够在没有视觉纹理的前提下合成出空间连续平滑的人体宏观光流场。

3. 解耦运动定位与流场估计(WiFlowRoI 与 WiFlowCombo):抑制静态背景虚假流动 在固定发射器与接收器的室内场景中,绝大多数像素属于静止背景,真实运动区域在图像空间中具有极高的稀疏性。如果使用单一流块网络直接回归全局光流(WiFlowSimple),网络往往倾向于在静态背景区域产生低幅值但持续存在的弥散噪声,而为了压低全局均方误差,又容易出现对局部快速运动估计欠拟合的折中。为攻克这一难题,论文提出了两种显式解耦空间定位与运动速度估计的架构设计: - WiFlowRoI:借鉴两阶段目标检测设计,首先利用预训练的掩码块(Mask Block)根据 CSI 检测出前景运动区域并提取连通域包围框(Bounding Box),随后仅在提取的 RoI 区域内调用 RoIAlign 结合上下文特征回归局部光流; - WiFlowCombo:采用并行的双分支网络结构,上方 Flow Block 负责专注预测全局速度矢量场,下方 Mask Block 则专门学习二值运动激活概率图,最终输出通过两者空间点乘逐像素过滤:

\[ F_{\text{final}} = F_{\text{flow}} \odot M_{\text{mask}} \]

这种乘性门控机制以极其微小的计算开销彻底消除了静止背景中的残余浮动噪声,使静态像素端点误差(\(EPES\))降低了一个数量级(从 0.40 降至 0.02),同时保留了前景运动边界的锐度。

损失函数 / 训练策略

为防止模型在大量全零背景的监督信号下退化为全零平凡解(All-zero Prediction),训练时采用强化运动区域加权的序列迭代损失函数:

\[ \mathcal{L} = \sum_{m=1}^{M} \gamma^{M-m} \| F_m - F_{\text{gt}} \|_{1, \text{weighted}} \]

其中迭代步数设为 \(M=4\),指数衰减因子 \(\gamma = 0.8\)。对于运动幅值 \(\|F_{\text{gt}}\|_2 > 0.5\) 像素的前景区域赋予更高的加权系数,迫使模型重点拟合肢体运动轨迹。模型使用 AdamW 优化器与余弦退火调度器在单张 NVIDIA RTX 6000 Ada GPU 上迭代训练 60,000 步,初始学习率为 \(1\times 10^{-3}\)

实验关键数据

主实验

论文在新建的多视角多被试 WiFlow 数据集上全面评测了三款模型架构,涵盖被试划分(Subject Split,跨人泛化)与时间划分(Time Split)两种协议,重点报告全图平均端点误差(\(EPE\))、运动像素端点误差(\(EPEM\))与静态像素端点误差(\(EPES\)):

视角 (Perspective) 模型架构 (Architecture) 被试划分 EPE (↓) 被试划分 EPEM (↓) 被试划分 EPES (↓) 时间划分 EPE (↓) 时间划分 EPEM (↓) 时间划分 EPES (↓)
sideview (侧视) WiFlowSimple 0.51 2.22 0.40 0.53 2.07 0.43
sideview (侧视) WiFlowRoI 0.18 2.36 0.04 0.16 2.21 0.04
sideview (侧视) WiFlowCombo 0.16 2.36 0.02 0.15 2.18 0.03
birdview (俯视) WiFlowSimple 0.55 3.53 0.40 0.56 3.24 0.43
birdview (俯视) WiFlowRoI 0.21 3.73 0.05 0.20 3.40 0.04
birdview (俯视) WiFlowCombo 0.19 3.71 0.03 0.18 3.38 0.03
birdview+ (长时俯视) WiFlowSimple 0.45 3.24 0.32 0.41 2.89 0.29
birdview+ (长时俯视) WiFlowRoI 0.21 3.41 0.05 0.19 3.13 0.05
birdview+ (长时俯视) WiFlowCombo 0.18 3.50 0.02 0.17 3.13 0.02

消融实验

1. CSI 预处理策略消融(基于 birdview+ 时间划分下的 WiFlowSimple)

预处理方案 (Preprocessing) EPE (↓) EPEM (↓, 运动像素) EPES (↓, 静态像素) EPEA (↓, 放大惩罚) 说明
常数全零基线 (Zero Prediction) 0.17 3.70 0.00 0.84 盲目预测全零导致运动区域误差极大
SavGol (时域平滑滤波) 0.59 3.64 0.44 1.14 滤除高频的同时抹平了快速运动瞬态
Fourier (时域傅里叶变换) 0.41 3.71 0.25 0.95 频域转换未消除天线间硬件相位漂移
Raw (幅值归一化 + 原始相位) 0.40 3.71 0.24 0.94 硬件相位随机噪声严重干扰运动捕捉
Quotient (多天线复数商数) 0.41 2.89 0.29 0.78 相消共模硬件误差,运动区域误差大幅下降 22%
PCA (前 150 主成分降噪) 0.47 2.95 0.35 0.82 降维滤除噪声,但略逊于天线归一化

2. 模型推理效率与算力对比(单张 RTX 6000 Ada GPU 上平均 1000 次测量)

模型架构 (Architecture) 推理延迟 (Time, ms) 计算量 (FLOPs, \(\times 10^9\)) 显存占用 (VRAM, MB) 综合评价
WiFlowSimple 23 22 380 单分支超轻量,延迟最低,但背景噪声明显
WiFlowRoI 26 22 380 二阶段检测裁剪,开销接近单流,背景洁净
WiFlowCombo 47 43 763 双分支并行前向,显存<1GB,精度与洁净度最佳

关键发现

  • 商数预处理是射频跨模态学习的核心基石:直接使用原始 CSI(Raw)虽然因全零背景占优在全局 EPE 上看似数值较低,但在真实运动区域上的误差高达 3.71;而天线商数归一化(Quotient)消除了收发机硬件相位共模偏移,将运动像素误差(\(EPEM\))压低至 2.89,实现了本质性的特征净化。
  • 解耦架构显著清除非运动伪影:WiFlowCombo 凭借掩码门控将静态背景区域的误差(\(EPES\))由单流 WiFlowSimple 的 0.40 彻底压低至 0.02,整体端点误差减小了 60% 以上;虽然 WiFlowSimple 在 \(EPEM\) 上因全局弥散平滑略显数值优势,但可视化定性结果表明其背景充斥着大量虚假流动斑块。
  • 多接收机空间分集具有饱和效应:实验通过递增接收设备(从 1 台 2 天线逐步扩展至 4 台 16 天线),发现当接收器数量增至 3 台时各项指标收益最为显著,达到 4 台后性能提升趋于平缓,表明 3-4 个空间分散观测点已足以消解室内三维反射路径的方位模糊性。
  • 优异的跨被试泛化能力:在完全未见过的测试人员(Subject Split)与训练集同人员(Time Split)之间,模型的端点误差波动小于 0.02 像素,证明 WiFlow 学习到的是物理层电磁多普勒扰动与空间速度场之间的普适映射关系,并未过拟合到特定个体的体态特征。

亮点与洞察

  • 开辟无源射频底层视觉新任务:首次打破 WiFi 感知局限于高层分类(姿态、手势、定位)的惯例,证明了商用射频信号蕴含足以恢复稠密底层光流场的空间物理关联。
  • 巧妙的双分支门控解耦设计:针对室内场景运动稀疏特性,通过并行的 Flow Block 与 Mask Block 组合(WiFlowCombo),以极简的点乘抑制了射频到图像空间映射中的背景幻觉噪声。
  • 完备的无源双重视角数据集:构建了首个包含 164 分钟、1 kHz 高频多天线 CSI 与毫秒级精准同步俯视/侧视双视角视频与 PseudoGT 光流的基准库,为射频跨模态视觉研究奠定了扎实基础。

局限与展望

  • 环境迁移性受限:与传统 WiFi 感知类似,室内多径反射严重依赖房间的具体几何构造与家具布局,在特定房间训练的模型直接迁移至全新物理环境时仍面临多径模式漂移挑战。
  • 伪真实标签(PseudoGT)的物理歧义:基于光学相机计算的伪光流不可避免包含阴影移动(Shadow Motion),而无线射频信号对光学阴影完全免疫,这种视觉表象与射频物理事实的不一致性给精细边界学习带来了固有噪声。
  • 多目标与分辨率瓶颈:当场景中存在多个人体朝不同方向交叉运动时,频域信号的多径叠加产生复杂混叠,且现有光流分辨率仅为 \(128 \times 168\),距离高清视觉需求仍有较大提升空间。

相关工作与启发

  • vs MM-Fi / Person-in-WiFi (多模态射频感知):以往基准仅关注三维骨架关键点回归或粗粒度二值分割,WiFlow 则进一步下探至密集像素运动场,能无缝对接下游各类基于光流的视觉分析管线。
  • vs RAFT (光学光流估计):RAFT 依赖两帧 RGB 图像之间的稠密局部特征匹配构建代价体;WiFlow 成功将其改造成利用天线/频域特征关联进行跨模态隐式运动场解码的通用引擎。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ [首次实现仅凭商用 WiFi CSI 预测连续稠密二维光流场,任务与表征极具突破性]
  • 实验充分度: ⭐⭐⭐⭐⭐ [自建高质量多天线同步数据集,覆盖预处理、架构、分辨率、天线规模及跨人全面评测]
  • 写作质量: ⭐⭐⭐⭐⭐ [逻辑严密,从硬件相移物理成因到网络解耦设计层层递进,消融剖析透彻]
  • 价值: ⭐⭐⭐⭐⭐ [为隐私敏感室内监护与全黑极端环境下的鲁棒运动感知提供了全新可落地的低成本范式型技术路线]