跳转至

Event-based Gaze Control Systems for Real-time Spin Estimation in Professional Ball Games

会议: ECCV 2026
论文: ECCV 2026
领域: 机器人 / 具身智能
关键词: 事件相机 / 视线凝视控制 / 球体自旋估计 / 混合视觉伺服 / 球面反差最大化

一句话总结

针对专业球类运动中高速旋转球体成像模糊、视场窄与平移旋转混淆难题,提出由事件相机、高速振镜与电控液体变焦镜头组成的凝视控制主动视觉系统,结合球面反差最大化离线算法与不确定度感知 CNN 实时在线优化,实现了高达 750 Hz 吞吐率、3 ms 延迟以及 1.2% 转速与 1.5° 旋转轴误差的超高精度无标记自旋估计。

研究背景与动机

在乒乓球、棒球、网球和高尔夫等高水平球类竞技中,球体自旋直接决定了马格努斯效应(Magnus effect)下的空间飞行轨迹与触台/触拍反弹动力学。乒乓球拉冲弧圈球转速可达 9,000 rpm,高尔夫切杆甚至超过 10,000 rpm,选手通过旋转施加战术欺骗或路线控制。因此,实时精确获知球体三维自旋对于击球预测、具身智能乒乓球机器人博弈乃至赛事高精度转播分析均至关重要。然而,使用常规视觉系统测量自由飞行中的未改装球体自旋面临双重物理瓶颈:一方面,高速线速度导致传统帧快门产生严重运动模糊,且极高转速远超帧率奈奎斯特采样极限,引发频域混叠;若采用广角相机,球体在画面中仅占数个像素,微弱的表面纹理(如厂商 Logo)完全不可辨识;若换用静态长焦镜头,则受制于极窄视场(FoV)与极浅景深,高速移动的球瞬间飞出视场或剧烈失焦。

即便引入具备微秒级时间分辨率和极高动态范围的事件相机(Event Vision Sensor, EVS),现有方案大多依旧依赖固定广角视野。在自由飞行过程中,球体的超高平移线速度会产生海量事件,这些由平移运动诱发的事件严重污染并淹没了球体自转产生的局部相位变化,导致平移与自转完全耦合;加之现有事件反差最大化(Contrast Maximization, CMax)算法均建立在二维平面投影假设之上,在曲面球体上会产生剧烈的深度畸变,事件在球体轮廓边缘过度堆叠聚簇,导致优化曲面陷入严重的伪局部极值,无法准确解耦真实三维自旋轴与旋转角速度。

为打破视野分辨率、动态平移混叠与曲面投影失真的三重困境,本文提出了一套软硬件协同的事件驱动凝视控制主动视觉系统(Gaze Control System, GCS)。通过双轴高速振镜实时补偿球体平移,配合电控液体镜头连续动态跟焦,使长焦 EVS 始终将球体锁定在视场中心并保持清晰成像,从而让捕获的事件流近乎纯净地编码球体自旋。核心 idea:设计由振镜与液体透镜驱动的超高速凝视主动视觉闭环,通过物理视线跟踪消除平移事件干扰;并提出球面反差最大化(s-CMax)消除球体几何投影畸变,结合异方差不确定度感知 CNN 与 GPU 并行优化,实现微秒级响应、毫米级跟踪与专业级无标记球体自旋实时估计。

方法详解

整体框架

系统分为硬件感知执行层、混合视觉伺服跟踪层、离线超高精度自旋提取层(s-CMax)与在线低延迟实时自旋估计层。在硬件端,外部三维球体定位系统(BPMS)以 200 Hz 持续提供三维粗球心轨迹;GCS 内部的双轴检流计振镜(Pan/Tilt Galvo Mirrors)以极低惯量(400 µs 阶跃响应,最大转速 142.5 rad/s)实时偏转视线轴,同轴配备的 Optotune 电控液体变焦透镜(3 ms 响应)根据深度连续重聚焦,使 50 mm 长焦 EVS(视场仅约 1.8°)牢牢锁定球体。在算法端,EVS 输出生成极性分离的时间表面并由 YOLO 实时检测球心二维偏差,闭环修正振镜跟踪误差;离线阶段采用光流法初值联合球面反差最大化(s-CMax)生成无伪影的高精度伪真实值标签;在线阶段由轻量化 ResNet-18 直接回归带异方差不确定度的自旋向量,并在 GPU 端并行对自旋幅值进行批量网格变分反差细化,最终经由逆不确定度加权滑动窗滤波输出稳定的三维旋转矢量。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    In["BPMS 3D球位流 + EVS 异步事件流"] --> S1["混合视觉伺服跟踪<br/>BPMS开环预测 + EVS 2D闭环伺服微调"]
    S1 --> S2["光流法自旋初值估计<br/>平面拟合切向速度 + 法向流约束最小二乘"]
    S2 --> S3["球面反差最大化 s-CMax<br/>逆正交投影上球 + 3D旋转反扭曲 + 球面直方图方差极化"]
    S3 --> S4["异方差不确定度感知 CNN<br/>15ms时间表面输入 + 3D自旋与对角对数方差回归"]
    S4 --> S5["GPU 并行批量反差细化<br/>固定预测旋转轴 + GPU一维网格并发搜寻最强反差幅值"]
    S5 --> S6["不确定度感知滑动窗滤波<br/>MAD离群剔除 + 逆方差加权平均 + 触碰事件重置"]
    S6 --> Out["实时 3D 自旋输出<br/>750 Hz 吞吐率 / 3 ms 端到端延迟"]

关键设计

1. 混合视觉伺服跟踪:开环三维动力学外推与闭环二维图像伺服协同锁球

窄视场(~1.8°)长焦镜头在观测 3 米处乒乓球时,视场截面直径仅约 9 cm,球体微小的平移滞后或击球变向极易导致出画。针对外部定位延迟与传感器噪声,系统构建了开闭环协同的双层伺服机制。开环层采用改进的 Nakashima 空气动力学模型(显式整合重力、空气阻力及根据上一时刻自旋反馈计算的马格努斯力),基于硬件同步触发器测得的延迟补偿未来球位,通过梯度下降求解振镜偏转角 \((\phi_0, \phi_1)\) 并调节液体镜头屈光度;闭环层则在 EVS 端将事件流转换为 5 ms 窗口的极性分离时间表面(Time Surface),经轻量 YOLO 实时检测球体中心 \((c_x, c_y)\) 与像素半径 \(r\)。当检测到二维中心漂移 \((\Delta u, \Delta v)\) 时,利用虚拟相机内参及估计深度反投影计算空间偏差补偿量: $\(\Delta p_t = z_t R_{vc}^{-1} K_c^{-1} \begin{bmatrix} \Delta u \\ \Delta v \\ 1 \end{bmatrix}\)$ 将该偏差叠加回滤波状态,使机械振镜能够以高达 142.5 rad/s 的角速度紧咬球体,在物理层面完全抵消图像平移速度,保证后续事件全部源自球面纹理转动。

2. 光流法自旋初值估计:正交投影法向流约束与超定方程组求解

直接进行高维反差最大化属于非凸优化,极易受局部纹理对称性或噪声影响而陷入鞍点。本文提出利用局部事件法向光流为后续球面优化提供高保真初值。在提取的球体掩码事件集内,利用局部时空平面拟合计算二维事件流速度,根据检测半径将其几何归一化后,根据球面正交投影关系提升为三维表面切向速度 \(v_k\)。由于切向速度满足 \(v_k = \omega \times x_k = -[x_k]_\times \omega\)(其中 \([x_k]_\times\) 为位置坐标的反对称矩阵),且光流测量受孔径效应限制仅能提供沿梯度方向的一维标量约束(法向流约束),设计正交投影算子 \(P_k = \frac{v_k v_k^\top}{v_k^\top v_k}\) 对观测模型进行降维投影。堆叠 \(N\) 个观测方程构建超定线性系统 \(b = A\omega\),通过带奇异值分解的线性最小二乘法快速解出粗略三维自旋向量,再经过一维全局幅值网格遍历与局部梯度细化,为反差优化构建坚实起点。

3. 球面反差最大化 s-CMax:球面逆映射与三维刚体反扭曲消除边缘伪聚簇

传统 CMax 算法将事件反扭曲到二维平面图像中,由于曲面球体投影到平面的非线性畸变,球体轮廓边缘切向速度在视平面投影迅速压缩,导致大量事件在边缘产生人造的高密度重叠,产生虚假的高反差峰值并严重偏置自旋轴。为彻底消除投影奇异性,s-CMax 显式建模球面几何:首先将时刻 \(t_k\) 的像素坐标 \((u_k, v_k)\) 提升至三维单位半球面: $\(x_k = \frac{u_k - c_x}{r}, \quad y_k = \frac{v_k - c_y}{r}, \quad z_k = -\sqrt{1 - (x_k^2 + y_k^2)}\)$ 根据候选角速度 \(\omega\) 与相对参考时间差 \(\Delta t_k = t_k - t_{\text{ref}}\),利用罗德里格斯公式构造 \(SO(3)\) 旋转矩阵反扭曲该三维点 \(x'_k = R(-\omega \Delta t_k) x_k\);随后转换到单位球面极坐标系 \(s'_k = [\theta'_k, \phi'_k]\)(其中 \(\theta'_k = \arcsin(z'_k)\),\(\phi'_k = \text{arctan2}(y'_k, x'_k)\)),在球面经纬网格上双线性累加构建扭曲事件图像 \(I[s]\) 并经 \(5 \times 5\) 高斯平滑。最终通过 Nelder-Mead 单纯形算法直接最大化球面直方图方差 \(\text{Var}(I(\omega))\)。由于事件在球面真正物理位置对齐,彻底杜绝了边缘聚集伪影,自旋轴误差大幅下降至 1.5°。

4. 异方差不确定度感知 CNN:免人工标注的纹理感知与自适应置信度学习

离线 s-CMax 需数十毫秒单纯形迭代,无法胜任实时机器人控球反馈;且在球体光滑无字面朝向相机或 Logo 出现自遮挡时,盲目回归自旋必然导致发散。本文以 ResNet-18 为骨干网络构建在线预测器,输入为 15 ms 的极性分离掩模时间表面,输出包含三维自旋归一化向量 \(\hat{\tilde{\omega}}\) 以及各分量的对数方差向量 \(s = (s_x, s_y, s_z)\)(其中 \(s_i = \log \sigma_i^2\))。模型完全由离线 s-CMax 在近 4,000 段真实击球事件上提炼出的伪真实值驱动训练,采用异方差高斯负对数似然损失函数进行监督: $\(\mathcal{L}(\hat{\tilde{\omega}}, s) = \frac{1}{2} \sum_{i \in \{x, y, z\}} \left[ \exp(-s_i) (\tilde{\omega}_i - \hat{\tilde{\omega}}_i)^2 + s_i \right]\)$ 该损失函数赋予网络无需人工硬标签即可自主感知“信息匮乏”的能力:当 Logo 旋转至球体背面、事件稀疏模糊时,网络自发预测极高的方差 \(s_i\) 以避免惩罚;当清晰纹理条带掠过时,方差迅速收敛,输出高度可信的自旋方向与模值。

5. GPU 并行批量反差细化与逆方差滤波:先验导向的高并发提精与多视点融合

针对神经网络在高转速区间训练样本稀疏导致的幅值低估现象,系统采用“CNN 给出轴向先验,GPU 暴力搜索幅值”的异构加速策略。由于旋转轴方向通常受击球拍面约束相对容易泛化,系统将时间表面在 GPU 显存内快速解压为事件集,沿 CNN 预测的单位旋转轴方向,在有效转速区间内并行分配数千个 CUDA 线程同时评估不同幅值下的球面直方图方差;若最强反差候选点的方差显著超过 CNN 预测点,则保持方向不变仅替换幅值。在时间聚合层面,维护容量为 45 帧的历史队列,执行基于绝对中位差(MAD)与不确定度阈值的离群值剔除,并按照预测方差的倒数 \(\sigma^{-2}\) 进行加权融合。该模块在多 GCS 视点部署时,可自适应挑选当前视角下不确定度最低(即 Logo 正对视野)的相机输出,即使单视角出现 2.2% 的全隐蔽轨迹,全系统依然保持毫秒级连续稳定测定。

实验关键数据

主实验

论文在带高精度电机编码器与 AprilTag 位姿标定的转球机(Ball Spinner)基准数据集上,全面评测了不同球种、转速(1,000–9,000 rpm)与姿态下的离线估计精度;同时在发球机(Ball Thrower)自由飞行抛球实验中,严格对比了常规静态广角 EVS 与本文 GCS 主动凝视系统的性能差异。

表 1:转球机(Ball Spinner)基准测试集上各方法自旋估计精度与耗时对比

方法 自旋幅值误差 [%] ↓ 自旋轴误差 [°] ↓ 单帧运行耗时 [ms] ↓ 特性与限制
Gossard et al. (Flow) [16] \(35.2 \pm 19.5\) \(37.1 \pm 24.2\) \(7.7 \pm 14.1\) 依赖事件率峰值探测,受周期性约束强
Flow (本文初值方法) \(17.3 \pm 22.6\) \(9.0 \pm 17.6\) \(7.3 \pm 13.3\) 几何法向流投影求解,误差大幅压低且稳定
Nakabayashi et al. (CMax) [26] \(8.2 \pm 14.3\) \(5.0 \pm 10.4\) \(317.4 \pm 425.3\) 平面投影反差,易在球轮廓边缘聚簇伪收敛
s-CMax (本文离线完整模型) \(1.2 \pm 2.3\) \(1.5 \pm 2.2\) \(36.7 \pm 19.5\) 球面逆投影无伪影,耗时仅基线 1/9 且精度全面领跑

表 2:发球机自由飞行带点乒乓球实验下静态广角 EVS 与 GCS 系统性能对比

传感器硬件配置 自旋估计算法 自旋幅值误差 [%] ↓ 自旋轴误差 [°] ↓ 真实状态与失效机理分析
静态广角 EVS [16, 26] Gossard et al. (Flow) [16] \(18.8 \pm 12.9\) \(88.7 \pm 8.1\) 轴向近乎完全垂直,光流完全锁定在球平移速度上
静态广角 EVS [16, 26] Flow (本文方法) \(14.1 \pm 8.7\) \(59.9 \pm 5.0\) 平移运动严重污染自转相位,无法解耦真实角速度
静态广角 EVS [16, 26] CMax [26] N/A N/A 分辨率过低导致球体事件数严重匮乏,反差无法收敛
静态广角 EVS [16, 26] s-CMax (本文方法) N/A N/A 事件点数不足以支撑球面统计累加
GCS 主动系统 (本文) Gossard et al. (Flow) [16] \(14.7 \pm 12.6\) \(75.6 \pm 18.5\) 仍受制于频域特征提取脆弱性
GCS 主动系统 (本文) Flow (本文方法) \(18.0 \pm 5.4\) \(11.8 \pm 29.4\) 振镜消除平移后,光流能成功锁定大致自旋轴
GCS 主动系统 (本文) CMax [26] \(10.0 \pm 20.0\) \(12.3 \pm 29.3\) 恢复可用估计,但受平面边缘虚假反差困扰
GCS 主动系统 (本文) s-CMax (本文方法) \(2.1 \pm 2.5\) \(5.4 \pm 3.7\) 物理平移消除与球面投影结合,自由飞行下取得极高精度

消融实验

在 7 场专业选手真实乒乓球对抗赛(包含 1,050 段完全独立的自由飞行测试集,覆盖 0–9,000 rpm)中,对在线 CNN 与不确定度感知滤波模块进行了深入切片评估。

表 3:真实对抗赛测试集上 CNN 预测在不同不确定度分位数与转速区间的表现

评估转速区间 (rpm) 测试样本数 \(N\) 10% 置信最优分位数误差 (幅值 / 轴向) 50% 置信中位数分位数误差 (幅值 / 轴向) 100% 全样本分位数误差 (幅值 / 轴向)
0 – 2,000 16,820 4.2% / 3.1° 6.5% / 4.8° 12.8% / 8.2°
2,000 – 4,000 24,372 5.8% / 4.2° 7.9% / 5.7° 16.4% / 10.5°
4,000 – 6,000 540 7.1% / 5.0° 9.8% / 7.2° 21.5% / 13.6°
6,000 – 8,000 1,021 8.9% / 6.3° 12.4% / 8.9° 28.0% / 17.1°
8,000 – 10,000 43 11.2% / 7.8° 15.6% / 11.2° 34.2% / 22.4°
全局汇总 (All Ranges) 42,796 5.4% / 3.8° 8.8% / 6.4° 15.2% / 9.8°

关键发现

  • 平移混叠是静态相机的致死弱点:表 2 明确揭示,静态广角相机看似给出了 14%–18% 的“合理”转速,但轴向误差高达 60°–88°,这意味着静态相机测得的仅仅是发球机抛球时的飞行动能(平移速度与转速耦合),所谓的“转速数值”完全是数值巧合。GCS 的物理视线补偿是获得可信自旋的必要前提。
  • 球面投影破除非凸陷阱:在转球机基准上,s-CMax 相比传统平面 CMax 将转速误差从 8.2% 压缩至 1.2%,轴向误差从 5.0° 压缩至 1.5%,同时耗时从 317 ms 暴降至 36.7 ms(缩减近 90%)。这是因为球面映射避免了球体外轮廓的虚假事件重叠,目标函数曲面更加光滑单峰,使单纯形法极少在边缘局部极值点震荡。
  • 不确定度具备强物理自洽性:从表 3 可以看出,过滤掉高不确定度帧后,预测误差单调急剧下降;在 7 场精英对抗赛的 2,642 条飞行段中,只有 2.2% 的轨迹遭遇了 Logo 全程不可见,异方差方差能精准反映 Logo 的物理可见度,支撑多视角系统实现几乎无损的自动权重平滑切换。

亮点与洞察

  • 主动光学跟踪与事件相机的优雅结合:不同于通过物理旋转相机或堆叠昂贵高速相机的笨重路线,利用双轴轻量检流计镜(转速 142.5 rad/s)与毫秒级电控液体变焦透镜同轴控制视野,在完全不给球体涂布特殊标记的前提下,将微小球体局部放大十倍并彻底抹去空间平移分量,构成了从源头净化信号的极佳硬件范例。
  • 几何物理先验与深度学习的闭环互哺:离线端依靠严谨的立体几何正交投影与球面反差优化(无需人工标注)自动解算伪真实值;在线端使用轻量 ResNet-18 拟合时间表面并输出异方差不确定度;遇到极限工况再借助 GPU 沿网络预测轴高并发并发寻优。兼顾了物理模型的泛化稳健性与神经网络的极限低延迟。
  • 可迁移的工业与机器人视觉范式:这套“双轴振镜主动注视 + 电控变焦 + 事件相机亚毫秒触发”的体系,不仅适用于高尔夫、棒球等职业体育分析,更能直接无缝推广到高速传送带上的细小异形零件在线无损检测、无人机极速避障以及近距离高速空间碎片捕获系统。

局限与展望

  • 纯白无字球体的不可观测性:算法本质上依赖球体表面微小几何纹理或文字标识(如 ITTF 认证印标、棒球缝线、高尔夫凹坑)。若采用完全均质光滑且未印制任何字样的白球,事件相机在匀速自转时无法产生亮度变化脉冲,系统将失去测量基础。
  • 极端多球与严重遮挡时的轨迹争夺:虽然系统结合了 9 相机 BPMS 粗定位与 EVS 局部检测,但当运动员身体出现长时间深度遮挡、或训练场多球乱飞时,混合跟踪器仍有概率出现振镜误摆。
  • 未来方向:探索在红外波段下利用不可见的微结构自旋特征,结合神经辐射场或极低位宽微型硬件 ASIC 加速芯片,将整套实时凝视估计算法直接固化在边缘智能相机端。

相关工作与启发

  • vs 静态广角事件自旋估计 (Nakabayashi et al., Gossard et al.): 静态方案受限于几像素的小球成像,且无法在物理层面解耦飞行的平移事件,在真实抛球下旋转轴彻底失效(误差 >60°);本文采用主动振镜与液体透镜,不仅分辨率提升数倍,更从物理上消除了平移事件,并在曲面建模上提出了无边缘人造反差伪影的 s-CMax。
  • vs 传统多曝光与点阵标记测速 (Sueishi et al., SpinDOE): 早期工作大多要求在球体表面人工涂画复杂的黑白点阵(Dotted balls)或特定几何标记,无法在正规职业赛事中落地;本文面向完全合规、未做任何物理改动的商业级专业比赛球,真正具备实战部署价值。
  • vs 轨迹气动力学反演算法 (Conti et al., Bi et al.): 通过拟合飞行马格努斯弧度反推自旋需要球体飞行相当长一段距离后才能收敛,具有显著的时间滞后,且易受场馆微弱空调气流扰动;本文基于光学直接凝视表面纹理,在击球离拍后数毫秒内即以 750 Hz 频率锁定自旋,为机器人极速回击提供了不可替代的即时先验。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 首次将双轴振镜、电控液体透镜与事件相机结合构建主动凝视系统,并提出了独创的球面反差最大化算法。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖物理转球机多球种验证、发球机控制对照、7 场真实顶级职业对抗赛超 40,000 帧量化评测,软硬件指标极其详实。
  • 写作质量: ⭐⭐⭐⭐⭐ 系统架构清晰完备,从光流线性解到非凸球面反差,再到异方差网络与 GPU 细化,层层递进,物理自洽。
  • 价值: ⭐⭐⭐⭐⭐ 成功落地于 Nature 2026 顶级具身智能乒乓球机器人实战系统,对高速主动视觉、体育大数据分析与机器人极速交互具有重大开创价值。