跳转至

Topological Periodicity Test (TopPT) via Confidence Bound of Time-Delay Embeddings

会议: NeurIPS2026
arXiv: 2512.06324
领域: 时间序列
关键词: 周期性检验、时间延迟嵌入、持久同调、子采样置信界、有界插值误差

一句话总结

TopPT 将延迟点云中的“早出生且长寿命的环”转化为带子采样置信半径的统计检验,在受限、定量分离的信号类上给出渐近误差控制;合成实验中 raw 规则检出两类周期信号且未拒绝四类结构化非周期信号,但插值误差修正明显降低检出率,真实呼吸数据只验证局部环结构检测。

研究背景与动机

周期检测通常从功率谱或自相关入手。Generalized Lomb–Scargle periodogram(GLS)、Fisher 的 \(g\) 检验等擅长发现标量序列中的频率成分,但“某个频率很强”与“系统在相空间里沿同一条轨道稳定循环”并不是同一件事。趋势、低频变化和非平稳振荡都可能产生显著谱峰。时间延迟嵌入提供了另一种视角:把同一信号在多个延迟时刻的取值组成向量,再观察这些向量是否围成闭环。SW1Pers 已说明滑动窗口几何与周期结构的联系,但仅看到持久同调图中的长条,还不能回答它是否足以超出有限采样带来的不确定性。

本文要补上的不是一个更复杂的周期评分,而是从连续信号、嵌入支撑集到有限样本检验的完整推理链。困难在于,任意“非严格周期”的信号并不一定没有环状几何;即便理论支撑集是圆,有限采样和线性插值也会改变环的出生、死亡尺度。因此作者先限制可检验的信号类,要求相位状态有定量分离、信号足够光滑且轨迹不退化,再证明嵌入的 reach 下界,最后把点云覆盖误差转成持久图的置信半径。这些假设是结论成立的组成部分,不能只保留“周期是圆、非周期是区间”的口号。

核心 idea:先证明两个受限信号类在小尺度拓扑上可分,再用子采样估计持久图误差,只在一个环足够早出生且寿命超过置信阈值时拒绝拓扑非周期原假设。

方法详解

整体框架

输入是标量观测及时间戳,输出是指定窗口、延迟和嵌入维度下的拒绝或不拒绝决定。流程依次是相位分离嵌入、子采样置信半径、插值误差修正和早生长寿检验:前者给出理论上应当寻找什么样的环,中间两步确定观察误差,最后一步把持久图中的点与误差阈值比较。

这里没有监督学习、训练标签或神经网络。理论分支使用精确延迟观测;离散标量观测先线性插值,形成观测延迟点云。raw 规则只使用子采样半径,robust 规则额外加入有界测量误差和插值误差修正。实验用 Vietoris–Rips(VR)持久同调作计算替代,而关于支撑集出生尺度的理论以距离函数、等价的 Čech 滤过为对象。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["标量观测与时间戳"] --> B["相位分离嵌入"]
    B --> C["子采样置信半径"]
    C --> D["插值误差修正"]
    E["已知误差和光滑性界"] -.->|robust 所需| D
    D -->|raw 不加修正| F["早生长寿检验"]
    F --> G["拒绝或不拒绝"]

关键设计

1. 相位分离嵌入:把受限周期问题变成圆与区间的拓扑区别

对每个锚点,嵌入收集该时刻及其后 \(m\) 个延迟时刻的标量值。作者用 \(m\) 表示延迟步数,因此向量实际位于 \(m+1\) 维空间;窗口总跨度是 \(m\tau\),并不是 \(m\) 或 \(\tau\) 单独决定几何。

\[ SW_{m,\tau}f(t)=[f(t),f(t+\tau),\ldots,f(t+m\tau)]^{\top}. \]

关键限制发生在信号定义上。Definition 3.2 的“非周期”要求相位轨迹 \(\Phi_f(t)=(f(t),f'(t))\) 在相关区间内单射,也就是两个不同时刻不能同时具有相同的函数值与一阶导数;这比通常意义上的“不存在全局周期”强得多。定量版本进一步要求,时间距离至少为 \(d\) 的两点,在函数值或一阶导数上至少相差 \(\epsilon\)。周期类则用模周期 \(\Xi\) 的时间距离衡量这种分离。两个假设类互不相交,但不互为补集:近常数、局部复现、混合节律以及部分非平稳振荡并未被统一纳入原假设。

为避免嵌入轨迹局部停滞,Assumption A.1 要求 \(f\) 为 \(C^{2,1}\),即二阶连续可微且二阶导数 Lipschitz;一阶、二阶导数绝对值及二阶导数 Lipschitz 常数由 \(L\) 控制,每个相关时刻至少有 \(|f'|\) 或 \(|f''|\) 不小于 \(\delta\)。这些条件必须覆盖扩展区间 \(J_{m,\tau}=[T_{\min},T_{\max}+m\tau]\),不能只检查锚点区间。周期情形还要求锚点观察区间至少包含一个完整周期,否则一段周期轨道也可能只是开弧。

局部曲率界和远距离相位分离共同防止自交、近自交。具体地,令 \(\nu_{\delta,L}=\frac{\delta}{16}\min\{1,\frac{\delta}{8L}\}\),尺度兼容要求 \(d<\frac{\pi\nu_{\delta,L}^{2}}{2L^{2}}\);延迟参数须满足 \(m\tau>\max\{\delta/(2L),\epsilon/(4L)\}\) 和 \(\tau<\min\{\delta/(8L),\epsilon/(16L)\}\)。总窗口够长、单步够密,才使标量相位分离能够转成整个延迟向量的分离。

reach 是支撑集到其 medial axis 的最小距离,可理解为最近点投影保持唯一的管状邻域半径。Theorems 4.1、4.3 给出以下共同的正下界,其中两个项分别对应全局分离和局部曲率控制:

\[ a_{m,\tau}=\sqrt{m+1}\min\left\{\frac{\epsilon}{32}\min\left\{1,\frac{\epsilon}{16L}\right\},\frac{\nu_{\delta,L}^{2}}{2L}\right\}. \]

在满足上述条件时,非周期支撑集同胚于区间,小于此界的邻域可缩;周期支撑集同胚于圆,小尺度邻域保留一个一维环。对应 Čech 支撑集持久图,原假设在出生尺度小于 \(a_{m,\tau}\) 的区域没有一维特征,备择则有一个 \((0,D)\),且 \(D\geq a_{m,\tau}\)。这里允许原假设在较大尺度出现人工闭合的环,所以最终检验必须同时检查出生位置,而不能只挑最长寿命。

2. 子采样置信半径:用点云覆盖误差衡量持久图不确定性

理论采样模型不是一般的随机时间序列模型,而是对一个固定、光滑的函数,在锚点区间按分布 \(Q\) 独立同分布抽取时刻,再获得相应的延迟向量。时间密度有正的上下界且 Lipschitz,因此支撑集不会有长期完全采不到的部分。规则时间网格、重叠窗口及带相关噪声的实际数据不能直接被这个 i.i.d. 定理覆盖;插值误差修正本身也不会消除这种依赖问题。

对大小为 \(n\) 的点云 \(X\),抽取大小为 \(b\) 的无放回子集 \(X_b^{(j)}\),计算原点云与每个子集之间的 Hausdorff 距离。因为子集包含于原点云,这个距离等于原点云各点到子集最近点距离的最大值:它测的是稀疏子集遗漏的覆盖尺度,而不是时间序列重采样后的谱峰变化。理论尾函数遍历所有子集,Algorithm 1 则用 \(B\) 次 Monte Carlo 子采样近似。

\[ L(t)=\binom{n}{b}^{-1}\sum_j\mathbf{1}\{d_H(X,X_b^{(j)})>t\},\qquad c_\alpha=2\inf\{t\geq0:L(t)\leq\alpha\}. \]

这里取的是上尾概率为 \(\alpha\) 的阈值,通常相当于距离分布的 \(1-\alpha\) 分位数,并且最终必须乘以 \(2\);不是取普通下侧 \(\alpha\) 分位数。持久图稳定性把 Hausdorff 误差转成 bottleneck 误差。Theorem 5.1 在 \(b\to\infty\)、\(b=o(n/\log n)\) 等条件下给出覆盖失败概率至多 \(\alpha+O((b/n)^{1/4})\)。Lemma 5.2 则说明固定嵌入参数时半径依概率趋于零。

附录 D、F 针对非周期支撑集有端点的问题补充了区间版本的子采样论证:端点小球概率质量是单侧的,主导常数与内部不同,作者据此扩展原先针对无边界流形的结果。笔记沿用论文陈述的局部质量正则条件,不把一般流形置信界不加说明地套给区间。另需区分理论全子集尾函数与有限 \(B\) 的估计:正文误差项不是对任意 Monte Carlo 次数都成立的额外精确校准保证。

3. 插值误差修正:将标量误差显式带到置信半径里

真实输入往往只有离散标量观测,延迟位置不一定落在采样网格上,因此先做分段线性插值。Assumption 3.5 要求网格覆盖整个扩展区间、每个标量测量误差有界于 \(\sigma_N\),并有真实信号二阶导数的上界 \(L_{\mathrm{int}}\)。网格最大间距为 \(\Delta_N\) 时,标量误差由测量项与二阶插值项相加;每个延迟向量有 \(m+1\) 个分量,欧氏误差因而放大为 \(\sqrt{m+1}\) 倍。

\[ \zeta_{m,N}=\sqrt{m+1}\left(\sigma_N+\frac{\Delta_N^2 L_{\mathrm{int}}}{8}\right),\qquad \hat c_\alpha^{\mathrm{err}}=\hat c_\alpha+5\zeta_{m,N}. \]

其中 \(\hat c_\alpha\) 是在插值后的观测点云上算出的子采样半径。附录 G 解释系数 \(5\) 的来源:原点云和子集各自受到最多 \(\zeta_{m,N}\) 的扰动,使 Hausdorff 距离变化最多 \(2\zeta_{m,N}\);乘以分位数前面的 \(2\) 后,半径变化最多 \(4\zeta_{m,N}\);再加上观测持久图相对精确持久图的 \(\zeta_{m,N}\),共得到 \(5\zeta_{m,N}\)。它不是随意调出的噪声系数。

Theorem 5.3 将同样的渐近覆盖形式扩展到此修正半径。如果有界测量误差只在高概率事件上成立,最终失败概率还要加上该事件补集的概率;无界 Gaussian 或 Laplace 噪声不能不加处理地使用确定性结论。robust 半径要趋于零,还需 \(\zeta_{m,N}\to0\),所以仅增加锚点数、但保持测量误差不变,不足以得到这一结论。合成实验中的 \(L_{\mathrm{int}}\) 来自密网格数值估计,并非另行认证的解析上界,原文明确保留了这一实验边界。

4. 早生长寿检验:既排除对角线噪声,也排除大尺度人工闭环

对每个一维持久点,记出生尺度为 \(b_\gamma\)、死亡尺度为 \(d_\gamma\),寿命是二者之差。置信半径 \(r_\alpha\) 在精确规则中取 \(c_\alpha\),在有界插值规则中取 \(\hat c_\alpha^{\mathrm{err}}\);raw 实验使用观测点云的 \(\hat c_\alpha\) 而不加修正。有至少一个点满足以下两个条件时,拒绝原假设:

\[ \exists\gamma:\quad b_\gamma\leq r_\alpha,\qquad d_\gamma-b_\gamma>2r_\alpha, \qquad A_\alpha^r=\{a_{m,\tau}>4r_\alpha\}. \]

出生条件说明它与理论中从零出生的真环兼容;寿命条件说明它到对角线的距离超过置信半径,不能仅靠与对角线匹配解释为噪声。边界约定也有意义:出生等于半径时仍符合拒绝条件,但寿命等于两倍半径时不拒绝。

理论误差控制还依赖分离事件 \(A_\alpha^r\)。Theorem 6.2 首先界定的是“错误且分离事件成立”的联合概率,而不是直接给出条件在 \(A_\alpha^r\) 上的错误率;不加分离条件的错误上界还包含 \(P((A_\alpha^r)^c\mid H_i)\)。因此这不是对任意有限样本、任意非周期信号都严格达到显著性水平的统一保证。固定 \(m,\tau\),半径收缩并满足理论假设时,两类错误才得到 \(\alpha+o(1)\) 的渐近上界;固定 \(\alpha\) 的这个陈述本身也不等于证明两类错误必然趋于零。

对事先固定、大小为 \(K\) 的有限参数网格,Corollary 6.4 为每个候选使用 \(\alpha/K\),任一候选拒绝即整体拒绝,结合相应分离事件给出联合误差控制。但这不自动解决“先在同一段数据上估计周期,再测试这些周期”的数据自适应选择问题。真实实验确实按实现出来的窗口—周期集合做 Bonferroni 修正,作者同时承认固定网格定理与这种程序之间仍有距离。

Čech 与 VR 的关系也必须保留尺度语义:主文 §2.2.1 用边长参数写 \(\mathcal C(\epsilon)\subseteq\mathcal{VR}(2\epsilon)\subseteq\mathcal C(2\epsilon)\),附录 B 则将 VR 定义为成对距离小于 \(2r\),写 \(\mathcal C(r)\subseteq\mathcal{VR}(r)\subseteq\mathcal C(2r)\)。这涉及不同参数约定,不能混用阈值。两者的 interleaving 说明计算替代的联系,并不意味着其持久图相同;要把 Čech 支撑集结论严格移植到实际 VR 决策,仍须跟踪尺度及相应界。

一个完整示例

考虑论文的 \(f_1\),其周期为 \(\Xi=2\pi/5\)。合成配置取 \(m=20\)、\(\tau=\Xi/(m+1)\),因而每个向量有 \(21\) 个分量。观测还需延伸到锚点区间末端之后的 \(m\tau\),这样最后一个向量才有完整数据。先线性插值形成点云,再对 \(n=336\) 个锚点抽取大小为 \(b=120\) 的子集,重复 \(500\) 次,按上尾阈值计算置信半径。

若某个环早出生且足够持久,raw 规则就拒绝;robust 规则用同一观测点云与持久图,但增加 \(5\zeta_{m,N}\),再重新检查两个不等式。这说明 robust 结果变弱不意味着“网络没学好”,而是更大的误差预算使长寿命条件更难满足,且可能破坏 \(a_{m,\tau}>4r_\alpha\) 的分离余量。下文 \(1.000\) 与 \(0.699\) 是同一信号在汇总实验中的两种规则拒绝率,并非某个单次样本的出生或死亡值。

损失函数 / 训练策略

TopPT不优化学习损失,也不训练分类器。嵌入、子采样和持久同调直接处理观测;误差与光滑性界是robust规则的输入,不能从测试拒绝率倒推得到。固定参数网格与真实数据自适应候选的统计边界已在上文分别说明。

实验关键数据

主实验

合成数据锚点区间为 \([0,2\pi]\),两类周期信号的已知周期均为 \(2\pi/5\)。\(f_1(t)=3/(2-\cos(5t))\);\(f_2(t)=5\log(\sin(10t)+5)+\exp(\cos(5t))\)。非周期例子分别为线性趋势、二次趋势、sigmoid 趋势及趋势叠加低频正弦。Table 1 每行平均了 \(100\) 个 seeds 与七种误差设置:无噪声,以及幅度界 \(0.02\)、\(0.05\)、\(0.10\) 的 uniform 和 truncated Gaussian 噪声。

共同配置为 \(N=400\) 个标量观测、\(m=20\)、\(n=336\) 个延迟锚点、\(b=120\)、\(B=500\)、\(\alpha=0.05\)。这里保留论文对 \(N\) 的实验用法,不与 Assumption 3.5 中网格从 \(s_0\) 编号到 \(s_N\) 的记号强行统一。表中周期行是检出率,非周期行是拒绝原假设的频率;这些有限实验频率不能替代理论误差保证。

信号 类别或结构 raw TopPT robust TopPT GLS Fisher \(g\) permutation
\(f_1\) 周期 1.000 0.699 1.000 1.000 1.000
\(f_2\) 周期 1.000 0.457 1.000 1.000 1.000
\(h_1\) 线性趋势 0.000 0.000 1.000 1.000 1.000
\(h_2\) 二次趋势 0.000 0.000 1.000 1.000 1.000
\(h_3\) sigmoid 趋势 0.000 0.000 1.000 1.000 1.000
\(h_4\) 趋势加低频正弦 0.000 0.000 1.000 1.000 1.000

来源:正文 Table 1、附录 I.1。三种标量基线均拒绝这四个结构化非周期例子,说明谱显著性与延迟空间闭环是不同检测对象,不宜推成“谱方法在所有周期任务上都无效”。

真实实验使用 raw TopPT,结果来自正文 Table 2。记录级拒绝表示至少一个经记录内修正的局部候选拒绝;窗口级拒绝表示该窗口至少有一个周期候选拒绝。

数据集 记录数 窗口数 TopPT 记录级拒绝 TopPT 窗口级拒绝 GLS:记录 / 窗口 Fisher \(g\)、permutation:记录 / 窗口
Fantasia 40 280 35/40 142/280 40/40;280/280 40/40;280/280
BIDMC 53 318 51/53 249/318 53/53;318/318 53/53;318/318

Fantasia 取前 \(90\) 秒、降采样到 \(25\) Hz,使用起点 \(0,10,\ldots,60\) 秒的七个重叠 \(20\) 秒窗口。BIDMC 取前 \(180\) 秒,经 \(0.05\)–\(0.8\) Hz 带通滤波后降采样到 \(25\) Hz,使用起点 \(0,30,\ldots,150\) 秒的六个 \(30\) 秒窗口。窗口均线性去趋势、标准化,嵌入采用 \(m=8\),最多 \(300\) 个锚点、\(300\) 次子采样。

附录 I.3 的子集大小取 \(b=0.99n\),作者将其定位为提高局部灵敏度的实践校准,并非 \(b=o(n/\log n)\) 的渐近配置。候选周期由 autocorrelation 和 Welch peaks 给出,最强提示乘以 \(0.9,1,1.1\) 后裁剪、去重;实现得到 Fantasia 共 \(825\) 个、BIDMC 共 \(954\) 个窗口—周期测试。TopPT 修正在窗口—周期对上,标量基线在窗口上,搜索对象不同。

这些数据没有拓扑原假设标签,也没有认证的测量误差或插值光滑性界,所以未运行 robust 真实数据检验。\(35/40\) 与 \(51/53\) 是记录拒绝计数,不是 accuracy;不能据此计算正确分类率或假阳性率。

消融实验

论文没有神经网络模块移除式消融。Table 1 中 raw 与 robust 的比较是误差修正分析;下面保留附录 Table 3 的非平稳压力测试,说明两种规则在严格假设类之外的行为。

信号 非平稳机制 raw TopPT robust TopPT GLS Fisher \(g\) permutation
\(g_1\) 相位漂移 0.791 0.137 1.000 1.000 1.000
\(g_2\) 幅度调制 1.000 0.714 1.000 1.000 1.000

来源:附录 I.2、Table 3;同样平均 \(100\) 个 seeds 与七种有界误差设置。\(g_1(t)=\sin(5t+0.18t^2)\),\(g_2(t)=\{1+0.18\cos(0.5t)+0.08t\}\sin(5t)\)。它们虽不严格周期,仍可能产生显著环状复现,因此拒绝不应作为 Section 6 拓扑原假设下的第一类错误来解释。

关键发现

  • 有界误差修正保留了四类结构化非周期例子的零拒绝率,但两类周期信号的拒绝率分别从 \(1.000\) 降至 \(0.699\) 和 \(0.457\),体现更大置信半径的保守性。
  • 相位漂移压力例子的 raw/robust 拒绝率为 \(0.791/0.137\),幅度调制为 \(1.000/0.714\);环状复现与严格周期不能等同。
  • 呼吸数据体现局部选择性,而非有标签分类性能。Figure 4 的最大寿命余量即寿命减 \(2\hat c_\alpha\);余量为正只满足寿命条件,还要同时检查出生尺度。

亮点与洞察

  • 把出生尺度纳入检验:长寿命本身不足以证明小尺度上有真环,因为开曲线也可能在大尺度被球覆盖封成洞。早出生条件使判据真正对应圆与区间的小尺度差异。
  • 将几何可辨识性与统计精度分开:\(a_{m,\tau}\) 衡量信号类给出的拓扑余量,\(r_\alpha\) 衡量观察不确定性。二者比较比单独报告“最大 persistence 很大”更能说明检测为何可信或为何暂时不可分。
  • 误差预算可追溯:\(5\zeta_{m,N}\) 同时处理持久图扰动和子采样半径扰动。此思路可迁移到其他需要插值或近似几何重建的拓扑检验,但必须另行证明相应误差界。

局限与展望

  • 原假设不是所有非周期信号:相位单射、定量分离、非退化光滑性与完整周期覆盖限制了适用范围。常数、部分复现、准周期和混合动力学需要单独建模。
  • 理论与实践采样不同:理论锚点 i.i.d.,真实序列和窗口具有依赖,且真实配置 \(b=0.99n\) 不处于所声明的子采样渐近区间。应发展依赖采样或更贴近实际窗口构造的覆盖理论。
  • 自适应搜索尚未获得相同保证:有限固定网格 Bonferroni 结果不能直接认证从同一数据估计的周期候选。样本拆分或选择后推断是可研究方向,而非本文已完成的步骤。
  • 计算替代仍需尺度衔接:实验 VR 图与理论 Čech 图不能当成同一个对象。严格实验认证应同时说明滤过参数约定和 interleaving 带来的阈值转换。
  • robust 的认证输入不足:合成实验使用数值二阶导数界,真实数据没有认证误差界;有限 Monte Carlo 分位数误差也应与理论全子集界区分。提升这些认证环节可能比单纯增加检测率更有价值。
  • 不拒绝不等于没有振荡:结论只是在测试窗口、候选周期和嵌入尺度下,没有发现满足该置信规则的环;噪声、节律漂移或过保守误差半径均可能导致不拒绝。

相关工作与启发

  • vs SW1Pers / Perea–Harer:共同利用滑动窗口的持久环表达周期结构;本文重点是定量 reach、有限点云置信半径及明确拒绝区域,而不是仅构造周期性分数。
  • vs Fasy et al. 的持久图置信集:子采样与 Hausdorff 到 bottleneck 的稳定性是既有工具。本文把它们接到信号特定的圆/区间分离上,并讨论有端点曲线和标量插值误差。
  • vs GLS、Fisher \(g\) 与 permutation max-periodogram:谱检验回答标量序列是否有显著频率结构,TopPT 回答延迟点云是否有超出置信尺度的早生长寿环。两者可以互补,不能将当前结构化 null 上的差异直接扩展成全面优劣排序。

评分

  • 新颖性: 4/5 — 将受限信号拓扑分离、reach 和子采样置信界接成可解释的检验链。
  • 实验充分度: 3/5 — 有结构化 null、误差修正、非平稳压力例子和真实数据,但实践校准与理论认证存在边界。
  • 写作质量: 4/5 — 假设和 raw/robust 区别较清楚,Čech/VR 参数约定及部分公式抽取仍需谨慎阅读。
  • 价值: 4/5 — 为周期检测提供可辨识性与不确定性并重的几何视角,当前更适合有明确假设的研究用途。