跳转至

Progressive Memory Transformer: Memory-Aware Attention for Time-Series

会议: NeurIPS2026
arXiv: 2609.31351
代码: https://github.com/dsb-ifi/pmt
领域: 时间序列
关键词: 可写记忆、多尺度表示、对比学习、低标签分类、时间序列预测

一句话总结

PMT 把随滑动窗口更新的可写记忆显式暴露为中尺度表示,并分别监督 token、记忆和序列摘要,在七个低标签分类数据集上取得平均 84.4% 准确率,同时用线索保留探针验证记忆确实携带跨窗口信息。

研究背景与动机

时间序列中的可用信息并不只存在于两个端点:逐点变化适合预测,整段摘要适合分类,而步态、振动模式等中间尺度的重复片段同样需要稳定表示。TS2Vec 用逐级最大池化形成多分辨率监督,TS-TCC 用跨视图未来预测与上下文判别结合,SoftCLT 则通过时间距离和样本相似度设置软正样本。这些方案能够利用时间结构,但中间状态往往仍是被压缩或间接塑形的内部变量,缺少一个可直接读取、直接监督的中尺度接口。

单纯增加记忆也不自动解决这个问题。Transformer-XL 把历史激活当只读缓存,循环网络通过隐藏状态传递上下文;它们能携带过去,却不一定把状态组织成与当前时间窗口对齐的模式表示。另一方面,全局潜变量或全局记忆库虽能压缩上下文,却很难指定“这一窗口的这一槽位”应该在两种增强下保持什么。本文的切入点不是让全局分类向量更大,而是改变骨干暴露给训练目标和下游任务的表示接口。

因此,架构和目标必须一起设计:先让每个窗口产生样本特定的可写槽位,再用与这个接口粒度一致的损失监督它,同时保留局部 token 和全局摘要。核心 idea:把窗口对齐的渐进记忆变成独立的中尺度表示,并用局部连续性、中尺度跨视图一致性和全局实例一致性分别塑造三个层级。

方法详解

整体框架

输入是多通道时间序列,先经一维卷积得到 patch token,再展开成长度为 \(W\)、步幅为 \(S\) 的重叠窗口。渐进记忆注意力(Progressive Memory Attention,PMA)沿窗口推进,更新当前 token 和少量记忆槽位;堆叠多个 PMA 块时,同一窗口还接收上一层的 token 和记忆,因此存在时间方向的横向传播与深度方向的纵向传播。

随后,重叠聚合与分层读出把重复位置合并回固定长度 token 流,并通过局部掩码编码器及全局 [CLS] 得到局部 token、中尺度记忆、全局摘要三个接口。三尺度监督只在训练时作用于这些接口;推理时不需要成对增强或对比损失,下游任务选择适合其粒度的表示。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    X["时间序列<br/>卷积与窗口化"] --> A["渐进记忆注意力"]
    H["上一窗口记忆"] -->|横向传播| A
    V["上一层 token 与记忆"] -->|纵向传播| A
    A --> B["重叠聚合与分层读出"]
    A -->|更新后的记忆| H
    B --> R["局部 token / 中尺度记忆<br/>全局摘要"]
    R --> O["下游探针<br/>推理数据流"]
    R -.-> C["三尺度监督<br/>训练时 HGCL / PCL / ICL"]

关键设计

1. 渐进记忆注意力:让同一窗口同时获得历史摘要和上一层表示

每个 PMA 块在处理新窗口时,不重新读取全部过去 token,而是接收上一窗口在同一块产生的记忆。与此同时,它接收当前窗口在上一块的记忆和 token,把两类上下文与当前证据拼接后,用一次多头注意力联合更新。记忆槽位既参与查询,也参与键和值,因此可以在一次注意力计算中读历史并写入新证据;它们不是处理后就丢弃的共享提示 token,而是随当前样本逐窗演化的状态。

\[ W_{w,b},M_{w,b}=\mathrm{PMA}\!\left(M_{w-1,b},\bar M_{w,b-1},\bar W_{w,b-1}\right). \]

这里 \(w\) 是窗口索引,\(b\) 是块索引,横向项来自上一窗口,带横线的两项来自上一块并经过门控。记忆门把继承状态与可学习的重置状态混合,以减少旧模式在状态切换后继续占据槽位;token 门把已处理 token 与原始 patch 表示混合,避免历史上下文抹去细粒度变化。每个块的首窗口从重置状态开始,因而不是跨独立样本共享不断累积的记忆。

掩码是不对称的:记忆查询可读取拼接后的输入;窗口查询可读取上一窗口记忆及本窗口严格因果部分,但不能读取上一层的当前窗口记忆,以阻断可能包含窗口后部信息的摘要向前泄漏。这是局部更新约束,不应被扩大成“任意实现的整个骨干都严格因果”。预测实验另用只包含过去的输入切片保证特征因果性。

原文主文把记忆门描述为重置横向携带记忆,但附录 A.1 与算法 1 将门控明确写在上一层的当前窗口记忆上。此处保留这一实现描述差异:图中的横向与纵向来源按式 (1) 区分,不把重置门的位置重新猜成统一版本。

2. 重叠聚合与分层读出:保留局部细节,同时让中尺度状态独立可见

窗口重叠时,一个全局 token 位置会产生多个上下文化输出。如果直接拼接,后续块的序列长度会不断膨胀;简单平均又会忽略不同窗口对同一位置提供的上下文质量。本文对每个位置设置单查询交叉注意力,只在该位置的重叠副本间选择和融合,加入按注意力头及重叠位置学习的偏置,再经过缩放、归一化和可学习门,与掩码均值跳连融合。这样每个 PMA 块输出仍有原来的 token 长度,而不是把滑窗副本全部传给下一层。

PMA 栈输出后,短编码器栈进一步处理 token:普通 token 只读取局部历史邻域,[CLS] 可读取整段以形成全局摘要。最终块的各窗口记忆被单独保留,不能被这个全局读出代替。于是预测使用局部表示,线索保留使用末窗口记忆,低标签分类使用 [CLS];三个接口可分别检验,而不是让所有任务都挤进一个 pooled vector。

这也解释了“渐进”并不等于必须靠很深的网络才能看到整段历史。横向记忆在第一块就可携带此前窗口的信息,深层块进一步重组摘要与局部证据;附录 A.3 给的是名义感受野上界,并非每个 token 实际利用了上界内所有输入的保证。

3. 三尺度监督:分别约束局部连续性、记忆模式和全局实例

中尺度的 PMA 对比损失(PCL)直接使用最终 PMA 块的归一化记忆槽位,没有额外投影头。一个槽位的正样本是同一样本第二视图中相同窗口、相同槽位的状态;负样本来自批内其他序列,同源序列的所有槽位都排除。这样训练信号瞄准窗口级模式而非缓存原始 token,但“每槽一个模式检测器”仍是机制直觉,不是对槽位语义的人工标注保证。

\[ \mathcal L_{\mathrm{PCL}}=-\mathbb E_{m_a}\log\frac{\exp(\langle m_a,m_p\rangle/\tau)}{\exp(\langle m_a,m_p\rangle/\tau)+\sum_{m_n\in\mathcal N_a}\exp(\langle m_a,m_n\rangle/\tau)}. \]

相似度为余弦相似度,损失在两个视图方向上求平均;附录每个锚点采样 512 个负槽位,并对锚点分块计算以控制激活内存。直接监督整个槽位向量,是让记忆从内部状态变成可用表示的关键,而不仅是把上下文传播距离加长。

局部的层次高斯对比损失(HGCL)在投影后的 token 上同时计算窗口内 token 项和序列内窗口项。两者都以第二视图的对齐位置为正样本,邻近位置或窗口按时间距离获得高斯权重,负样本仅来自其他序列;窗口表示由其 token 均值归一化得到。高斯宽度由窗口长度和步幅决定,不需要预先计算 DTW 或数据空间距离,因此局部结构先验来自窗口几何。

需要区分作者的“软正样本”解释与实际式子:附录 A.11 的分子只有对齐正样本,其他邻居的加权相似度先合成一个 bucket,再以额外指数项进入分母,并非把所有软正样本直接相加到分子。不能将其简化成常见的多正样本 InfoNCE,也不能仅凭“软正样本”措辞推断每个邻居都被直接拉近。

全局实例对比损失(ICL)通过两层 GELU MLP 投影 [CLS],拉近同一序列两种视图、区分其他序列;每个锚点有 \(2(\mathcal B-1)\) 个其他实例视图作为负样本。HGCL 与 ICL 使用尺度特定的投影,PCL 不投影,这个差别让记忆本体直接承受跨视图一致性约束。

一个完整示例

附录 A.3 使用一个说明性 token 序列:\(K=500\)、\(W=100\)、\(S=25\)、\(B=4\),共有 17 个不补齐的有效窗口。这是感受野算例,不是 FordA 实验的原始波形 tokenizer 配置。

第一窗口处理前 100 个 token 并写入记忆;第二窗口在重叠局部证据外,还接收第一窗口摘要。这样逐窗推进,到第 17 窗口时,第一块的名义历史覆盖已经可达 500 个 token;四块的未截断上界为 725,但实际仍受 \(K=500\) 限制,额外深度用于重组已覆盖信息而非创造新输入。

重叠聚合把同一位置的不同窗口输出融合回 500 个位置,最终读出局部 token、17 个窗口的记忆和一个全局摘要。训练时两种增强在这三处形成对应关系;推理时若只测试早先线索是否保留,探针只读末窗口记忆,不遍历所有窗口寻找线索。

损失函数 / 训练策略

弱视图使用通道级 z-scaling 和低方差高斯噪声,强视图额外使用时间扭曲和幅值扭曲,两个视图共享骨干。HGCL 自身由 token 项与窗口项加权组成,外层再组合三个尺度的损失:

\[ \mathcal L_{\mathrm{total}}=\lambda_{\mathrm{ICL}}\mathcal L_{\mathrm{ICL}}+\lambda_{\mathrm{HGCL}}\mathcal L_{\mathrm{HGCL}}+\lambda_{\mathrm{PCL}}\mathcal L_{\mathrm{PCL}}. \]

训练采用 AdamW、余弦学习率调度、5% warmup,峰值学习率 \(10^{-4}\)、最低 \(10^{-6}\),批大小 256。主实验的损失权重按数据集调节;全部权重为 1 是表 5 的消融参照和建议起点,不是表 1 的统一配置。附录 E.6 明确说明这一点,不能把主实验成绩宣传成“无需逐数据集调参”所得。

分类先无标签预训练,再冻结骨干,用 1% 或 5% 标签训练线性 SVM。预测则冻结编码器,用每个预测跨度独立的岭回归;其 tokenizer 改为 patch 大小和步幅均为 1,通过左填充的过去窗口、\(P=200\) 的 sliding-encode 产生特征,与分类的 patch 配置不同。

实验关键数据

主实验

表 1 的低标签线性探针结果如下,每格为准确率 / macro-F1(%);比较两条最强时间序列 SSL 基线,不把它们统称为每个设置的 SOTA。

数据集 / 标签比例 PMT TS2Vec+SoftCLT TS-TCC+SoftCLT
HAR / 1% 92.9 / 93.2 91.0 / 91.0 82.9 / 82.8
HAR / 5% 95.5 / 95.9 92.1 / 92.1 92.6 / 92.6
Wafer / 1% 98.7 / 96.5 95.3 / 88.1 96.5 / 96.5
Wafer / 5% 99.0 / 97.2 98.8 / 96.8 98.2 / 98.2
FordA / 5% 89.5 / 89.5 92.5 / 92.5 93.2 / 93.2
FordB / 5% 76.7 / 76.7 78.8 / 78.6 88.0 / 88.0
ElectricDevices / 5% 65.9 / 60.8 62.4 / 54.4 65.1 / 63.8

七个数据集、两种标签比例的总体平均准确率为 PMT 84.4%、TS-TCC+SoftCLT 83.1%、TS2Vec+SoftCLT 82.5%。优势不覆盖所有指标:ElectricDevices 的 5% 准确率更高,但 macro-F1 低于 TS-TCC+SoftCLT;FordA/B 的 5% 标签结果明显落后。

原文正文称准确率在 14 个设置中胜出 11 个,但表 1 中 Epilepsy / 5% 与 TS2Vec+SoftCLT 同为 96.7%,另有三个设置低于其他基线。因此,按严格胜出计数是 10 次胜出、1 次并列、3 次落后;这里保留正文措辞与表中数值的口径差异,不改动原始成绩。

预测表 3 比较的是在相同窗口化协议下重训的 SoftCLT,不是直接照搬其原论文成绩。五个跨度的平均 MSE 中,多变量 Electricity 为 PMT 0.404 对 SoftCLT 0.505,多变量 ETTh1 为 0.728 对 0.742;但单变量 ETTh1 在跨度 24 时为 0.103 对 0.045,短期预测明显较弱,其平均 MAE 也为 0.322 对 0.309。

消融实验

表 2 的 FordA 线索保留使用未在预训练中出现的 Hann 突发信号,探针只读取末窗口状态。AUC 是 ROC-AUC;Top-1 与 macro-F1 使用概率 0.5 阈值,数值在 0–1 范围内。

配置 EOS AUC EOS Top-1 EOS macro-F1
TS2Vec+SoftCLT 0.649 0.638 0.604
Transformer-XL 0.933 0.795 0.790
xLSTM 0.956 0.820 0.817
PMT,关闭 PCL 0.983 0.831 0.824
PMT,完整模型 0.994 0.921 0.920

该探针使用非重叠窗口变体;突发幅度为通道标准差的 0.5 倍、宽度为序列长度的 20%,标准差计算排除线索区间。冻结骨干只证明线索证据可从末状态恢复,不等于模型在自然数据上学会任意事件的长程因果关系。

表 5(a) 是 FordA、HAR、POC、Wafer 四个数据集、两种标签比例的平均分类结果,完整参照使用三个外层权重均为 1。

配置 Top-1(%) macro-F1(%)
三个损失,全部权重 1 87.49 86.06
关闭 ICL 83.33 81.23
关闭 HGCL 84.69 82.37
关闭 PCL 87.33 86.01
仅 ICL 81.37 79.59
仅 HGCL 82.51 79.17
仅 PCL 81.58 79.25

关键发现

  • PCL 对 [CLS] 分类的直接增益很小:关闭它只降低 Top-1 0.16 个百分点;但在末记忆探针上,完整模型比关闭 PCL 高 0.090 Top-1、0.096 macro-F1。表示粒度与探针粒度匹配后,模块价值才显现。
  • 原文把 AUC 小幅上升、阈值指标明显上升解释为校准改善;没有报告专门的概率校准指标,因此更稳妥的结论是固定阈值下可分性改善。
  • tokenizer 步幅比 patch 长度更敏感:表 6(b) 中步幅从 patch 长度的 10% 增至 100%,FordA 准确率从 87.7% 降到 62.5%。不能只调损失权重而忽略输入分辨率。
  • HAR 的短程窗口消融表 E.4 在窗口比例 0.10–0.30 时准确率为 92.7%–92.8%,完整窗口时为 92.3%;这支持较小窗口,而非深度或窗口越大越好。

亮点与洞察

  • 把“能传递状态”与“状态值得直接监督”分开设计。窗口对齐和显式读出使记忆有了可检验的用途,而不只是让最终分类器得到更多上下文。
  • 线索保留同时比较完整模型与同架构无 PCL 版本。前者检验监督增益,后者检验接口本身,较单独报告分类准确率更能定位贡献。
  • 预测、记忆探针、分类分别读取三个接口。这个评测方式可迁移到其他多尺度模型,但需要独立构造与中间状态对应的任务,不能以最终读出代替全部验证。

局限与展望

  • 作者承认固定步幅卷积需要逐数据集选择;短暂相位和频率事件容易被粗步幅损伤。可探索信号自适应 tokenizer 或加入预测目标,但本文没有验证这些扩展。
  • 三个 InfoNCE 目标依赖足够大的批内负样本,极小数据集被排除,批大小 256 对受限硬件也有压力。动量队列是可能方向,不是已验证结果。
  • 架构替换实验中的 xLSTM、Transformer-XL 没有可接 PCL 的同类接口,只训练 HGCL 与 ICL。因此表 4 比较的是“接口及其可用监督”的组合,不是三者完全相同目标下的纯架构隔离。
  • 不应将流式 PMA 的开销优势外推至完整 PMT:表 C.2 中完整 PMT 峰值内存 12,337 MB、延迟 5,381.27 ms,FlashAttention 基线为 8,336 MB、3,476.55 ms。该非流式配置有重叠窗口物化和额外编码器,且参数量分别为 20.1M 与 7.4M。
  • 原文存在配置表述差异:附录 B 写卷积 kernel 与 stride 均为 \(k\),表 6 却独立扫描 patch 与 stride,附录 C 另用 16 样本 patch 和 8 倍压缩。应以具体实验配置区分,而非断言所有实验都采用不重叠 patch。

相关工作与启发

  • vs TS2Vec / SoftCLT:它们用层次池化或软相似度塑造多尺度表示;PMT 保留 token 流,把窗口记忆独立交给 PCL。HGCL 的邻居权重来自窗口几何,而非 SoftCLT 的数据空间相似度与 DTW。
  • vs Transformer-XL / xLSTM:两者通过缓存或循环状态传递历史,PMT 增加可写、窗口对齐、可直接监督的状态接口。优势并非所有低标签设置都成立,FordB 的 5% 结果仍提示预测式预训练的价值。
  • vs HiMTM / PatchTST:前者通过多尺度重建与自蒸馏学习层级,后者通过 patch 和注意力扩大上下文;PMT 关注三个独立的对比表示接口。本文的冻结岭回归预测协议不能据此宣称胜过专门端到端预测模型。

评分

  • 新颖性: 4/5。窗口对齐可写记忆与尺度匹配监督形成明确的接口级贡献。
  • 实验充分度: 4/5。三个粒度均有探针和消融,但数据集规模、调参范围与纯架构隔离仍有限。
  • 写作质量: 3/5。主线清楚,门控位置、tokenizer 配置及部分收益措辞需要结合附录谨慎解读。
  • 价值: 4/5。对需要中尺度状态的时间序列表示学习有参考价值,不是无条件的预测或效率突破。