跳转至

Kairos: Toward Adaptive and Parameter-Efficient Time Series Foundation Models

会议: NeurIPS2026(任务清单归属;本文依据 arXiv v4)
arXiv: 2509.25826
论文: 项目页
领域: 时间序列
关键词: 自适应分块、混合粒度编码、动态旋转位置编码、多块预测、零样本预测

一句话总结

Kairos 把时间序列的局部复杂度和实例级频谱差异分别交给混合粒度编码与动态旋转位置编码处理,再并行预测多个未来块,以 53M 参数在 GIFT-Eval 达到 0.738 的归一化 MASE,但概率预测与逐任务表现并非全面领先。

研究背景与动机

时间序列基础模型希望在大量跨领域数据上预训练后,不再针对每个新数据集重新训练。然而,小时级电力消耗、日级销售和局部突变信号并不共享同一种时间尺度。Chronos 的逐点表示、TimesFM 一类固定长度分块,以及全序列统一使用的多尺度选择,都可能把平稳区与剧烈变化区交给相同的表示预算。块太大容易丢失细节,块太小又会让低复杂度区产生大量冗余 token;增大 Transformer 只能间接补偿这种不匹配。

位置编码也有类似问题。固定 RoPE 给所有序列同一组旋转频率,并把 token 序号视作时间距离。当编码器允许不同局部块长时,相邻 token 的实际观测跨度不再相同;即便块长相同,不同序列的周期结构也不一致。因此,改成动态分块而不改变位置编码,反而会引入新的时间轴失真。Kairos 的目标不是简单扩大稀疏专家容量,而是让轻量输入侧模块先吸收这种异质性,减轻主干的负担。

这里的“信息密度”是频谱复杂度的分析概念,不是路由器直接计算的监督标签。附录 M 在长度与步长均为 128 的窗口上加 Hann 窗,再对归一化功率谱计算 Shannon 熵;频谱集中意味着较低复杂度,分散则意味着较高复杂度。路由决策仍由预测目标端到端学习,不能把“熵高”直接等同于“更可预测”。核心 idea:分段选择实际需要的粒度,按实例频谱和真实观测跨度校准注意力的时间坐标,让有限参数用于可迁移的时间结构,而不是补偿统一表示的失配。

方法详解

整体框架

输入是单变量历史观测,多变量数据采用通道独立处理;输出是未来各时刻的分位数,中位数作为点预测。历史先经“混合粒度编码”,每个粗分段独立选择分块专家并融合成长度可变的 token 序列;随后“动态时间校准”在 Transformer 内用 DRoPE 调整旋转频率与位置;最后“多块并行解码”用可学习预测 token 通过交叉注意力读取历史表示。

并行发生在一个解码轮次内部,而不是任意长度预测都只需一次前向。标准配置每轮输出 2 个长度为 64 的未来块,超出该轮覆盖范围时,把中位数预测接回历史,继续下一轮。训练中的未来真值只用于分位数损失,不是零样本推理的输入。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["历史观测"] --> B["混合粒度编码"]
    B --> C["动态时间校准"]
    C --> D["多块并行解码"]
    D --> E["未来分位数"]
    E -->|长预测:中位数接回历史| A
    Y["训练未来真值"] -.->|仅训练监督| L["加权分位数损失"]
    E -.->|仅训练| L

关键设计

1. 混合粒度编码:让局部复杂度决定表示分辨率

先把历史划成不重叠、固定长度的粗分段;动态的是每个分段内部的分块粒度,不是任意搜索分段边界。轻量线性路由器对分段观测产生专家分数,经过带负载平衡偏置的 softmax,再从真实粒度专家与空专家共同组成的候选集合中选 Top-K。真实专家各自对应固定块长,使用两层 MLP 编码;空专家不产生表示,也不执行编码计算,只占据选择名额,因此实际激活的真实粒度数量可以少于 K。

Base 有 4 个真实专家,块长为 32、64、128、256,另有 2 个空专家,Top-K 为 4。因为空专家数量少于选择名额,始终会留下真实专家,不会出现整个分段没有表示的情况。这里的专家差异是观测粒度,不是多个同尺寸 Transformer FFN 的扩容;局部变化需要细粒度,平稳区则可以选择更粗的表示。

不同粒度产生的 token 数不同,不能直接相加,也不能把所有专家 token 无差别串接。Kairos 取当前分段中最细的已激活块长作为目标分辨率;由于块长嵌套整除,较粗嵌入通过重复扩展到对应细位置,再融合。粗嵌入的重复是在共享上下文,不是在恢复原本未编码的细节。真正的细节仍来自细粒度专家;最终 token 数由最细的已激活粒度决定,而非各专家 token 数之和。

\[ \bar{\boldsymbol E}=\sum_{i\in\mathcal I_{\mathrm{valid}}}c_i\,\mathrm{Expand}(\boldsymbol E_i),\qquad c_i=\frac{\tilde s_i}{\sum_{j\in\mathcal I_{\mathrm{valid}}}\tilde s_j}. \]

这里的有效集合只包含选中的真实专家,融合权重也只在它们之间重新归一化,空专家不是带零向量参加平均。各粗分段融合后按时间顺序串接。因而相邻分段可以贡献不同数量的 token,保留局部适应性,同时把多粒度结果变成主干能够统一处理的序列。

训练时,负载平衡不额外加入辅助损失,而是根据一个批次中各专家的 softmax 权重总量与目标负载分布调整路由偏置。目标分布并非强制均匀,还包含空专家份额;这能避免专家训练不足,但也意味着最终计算分配受到人工目标比例影响,不能理解为完全无约束地发现最佳粒度。

2. 动态时间校准:同时修正频谱差异和变长 token 的时间轴

DRoPE 保留 RoPE 对查询与键的成对维度旋转,改变的是旋转频率和位置坐标。频率侧先将历史按有效观测掩码处理,做实数 FFT,取前 128 个低频幅值,经 LayerNorm 和轻量 MLP 得到实例级、分层的缩放与偏移。变换发生在频率的对数空间,避免基础频率跨度大时直接线性调制造成不成比例的调整;再指数变换回正频率。

位置侧不能继续使用等间隔 token 序号。每个融合 token 对应所在分段选中的最细有效块长,累计这些块长,除以全局最小候选块长,得到校准坐标。因此一个跨度更大的 token 会推进更多时间距离,而不是与细块同样只前进一步。这里的“物理时间”是按原始观测点跨度度量的时间轴,并不意味着模型自动获取小时、天等外部单位或支持任意不规则时间戳。

\[ \log\theta_{\mathrm{inst},d}=\gamma_d\log\theta_d+\beta_d,\qquad \tilde t=\sum_{k=1}^{t-1}\frac{\bar P_k}{\bar P_{\mathrm{g\_min}}},\qquad f_{\mathrm{DRoPE}}(\boldsymbol z,t)=(z_{2d}+iz_{2d+1})e^{i\tilde t\theta_{\mathrm{inst},d}}. \]

式中缩放与偏移来自当前历史的频谱,块长来自编码后的实际 token 分辨率,层索引为简洁而省略。两部分解决不同问题:频率调制适应周期和趋势结构,位置校准避免混合块长扭曲相对距离。附录 H 的推导说明固定内容下每个二维子空间的 RoPE 注意力贡献具有周期性,但没有证明动态调制一定提高总体泛化;其效果仍需消融与干预实验支持。

DRoPE 也不是估计一个“真实周期”后直接替换位置编码。它生成的是随实例与层变化的频率配置,用来改变注意力对相对滞后的偏好;多周期、非平稳信号仍可由多组旋转频率共同表达。实例频谱是全历史级条件,与分段路由的局部适应形成互补。

3. 多块并行解码:减少长预测轮次,而非消除自回归

解码器为各未来块设置独立、可学习的预测 token,让它们通过交叉注意力读取 Transformer 历史表示,再用共享残差前馈预测头输出固定长度的块。一个轮次中的多个未来块并行产生,后一个块不依赖前一个块已经生成的数值;相比单块滚动预测,减少把误差写回历史的次数。

默认 2 个预测 token,每个对应 64 个未来点,单轮覆盖 128 个点。更短的目标可以按需要组合预测块并取对应区间,更长的目标仍需多轮滚动。附录 D 同时比较“单 token 输出 128 点”与“2 个 token 各输出 64 点”,两者直接预测长度相同而后者更好,因此收益不只是一次预测得更长,还与多个查询分别检索未来块所需信息有关。

增加预测 token 数并非越多越好。它要求训练样本同时提供足够历史和全部未来块监督,还增加直接预测难度;附录 D 按“样本总长至少为每轮预测长度的两倍”统计,2 个 token 的覆盖率为 82.69%,12 个则为 71.53%。因此选择少量并行块是预测难度、训练覆盖与滚动次数之间的具体取舍。

一个完整示例

采用附录 H 的编码示例:粗分段长度为 128,候选块长为 32、64、128,有 2 个空专家,Top-K 为 3。假设选中了块长 32、块长 128 和一个空专家,真实专家分别产生 4 个细嵌入与 1 个粗嵌入。

融合前把粗嵌入重复 4 次,与细嵌入逐位置对齐,再按真实专家重新归一化的权重加和,输出仍是 4 个 token,而不是 5 个。若另一个分段只保留更粗的有效粒度,它贡献的 token 会更少,DRoPE 用对应观测跨度而非串接后的序号标记时间距离。

在标准解码配置下,预测长度 192 需要 2 轮:首轮给出 128 个点,再把中位数接回历史,下一轮提供剩余 64 个点所需的预测。这个推理示例用于解释轮次,并非原文新增的一项实验;下一轮不允许访问未来真值。

损失函数 / 训练策略

模型直接输出 9 个分位数,级别为 0.1 至 0.9,中位数 0.5 用作点预测与多轮回填。训练使用加权 pinball loss,让靠近预测起点的时刻权重更大;它不是单纯均方误差训练,也不需要随机采样生成概率预测。

\[ L_{\alpha}(y,q)=(\alpha-\mathbf 1_{\{y<q\}})(y-q),\qquad w(t)=\frac{\ln H-\ln t'}{H}. \]

总目标对批次和分位数平均,并对未来时刻累加加权损失。原文把离散时刻映射为从 \(1+10^{-5}\) 到 \(H-10^{-3}\) 的均匀连续序列 \(t'\),避免末端权重为零;不应把原式的 \(t'\) 直接改成 \(t\)。

PreSTS 使用超过 300B 的真实时间点,另外加入 15B 合成时间点;摘要和正文用“超过 300B”作总规模概述,附录 I 给出了更细的组成口径。真实数据分为 5 个可预测性层级,优先采样规律更清晰的数据;数据加载器采样比例为真实 80%、合成 20%,不等于两者存储规模比例。合成数据包含季节、趋势、噪声组合及理想化工业周期信号,补充真实语料缺少的规律性与周期分布。

作者声明排除了 GIFT-Eval 与 TSLib 的训练、验证、测试划分,支持本文的零样本评测设定;这是论文报告的数据排除规则,本笔记未独立审计语料。Base 使用 6 层、8 个注意力头、隐藏维度 512,训练 300,000 步、批量 512,采用 AdamW 与线性学习率衰减;DRoPE 相关参数学习率为 \(10^{-5}\),其余为 \(10^{-3}\)。报告的训练条件是 4 张 A100、TF32、约 15 小时,不代表独立复现时间。

实验关键数据

主实验

GIFT-Eval 包含 97 个任务,分为短期 55、中期 21、长期 21;来自 28 个源数据集。每个任务先按 Seasonal Naïve 归一化 MASE 与 CRPS,再以几何平均汇总,越低越好。表中只摘录若干基础模型,数值来自原文表 1;本文提出的优势主要是点预测与参数规模,而非所有概率指标都最优。

模型 参数 归一化 MASE 归一化 CRPS
Chronos 709M 0.870 0.574
ChronosBolt 205M 0.808 0.574
TimesFM 500M 0.758 0.550
Toto 151M 0.750 0.517
Sundial 128M 0.750 0.559
Kairos-Small 23M 0.748 0.554
Kairos-Base 53M 0.738 0.548

相对 Sundial,Base 的总体归一化 MASE 降低 1.6%。但其赢下的 64 个任务才有 8.1% 的组内几何平均改善,输掉的 33 个任务有 12.3% 的组内几何平均恶化;不能把仅赢组统计当成总体收益。按源数据集合并后为 20 胜、8 负,对应赢组改善 9.36%、输组恶化 8.02%。

TSLib 使用 ETTh1、ETTh2、ETTm1、ETTm2、Weather 及日级、周级 Saugeen,共 27 个数据集—预测长度组合;周级 Saugeen 不包含 720 长度。Kairos 上下文为 2048,其他基础模型存在 512 或 1536 的长度例外,监督基线则从原论文长度及长上下文候选中选优。表 23 的整体 MSE / MAE 为 Base 0.471 / 0.365、Mini 0.477 / 0.367、全量监督 PatchTST 0.456 / 0.397,因此不能概括为 Kairos 在所有总体指标上胜过全量监督模型。

消融实验

以下摘录原文表 2 的归一化 MASE;各行是相应组件替换或去除,不是不同预训练数据的比较。完整模型的总体最好,但单块自回归在短期更好,表明设计收益具有预测长度边界。

配置 短期 中期 长期 总体
固定块长 (32) 0.724 0.802 0.820 0.761
混合粒度但无空专家 0.720 0.770 0.800 0.748
标准 RoPE 0.729 0.807 0.835 0.767
仅实例频率调制 0.719 0.767 0.797 0.746
仅粒度位置校准 0.727 0.796 0.807 0.758
单块自回归 0.705 0.794 0.848 0.753
完整模型 0.709 0.761 0.794 0.738

表 13 对训练语料进行交叉比较,说明 Kairos 的优势不是只有 PreSTS 才存在;但模型参数、目标与训练实现仍可能不同,不能把“相同语料”当成纯架构或纯目标的因果证明。

模型 参数 训练语料 归一化 MASE
Kairos 53M PreSTS 0.738
Kairos 53M Chronos corpus 0.761
ChronosBolt 205M PreSTS 0.781
ChronosBolt 205M Chronos corpus 0.808

关键发现

  • 局部适应有额外证据:全序列 Pathformer 式路由为 0.759,推理时统一粒度权重为 0.831,打乱路由为 1.205,对比完整模型 0.738。它们支持学到的选择有用,但干预也改变了模型习惯的表示分布,不能据此宣称识别出唯一最优路由。
  • DRoPE 的实例条件不能任意交换:同数据集内打乱为 0.751,跨数据集打乱为 0.947;标准 RoPE 为 0.767。这些数值与全模型 0.738 的排序支持实例匹配的重要性,但固定 RoPE 是重新训练的结构基线,打乱是推理干预,二者并非同类操作。
  • 统计检验以 28 个源数据集为单位,避免把相关的任务变体全当独立样本。Holm 校正后,对 Sundial 的符号检验为 0.0714、不显著,Wilcoxon 为 0.0402、显著;对固定块长分别为 0.0872 与 0.0358。同空专家去除和标准 RoPE 的比较则在两类检验中均显著,不能统一写成“所有比较显著”。
  • 同参数控制更接近容量问题:相同 PreSTS、训练步数及优化设置下,53M 常规 Transformer 为 0.797,Kairos 为 0.738。Weather 从头训练的 Mini 平均 MSE / MAE 为 0.228 / 0.267,说明优势不完全依赖预训练,但仍限于这一监督数据集与所列基线。
  • 延迟来自单张 TITAN RTX、输入 2048、输出 96 的逐批平均:Base 0.061 s、Mini 0.030 s、TTM 0.009 s、ChronosBolt 0.055 s、Toto 13.717 s。TTM 输入例外为 1536;这些数值不是全基准时延、不同硬件的通用吞吐,也不意味着 Kairos 最快。表中 MASE 是 GIFT-Eval 总体指标,不是该计时样本的误差。

亮点与洞察

  • 把表示预算的选择放在主干之前,比单纯用更多参数吸收异质性更直接。空专家允许选择“少用一个粒度”,而不是为了满足固定 Top-K 强行调用所有候选。
  • 多尺度融合的关键不只是准备多个块长,还包括重复对齐和有效专家权重重新归一化。若只拼接所有尺度,既不能得到本文相同的 token 时间轴,也不能复用相同的位置校准逻辑。
  • 编码器改变时间粒度后,位置编码必须共同改变。可迁移的启发是:任何非均匀采样或自适应压缩系统,都应检查“表示序号”和“真实跨度”是否已经脱钩,而不是默认相邻表示等距。
  • 多块解码的价值在于减少轮间回填,而非承诺无误差累积。附录 D 的 ETTh1 实验中,第 2–5 轮相对真值回填 oracle 仍有 9.79%–14.85% 的 MAE 代价,支持“缓解”而非“消除”。

局限与展望

  • 通道独立处理无法显式刻画变量间依赖;加入通道混合器是作者提出的后续方向,但本文没有验证其效果与成本。
  • 概率预测仍落后于 Toto:CRPS 0.548 对 0.517。表 1 中 YingLong 也是 0.548,因此正文“第二好”的说法应理解为按展示精度并列,而不是独占该排名。
  • 泛化证据以预测为主。附录 C 的冻结编码器在 91 个 UCR 数据集达到平均准确率 0.818,对 MOMENT 的 0.794 有优势,但仍训练轻量分类器,不能称为零样本分类,也不能替代异常检测或插补验证。
  • 重复训练只报告 Small 的 3 次运行,归一化 MASE 为 \(0.747\pm0.001\);没有据此给 Base 所有消融的种子不确定性。确定性分位数推理也不等于训练过程没有随机性。
  • 数据与说明存在口径细节:正文概述超过 300B,附录细分为真实超过 300B 加合成 15B;附录 I 关于 ARCH-LM 值接近零的波动解释与常见统计读法有歧义,不据此加强合成数据分布的结论。后续应公布分层规则、采样及统计实现,提升可审计性。

相关工作与启发

  • vs Pathformer:后者根据序列级特征选择多尺度,本文逐粗分段选择粒度。附录 E 的替换比较直接针对局部适应是否有额外价值,而不是证明所有多尺度方法都不适合时间序列。
  • vs Chronos / ChronosBolt:本文不把异质性仅留给主干处理,使用动态粒度与 DRoPE;匹配语料结果支持这一组合有价值,但不足以单独证明连续分位数目标优于其他目标。
  • vs ElasTST:可调 RoPE 面向数据集训练适配,本文从每个实例的历史频谱动态生成分层调制。后续可研究突变后频谱条件更新是否能改善非平稳预测,但这是研究线索,不是本文已经验证的结论。
  • vs 单块自回归基础模型:多个查询分摊未来块的信息检索并减少迭代次数,保留变长预测能力。真正的比较应同时控制每轮直接预测长度、训练覆盖和上下文预算,附录 D 的固定长度对照是有用起点。

评分

  • 新颖性: 4/5;局部分辨率与实例频谱位置编码协同,区别于一般稀疏扩容。
  • 实验充分度: 4/5;有结构消融、路由干预、匹配语料与源数据集统计,但种子和跨任务覆盖仍有限。
  • 写作质量: 4/5;附录补足融合与长预测机制,排名和数据规模口径需谨慎阅读。
  • 价值: 4/5;为紧凑零样本预测模型提供可复用的架构思路,不代表参数高效微调方法。