跳转至

Multivariate Time Series Forecasting needs Cross Variable Loss

会议: NeurIPS 2026(Accepted,按会议清单)
arXiv: 2608.05742
代码: https://github.com/Day333/CvLoss
领域: 时间序列
关键词: 多变量预测、跨变量损失、残差一致性、图全变差、直接预测

一句话总结

CvLoss 不改预测骨干,而是在逐点 MSE 之外约束不同变量预测片段之间的残差差异,在论文汇总的 114 个同骨干比较单元中得到 111 胜、2 平、1 负,且推理时无需计算该损失。

研究背景与动机

多变量时间序列预测不仅要预测每条曲线,还要保留变量共同变化的关系:多个电力用户可能同时受到天气影响,交通扰动也可能从一个位置传播到另一个位置。iTransformer、Crossformer 和 TimeFilter 等方法主要在历史输入侧组织跨变量信息,然后通过直接预测(Direct Forecasting,DF)一次输出整个未来窗口。即使网络共享表示,常用的逐点 MSE 仍只累加各个时间—变量位置的误差,并不显式监督变量之间的相对关系。

这并不意味着 MSE 模型不能学到依赖,而是“骨干有能力交互”和“目标函数要求结构正确”并非同一件事。两个预测器可以有相近的逐点误差,却得到不同的未来变量相关矩阵。论文在 ECL 上用相同 iTransformer 展示这一现象,加入 CvLoss 后,84.83% 的跨变量矩阵条目具有更小的结构误差;这一比例衡量相关结构恢复,而不是 MSE 的降幅。

作者没有直接估计整个未来残差的时空协方差,而是把未来窗口切成片段,在跨变量图上比较预测与标签的相对差异。这样,损失能同时监督同一片段的同步关系和不同片段的滞后关系。核心 idea:用图边上的残差差异补足逐点监督未显式约束的跨变量结构,同时保留 MSE 作为绝对数值锚点。

方法详解

整体框架

输入是历史窗口,输出是未来所有变量的预测矩阵;预测骨干、输入处理和部署时的前向路径都不变。训练时,把预测与标签按相同方式切成不重叠时间片段,形成“片段索引—变量索引”节点,再在不同变量的节点之间计算结构损失,与 MSE 加权联合优化。

每个节点保存一个完整片段的预测残差,图边检查两个节点的残差是否一致。这里的图是训练目标中的关系集合,不是额外的图神经网络,也不进行消息传递或推理期修正。因此,本方法用文字与损失公式即可描述,不需要画成多模块网络。

默认使用预先确定的完全跨变量图,覆盖同步和异步边;它不是从未来标签的相关矩阵学习出来的图。训练标签只通过通常的监督残差进入默认目标,测试时既不需要真实未来,也不构建这一损失图。

关键设计

1. 关系感知目标:区分逐点误差与联合误差几何

把未来所有位置的残差展开为向量后,MSE 相当于对每个坐标给予相同、互不耦合的惩罚。作者假设残差服从零均值多元高斯,且协方差正定、在推导中不随预测器参数变化;在这些条件下,真实负对数似然使用精度矩阵加权,而各向同性高斯对应普通 MSE。

论文的目标差距可写为:

\[ \Delta=\frac{1}{2TD}\mathbf{e}^{\top}\left(\mathbf{\Sigma}_{ST}^{-1}-\frac{1}{\sigma^{2}}\mathbf{I}\right)\mathbf{e}. \]

其中,预测长度为 \(T\)、变量数为 \(D\),\(\mathbf{e}\) 是展开后的预测残差。非对角精度项意味着不同位置的误差需要联合计分;但这条推导只是指出目标函数形式的差异,不证明某个具体正则项在任意数据上都优于 MSE。

尤其要区分“两个二次型不是同一个函数”和“每一个残差向量的差值都非零”。原文把非球形精度矩阵直接描述为严格非零的 gap,但零残差或某些方向上的残差仍可能使上述差值为零;该式也不保证差距始终为正,更不能单独推出预测风险必然下降。

作者进一步证明,MSE 加平方图边差异可以对应一种由图拉普拉斯构造的高斯精度矩阵。这为关系感知目标提供了一个合法的结构族,却不是恢复真实精度矩阵:统一边权、固定符号和固定拓扑仍然是强限制,不能把“完全图不排除跨变量边”理解成能表示任意残差协方差。

2. 片段跨变量图:把同步与滞后关系放进同一监督集合

将未来窗口切成 \(P\) 个长度为 \(L\) 的不重叠片段,满足 \(T=PL\);每个变量的每个片段是一个节点,共有 \(N=PD\) 个节点。节点残差定义为 \(\mathbf{e}_v=\hat{\mathbf{z}}_v-\mathbf{z}_v\),即该片段的预测向量减去标签向量;\(L=1\) 时退化为逐点节点。

同步边连接不同变量的相同片段索引,异步边连接不同变量的不同片段索引,默认图取两者的并集。异步比较在片段内部仍按对应位置做差,因而覆盖的是由片段位移产生的相对关系,而不是显式学习传播方向、连续时延或因果图。

使用完全跨变量图的理由是无需预先知道哪些变量相互作用,也无需估计高维精度矩阵。例如,ECL 在预测长度 720、变量数 321 时,完整时空精度矩阵超过 500 亿个元素,直接估计不现实。图边约束把这一问题转成可计算的成对监督,但完全图也会包含无关边,且对所有边使用同一权重。

3. 残差图全变差:保持变量相对差异,而不是把曲线拉成一样

对一条边,先比较两个节点的预测片段差异与真实片段差异。两者之差恰好等于两节点的残差差异,因此 CvLoss 是残差场上的平均图全变差:

\[ \mathcal{L}_{\mathrm{cv}}=\frac{1}{|\mathcal{E}|L}\sum_{(i,j)\in\mathcal{E}}\left\|(\hat{\mathbf{z}}_i-\hat{\mathbf{z}}_j)-(\mathbf{z}_i-\mathbf{z}_j)\right\|_1=\frac{1}{|\mathcal{E}|L}\sum_{(i,j)\in\mathcal{E}}\|\mathbf{e}_i-\mathbf{e}_j\|_1. \]

这里 \(\mathcal{E}\) 是图边集合,分母按边数和片段长度归一化。约束的是“预测保留了多少真实相对差异”,不是让不同变量的预测值相等;真实标签中已有的水平差、幅度差和反向变化都可以保留。

这一等价关系也揭示了方法的盲点:所有节点若产生相同的非零残差向量,边上的差异仍为零。CvLoss 可以辨认变量之间误差不协调,却无法独自辨认公共偏移;所以它必须与绝对误差监督配合,而不能被描述为独立保证准确预测的目标。

实际使用 \(\ell_1\) 范数,因为少数变量特有冲击可能造成很大的边差异,平方惩罚会让这些边支配训练。高斯命题直接对应的是平方 \(\ell_2\) 图惩罚;改用 \(\ell_1\) 后可以解释为同一图上的成对 Gibbs 场,但不再是该高斯命题推导出的目标。这个范数选择有消融支持,是经验决策而非定理必然结论。

损失函数 / 训练策略

MSE 保留为绝对锚点,最终训练目标为:

\[ \mathcal{L}_{\alpha}=(1-\alpha)\mathcal{L}_{\mathrm{df}}+\alpha\mathcal{L}_{\mathrm{cv}},\qquad \mathcal{L}_{\mathrm{df}}=\frac{1}{TD}\|\hat{Y}-Y\|_F^2. \]

主方法中的 \(\alpha\in(0,1)\) 是验证集选择后固定的标量,片段长度 \(L\) 也通过验证集选择。它不会随批次、变量或图边变化,更不是训练时学习的自适应权重;附录 D.2 的可学习非归一化系数仅用于额外诊断,不能当作这里的 \(\alpha\)。

骨干配置、预处理、归一化、Adam 优化器和训练协议沿用公开基线,仅调损失权重与片段长度。验证集早停耐心值为 3 个 epoch;测试禁用 drop-last,保留最后一个不完整批次。敏感性实验另外测试了 \(\alpha=0\) 与 \(\alpha=1\),它们是边界诊断,不是主方法固定权重区间的定义。

全图边数随片段数和变量数按 \(O(P^2D^2)\) 增长。附录 C.10 单独研究每批最多 1000 条随机边的效率方案,正文准确率结果不来自这一抽样版;附录 D 的结构误差 top-K 选边也不是主结果配置。top-K 需要训练标签的相关结构,且选边本身的统计开销不能仅靠保留 K 条边的损失成本概括。

部署时删除整个结构损失计算,模型不增加预测参数、缓冲区或前向操作。所谓“零推理开销”针对这条不变的预测路径,并不意味着全图训练没有额外成本;高维 ECL 的反向开销明显大于低维 ETTh2。

实验关键数据

主实验

实验包含 12 个数据集:4 个 ETT 子集、Weather、ECL、Traffic、Solar 和 4 个 PEMS 子集。历史长度固定为 96,按时间划分训练、验证和测试;长预测结果平均于预测长度 96、192、336、720。下表摘录正文表 1,比较完全相同的 TimeFilter 骨干,MSE 和 MAE 均越低越好。

数据集 TimeFilter MSE +CvLoss MSE TimeFilter MAE +CvLoss MAE
ETTm1 0.377 0.372 0.393 0.381
ETTh1 0.420 0.419 0.428 0.427
Weather 0.240 0.236 0.270 0.260
ECL 0.159 0.157 0.256 0.252
Traffic 0.408 0.407 0.269 0.254
Solar 0.228 0.218 0.262 0.254
PEMS07 0.071 0.063 0.170 0.156

这一配对能支持损失改进的归因,而同表中其他架构的排行榜不能替代配对实验。Solar 上 TQNet 的 MSE 为 0.197,仍低于 TimeFilter+CvLoss 的 0.218,因此不能把 CvLoss 列概括为所有数据集、所有指标的最优架构。

正文表 2 汇总 7 个骨干的同配置比较,以“骨干—数据集—指标”的预测长度平均值为一个单元:114 个单元中 111 胜、2 平、1 负,平均相对误差降低为 MSE 3.39%、MAE 3.61%。这些实验块的数据集与骨干有重叠,是描述性证据汇总,不是 114 个独立任务组成的显著性检验。

消融实验

下面摘录正文表 4 的 TQNet 拓扑消融,均为 4 个长预测长度的平均值;每个单元按 MSE / MAE 展示。

图配置 ETTm1 ETTh1 ECL Weather
DF,无结构边 0.377 / 0.393 0.441 / 0.434 0.165 / 0.259 0.242 / 0.269
仅同步边 0.375 / 0.389 0.444 / 0.435 0.164 / 0.255 0.244 / 0.269
仅异步边 0.374 / 0.387 0.444 / 0.435 0.164 / 0.256 0.241 / 0.266
同步 + 异步边 0.372 / 0.387 0.438 / 0.430 0.162 / 0.253 0.240 / 0.264

单独增加某一类边并不保证收益:ETTh1 的两种单支持图均比 DF 差,Weather 的仅同步图也没有改善。组合图整体更可靠,说明不能把“存在依赖”直接等同于“任意关系约束都会有效”。

附录表 15 进一步固定协议比较边差异范数,结果平均于预测长度 96、192、336、720。该表有自己的基线数值,不与正文表 1 合并成同一运行。

数据集 / 骨干 基线 MSE / MAE 平方 L2 边惩罚 L1 边惩罚
ECL / TimeFilter 0.158 / 0.256 0.157 / 0.254 0.156 / 0.252
ECL / TQNet 0.165 / 0.259 0.164 / 0.257 0.162 / 0.254
Weather / TimeFilter 0.241 / 0.271 0.241 / 0.270 0.238 / 0.262
Weather / TQNet 0.242 / 0.269 0.244 / 0.269 0.241 / 0.264

关键发现

  • L1 版在上述 8 个指标单元中都优于平方 L2 版;但 L2 版并非处处有效,Weather/TQNet MSE 从 0.242 变为 0.244。证据支持此协议下的范数偏好,不支持普遍最优范数的结论。
  • ECL 的权重敏感性显示绝对锚点有实际价值:正文表 6 中,TimeFilter 的 MSE 在权重 0、0.5、1 时分别为 0.159、0.157、0.168。纯结构监督在此例反而劣于未正则化基线。
  • 附录使用 2020–2026 的 7 个配对随机种子。表 18 的 13 个边际区间重叠单元中,11 个配对 95% 区间排除零;Weather/TQNet 在预测长度 336 和 720 的 MSE 改善尚不确定,不能一概称为显著胜出。
  • 相关结构可视化采用未来序列的绝对 Pearson 相关矩阵,逐元素比较预测相关与真实相关的绝对误差。ECL 的 84.83%、PEMS03 的 61.98%、Weather 的 44% 是误差变小的条目比例,并非预测误差降低百分比,也不保留相关符号。

原文存在需要保留的边界与数值冲突:正文说 Traffic MAE 降低 0.014,但表 1 的显示值 0.269 与 0.254 相差 0.015;表 1 的 ETTm1 基线 MAE 为 0.393,附录表 8 为 0.394。正文表 3 的 TQNet/ETTh1 CvLoss 为 MSE 0.430、MAE 0.438,附录表 13 对应平均行为 0.438、0.430;本笔记不将这组冲突数据用于确定的胜负归因。

PEMS 的协议描述也不统一:附录 B 写预测长度 12、24、36、48,而实际表 9 只列 12、24、48,表注又称“四个”长度。上面的 PEMS07 平均数按表 1 原样记录,不自行补出长度 36 的结果,也不重算作者的平均值。

亮点与洞察

  • 结构监督可以独立于结构骨干。 即使输入侧已经有图筛选或跨变量注意力,输出目标仍能补充监督;这种改进位置使同骨干实验尤其重要。
  • 在残差上做平滑比直接平滑预测更合理。 它不要求不同物理量输出相同曲线,而要求预测相对差异接近标签关系;因此不会仅因两变量水平不同就惩罚它们。
  • 相对约束与绝对锚点缺一不可。 图全变差的平移不变性直接解释了为什么保留 MSE,而不是仅凭调参经验把两项拼起来。

局限与展望

  • 理论动机不是一般最优性保证。 高斯、固定协方差和结构化精度族都有限制;部署的 L1 损失更依赖实证,图全变差不能任意表达正负、异质残差依赖。
  • 完全图会混入无关关系。 作者承认预定义图与固定片段缺乏适应性;可进一步研究只基于训练历史选择的稀疏或加权图,同时报告图构造与选边的完整成本。
  • 评价范围仍是规则采样的确定性预测。 概率预测、不规则时间间隔和缺失值尚未验证;Exchange 被主动排除,也限制了对弱耦合、近随机游走场景的外推。
  • 结构恢复证据有限。 绝对 Pearson 相关会忽略相关符号,且不是残差精度矩阵的直接验证;可同时评估有符号相关、联合分布校准与实际系统约束,而非只依赖热图。
  • 稿件一致性影响复现判断。 表格间的细小基线差异、指标互换和 PEMS 长度冲突需要作者代码或更正说明解决,不应由笔记自行改成一致。

相关工作与启发

  • vs iTransformer / Crossformer / TimeFilter:这些方法主要改变历史变量如何交换信息,CvLoss 改变未来输出如何接受结构监督。两条路线可以结合,但强输入建模并不意味着任何输出正则都有收益。
  • vs FreDF / QDF / Time-o1:这些目标从频域、联合误差或标签变换等角度改进预测训练,CvLoss 的区别在于显式比较跨变量片段的相对差异;实验仍有输给其他目标的具体设置,不能概括成全面替代。
  • vs DBLoss / Patch-wise Structural Loss:分解或片段结构监督关注序列结构,本文把关系放到不同变量的节点之间。可研究时域分解与跨变量结构是否互补,但需同骨干、同调参预算验证,不能从两篇各自收益推断组合收益。

评分

  • 新颖性: 4/5。将输出侧跨变量残差一致性组织为可插拔图损失,机制简单但问题切入明确。
  • 实验充分度: 4/5。覆盖多骨干、拓扑、范数、权重和配对种子分析,但部分协议与表格存在冲突。
  • 写作质量: 4/5。v3 清楚区分理论、L1 实践和辅助诊断,但严格非零 gap 与表格一致性仍需改进。
  • 价值: 4/5。适合已有预测模型的低侵入训练改造,主要价值在稳定的小幅收益及不增加推理路径。