Multivariate Time Series Forecasting needs Cross Variable Loss¶
会议: NeurIPS 2026(Accepted,按会议清单)
arXiv: 2608.05742
代码: https://github.com/Day333/CvLoss
领域: 时间序列
关键词: 多变量预测、跨变量损失、残差一致性、图全变差、直接预测
一句话总结¶
CvLoss 不改预测骨干,而是在逐点 MSE 之外约束不同变量预测片段之间的残差差异,在论文汇总的 114 个同骨干比较单元中得到 111 胜、2 平、1 负,且推理时无需计算该损失。
研究背景与动机¶
多变量时间序列预测不仅要预测每条曲线,还要保留变量共同变化的关系:多个电力用户可能同时受到天气影响,交通扰动也可能从一个位置传播到另一个位置。iTransformer、Crossformer 和 TimeFilter 等方法主要在历史输入侧组织跨变量信息,然后通过直接预测(Direct Forecasting,DF)一次输出整个未来窗口。即使网络共享表示,常用的逐点 MSE 仍只累加各个时间—变量位置的误差,并不显式监督变量之间的相对关系。
这并不意味着 MSE 模型不能学到依赖,而是“骨干有能力交互”和“目标函数要求结构正确”并非同一件事。两个预测器可以有相近的逐点误差,却得到不同的未来变量相关矩阵。论文在 ECL 上用相同 iTransformer 展示这一现象,加入 CvLoss 后,84.83% 的跨变量矩阵条目具有更小的结构误差;这一比例衡量相关结构恢复,而不是 MSE 的降幅。
作者没有直接估计整个未来残差的时空协方差,而是把未来窗口切成片段,在跨变量图上比较预测与标签的相对差异。这样,损失能同时监督同一片段的同步关系和不同片段的滞后关系。核心 idea:用图边上的残差差异补足逐点监督未显式约束的跨变量结构,同时保留 MSE 作为绝对数值锚点。
方法详解¶
整体框架¶
输入是历史窗口,输出是未来所有变量的预测矩阵;预测骨干、输入处理和部署时的前向路径都不变。训练时,把预测与标签按相同方式切成不重叠时间片段,形成“片段索引—变量索引”节点,再在不同变量的节点之间计算结构损失,与 MSE 加权联合优化。
每个节点保存一个完整片段的预测残差,图边检查两个节点的残差是否一致。这里的图是训练目标中的关系集合,不是额外的图神经网络,也不进行消息传递或推理期修正。因此,本方法用文字与损失公式即可描述,不需要画成多模块网络。
默认使用预先确定的完全跨变量图,覆盖同步和异步边;它不是从未来标签的相关矩阵学习出来的图。训练标签只通过通常的监督残差进入默认目标,测试时既不需要真实未来,也不构建这一损失图。
关键设计¶
1. 关系感知目标:区分逐点误差与联合误差几何
把未来所有位置的残差展开为向量后,MSE 相当于对每个坐标给予相同、互不耦合的惩罚。作者假设残差服从零均值多元高斯,且协方差正定、在推导中不随预测器参数变化;在这些条件下,真实负对数似然使用精度矩阵加权,而各向同性高斯对应普通 MSE。
论文的目标差距可写为:
其中,预测长度为 \(T\)、变量数为 \(D\),\(\mathbf{e}\) 是展开后的预测残差。非对角精度项意味着不同位置的误差需要联合计分;但这条推导只是指出目标函数形式的差异,不证明某个具体正则项在任意数据上都优于 MSE。
尤其要区分“两个二次型不是同一个函数”和“每一个残差向量的差值都非零”。原文把非球形精度矩阵直接描述为严格非零的 gap,但零残差或某些方向上的残差仍可能使上述差值为零;该式也不保证差距始终为正,更不能单独推出预测风险必然下降。
作者进一步证明,MSE 加平方图边差异可以对应一种由图拉普拉斯构造的高斯精度矩阵。这为关系感知目标提供了一个合法的结构族,却不是恢复真实精度矩阵:统一边权、固定符号和固定拓扑仍然是强限制,不能把“完全图不排除跨变量边”理解成能表示任意残差协方差。
2. 片段跨变量图:把同步与滞后关系放进同一监督集合
将未来窗口切成 \(P\) 个长度为 \(L\) 的不重叠片段,满足 \(T=PL\);每个变量的每个片段是一个节点,共有 \(N=PD\) 个节点。节点残差定义为 \(\mathbf{e}_v=\hat{\mathbf{z}}_v-\mathbf{z}_v\),即该片段的预测向量减去标签向量;\(L=1\) 时退化为逐点节点。
同步边连接不同变量的相同片段索引,异步边连接不同变量的不同片段索引,默认图取两者的并集。异步比较在片段内部仍按对应位置做差,因而覆盖的是由片段位移产生的相对关系,而不是显式学习传播方向、连续时延或因果图。
使用完全跨变量图的理由是无需预先知道哪些变量相互作用,也无需估计高维精度矩阵。例如,ECL 在预测长度 720、变量数 321 时,完整时空精度矩阵超过 500 亿个元素,直接估计不现实。图边约束把这一问题转成可计算的成对监督,但完全图也会包含无关边,且对所有边使用同一权重。
3. 残差图全变差:保持变量相对差异,而不是把曲线拉成一样
对一条边,先比较两个节点的预测片段差异与真实片段差异。两者之差恰好等于两节点的残差差异,因此 CvLoss 是残差场上的平均图全变差:
这里 \(\mathcal{E}\) 是图边集合,分母按边数和片段长度归一化。约束的是“预测保留了多少真实相对差异”,不是让不同变量的预测值相等;真实标签中已有的水平差、幅度差和反向变化都可以保留。
这一等价关系也揭示了方法的盲点:所有节点若产生相同的非零残差向量,边上的差异仍为零。CvLoss 可以辨认变量之间误差不协调,却无法独自辨认公共偏移;所以它必须与绝对误差监督配合,而不能被描述为独立保证准确预测的目标。
实际使用 \(\ell_1\) 范数,因为少数变量特有冲击可能造成很大的边差异,平方惩罚会让这些边支配训练。高斯命题直接对应的是平方 \(\ell_2\) 图惩罚;改用 \(\ell_1\) 后可以解释为同一图上的成对 Gibbs 场,但不再是该高斯命题推导出的目标。这个范数选择有消融支持,是经验决策而非定理必然结论。
损失函数 / 训练策略¶
MSE 保留为绝对锚点,最终训练目标为:
主方法中的 \(\alpha\in(0,1)\) 是验证集选择后固定的标量,片段长度 \(L\) 也通过验证集选择。它不会随批次、变量或图边变化,更不是训练时学习的自适应权重;附录 D.2 的可学习非归一化系数仅用于额外诊断,不能当作这里的 \(\alpha\)。
骨干配置、预处理、归一化、Adam 优化器和训练协议沿用公开基线,仅调损失权重与片段长度。验证集早停耐心值为 3 个 epoch;测试禁用 drop-last,保留最后一个不完整批次。敏感性实验另外测试了 \(\alpha=0\) 与 \(\alpha=1\),它们是边界诊断,不是主方法固定权重区间的定义。
全图边数随片段数和变量数按 \(O(P^2D^2)\) 增长。附录 C.10 单独研究每批最多 1000 条随机边的效率方案,正文准确率结果不来自这一抽样版;附录 D 的结构误差 top-K 选边也不是主结果配置。top-K 需要训练标签的相关结构,且选边本身的统计开销不能仅靠保留 K 条边的损失成本概括。
部署时删除整个结构损失计算,模型不增加预测参数、缓冲区或前向操作。所谓“零推理开销”针对这条不变的预测路径,并不意味着全图训练没有额外成本;高维 ECL 的反向开销明显大于低维 ETTh2。
实验关键数据¶
主实验¶
实验包含 12 个数据集:4 个 ETT 子集、Weather、ECL、Traffic、Solar 和 4 个 PEMS 子集。历史长度固定为 96,按时间划分训练、验证和测试;长预测结果平均于预测长度 96、192、336、720。下表摘录正文表 1,比较完全相同的 TimeFilter 骨干,MSE 和 MAE 均越低越好。
| 数据集 | TimeFilter MSE | +CvLoss MSE | TimeFilter MAE | +CvLoss MAE |
|---|---|---|---|---|
| ETTm1 | 0.377 | 0.372 | 0.393 | 0.381 |
| ETTh1 | 0.420 | 0.419 | 0.428 | 0.427 |
| Weather | 0.240 | 0.236 | 0.270 | 0.260 |
| ECL | 0.159 | 0.157 | 0.256 | 0.252 |
| Traffic | 0.408 | 0.407 | 0.269 | 0.254 |
| Solar | 0.228 | 0.218 | 0.262 | 0.254 |
| PEMS07 | 0.071 | 0.063 | 0.170 | 0.156 |
这一配对能支持损失改进的归因,而同表中其他架构的排行榜不能替代配对实验。Solar 上 TQNet 的 MSE 为 0.197,仍低于 TimeFilter+CvLoss 的 0.218,因此不能把 CvLoss 列概括为所有数据集、所有指标的最优架构。
正文表 2 汇总 7 个骨干的同配置比较,以“骨干—数据集—指标”的预测长度平均值为一个单元:114 个单元中 111 胜、2 平、1 负,平均相对误差降低为 MSE 3.39%、MAE 3.61%。这些实验块的数据集与骨干有重叠,是描述性证据汇总,不是 114 个独立任务组成的显著性检验。
消融实验¶
下面摘录正文表 4 的 TQNet 拓扑消融,均为 4 个长预测长度的平均值;每个单元按 MSE / MAE 展示。
| 图配置 | ETTm1 | ETTh1 | ECL | Weather |
|---|---|---|---|---|
| DF,无结构边 | 0.377 / 0.393 | 0.441 / 0.434 | 0.165 / 0.259 | 0.242 / 0.269 |
| 仅同步边 | 0.375 / 0.389 | 0.444 / 0.435 | 0.164 / 0.255 | 0.244 / 0.269 |
| 仅异步边 | 0.374 / 0.387 | 0.444 / 0.435 | 0.164 / 0.256 | 0.241 / 0.266 |
| 同步 + 异步边 | 0.372 / 0.387 | 0.438 / 0.430 | 0.162 / 0.253 | 0.240 / 0.264 |
单独增加某一类边并不保证收益:ETTh1 的两种单支持图均比 DF 差,Weather 的仅同步图也没有改善。组合图整体更可靠,说明不能把“存在依赖”直接等同于“任意关系约束都会有效”。
附录表 15 进一步固定协议比较边差异范数,结果平均于预测长度 96、192、336、720。该表有自己的基线数值,不与正文表 1 合并成同一运行。
| 数据集 / 骨干 | 基线 MSE / MAE | 平方 L2 边惩罚 | L1 边惩罚 |
|---|---|---|---|
| ECL / TimeFilter | 0.158 / 0.256 | 0.157 / 0.254 | 0.156 / 0.252 |
| ECL / TQNet | 0.165 / 0.259 | 0.164 / 0.257 | 0.162 / 0.254 |
| Weather / TimeFilter | 0.241 / 0.271 | 0.241 / 0.270 | 0.238 / 0.262 |
| Weather / TQNet | 0.242 / 0.269 | 0.244 / 0.269 | 0.241 / 0.264 |
关键发现¶
- L1 版在上述 8 个指标单元中都优于平方 L2 版;但 L2 版并非处处有效,Weather/TQNet MSE 从 0.242 变为 0.244。证据支持此协议下的范数偏好,不支持普遍最优范数的结论。
- ECL 的权重敏感性显示绝对锚点有实际价值:正文表 6 中,TimeFilter 的 MSE 在权重 0、0.5、1 时分别为 0.159、0.157、0.168。纯结构监督在此例反而劣于未正则化基线。
- 附录使用 2020–2026 的 7 个配对随机种子。表 18 的 13 个边际区间重叠单元中,11 个配对 95% 区间排除零;Weather/TQNet 在预测长度 336 和 720 的 MSE 改善尚不确定,不能一概称为显著胜出。
- 相关结构可视化采用未来序列的绝对 Pearson 相关矩阵,逐元素比较预测相关与真实相关的绝对误差。ECL 的 84.83%、PEMS03 的 61.98%、Weather 的 44% 是误差变小的条目比例,并非预测误差降低百分比,也不保留相关符号。
原文存在需要保留的边界与数值冲突:正文说 Traffic MAE 降低 0.014,但表 1 的显示值 0.269 与 0.254 相差 0.015;表 1 的 ETTm1 基线 MAE 为 0.393,附录表 8 为 0.394。正文表 3 的 TQNet/ETTh1 CvLoss 为 MSE 0.430、MAE 0.438,附录表 13 对应平均行为 0.438、0.430;本笔记不将这组冲突数据用于确定的胜负归因。
PEMS 的协议描述也不统一:附录 B 写预测长度 12、24、36、48,而实际表 9 只列 12、24、48,表注又称“四个”长度。上面的 PEMS07 平均数按表 1 原样记录,不自行补出长度 36 的结果,也不重算作者的平均值。
亮点与洞察¶
- 结构监督可以独立于结构骨干。 即使输入侧已经有图筛选或跨变量注意力,输出目标仍能补充监督;这种改进位置使同骨干实验尤其重要。
- 在残差上做平滑比直接平滑预测更合理。 它不要求不同物理量输出相同曲线,而要求预测相对差异接近标签关系;因此不会仅因两变量水平不同就惩罚它们。
- 相对约束与绝对锚点缺一不可。 图全变差的平移不变性直接解释了为什么保留 MSE,而不是仅凭调参经验把两项拼起来。
局限与展望¶
- 理论动机不是一般最优性保证。 高斯、固定协方差和结构化精度族都有限制;部署的 L1 损失更依赖实证,图全变差不能任意表达正负、异质残差依赖。
- 完全图会混入无关关系。 作者承认预定义图与固定片段缺乏适应性;可进一步研究只基于训练历史选择的稀疏或加权图,同时报告图构造与选边的完整成本。
- 评价范围仍是规则采样的确定性预测。 概率预测、不规则时间间隔和缺失值尚未验证;Exchange 被主动排除,也限制了对弱耦合、近随机游走场景的外推。
- 结构恢复证据有限。 绝对 Pearson 相关会忽略相关符号,且不是残差精度矩阵的直接验证;可同时评估有符号相关、联合分布校准与实际系统约束,而非只依赖热图。
- 稿件一致性影响复现判断。 表格间的细小基线差异、指标互换和 PEMS 长度冲突需要作者代码或更正说明解决,不应由笔记自行改成一致。
相关工作与启发¶
- vs iTransformer / Crossformer / TimeFilter:这些方法主要改变历史变量如何交换信息,CvLoss 改变未来输出如何接受结构监督。两条路线可以结合,但强输入建模并不意味着任何输出正则都有收益。
- vs FreDF / QDF / Time-o1:这些目标从频域、联合误差或标签变换等角度改进预测训练,CvLoss 的区别在于显式比较跨变量片段的相对差异;实验仍有输给其他目标的具体设置,不能概括成全面替代。
- vs DBLoss / Patch-wise Structural Loss:分解或片段结构监督关注序列结构,本文把关系放到不同变量的节点之间。可研究时域分解与跨变量结构是否互补,但需同骨干、同调参预算验证,不能从两篇各自收益推断组合收益。
评分¶
- 新颖性: 4/5。将输出侧跨变量残差一致性组织为可插拔图损失,机制简单但问题切入明确。
- 实验充分度: 4/5。覆盖多骨干、拓扑、范数、权重和配对种子分析,但部分协议与表格存在冲突。
- 写作质量: 4/5。v3 清楚区分理论、L1 实践和辅助诊断,但严格非零 gap 与表格一致性仍需改进。
- 价值: 4/5。适合已有预测模型的低侵入训练改造,主要价值在稳定的小幅收益及不增加推理路径。