
相关链接论文arXiv地址https://arxiv.org/abs/2605.14551开源代码仓库https://github.com/dreamone-Lee/SeesawNet代码及改进思路讲解https://space.bilibili.com/51422950?spm_id_from333.1007.0.0摘要实例归一化IN被广泛用于非平稳多变量时序预测以减少分布偏移、突出跨样本的共同模式。然而IN会过度平滑实例特有的结构信息而这些信息对建模时间异质性与跨通道异质性至关重要。以往方法要么进一步抑制分布差异、要么尝试恢复时间维度的特有依赖却普遍忽略了一个核心矛盾如何根据每个实例的非平稳结构自适应地建模共同依赖与实例特有依赖。为破解这一困境作者提出统一架构SeesawNet在时间与通道两个维度动态平衡共同依赖与实例特有依赖的建模。其核心是自适应平稳—非平稳注意力ASNA从归一化序列中捕捉共同依赖、从原始序列中捕捉实例特有依赖并依据实例级非平稳程度自适应融合二者。在ASNA之上SeesawNet交替进行专门的时间关系建模与通道关系建模共同捕捉长程依赖与跨变量依赖。在多个真实基准上的大量实验表明SeesawNet一致优于当前最先进的方法在9个数据集、72个数据集—步长组合中它在51个组合上取得最优。Q1这个模型试图解决什么问题核心问题是实例归一化IN虽能对齐分布、帮助模型学习跨样本可迁移的共同模式却同时改变了实例级统计量、过度平滑了实例特有的趋势、周期与独特模式削弱对时间与跨通道异质性的建模而现有方法没有回答“如何依据每个实例自身的非平稳结构在共同依赖与实例特有依赖之间自适应取舍”这一核心矛盾。图注动机示例。两条原始序列S1Raw与S2Raw分布差异显著经IN后归一化输入S1Norm与S2Norm呈现更清晰的跨样本共同结构、产生相似预测PS1Output与PS2Output说明可迁移的共同依赖被很好捕捉但原始序列中样本特有的趋势与局部波动没有充分反映在预测中说明IN削弱了实例特有依赖。1.IN的收益突出共同模式真实序列常因趋势、季节性与不规则事件而强非平稳样本间分布差异会限制模型容量与泛化以RevIN为代表的IN在建模前归一化、建模后还原有效对齐分布、便于学习跨样本重复出现的共同模式如周期与共享趋势2.IN的代价过度平滑实例特有结构在激进压制非平稳成分时IN也改变了实例级统计量可能掩盖真实的实例特有趋势、周期或独特模式从而削弱时间与跨通道异质性建模如图1归一化后两条序列预测趋同但各自特有的局部波动丢失3.通道维度同样受影响且更欠研究跨通道依赖模式对归一化也很敏感保留实例特有的变量间关系长期被忽视现有方法多用修正或约束来强调特有线索却没有协调好IN下共同依赖学习与实例特有依赖建模的关系。图注被IN模糊的、随体制变化的跨通道依赖。以交通预测为例郊区路段R1与城区路段R2之间的关系会随早晚高峰体制O1与O2发生反转当IN压制了体制特有的结构线索如流量大小与尺度差异这些反转依赖模式变得难以区分使实例特有的跨通道依赖更难建模。Q2相关研究多变量时序预测中的实例归一化为缓解非平稳性IN及其变体已成为现代预测模型的常见设计。代表性范式RevIN在建模前对每个输入实例归一化、建模后还原有效对齐分布、便于学习共同模式后续变体通过改进归一化/反归一化在严重非平稳下进一步降低学习难度或通过优化反归一化阶段的可学习参数提升灵活性。但在激进压制非平稳成分时IN也会改变实例级统计量、掩盖真实结构信息。归一化之后的依赖学习由于IN可能削弱实例特有信号近期工作尝试在归一化序列中恢复或增强实例特有依赖NS-Transformer研究过度平稳化问题认为IN会降低注意力空间中的样本区分度、削弱时间依赖建模于是用原始输入信号在归一化后修正注意力分数U-Mixer从分布演化视角约束输入与输出之间相关模式的对齐以保持样本级时间一致性。这些工作主要聚焦恢复时间维度的依赖而对多变量预测而言跨通道依赖模式对归一化同样敏感保留实例特有的变量间关系仍相对欠探索。近期的TimeBridge从表示视角讨论非平稳的消除与保留之间的平衡为短期变化压制非平稳、为长期协整结构保留非平稳但其“平衡”与本文不同SeesawNet关注的是由IN引出的共同依赖与实例特有依赖建模在时间与通道两个维度上的动态协调。Q3作者是如何解决的问题定义与结构总览给定含C个通道变量的多变量时序实例记历史输入X∈R^(C×L)、预测目标Y∈R^(C×H)目标是学习映射Ŷf(X)逼近Y。SeesawNet构建归一化与原始两条路径用ASNA分别进行时间patch依赖学习与跨通道关系学习最后把平衡后的表示展平预测、再反归一化。图注SeesawNet整体架构与核心组件ASNA。(a)SeesawNet流程双路patching与embedding、SeesawNet Core、展平预测与IN反归一化(b)SeesawNet Core基于ASNA的patch依赖学习层、时间下采样、基于ASNA的通道关系学习层(c)ASNA模块平稳注意力与非平稳注意力经自适应门控融合。双路patching与embedding为同时保留一般信息与特有信息作者采用不同于传统“只归一化”设计的双路输入策略给定X沿每个通道的时间轴做RevIN式实例归一化得到平稳序列XstaIN-Norm(X)同时保留原始非平稳输入XnonX二者分别被切成patch长度为P、步长为S的重叠patch必要时尾部填充以覆盖整个输入每通道得到N个patch再嵌入D维空间PstaEmbedding(Patching(Xsta))式1、PnonEmbedding(Patching(Xnon))式2。核心组件ASNA平稳与非平稳注意力ASNA是作用于通用token序列的可复用注意力块给定平稳与非平稳token嵌入Zsta、Znon输出更新后的嵌入。平稳注意力在归一化序列上计算Astasoftmax(ZstaZstaᵀ/√d)式3倾向强调稳定、可跨样本迁移的模式周期、趋势相关线索、重复出现的通道协调非平稳注意力在原始序列上计算Anonsoftmax(ZnonZnonᵀ/√d)式4突出实例特有的上下文。ASNA自适应门控与融合自适应门控由拼接表示生成门张量Gσ(Linear(Zsta⊕Znon))式5控制各注意力分支的贡献Linear也可用逐token的1×1卷积等价实现。以平稳嵌入Zsta作为注意力value最终融合输出为O((1−G)⊙AstaG⊙Anon)Zsta式6。多头实现中等价于结合两个多头注意力分支平稳分支的Q、K、V都由Zsta投影非平稳分支的Q、K由Znon投影、V由Zsta投影以使聚合内容与平稳嵌入空间对齐。ASNA随后按标准Transformer设计用残差与前馈网络更新两种嵌入ZtmpNorm(ZstaDropout(O))式7、ẐstaNorm(ZtmpFFN(Ztmp))式8、ẐnonNorm(ZnonFFN(O))式9O作为共享交互信号、各分支保留自身残差路径。ASNA还可直接替换iTransformer、PatchTST等模型中的标准注意力层体现广泛适用性。patch依赖学习层时间维度该层在patch轴上建模通道内时间依赖对每个通道c把其patch嵌入作为ASNA的token序列token长度TN将平稳与非平稳patch嵌入送入ASNA得到更新表示(̂Psta^(c),̂Pnon^(c))ASNA(Psta^(c),Pnon^(c))式10使每个通道在平衡共同动态与实例特有演化的同时捕捉跨patch时间交互堆叠多层可学习更深的时间结构。通道关系学习层通道维度为在每个时间patch上捕捉通道间交互先用核大小为1的Conv1D做可学习时间聚合、压缩patch token得到更短的N′个patchQstaConv1D(̂Psta)式11、QnonConv1D(̂Pnon)式12再对每个patch n把该patch处的通道嵌入作为ASNA的token序列token长度TC送入ASNA建模跨通道依赖(̂Qsta^(n),̂Qnon^(n))ASNA(Qsta^(n),Qnon^(n))式13从而捕捉可能随时间体制变化的跨通道关系。展平、预测与反归一化更新后的平稳嵌入̂Qsta编码了时间与通道两个维度上被平衡的共同与实例特有依赖作为预测的隐表示展平后经预测头得到Y′FFN(Flatten(̂Qsta))式14再用IN-Norm阶段的实例统计反归一化恢复原始尺度ŶIN-Denorm(Y′)式15。Q4实验效果如何数据集、基线与设置实验在9个真实数据集上进行ETTh1、ETTh2、ETTm1、ETTm2、Exchange Rate、Weather、ILI、Solar-energy与ECL变量数从7到321、采样频率从10分钟到一周。预测步长设为{96,192,336,720}ILI用{24,36,48,60}报告MSE与MAE、每个设置三次运行平均。基线分三类①基于实例归一化的改进方法DDN、SAN②归一化之后做依赖建模的U-Mixer、NS-Transformer、TimeBridge③强预测骨干PDF、iTransformer、PatchTST。实验在两张RTX 4090上进行Adam优化、学习率从{1e-3,2e-4,1e-4}选取并采用名为Fredf的混合时频MAE损失以提升预测稳定性。主结果长期预测图注长期预测主结果9个数据集、4个预测步长ILI为24/36/48/60最优加粗、次佳下划线末行Improvement给出各模型相对提升。SeesawNet在72个数据集—步长组合中51个最优、12个第二。主结果有四点结论①相比DDN、SAN等IN改进模型SeesawNet的MSE/MAE平均降低8.5%/6.8%在实例特有时间结构丰富的ETT上增益尤为明显②相比U-Mixer、NS-Transformer、TimeBridge等归一化后依赖建模方法增益扩大到18.1%/9.2%在ILI、Solar等高非平稳数据集上共同与特有依赖的自适应平衡尤其有益③相比PDF、PatchTST、iTransformer等强预测骨干仍降低10.2%/7.2%④Exchange/ECL上增益较小因为较弱的跨变量协整或很强的共享负荷模式降低了实例特有通道建模的相对收益。分析一ASNA作为通用骨干的泛化能力图注ASNA的泛化能力。把ASNA作为解耦模块替换iTransformerTransformer列与PatchTST的注意力iTransformer平均提升7.7%/5.6%、PatchTST的MSE/MAE降低3.8%/4.0%在ETTh2、ETTm1、ETTm2、Weather、Solar等多数数据集上一致改进。分析二注意力行为可视化图注ETTm1两个样本上的注意力行为每行为一个样本。(a)真实与预测序列(b)平稳注意力热图(c)非平稳注意力热图(d)自适应门控分配给平稳注意力的动态权重分布。尽管原始分布不同两样本的平稳注意力图保持相似说明从归一化输入学到了共享模式非平稳注意力图则差异显著反映从原始序列保留的实例特有结构。离分布中心更远的样本门控给平稳注意力分配更高权重说明不确定性越大、SeesawNet越倾向依赖共同依赖这支持模型确实分离并平衡了共同与特有依赖。分析三组件消融图注8个数据集上的平均消融。去除平稳注意力w/o sta、非平稳注意力w/o non或门控w/o gate分别使性能平均退化18.6%、8.1%、1.5%另对比去除patch依赖层w/o pd、去除通道关系层w/o cr与二者的组合crpd。消融表明①平稳与非平稳两个注意力分支都必要去掉任一个性能都下降其中去掉平稳分支退化最严重如720步从0.355升至0.506②门控提供自适应协调、去掉后小幅退化③时间patch层与通道关系层各有贡献完整模型最优验证在两个维度上平衡共同与特有依赖的必要性。分析四训练目标损失消融图注训练目标消融。在SeesawNet、TimeBridge、SAN、U-Mixer、PDF上对比Fredf、MSE、hybrid与MAE四种损失给出各数据集MSE/MAE。结果显示损失选择会带来小幅影响各数据集上MAE约变化0.9%但即使用普通MSE训练SeesawNet仍以4.7%至8.9%的平均相对优势明显胜过竞争方法说明其优越性主要来自所提出的平衡架构、而非由损失设计主导。效率分析双分支ASNA只带来常数倍的注意力计算增加约从O(C(L/S)²)增至O(2C(L/S)²)而时间下采样降低了高维数据集上的实际开销。经验上在ETTm2、Weather、ECL上SeesawNet分别达到0.16、0.02、25.16 GFLOPs与1.50、0.95、5.91 ms延迟与强基线相当。Q5有哪些可以继续探索的点1.非平稳模式如何影响平衡作者在结论中明确把“不同非平稳模式如何影响共同与特有依赖之间的平衡”列为未来工作可针对趋势型、周期型、突变型等不同非平稳形态分别刻画最优的门控策略2.门控的可解释性与理论保证目前自适应门控主要由数据驱动、可解释性有限可研究门控权重与实例统计量如均值、方差、信噪比之间的定量关系并为平衡机制提供理论依据3.非相邻/多尺度结构的扩展当前双路只区分归一化与原始两种视图可进一步结合多尺度分解、频域信息让共同与特有依赖在更多视图上被分离与融合4.效率与高维扩展尽管ASNA只增加常数倍开销在超大规模变量数与超长序列下仍可探索稀疏化、低秩化或共享投影进一步降低高维场景成本。Q6总结SeesawNet面向非平稳多变量时序预测核心洞察是实例归一化IN在帮助学习跨样本共同模式的同时会过度平滑实例特有的结构信息。为此它以ASNA为核心从归一化输入学习共享模式、从原始序列学习互补的实例特有结构再依据每个实例的非平稳程度自适应融合并把这种平衡扩展到时间patch建模与跨通道关系学习两个维度。在9个真实数据集上SeesawNet在72个组合中51个取得最优并在ASNA泛化、注意力可视化、组件消融与损失消融等多组实验中一致占优同时只付出常数倍的额外计算这验证了“在时间与通道双维动态平衡共同依赖与实例特有依赖”对非平稳时序预测的关键价值。