相关链接论文arXiv地址https://arxiv.org/abs/2507.21830开源代码仓库https://github.com/BenchCouncil/DualSG改进思路及讲解https://space.bilibili.com/51422950?spm_id_from333.1007.0.0摘要多变量时序预测在众多应用中起关键作用。近期工作探索用大语言模型做MTSF以利用其推理能力但许多方法把LLM当作端到端预测器常导致数值精度损失、并迫使LLM处理超出其设计的模式另一些试图在隐空间对齐文本与时序模态的方法则频繁遭遇对齐困难。本文提出不把LLM当作独立预测器而是作为双流框架中的语义引导模块。DualSG提供显式语义引导LLM充当语义引导器Semantic Guide来精炼而非替代传统预测。作为框架一部分提出Time Series Caption这一显式prompt格式用自然语言总结趋势模式、为LLM提供可解释上下文而非依赖文本与时序在隐空间的隐式对齐还设计caption引导的融合模块显式建模变量间关系同时降低噪声与计算。跨领域真实数据集上的实验表明DualSG一致优于15个SOTA基线展示了把数值预测与语义引导显式结合的价值。Q1这个模型试图解决什么问题核心问题是LLM用于多变量时序预测的两条主流路线都有硬伤——把LLM当端到端预测器会损失数值精度、迫使其处理不擅长的数值模式在隐空间对齐文本与时序模态则对齐困难。图注LLM用于MTSF的三种范式。(a)LLM-only Forecasting把时序当自然语言直接预测存在数值不精确Numerical Imprecision(b)LLM-align Forecasting在隐空间对齐文本与时序存在任务错配Task Mismatch与对齐困难Alignment Difficulty(c)本文的LLM-guided双流数值预测流与文本推理流分工LLM冻结、只做引导。1.LLM-only的问题把数值序列重写成文本token、让LLM直接输出预测LLM本质上为自然语言处理设计、不擅长逐点数值运算导致数值精度损失2.LLM-align的问题在隐空间对齐两种模态但token信息密度随尺度与周期变化文本与时序难以稳定对齐3.本文立场采用显式对齐句子级、显式prompt让LLM做它擅长的推理与总结、把数值预测留给专用模型。图注三类prompt示例Table 1。LLM-only把逐日数值全部罗列给LLMLLM-align只给“rise/up/down/steady/top”等离散词本文LLM-guided用一句caption概括趋势“序列从起点到终点逐渐下降、末端走平”。Q2相关研究LLM-based时序预测LLM-only类如GPT4TS等重写时序、让LLM直接预测LLM-align类在隐空间对齐模态。二者分别面临数值不精确与对齐困难。代表性LLM基线包括CALF、TimeLLM、GPT4TS等。传统多变量预测CNN类TimesNet、MICN、MLP类DLinear、TimeMixer、Transformer类PatchTST、iTransformer、FEDformer、Crossformer、Non-stationary Transformer、DUET等是主要的非LLM基线分别在时间建模与变量交互上各有侧重。Q3作者是如何解决的框架总览图注DualSG框架总览。Input经趋势分解进入Dual Stream数值流用MAP多尺度自适应patching选patch、经Patch Embedding与Time Series Encoder文本流经Time Series Caption模块生成captionSemantic Guided Fusion中SemFuse做语义通道融合、Cross Modality Projection结合冻结LLM最后TS Forecasting输出预测序列。数值预测流数值流先对输入X∈R^(N×T)用MAPMulti-scale Adaptive Patching多尺度自适应patching提取多尺度时间patch自适应掩码模块依据重要性图选择patch再经Patch Embedding与时间编码器生成基础预测ŶbaseTemporalEncoder(P)式21。MAP相比均匀patching能自适应覆盖多尺度感受野。文本推理流Time Series Caption生成TSCG文本推理流从原始时序提取高层语义模式这是首个用时序caption直接增强预测的工作核心是TSCG模块把时序片段转成自然语言摘要、作为语义prompt引导LLM精炼趋势级预测。由于缺乏公开的时序caption生成模型作者设计轻量encoder-decoder、在大规模混合领域时序上预训练。Patch Embedding把序列切成重叠patch、线性投影并加位置编码式7K层Transformer编码器做层次时间编码式8–10Time-to-Text自注意力不依赖外部文本query、仅基于时序特征计算式11–13直接把时间信号注入GPT2解码器caption以自回归方式解码式14–16用交叉熵训练式17推理时可对未见模式zero-shot生成caption。captionTSC在三个维度编码趋势语义方向directionrising/falling、强度intensitysharp/gradual、时间转换temporal transitionfollowed by/then为长程预测提供可控、可解释的语义正则。语义修正项caption经冻结LLM编码后投影为分段常数的语义修正项ΔŶRepeat(LayerNorm(ReLU(W·LLM(S)b)))式22Repeat把每个语义单元扩展到固定区间、隐式建模周期性。双流融合一SemFuse语义通道融合SemFuse用caption作语义锚点构建可解释的通道间依赖分三阶段语义相关投影用冻结LLM编码caption、经sigmoid得通道相关分gn,i式18稀疏top-K选择构造二值掩码、只保留最相关的K个通道式19门控通道融合按相关分加权聚合所选通道式20。相比全成对注意力与静态聚类SemFuse是一次性、caption引导的稀疏通路更高效、可解释、对局部波动更鲁棒。双流融合二跨流动态融合第二阶段用可学习注意力权重WSTAM自适应平衡两股流式23ŶWSTAM⊙Ŷbase(1-WSTAM)⊙ΔŶ在保持数值精度的同时引入语义修正、缓解趋势级偏差提升分布漂移下的鲁棒性。Q4实验效果如何数据集、基线与设置在Time Series Library的12个常用多变量数据集上评估包括Weather、Traffic、Electricity、Solar-Energy与四个ETT变体基线15个覆盖CNN、MLP、Transformer与LLM四类。训练阶段TSCG冻结、仅用于推理生成captionPyTorch实现、Adam余弦退火、L1损失、4张A800 GPU指标为MSE与MAE。主结果长期预测图注长期预测完整结果H∈{96,192,336,512}最优加粗、次优下划线。DualSG在8个数据集上几乎全面占优1st Count行显示DualSG共65次取得最优远超CALF8次、DUET10次等所有基线。相比次优LLM基线CALFDualSG在8数据集上平均MSE降低11.3%、MAE降低9.8%Solar-Energy上MSE降低40.7%0.192对0.324体现语义引导通道融合的效果并一致优于最强非LLM基线DUET。分析一语义通道融合的鲁棒性在通道相关较弱的ETTm2上DualSG取得MSE 0.254优于Crossformer1.216降低79.1%与PatchTST0.285降低10.9%避免了对虚假依赖的过拟合在非平稳数据集上相比FEDformerDualSG在Traffic上MSE降低35.1%、Weather上降低26.2%主要受益于语义流的高层趋势修正。消融一各模块贡献图注模块消融各预测步长平均。对比完整DualSG与去掉TSCG、MAP、SemFuse、LLM四个变体去掉任一模块性能都下降完整DualSG在ETTh1.414/.422、ETTm2.254/.308、Weather.228/.260等全部最优。去掉TSCG在Weather等非平稳数据集上下降最明显验证语义趋势抽象的价值把MAP换成均匀patching在ETTm2等高频序列上受损体现多尺度自适应建模用全注意力或静态聚类替换SemFuse会增加成本、降低精度LLM最不重要因为它只做推理总结、TSCG生成的caption已含足够信息。消融二prompt策略对比图注六种prompt策略消融。柱状右轴Counts为各prompt取得最优的次数折线左轴MSE为跨数据集平均MSE本文Caption柱最高约33次、平均MSE最低Timestamp次之。在domain、timestamp、statistics、instruction、external、caption六类prompt中caption一致最优、平均MSE最低、最优次数最多timestamp排第二、印证时间标记的作用其他prompt语义丰富度或上下文相关性不足external因缺少时间对齐配对数据而排除。消融三六类prompt明细图注六类prompt明细Table 3Domain给领域背景、Timestamp罗列时间与数值、Statistics给统计量、Instruction给任务指令、External给无关外部文本、Caption用一句话概括趋势。分析二分解组件上的对比图注Weather上趋势/季节/残差三组件的平均MAE及相对DualSG的偏差。DualSG趋势MAE最低0.239DLinear高20.9%、PatchTST高13.8%、TimesNet高10.0%季节与残差上各方法接近。得益于双流协作DualSG在最依赖长期模式建模的趋势组件上改进最显著趋势MAE最多降低20.9%说明caption引入的高层语义推理有效补充了数值建模季节指标略差归因于固定回看窗口96、限制了对重复模式的捕捉。分析三训练与推理效率图注训练与推理效率ETTh2。DualSG训练47.1分钟、推理11.7秒、MSE .284缓存预编码后训练仅13.3分钟、精度不变TimeCMA训练59分钟TimeLLM训练95分钟、推理90.8秒。缓存预编码时序可大幅缩短训练时间、又不牺牲精度DualSG相比TimeLLM等LLM方法训练与推理开销都更低同时误差更小。分析四STAM注意力与不同LLM/patch图注ETTh1上不同预测长度96/192/336/720的STAM热力图横轴为多个预测时间点的平均值、纵轴为不同通道随预测长度增加少数通道的重要性增强、呈现分组选择。附录还比较了16/24/36/48四种固定patch长度可能忽略变化的时间模式以及GPT2、BERT、DeepSeek-R1、Qwen2.5-3B、LLaMA2-7B、LLaMA3.2-3B六种LLM骨干实验发现GPT2效果最好。Q5有哪些可以继续探索的点1.扩展到更复杂的多模态时序作者在结论中计划把该范式推广到更复杂的多模态时序可纳入事件、图像、文本等更多模态2.caption生成的自动化与丰富度可改进TSCG让caption覆盖多周期、突变、异常等更细粒度结构减少对预定义趋势词表的依赖3.patch与LLM骨干自适应固定patch长度与LLM骨干目前靠经验选择可研究按数据特性自适应确定4.季节/残差精度补强趋势增强可能轻微牺牲季节精度可研究更长回看或解耦的双流权重兼顾三类组件。Q6总结DualSG面向多变量时序预测核心洞察是LLM不擅长逐点数值运算、却擅长高层推理与总结把LLM当端到端预测器会损失数值精度在隐空间做模态对齐又对齐困难。它把LLM重新定位为语义引导器文本流通过TSCG把时序转成趋势caption方向、强度、时间转换经冻结LLM得到语义修正项SemFuse用caption做稀疏、可解释的通道融合跨流动态融合用可学习权重把数值预测与语义修正显式结合。在12个数据集上DualSG以65次最优一致超越15个SOTA基线并在趋势组件与训练效率上优势明显验证了“数值预测显式语义引导”这一路线的价值。
阅读完成 · 觉得有帮助?