2026年上半年销量预测领域在基础模型、Mamba架构和LLM融合三个方向上取得了密集进展。进入下半年这些技术路线开始从“各自突围”走向“系统整合”——研究者不再追问“哪个模型更好”而是开始回答“如何为不同问题匹配合适的模型”。本文梳理2026年下半年涌现的新架构、新基准与新共识。一、基础模型从“比精度”到“比效率”1.1 精度-能耗的权衡成为新焦点基础模型在零样本预测中的精度优势已被充分验证。预训练TSFM在10个任务级别中占据8个胜场Moirai-2.0和TimesFM-2.5在多任务上表现最强。TimesFM还以低能耗实现了最优精度。但2026年的一项系统性基准测试揭示了一个新维度精度与能耗的权衡。研究量化了10个时序基础模型的精度-能耗权衡发现Moirai-MoE在可比误差下能耗显著更高而TimesFM以低能耗实现了顶尖精度。这一发现对工业部署有直接影响。对于高频调用的预测服务能耗差异会直接转化为云成本差异。在精度接近的情况下选择能效更高的模型可能比选择精度略高的模型更具商业价值。Chen和Wang2026的综述从计量经济学视角为这一讨论提供了框架。他们认为Transformer可视为VAR的非线性泛化基础模型则通过大规模预训练进一步扩展了这一范式。但他们也指出现代方法往往缺乏经典模型用于检验、解释和政策分析的推断与结构工具——这恰恰是零售业务决策中最需要的部分。1.2 AME-TS结构引导的稀疏MoE亚马逊AWS团队提出的AME-TS核心洞察是不同时间序列需要不同的计算路径。高度季节性的零售序列、强趋势的宏观经济指标和稀疏的云监控信号不应被同一个密集计算路径处理。AME-TS先用轻量级预测器估计序列级描述符可预测性、季节性、趋势、稀疏性映射为专家的软结构先验引导token级路由。在GIFT-Eval基准上AME-TS在小规模下大幅超越现有基础模型大规模下仍具竞争力并通过稀疏路由激活极少的参数。1.3 TimeCopilot的启示编排优于模型虽然TimeCopilot本身是上半年的成果但其影响在下半年持续发酵。“编排优于模型”正在成为新共识——与其押注单一最优模型不如构建一个能动态调用多个模型的Agent系统。这一思路与AME-TS的结构引导路由一脉相承核心不是找到最好的模型而是为每个序列找到最合适的处理方式。二、Mamba架构从“证明可行”到“系统优化”2.1 多尺度成为Mamba的标准配置2026年下半年Mamba在时间序列预测中的演进方向越来越清晰单尺度的Mamba已不够多尺度才是答案。ms-Mamba用多个不同采样率的Mamba块同时处理多个时间尺度。RMTSFMC将Mamba与1D-CNN结合——Mamba捕获全局依赖1D-CNN捕获局部模式两者互补。SLAN将线性注意力融入Mamba以增强长程依赖建模。Graph-enhanced MambaG-Mamba 将图神经网络与Mamba结合实现图条件的选择性状态更新。2.2 DMamba分解增强的MambaDMamba的核心洞察来自时间序列理论趋势和季节性分量中变量关系的统计性质根本不同。趋势关系常由少数共同随机因子驱动处于低维流形而季节性关系涉及动态、高维交互。DMamba的策略是显式对齐架构复杂度与分量特征变量方向Mamba编码器捕获季节性分量中丰富的跨变量动态简单MLP学习趋势分量中的低维关系。这一思路与销量预测的实践高度契合——长尾商品的销量模式更像“稀疏事件”畅销品则更像“平稳趋势”。2.3 多源数据融合的Mamba框架Gao和Lu提出的多尺度时空预测框架以Mamba状态空间为骨干结合动态图注意力和事件感知嵌入整合贸易流、OSM空间连接、新闻和经济指标等多源数据。这代表了Mamba在销量预测中的演进方向从“更快的时序模型”升级为“多源数据融合的预测平台” 。三、间歇性需求从“两阶段框架”到“MoEHurdle”3.1 Switch-Hurdle2026年最值得关注的长尾预测架构Muşat和Căbuz2026提出的Switch-Hurdle可能是2026年间歇性需求预测领域最重要的技术突破。核心设计MoE编码器 Hurdle概率解码器。编码器使用稀疏Top-1专家路由前向通过直通估计器实现近似密集反向传播。解码器采用交叉注意力自回归设计配备共享Hurdle头明确将预测任务拆分为两个组件估计销售概率的二分类组件和给定销售后预测数量的条件回归组件。在M5基准和大型专有零售数据集上Switch-Hurdle达到SOTA预测性能同时保持可扩展性。这验证了一个趋势两阶段的思路是对的但实现方式正在从“两个独立的XGBoost”演进为“端到端的MoEHurdle神经网络” 。3.2 TSB-HB间歇性需求的生成式建模Bai和Chu2026提出的TSB-HB将经典TSB方法扩展为分层贝叶斯框架。关键创新在于经典方法只提供简单启发式规则缺乏原则性的生成基础。TSB-HB通过分层贝叶斯为间歇性需求提供了生成式建模框架。在UCI Online Retail数据集上TSB-HB取得了最低的RMSE和RMSSE。3.3 特征工程优先于架构复杂性2026年的一项研究提出了一个关键观点对于间歇性需求预测特征工程的重要性超过架构复杂性。极端需求稀疏性、不规则发生模式和高度可变的需求量级使得精心设计的特征往往比复杂的神经网络架构更能提升预测精度。这对工业实践有直接启示在追求新架构之前先确保特征工程做扎实了。3.4 大模型用于间歇性需求预测一项2026年的研究将轻量级GPT-2模型重新用于间歇性需求预测在短期7天和中期预测中相比最优竞品实现了高达27%的提升。这表明LLM的能力可能不止于事件推理——在特定条件下它们也能直接参与数值预测。四、LLM融合从“事件推理”到“多智能体协作”4.1 EventCast工业验证的LLM事件推理框架EventCast在真实电商场景中部署10个月后交出了令人信服的答卷相比无事件知识的变体MAE提升高达86.9%MSE提升97.7% 相比最优工业基线事件驱动期间MAE降低57.0%MSE降低83.3% 。该框架自2025年3月起已部署于工业生产环境。EventCast的模块化设计——LLM负责事件推理时序模型负责数值预测——已被验证为LLM融入销量预测的最优实践。4.2 “MLP主导、LLM辅助”的混合范式2026年的一项研究将MLP与LLM结合用于卷烟销量预测。MLP擅长自然数据建模LLM具备多源信息理解与推理能力。在畅销品预测上平均相对误差仅3.5% 远超ARIMA20.0%。这一范式与EventCast的思路一脉相承让擅长数值的模型做数值让擅长推理的模型做推理——而不是让一个模型做所有事。五、分层预测e2eTD的效率革命Zambon等人2026提出的e2eTD直接预测仅占层级约0.3%的少量聚合序列——这些序列更平滑、更可预测。通过概率自上而下采样算法传播到底层再求和获得所有层级的一致预测。在M5和Favorita数据集上e2eTD取得了各聚合层级最低的加权缩放弹球损失在M5不确定性竞赛的892支队伍中可排名第11位。在标准笔记本上M5约4万条序列仅需5分钟Favorita约30万条序列约20分钟。计算效率与预测精度的统一是e2eTD最大的贡献。六、总结2026年下半年的五个共识精度-效率的权衡正在取代纯粹的精度竞赛。TimesFM的能效优势、AME-TS的稀疏路由、e2eTD的计算效率都指向同一个方向——好的预测系统不仅要准还要省。多尺度成为Mamba的标配。ms-Mamba、RMTSFMC、SLAN都在探索如何让Mamba同时处理多个时间尺度。间歇性需求预测正在从“两阶段XGBoost”向“MoEHurdle”演进。Switch-Hurdle代表了这一方向的SOTA但特征工程的重要性依然不可替代。LLM在预测中的角色正在固化。EventCast的模块化设计——“LLM负责事件推理时序模型负责数值预测”——正在成为行业标准。编排优于单一模型。无论是TimeCopilot的Agent架构、AME-TS的结构引导路由还是EventCast的模块化设计核心思想都是为不同问题匹配合适的工具而不是用一个工具解决所有问题。技术选型速查表2026年下半年更新业务特征 推荐方案 核心理由快速上线、无标注数据 TimesFM 2.5 精度高、能耗低长尾/间歇性需求 Switch-Hurdle 或 两阶段XGBoost 专为稀疏数据设计SOTA性能超长序列、多源数据 Mamba多尺度框架 线性复杂度MAE/RMSE提升25%促销/事件驱动场景 EventCast MAE降低57%已工业验证大规模层级数据 e2eTD 5分钟处理4万序列概率一致追求精度与效率平衡 AME-TS 结构引导稀疏路由激活参数极少销量预测的技术选择已不再是“哪个模型最好”的问题而是“如何为你的业务场景设计最合适的模型组合”的问题。 2026年下半年的工具箱比上半年更加丰富而真正的挑战在于如何将这些工具组合成一个可持续运转的预测系统。
销量预测2026下半年:新架构、新基准与新共识
2026年上半年销量预测领域在基础模型、Mamba架构和LLM融合三个方向上取得了密集进展。进入下半年这些技术路线开始从“各自突围”走向“系统整合”——研究者不再追问“哪个模型更好”而是开始回答“如何为不同问题匹配合适的模型”。本文梳理2026年下半年涌现的新架构、新基准与新共识。一、基础模型从“比精度”到“比效率”1.1 精度-能耗的权衡成为新焦点基础模型在零样本预测中的精度优势已被充分验证。预训练TSFM在10个任务级别中占据8个胜场Moirai-2.0和TimesFM-2.5在多任务上表现最强。TimesFM还以低能耗实现了最优精度。但2026年的一项系统性基准测试揭示了一个新维度精度与能耗的权衡。研究量化了10个时序基础模型的精度-能耗权衡发现Moirai-MoE在可比误差下能耗显著更高而TimesFM以低能耗实现了顶尖精度。这一发现对工业部署有直接影响。对于高频调用的预测服务能耗差异会直接转化为云成本差异。在精度接近的情况下选择能效更高的模型可能比选择精度略高的模型更具商业价值。Chen和Wang2026的综述从计量经济学视角为这一讨论提供了框架。他们认为Transformer可视为VAR的非线性泛化基础模型则通过大规模预训练进一步扩展了这一范式。但他们也指出现代方法往往缺乏经典模型用于检验、解释和政策分析的推断与结构工具——这恰恰是零售业务决策中最需要的部分。1.2 AME-TS结构引导的稀疏MoE亚马逊AWS团队提出的AME-TS核心洞察是不同时间序列需要不同的计算路径。高度季节性的零售序列、强趋势的宏观经济指标和稀疏的云监控信号不应被同一个密集计算路径处理。AME-TS先用轻量级预测器估计序列级描述符可预测性、季节性、趋势、稀疏性映射为专家的软结构先验引导token级路由。在GIFT-Eval基准上AME-TS在小规模下大幅超越现有基础模型大规模下仍具竞争力并通过稀疏路由激活极少的参数。1.3 TimeCopilot的启示编排优于模型虽然TimeCopilot本身是上半年的成果但其影响在下半年持续发酵。“编排优于模型”正在成为新共识——与其押注单一最优模型不如构建一个能动态调用多个模型的Agent系统。这一思路与AME-TS的结构引导路由一脉相承核心不是找到最好的模型而是为每个序列找到最合适的处理方式。二、Mamba架构从“证明可行”到“系统优化”2.1 多尺度成为Mamba的标准配置2026年下半年Mamba在时间序列预测中的演进方向越来越清晰单尺度的Mamba已不够多尺度才是答案。ms-Mamba用多个不同采样率的Mamba块同时处理多个时间尺度。RMTSFMC将Mamba与1D-CNN结合——Mamba捕获全局依赖1D-CNN捕获局部模式两者互补。SLAN将线性注意力融入Mamba以增强长程依赖建模。Graph-enhanced MambaG-Mamba 将图神经网络与Mamba结合实现图条件的选择性状态更新。2.2 DMamba分解增强的MambaDMamba的核心洞察来自时间序列理论趋势和季节性分量中变量关系的统计性质根本不同。趋势关系常由少数共同随机因子驱动处于低维流形而季节性关系涉及动态、高维交互。DMamba的策略是显式对齐架构复杂度与分量特征变量方向Mamba编码器捕获季节性分量中丰富的跨变量动态简单MLP学习趋势分量中的低维关系。这一思路与销量预测的实践高度契合——长尾商品的销量模式更像“稀疏事件”畅销品则更像“平稳趋势”。2.3 多源数据融合的Mamba框架Gao和Lu提出的多尺度时空预测框架以Mamba状态空间为骨干结合动态图注意力和事件感知嵌入整合贸易流、OSM空间连接、新闻和经济指标等多源数据。这代表了Mamba在销量预测中的演进方向从“更快的时序模型”升级为“多源数据融合的预测平台” 。三、间歇性需求从“两阶段框架”到“MoEHurdle”3.1 Switch-Hurdle2026年最值得关注的长尾预测架构Muşat和Căbuz2026提出的Switch-Hurdle可能是2026年间歇性需求预测领域最重要的技术突破。核心设计MoE编码器 Hurdle概率解码器。编码器使用稀疏Top-1专家路由前向通过直通估计器实现近似密集反向传播。解码器采用交叉注意力自回归设计配备共享Hurdle头明确将预测任务拆分为两个组件估计销售概率的二分类组件和给定销售后预测数量的条件回归组件。在M5基准和大型专有零售数据集上Switch-Hurdle达到SOTA预测性能同时保持可扩展性。这验证了一个趋势两阶段的思路是对的但实现方式正在从“两个独立的XGBoost”演进为“端到端的MoEHurdle神经网络” 。3.2 TSB-HB间歇性需求的生成式建模Bai和Chu2026提出的TSB-HB将经典TSB方法扩展为分层贝叶斯框架。关键创新在于经典方法只提供简单启发式规则缺乏原则性的生成基础。TSB-HB通过分层贝叶斯为间歇性需求提供了生成式建模框架。在UCI Online Retail数据集上TSB-HB取得了最低的RMSE和RMSSE。3.3 特征工程优先于架构复杂性2026年的一项研究提出了一个关键观点对于间歇性需求预测特征工程的重要性超过架构复杂性。极端需求稀疏性、不规则发生模式和高度可变的需求量级使得精心设计的特征往往比复杂的神经网络架构更能提升预测精度。这对工业实践有直接启示在追求新架构之前先确保特征工程做扎实了。3.4 大模型用于间歇性需求预测一项2026年的研究将轻量级GPT-2模型重新用于间歇性需求预测在短期7天和中期预测中相比最优竞品实现了高达27%的提升。这表明LLM的能力可能不止于事件推理——在特定条件下它们也能直接参与数值预测。四、LLM融合从“事件推理”到“多智能体协作”4.1 EventCast工业验证的LLM事件推理框架EventCast在真实电商场景中部署10个月后交出了令人信服的答卷相比无事件知识的变体MAE提升高达86.9%MSE提升97.7% 相比最优工业基线事件驱动期间MAE降低57.0%MSE降低83.3% 。该框架自2025年3月起已部署于工业生产环境。EventCast的模块化设计——LLM负责事件推理时序模型负责数值预测——已被验证为LLM融入销量预测的最优实践。4.2 “MLP主导、LLM辅助”的混合范式2026年的一项研究将MLP与LLM结合用于卷烟销量预测。MLP擅长自然数据建模LLM具备多源信息理解与推理能力。在畅销品预测上平均相对误差仅3.5% 远超ARIMA20.0%。这一范式与EventCast的思路一脉相承让擅长数值的模型做数值让擅长推理的模型做推理——而不是让一个模型做所有事。五、分层预测e2eTD的效率革命Zambon等人2026提出的e2eTD直接预测仅占层级约0.3%的少量聚合序列——这些序列更平滑、更可预测。通过概率自上而下采样算法传播到底层再求和获得所有层级的一致预测。在M5和Favorita数据集上e2eTD取得了各聚合层级最低的加权缩放弹球损失在M5不确定性竞赛的892支队伍中可排名第11位。在标准笔记本上M5约4万条序列仅需5分钟Favorita约30万条序列约20分钟。计算效率与预测精度的统一是e2eTD最大的贡献。六、总结2026年下半年的五个共识精度-效率的权衡正在取代纯粹的精度竞赛。TimesFM的能效优势、AME-TS的稀疏路由、e2eTD的计算效率都指向同一个方向——好的预测系统不仅要准还要省。多尺度成为Mamba的标配。ms-Mamba、RMTSFMC、SLAN都在探索如何让Mamba同时处理多个时间尺度。间歇性需求预测正在从“两阶段XGBoost”向“MoEHurdle”演进。Switch-Hurdle代表了这一方向的SOTA但特征工程的重要性依然不可替代。LLM在预测中的角色正在固化。EventCast的模块化设计——“LLM负责事件推理时序模型负责数值预测”——正在成为行业标准。编排优于单一模型。无论是TimeCopilot的Agent架构、AME-TS的结构引导路由还是EventCast的模块化设计核心思想都是为不同问题匹配合适的工具而不是用一个工具解决所有问题。技术选型速查表2026年下半年更新业务特征 推荐方案 核心理由快速上线、无标注数据 TimesFM 2.5 精度高、能耗低长尾/间歇性需求 Switch-Hurdle 或 两阶段XGBoost 专为稀疏数据设计SOTA性能超长序列、多源数据 Mamba多尺度框架 线性复杂度MAE/RMSE提升25%促销/事件驱动场景 EventCast MAE降低57%已工业验证大规模层级数据 e2eTD 5分钟处理4万序列概率一致追求精度与效率平衡 AME-TS 结构引导稀疏路由激活参数极少销量预测的技术选择已不再是“哪个模型最好”的问题而是“如何为你的业务场景设计最合适的模型组合”的问题。 2026年下半年的工具箱比上半年更加丰富而真正的挑战在于如何将这些工具组合成一个可持续运转的预测系统。