工业时序基础模型:从预测分数到可用决策
时间序列基础模型把“为每条曲线训练一个模型”改成了“先在大量序列上学习通用结构,再迁移到具体任务”。这条路线很吸引人:设备历史数据零散、标签昂贵,而预训练模型似乎可以直接做零样本预测。但工业现场真正关心的并不是排行榜上的平均误差,而是模型能否在工况切换、传感器缺失和故障前兆出现时给出稳定、可解释的结果。
先定义预测对象
同一条功率曲线可以支持完全不同的任务:预测未来十五分钟用于控制,预测明日峰值用于排产,估计未来一个月的退化趋势用于检修。预测窗口、采样频率、决策延迟和错误成本不明确,模型分数就没有工程意义。
我会先写一张任务卡:输入信号及单位、可使用的历史长度、预测步长、刷新周期、允许延迟、缺测比例和下游动作。对于储能系统,还要注明充放电状态、环境温度、额定容量变化和保护逻辑,因为这些变量决定序列是否近似平稳。
数据切分必须尊重时间
随机打乱序列再划分训练集和测试集,会把未来的统计特征泄漏到过去。更可靠的方法是滚动回测:在多个历史截点上只使用截点之前的数据训练或适配,再预测之后的固定窗口。设备级泛化还应增加留一设备测试,避免同一设备的相邻片段同时出现在训练和测试中。
归一化也可能造成泄漏。全局均值和方差如果由完整数据计算,就已经看到了测试区间。生产管线应只用当时可见的历史统计量,并记录归一化参数的版本。遇到传感器量程变化时,模型输入与告警阈值必须一起迁移。
不要只看一个误差
MAE 对离群点较稳健,RMSE 会更强地惩罚大误差,sMAPE 便于比较不同量级,却会在真实值接近零时变得不稳定。工业评测至少应同时给出整体误差、不同预测步长的误差曲线,以及关键工况下的分组结果。
若预测结果驱动峰值控制,漏掉峰值的代价通常高于普通时段的偏差。此时可以增加峰值召回率、超限提前量和方向准确率。概率预测则需要检查区间覆盖率与宽度:标称 90% 的预测区间如果只覆盖 60% 的真实值,说明不确定性被系统性低估。
基础模型也需要基线
零样本模型应与三个简单基线比较:最后值延拓、季节性重复和轻量统计模型。如果一个大型预训练模型不能稳定超过“昨天同一时刻”,就不值得承担额外的显存、延迟和维护成本。对于数据较充足的单一设备,还应比较专用模型微调后的收益,而不是默认通用模型一定更好。
评测表应报告模型参数量、上下文长度、推理硬件、批量大小和单次延迟。只公布精度而隐藏资源成本,会让边缘部署方案失去可复现性。
从预测到决策要有隔离层
预测值不应直接写入控制器。更稳妥的链路是“模型输出 → 可信度检查 → 业务约束 → 优化或规则层 → 执行动作”。当输入缺失、分布偏移或置信区间过宽时,系统应回退到保守策略。所有模型建议都要保留输入窗口、版本、置信度和最终动作,方便事后审计。
上线后的漂移监控也不只是观察误差。没有及时标签时,可以先监测输入分布、缺测率、预测区间宽度和残差代理;标签回流后再计算按设备、工况与时间分组的真实误差。模型是否继续可用,最终由决策收益和风险决定,而不是由某个漂亮的平均分决定。