所属: 应用层。本页边界: LLM 应怎样与数值时序模型结合,而不是替代强预测基线。
#核心公式
该目标强调预测器只能使用预测时刻的信息集 ,并在多个预测步上最小化与任务代价一致的损失。
#符号说明
| 符号 | 含义 | 单位/条件 |
|---|---|---|
| 作出预测的当前时刻 | 时间索引 | |
| 预测步长与最大预测范围 | 正整数 | |
| 时刻 真正可获得的信息集 | 历史数值、已知外生变量等 | |
| 未来第 步的真实目标值 | 依任务定义 | |
| 参数为 的时序预测器 | 函数 | |
| 模型对未来值的点预测 | 与 同单位 | |
| 与任务代价对应的预测损失 | MAE、MSE、分位数损失等 | |
| 截至 可用的外生变量和文本事件特征 | 特征序列 | |
| 分位数预测及其概率水平 | 单位与取值范围分别对应 |
如果输入包含 之外的未来实测信息,目标函数即发生信息泄漏。
#技术要点
- 数值模型负责预测、检测与概率校准。
- LLM 适合文本知识、元数据、工具编排和解释。
- 切分必须按时间,避免未来信息泄漏。
- 任何 LLM 方案应与无 LLM 的强基线比较。
#原理与演进
#先确定时序任务的数学对象
| 任务 | 输出 | 常见技术难点 |
|---|---|---|
| 预测 | 或未来分布 | 趋势/季节性、外生变量未来是否可得 |
| 异常检测 | 每个时刻或区间的异常分数 | 异常稀少、标签延迟与漂移 |
| 分类 | 窗口或设备状态标签 | 类别不平衡、跨设备迁移 |
| 因果推断 | 干预效应而非相关性 | 混杂、反事实不可观测 |
| 模式挖掘 | 重复状态、事件序列 | 多尺度、可解释性 |
- 公式中 是预测时刻已知的外生变量;若把未来天气实测值、未来维修记录输入模型,就是信息泄漏。
- 预测应与季节性朴素法、线性模型和合适的深度时序基线比较;加 LLM 的收益必须超出其额外数据与计算成本。
#LLM 最有理由出现的位置
- 文本变结构化变量:从设备日志、维修工单或规程提取与时序相关的事件。
- 检索专业知识:将规程和历史案例作为可引用证据;机制见RAG。
- 工具编排:调用数值预测、异常检测和因果分析模型,再解释结果;见工具调用。
#必须避免的错觉
- 时间随机切分会让同一设备相邻窗口同时落在训练与测试,分数虚高;应按时间并考虑跨设备/跨季节外推。
- LLM 生成的自然语言解释不等于因果证据;因果结论必须有识别假设与对照设计。
- 解释是否“像专家”与数值误差、异常召回、校准度应分别评估。
#1. 先定义可预测信息集
预测时刻 的信息集记为 ;合法预测器必须满足下式。历史负荷、已发布的天气预报、未来已知日历通常可用;未来实测天气、事后故障报告、未来统计均值不可用。这个约束比“训练集/测试集分开”更根本。
多步预测可直接输出 ,也可递归生成;递归方案会积累误差。点预测之外,分位数 或分布 更适合调度风险决策,但需要校准检查。
#2. 数值主线与 LLM 主线的位置
季节性朴素法(强基线)→ 统计/树模型(外生变量与可解释特征)→ 深度时序模型(长依赖、多变量与跨设备迁移)→ LLM 接入文本/知识/工具(补充异构信息);最后一步不是对前面模型的无条件替代。
| 组件 | 最合适的输入 | 输出 | 主要错误 |
|---|---|---|---|
| 时序预测器 | 历史数值、可用外生变量 | 数值/分布预测 | 漂移、极端值、未来泄漏 |
| 事件提取 LLM | 工单、日志、规程 | 时间戳、设备、事件类型 | 文本歧义、实体对齐错 |
| RAG | 有版本的规程/知识 | 带来源的证据 | 漏召回、过时文件 |
| Agent/工具层 | 已验证的模型与数据库 | 编排、解释 | 工具越权、解释过度 |
LLM 输出的事件特征 可与时序特征拼接如下。若 来自事后填写的工单,却被当作预测时刻已知,则引入时间泄漏。
#3. 五类任务各有独立指标
| 任务 | 原理目标 | 合适的核心评价 |
|---|---|---|
| 预测 | 最小化 | MAE/RMSE、季节分层误差、分位数覆盖 |
| 异常检测 | 区分异常与正常时间段 | PR-AUC、事件级召回、误报/天、检测延迟 |
| 分类 | 将窗口映射到状态 | macro-F1、跨设备混淆矩阵 |
| 因果推断 | 估计 | 识别假设、敏感性分析、干预验证 |
| 模式挖掘 | 找重复或阶段性结构 | 稳定性、可复现性、业务解释一致性 |
因果效应的反事实 不能同时对同一对象直接观测;语言模型生成的“原因解释”不填补这个识别缺口。异常检测若仅看点级准确率,在异常极少时可能接近全正常基线。
#4. 实验切分要匹配部署场景
时间外推:按时间向前滚动验证,训练只用测试时刻之前数据。设备外推:将整台设备留出,检验跨设备迁移。地域/季节外推:额外按场站、季节分层。若同一设备的重叠窗口被随机分到训练与测试,几乎重复的历史模式会抬高指标。
LLM 增益应做消融:数值基线;+文本事件;+RAG;+Agent 编排。每一步额外报告 token、延迟、可用率和错误类型。若仅加入 LLM 而数据源也变多,不能把提升全部归因于模型架构。
#5. 专业知识如何影响模型
设备拓扑、运行约束、调度规程更适合作为结构化特征或可检索证据;训练权重适合吸收稳定、广泛重复的模式。知识频繁变动时,优先更新检索库而非依赖继续预训练。对需严守物理边界的预测,可将违反约束的输出投影回可行域,但投影后的误差、覆盖率和物理一致性都需单独验证。
#6. 预测指标必须对齐决策代价
MAE 见式(1),RMSE 见式(2);RMSE 对大误差更敏感。若低估负荷比高估负荷更危险,单一对称误差不够,应使用不对称损失或分位数预测。分位数损失见式(3),其中式(4);它直接对应不同风险水平的预测。
式(1):
式(2):
式(3):
式(4):
不能只报所有时刻平均值。极端天气、节假日、设备故障时段可能少,却决定调度风险;应对这些条件分别报告误差与区间覆盖。概率预测若 90% 区间仅覆盖 60% 真值,数值平均误差小也不足以支撑风险决策。
#7. LLM 解释的证据链
一条可信解释应能追溯:原始时序异常区间 → 数值模型预测/异常分数 → 相关日志/规程片段 → LLM 组织语言。若只给 LLM 一张预测曲线,它可能把相关事件叙述成因果原因。尤其对“某次调度动作导致负荷变化”之类结论,应明确干预时间、对照和潜在混杂,不能凭叙事流畅度替代识别假设。
关联概念: RAG提供规程证据;工具调用连接数值模型;评测与可靠性说明分层评价、泄漏与成本口径;数据血缘追踪工单与时序数据版本。