知识库 / 应用实践
GitHub
← 应用实践

LAYER 07 / APPLICATIONS

能源时序与大模型

所属: 应用层。本页边界: LLM 应怎样与数值时序模型结合,而不是替代强预测基线。

#核心公式

ϕ∗=arg⁡min⁡ϕE ⁣[∑h=1Hℓ ⁣(yt+h,fϕ(Ft,h))] \phi^* =\arg\min_\phi \mathbb E\!\left[ \sum_{h=1}^{H} \ell\!\left( y_{t+h}, f_\phi(\mathcal F_t,h) \right) \right]

该目标强调预测器只能使用预测时刻的信息集 Ft\mathcal F_t,并在多个预测步上最小化与任务代价一致的损失。

#符号说明

符号 含义 单位/条件
tt 作出预测的当前时刻 时间索引
h, Hh,\ H 预测步长与最大预测范围 正整数
Ft\mathcal F_t 时刻 tt 真正可获得的信息集 历史数值、已知外生变量等
yt+hy_{t+h} 未来第 hh 步的真实目标值 依任务定义
fϕf_\phi 参数为 ϕ\phi 的时序预测器 函数
y^t+h\hat y_{t+h} 模型对未来值的点预测 与 yy 同单位
ℓ\ell 与任务代价对应的预测损失 MAE、MSE、分位数损失等
u≤t, e≤tu_{\le t},\ e_{\le t} 截至 tt 可用的外生变量和文本事件特征 特征序列
q^α,t+h, α\hat q_{\alpha,t+h},\ \alpha 分位数预测及其概率水平 单位与取值范围分别对应 y, (0,1)y,\ (0,1)

如果输入包含 Ft\mathcal F_t 之外的未来实测信息,目标函数即发生信息泄漏。

#技术要点

  • 数值模型负责预测、检测与概率校准。
  • LLM 适合文本知识、元数据、工具编排和解释。
  • 切分必须按时间,避免未来信息泄漏。
  • 任何 LLM 方案应与无 LLM 的强基线比较。

#原理与演进

#先确定时序任务的数学对象

任务 输出 常见技术难点
预测 y^t+h\hat y_{t+h} 或未来分布 趋势/季节性、外生变量未来是否可得
异常检测 每个时刻或区间的异常分数 异常稀少、标签延迟与漂移
分类 窗口或设备状态标签 类别不平衡、跨设备迁移
因果推断 干预效应而非相关性 混杂、反事实不可观测
模式挖掘 重复状态、事件序列 多尺度、可解释性
  • 公式中 u≤tu_{\leq t} 是预测时刻已知的外生变量;若把未来天气实测值、未来维修记录输入模型,就是信息泄漏。
  • 预测应与季节性朴素法、线性模型和合适的深度时序基线比较;加 LLM 的收益必须超出其额外数据与计算成本。

#LLM 最有理由出现的位置

  1. 文本变结构化变量:从设备日志、维修工单或规程提取与时序相关的事件。
  2. 检索专业知识:将规程和历史案例作为可引用证据;机制见RAG。
  3. 工具编排:调用数值预测、异常检测和因果分析模型,再解释结果;见工具调用。

#必须避免的错觉

  • 时间随机切分会让同一设备相邻窗口同时落在训练与测试,分数虚高;应按时间并考虑跨设备/跨季节外推。
  • LLM 生成的自然语言解释不等于因果证据;因果结论必须有识别假设与对照设计。
  • 解释是否“像专家”与数值误差、异常召回、校准度应分别评估。

#1. 先定义可预测信息集

预测时刻 tt 的信息集记为 Ft\mathcal F_t;合法预测器必须满足下式。历史负荷、已发布的天气预报、未来已知日历通常可用;未来实测天气、事后故障报告、未来统计均值不可用。这个约束比“训练集/测试集分开”更根本。

y^t+h=f(Ft) \hat y_{t+h}=f(\mathcal F_t)

多步预测可直接输出 (y^t+1,…,y^t+H)(\hat y_{t+1},\ldots,\hat y_{t+H}),也可递归生成;递归方案会积累误差。点预测之外,分位数 q^α,t+h\hat q_{\alpha,t+h} 或分布 p(yt+h∣Ft)p(y_{t+h}\mid\mathcal F_t) 更适合调度风险决策,但需要校准检查。

#2. 数值主线与 LLM 主线的位置

季节性朴素法(强基线)→ 统计/树模型(外生变量与可解释特征)→ 深度时序模型(长依赖、多变量与跨设备迁移)→ LLM 接入文本/知识/工具(补充异构信息);最后一步不是对前面模型的无条件替代。

组件 最合适的输入 输出 主要错误
时序预测器 历史数值、可用外生变量 数值/分布预测 漂移、极端值、未来泄漏
事件提取 LLM 工单、日志、规程 时间戳、设备、事件类型 文本歧义、实体对齐错
RAG 有版本的规程/知识 带来源的证据 漏召回、过时文件
Agent/工具层 已验证的模型与数据库 编排、解释 工具越权、解释过度

LLM 输出的事件特征 ete_t 可与时序特征拼接如下。若 ete_t 来自事后填写的工单,却被当作预测时刻已知,则引入时间泄漏。

y^t+h=fϕ(y≤t,u≤t,e≤t) \hat y_{t+h}=f_\phi(y_{\le t},u_{\le t},e_{\le t})

#3. 五类任务各有独立指标

任务 原理目标 合适的核心评价
预测 最小化 Eℓ(y,y^)\mathbb E\ell(y,\hat y) MAE/RMSE、季节分层误差、分位数覆盖
异常检测 区分异常与正常时间段 PR-AUC、事件级召回、误报/天、检测延迟
分类 将窗口映射到状态 macro-F1、跨设备混淆矩阵
因果推断 估计 E[Y(1)−Y(0)]\mathbb E[Y(1)-Y(0)] 识别假设、敏感性分析、干预验证
模式挖掘 找重复或阶段性结构 稳定性、可复现性、业务解释一致性

因果效应的反事实 Y(0),Y(1)Y(0),Y(1) 不能同时对同一对象直接观测;语言模型生成的“原因解释”不填补这个识别缺口。异常检测若仅看点级准确率,在异常极少时可能接近全正常基线。

#4. 实验切分要匹配部署场景

时间外推:按时间向前滚动验证,训练只用测试时刻之前数据。设备外推:将整台设备留出,检验跨设备迁移。地域/季节外推:额外按场站、季节分层。若同一设备的重叠窗口被随机分到训练与测试,几乎重复的历史模式会抬高指标。

LLM 增益应做消融:数值基线;+文本事件;+RAG;+Agent 编排。每一步额外报告 token、延迟、可用率和错误类型。若仅加入 LLM 而数据源也变多,不能把提升全部归因于模型架构。

#5. 专业知识如何影响模型

设备拓扑、运行约束、调度规程更适合作为结构化特征或可检索证据;训练权重适合吸收稳定、广泛重复的模式。知识频繁变动时,优先更新检索库而非依赖继续预训练。对需严守物理边界的预测,可将违反约束的输出投影回可行域,但投影后的误差、覆盖率和物理一致性都需单独验证。

#6. 预测指标必须对齐决策代价

MAE 见式(1),RMSE 见式(2);RMSE 对大误差更敏感。若低估负荷比高估负荷更危险,单一对称误差不够,应使用不对称损失或分位数预测。分位数损失见式(3),其中式(4);它直接对应不同风险水平的预测。

式(1):

1n∑i∣yi−y^i∣ \frac1n\sum_i|y_i-\hat y_i|

式(2):

1n∑i(yi−y^i)2 \sqrt{\frac1n\sum_i(y_i-\hat y_i)^2}

式(3):

ρα(u)=u(α−1[u<0]) \rho_\alpha(u)=u(\alpha-\mathbf 1[u<0])

式(4):

u=y−q^α u=y-\hat q_\alpha

不能只报所有时刻平均值。极端天气、节假日、设备故障时段可能少,却决定调度风险;应对这些条件分别报告误差与区间覆盖。概率预测若 90% 区间仅覆盖 60% 真值,数值平均误差小也不足以支撑风险决策。

#7. LLM 解释的证据链

一条可信解释应能追溯:原始时序异常区间 → 数值模型预测/异常分数 → 相关日志/规程片段 → LLM 组织语言。若只给 LLM 一张预测曲线,它可能把相关事件叙述成因果原因。尤其对“某次调度动作导致负荷变化”之类结论,应明确干预时间、对照和潜在混杂,不能凭叙事流畅度替代识别假设。

关联概念: RAG提供规程证据;工具调用连接数值模型;评测与可靠性说明分层评价、泄漏与成本口径;数据血缘追踪工单与时序数据版本。

本页由仓库中的 Markdown 生成。具体技术结论请结合正文引用与实验条件理解。

输入关键词,探索整个知识库

↑ ↓ 选择 ↵ 打开36 篇笔记,一次搜索