Understanding Time Series Data

时间序列数据与样本

时间序列不是按顺序排列的一串数,而是动态系统在特定时间、尺度和观测条件下留下的测量记录。 理解它,首先要看清一条记录包含什么,以及一段连续数据如何被组织成边界明确的预测样本。

动态系统的测量 单条记录的构成 预测样本的边界 信息的可用时间
Core View

先理解数据,再讨论预测

本页只讨论时间序列数据本身、样本如何构成,以及信息边界如何确定。

时间序列是动态系统随时间演化后形成的测量记录。每个数值都属于一个对象、一个时刻、一种尺度和一组观测条件。

Symbol Sequence

符号序列关注内容如何继续

位置主要表达先后关系;一个片段通常由符号及其上下文构成,语义合理性是理解连续内容的重要依据。

Measured Sequence

测量序列关注系统如何演化

时间戳、间隔、单位、观测对象和外部条件都会改变数值的含义。时间序列不是文本的数字版,它记录的是谁、何时、以什么尺度、在什么条件下发生了什么。

Level 01

真实系统

对象内部的状态、外部情境、运行行动与未知扰动共同推动系统持续演化。

Level 02

单条记录

观测过程把系统状态投影为带有对象、数值、时间、频率、情境和质量标记的数据。

Level 03

预测样本

围绕一个预测时点,将当时可用的历史与情境组织成输入,并把之后发生的未来作为答案。

System & Observation

时间序列是复杂系统留下的动态轨迹

许多真实系统无法被直接、完整地观察。我们得到的时间序列,是系统运行过程中持续留下的局部观测。

01电力系统

负荷曲线,以及供需平衡随时间形成的变化轨迹。

02水文系统

径流与水位随降雨、汇流和调度共同变化。

03气象系统

温度、降雨与风速等连续或事件型观测。

04新能源系统

光伏与风电功率对天气和运行条件的动态响应。

05交通系统

交通流量在通勤、事件和道路状态影响下的演化。

06工业系统

设备传感器信号对运行、磨损与故障状态的记录。

07金融系统

价格、交易量与需求变化对市场状态和人类行为的反映。

这些序列不是系统本身,而是系统的可观测投影。 它们由内部状态、外部扰动、运行机制与人类行为共同作用后产生;同一条曲线背后,可能对应不同的系统状态和形成原因。

系统如何演化,又如何被我们看到

Ct外部情境
At运行与决策行动
εt未观测扰动
当前潜在状态St
演化机制 F →
下一时刻状态St+1
观测映射 G 与观测噪声 ηtXt

一个简洁的概念表达

St+1 = F(St, Ct, At, εt)
Xt = G(St) + ηt

εt 表示系统演化中未被完整记录的扰动,ηt 表示测量过程中的噪声或误差。

  • St复杂系统内部的潜在状态
  • Ct天气、政策、环境与事件等外部情境
  • At系统运行者或决策者采取的行动
  • Xt实际能够观测到的时间序列
  • F系统真实但通常未知的演化机制
  • G从系统状态到观测数据的映射

我们看到的 Xt 并不是系统本身,而是系统的一个动态接口。

时间序列是连接人工智能模型与真实复杂系统的动态观测通道。分析时间序列,是借助可见轨迹反向认识系统的状态、结构、机制、变化与未来。

Record Anatomy

一条时序记录由什么构成

一行数据不应只有“时间 + 数值”。完整记录还要说明它从哪里来、如何被测量,以及能否被信任。

对象合肥站点 A
数值光伏功率 6.8 MW
时间08-16 14:00
采样15 分钟平均
情境晴 · 35°C
状态有效 · 已校验
01

观测对象

明确数值属于哪个人、设备、区域、站点、流域或业务单元。对象变化,往往意味着生成过程和可比较范围也随之变化。

02

数值、类型与单位

记录实值、计数、事件或状态,并保留单位、量纲、精度和量程。6.8 MW 与 6.8 kW 不是同一种观测。

03

时间坐标

包含时间戳、时区与日历语义。相同数值出现在工作日午后、周末凌晨或节假日,含义可能完全不同。

04

采样规则

说明采样间隔、频率、聚合方式和是否规则采样。瞬时值、15 分钟平均值与日累计值不能直接混为一列。

05

关联变量与情境

保存与目标同步的天气、日历、操作、事件和邻近对象信息,并注明这些信息是在何时、以何种来源获得的。

06

数据质量与状态

标记缺失、异常、插补、传感器故障、修订版本与运行状态。没有质量标记的“干净数值”可能掩盖真实观测过程。

关键理解:数值只有放回对象、时间、尺度、情境和观测条件中才具有完整意义;同一列数值并不自动构成同一种时间序列数据。
Sample Anatomy

一个预测样本由什么构成

预测样本不是从长序列中随意截取的一段数,而是在某个真实预测时点上,重新封装一次“当时已知什么、未来要判断什么”。

一次完整预测样本 对象 + 时点 + 输入 + 未来答案 + 身份
  1. 预测对象

    要判断哪一个实体、通道或指标的未来。

  2. 预测时点

    模拟“现在”的时间切口,也是所有信息可用性的判断基准。

  3. 历史窗口

    截至预测时点能够看到的目标历史、相关变量和状态记录。

  4. 未来范围

    从何时开始、向前多远、以什么频率给出未来结果。

  5. 当时可用的信息

    预测时已经发布的日历、计划、预报、事件与其他情境。

  6. 未来真实结果

    预测发生后才观测到的答案,只用于回看与评价。

  7. 样本身份

    实体编号、时间区间、数据版本、场景标签,以及所属训练、验证或测试阶段。

Input Boundary

输入边界

在预测时点以前真实可见的历史记录,以及当时已经确定或已经发布的信息。

Answer Boundary

答案边界

预测时点之后逐步发生的真实未来。它是样本答案,不能反过来进入本次预测的输入。

Information Boundary

判断信息能否进入样本,要看三种时间

“事情何时发生”与“我们何时知道”并不总是相同。样本必须还原预测发生当时的信息状态。

发生时间

观测、事件或状态在现实系统中真正出现的时间,例如降雨开始、设备停机或政策生效的时刻。

可获得时间

数据或消息实际进入预测者视野的时间。延迟上报、事后修订和晚到数据都可能使它晚于发生时间。

预测时点

样本模拟的决策现在。只有在这一刻已经可获得的信息,才属于本次样本的真实输入。

边界原则:即使一条信息描述的是早已发生的事情,只要它在预测时点之后才获得,就不能作为这个样本的输入。否则,离线数据会比真实预测拥有更多“事后知识”。
Rolling Samples

一条长序列如何形成多个样本

沿时间轴移动预测时点,可以得到多个历史—未来配对;每移动一次,样本的“现在”以及可用信息都要同步更新。

样本 A · 周一 12:00

080910111213
已知历史待预测未来

以周一中午为预测时点,未来两段记录属于答案。

样本 B · 周一 13:00

091011121314
已知历史待预测未来

向前移动一小时后,12:00 的真实记录进入历史,信息状态随之改变。

样本 C · 周一 14:00

101112131415
已知历史待预测未来

再次移动后形成新样本,但它与前两个样本共享了大量历史记录。

不能只看窗口数量:滚动切片可以生成很多样本,但相邻窗口高度重叠,并不等于获得了同样多份彼此独立的新证据。
Sample Organization

样本质量比样本数量更重要

好的样本集既要尊重时间顺序,也要保留实体差异、真实数据质量和稀有状态。

01 · 时间顺序

过去训练,未来检验

按时间顺序划分训练、验证与测试阶段,避免未来时期的状态、修订记录或统计信息提前影响过去样本。

02 · 实体边界

识别谁与谁真正独立

当不同用户、设备、流域或站点需要独立检验时,应按独立实体分组,避免同一对象的近邻片段同时出现在两侧。

03 · 观测真实性

不要抹掉数据产生过程

保留缺失、异常与极端时期的标记,并记录插补和修订来源;这些状态本身就是理解测量可靠性的组成部分。

04 · 分布代表性

让常态与关键少数都被看见

检查普通时期与稀有时期的代表性,明确季节、机制变化、突发冲击和新实体是否在不同阶段得到合理覆盖。

My Understanding

我对时间序列数据的三个基本认识

时间序列的意义不只存在于数值中,也存在于数值如何被观测、组织和使用的边界中。

数据是系统测量

每个值都来自具体对象、具体时刻与具体观测过程,不能脱离时间尺度、单位和状态单独解释。

样本是预测现场

一个样本应还原某个预测时点的真实信息条件,清楚区分当时已知的输入与后来发生的答案。

数量不等于证据

大量重叠窗口可能只是重复观察同一段历史;真正重要的是独立性、代表性、边界一致性和数据质量。

只有先把“记录了什么、样本如何形成、当时能知道什么”说清楚,时间序列研究才建立在真实、可复现且可解释的数据基础上。