CastMind(星思) 情境推演驱动的时间序列基础大模型

CastMind 是一个面向复杂系统的情境推理驱动时间序列推演大模型,通过融合历史序列、外部情境与领域知识,推演未来趋势在特定条件下的延续、增强、削弱、偏移或反转,并实现预测修正与机制解释。

“时序预测推演大模型(Time Series Forecasting Foundation Model / Time Series Reasoning Model)”是一类面向复杂动态系统、基于大规模时序数据预训练,并具备预测、推理、解释、交互和决策辅助能力的新一代智能模型。其目标不再只是“根据过去预测未来”,而是进一步实现:理解系统演化规律 → 结合外部情境知识 → 推演未来可能状态 → 评估不确定性 → 辅助决策。

CastMind 是这一范式下的情境推理驱动时间序列推演大模型。它首先从历史序列中挖掘趋势、周期、波动和变量依赖,形成基础未来轨迹;随后融合天气、事件、政策、文本、领域知识和系统状态等多源情境,理解系统运行条件;进一步通过大模型的知识推理与机制分析,判断历史趋势在特定情境下是否延续、增强、削弱、偏移或反转,完成未来状态推演、预测修正、不确定性评估与机制解释,为后续决策提供依据。

项目简介

CastMind 的核心技术哲学,是用慢思考、长链路、可验证的认知推理过程,实现对时间序列未来趋势的条件化推演。其关键技术路径围绕“外推—理解—推演—修正”展开,将历史数值模式、多源情境信息和大模型推理能力组织为一个可解释、可修正的预测流程。

01
理解规律

基于历史序列学习长期趋势、周期节律、局部波动、突变点与多变量依赖, 区分稳定结构、短期扰动与异常噪声,建立不含外部情境的基础未来轨迹。

核心产出系统演化规律与基础预测轨迹
02
结合情境

检索并对齐天气、事件、政策、文本、领域知识和系统状态,评估证据的相关性、 时效性与可信度,判断不同条件对基础趋势的增强、削弱、偏移或反转作用。

核心产出可信情境约束与条件影响判断
03
推演状态

围绕关键变量与机制假设,分别推演趋势延续、增强、削弱、偏移或反转等可能路径, 形成条件化的多情景未来状态空间,而不是给出唯一答案。

核心产出未来状态集合、触发条件与演化路径
04
评估不确定性

同时报告点预测误差、概率分布或预测区间,并通过敏感性和反事实分析, 识别风险来源、敏感因素和模型适用边界,说明结论在何种条件下可信。

核心产出置信区间、风险清单与适用边界
05
辅助决策

把不同情景下的预测结果和风险评估转化为预警、调度、资源配置或行动建议, 比较不同干预方案的影响与代价,并根据反馈持续修正预测。

核心产出可执行建议、干预优先级与反馈闭环

时序推演输入

CastMind(星思)的推演输入由历史序列情境特征两个模块构成: 前者提供数值轨迹基础,后者提供条件约束与机制解释。

Sequence Module

历史序列

历史序列是 CastMind 进行趋势推演的基础观测信号,负责刻画连续变化、局部波动、 周期结构、异常点、转折点和多变量依赖,形成可被后续情境推理修正的基础未来轨迹。

Trend · Seasonality · Volatility · Turning Point · Multivariate Dependency
Context Module

情境特征

情境特征为预测提供外部条件和领域约束,包括天气、节假日、事件、政策、文本、 领域知识和系统状态等信息,用于判断历史趋势在特定情境下是否延续、增强、削弱、 偏移或反转。

Weather · Events · Policy · Text · Domain Knowledge · System State

训练 Instance 结构

一个典型的 CastMind(星思)训练样本包含以下八类信息:

Instance = {
  dynamic_numeric_sequence Feature Encoder 原生建模的动态数值序列
  context_aware_features 外部情境证据(天气、事件、日历、空间、环境状态…)
  domain_metadata 领域、频率、变量、单位信息
  forecasting_instruction 预测任务定义
  future_target 未来真实值(监督信号)
  reasoning_trace 结构化上下文推理过程(SFT / Reasoning 阶段学习)
  agentic_interaction_trace 环境交互、证据获取与预测修正轨迹
  reward_signals 结果奖励 + 推理过程奖励 + Agentic 交互反馈
}

关键技术路径

预训练语言大模型作为 Backbone Network,SFT / RLVR 作为能力优化算法, 构成从通用认知主干、监督适配到可验证推演强化的关键技术路径。

1. Backbone Network:预训练语言大模型作为推演主干

CastMind 不一定从零训练时间序列大模型,而是以预训练语言大模型作为 Backbone Network,利用其已有的语言理解、知识表达、复杂推理、指令跟随和工具调用能力,作为时间序列推演的认知核心。

它的输入不只是历史时间序列,还包括:

Xpast, C, K, T

其中:

  • Xpast:历史时间序列;
  • C:多源情境信息;
  • K:领域知识;
  • T:预测任务目标。

Backbone 的作用不是简单生成数值,而是完成:

历史序列理解、情境语义理解、时序—情境协同推理、未来趋势推演与预测修正。

这里可以配合时序编码器、统计工具、时序 tokenizer、特征提取器或可视化输入接口,把数值时序转化为大模型可理解、可推理的表示。

2. SFT:监督微调,让模型学会“如何推演”

SFT 的核心作用是把通用语言大模型适配到时间序列推演任务。

训练样本可以构造成:

历史序列 + 情境信息 + 任务指令 → 趋势理解 + 情境分析 + 推演判断 + 修正预测

SFT 重点训练模型学会四类能力:

  1. 历史序列理解:识别趋势、周期、波动、异常、转折点;
  2. 情境理解:判断天气、事件、政策、文本等情境是否与预测相关;
  3. 趋势推演:判断未来趋势是延续、增强、削弱、偏移还是反转;
  4. 预测修正:根据推演结果调整基础预测。

所以 SFT 的目标不是简单拟合数值,而是让模型学习一套标准化的推演工作流:

看懂历史 → 理解情境 → 推演未来 → 修正预测 → 生成解释。

3. RLVR:强化模型的可验证推演能力

RLVR 可以理解为 Reinforcement Learning with Verifiable Rewards,即用可验证奖励优化模型的推演行为。

它适合 CastMind,因为时间序列预测有天然可验证信号:

  • 预测误差是否降低;
  • 趋势方向是否判断正确;
  • 峰谷位置是否命中;
  • 转折点是否识别正确;
  • 情境引用是否合理;
  • 推演解释是否与数值修正一致;
  • 是否避免 context leakage。

可以构造奖励函数:

R = Rforecast + Rtrend + Rturning + Rcontext + Rconsistency − Rleakage

其中:

  • Rforecast:预测误差奖励;
  • Rtrend:趋势方向奖励;
  • Rturning:拐点识别奖励;
  • Rcontext:情境相关性奖励;
  • Rconsistency:解释与预测修正一致性奖励;
  • Rleakage:未来信息泄漏惩罚。

RLVR 的价值在于让模型不只是“会说解释”,而是:

推演过程能够真正带来预测性能提升,并且推理结论可以被结果验证。

四阶段训练范式

CastMind(星思)采用四个能力递进阶段: CastMind-Base → CastMind-SFT → CastMind-Structured Reasoning → CastMind-Agentic Reasoning。 Base 阶段解决"如何以 Feature Encoder 接入动态数值序列";SFT 阶段解决"如何融合 Context-aware Feature 完成时序任务"; Structured Reasoning 阶段解决"如何进行上下文推理预测";Agentic Reasoning 阶段解决 "如何与环境自主多轮交互、获取证据并修正判断"。

Stage 1CastMind-Base
接入时间序列
Stage 2CastMind-SFT
完成时序任务
Stage 3Structured Reasoning
上下文推理预测
Stage 4Agentic Reasoning
自主多轮交互
Stage 1 · CastMind-Base

基础模型阶段
接入时间序列信号

输入:原始时间序列 + 多模态情境 + 跨域语料

核心目标是建立"Feature Encoder + LLM Backbone"的模型底座。 原始时间序列首先经过 Feature Encoder 在数值空间中建模动态变化, 再输入语言模型,使模型具备跨域时间序列表征、基础预测、上下文融合和 多模态情境对齐能力。这个阶段重点不是复杂推理,而是让语言模型真正接入动态数值序列信号。

输出:CastMind-Base
Stage 2 · CastMind-SFT

任务适配阶段
按任务分析和预测

输入:监督微调任务样本 + 预测与解释示范

核心目标是让模型从"能表示时间序列"进一步变成 "能按照任务要求分析和预测时间序列"。 通过监督微调,模型学习趋势分析、预测生成、异常解释、外生变量理解、 Meta Data 融合、领域描述理解和 Context-aware Feature 对齐, 解决指令跟随、任务格式、预测输出和基础解释问题。

输出:CastMind-SFT
Stage 3 · CastMind-Structured Reasoning

上下文推理阶段
推理式预测

输入:结构化时序推理样本 + 推理质量反馈

核心目标是强化模型的结构化上下文推理能力。 模型不只是直接输出预测结果,而是能够围绕趋势变化、周期波动、异常扰动、 事件影响、情境变化和未来演化路径展开分步分析。 这个阶段把时间序列预测从"模式外推"推进到"推理式预测"。

输出:CastMind-Structured Reasoning
Stage 4 · CastMind-Agentic Reasoning

Agentic Reasoning 阶段
环境自主多轮交互

输入:环境状态 + Memory/工具交互 + 证据检索与修正轨迹

核心目标是让 CastMind(星思)具备可评估的 Agentic Reasoning 能力。 模型在预测过程中可以主动发现证据缺口,与 Memory、检索器、外部变量服务和任务环境 自主多轮交互,检索历史相似模式、领域知识、失败经验、数据分析结论和过往预测轨迹, 并基于新证据持续修正上下文判断和最终预测。这个阶段强调环境交互闭环, 不是一次性的工具调用展示。

输出:CastMind-Agentic Reasoning

评估体系

CastMind(星思)的时序预测评估首先遵循两大类指标体系: 确定性点预测评估衡量单一预测值或预测轨迹与真实值之间的误差, 概率性预测评估衡量预测分布、分位数和预测区间的质量、校准性与锐度。 在此基础上,评估同时覆盖 in-domain 能力out-of-domain 泛化能力, 并进一步验证 Feature Encoder、Context-aware Feature 与 Agentic Reasoning 的综合增益。

In-domain 评估

已见领域的两类预测评估

使用现有数据集测试集,分别检验 CastMind(星思)在已见领域和数据分布下的点预测精度与概率预测质量。

  • 确定性点预测评估:MAE · MSE · RMSE · sMAPE · MASE,用于衡量点预测误差与跨尺度表现
  • 概率性预测评估:CRPS · Pinball Loss · Prediction Interval Coverage · Mean Prediction Interval Width,用于衡量分布质量、分位数误差、区间校准性与锐度
  • Encoder 指标:动态数值序列表示质量 · 关键变化点捕获 · 趋势方向一致性
  • Context 指标:Context Attribution · 情境归因一致性 · 可见上下文利用率
  • Agentic 指标:交互触发准确性 · 环境证据利用率 · 预测修正有效性

在四个阶段(Base / SFT / Structured Reasoning / Agentic Reasoning)间进行对比,展示各阶段对预测、上下文推理与环境交互能力的增益。概率区间的覆盖率与区间宽度必须联合报告,避免以过宽区间换取表面上的高覆盖率。

Out-of-domain 评估

跨领域情境感知泛化能力

FutureCast(天星台) 为核心评测集,在未见领域、未见上下文类型和复杂情境变化下,同时评估确定性点预测与概率性预测的泛化能力。

  • 确定性点预测泛化:报告 MAE、RMSE、sMAPE、MASE 及其相对 in-domain 性能退化
  • 概率性预测泛化:报告 CRPS、Pinball Loss、区间覆盖率与区间宽度的变化
  • 能否适应新的领域和采样频率
  • 能否理解未见的 Context-aware Feature 类型
  • 能否在外部事件、分布漂移、非平稳变化和信息不完整下给出稳健预测
  • 能否通过上下文推理解释未来趋势变化
  • 能否在信息不完整时与环境自主多轮交互并修正预测
  • 能否输出合理的不确定性估计

评估指标总览

评估维度指标适用阶段
确定性点预测评估MAE · MSE · RMSE · sMAPE · MASE全部阶段
概率性预测评估CRPS · Pinball Loss · PI Coverage · Mean Prediction Interval WidthSFT / Structured Reasoning / Agentic Reasoning
趋势判断能力Direction Accuracy · Turning-point F1全部阶段
Feature Encoder 表示质量Dynamic Pattern Coverage · Turning-point Capture · Temporal Embedding Separability全部阶段
情境融入能力Contextual Integration · Context Attribution · Context UtilizationSFT / Structured Reasoning / Agentic Reasoning
预测—推理一致性Prediction-Reasoning Consistency ScoreStructured Reasoning / Agentic Reasoning
环境交互质量Interaction Seeking · Evidence Grounding · Forecast Revision · Environment Feedback UseAgentic Reasoning
跨域泛化能力确定性与概率性指标的 Zero-shot / Few-shot 表现及相对性能退化(FutureCast(天星台))全部阶段

从时间序列预测到时序预测推演

预测是推演的数值基础。推演是在预测之上对未来进行情境化、机制化和多情景扩展,而不是对预测的简单替代。

Stage 01 · Forecasting

数据拟合智能

传统时间序列预测

输入
历史序列
方法
模式匹配 · 统计学习
输出
点预测 · 概率预测

What will happen?

Stage 02 · Context

情境理解智能

情境感知时间序列预测

输入
历史序列 + 外部情境
方法
情境对齐 · 条件关联分析
输出
特定情境下的条件预测

What will happen under this context?

Stage 03 · Reasoning

认知推演智能

机制推理与多情景推演

输入
序列 + 情境 + 知识 + 系统状态
方法
机制分析 · 假设推理 · 情景模拟
输出
多种未来状态 · 不确定性 · 决策依据

Why? What if? What should we do?

能力演进链路
历史序列预测 → 情境条件预测 → 机制推理与多情景推演 → 不确定性评估 → 决策辅助

CastMind 以数值预测为基础锚点,引入外部情境和领域知识理解系统运行条件,通过机制分析、假设推理与多情景模拟,推演不同条件下的未来状态,评估其不确定性与风险,并为决策提供依据。