Time-Series Evaluation Observatory

CastBench 多维时间序列基础模型评测与公开排行榜

不只比较一个误差数字。CastBench 在统一协议下评估数值预测、概率校准、 趋势与转折、情境证据利用、跨域鲁棒性和推理效率,让每个模型的优势与边界都可见。

Leaderboard

模型能力总榜

默认按六维加权综合分排序。你也可以切换领域、模型类型和单项能力, 点击模型查看领域剖面,或选择最多 3 个模型并排比较。

正在加载协议演示榜单…

85–100 强 70–84 中 <70 基线
CastBench 协议演示排行榜。当前分数不构成正式模型性能声明。
排名 模型 / 类型 状态 / 操作
Benchmark Dataset

三层数据轨道,覆盖真实预测难点

CastBench 首期规划把通用数值预测、FutureCast 情境任务和压力测试组织成互补数据轨道, 让模型既要“预测得准”,也要“理解为什么变化、遇到新情境能否修正”。

Suite 01 · Foundation

General Forecasting Suite

统一评估多领域、多频率和多预测跨度下的基础数值预测与概率预测能力, 为深度模型和时间序列基础模型提供可比底座。

Point Forecast Probabilistic Zero-shot Long Horizon
Suite 02 · Context

FutureCast Context Suite

把历史序列、天气、日历、事件、政策、文本和领域规则组织为联合实例, 检验情境选择、证据对齐、趋势推理与预测修正。

Context Alignment Evidence Use Revision Gain Reasoning
Suite 03 · Stress

Stress Test Suite

面向分布漂移、极端事件、缺失情境、跨域迁移和受限推理预算, 检验平均成绩之外的最差场景表现与系统稳定性。

Distribution Shift Extreme Events Missing Context Worst-group
数据发布边界

本页展示的是首期规划与评测结构,不虚构尚未冻结的数据规模、样本数量或完成状态。 具体数据清单、许可、版本与下载入口将在数据审计完成后独立发布。

ENERGY General + Context

能源与电力

负荷、发电与价格序列,强调峰谷转换、需求响应和新能源出力不确定性。

情境:温度、节假日、电价、设备与政策 挑战:多跨度预测 · 爬坡事件 · 跨区域迁移
MOBILITY General + Context

交通与出行

道路流量、速度、客流和共享出行序列,覆盖明显周期与突发扰动。

情境:天气、事故、活动、路网与日历 挑战:空间迁移 · 突发拥堵 · 缺失传感器
WEATHER General + Stress

气象与环境

天气、空气质量、水文与环境监测序列,强调多变量耦合和极端事件。

情境:空间邻近、季节、预警与外部驱动 挑战:多尺度变化 · 极值 · 长预测窗口
MARKET Context + Stress

金融与零售

价格、销量、库存和客流序列,考察事件、促销与制度变化下的需求漂移。

情境:新闻、促销、节庆、价格与业务规则 挑战:冷启动 · 结构突变 · 反事实情境
HEALTH + OPS Context + Stress

医疗与运营

生理监护、就诊需求、服务流量和资源负载,强调不规则观测与高风险误差。

情境:干预、状态、发布变更与系统事件 挑战:个体差异 · 稀疏观测 · 可靠性约束
HARD SET Stress Only

跨域困难集

把未见领域、未见实体、未见事件与缺失情境组合起来,单独衡量性能下界。

划分:时间、实体、区域、事件与情境组合隔离 挑战:零样本 · 分布漂移 · 最差组表现
Evaluation Dimensions

六维评测,不用单一误差定义“最好”

原始指标先按数据域、尺度和方向标准化,再汇总为越高越好的能力分。 这样既保留 MAE、CRPS 等原始结果,也能形成清晰、可解释的统一能力剖面。

DIM 01 30%

点预测准确性

衡量单一预测轨迹与真实未来之间的偏差,并对不同量纲和预测跨度进行归一化。

MAE · RMSE · sMAPE · MASE · NRMSE
DIM 02 15%

概率预测质量

联合评估预测分布、分位数和预测区间的准确性、校准性与锐度。

CRPS · Pinball Loss · Coverage · Interval Width
DIM 03 15%

趋势与转折判断

衡量模型是否抓住未来方向、斜率变化和关键转折,而不是只优化平均数值误差。

Direction Accuracy · Trend Accuracy · Turning-point F1
DIM 04 20%

情境理解与证据利用

检验模型能否选择相关情境、对齐事件与序列变化,并利用新增证据修正预测。

Evidence F1 · Context Attribution · Revision Gain
DIM 05 15%

跨域鲁棒性

报告未见实体、事件和领域下的性能退化、最差数据域结果与有效任务覆盖率。

OOD Gap · Worst-group Score · Coverage · Stability
DIM 06 5%

推理效率

在统一硬件和调用预算下比较延迟、峰值显存、参数规模与外部工具成本。

Latency · Memory · FLOPs · Tool Calls · Cost

默认综合分公式

Overall = 30% Accuracy + 15% Probabilistic + 15% Trend + 20% Context + 15% Robustness + 5% Efficiency

MAE、RMSE、CRPS 等原始误差指标越低越好;经基线、尺度和方向校正后统一映射为 0–100 的“越高越好”能力分。缺失维度不静默填补,正式总榜至少覆盖五个维度和全部必选数据域。

050100
Evaluation Protocol

可复现比一个漂亮分数更重要

CastBench 把数据隔离、预算一致、分组报告和产物留存写入协议。 每个正式成绩必须能回答:用什么数据、何种设置、付出多少成本、能否复现。

RULE 01

时间顺序切分

训练、验证与测试严格遵循真实时间顺序;窗口只能在各自 split 内构造,禁止随机窗口泄漏。

RULE 02

未见实体与事件

跨域赛道隔离实体、区域、事件和情境组合,检验真正的未见场景泛化,而非近邻记忆。

RULE 03

统一推理预算

固定上下文、预测跨度、采样次数、工具调用次数和时间上限,使模型与智能体成本可比。

RULE 04

均值与最差数据域

同时报告微平均、宏平均、最差数据域、有效任务覆盖率和跨域退化,避免平均分掩盖短板。

RULE 05

统计稳定性

训练型方法报告三个随机种子;确定性与 API 模型记录版本、时间戳、参数和解码配置。

RULE 06

完整复现产物

保存配置、模型卡、预测文件与运行日志、环境摘要和指标明细,支持独立重算与审计。

成绩状态必须逐级升级

Demo → Submitted → Reproduced → Verified
Demo

仅用于界面、协议或方法演示;当前页面中的全部分数均处于此状态。

Submitted

提交方上传了完整结果包,等待自动校验和复现排期。

Reproduced

独立环境复跑成功,核心指标在允许误差范围内一致。

Verified

通过数据、配置、成本和结果审查,进入指定版本的正式榜单。

Submit & Reproduce

提交一次,留下完整复现链

提交不只是上传一个分数。CastBench 要求结果包同时包含预测、指标明细、配置和成本, 让后续的复现、误差归因和版本比较都有据可查。

01

选择评测轨道

选择基础预测、FutureCast 情境任务或 Stress Test,并锁定数据与协议版本。

02

运行标准适配器

通过统一输入输出接口运行模型,自动记录硬件、时延、调用预算和异常。

03

生成结果包

导出配置、预测文件、运行日志、环境摘要、模型卡和逐数据集指标明细。

04

复现审查与发布

通过格式校验、独立复跑与人工审查后,成绩进入对应版本的 Verified 榜单。

提交入口筹备中 查看 FutureCast 返回 CastMind 首版暂不收集在线提交,协议与适配器冻结后开放。
Model Capability Profile

模型详情