General Forecasting Suite
统一评估多领域、多频率和多预测跨度下的基础数值预测与概率预测能力, 为深度模型和时间序列基础模型提供可比底座。
不只比较一个误差数字。CastBench 在统一协议下评估数值预测、概率校准、 趋势与转折、情境证据利用、跨域鲁棒性和推理效率,让每个模型的优势与边界都可见。
默认按六维加权综合分排序。你也可以切换领域、模型类型和单项能力, 点击模型查看领域剖面,或选择最多 3 个模型并排比较。
| 排名 | 模型 / 类型 | 状态 / 操作 |
|---|
CastBench 首期规划把通用数值预测、FutureCast 情境任务和压力测试组织成互补数据轨道, 让模型既要“预测得准”,也要“理解为什么变化、遇到新情境能否修正”。
统一评估多领域、多频率和多预测跨度下的基础数值预测与概率预测能力, 为深度模型和时间序列基础模型提供可比底座。
把历史序列、天气、日历、事件、政策、文本和领域规则组织为联合实例, 检验情境选择、证据对齐、趋势推理与预测修正。
面向分布漂移、极端事件、缺失情境、跨域迁移和受限推理预算, 检验平均成绩之外的最差场景表现与系统稳定性。
本页展示的是首期规划与评测结构,不虚构尚未冻结的数据规模、样本数量或完成状态。 具体数据清单、许可、版本与下载入口将在数据审计完成后独立发布。
负荷、发电与价格序列,强调峰谷转换、需求响应和新能源出力不确定性。
道路流量、速度、客流和共享出行序列,覆盖明显周期与突发扰动。
天气、空气质量、水文与环境监测序列,强调多变量耦合和极端事件。
价格、销量、库存和客流序列,考察事件、促销与制度变化下的需求漂移。
生理监护、就诊需求、服务流量和资源负载,强调不规则观测与高风险误差。
把未见领域、未见实体、未见事件与缺失情境组合起来,单独衡量性能下界。
原始指标先按数据域、尺度和方向标准化,再汇总为越高越好的能力分。 这样既保留 MAE、CRPS 等原始结果,也能形成清晰、可解释的统一能力剖面。
衡量单一预测轨迹与真实未来之间的偏差,并对不同量纲和预测跨度进行归一化。
联合评估预测分布、分位数和预测区间的准确性、校准性与锐度。
衡量模型是否抓住未来方向、斜率变化和关键转折,而不是只优化平均数值误差。
检验模型能否选择相关情境、对齐事件与序列变化,并利用新增证据修正预测。
报告未见实体、事件和领域下的性能退化、最差数据域结果与有效任务覆盖率。
在统一硬件和调用预算下比较延迟、峰值显存、参数规模与外部工具成本。
Overall = 30% Accuracy + 15% Probabilistic + 15% Trend + 20% Context + 15% Robustness + 5% Efficiency
MAE、RMSE、CRPS 等原始误差指标越低越好;经基线、尺度和方向校正后统一映射为 0–100 的“越高越好”能力分。缺失维度不静默填补,正式总榜至少覆盖五个维度和全部必选数据域。
CastBench 把数据隔离、预算一致、分组报告和产物留存写入协议。 每个正式成绩必须能回答:用什么数据、何种设置、付出多少成本、能否复现。
训练、验证与测试严格遵循真实时间顺序;窗口只能在各自 split 内构造,禁止随机窗口泄漏。
跨域赛道隔离实体、区域、事件和情境组合,检验真正的未见场景泛化,而非近邻记忆。
固定上下文、预测跨度、采样次数、工具调用次数和时间上限,使模型与智能体成本可比。
同时报告微平均、宏平均、最差数据域、有效任务覆盖率和跨域退化,避免平均分掩盖短板。
训练型方法报告三个随机种子;确定性与 API 模型记录版本、时间戳、参数和解码配置。
保存配置、模型卡、预测文件与运行日志、环境摘要和指标明细,支持独立重算与审计。
Demo → Submitted → Reproduced → Verified
仅用于界面、协议或方法演示;当前页面中的全部分数均处于此状态。
提交方上传了完整结果包,等待自动校验和复现排期。
独立环境复跑成功,核心指标在允许误差范围内一致。
通过数据、配置、成本和结果审查,进入指定版本的正式榜单。
提交不只是上传一个分数。CastBench 要求结果包同时包含预测、指标明细、配置和成本, 让后续的复现、误差归因和版本比较都有据可查。
选择基础预测、FutureCast 情境任务或 Stress Test,并锁定数据与协议版本。
通过统一输入输出接口运行模型,自动记录硬件、时延、调用预算和异常。
导出配置、预测文件、运行日志、环境摘要、模型卡和逐数据集指标明细。
通过格式校验、独立复跑与人工审查后,成绩进入对应版本的 Verified 榜单。