NeoResearch 是一个面向数据科学研究的自主智能体,通过对研究任务、数据、模型、实验结果和历史经验进行持续认知,自主完成假设提出、数据分析、模型设计、实验执行、结果诊断和方案迭代,从而实现 AI 系统对 AI 模型的自主研究与能力增强。
中国科学技术大学 · 认知智能全国重点实验室
NeoResearch 的研究认知同时来自三类可追溯证据:已有文献提供方法与先验,当前数据揭示任务结构,受控实验检验假设并产生新的经验。 系统不是只根据单次指标自动搜索配置,而是围绕证据形成可验证的研究问题与模型设计。
研究过程采用双层闭环:外循环从人机意图对齐开始,依次完成问题理解、文献研究、数据认知、假设生成、自主实验与诊断演化; 内循环则围绕模型设计、代码实现、训练执行、评估和修正快速迭代。 时间序列预测具有清晰指标、丰富数据和高度碎片化的模型生态,因此被选为首个验证场景,而不是 NeoResearch 的能力边界。
[Jul. 2026] NeoResearch project page released with the first public overview of an evidence-grounded autonomous data-science research agent, initially validated in time-series forecasting.
NeoResearch 的自主研究必须同时回答三个问题:已有研究告诉了我们什么,当前数据呈现了什么,以及实验结果真正证明了什么。 只有把三类证据放入同一认知上下文,Agent 才能提出有依据、可证伪、可迭代的研究假设。
从论文、技术报告和已有方法中提取问题定义、机制假设、有效模块与失败边界,为新研究建立可追溯先验。
分析分布、趋势、周期、变量关系、缺失与异常,形成 TaskFingerprint,让模型设计回应当前数据而不是套用固定模板。
通过受控实验、消融、复现和多层评估检验假设,区分可靠改进、偶然波动与失败模式,并写回研究记忆。
三类证据共同进入同一 Research Context:外循环负责决定“研究什么、为什么研究、结论如何推动模型演化”,内循环负责把当前假设快速转化为可运行、可比较、可修正的实验。
覆盖意图对齐、问题理解、文献态势、数据画像、假设生成、实验评估和诊断演化,保证研究方向与证据链持续更新。
围绕模型设计、代码实现、训练执行、评估与修正进行紧凑迭代,为外循环提供新的实验证据。
在时序预测验证场景中,模型结构、预处理、变量交互、预测头、训练目标和数据属性存在强耦合。 AutoML 可以高效比较配置,但 NeoResearch 还需要理解证据、解释实验并把结论转化为下一轮模型演化依据。
如果文献先验、数据特征和实验结论不能共同推理,Agent 只能重复已有配方或盲目试错。
不同论文模型往往绑定整套设计,需要拆解成可组合、可审计且能映射研究假设的模块级 action。
如果 Agent 能频繁读取 test、修改数据切分或忽略消融与复现,研究系统就会退化为隐性调参器。
单次 keep / discard 不能解释“何时、为何有效”,成功与失败都需要沉淀为可复用、可迁移的研究记忆。
NeoResearch 的完整形态由七层组成:Human Control 定义边界与审批;Evidence & Cognition 汇聚文献、数据和实验认知; Agent Orchestration 分解研究任务;Research Design 把假设转化为模型方案;Protocol & Governance 固定规则; Execution & Evaluation 运行并检验实验;Memory & Evolution 反思结果、沉淀经验并驱动下一轮演化。
从 curated literature、TaskFingerprint 与实验谱系中抽取可追溯证据,形成统一 Research Context,而不是把检索、数据分析和实验日志彼此隔离。
基于 Research Context 提出可证伪假设并生成 CandidateRecipe,把证据映射到网络结构、模块组合、loss 与 training strategy,同时检查预算和接口兼容性。
在隔离环境中运行训练、消融与复现,按预设 Evaluation 收集指标和 artifact,再由 Analyst 判断结果是否真正支持原始假设。
保存证据链、实验谱系和失败模式,将“何时、为何有效”压缩成可迁移研究记忆,并生成下一轮假设与模型演化方向。
NeoResearch 通过外循环管理完整研究生命周期,通过内循环加速单个假设的工程验证。 外循环保证研究目标、文献态势、数据认知、假设与结论彼此一致;内循环在固定协议与预算内完成模型设计、实现、训练、评估和修正。
外循环从用户目标出发,并在诊断、反思和模型演化后回到目标与意图对齐,使每一轮研究都能重新校准问题、证据和方向。 为与总览图保持一致,编号沿用 0、1/A、2/B、3/C、4/D、6/F、7/G;其中 5/E 被展开为下方快速实验内循环,而不是重复列作外循环阶段。
每个候选假设进入紧凑的工程循环;评估结果既可以触发局部修正,也可以返回外循环重新审视假设和研究问题。
双层闭环依赖统一、可审计的研究底座:
系统不只交付一次指标,而是持续形成:
为让上述方法先在可度量环境中落地,MVP 采用与 autoresearch 同构的最小文件结构:冻结的 prepare_tsf.py 负责预设 Dataset Loader、数据切分与 Evaluation;
train.py 是 Agent 可编辑的模型实验层;program.md 承载人类制定的研究策略、证据使用规则与行为协议。
| autoresearch | NeoResearch MVP | 角色 |
|---|---|---|
prepare.py |
prepare_tsf.py |
冻结数据加载、切分、标准化和评估协议 |
train.py |
train.py |
模型结构、loss、训练循环的受控实验层 |
program.md |
program.md |
人类定义研究策略、预算、keep / discard 规则 |
val_bpb |
val_avg_mse |
Agent 可见主指标,越低越好 |
在首个时序预测验证场景中,Model Design 被实现为 TimeRecipe 风格的模块级 CandidateRecipe。 关键升级不是从更多配置中选出最优项,而是让 Agent 结合文献先验、数据特征和历史实验,解释为什么选择某种 preprocessing、embedding、backbone、fusion、head、loss function 与 training strategy。
| 模块 | 候选 action | 研究偏置 |
|---|---|---|
| Preprocessing | none, instance_norm, series_decomposition, seasonal_differencing |
处理尺度漂移、趋势、季节性和缺失提示 |
| Embedding | none, token, patch, invert, frequency |
控制序列进入主干网络的表示粒度 |
| Backbone | linear, mlp, rnn, tcn, transformer, ssm, mixer |
探索轻量、低延迟与长依赖建模之间的权衡 |
| Fusion / Head | temporal, feature, gated_hybrid, linear, quantile |
决定优先建模时间依赖、变量依赖或不确定性输出 |
| Loss / Training | mse, mae, huber, pinball_loss, trend_loss, frequency_loss |
把损失函数纳入搜索空间,决定优化目标、异常鲁棒性、趋势约束与概率预测偏好 |
Literature Evidence 提供可追溯的设计先验,Dataset profiler 只在 train split 上计算任务指纹,Experimental Evidence 则记录相似方案的成功条件和失败模式;三者共同通过 rule-based prior 或 rank predictor 给候选排序。
例如,长 horizon 且 trend 强时优先尝试 series_decomposition + patch + temporal fusion + linear/mlp;
变量相关性高时优先尝试 invert embedding + feature fusion。
NeoResearch 的第一原则是“先协议,后智能”。在时序预测验证中,所有归一化、缺失填补和统计特征拟合只允许在 train fold 上完成;
val_avg_mse 是 Agent 日常 keep / discard 的唯一决策信号,reference test 和 blind test 则由 Runner / Human Gate 保护。
统一声明 task_id、forecast mode、context length、prediction lengths、dataset loader、split、metric、seed 与预算。
禁止读取未来特征、修改 split、把 test 写入 Agent 可读日志,reference test 只在晋级节点查询。
| 层次 | 名称 | 用途 | 查询频率 |
|---|---|---|---|
| L1 | Dev Validation | 日常 keep / discard 决策 | 每次实验 |
| L2 | Reference Test / Shadow Holdout | 晋级筛选与对外参考对齐 | 每 N 次 keep 后由 Runner 查询 |
| L3 | Blind Test | 最终 champion 确认 | 仅晋级节点,后期独立服务暴露 |
人类负责定义研究问题、证据范围、预算与评估协议,批准设计空间扩展并审核最终 champion; Agent 负责检索并组织文献证据、理解数据、提出假设、生成候选、执行受限 patch 与实验、反思归因并更新研究记忆。 这种分工让系统既能持续探索,又保留科研级审计、回滚与权限边界。
NeoResearch 从一个证据可追溯、结果可度量的最小研究闭环开始,而不是一开始就构建全功能平台。 时序预测用于验证 Agent 能否联合文献、数据和实验形成有效假设,并在固定协议下完成模型设计、实验、反思与演化;随后再扩展研究任务与领域。
prepare_tsf.py、可复现 baseline 与证据谱系。
证据来源可追溯率、假设可证伪率、实验与假设对齐率,以及反思结论的人工审核一致性。
在首个时序预测验证场景中,相对 baseline 的 val_avg_mse 与 Pareto 改进、覆盖数据集数,以及有效机制能否在复现中保持。
每次有效结论所需实验轮数、GPU 小时、候选到晋级的转化率,以及无效搜索的减少比例。
实验复现通过率、数据泄漏事件数、失败模式覆盖率,以及研究记忆在相似任务上的迁移成功率。
本页面根据 NeoResearch(智多星)规划文档与核心思想说明整理而成,聚焦介绍三类认知证据、双层自主研究闭环、七层工程架构,以及在时序预测中的首个验证实现。 当前内容作为项目介绍页使用,后续可在代码仓库、论文、benchmark 结果明确后补充 GitHub、技术报告和 citation。