NeoResearch(智多星)

NeoResearch 是一个面向数据科学研究的自主智能体,通过对研究任务、数据、模型、实验结果和历史经验进行持续认知,自主完成假设提出、数据分析、模型设计、实验执行、结果诊断和方案迭代,从而实现 AI 系统对 AI 模型的自主研究与能力增强。

中国科学技术大学 · 认知智能全国重点实验室

TL;DR: NeoResearch 不是为了让 AI 直接发现自然科学规律,而是让 AI 像数据科学家一样自主理解数据、设计模型、开展实验并改进 AI,从而在时序预测中验证 AI for AI 的可行性。

项目简介

NeoResearch 的研究认知同时来自三类可追溯证据:已有文献提供方法与先验,当前数据揭示任务结构,受控实验检验假设并产生新的经验。 系统不是只根据单次指标自动搜索配置,而是围绕证据形成可验证的研究问题与模型设计。

研究过程采用双层闭环:外循环从人机意图对齐开始,依次完成问题理解、文献研究、数据认知、假设生成、自主实验与诊断演化; 内循环则围绕模型设计、代码实现、训练执行、评估和修正快速迭代。 时间序列预测具有清晰指标、丰富数据和高度碎片化的模型生态,因此被选为首个验证场景,而不是 NeoResearch 的能力边界。

3
认知证据源
Literature / Data / Experiment
7
外循环阶段
Intent Alignment 到 Evolution
5
内循环环节
Design / Code / Train / Eval / Revise
TSF
首个验证场景
从时序预测验证 AI for AI

News / Updates

核心思想

NeoResearch 的自主研究必须同时回答三个问题:已有研究告诉了我们什么,当前数据呈现了什么,以及实验结果真正证明了什么。 只有把三类证据放入同一认知上下文,Agent 才能提出有依据、可证伪、可迭代的研究假设。

Literature Evidence + Data Evidence + Experimental Evidence
📚

Literature Evidence · 文献证据

从论文、技术报告和已有方法中提取问题定义、机制假设、有效模块与失败边界,为新研究建立可追溯先验。

🔎

Data Evidence · 数据证据

分析分布、趋势、周期、变量关系、缺失与异常,形成 TaskFingerprint,让模型设计回应当前数据而不是套用固定模板。

🧪

Experimental Evidence · 实验证据

通过受控实验、消融、复现和多层评估检验假设,区分可靠改进、偶然波动与失败模式,并写回研究记忆。

证据如何进入双层闭环

三类证据共同进入同一 Research Context:外循环负责决定“研究什么、为什么研究、结论如何推动模型演化”,内循环负责把当前假设快速转化为可运行、可比较、可修正的实验。

外循环 · 自主研究闭环

覆盖意图对齐、问题理解、文献态势、数据画像、假设生成、实验评估和诊断演化,保证研究方向与证据链持续更新。

内循环 · 快速实验闭环

围绕模型设计、代码实现、训练执行、评估与修正进行紧凑迭代,为外循环提供新的实验证据。

为什么不能只靠自动搜索

在时序预测验证场景中,模型结构、预处理、变量交互、预测头、训练目标和数据属性存在强耦合。 AutoML 可以高效比较配置,但 NeoResearch 还需要理解证据、解释实验并把结论转化为下一轮模型演化依据。

🔗

知识、数据与实验相互割裂

如果文献先验、数据特征和实验结论不能共同推理,Agent 只能重复已有配方或盲目试错。

🧩

模型设计高度耦合

不同论文模型往往绑定整套设计,需要拆解成可组合、可审计且能映射研究假设的模块级 action。

📏

实验结论容易失真

如果 Agent 能频繁读取 test、修改数据切分或忽略消融与复现,研究系统就会退化为隐性调参器。

🧠

经验难以形成认知

单次 keep / discard 不能解释“何时、为何有效”,成功与失败都需要沉淀为可复用、可迁移的研究记忆。

系统边界

系统架构

NeoResearch 的完整形态由七层组成:Human Control 定义边界与审批;Evidence & Cognition 汇聚文献、数据和实验认知; Agent Orchestration 分解研究任务;Research Design 把假设转化为模型方案;Protocol & Governance 固定规则; Execution & Evaluation 运行并检验实验;Memory & Evolution 反思结果、沉淀经验并驱动下一轮演化。

NeoResearch evidence-grounded autonomous research architecture
七层工程视图承载证据组织、研究编排、协议治理、实验执行与记忆演化;下方双层闭环进一步展开完整研究生命周期和快速实验过程。

核心服务模块

Literature / Dataset / Experiment Cognition

从 curated literature、TaskFingerprint 与实验谱系中抽取可追溯证据,形成统一 Research Context,而不是把检索、数据分析和实验日志彼此隔离。

Hypothesis / Model Design / Validator

基于 Research Context 提出可证伪假设并生成 CandidateRecipe,把证据映射到网络结构、模块组合、loss 与 training strategy,同时检查预算和接口兼容性。

Runner / Preset Evaluation / Analyst

在隔离环境中运行训练、消融与复现,按预设 Evaluation 收集指标和 artifact,再由 Analyst 判断结果是否真正支持原始假设。

Reflection / Memory / Model Evolution

保存证据链、实验谱系和失败模式,将“何时、为何有效”压缩成可迁移研究记忆,并生成下一轮假设与模型演化方向。

双层自主研究闭环

NeoResearch 通过外循环管理完整研究生命周期,通过内循环加速单个假设的工程验证。 外循环保证研究目标、文献态势、数据认知、假设与结论彼此一致;内循环在固定协议与预算内完成模型设计、实现、训练、评估和修正。

NeoResearch 面向 AI for AI 的双层自主数据科学研究闭环
NeoResearch 总体研究流程:外循环覆盖完整自主研究生命周期,内循环负责快速实验;点击图片可查看原始尺寸。

外循环:自主研究闭环(7 个阶段)

外循环从用户目标出发,并在诊断、反思和模型演化后回到目标与意图对齐,使每一轮研究都能重新校准问题、证据和方向。 为与总览图保持一致,编号沿用 0、1/A、2/B、3/C、4/D、6/F、7/G;其中 5/E 被展开为下方快速实验内循环,而不是重复列作外循环阶段。

  1. 0. 人机交互与意图对齐 通过交互式需求澄清明确目标、偏好、约束和反馈机制,避免系统在错误问题上自主优化。
  2. 1/A. 研究问题理解 把用户目标转化为可执行的研究任务,定义任务边界、约束条件、预算、评估指标与终止准则。
  3. 2/B. 文献调研与研究态势建模 检索、阅读、比较和综合已有研究,识别已验证机制、失败边界、争议与值得检验的研究空白。
  4. 3/C. 数据认知与任务画像 分析模式、漂移、质量、可预测性与未来情境,形成可被模型设计直接使用的 TaskFingerprint。
  5. 4/D. 假设生成 联合文献证据、数据证据和实验记忆提出可证伪假设,并明确预期机制、适用条件与反例。
  6. 6/F. 自主实验与评估 启动快速实验内循环,在冻结协议、沙箱和预算边界内完成候选设计、实现、训练、评估与修正。
  7. 7/G. 诊断、反思与模型演化 结合误差分析、消融、复现和文献对照判断假设是否成立,沉淀研究记忆并生成下一轮方向。

内循环(5/E):快速实验闭环

每个候选假设进入紧凑的工程循环;评估结果既可以触发局部修正,也可以返回外循环重新审视假设和研究问题。

  1. 模型设计把假设映射为结构、模块、损失与训练策略
  2. 代码实现生成受限 patch,并完成接口和静态检查
  3. 训练执行按预算运行 smoke、低保真与正式训练
  4. 评估收集指标、误差切片、消融和复现证据
  5. 修正修复实现或调整设计,并决定是否进入下一轮

研究基础设施

双层闭环依赖统一、可审计的研究底座:

  • 科学文献语料库
  • 数据集与特征工具
  • 模型与代码库
  • 训练与评测环境
  • 研究记忆
  • 计算资源

AI for AI 的研究输出

系统不只交付一次指标,而是持续形成:

  • 更优模型
  • 新算法
  • 可靠发现
  • 可复用研究经验

时序预测 MVP 映射

为让上述方法先在可度量环境中落地,MVP 采用与 autoresearch 同构的最小文件结构:冻结的 prepare_tsf.py 负责预设 Dataset Loader、数据切分与 Evaluation; train.py 是 Agent 可编辑的模型实验层;program.md 承载人类制定的研究策略、证据使用规则与行为协议。

autoresearch NeoResearch MVP 角色
prepare.py prepare_tsf.py 冻结数据加载、切分、标准化和评估协议
train.py train.py 模型结构、loss、训练循环的受控实验层
program.md program.md 人类定义研究策略、预算、keep / discard 规则
val_bpb val_avg_mse Agent 可见主指标,越低越好

时序预测验证:CandidateRecipe 配方搜索

在首个时序预测验证场景中,Model Design 被实现为 TimeRecipe 风格的模块级 CandidateRecipe。 关键升级不是从更多配置中选出最优项,而是让 Agent 结合文献先验、数据特征和历史实验,解释为什么选择某种 preprocessing、embedding、backbone、fusion、head、loss function 与 training strategy。

Input固定数据协议与上下文窗口
Preprocessinstance norm / decomposition
Embeddingnone / token / patch / invert
Backbonelinear / mlp / tcn / transformer
Fusiontemporal / feature / hybrid
Headlinear / multi-horizon / quantile
Trainingloss / optimizer / schedule
Forecast受控评估与晋级

首批 Action Space

模块 候选 action 研究偏置
Preprocessing none, instance_norm, series_decomposition, seasonal_differencing 处理尺度漂移、趋势、季节性和缺失提示
Embedding none, token, patch, invert, frequency 控制序列进入主干网络的表示粒度
Backbone linear, mlp, rnn, tcn, transformer, ssm, mixer 探索轻量、低延迟与长依赖建模之间的权衡
Fusion / Head temporal, feature, gated_hybrid, linear, quantile 决定优先建模时间依赖、变量依赖或不确定性输出
Loss / Training mse, mae, huber, pinball_loss, trend_loss, frequency_loss 把损失函数纳入搜索空间,决定优化目标、异常鲁棒性、趋势约束与概率预测偏好

Recipe Prior

Literature Evidence 提供可追溯的设计先验,Dataset profiler 只在 train split 上计算任务指纹,Experimental Evidence 则记录相似方案的成功条件和失败模式;三者共同通过 rule-based prior 或 rank predictor 给候选排序。 例如,长 horizon 且 trend 强时优先尝试 series_decomposition + patch + temporal fusion + linear/mlp; 变量相关性高时优先尝试 invert embedding + feature fusion

评估协议与治理

NeoResearch 的第一原则是“先协议,后智能”。在时序预测验证中,所有归一化、缺失填补和统计特征拟合只允许在 train fold 上完成; val_avg_mse 是 Agent 日常 keep / discard 的唯一决策信号,reference test 和 blind test 则由 Runner / Human Gate 保护。

TaskSpec

统一声明 task_id、forecast mode、context length、prediction lengths、dataset loader、split、metric、seed 与预算。

Time-Series Safety

禁止读取未来特征、修改 split、把 test 写入 Agent 可读日志,reference test 只在晋级节点查询。

三层评估协议

层次 名称 用途 查询频率
L1 Dev Validation 日常 keep / discard 决策 每次实验
L2 Reference Test / Shadow Holdout 晋级筛选与对外参考对齐 每 N 次 keep 后由 Runner 查询
L3 Blind Test 最终 champion 确认 仅晋级节点,后期独立服务暴露

人机分工

人类负责定义研究问题、证据范围、预算与评估协议,批准设计空间扩展并审核最终 champion; Agent 负责检索并组织文献证据、理解数据、提出假设、生成候选、执行受限 patch 与实验、反思归因并更新研究记忆。 这种分工让系统既能持续探索,又保留科研级审计、回滚与权限边界。

研发路线图

NeoResearch 从一个证据可追溯、结果可度量的最小研究闭环开始,而不是一开始就构建全功能平台。 时序预测用于验证 Agent 能否联合文献、数据和实验形成有效假设,并在固定协议下完成模型设计、实验、反思与演化;随后再扩展研究任务与领域。

成功指标

证据与假设质量

证据来源可追溯率、假设可证伪率、实验与假设对齐率,以及反思结论的人工审核一致性。

模型演化效果(时序验证)

在首个时序预测验证场景中,相对 baseline 的 val_avg_mse 与 Pareto 改进、覆盖数据集数,以及有效机制能否在复现中保持。

研究效率

每次有效结论所需实验轮数、GPU 小时、候选到晋级的转化率,以及无效搜索的减少比例。

可靠性与迁移

实验复现通过率、数据泄漏事件数、失败模式覆盖率,以及研究记忆在相似任务上的迁移成功率。

规划来源

本页面根据 NeoResearch(智多星)规划文档与核心思想说明整理而成,聚焦介绍三类认知证据、双层自主研究闭环、七层工程架构,以及在时序预测中的首个验证实现。 当前内容作为项目介绍页使用,后续可在代码仓库、论文、benchmark 结果明确后补充 GitHub、技术报告和 citation。

NeoResearch / 智多星 Autonomous Data Science Research Agent for AI-for-AI Evidence: literature + data + experiment Outer loop: intent alignment -> question -> literature -> data -> hypothesis -> experiment -> reflection & evolution Inner loop: model design -> code -> train -> evaluate -> revise First validation: time-series forecasting