搜完论文还得手写代码跑实验?这个开源项目把“科研闭环”做成了自动化

25 阅读5分钟

从文献检索到实验验证,一条命令完成“分析→方案→训练→评估”全流程

前两篇我们分别介绍了 Paper_Rec 的智能检索和自研 Wiki 阅读系统。

但有一个更核心的问题始终没有解决:搜到论文、读完论文之后呢?

如果你也经历过“读完十篇论文,脑子里一堆想法,打开代码却不知从何下手”的困境,或者每次复现论文都要手动写训练脚本、画损失曲线、对比指标——那么今天的更新可能会让你彻底改变做实验的方式


01 | 从“读论文”到“做实验”,闭环的最后一块拼图

Paper_Rec 的最新定位已经远不止于文献检索工具:

从自然语言问题出发 → 多源文献检索 → Wiki 阅读沉淀 → 实验沙箱验证 → 指标曲线回写知识库

这是一条完整的 研究闭环(Research Loop)

而实现这个闭环的最后一块拼图,就是 Exp_Sandbox(实验沙箱)  ——一个自动化机器学习实验的 Agent Skill

你可以把它理解为一个“AI 实验助理”:  你告诉它你要优化什么指标,它帮你分析数据、生成方案、跑验证、做训练、输出评估,最后把结果和曲线自动写回 Wiki


02 | 四个命令,覆盖实验全流程

Exp_Sandbox 提供了四个核心命令,覆盖从分析到迭代的完整链路

命令作用
/exp_analysis训练集/测试集与 Badcase 分析
/exp_training启动训练并监控 Loss / 验证曲线
/exp_eval输出指标并对照 target_score
/exp_loop完整迭代循环:分析 → 方案 → 验证 → 训练 → 评估 → 迭代

最值得关注的是 /exp_loop——它把整个实验流程串成了一条自动化管线

分析数据 → 生成多个候选方案 → 小规模验证筛选 → 全量训练 → 评估指标 → 如果未达标则迭代下一轮

你只需要设定一个目标指标(比如 target_score: OCR F1 >= 0.92),剩下的交给 Agent 去跑


03 | 核心思想:先预测,再执行

Exp_Sandbox 的设计背后有一个重要的方法论借鉴:Predict-then-Verify(先预测,再验证)

这个思路来自浙江大学 NLP 实验室的开源项目。核心理念是:

在执行昂贵的全量训练之前,先用低成本的方式预测各个方案的优劣,只对最有希望的方案投入计算资源。

具体到 Exp_Sandbox 的实现

  • 多方案生成:一次性生成多个候选方案(默认 10 个)
  • 偏好排序:通过 Pairwise preference + confidence gate(默认 0.7)筛选方案
  • 小规模验证:只对 Top-1 方案进行验证性实验
  • 全量训练:验证通过后才投入全量训练

默认超参数:m_candidates=10confidence_gate=0.7top_k_verify=1

这套机制的核心价值在于 大幅压缩实验成本——你不需要每个想法都跑一遍完整训练,AI 会帮你先做一轮“纸上推演”。


04 | 实验结果自动回写 Wiki

实验做完不是终点,结果需要被记录和追溯

Exp_Sandbox 通过 sync-exp 命令,将实验结果同步回 Wiki

bash

python -m wiki_bridge.cli sync-exp \
  --wiki-root ../.. \
  --report ./examples/sample_exp_report.json

同步后,以下内容会自动写入知识库

  • 实验产物:方案、轮次、指标、最终报告 → content/exp/
  • 实验镜像:在 Wiki 的「实验」模块中呈现 → content/wiki/pages/_exp/
  • 曲线与指标:Loss 曲线、验证曲线与 paper_refs 关联

这意味着:你做的每一个实验,都有完整的可追溯记录——方案是什么、指标多少、曲线长什么样、参考了哪些论文——全部在一个地方。


05 | 安装与使用(超简单)

第一步:安装两个 Skill

bash

mkdir -p .agents/skills/paper-rec .agents/skills/exp-sandbox
cp -r skill/* .agents/skills/paper-rec/
cp -r skill-exp/* .agents/skills/exp-sandbox/

第二步:启动 Wiki

bash

powershell -ExecutionPolicy Bypass -File apps/start-wiki.ps1

第三步:开始实验

bash

# 分析阶段
/exp_analysis train

# 或直接跑完整循环
/exp_loop target_score: OCR F1 >= 0.92 on test_handwriting_v2

实验完成后,执行 sync-exp 将结果回写 Wiki,然后在 http://127.0.0.1:5173/experiments 查看


06 | 架构一览:四层各司其职

Exp_Sandbox 的加入让 Paper_Rec 的架构更加完整

层级路径职责
Skill 层skill/文献检索流水线
skill-exp/实验沙箱 + 参考伪代码
Bridge 层packages/wiki-bridge/sync-report(文献入库)+ sync-exp(实验回写)
API 层apps/wiki-api/FastAPI 后端,提供论文/实验/图谱/周刊接口
Web 层apps/wiki-web/Vue3 前端,阅读/编辑/图谱/实验浏览
数据层content/Git Markdown 存储,唯一内容真源

核心设计原则

  • Agent-native:以 Markdown Skill 驱动,不绑定任何 IDE
  • Git as database:笔记与实验记录即文件,可 diff、可备份
  • Predict before burn:先方案排序与小规模验证,再全量训练
  • Human in the loop:检索与沙箱自动化;阅读标记与目标定义留给研究者

07 | 谁适合用?

  • 🔬 AI 研究员/工程师:快速验证新想法,不需要每次都从头写训练脚本
  • 🎓 研究生/博士生:做实验时有清晰的分析→方案→验证→训练流程
  • 📊 需要追踪实验记录的任何人:所有指标、曲线、方案自动归档,不再丢失
  • 💻 跨平台用户:Claude Code、Codex、OpenClaw 等任何能加载 Markdown Skill 的 Agent 都能用

08 | 总结

从第一篇的智能检索,到第二篇的Wiki 阅读沉淀,再到今天的实验沙箱——

Paper_Rec 已经从一个单纯的文献检索工具,进化成了一个完整的科研操作系统

Discover(发现)· Annotate(标注)· Experiment(实验)· Remember(记忆)

「找论文 → 读论文 → 做实验 → 记结果」这条闭环,现在已经全部打通

项目完全开源,采用 MIT 许可证

如果觉得有用,不妨给项目点个 ⭐ Star 支持下作者~


本文由 AI 辅助整理,项目信息以 GitHub 仓库及 CHANGELOG 为准。