从文献检索到实验验证,一条命令完成“分析→方案→训练→评估”全流程
前两篇我们分别介绍了 Paper_Rec 的智能检索和自研 Wiki 阅读系统。
但有一个更核心的问题始终没有解决:搜到论文、读完论文之后呢?
如果你也经历过“读完十篇论文,脑子里一堆想法,打开代码却不知从何下手”的困境,或者每次复现论文都要手动写训练脚本、画损失曲线、对比指标——那么今天的更新可能会让你彻底改变做实验的方式。
01 | 从“读论文”到“做实验”,闭环的最后一块拼图
Paper_Rec 的最新定位已经远不止于文献检索工具:
从自然语言问题出发 → 多源文献检索 → Wiki 阅读沉淀 → 实验沙箱验证 → 指标曲线回写知识库
而实现这个闭环的最后一块拼图,就是 Exp_Sandbox(实验沙箱) ——一个自动化机器学习实验的 Agent Skill。
你可以把它理解为一个“AI 实验助理”: 你告诉它你要优化什么指标,它帮你分析数据、生成方案、跑验证、做训练、输出评估,最后把结果和曲线自动写回 Wiki。
02 | 四个命令,覆盖实验全流程
Exp_Sandbox 提供了四个核心命令,覆盖从分析到迭代的完整链路:
| 命令 | 作用 |
|---|---|
/exp_analysis | 训练集/测试集与 Badcase 分析 |
/exp_training | 启动训练并监控 Loss / 验证曲线 |
/exp_eval | 输出指标并对照 target_score |
/exp_loop | 完整迭代循环:分析 → 方案 → 验证 → 训练 → 评估 → 迭代 |
最值得关注的是 /exp_loop——它把整个实验流程串成了一条自动化管线:
分析数据 → 生成多个候选方案 → 小规模验证筛选 → 全量训练 → 评估指标 → 如果未达标则迭代下一轮
你只需要设定一个目标指标(比如 target_score: OCR F1 >= 0.92),剩下的交给 Agent 去跑。
03 | 核心思想:先预测,再执行
Exp_Sandbox 的设计背后有一个重要的方法论借鉴:Predict-then-Verify(先预测,再验证) 。
这个思路来自浙江大学 NLP 实验室的开源项目。核心理念是:
在执行昂贵的全量训练之前,先用低成本的方式预测各个方案的优劣,只对最有希望的方案投入计算资源。
- 多方案生成:一次性生成多个候选方案(默认 10 个)
- 偏好排序:通过 Pairwise preference + confidence gate(默认 0.7)筛选方案
- 小规模验证:只对 Top-1 方案进行验证性实验
- 全量训练:验证通过后才投入全量训练
默认超参数:m_candidates=10,confidence_gate=0.7,top_k_verify=1。
这套机制的核心价值在于 大幅压缩实验成本——你不需要每个想法都跑一遍完整训练,AI 会帮你先做一轮“纸上推演”。
04 | 实验结果自动回写 Wiki
实验做完不是终点,结果需要被记录和追溯。
Exp_Sandbox 通过 sync-exp 命令,将实验结果同步回 Wiki:
bash
python -m wiki_bridge.cli sync-exp \
--wiki-root ../.. \
--report ./examples/sample_exp_report.json
- 实验产物:方案、轮次、指标、最终报告 →
content/exp/ - 实验镜像:在 Wiki 的「实验」模块中呈现 →
content/wiki/pages/_exp/ - 曲线与指标:Loss 曲线、验证曲线与
paper_refs关联
这意味着:你做的每一个实验,都有完整的可追溯记录——方案是什么、指标多少、曲线长什么样、参考了哪些论文——全部在一个地方。
05 | 安装与使用(超简单)
第一步:安装两个 Skill
bash
mkdir -p .agents/skills/paper-rec .agents/skills/exp-sandbox
cp -r skill/* .agents/skills/paper-rec/
cp -r skill-exp/* .agents/skills/exp-sandbox/
第二步:启动 Wiki
bash
powershell -ExecutionPolicy Bypass -File apps/start-wiki.ps1
第三步:开始实验
bash
# 分析阶段
/exp_analysis train
# 或直接跑完整循环
/exp_loop target_score: OCR F1 >= 0.92 on test_handwriting_v2
实验完成后,执行 sync-exp 将结果回写 Wiki,然后在 http://127.0.0.1:5173/experiments 查看。
06 | 架构一览:四层各司其职
Exp_Sandbox 的加入让 Paper_Rec 的架构更加完整:
| 层级 | 路径 | 职责 |
|---|---|---|
| Skill 层 | skill/ | 文献检索流水线 |
skill-exp/ | 实验沙箱 + 参考伪代码 | |
| Bridge 层 | packages/wiki-bridge/ | sync-report(文献入库)+ sync-exp(实验回写) |
| API 层 | apps/wiki-api/ | FastAPI 后端,提供论文/实验/图谱/周刊接口 |
| Web 层 | apps/wiki-web/ | Vue3 前端,阅读/编辑/图谱/实验浏览 |
| 数据层 | content/ | Git Markdown 存储,唯一内容真源 |
- Agent-native:以 Markdown Skill 驱动,不绑定任何 IDE
- Git as database:笔记与实验记录即文件,可 diff、可备份
- Predict before burn:先方案排序与小规模验证,再全量训练
- Human in the loop:检索与沙箱自动化;阅读标记与目标定义留给研究者
07 | 谁适合用?
- 🔬 AI 研究员/工程师:快速验证新想法,不需要每次都从头写训练脚本
- 🎓 研究生/博士生:做实验时有清晰的分析→方案→验证→训练流程
- 📊 需要追踪实验记录的任何人:所有指标、曲线、方案自动归档,不再丢失
- 💻 跨平台用户:Claude Code、Codex、OpenClaw 等任何能加载 Markdown Skill 的 Agent 都能用
08 | 总结
从第一篇的智能检索,到第二篇的Wiki 阅读沉淀,再到今天的实验沙箱——
Paper_Rec 已经从一个单纯的文献检索工具,进化成了一个完整的科研操作系统:
Discover(发现)· Annotate(标注)· Experiment(实验)· Remember(记忆)
「找论文 → 读论文 → 做实验 → 记结果」这条闭环,现在已经全部打通。
项目完全开源,采用 MIT 许可证。
- 项目地址:github.com/QinHsiu/Pap…
- 最新版本:v2.5.0(2026年7月17日发布)
如果觉得有用,不妨给项目点个 ⭐ Star 支持下作者~
本文由 AI 辅助整理,项目信息以 GitHub 仓库及 CHANGELOG 为准。