应届生,最近开始接触一些真实业务场景下的 AI/Agent 项目。
最近在用 Claude Code / Codex,也研究了 Superpowers、Grill Me 和一些 Agent Skills。
但用下来感觉现在很多东西解决的是“某个开发环节”,比如 Planning、Debug、Code Review,却很少看到真正把整个生命周期串起来的方案。
我比较想要的是:
业务需求 → 可行性验证 → PoC → Eval → Spec → Plan → 小步开发 → Checkpoint → MVP → Production → Monitoring
尤其遇到一个比较明显的问题:Coding Agent 很擅长按照 Plan 连续执行,但 AI 项目本身存在大量不确定性。如果 Plan 方向错了,等几十个文件都改完才发现真实业务指标没有提升,其实 Token 和开发时间已经浪费很多。
所以我现在倾向于:
Plan → Small Experiment → Measure → Continue / Replan
而不是:
Plan → Execute Everything → Validate
目前自己在尝试用 Lifecycle Router + Superpowers / Grill Me / Eval / Observability 等 Skill 拼一套项目模板。
想请教有实际生产经验的前辈:
公司里有没有类似的 AI 项目生命周期模板?
Coding Agent 一般介入到什么程度?
AI 项目怎么做阶段 Checkpoint?
PRD / Spec / ADR / Eval / Plan 这些文档怎么管理?
有没有值得参考的开源 Workflow? #AI 编程#
#AI 编程# 离线评测涨了 5 个点,上线之后留存一点没动。翻数据发现离线评测集里 70% 是长文档,而线上用户 80% 问的是短问题,评测和真实分布对不上。后来按线上日志重采样了一版评测集,离线涨就真的带动了线上。评测集要跟着线上分布走。你们多久重采样一次?
评论
3