别再跑一遍就交付了!3个土办法让AI自己验自己,独立开发都能用

0 阅读7分钟

"

验证,而不是生成,才是真正的瓶颈。

上一篇《AI时代的技术资产审计》我们聊了哪些投入会被下一代模型作废,今天我们来看下,怎么把验证做成 AI 能自己跑的流程。

先问一个场景,AI 写完代码,跟你说一句:我做完了。你接下来干什么?

我猜大多数人的答案,和我以前一模一样:眼见为实,跑一遍看效果。打开页面,把主流程从头到尾点一遍,没问题,交付。

听起来很稳对吧?

我以前也这么觉得,直到翻车翻多了才看明白:跑一遍,恰恰是整个验证体系里最薄的一层。

这篇文章就干一件事:把跑一遍这个动作,从你手上挪到 AI 自己手上。3 个土办法,1 张清单,零基建门槛,看完今天就能用。

📌 本文看点

01 跑一遍漏掉的三类雷

02 为什么验证成了主战场

03 3 个土办法和 1 张清单

01 MINEFIELD

跑一遍,漏掉的是三类雷

先讲我印象最深的一次翻车。

去年初刚开始用AI做小程序,AI 把功能写完,我把主流程从头到尾点了一遍:建单、提交、查询,全都是好的,看着没问题就交付了。

结果几天后用户反馈来的时候我人是懵的:输入框里粘贴了一长串带表情的文本,页面直接白屏;另一个没数据的列表页,显示成一片空白。我回头排查,还发现一个更隐蔽的问题:AI 之前帮我修一个小 bug 时,顺手改了另一个模块的判断逻辑。

我验证的是新改的功能,它弄坏的是我根本没想到要看一眼的地方。

感觉就像你验收了一套精装修,水电全通、墙面锃亮,结果隔壁房间被施工队悄悄拆了堵承重墙。

眼见为实的盲区

- 图1|跑一遍漏掉的三类雷

那次之后我复盘,发现眼见为实有个天生的缺陷:**它只覆盖你想得到的路径。**具体说,漏三类雷:

边界输入

长文本、特殊字符、表情符号

异常状态

空列表、弱网、没权限

被顺手改坏的旧功能

AI 修 bug 时动了别处,而你根本没想到那里要看

02 THE SHIFT

为什么验证成了主战场

不是我一个人的执念,整个行业都在收敛到同一个判断。

淘天团队说得很直白:AI 的能力边界,是由可验证的反馈决定的。 coding 之所以最先被 AI 拿下,不是因为简单,而是因为编译过没过、测试绿没绿,机器自己就能判。

他们给企业画的分层验证体系是:编译、单测这类秒级反馈给 AI 高频自主迭代用;集成测试、浏览器自动化这类分钟级反馈覆盖更真实的行为;人工判断只留给机器裁决不了的部分,业务价值、用户体验、伦理边界。

更有说服力的是 Anthropic 的内部数据:**验证类 skill,是他们对 Claude 产出质量影响最可测量的一类。**说白了,连造模型的公司,都在把验证做成 AI 自己跑的流程。

道理其实不复杂。启动一个 agent 只要一句话,但收口一点都不便宜。当 AI 生成代码的速度远超你能验证的速度,你囤的不是效率,是认知债:代码看着干净、测试看着全绿,但没有人真正理解它。

最麻烦的是,这种债不疼不痒,出事之前你根本感觉不到它的存在,它滋生的是虚假的信心。

「验证,而不是生成,才是真正的瓶颈。」

分层验证金字塔

- 图2|分层验证:越往下,AI 越自主

03 HOW-TO

3 个土办法,今天就能用

道理讲完,上土办法。都不成体系,但真管用,每一条都是一句话 prompt 级别的动作。

第一刀:跑的动作,外包给 AI。

现在 AI 写完代码,我不再自己先点,而是直接一句话:

写完先自己跑测试,全绿再给我看。

跑的动作外包回给了 AI,我只看它贴出来的测试结果。账很好算:它30 秒跑完 20 个用例,全程不喊累不嫌烦;我自己点主流程至少 10 分钟,还只覆盖 happy path。同样的时间,我可以让它再跑三轮边界用例。

第二刀:动手之前,先答影响面。

让 AI 改东西之前,必须先回答我一句:

这次改动涉及哪几个文件?会不会影响别的地方?

答不上来就不许动手。说来也怪,光是多这一句,它乱改的次数肉眼可见地少了。改动范围,变成了它的自我约束。

第三刀:边界清单,翻车变资产。

我把翻过车的边界输入,长文本、特殊字符、空列表、弱网,存成一张清单。新功能交付前,让 AI 按清单逐条自测一遍。

这张清单每翻一次车才长一条,但它本身就是资产:翻过的车,不再翻第二次。

三个土办法卡片

- 图3|3 个土办法,今天就能用

小技巧:清单不用一开始就建全,从空表开始,每翻一次车补一条。半年后回头看,你会发现自己攒下了一份比任何教程都贴合你项目的检查表。

04 AUTONOMY

你攒的不是测试,是自主权

聊到这,可以把上一篇的话接上了。

上一篇《AI时代的技术资产审计》说,人的主观认识是模型永远拿不到的信息:什么算做完了、什么算够好了,这些标准只在你脑子里。验证,就是把这些只在你脑子里的标准,一条一条翻译成机器能自己跑的信号。

我那张边界清单,每一条都是我用一次翻车换来的判断,现在它们变成了 AI 能自己执行的检查项。所以验证这件事,本质上是在攒增值区的资产,上一篇说贬值区和增值区,验证就是你最该建的那个增值区。

它直接决定一件事:你验证得越便宜、越可靠,就敢把越大的活交给 AI 自己跑。

反过来看也成立,说白了你只敢跑一遍就交付,不是因为你谨慎,是你的验证能力只支撑得起这么多自主权。敢不敢放手,从来不是性格问题,是验证能力问题。

自主权公式天平

- 图4|验证能力 = 你敢放手的自主权

∞ THE END

从下一次翻车开始

别再用我点了一遍安慰自己了。

「跑一遍是在检查这一次,攒一套验证是在保障每一次。」

下一次翻车,先别沮丧,把它变成一条清单、一个测试。那才是你从 AI 时代真正带走的东西。

也很想听听:你现在敢让 AI 自己跑多大的活?是一段函数、一个模块,还是一整个项目?评论区聊聊你的验证做法,让我们互相抄抄作业。

END

我是艾启蒙,用 AI 陪伴成长,用技术创造价值。

如果这篇帮你省下了下一次翻车的时间,欢迎点赞、在看、转发三连。

关注「AI启蒙学习」并星标,下一篇,聊聊验证做深之后,怎么让 AI 跑完整条交付链路,我们下篇见。