关注 霍格沃兹软件测试开发 公众号,回复「资料」, 领取人工智能测试开发技术合集
从“写脚本”到“说人话”,测试自动化的范式转移已经完成
大家好,我是某互联网公司质量基础设施团队的负责人。
最近半年,我陆续收到了十几个测试同行的问题,问得最多的一句是:“现在AI测试工具这么多,到底怎么选?怎么搭? ”
以前我的回答总是绕不开“看你们团队的代码能力”“看你们现有的技术栈”。但最近三个月,我开始换了一种回答方式—— “你先告诉我你想测什么,剩下的交给AI。”
不是敷衍。2026年,不用写一行代码就能搭建AI测试智能体的时代真的来了。
一、先回答一个根本问题:什么是“AI测试智能体”?
在开始搭建之前,得先搞清楚我们在搭什么。
AI测试智能体(AI Testing Agent)不是传统的自动化测试工具。 传统工具——Selenium、Appium、JMeter——本质上是 “脚本执行器” :你告诉它每一步具体做什么,它照做。
AI测试智能体的本质是 “意图理解器” 。你告诉它“你想验证什么”,它自己决定“怎么验证”。
举个例子:
- 传统方式:写50行代码定位元素、处理等待、写断言
- AI智能体方式:输入“把最贵的商品加到购物车”
区别在于:前者需要你懂代码、懂XPath、懂框架API;后者只需要你会说人话。
2026年的AI测试智能体平台,普遍具备以下核心能力:
- 自然语言驱动:用日常英语写测试,AI自动理解意图并执行
- 自动定位与自愈:不依赖脆弱的XPath,AI基于视觉和语义理解页面,UI变了自动适配
- 智能断言:AI自己判断结果对不对,不需要手写断言代码
- 多智能体协同:导航、数据填充、断言校验由不同 specialist agents 分工完成
二、2026年主流方案速览:一张表看懂怎么选
先别急着动手。2026年的AI测试工具生态已经相当丰富,不同场景有不同选择。
我把主流方案分成四类,你可以对号入座:
| 类别 | 代表产品 | 适合谁 | 特点 |
|---|---|---|---|
| 企业级全托管平台 | Harness AI Test Automation、Mabl、TestRigor、Functionize | 中大型企业,追求开箱即用 | 零代码、自愈、CI/CD集成、企业级安全 |
| 开源/自部署方案 | Autonoma、PageEyes-Agent、qpilot | 有技术能力、需私有化部署的团队 | 开源免费、可自托管、灵活可控 |
| AI原生E2E测试 | QA Use、AgenTest | 快速验证、小团队 | 自然语言驱动、Docker一键部署 |
| 低代码/无代码工具 | Testsigma、Katalon Studio(AI增强) | 传统测试团队转型 | 介于传统脚本和AI之间,学习曲线平缓 |
下面我挑几个最有代表性的,展开说说。
企业级首选:Harness AI Test Automation
Harness在2026年7月发布了71项功能更新,其中最大的是Agent DLC(Agent开发生命周期) 。
它的核心逻辑很简单:用自然语言写测试,AI理解意图并自动执行。你输入“验证用户能否成功登录并查看订单历史”,AI自动完成页面导航、元素定位、操作执行和结果断言。
更关键的是——每次运行都会自愈。UI变了?AI动态调整定位器,不需要你手动修脚本。
开源方案:Autonoma
如果你们团队需要私有化部署、不想把代码和数据交给第三方,Autonoma是2026年最值得关注的开源方案。
它用AI Agent读取你的代码库,自动理解业务逻辑并生成端到端测试。不需要写测试文件、不需要录制点击,连接代码库后几天内就能达到80%以上的核心流程覆盖。
支持Web、iOS、Android,执行引擎基于Playwright和Appium。
轻量级方案:qpilot 和 PageEyes-Agent
如果你只是想快速验证“AI测试到底能不能用”,这两个开源项目最适合。
qpilot:你把手工测试用例用纯文本粘贴进去,AI Agent自动打开浏览器执行每一步,输出pass/fail/warn。不需要写任何配置文件和脚本,支持Anthropic Claude或任何OpenAI兼容的模型。
PageEyes-Agent:腾讯音乐开源的自然语言UI Agent。完全由自然语言指令驱动,支持Web、Android、HarmonyOS、iOS。默认使用deepseek-v4-flash模型,也支持千问、OpenAI等。
三、实操:三步搭建你的第一个AI测试智能体
下面我以Harness AI Test Automation为例,完整走一遍搭建流程。其他平台的逻辑大同小异。
第一步:用自然语言创建测试(5分钟)
不需要写代码。直接在平台上输入你想要的测试意图:
"Verify that a user can add an item to the cart and complete checkout successfully."
AI会自动:
- 分析你的意图,理解要测什么
- 从应用知识库中识别相关页面和流程
- 确定起始URL和导航路径
- 预测并执行每一步操作
整个过程零代码、零配置。
第二步:AI自动执行与智能验证(执行中)
测试执行时,Harness的AI架构会经历以下阶段:
- AI推理与探索:AI实时分析应用状态,决定下一步操作
- 多智能体协同:导航、数据填充、断言校验由不同智能体分工完成
- 视觉与DOM双重验证:不仅校验功能,还检测视觉回归
- 持续学习:每次执行丰富知识库,下次更精准
你只需要看着它跑,什么都不用做。
第三步:集成CI/CD并设置质量门禁(10分钟)
这是让AI测试真正发挥价值的关键一步。
- 把AI测试集成到你的CI/CD流水线中
- 每次代码提交自动触发测试执行
- 设置质量门禁:测试不通过就不让合入
Harness还支持并行执行最多100个测试,大幅缩短反馈周期。
四、如果不想用企业级平台:开源方案快速上手指南
预算有限或需要私有化部署?下面给两个开源方案的快速上手实操。
qpilot:5分钟跑通第一个测试
# 1. 安装(只需要Node.js 20.12+和Chrome)
npx qpilot
# 2. 首次运行会引导配置模型
# 选择Anthropic Claude或自定义OpenAI兼容端点
# 支持Qwen、vLLM、Ollama等
# 3. 在浏览器中打开 http://localhost:3847
# 粘贴你的手工测试用例,比如:
# "打开https://www.saucedemo.com/,用标准用户登录,把最贵的商品加到购物车"
# 4. 点击运行,AI自动执行
就这么简单。不需要写Selenium、不需要配驱动、不需要维护选择器。
PageEyes-Agent:自然语言驱动多端测试
# 1. 安装
pip install page-eyes
# 2. 配置环境变量(以千问VL为例)
OPENAI_BASE_URL=https://dashscope.aliyuncs.com/compatible-mode/v1
OPENAI_API_KEY=your-api-key
AGENT_MODEL_TYPE=vlm
AGENT_MODEL=openai:qwen3-vl-plus
# 3. 写一个测试脚本
import asyncio
from page_eyes.agent import AndroidAgent
async def main():
ui_agent = await AndroidAgent.create()
report = await ui_agent.run("打开QQ音乐,点击乐馆,点击排行,检测当前页面出现由你榜")
asyncio.run(main())
完全由自然语言驱动,支持Web、Android、HarmonyOS、iOS。不依赖视觉大模型,小参数的LLM也能胜任路径规划。
五、避坑指南:别踩我踩过的坑
过去半年我在多个项目中落地AI测试智能体,踩了不少坑。说三个最痛的:
坑一:以为“零代码”等于“零准备”
零代码 ≠ 零准备。 AI测试智能体再强,也需要你给它提供上下文——应用的知识库、关键业务流程、测试环境配置。
解法:花一周时间整理应用的核心流程和业务规则,这是AI能准确理解你“意图”的前提。
坑二:忽略了AI的“非确定性”
传统测试是确定性的——同样的输入永远产生同样的输出。但AI测试智能体是非确定性的——模型每次可能做出不同的决策。
这意味着:同样一条测试,跑10次可能有10种不同的执行路径。你需要测试你的测试工具——用AI Evals对智能体的输出进行正确性、性能、安全性的评分。
坑三:让AI自动提交Bug
我们试过。后果是开发同学在群里疯狂@我:“这什么鬼?这也算Bug?”
解法:AI的输出永远是 “疑似问题清单” ,不是“最终缺陷报告”。人工复核后再提交TAPD,这是底线。
六、2026年AI测试智能体的趋势
最后说几个我正在关注的方向:
趋势一:从“功能正确性”到“行为可信性”
测试的不再只是“功能对不对”,而是“AI的行为可不可信”——有没有幻觉、有没有偏见、有没有安全漏洞。
趋势二:人机协同成为核心能力
AI负责“广撒网”执行大量测试,人负责“精准打击”做深度分析和决策。AI不会取代测试工程师,但会用AI的测试工程师会取代不会用的。
趋势三:智能体开发生命周期(Agent DLC)
AI智能体本身也需要被构建、测试、部署、回滚、审计。Harness在2026年7月推出的Agent DLC就是在解决这个问题——用管理应用代码的流程来管理AI智能体。
最后
不用写一行代码的测试时代真的来了。
但别误会——这不意味着测试工程师要失业。恰恰相反,测试工程师的价值从“写脚本”升级到了“设计测试策略、训练和调优测试智能体、判断AI的输出是否可信” 。
技术门槛在降低,但认知门槛在升高。
如果你还没试过AI测试智能体,我建议你今天就开始。选一个最简单的工具——qpilot或者PageEyes-Agent——跑通第一个用例。半小时就能看到效果。
然后你会和我有同样的感受:
“以前我怎么没想到可以这样测?”
本文部分内容参考了霍格沃兹测试开发学社整理的相关技术资料,主要涉及软件测试、自动化测试、测试开发及 AI 测试等内容,侧重测试实践、工具应用与工程经验整理。
推荐阅读:[在 OpenCode 中接入本地模型:Ollama 部署与配置完全指南OpenCode 这玩意儿最近挺火。GitHub - 掘金] juejin.cn/post/767016…