返回
Kevin Riedl

9 分钟 阅读 · 2026年8月11日
最近审核

下一篇
图片在你的设备上生成,不连接 Instagram。文章链接会复制到剪贴板,供链接贴纸使用。

智能体测试与测试自动化:2026 年实用试点指南

智能体测试让 AI 智能体自行决定如何完成测试目标,观察应用、调整动作并提出证据。传统测试自动化则执行人工预先定义的路径和断言。2026 年更可靠的做法是把两者结合起来:智能体负责发现和起草,确定性检查和承担责任的人决定软件是否通过。

本文面向正在评估 AI 测试智能体的产品负责人、CTO 和 QA 团队。它讨论的是“用智能体测试普通软件”,而不是“测试产品中的 AI”。后一个问题请参阅AI 生成代码的 QA。这里,智能体是测试者,被测对象可以是普通 Web、移动或 API 软件。

正在评估自主 QA?

 规划智能体测试试点

什么是智能体测试?

智能体测试是一种软件测试方法:AI 智能体围绕测试目标规划并执行动作,评估观察结果,再调整下一步。它可以探索界面、起草测试计划、生成可执行代码、运行测试、调查失败或提出修复。自主性是连续尺度,不是简单的开关。

方法谁决定下一步?最适合主要风险
人工探索测试测试人员未知风险、模糊行为和产品判断重复性和吞吐有限
传统测试自动化预定义脚本稳定回归测试和发布门禁界面变化后的维护
AI 辅助测试使用 AI 建议的人快速起草用例、数据和代码看似合理但薄弱的断言
智能体测试受目标和权限限制的智能体探索、生成、适配和分诊非确定性和虚假信心

关键区别是闭环。录制器记录人已经做过的动作,代码生成器一次性写出脚本;测试智能体会观察结果、推理并选择下一步。这个额外闭环既创造潜在价值,也带来新的保证难题。

2026 年发生了什么变化?

Playwright 已记录一套三智能体工作流:planner 探索应用并生成 Markdown 计划,generator 把计划转换为可执行测试,healer 运行并修复失败测试。文件仍保存在仓库内,团队可以审查,而不是只能相信平台摘要。参阅官方Playwright Test Agents 文档

在 Android 上,Firebase 预览版 App Testing agent 接受自然语言目标、步骤、提示和最终屏幕断言,再在指定设备上执行。Google 同时列出当前限制:相同指令可能产生不同动作,AI 引导测试有五分钟超时,复杂任务更适合拆成短步骤。参阅Firebase App Testing agent 预览文档

研究仍处在早期。一篇 2026 年 1 月论文提出由生成、执行、分析和审查组成的多智能体闭环。在其微服务实验中,相比单模型基线,论文报告无效测试最多减少 60%,覆盖率提高 30%。这些数字只属于该实验,不能直接套到你的 backlog。应把这篇智能体测试框架论文视为待验证机制。

智能体应该补充哪些脚本?

测试任务建议负责人原因
探索陌生流程智能体加测试人员智能体扩展路径,人提供风险和产品背景。
起草计划和可执行用例智能体生成,人工审查生成便宜,接受薄弱测试预言昂贵。
验证金额、权限和持久状态确定性断言资金、访问和数据完整性需要可重复证据。
修复变化的选择器智能体提议,加代码审查定位器可以变,业务意图不能变。
改变期望值或跳过测试人工审批改写预言可能把真实回归变成绿灯。
发布或回滚生产策略门禁和责任人后果超出智能体的证据边界。

一项 2026 年研究发现,自主编码智能体提交的 PR 越来越常包含测试,但含测试和不含测试的 PR 合并率大体相近,而且不同智能体差异明显。这是描述性证据,不是安全证明。该智能体 PR 测试研究支持一个原则:统计被团队接受的证据和发现的缺陷,不要统计生成了多少文件。

安全试点需要什么架构?

可信试点至少需要七道边界。“把智能体接到 staging 让它自己测”不算完整方案。

  1. 一条有边界的关键路径。选择注册、询价或结账等商业重要流程,并定义起始和完成状态。
  2. 可丢弃测试数据。使用可重置的种子账号和记录,不让智能体接触客户数据。
  3. 最小权限工具。浏览器动作、只读日志和窄范围测试数据 API 比开放 shell 或生产权限更安全。
  4. 版本化意图规范。把目标、前置条件、允许动作和业务期望结果与代码一同保存。
  5. 独立测试预言。导航可交给智能体,关键结果必须通过 API、数据库状态、事件或固定断言验证。
  6. 完整审计轨迹。保存计划、动作、截图、trace、diff、版本、成本和审查结论。
  7. 人工控制变更。断言修改、跳过测试、写权限和发布后果必须由人批准。

独立预言是架构核心。如果同一个模型选择路径、解释屏幕又宣布成功,你只是把同一个意见重复了三次。支付测试应通过确定性系统边界核对金额和状态。授权测试要证明服务器拒绝了请求,而不仅是按钮被隐藏。

为什么自愈测试会制造虚假信心?

自愈只有在修复实现细节、不改变测试意图时才有价值。把过时选择器换成正确的无障碍角色可以减少维护;把“订单总额等于 €120”改成“页面显示某个总额”,则是在破坏测试的同时让它通过。

一篇近期立场论文指出,当智能体解释听起来很可信时,团队可能未经足够审查就把输出当作保证。该测试智能体过度依赖论文不是效果基准,但提出了正确问题:审查者能否重建为什么这条测试足以成为证据?

  • 可自动接受:格式、import 或等价定位器,前提是断言和目标行为不变。
  • 必须审查:等待、导航步骤、fixture 或数据准备。
  • 禁止自动修复:期望值、权限结果、财务计算、跳过测试和发布阈值。

智能体测试成本是多少?

不存在可信的统一价格。应比较月度总成本,而不是只看模型账单:

成本 = 初始搭建 + 平台或模型用量 + 测试基础设施 + 人工审查 + 误报分诊 + 维护 + 治理

每个有效发现的成本 = 试点总成本 / 团队确认的缺陷或重要覆盖缺口

同时记录每条接受测试的维护分钟数和每次运行的审查分钟数。生成 500 个用例却需要 40 小时审查,并不等于创造了 500 份价值。

30 天试点计划

工作退出证据
第 1 周:基线选择流程,记录当前缺陷、覆盖、耗时、不稳定率和维护成本。定义禁止动作和停止条件。已批准意图、基线表、种子环境和权限图。
第 2 周:影子运行让智能体规划和执行,但不改套件、不阻断发布。审查全部结果。确认发现、误报、漏掉的已知缺陷和审查时间。
第 3 周:受控贡献允许新测试和低风险定位器修复 PR,断言仍强制审查。接受率、种子缺陷检出率、维护时间和重复运行稳定性。
第 4 周:决策与现有流程并行运行,计算总成本。扩展、修改或停止的决策,包含责任人和回滚。

植入团队理解的已知缺陷或 mutation,并保留未出现在 prompt 中的 holdout 集。这样测到的是相关缺陷检出能力,而不是活动量或对示例的记忆。

哪些 KPI 决定是否扩大?

  • 确认发现精度:确认发现数除以全部报告数。
  • 种子缺陷检出:未告知智能体时发现的已知相关缺陷。
  • 测试接受率:审查后合并的生成测试除以提交的生成测试。
  • 审查和维护时间:每次运行、每条接受测试及产品变化所需人工分钟。
  • 重复性:相同起始状态下结果是否一致。
  • 每个有效发现的成本:使用完整成本,而不是只看 token。
  • 漏测变化:同类缺陷是否仍进入生产。

试点准备度评分表

问题良好信号应先准备
流程是否具有商业重要性?失败会影响收入、风险或发布信心。只因容易而选择演示流程。
环境能否重置?账号和数据均为种子且可丢弃。依赖共享可变数据或生产数据。
成功能否独立验证?API、事件或数据库状态提供预言。只依赖智能体视觉判断。
是否有基线?已有缺陷、不稳定、成本和漏测指标。没有可信比较对象。
权限能否收窄?只提供测试身份和有限工具。需要管理员、生产或开放 shell。
是否有人审查?QA 或工程负责人有明确容量。采购自主性是为了取消全部监督。

如果四项以上落在右栏,应先修复测试系统。相同准备也会改善传统自动化。

供应商或交付伙伴应提供什么?

  • 明确说明智能体能观察、修改和批准什么。
  • 可导出、版本化的测试和意图规范。
  • 每次运行的模型、工具和 prompt 版本。
  • 来自确定性断言的证据,而不只是智能体摘要。
  • 拆分的平台、推理、设备、存储和人工审查成本。
  • 测试凭据、保留期、数据区域和删除控制。
  • 无锁定地回到普通可执行测试的路径。
  • 基于你的基线做决策,包括“不要推广”的诚实结果。

OWASP 建议把工具和权限缩到最小,并对高影响动作要求人工批准。即使智能体“只是在测试”,这些控制也适用,因为浏览器或 API 测试仍可能创建订单、发送消息或修改数据。可把OWASP 过度代理权控制用作采购清单。

智能体测试能取代 QA 工程师吗?

不能。它可以承担部分重复路径编写、执行和初步分诊。QA 工程师仍需定义风险、设计独立预言、调查歧义,并决定什么证据足以发布。岗位会转向设计和监督可信测试系统。

测试智能体能在生产运行吗?

只能采用独立且严格受限的设计。首先在可重置的非生产环境运行。生产检查需要合成身份、允许动作清单、硬性费用与速率限制、明确数据清理和即时终止控制。

Wavect 如何规划试点?

我们从现有交付系统开始,而不是从工具演示开始。我们的软件质量保证服务会界定关键路径、基线和证据边界。上线前软件 QA 清单提供确定性发布检查,IKB 基础设施案例展示跨越真实系统边界所需的集成纪律。

交付物是一条可运行的试点分支、证据报告以及扩大或停止的决策。如果智能体只增加噪音,停止也是成功结果。如果相关覆盖提升且每个有效发现的成本下降,下一步应是受控推广。预约 QA 试点规划沟通

来源与方法边界

Playwright 和 Firebase 文档说明了功能,但不能证明你的 ROI。引用研究只覆盖特定数据集或提出框架,没有给出通用检出率。成本公式和评分表是决策工具,不是行业基准。采购前应重新核对可用性、预览条款和数据处理规则。

最终思考

智能体测试不是确定性自动化的替代品,而是在探索、生成、修复和分诊外围增加的自适应层。可靠架构允许智能体搜索,同时把业务真相留在模型之外。

运行一个 30 天试点,统计被接受的证据,而不是生成的活动。只有在确认发现增加、审查成本可控,并且智能体无法悄悄改变通过标准时,才值得扩大。

构建产品,而不只是 backlog

如果这篇文章对应的是一个真实产品决策,Wavect 可以用高级创始人级判断帮你界定范围、构建、加固或领导软件工作。

可选服务路径:

只收重要内容

关注与你相关的内容

每当我们发布新文章,你会收到一封简短邮件。你可以关注整个博客,也可以只选感兴趣的主题。

你希望接收哪些内容?
选择主题

免费、双重确认、不使用跟踪像素。

返回
Kevin Riedl

9 分钟 阅读 · 2026年8月11日
最近审核

下一篇

通过邮件获取新文章

我们发布时给你一封简短邮件。免费,不做跟踪。

免费、双重确认、不使用跟踪像素。