过去两年,测试圈聊的东西变了。以前大家聚在一起,聊的是自动化框架选哪个、接口平台怎么搭、CI/CD 怎么接入、测试覆盖率怎么算。现在,这些话题依然重要,但越来越多的人开始讨论:AI 生成测试用例、Test Agent、RAG、MCP、自愈测试……
这些新词背后,是整个测试工作的重心正在发生真实迁移——从“人写脚本”到“AI 辅助设计”,从“执行自动化”到“流程智能化”。
今天,我们就拆解测试领域最值得关注的 12 个AI 热词。第一个你很可能天天在用,最后一个,90% 的人还不知道。
![]()
01、AI 生成测试用例
这是目前普及度最高的 AI 测试能力。把需求文档、接口说明、用户故事扔给大模型,它就能快速产出测试点、测试场景甚至脚本。
应用场景:一个登录功能,包含手机号登录、验证码校验、错误提示、账号锁定。AI 几秒钟就能给出正常登录、验证码错误、验证码过期、手机号为空、连续输错后锁定等场景。
但要注意:AI 会编造不存在的规则,比如需求只要求输错 5 次锁定,它可能按通用经验写成 3 次。AI 生成的是初稿,不是终稿,必须经过人工评审、补充和修正。
02、Test Agent
普通 AI 助手是你说一句,它回一句。Test Agent 不一样——你给它一个目标,它会自己拆解任务、调用工具、执行测试、分析结果。
应用场景:你说“请确认这个 PR 是否影响核心登录流程”。Agent 会读取代码变更 → 分析影响范围 → 检索历史用例 → 生成新测试 → 执行 → 输出报告。
这意味着测试人员不再需要手写每一个步骤,但要学会定义清晰的目标和验收标准。
03、Agentic Testing
这是 Test Agent 的升级版。AI 不仅执行任务,还能围绕一个测试目标自主规划、动态调整、持续反馈。传统自动化是人写死脚本,Agentic Testing 是 AI 根据当前状态实时生成测试。
关键不是 AI 能不能干活,而是你能不能给它画好边界:哪些测试失败可以自动重试?哪些必须人工确认?AI 能不能修改代码?这些问题需要测试团队提前设计好规则。
04、RAG(检索增强生成)
RAG 的做法是:AI 在生成内容之前,先去你们的知识库里查资料——PRD、接口文档、历史缺陷库、线上事故记录。基于真实资料再生成。
应用场景:你们的支付系统有特殊的风控规则(比如单笔超过 5000 元需要二次验证)。RAG 能让 AI 读到这条规则,生成对应的测试用例。这是 AI 测试从“能用”到“好用”的关键一步。
05、MCP(模型上下文协议)
AI 只生成文字是不够的。它需要能操作浏览器、查数据库、读 Git 代码、调用 CI/CD、同步测试管理工具。MCP 就是一套标准协议,让 AI 以统一的方式连接这些外部工具。
未来评估 AI 测试工具时,不能只看它能不能生成用例,更要看它能不能接入你现有的工程体系。
06、多模态测试
需求信息不全在文字里。原型图、流程图、UI 截图、设计稿里藏着大量细节。多模态测试让 AI 能直接理解这些图像信息。
应用场景:AI 分析 UI 截图,自动识别输入框、按钮、弹窗、状态变化,甚至发现可访问性问题。在需求评审阶段,AI 就能根据流程图找出遗漏的异常分支,真正做到测试左移。
![]()
07、自愈测试
UI 自动化的痛点:页面改个 class 名,脚本就挂了。自愈测试让 AI 在脚本失败时自动分析原因,尝试修复定位方式。
应用场景:按钮的 class 变了,AI 会结合按钮文本、页面位置、上下文语义,重新找到目标元素。
但风险也很大:AI 可能把“提交”按钮误识别成“取消”按钮,脚本虽然跑通了,但测错了。所以自愈不能只看“跑通率”,更要看业务意图是否保持一致。
08、LLM-as-Judge
当 AI 一次生成上百条用例,你一条条看不过来。这时可以用另一个 AI 来做初筛,评估用例质量。
它能检查:是否覆盖了主流程和异常流程?断言是否具体?有没有重复?有没有引用不存在的字段?
但最终裁判还得是人。理想模式是:AI 做规模化初筛,人做关键性判断。
09、Vibe Testing
Vibe Testing 借用了“Vibe Coding”的概念——你不需要手写每一行脚本,只要用自然语言描述测试意图,AI 帮你生成可执行代码。
应用场景:你说“验证用户用正确手机号和验证码能成功登录,登录后进入首页,会话状态正确”,AI 自动转成 Playwright 或 Selenium 脚本。
这不代表测试人员不需要技术了,相反,你得更清楚什么叫“正确的会话状态”,什么叫“风险被覆盖”。你的判断力,比你的编码速度更重要。
10、AI 幻觉
AI 幻觉指的是模型生成的内容看起来很专业,实际上是错的。在测试场景中,这尤其危险。
常见幻觉:编造不存在的接口字段、假设需求里没有的业务规则、写出无法运行的脚本、把行业通用规则当成你们系统的规则。
怎么防? 三问:需求里有依据吗?字段真的存在吗?是不是把通用经验当成了本地规则?RAG + 人工抽查 + 格式约束,是目前最有效的三道防线。
11、MECE 测试拆解
MECE 是“相互独立、完全穷尽”的缩写。很多 AI 生成的用例是“散”的——看起来都对,但整体覆盖不完整。
更好的做法:要求 AI 按照固定维度拆解,比如:输入字段维度、业务流程维度、状态变化维度、异常处理维度、权限与风控维度、数据一致性维度。
这样生成出来的用例不是一盘散沙,而是一张有结构、可评审、可复用的测试地图。
12、Mutation Testing变异测试
这是目前最冷门、但最有深度的概念。变异测试的做法是:故意在代码里制造一个小缺陷(比如把 >=18 改成 >18),然后看现有的测试能不能发现它。
如果测试能发现,说明你的测试是真的在验证业务逻辑;如果测试仍然通过,说明你的测试只是“跑过了”,并没有真正校验关键规则。
这对 AI 生成测试尤其重要——AI 很容易生成“断言很弱”的测试,比如只检查不报错、只检查页面能打开。变异测试可以帮你揪出这些“假覆盖”。
覆盖率只能说明代码被执行了,变异测试才能说明测试是否真的有效。
![]()
AI测试不是“换赛道”,而是“加能力”——给新手的3条转行路线
看到这里,如果你是一名刚入行或准备转行测试的新手,可能会有点慌:这么多新词,我得学到什么时候?是不是不会AI就没法做测试了?
别急,我想告诉你三句大实话:
- 第一,AI测试不是取代你,而是给你装上一套“外挂”。你不需要成为算法工程师,也不需要会训练模型。你只需要学会用好AI工具,就像当年从手工测试转向自动化测试一样。
- 第二,转行AI测试,不是从零开始,而是能力升级。你已有的测试思维、业务理解、边界分析能力,全部作数。AI帮你省掉的是重复劳动,放大的是你的判断力。
- 第三,现在就是最好的入局时间。AI测试工具还在早期阶段,没有所谓的“资深专家”。你只要比周围人早动手半年,就能建立明显的先发优势。
☑️想了解更多涨薪技能提升方法
✔️可以到公主号【Atstudy技术社区】,即可加入领取 ⬇️⬇️⬇️
☑️转行、入门、提升、需要的各种干货资料
☑️内含AI测试、 车载测试、AI大模型开发、BI数据分析、银行测试、游戏测试、AIGC
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.