GPT-6 发布,火爆全网。它除了写代码之外,也越来越擅长直接操作电脑和浏览器。OpenAI 在 GPT-6 Astra 的介绍中展示了前端 QA 场景,模型可以创建网站,再运行前端检查,验证页面功能是否正常。
既然 GPT-6 已经能自己理解页面、点击按钮甚至处理异常,那么 UI 自动化测试,是不是也可以交给 GPT-6?
当然可以。但如果面对的是每次发布都要跑的批量回归测试,只靠 Agent 未必最合适。因为测试里有些工作需要理解和判断,有些工作只是需要稳定地重复。
为什么 UI 自动化测试需要分工?
之所以要分工,是因为不同测试阶段关注的重点不一样。
新功能刚出来时,页面和流程还在变化,更适合用 GPT-6 去探索和判断。等流程稳定下来,像登录、下单、创建项目这类重复测试,就更适合固定下来长期跑。
如果进入团队使用,还要考虑后续维护和协作,以及高频执行时的 Token 和调用成本。
灵活性 VS 稳定性
GPT-6 的优势在于灵活。页面变化、文案调整或出现异常时,它可以重新理解当前状态并规划下一步。新功能探索、临时验收、边界场景测试和失败分析都适合交给它。这些任务通常难以提前定义完整路径。
但一条已经确定的流程,如果要重复跑 100 次,难道也要让 AI 重新理解 100 次?
显然是不合适的。
回归测试更看重确定性。固定的流程已经连续跑了几个版本。下一次发布时,我们通常并不希望重新探索一遍怎么完成,而是想按照已经确认过的方式再走一次,看看原来的业务链路是不是还正常。
这正是自动化测试工具 CueCast 更适合做的部分。
测试人员可以先在真实页面里把已经确认的业务流程录下来,点击、输入、断言等动作会转成结构化步骤。下一次再回归时,继续执行这套测试用例,不需要每次重新让模型理解页面和决定下一步。

同时,确定性也不等于完全写死。Web 页面本身会持续变化,如果稍微一变就全部失败,自动化测试也很难真正用起来。
所以 CueCast 在执行时会做多层处理。元素定位并不只依赖一个 locator,而是保留多个候选。回放操作以 CDP 模拟真实操作为主要路径,在需要时还可以通过 DOM 兜底。页面出现一些正常的小变化时,测试有一定空间继续执行。如果业务流程本身真的变了,再去修改对应步骤。
这种稳定性更符合长期回归需要的状态,在保持测试路径相对稳定的同时,适应合理的页面变化,让测试用例更具有韧性。
个人使用 VS 团队资产
当测试从个人尝试进入日常回归后,另一个问题是:谁来维护这些测试?
一次 GPT-6 执行更像独立任务,换人后,其他同事未必了解原来的测试过程和设计原因。长期运行的自动化测试,不能只存在于某次对话、某个 Prompt 或个人习惯里。
CueCast 支持组织、成员和角色管理,团队可以共同查看、维护测试用例。一个人录好的流程,其他成员可以继续使用、修改,并查看执行结果,无需重新创建。

一条回归用例可能运行半年甚至更久。它不只是今天能跑通,还要让团队里其他人看得懂、会维护、能修改。这样,执行一次的测试用例才能变成一份可以交接、复用和持续维护的团队资产。
高频回归,还要算一笔 Token 账
GPT-6 执行一次浏览器任务,需要不断读取页面、理解状态、决定下一步,再调用浏览器工具。流程越长、页面越复杂、异常和重试越多,模型推理和工具调用也会增加。
以 GPT-6 的 API 价格为例,输入是 10 美元/百万 Token,输出是 50 美元/百万 Token。一条 UI 测试如果每一步都要读取页面、分析状态并生成下一步操作,单次执行消耗几千到上万 Token 并不奇怪。单次测试可能感觉不明显,但回归测试的特点就是重复。
新功能探索时,这笔钱通常值得,因为需要 GPT-6 的判断和灵活性。但对于已经稳定的固定回归,直接执行保存好的测试流程通常更划算,也能把 Token 留给真正需要分析的变化和失败。
CueCast 会把已经确认的操作流程保存下来,后续直接按步骤稳定复用录制好的用例,不消耗 Token。登录、创建项目等固定流程,尤其适合交给 CueCast 做高频回归。
简单来说,用 GPT-6 把 Token 花在新功能探索、异常路径和失败分析上,而 CueCast 负责稳定执行已经跑熟的流程,避免重复支付模型调用成本。这样既保留了 Agent 的灵活性,也降低了长期回归的成本。

GPT-6 + CueCast,可以怎么配合?
GPT-6 和 CueCast 其实负责的是 UI 测试中不同的部分。
新功能刚出来、测试路径还没完全确定时,可以让 GPT-6 帮忙理解需求、尝试不同操作,或者补充一些容易漏掉的场景。等其中的核心流程逐渐跑顺,再把真正需要长期保证的部分录进 CueCast。
之后的日常回归,就继续跑这些已经沉淀下来的用例。登录、创建、保存这类流程不需要每次重新让模型理解,团队成员也可以共同查看和维护。
如果某次执行突然失败,或者页面发生了比较大的变化,再让 AI 介入分析会更合适。它可以结合失败现象和截图帮助判断问题出在哪里,测试人员再决定是修产品,还是更新已有用例。
最后,所有测试报告、截图和结果都在统一平台查看、存储,让每一次执行都有证据可查。

AI 越强,测试越需要合理分工
GPT-6 让 UI 测试拥有了更强的理解、推理和自主操作能力,但自动化测试的目标,并不是让每一个步骤都经过 AI。已经确定的核心业务路径,更需要稳定、低成本地持续执行。
当这些任务被放到更合适的位置,GPT-6 和 CueCast 就不再是互相替代的方案,而是测试流程里不同的角色。
让 GPT-6 处理变化,让 CueCast 沉淀确定性。
如果你也在探索自动化测试,欢迎关注我们,后续将持续分享更多自动化测试方面的干货。