技术栈
测试
匠测AI说
2 小时前
人工智能
·
测试
AI for Testing 提效实战·测试设计(四):我拿一个真实需求,让 AI 陪我走完了整个测试设计(全程复盘)
用 AI 做测试设计 ·(四)· 本篇是一次真实的「复盘」前三篇把方法拆完了:脑暴铺点、等价类 + 边界值、场景法 + 判定表。但有读者问我:"真到一个需求砸过来,这些到底怎么配合?是一次问完,还是分几轮?AI 给的东西我信哪句?"
冬奇Lab
17 小时前
人工智能
·
测试
LLM 驱动的自动化测试系列(06):移动端自动化(二)——DroidRun/Mobilerun 的角色级模型拆分
Mobilerun(这个开源项目原名 DroidRun,仓库路径至今仍叫 droidrun,但 pip 包名、CLI 命令、文档站点已经全部改成了 mobilerun)的定位很直接:一个用 LLM Agent 控制 Android 和 iOS 设备的开源框架。它给 Agent 提供检查 UI 状态、理解截图、点击、滑动、输入文字、规划多步流程的移动端原生工具集,通过 CLI 或 Python API 调用。
网络毒刘
20 小时前
测试
·
schema
·
mcp
·
atomgit
为 MCP 写集成测试:mock stdio、断言 tool schema,防止升级后静默坏掉
MCP Server 最烦人的故障不是「进程起不来」——那种很吵,你会立刻发现。真正危险的是 静默损坏:升级 SDK 或依赖后,tool 改名、必填字段消失、枚举变松,客户端要到运行时才炸,而且不一定好猜。
布丁丁
21 小时前
测试
·
全栈
测试通过但业务结果错误:断言应该怎么设计
一条创建订单的自动化用例,运行报告显示“通过”。测试人员打开业务系统,却发现订单金额不对,状态也还停在“草稿”。回头看用例,它只检查了一件事:点击提交后,页面出现过“保存成功”。
冬奇Lab
2 天前
人工智能
·
测试
开源项目第229期:e2e — 用自然语言写 E2E 测试,还能把 Agent 跑过的操作录成‘回放缓存‘免模型调用
"Describe a goal in natural language and an agent drives the app to reach it. Check the result with locators and assertions in the same test."
冬奇Lab
2 天前
人工智能
·
测试
LLM 自动化测试系列(05):移动端自动化(一)——ARTEMIS 的双模式架构拆解
Google 开源的 ARTEMIS,官方定位是一句话:"让 AI 助手和测试套件像人一样操作真机"(Let AI assistants and test suites use real phones like a human)。它的核心场景是:给它一句自然语言指令,它就在一台真实或模拟的 Android 设备上完成跨应用的操作和验证——不是写死的 UI 自动化脚本,而是一个能自主规划、执行、验证的 Agent。
网络毒刘
2 天前
agent
·
测试
·
提示词
·
diff
用测试夹具约束 Agent:给定失败用例,要求只输出最小 diff 的提示词套路
「帮我修一下这个测试」是 Agent 上下文里最高危的句子之一。没有夹具、没有失败断言、没有路径白名单时,模型会倾向于:改生产代码 + 改测试 + 顺手重构,最后给你一个「全绿」但不可审的大补丁。
Flynt
2 天前
agent
·
ai编程
·
测试
这个日增 1400 星的 E2E 框架说"第二次跑不调模型",我改了按钮文案试了试
用 agent 跑 E2E 测试这件事,我一直有个心病:它把测试代码的维护问题,换成了账单问题和玄学问题。 传统录制回放(Selenium 那套)的痛点是脆——页面一改脚本就废。于是有人想,干脆让 agent 看着页面自己点,测试里只写"把商品加进购物车"这种自然语言。听起来很美,但两个新问题马上冒出来:每次跑测试都在调模型,50 个用例的套件每轮 PR 烧几万 token,花的钱买的还是同样的决策;而且同一个 prompt 今天走 A 路径明天走 B 路径,测试比被测代码还不稳定。
长安米粒贵
2 天前
测试
单元测试写了不少,为什么线上还是没信心?聊聊测试分层的 4 个误区
很多项目都有这样的测试数据:但一到发布日,团队依然紧张。明明测试很多,为什么上线前还是没有信心?原因通常不是“测试写得不够多”,而是测试分布错了。
A1Book
3 天前
llm
·
测试
# 从 0 部署 Qwen3.8-27B:量化档位怎么选,终端配置怎么配
2026 年 8 月 5 日,通义千问团队发布了 Qwen3.8-27B。这是一款稠密(Dense)原生视觉语言模型,Apache-2.0 协议开源,基于 Qwen3.5 架构演进,主打编码、专业工作、研究与长程 Agent 任务,原生支持图像与视频理解,上下文长度 262,144 tokens 并可扩展至 100 万 tokens。
匠测AI说
3 天前
人工智能
·
测试
AI for Testing 提效实战·测试设计(三):让 AI 用场景法串起业务链路,多条件岔路口用判定表一次理清
用 AI 做测试设计 ·(三)先说结论:等价类和边界值,测的是一个个"点";场景法测的是一条条"路"。 点都对,不代表路能走通。而路上总有几个"岔路口"——走哪条分支由好几个条件共同决定(会员?满减?有券?超限购?),条件一多,顺着流程想就漏组合。
Zelman
4 天前
测试
·
自动化运维
·
devops
测试过程模型与左移右移
一句话:本页回答"测试在流程里放哪儿"——从 V/W 模型的阶段对齐,到敏捷的迭代内闭环,再到把质量活动推到需求阶段(左移)、**延伸到生产环境(右移)**的两次位移。
落梦纷飞
4 天前
e2e
·
测试
Playwright 裸写、Cypress、商业录制回放、本地 E2E 工具:四条路线的形状与代价
说明:这篇里对 Playwright 与 Cypress 的描述来自它们的官方文档(附链接),TestDog 的部分来自项目文档与源码。我没有替任何一方编「用起来什么感觉」——选型最怕的就是拿别人的体感当自己的结论。
谷哥的小弟
5 天前
测试
·
ip
·
端口
·
网络连接
网络连接测试命令Test-NetConnection
使用Test-NetConnection测试TCP端口时,基本语法如下:其中,主机地址用于指定目标服务器,可以填写IP地址或主机名;-Port用于指定需要测试的TCP端口。
七夜zippoe
5 天前
ai
·
自动化
·
agent
·
测试
·
openclaw
Agent 自动化测试:怎么给“会自己决策“的程序写测试
本文是《AI Agent 生产化实战(OpenClaw 主线)》系列第 5 篇。前面四篇把 Agent 搭起来了、看得见了、也把成本压下来了——但还剩一个最要命的问题没解决:你怎么确认这次改动没有把之前修好的东西弄坏? 传统后端的答案是单元测试,可这套答案在 Agent 上几乎全部失效:输入不再是确定的,输出不再是可断言的,同一段代码跑两次结果可能不同。本篇面向已经用上 CI、却对 Agent 改动"只敢人工点几下"的团队:基于 OpenClaw(2026-08 版)+ Vitest + 评测集方案,讲清
Zelman
8 天前
测试
测试金字塔与自动化分层
一句话:金字塔表达的是成本结构(越往上越慢、越贵、越脆),不是用例数量的 KPI——把它当比例指标考核,就是下一个被刷掉的数字。
柒和远方
8 天前
langchain
·
llm
·
测试
LangSmith RAG 量化评估:从"感觉还行"到"数据说话"
第八十五天学习笔记:用 LangSmith + openevals 给 RAG 应用做回归评估。 对应代码:本目录 src/ 下的 build_dataset.mjs、evaluators.mjs、run_eval.mjs、rag_agent.mjs。
匠测AI说
8 天前
测试
AI for Testing 提效实战·测试设计(一):喂段需求给AI,30秒铺开测试点,防漏测的第一步
用 AI 做测试设计 ·(一)做测试这些年,我最慌的时刻从来不是"写不完用例",而是上线后冒出一个我压根没想到的场景——那种"这个点我当时怎么漏了"的后背发凉。
EvalDock
9 天前
人工智能
·
测试
同一道 Excel 任务,四款 Agent 的公式、修改范围与缓存有何不同?
把 Agent 返回的 XLSX 接进后续读取流程时,除了核对算式,还要知道文件里存的是公式、常量还是计算缓存。EvalDock 对同一道日期滚动求和任务的四份最终交付做了逐格比较:三款产品填满16个公式,WPS 灵犀只补后八格;三份完整公式交付的结果一致,缓存保存方式却不同。