把大模型记忆回归测试从手工检查换成 Playwright+VCR,误判率从 40% 降到 0凌晨一点,我被一连串钉钉消息震醒。产品经理在群里大喊:“用户投诉我们 AI 助手把他上周设定的‘紧急联系人’全忘了,明明上次对话里还提到过!”我迷迷糊糊打开日志,一条条翻聊天记录,发现模型这次回答确实跟历史记忆对不上——典型的记忆幻觉,但上一个版本明明没这个问题。谁改了记忆存储的逻辑?没人承认。那一夜,我手动对比了 30 组对话,眼睛都花了,最后靠直觉拍板:回滚。之后我在想,为什么我们在 2025 年还在靠“人肉”比对大模型的记忆? 这直接催生了 Playwright + VCR 的自动回归方案。