我让 AI 做了一次调研,它给了三个错误答案——每个都长得很像真的

我最近用 AI 做了一次完整的市场调研,产出几十页材料。其中有三个结论是错的 ------ 而且不是"一眼假"的那种错,是细节齐全、逻辑通顺、引用规范的那种错。如果不是我逐个去核来源,它们会原样进我的决策。

把这三个案例记下来,因为它们背后是同一个模式。

错误一:我把 13 年前的数字当成了现行标准

AI 给我的报告里写着:

InfoQ 稿费标准:150 元/千字,单篇 800 元封顶。

这个数字有出处 ------ 它确实来自 InfoQ 的官方投稿须知页面。引用是准确的。

问题是:那篇须知发布于 2012 年 2 月 1 日。

十三年过去了,这个数字还成不成立?不知道。而 AI 把它当作现行标准,用来估算我的收入预期。

更糟的是:那篇 2012 年的须知里还写着"接收投稿的对象为经验丰富的 IT 工程师作者"------这句话本身就说明这个渠道可能不适合我,但报告里没提。

可复用的规则

看到一个数字,先问它的日期。

不是问"有没有出处",是问"这个出处的日期是什么时候"。有出处 ≠ 有效。

错误二:AI 说"找不到",其实是它没找对地方

我问 AI:国内有没有面向中学生的编程/安全类竞赛?

它搜了一圈,回复:找不到明确的全国性赛事,建议考虑境外赛事。

这个结论听起来很合理 ------ 因为搜出来确实很乱,各种机构办的比赛混在一起。

但事实是:教育部有一份正式发文的白名单。

项 内容
文件名 《2025---2028学年面向中小学生的全国性竞赛活动的通知》
发文字号 教监管厅函〔2025〕7号
规模 47 项竞赛
有效期 2025 年 9 月 --- 2028 年 8 月

公开的、发文的、带编号的。 查到它花了我不到五分钟。

不是"搜不到",是没去找正确的源头 ------ 一份政府文件不在技术社区里,搜索它的关键词和搜索"有什么比赛"完全不同。

可复用的规则

"找不到"是一个需要被质疑的结论。

在没有确认"我已经找过权威源(政府、标准组织、厂商官方文档)"之前,不要把"搜不到"当成"不存在"。

错误三:把平台自己的说明文档,当成了数据

我让 AI 写一个脚本,去抓 GitHub 上带金额的悬赏 issue。第一次运行,它报出五条 $100 的悬赏。

其中四条:同一个仓库、同一天创建、同样金额。

太整齐了,所以我去核实。 结果是:

真实悬赏数 = 0。

那些金额全部来自 Opire 注入到每个 issue 里的一个样板页脚,内容是它自己的语法说明:

html 复制代码
<details><summary>This repo is using Opire - what does it mean? 👇</summary>
💵 Everyone can add a reward with `/bounty $100` on any issue.</details>

标记存在 ✅、金额存在 ✅、两者都来自平台在解释自己,而不是来自任何人出钱。

可复用的规则

当你的输入来自别人的系统时,输入的一部分是"那个系统对自己的说明"。

你搜索的任何模式,都可能匹配到文档 而不是内容。

对每个抽取的字段都问一句:这段文字出现在这里,有没有可能不是为了我以为的那个原因?

共同点:三个错误都是"合理的中间信号"

复盘一下:

错误 依赖的信号 为什么它会骗人
13 年前的稿费 "有官方出处" 出处为真,但过期了
"找不到赛事" "我搜过了" 搜索为真,但搜错了地方
幻影赏金 "字段匹配到了" 匹配为真,但匹配到的是文档

这三个信号,没有一个是"假的"。 它们只是不回答我问的那个问题。

这才是 AI 调研最难防的失败模式。它不会给你一个明显荒谬的答案 ------ 那种错你一眼就看出来了。它给你一个每一环都能追溯、但整体是错的答案。而这种错,你只有在逐环追问"这个信号真的在回答我的问题吗"的时候才会发现。

我现在的实际做法

三条,很土,但有效:

1. 每个数字先问日期。 "这个数字是什么时候的?"------一句话筛掉大部分过期数据。

2. 区分"权威源"和"第三方汇总"。 政府文件、标准组织公告、厂商官方文档 = 权威源。 "某某导航站整理"、"某篇公众号盘点" = 线索,不是依据。

3. 让 AI 明确标注"未核实"。 我在自己的笔记里强制执行一条:任何未逐字核对过的结论,必须带 ❌ 标记。 带着 ❌ 的结论可以用作下一步的方向,不能用作决策依据。

结尾

这三条规则加起来,其实就是一句话:

在任何判断之前,先问一句:我现在依赖的这个信号,真的在回答我这个问题吗?

如果答案是"不完全是"------那就去找那个直接回答问题的证据,哪怕它更麻烦、更底层、更不好看。

AI 能帮你把调研速度提升一个数量级,也能把犯错的速度提升一个数量级。 区别在于你有没有给它定一条"必须能追溯"的规矩。

相关推荐
newerp5 小时前
Go 性能分析工具 pprof:CPU、Heap 与 Goroutine 实战
后端·程序员·go
KylinLab6 小时前
工具手册的机器可读重构:人机双轨 + 六模块
程序员
知守观7 小时前
18年老兵的十条开发军规:每条背后都是一个翻车现场
java·后端·程序员
SimonKing7 小时前
一只离线鼠鼠,干翻了一堆在线格式转换网站
java·后端·程序员
Thneonl7 小时前
值班第一年:最先要学的不是排障,是叫人
后端·程序员
newerp1 天前
pprof 火焰图(Flame Graph)阅读与热点代码重构实战
后端·程序员·go
SimonKing1 天前
Qoder中Qwen3.8-Flash 限时免费使用
java·后端·程序员
爱勇宝1 天前
裁员裁掉了那个干了14年的人:我这才看清职场的5条潜规则
前端·后端·程序员
Hilaku1 天前
GraphQL 在国内为什么水土不服?
前端·javascript·程序员