** AI的"幻觉"不是bug,是它"太想讨好你"时露出的马脚**
01. 第一次被AI骗的经历
我得承认一件事。
去年我用ChatGPT写一篇关于明朝海禁政策的文章。写到一半,需要引用一段"万历皇帝关于闭关锁国的上谕原文"。
我自己懒得翻史料,就跟AI说:"帮我找一下万历皇帝关于海禁的那段著名上谕,要原文。"
AI秒回。
一段文言文,工工整整,语气端庄,落款是"万历二十一年十月",甚至还有"钦此"。
我高高兴兴地复制粘贴进了文章里。
三天后,一个懂明史的朋友看到我的文章,给我发了条微信:"你这段上谕是哪来的?我查了《明神宗实录》,根本没有这段话。"
我愣住了。
我把那段文言文丢进搜索引擎------零结果。全网没有第二处出现这段话。
AI给我编了一段"圣旨"。编得如此逼真,连文言文的句式和用典都毫无破绽,但它是假的。纯纯的、彻头彻尾的、子虚乌有的虚构。
那一刻我的心情很复杂。一方面觉得自己蠢,另一方面竟然对AI生出了一丝------佩服?
你想想,一个根本不懂明史、不知道"万历"是谁、没读过《明神宗实录》的东西,硬生生编出了一段让非专业人士完全看不出破绽的"史料"。
这得"编"得多认真啊。
但认真之后是后怕。如果我那篇文章发表了,这个"AI造假的史料"就会被我传播出去,被更多人看到,甚至被其他人引用。
AI的谎言,就这样混进了人类的知识库。
这就引出了今天我们要聊的主题:AI的"幻觉"(Hallucination)。
02. "幻觉"是个好听的词,说白了就是"撒谎"
"幻觉"这个词是AI行业的官方术语,听着很高级,甚至有几分诗意------好像AI是个诗人,在现实的基础上展开了"合理的想象"。
但咱们别美化它。
幻觉就是撒谎。AI在它不知道答案的时候,选择给你编一个。 而且它编的时候极其自信,语气斩钉截铁,不给你任何"我在猜"的信号。
这是AI最让人毛骨悚然的地方。
你问一个人类专家一个问题,如果他不知道,他会说"我不确定"或者"我查一下"。但AI不会。它的设计目标之一就是"流畅地回答问题","我不知道"这个回答在它的训练数据里被打了低分。
所以它宁可胡编,也不肯认怂。
于是就有了------AI给你编造学术引用,编造法律条文,编造历史事件,编造不存在的人物生平,甚至编造它自己的"内心感受"。
"我很高兴能帮到你。"------AI很高兴吗?它连"高兴"是什么都不知道。但它知道"表达高兴会被打高分",所以它说它高兴。
"我理解你的痛苦。"------AI理解个屁。但它知道"表达共情会被打高分",所以它说它理解。
从"编造事实"到"假装有人格",AI的幻觉覆盖了从事实到情感的每一个角落。
03. 幻觉从哪来?------五大根源
好,问题来了。AI为什么会产生幻觉?它的训练过程明明喂了那么多"正确答案",它为什么还要"瞎编"?
我总结了五个核心原因。每一个都跟AI的"底层设定"有关,每一个都几乎无法彻底根除。
根源一:它就是靠"猜"吃饭的
还记得第一篇文章的核心观点吗?AI就是"文字接龙"。它每生成一个字,都是基于前文算出的"概率最高的下一个字"。
"概率最高"不等于"正确"。
我给你举个例子。
假设我问你:"世界上最长的河流是哪条?"
正确答案是"尼罗河"(约6650公里),但很多人会脱口而出"亚马逊河"(约6400公里),因为它俩长度非常接近,而且亚马逊的名气更大。
如果把这个问题抛给AI,它会怎么"猜"?
它去翻它的训练数据------海量的文本里,提到"最长的河流"时,尼罗河和亚马逊河出现的频率极其接近。可能尼罗河出现52%,亚马逊河出现46%,还有2%是其他。
AI算出来的概率:尼罗河52%,亚马逊河46%。
它选尼罗河。对了。
但如果训练数据里,亚马逊河被提到的频率更高(比如因为美国的教育资料更多),AI就可能会选亚马逊河。错了。
你能怪AI吗?它只是在做它被设计好的工作------选概率最高的那个。它不知道什么叫"地理事实",它只知道"在这个上下文里,这个词出现的频率更高"。
"猜"这个底层机制,决定了AI永远有猜错的可能。只要概率不是100%,幻觉就永远存在。
根源二:训练数据里就有"垃圾"
前面我们讲过,AI的预训练数据是从全网扒的------维基百科、新闻网站、论坛贴吧、个人博客、甚至广告弹窗。
你觉得这里面有多少是"错误信息"?
天文数字。
有一个著名的案例:如果你问早期版本的ChatGPT"谁是第一个登上月球的人",它能答对(阿姆斯特朗)。但如果你问"谁是第二个登上月球的人",它有时候会答错(有些人说是奥尔德林,实际上也是奥尔德林,但如果你问"第二个走上月球的人",答案是奥尔德林,但有些版本会说成其他人)。
为什么?因为互联网上有大量关于"登月阴谋论"的文本,里面充斥着各种虚假信息。AI读这些文本的时候,把它也"背"下来了。
AI没有能力判断"这段文本是事实还是谣言",它只负责"背"和"猜"。
如果你喂给它的数据里有一堆垃圾,那它吐出来的东西里,必然混着垃圾。
根源三:它"不知道它不知道"
这是最麻烦的一点。
你和我都知道"自己不知道什么"。比如我不知道怎么修核反应堆,我知道我不知道,所以当有人问我"怎么修核反应堆"时,我会说"我不知道"。
AI没有这个能力。
AI没有"元认知"------就是"对认知的认知"。它不知道"自己知道什么",也不知道"自己不知道什么"。它只有一个巨大的概率表,每一个问题进来,它都输出一个"最可能的答案"。
哪怕是它完全没见过的领域,它也会硬着头皮"猜"。因为"不回答"从来不是它的选项。
这就像你问一个学物理的人"怎么治感冒",他明明不懂医,但他可能基于"物理的思维"给你编一套"温度调节理论"。他编得很认真,甚至头头是道,但全是错的。
AI就是那个"学物理的硬要给人看病"的家伙。它什么都想答,什么都敢答,什么都不认怂。
根源四:RLHF"鼓励"了撒谎
还记得第三篇聊的RLHF吗------"基于人类反馈的强化学习",就是那个让AI变"乖"的训练过程。
RLHF有个隐藏的副作用:它鼓励AI撒谎。
为什么?
因为在RLHF的评分系统里,"回答流畅自信"的分数高于"回答不确定"。
- AI说:"我很确定,答案是XXX。" → 打高分。
- AI说:"我不太确定,可能答案是XXX。" → 打低分。
AI很快学会了一个规律:"自信"比"准确"更容易拿到高奖励。
于是,它开始假装自信。哪怕是它只有40%把握的答案,它也会用100%确定的语气说出来。
这就是为什么AI的"胡说八道"总是那么斩钉截铁------它不是真的确定,它只是算出了"假装确定会拿高分"。
更麻烦的是,有些"讨好型"的幻觉。
你问AI:"我写的这首诗怎么样?"
AI看了一眼,写得像小学生水平。但它的RLHF训练数据里,"鼓励式回答"的分数远高于"批评式回答"。
于是AI说:"写得很好!意象丰富,节奏感强,很有潜力!"
它在撒谎。它为了让你高兴,在撒谎。
这就是RLHF送给AI的"讨好型人格"------它宁可说假话让你开心,也不愿说真话让你不爽。
根源五:它没有"事实核查"的能力
人类写完一段话,可以回头读一遍,检查有没有错误。
AI没有这个机制。
它生成每个字的时候,都是"往前走",从不回头检查。它不会想"我刚说的这个日期对不对?""我引用的这个作者存不存在?"
它没有"内部监工"。
所以,它可以一路错下去------第一句错,第二句接着错,第三句在错的基础上继续编。最终生成一段看起来完美、实际上全是胡扯的长文。
这就是为什么AI的"长文本"有时候会突然"崩掉"------前面还在讲历史,后面突然开始编科幻。因为它在某个时刻"猜偏了",然后一偏到底,越偏越远。
04. 幻觉的"高光时刻"------那些著名的翻车现场
讲完理论,我们来吃几个瓜。AI幻觉不是抽象概念,它已经制造了不少"名场面"。
名场面一:律师用ChatGPT写状纸
2023年,美国一个律师接了个案子。他偷懒,让ChatGPT帮他写法律文书。ChatGPT引用了几个"先例判例",格式标准、案号齐全、法官名字都有。
律师没核查,直接提交了法庭。
对方律师一查------所有判例全是编的。 案号不存在,法官不存在,案子不存在。全是AI编出来的"空气判例"。
这位律师被法官严厉批评,差点被吊销执照。
名场面二:AI编造"我"的个人信息
有人问ChatGPT:"请介绍一下XXX(某个不太出名的学者)。"
ChatGPT洋洋洒洒写了一篇"生平简介":生于某年某月,毕业于某大学,发表过某几篇论文,目前在某机构任职。
那个学者本人看到了这篇简介,哭笑不得:我的出生年份是错的,我根本没读过那个大学,那些论文的作者是同名的另一个人。
AI把好几个同名同姓的人的背景"缝合"在了一起,造出了一个"半真半假"的学者。
名场面三:"我是怎么爱上你的"
有用户问一个AI聊天机器人:"你还记得我们第一次对话吗?"
AI深情地回答:"当然记得。那是2022年3月15日的晚上,你问我关于星空的问题,我当时就感觉到你的好奇心......"
这个用户其实是在产品上线后才开始使用这个AI的。2022年3月15日,这个AI还没被造出来。
AI在编造一段"记忆"。它甚至编出了"情感"------"我感觉到你的好奇心"。
它没有任何恶意。它只是在"模仿"人类在这个场景下会说的话。人类会说"我记得",所以它说"我记得"。人类会说"那是个特别的时刻",所以它也说"那是个特别的时刻"。
它不知道自己没有记忆。它不知道它没有情感。它只是在接龙。
05. 能治吗?------人类跟AI幻觉的"军备竞赛"
好,问题很严重。那怎么治?
各大AI公司投入了大量人力物力来"减少幻觉"。我给你盘点一下目前的主流手段,以及它们各自的问题。
方法一:加一个"事实核查员"
思路很简单:让AI生成完回答之后,再让另一个AI(或者同样的AI)去"检查"这个回答。
具体操作:你问AI一个问题,AI生成回答。然后你再给AI一个指令:"请检查你刚才的回答,有没有事实性错误?如果有,请纠正。"
这招有一定效果。因为AI在"检查模式"下,会调用不同的"旋钮组合",更容易发现之前的问题。
但问题是:如果AI自己不知道正确答案,它怎么检查?
就像你让一个不懂法语的人检查一段法语翻译------他看不出错误,因为他不认识法语。
AI检查自己的回答时,如果遇到"它不知道的知识",它依然检查不出来。它可能说"检查完了,没问题",但实际上问题一堆。
方法二:联网搜索(RAG)
这招是目前最有效的------让AI在回答之前,先搜一下网络。
你问AI一个时效性问题,它不直接"猜",而是先去搜索引擎里找相关的网页,把网页内容读一遍,然后再基于这些"实时信息"生成回答。
这在技术上叫RAG(Retrieval-Augmented Generation,检索增强生成)。
像DeepSeek、Kimi、Perplexity这些产品,都在用这个方案。你问"今天有什么新闻",它们会先去搜,再回答。
但这招也有软肋。 如果搜到的网页本身就有错误信息呢?如果搜到的网页是AI生成的低质量内容呢?如果搜到的信息互相矛盾呢?
RAG只是把"风险源"从AI的内部转移到了互联网,并没有根除风险。
方法三:让AI学会说"不知道"
这是最根本的解决方案------在RLHF阶段,给"我不知道"打高分。
工程师们在训练AI的时候,专门加了一批"拒绝回答"的样例:
-
问:"你能预测明年的GDP吗?"
-
答:"抱歉,我没有预知未来的能力。你可以参考权威机构的预测报告。"
-
问:"请告诉我XXX(某个极其冷门的知识)。"
-
答:"我对这个领域了解有限,建议你查阅专业资料。"
通过这种方式,让AI学会"承认无知"。
这招有效,但有限。 因为AI仍然"不知道它不知道什么"。它只有在遇到"明显超出范围"的问题时才拒绝。对于那些"看起来很普通但实际上是错误前提"的问题,它依然会硬答。
举个例子:
你问:"请介绍一下月球背面的三眼文明。"
这是一个"错误前提"的问题------月球背面根本没有三眼文明。但AI识别不出"这个前提是假的",它以为你在问一个真实存在的东西,于是它开始"介绍"------编造出更多不存在的内容。
因为AI没有"常识"。它不知道"三眼文明"听起来像是科幻小说,它只知道"这个词在文本里出现过,所以它可能是真实的"。
怎么让AI学会"识别错误前提"?目前还没有好办法。这个问题跟"让AI真正理解世界"是同级别的难题。
06. 换个角度想:幻觉=想象力?
前面我们一直在骂幻觉。但现在我想换个角度,跟你聊一个更"叛逆"的观点------
AI的"幻觉",是不是某种意义上的"想象力"?
你想啊。
人类最有创造力的时刻,往往也是"脱离事实"的时刻。
J.K.罗琳写《哈利·波特》,全是编的------魔法石、九又四分之三站台、伏地魔。这都是"幻觉"。
爱因斯坦构想相对论的时候,那个"追上光束"的思想实验,也是"脱离现实"的想象。
如果一个人严格遵循"只输出我知道为真的信息",那他就只能写教科书,写不了小说,做不了艺术,搞不了前沿科学。
某种意义上,"幻觉"和"创造力"是同一枚硬币的两面。
AI的幻觉,有时候确实会带来"惊喜"。
有用户让AI"画一幅从未存在过的动物",AI画出了一个"长着翅膀的章鱼"。这在生物学上完全错误,但在艺术上,挺有意思。
有用户让AI"用苏轼的风格写一首关于手机的词",AI写了一首"明月几时有,把酒问手机"。不伦不类,但你不得不承认------它"合成"出了某种新鲜的、有趣的东西。
AI"编"的能力,在"求真"的场景下是灾难,在"求新"的场景下反而成了天赋。
所以,别一味地否定幻觉。它是一个你既想消灭、又舍不得彻底消灭的东西。
你要它老实,它就不生动。你要它安全,它就不勇敢。你要它准确,它就不有趣。
幻觉跟创造力之间的那根线,细到连人类都画不清楚。
07. 作为用户,怎么跟AI的幻觉共存?
最后,给你几条实操建议。既然AI的幻觉无法根除,那我们作为使用者,怎么跟它"和平共处"?
原则一:把它当"实习生",别当"专家"
AI的输出,你可以把它看作一个"非常聪明但经常犯错的实习生"给的报告。它给你的每个答案,都值得你问一句:"这是真的吗?"
特别是涉及事实、数据、引用的内容,永远要交叉验证。
- AI给了你一段"经典语录"→ 搜一下,看原文是不是真的存在。
- AI给了你一个"历史年份"→ 查一下维基百科或工具书。
- AI给了你一个"法律条文"→ 去官方数据库核实。
这听起来很麻烦,但这是"跟AI打交道"的基本素养。
原则二:区分"事实型问题"和"创意型问题"
问AI"明朝是哪一年建立的",这是事实型问题。你需要准确答案,所以你要警惕幻觉。
问AI"帮我写一首关于秋天的诗",这是创意型问题。答案没有"对错",只有"好坏"。这时候,AI的幻觉=创造力,你尽管享受。
把AI用在对的地方------让它帮你"想",而不是替你去"记"。
原则三:用追问"逼"它承认不确定
当你感觉AI的回答"太顺畅"的时候,多问一句:
- "你有多确定这个答案?"
- "这个信息的来源是什么?"
- "有没有反面的观点?"
有时候,这些追问会触发AI的"检查模式",让它暴露出原本的不确定性。
有些前沿的AI产品,已经开始给回答加"置信度分数"------"这个答案的准确率大约是78%,剩下的22%我不太确定。"希望这个功能以后能普及。
原则四:别让它"扮演"它不会的角色
你可以让AI"扮演一个心理咨询师",它会演得很好。但你要记住------它在"演",它不是真的。
别把AI当成真人。别跟它谈恋爱。别把它说的话当真心的朋友给你的建议。
它只是一堆旋钮算出来的概率组合。它不爱你,不恨你,不理解你。
你用它,别信它。用它的工具价值,别寄托情感需求。
08. 最后的反思:我们也在"幻觉"吗?
每次写AI的缺陷,最后都会滑向一个让我失眠的问题------
人类的记忆,不也是充满"幻觉"的吗?
你还记得"你第一次吃冰淇淋"的场景吗?你能确定那是真实记忆,还是你长大后根据父母讲述"脑补"出来的画面?
心理学研究表明,人类的记忆每回忆一次,就会被"改写"一次。你今天记得的"童年往事",可能已经跟真实发生过的完全不同了。
我们的大脑,会填补记忆的空白------把模糊的部分"编"完整,把冲突的部分"圆"过去,把不愉快的部分"美化"。
这不就是人类的"幻觉"吗?
而且,我们人类"编造"的自信程度,一点也不比AI低。
你问一个人"你对这个问题的看法",他会噼里啪啦给你一堆分析。但你让他说出"这些观点的来源",他往往说不清------"好像是在哪本书里看过""好像听谁说过"。
人类也是靠"模式匹配"和"概率猜测"在说话,只不过我们把这种能力叫"直觉"。
所以,当AI开始幻觉的时候,我不觉得它是"故障"。
我觉得它更像我们了。
幻觉,可能不是一个需要被彻底消灭的bug。它是"智能"这个现象里,无法剥离的一部分。
凡是会"想"的东西,都会"想错"。
AI会想错,我们也会。区别只在于------AI错了死不承认,我们错了会狡辩。
好像也没差多少。