前言
大家好,我是wacky。最近AI相关的新闻几乎每天刷屏,朋友圈里一半在晒用AI生成的图片,另一半在担忧AI会不会取代自己的工作。作为一个技术人,我觉得有必要聊一聊AI到底是什么------不是那种"颠覆未来"的宏大叙事,而是从它的底层原理出发,搞清楚它能做什么、不能做什么,以及它正在往哪里走。
LLM的本质
无论ChatGPT、Claude还是文心一言,所有大语言模型(LLM)的核心工作机制可以用一句话概括:给定上文,预测下一个最可能出现的token。
对,本质上就是"猜下一个字"。
你问它"1+1等于几",它不是在计算,而是基于训练数据发现"1+1等于"后面出现概率最高的字是"2"。你让它写辞职信,它不是在理解你的职场处境,而是根据"辞职信"这个上下文,按概率生成"尊敬的领导""感谢培养""因个人原因"这一系列文本。
学术上叫Next Token Prediction,通俗地说,就是一个规模极度放大的输入法联想------只不过它的词汇量是几万亿级别,上下文窗口可以容纳整本书。量变到一定程度,表现出来的效果接近质变。
但这里有一个关键区别:LLM没有世界模型。它不理解"杯子打翻水会洒",只是读过几百万个"杯子打翻水洒了"的句子,所以当上文出现"杯子打翻",它推断下文大概率要接"水洒了"。
这就是为什么AI会在某些看似简单的任务上出错。比如让它数"strawberry"里有几个"r"------它不是数字符,是猜答案。猜对了是运气,猜错了就是所谓的AI幻觉(Hallucination)。
很多人以为AI"胡说八道"是程序出了bug。实际上,幻觉是概率模型的必然产物。当模型遇到训练数据覆盖不足或超出知识截止日期的问题时,它不会回答"不知道"------因为它没有"知道自己不知道"的机制。它只会生成一个"看起来合理"的回答。
你问它2027年世界杯冠军是谁,它能给你编出一个有比分、有进球球员、有战术分析的回答,全文没有任何事实依据。推理模型(如OpenAI o1、DeepSeek R1)通过输出前多步验证,在一定程度上缓解了这个问题,但这只是降低幻觉率,不是消除。只要底层机制还是概率预测,幻觉就不可能归零。
几个常见的认知误区
基于以上原理,有几个流行的说法值得警惕。
第一,AI可以替代人类判断。2018年亚马逊曾用AI做简历筛选,结果模型对包含"women's"的简历系统性降分------因为它从历史数据中学到了"被录取者多为男性"的模式。AI本身不会歧视,但会忠实复现训练数据中的偏见。
第二,AI输出的就是事实。LLM的优化目标是语言流畅度,不是事实准确性。这两个目标有时重合,有时完全背离。2023年纽约一位律师用ChatGPT准备法律文书,引用的六个判例全是AI编造的。
第三,AGI马上就要来了。LLM在语言任务上表现惊人,但一旦离开纯文本领域------涉及物理直觉、因果推理、长期规划------能力断崖式下降。能说会道不等于真正理解,这一点各位看官需要心里有数。
从Prompt到Agent
讲完AI的局限,再看看它发展得有多快。
Prompt时代(2022-2023):这一阶段的AI本质上是答题机器,你需要把问题拆解清楚,它才能给出像样的答案。"会不会提问"成了核心竞争力,甚至催生了Prompt工程师这个岗位。
推理时代(2024-2025):OpenAI o1和DeepSeek R1引入了推理链机制------模型在输出答案前,先在内部进行多轮自问自答和交叉验证。数学推理、代码生成、逻辑分析的准确率大幅提升。但本质上,这个"思考"仍然是在概率空间里探索更多路径,然后选最优的那条,不是真正的理解。
Agent时代(2025-2026):这是目前最值得关注的变化。Agent的核心区别在于AI不再只是回答问题,而是执行任务。它能调用外部工具、访问API、分步操作,甚至多个Agent协同工作。
举个例子:Prompt时代你问"今天天气怎么样",AI回答天气信息。Agent时代你说"如果明天下雨就把会议改到周五",AI自行查询天气、判断条件、修改日历、通知参会者------全程你只需要下一道指令。从"会说话"到"会做事",这一步跨越的意义不亚于ChatGPT的首次发布。
后记
写到这里,我想说的是AI既不是神也不是玩具。它更适合被看作一个知识面极广但偶尔出错的协作者。让它做信息整理、初稿生成、代码辅助,是它的强项。让它做最终决策、未经核实的事实陈述、需要物理常识的判断,是它的盲区。
每次拿到AI的输出,先问自己:我怎么验证这个结论?AI不会取代你,但善用AI的人可能会。这不是危言耸听,是正在发生的事实,诸君共勉。
本文首发于我的公众号【wacky的碎碎念】,欢迎关注追更!