人工智能基础概念全景解析:从 AI 到 Transformer、LLM、Prompt、Token、RAG、Agent、对齐与安全

一文说明人工智能领域的 20+ 个核心概念 ------ 不只是定义,而是深入理解每个概念背后的"为什么"


目录

  1. 引言:为什么需要理解这些基础概念
  2. 人工智能(AI):概念、本质与日常应用
  3. [AI 发展简史:从图灵测试到超级智能的七十年](#AI 发展简史:从图灵测试到超级智能的七十年)
  4. AI、机器学习、深度学习:三层关系深度拆解
  5. [Transformer 架构深度解析:大语言模型的"发动机"](#Transformer 架构深度解析:大语言模型的"发动机")
  6. 大语言模型(LLM):核心概念与主流模型盘点
  7. Prompt(提示词):结构、类型与工程化方法
  8. 提示词设计技巧:从基础到进阶
  9. [生成参数详解:Temperature、Top-P、Top-K 与采样策略](#生成参数详解:Temperature、Top-P、Top-K 与采样策略)
  10. Token(词元):计费单位、上下文窗口与模型理解能力的基石
  11. [会话记忆(Chat Memory):让对话保持连贯的核心机制](#会话记忆(Chat Memory):让对话保持连贯的核心机制)
  12. [上下文窗口(Context Window):从"背包容量"理解模型记忆边界](#上下文窗口(Context Window):从"背包容量"理解模型记忆边界)
  13. 多模态(Multimodal):文本、图像、音频、视频的融合智能
  14. [RAG(检索增强生成):给 AI 装上"外挂大脑"](#RAG(检索增强生成):给 AI 装上"外挂大脑")
  15. [Embedding 与向量数据库:AI 理解语义的"数字密码"](#Embedding 与向量数据库:AI 理解语义的"数字密码")
  16. 模型训练与微调:从预训练到对齐的完整技术栈
  17. [AI 模型评测体系:如何判断一个模型"好不好"](#AI 模型评测体系:如何判断一个模型"好不好")
  18. [AI Agent 架构:从单兵作战到多智能体协作](#AI Agent 架构:从单兵作战到多智能体协作)
  19. [AI 幻觉深度解析:为什么 AI 会"一本正经地胡说八道"](#AI 幻觉深度解析:为什么 AI 会"一本正经地胡说八道")
  20. [AI 安全、对齐与伦理:让 AI 向善的关键议题](#AI 安全、对齐与伦理:让 AI 向善的关键议题)
  21. [Vibe Coding 深入:从概念到实践的全景解析](#Vibe Coding 深入:从概念到实践的全景解析)
  22. 总结:一张图看清核心概念之间的关系

一、引言:为什么需要理解这些基础概念

hello 大家,我们都知道,人工智能领域的发展速度之快,让"跟上节奏"本身成了一件难事。2025 年 GPT-4o 还在让开发者惊叹,2026 年 GPT-5.5、Claude Opus 4.6、DeepSeek V4、Gemini 3.1 Pro 已经让人应接不暇。各种新名词、新概念、新框架层出不穷,从业者很容易陷入"会用但不知道为什么这样用"的困境。

所以,为了帮助大家理解这些和ai有关的概念,便有了这篇文章~~

这篇文章覆盖的内容包括:

  • AI 是什么:从日常体验到技术本质,理解人工智能的"智能"到底意味着什么
  • AI 发展简史:从 1950 年图灵测试到 2026 年大模型军备竞赛,七十年风雨历程中的三大教训
  • AI / ML / DL 三层关系:为什么深度学习是机器学习的分支,而机器学习是 AI 的核心实现方式
  • Transformer 架构深度解析:自注意力机制、QKV 矩阵、多头注意力、位置编码------大语言模型的"发动机"
  • LLM 大语言模型:GPT-5.5、Claude Opus 4.6、Gemini 3.1 Pro、DeepSeek V4 等主流模型的能力边界和适用场景
  • Prompt 提示词:CO-STAR 框架、系统提示词与用户提示词的区别、提示词工程的核心思想
  • 提示词设计技巧:从角色提示到链式思考(CoT)、自我一致性、迭代优化策略
  • 生成参数详解:Temperature、Top-P、Top-K、Repetition Penalty------如何精准控制模型的"创造力"
  • Token 词元:计费单位、上下文窗口限制、分词器的工作原理、Token 优化策略
  • 会话记忆与上下文窗口:它们之间的关系、各自的限制和实际影响
  • 多模态:文本、图像、音频、视频的融合技术及其典型应用
  • RAG 检索增强生成:核心原理、向量数据库、Embedding、Graph RAG、Agentic RAG
  • Embedding 与向量数据库:语义搜索的核心技术、主流模型与数据库选型对比
  • 模型训练与微调:预训练、SFT、RLHF、DPO、RLAIF、LoRA 的完整技术栈
  • AI 模型评测体系:MMLU、HumanEval、SWE-bench、GPQA、Chatbot Arena
  • AI Agent 架构:从单智能体到多智能体协作,LangGraph、CrewAI、AutoGen 等框架
  • AI 幻觉:成因、类型、检测与缓解策略
  • AI 安全与伦理:对齐技术、偏见问题、全球监管法规

二、人工智能(AI):概念、本质与日常应用

2.1 人工智能的定义

人工智能(Artificial Intelligence,简称 AI) ,是指通过计算机系统模拟人类智能的技术。它的本质是:让机器通过算法和数据,具备类似人类的认知和思维能力,从而完成学习、推理、决策等复杂任务。

这个定义中有三个关键词值得展开:

  • 模拟:AI 不是"复制"人类智能,而是在特定任务上达到或超越人类水平的表现。一个能下围棋赢过世界冠军的 AI(AlphaGo),并不具备"饿了要吃饭"的常识。这种"窄领域超强、宽领域很弱"是当前 AI 的典型特征。
  • 算法和数据:AI 的智能来自两个源头------算法(怎么做)和数据(学什么)。算法决定了模型的学习方式和能力上限,数据决定了模型学到的具体知识和模式。两者缺一不可。
  • 类人能力:包括感知(看、听)、认知(理解、推理)、决策(选择、规划)、行动(执行、生成)。不同的 AI 系统在这些能力上的侧重不同。

2.2 日常生活中的 AI

与其从抽象定义出发,不如从日常体验入手,这能更直观地理解 AI 的实际形态:

内容推荐:打开抖音、小红书、B站,刷到的内容越来越符合你的口味。这不是巧合,而是推荐算法在不断"学习"你的行为模式------你看了什么、停留了多久、点赞了哪些、分享了什么。每一次交互都在更新模型对你的"理解",让你看到的下一页内容更可能让你继续刷下去。这就是 AI 在"学习"和"预测"。

语音助手:对着 Siri、小爱同学、天猫精灵说话,它们能听懂你在讲什么,还能用自然语言回答你。这套流程背后是三个 AI 系统的协作:语音识别(ASR)把声音变成文字,自然语言理解(NLU)理解文字的含义和意图,自然语言生成(NLG)和语音合成(TTS)把回答变成声音。这就是 AI 在"听"和"说"。

视觉识别:拍照自动识别人脸、美颜滤镜精准定位五官、OCR 把图片中的文字提取出来、翻译软件对准路牌就能实时翻译。这些都是计算机视觉(Computer Vision)的典型应用------AI 在"看"和"理解"。

AI 生成内容:输入一段文字描述,AI 就能生成一张逼真的图片、一段视频、一首音乐。比如 Sora(OpenAI)、即梦(字节跳动)、可灵(快手)等工具,输入"一只猫在月球上弹钢琴",就能生成对应的视频。这就是 AI 在理解文字并创作生成内容。

自动驾驶:新能源汽车在高速公路上自动跟车、变道、避障。车辆通过摄像头、雷达、激光雷达感知周围环境,通过 AI 算法实时判断:前方车辆减速了要不要刹车、旁边车道有空间要不要变道、这个路口能不能左转。这就是 AI 在"思考"和"做决策"。

2.3 AI 应用 vs AI 算法 vs AI 模型

这三个词经常被混用,但它们的含义有明确的区别:

  • AI 应用:把 AI 能力运用到具体业务和实际场景中,以产品或系统的形式落地。比如豆包、Cursor、自动驾驶辅助系统、智能客服机器人。AI 应用是"用户能直接使用的东西"。
  • AI 算法:计算机模仿人类思考、学习、判断时,遵循的数学公式和执行流程。它是实现 AI 能力的具体方法和逻辑。可以把 AI 算法理解为 AI 的"大脑逻辑"------同样的数据,不同的算法会产生不同的学习效果和输出质量。
  • AI 模型:用特定算法在特定数据上训练出来的产物。模型 = 算法 + 训练数据 + 训练过程。同一个算法(如 Transformer),用不同的数据训练,会得到不同的模型(如 GPT 用于英文、Qwen 用于中英文)。

常见的 AI 算法包括:线性回归、逻辑回归、决策树与随机森林、支持向量机(SVM)、卷积神经网络(CNN)、循环神经网络(RNN)、Transformer(当前大语言模型的基础架构)。

2.4 Agent(智能体)与 Copilot(副驾驶)

**Agent(智能体)**是一个能够感知环境输入、自主决策、规划行动路径,并可调用工具或执行操作以达成目标的自主性软件实体。

Copilot(副驾驶)模式 与 Agent 模式的核心区别在于控制权归属

维度 Copilot 模式 Agent 模式
控制权 人主导,AI 提供建议 AI 自主规划和执行
决策方式 人决定是否采纳 AI 的建议 AI 自主决定行动步骤
典型场景 ChatGPT 普通问答、Cursor Ask 模式 Cursor Agent 模式、AutoClaw 浏览器自动化
交互方式 "我提问题,你给我建议,我决定做不做" "我提目标,你自己想办法完成,向我汇报结果"
风险 低(人在回路中) 中到高(AI 自主执行,需要安全机制)

举个例子来说明两者的区别:

  • Copilot 模式:你对 AI 说"帮我看看这段代码有什么问题",AI 分析后给出建议,你看了觉得有道理,手动修改代码。
  • Agent 模式:你对 AI 说"帮我把这个项目中的所有 TODO 注释替换成对应的 Issue 链接,然后提交 PR",AI 自己搜索文件、替换内容、执行 git 操作、创建 PR,最后告诉你"完成了,这是 PR 链接"。

在当下,agent毫无疑问是主流存在。

2.5 Vibe Coding(AI 编程)

Vibe Coding 是一种以自然语言驱动的软件开发方式。开发者通过描述需求或意图,借助大语言模型自动生成、修改代码,从而完成开发任务。开发者只管验收、反馈、迭代,快速把想法变成可运行程序。

这个概念在 2025-2026 年迅速成为主流开发方式之一。它的核心转变是:从"写代码"到"描述需求"。以前是"我知道怎么实现,我来写",现在是"我知道要什么效果,AI 来实现"。

关于vibe coding,我之前也有一篇文章专门讲到,大家有兴趣的可以去看看

常用的 Vibe Coding 工具按类别分:

AI 原生 IDE(日常开发主力,在编辑器内深度集成 AI):

工具 特点 地址
Cursor 基于 VS Code,Agent 模式支持自主编程,Composer 功能强大 cursor.sh
Windsurf Codeium 出品,Flow 模式自动分析上下文并执行多步操作 windsurf.com
Trae 字节跳动出品,内置 Builder 模式,中文体验优秀 trae.ai

CLI 工具(终端内使用,不占界面):

工具 特点 地址
Claude Code Anthropic 官方 CLI,深度集成 Claude 模型 claude.ai/code
Aider 开源 CLI,支持多模型,Git 集成好 aider.chat
Cline VS Code 插件,终端内操作 cline.bot

即时生成工具(一句话生成可运行项目,快速出 Demo):

工具 特点 地址
Devin 首个 AI 软件工程师,全自主开发 devin.ai
秒哒 字节跳动出品,中文友好 miaoda.cn
码上飞 即时生成,快速出原型 codeflying.net

三、AI 发展简史:从图灵测试到超级智能的七十年

3.1 为什么需要了解 AI 的发展历程

要真正理解今天的 AI 为什么是这个样子,必须回到历史中去。AI 不是一夜之间"突然出现"的------它经历了三次寒冬、两次复兴、无数次的路线之争,才走到今天的大语言模型时代。了解这段历史,你就能理解:

  • 为什么专家系统在 1980 年代风靡一时,又在 1990 年代迅速衰落
  • 为什么深度学习在 2012 年"突然爆发"(其实已经酝酿了 30 年)
  • 为什么 Transformer 架构的出现是整个 AI 领域的分水岭
  • 为什么 ChatGPT 在 2022 年底引爆了全球 AI 热潮

3.2 AI 发展的七个阶段

第一阶段:AI 的诞生(1950-1974)------ 从"机器能思考吗"到第一次黄金时代

1950 年,艾伦·图灵(Alan Turing)发表了一篇划时代的论文《Computing Machinery and Intelligence》,提出了一个至今仍在被讨论的问题:"机器能思考吗?"为了回答这个问题,他设计了著名的"图灵测试"------如果一台机器在与人类的对话中,让人类无法分辨对方是机器还是人,那么这台机器就具备了"智能"。

1956 年,达特茅斯会议(Dartmouth Workshop)召开。约翰·麦卡锡(John McCarthy)在这次会议上正式提出了"Artificial Intelligence(人工智能)"这个术语。这次会议被公认为 AI 学科的诞生标志。

在接下来的十几年里,AI 进入了第一个黄金时代。研究者们开发出了能证明数学定理的程序(Logic Theorist)、能下棋的程序、能解决简单自然语言问题的程序(ELIZA 聊天机器人)。当时的人们对 AI 充满乐观------"20 年内,机器将能完成人类能做的一切工作"。

第二阶段:第一次 AI 寒冬(1974-1980)------ 期望越高,失望越大

1970 年代中期,热情骤然冷却。原因很简单:早期 AI 系统的能力远远低于预期。那些在实验室里表现不错的系统,一到真实世界就完全失效。符号逻辑推理在简单的"玩具问题"上有效,但面对现实世界的复杂性和模糊性,完全无能为力。

1973 年,英国政府发布了著名的《Lighthill 报告》,严厉批评 AI 研究"没有取得任何实质性进展"。英国政府大幅削减 AI 研究经费,随后美国 DARPA 也跟进削减。AI 研究资金几乎枯竭,大量研究者被迫转行。这就是第一次 AI 寒冬。

第三阶段:专家系统的复兴(1980-1987)------ "知识就是力量"

1980 年代,AI 以"专家系统"的形式强势回归。专家系统的核心思想是:不追求通用智能,而是聚焦于特定领域,将人类专家的知识编码为"如果-那么"规则。

一个典型的专家系统:MYCIN(1976 年开发,1980 年代投入使用),它包含了约 600 条关于血液感染诊断的规则,在诊断某些细菌感染方面的准确率超过了初级医生。XCON(1980 年)为 DEC 公司每年节省了 4000 万美元------它自动配置计算机系统的组件,减少了大量人工错误。

专家系统在商业上的成功引发了第二次 AI 投资热潮。日本启动了雄心勃勃的"第五代计算机"项目,美国、英国也纷纷跟进。但专家系统的致命缺陷已经暴露:规则写不完、规则会冲突、系统无法应对新情况、维护成本极高。

第四阶段:第二次 AI 寒冬(1987-1993)------ 专家系统的崩溃

1987 年,专用 Lisp 机器市场崩溃。通用计算机(如 Sun 工作站)的性能已经超过了昂贵的专用 AI 硬件。加上专家系统在实际应用中暴露的大量问题(维护困难、无法处理不确定性、知识获取成本高),AI 投资再次大幅萎缩。

日本第五代计算机项目在 1992 年正式宣告失败------投入了 10 年时间、数百亿日元,却没有产生任何有商业价值的成果。AI 再次跌入低谷。

但正是在这个寒冬中,有一批研究者默默坚持着另一条技术路线------神经网络。虽然当时不被主流 AI 界看好,但他们的工作为后来的深度学习革命埋下了种子。

第五阶段:机器学习的崛起(1993-2012)------ 从"规则"到"数据"

1990 年代,AI 的研究重心从"基于规则的推理"转向了"基于数据的统计学习"。支持向量机(SVM)、随机森林、贝叶斯网络等机器学习方法开始成为主流。

关键事件:

  • 1997 年:IBM 深蓝(Deep Blue)击败国际象棋世界冠军卡斯帕罗夫。这是 AI 在智力竞技领域第一次击败人类世界冠军。
  • 2006 年:杰弗里·辛顿(Geoffrey Hinton)发表了关于深度信念网络(Deep Belief Networks)的论文,标志着"深度学习"这个概念的正式提出。他证明了多层神经网络可以通过"逐层预训练"来有效训练。
  • 2011 年:IBM Watson 在《危险边缘》(Jeopardy!)问答节目中击败了两位人类冠军。

第六阶段:深度学习革命(2012-2017)------ "数据 + 算力 + 算法"的三重奏

2012 年是深度学习革命的元年。辛顿的两位学生 Alex Krizhevsky 和 Ilya Sutskever(后来成为 OpenAI 的联合创始人)设计的 AlexNet 在 ImageNet 图像识别大赛中,以压倒性优势击败了所有传统方法------错误率从 26% 骤降到 15.3%。这次胜利向全世界证明了:深度学习 + GPU 算力 + 海量数据 = 前所未有的能力。

此后,深度学习在图像识别、语音识别、机器翻译等几乎所有 AI 任务上取得了突破性进展:

  • 2014 年:Ian Goodfellow 发明了 GAN(生成对抗网络),开启了 AI 生成图像的时代
  • 2014 年:Google 收购 DeepMind,后者开始研发 AlphaGo
  • 2016 年:AlphaGo 以 4:1 击败围棋世界冠军李世石。围棋被认为是人类智力游戏的巅峰,其状态空间远超国际象棋,此前没人相信 AI 能在围棋上击败人类顶级棋手
  • 2017 年:Google 发表论文《Attention Is All You Need》,提出了 Transformer 架构。这篇论文改变了整个 AI 领域的走向,时至今日,transformr依旧是所有大模型的基础架构。

第七阶段:大语言模型时代(2017-2026)------ 规模即能力

Transformer 的出现,让研究者们发现了一个惊人的规律:模型越大,能力越强,而且这种能力的增长不是线性的,而是涌现式的,说白了就是以量制胜,靠数据给他堆积起来,就比如让一个人把github上面的所有代码学会,那么毋庸置疑他会成为计算机领域唯一的god。

  • 2018 年:Google 发布 BERT(基于 Transformer 的编码器),OpenAI 发布 GPT-1。BERT 在 11 项 NLP 任务上刷新了最佳成绩
  • 2019 年:OpenAI 发布 GPT-2(15 亿参数),因为"太危险"而延迟发布------他们担心这个模型被用于生成虚假新闻
  • 2020 年:OpenAI 发布 GPT-3(1750 亿参数),首次展示了"涌现能力"------模型在没有专门训练的情况下,能够完成翻译、编程、写诗等任务
  • 2022 年 11 月:OpenAI 发布 ChatGPT,基于 GPT-3.5。两个月内用户突破 1 亿,成为历史上增长最快的消费级应用。AI 从"实验室技术"变成了"全民工具"
  • 2023 年 3 月:OpenAI 发布 GPT-4,支持多模态(图像理解),在律师资格考试中排名前 10%
  • 2023 年:Meta 开源 Llama 2,中国大模型厂商集中爆发(百度文心、阿里通义、字节豆包、智谱 GLM 等)
  • 2024 年:多模态模型全面爆发------GPT-4o 支持实时音视频交互,Sora 实现文生视频,Claude 3 在多项基准上超越 GPT-4
  • 2025 年:AI Agent 爆发------模型不仅能"聊天",还能自主操作浏览器、写代码、调用 API、完成复杂任务链。DeepSeek-R1 以极低成本达到顶级推理能力,引发"价格屠夫"讨论
  • 2026 年:模型能力持续攀升------Claude Opus 4.6 支持 1M Token 上下文和自适应推理,GPT-5 系列迭代到 5.5 版本,DeepSeek V4 在 SWE-bench 编程基准上达到 81% 的得分,Gemini 3.1 Pro 在 MMLU-Pro 上达到 91.2% 的领先水平 1718

3.3 AI 发展史的三大教训

回顾这七十年的历史,有三个反复出现的教训:

教训一:不要高估短期,不要低估长期。1960 年代的 AI 研究者认为"20 年内 AI 能替代人类所有工作",这个预测至今没有实现。但 2010 年很少有人能预测到,短短 13 年后,AI 就能通过律师资格考试、写出可用的代码、生成逼真的视频。

教训二:算力、数据、算法,三者缺一不可。神经网络的概念在 1950 年代就出现了,但直到 2012 年才爆发------因为有了 GPU(算力)、ImageNet(数据)和更好的训练算法。Transformer 在 2017 年就提出了,但真正的爆发在 2022 年------因为需要足够的算力来训练 GPT-3 级别的大模型,那么算力其实就是基础设施,比如电。

教训三:寒冬孕育突破。每一次 AI 寒冬之后,都有一批研究者从主流路线之外找到了新的方向。没有第一次寒冬,就不会有专家系统的想法;没有第二次寒冬,神经网络可能不会得到持续的关注;没有过去几年的积累,ChatGPT 的爆发就不可能发生。


四、AI、机器学习、深度学习:三层关系深度拆解

3.1 三层关系概述

人工智能、机器学习、深度学习这三者的关系,可以用一个技术圈常见的比喻来理解:三层同心圆

  • 最外层:人工智能(AI)------目标是让机器拥有类似人类的智能。这是最宏大的愿景,涵盖所有试图让机器变"聪明"的技术。
  • 中间层:机器学习(ML)------是 AI 的核心实现方式。它通过数据训练模型,让机器自动学习规律,而不是依赖人工编写规则。
  • 最内层:深度学习(DL)------是机器学习的一个重要分支。基于多层神经网络,让机器自动从海量数据中学习特征与规律。

一句话总结:深度学习是机器学习的重要分支,机器学习是人工智能的核心实现方式。

3.2 人工智能(AI)------最宏大的愿景

人工智能的目标是让机器表现出类似人类的智能行为。这个定义非常宽泛,因为它涵盖了一切试图让机器"聪明"起来的技术------从 1950 年代的符号逻辑推理,到 2020 年代的大语言模型,都属于 AI 的范畴。

AI 的实现方式有很多种,机器学习只是其中之一。早期 AI 也曾尝试"专家系统"------由人类专家手动编写成千上万条规则,让机器按照规则来推理。比如:"如果病人发烧且咳嗽且肺部有阴影,那么可能是肺炎"。这种方式的局限性很明显:规则写不完、规则之间会冲突、规则无法应对新情况。

3.3 机器学习(ML)------从规则到数据

**机器学习(Machine Learning)**的核心思想是:不写规则,而是让机器从数据中自动学习规则

传统的编程方式:

复制代码
数据 + 规则 → 计算机 → 答案

机器学习的方式:

复制代码
数据 + 答案 → 计算机 → 规则(模型)

举个例子:要识别一张图片是猫还是狗。传统方式需要手动编写规则------"猫的耳朵是尖的,狗的眼睛是圆的,猫的尾巴是细的......"------然后让计算机按照这些规则判断。但"尖耳朵"这个规则怎么写?多尖算尖?不同品种的猫耳朵形状差异很大,不同角度拍出来的耳朵也不一样。规则写到吐也写不完。

机器学习的方式完全不同:给算法看十万张标注了"猫"或"狗"的图片,算法自己从这些图片中"学习"出猫和狗的区别特征。它学到的不是人类定义的"尖耳朵"规则,而是像素级别的抽象模式------这些模式人类可能无法用语言描述,但机器"知道"怎么用它们来区分猫和狗。

机器学习的常见方法

方法 核心思想 典型应用
线性回归 找一条直线拟合数据点,预测连续值 房价预测、销售额预测
逻辑回归 将线性回归的输出映射到 0-1,用于分类 垃圾邮件分类、疾病预测
决策树 通过一系列"如果-那么"规则进行决策 信用评估、客户分类
随机森林 多棵决策树的集合,投票决定最终结果 高精度分类和回归
支持向量机(SVM) 找到最优分类边界,最大化类别间距 文本分类、图像识别
K-Means 聚类 将数据自动分组,组内相似、组间差异 用户分群、异常检测

3.4 深度学习(DL)------多层神经网络的力量

深度学习(Deep Learning)之所以叫"深度",是因为它使用了多层神经网络------每一层从上一层提取的特征中继续学习更抽象的特征。

用一个视觉识别的例子来说明深度学习的工作原理:

  • 第 1 层:识别最基本的边缘和颜色块("这条线是直的还是弯的")
  • 第 2 层:将边缘组合成简单形状("这些线组成了一个圆")
  • 第 3 层:识别更复杂的图案("这个圆加上两个三角形,看起来像猫的脸")
  • 第 4 层:识别完整的物体("这是一只猫")
  • 更深层:识别场景和关系("一只猫坐在沙发上,旁边有一本书")

深度学习的关键突破在于:不需要人工设计特征。传统机器学习需要人类专家先"提取特征"------比如识别猫之前,先手动定义"猫的特征是尖耳朵、圆脸、长胡须"。深度学习完全不需要这一步------它自己从原始像素中逐层学习特征。这就是为什么深度学习在图像识别、语音识别、自然语言处理等领域取得了远超传统方法的成果。

深度学习的核心技术

技术 核心思想 典型应用
CNN(卷积神经网络) 通过卷积核在图像上滑动,局部感知 图像识别、目标检测
RNN(循环神经网络) 处理序列数据,记住之前的信息 文本生成、时间序列预测
LSTM / GRU 改进的 RNN,解决长序列记忆问题 机器翻译、语音识别
Transformer 自注意力机制,并行处理序列 所有大语言模型的基础架构
GAN(生成对抗网络) 生成器与判别器对抗训练 图像生成、风格迁移
Diffusion Model 逐步去噪生成高质量图像 Stable Diffusion、DALL-E

3.5 为什么是大语言模型的时代

当前 AI 领域最热门的"大语言模型"(LLM)属于深度学习的范畴,具体来说,它们都基于 Transformer 架构。Transformer 在 2017 年由 Google 提出(论文标题《Attention Is All You Need》),它的核心创新是自注意力机制(Self-Attention)------让模型在处理一个词时,能够同时"关注"句子中的所有其他词,理解它们之间的关系。

这个机制的重要性怎么强调都不过分。在 Transformer 出现之前,处理文本序列的主流方式是 RNN/LSTM------它们必须按顺序处理每个词,处理第 100 个词时必须"记住"前面 99 个词的意思。这导致两个问题:处理速度慢(必须串行),以及"记忆"在长序列中逐渐衰减。Transformer 的自注意力机制让所有词可以同时被处理,而且任意两个词之间的"距离"都是 1 步------无论它们在句子中离得多远。

Transformer 的另一个关键特性是可扩展性:它的架构天然适合大规模并行计算(GPU/TPU),这让训练超大模型成为可能。从 GPT-1(1.17 亿参数)到 GPT-4(据估计超过 1 万亿参数),从 BERT 到 Claude Opus,模型参数量的指数级增长,带来了能力的质变------这就是"大"语言模型中"大"字的含义。


五、Transformer 架构深度解析:大语言模型的"发动机"

5.1 为什么 Transformer 改变了世界

在 Transformer 出现之前,处理文本序列的主流方式是 RNN(循环神经网络)和 LSTM(长短期记忆网络)。它们有一个共同的致命缺陷:必须按顺序处理每个词。处理第 100 个词时,必须"记住"前面 99 个词的意思。这导致:

  • 处理速度慢(必须串行,无法并行)
  • "记忆"在长序列中逐渐衰减(梯度消失问题)
  • 无法有效利用 GPU 的并行计算能力

2017 年,Google 的八位研究者(Vaswani 等)发表了一篇题目极其大胆的论文:《Attention Is All You Need》(注意力就是你所需要的全部)。这篇论文提出的 Transformer 架构,用**自注意力机制(Self-Attention)**彻底替代了 RNN 的循环结构,让所有词可以同时被处理,而且任意两个词之间的"距离"都是 1 步------无论它们在句子中离得多远。

这篇论文不仅改变了 NLP 的方向,还为后来的 GPT、BERT、Claude、Gemini 等所有大语言模型奠定了基础。可以说,没有 Transformer,就没有今天的大语言模型时代

5.2 Transformer 的整体架构

Transformer 由**编码器(Encoder)解码器(Decoder)**两部分组成,每部分由多个相同的层堆叠而成(原文中 N=6)。

编码器:接收输入序列,将其转换为一系列"上下文感知"的向量表示。每个编码器层包含两个子层:

  1. 多头自注意力机制(Multi-Head Self-Attention)
  2. 前馈神经网络(Feed-Forward Network)

每个子层后面都有一个"残差连接(Add)"和"层归一化(Norm)"。残差连接让信息可以绕过子层直接传递,解决了深层网络的训练困难问题。

解码器:接收编码器的输出和之前已生成的输出,逐步生成目标序列。每个解码器层比编码器多一个子层:

  1. 掩码多头自注意力(Masked Multi-Head Self-Attention)------确保在生成第 i 个词时,只能看到前 i-1 个词
  2. 交叉注意力(Cross-Attention)------关注编码器的输出
  3. 前馈神经网络

5.3 自注意力机制:核心中的核心

自注意力机制是 Transformer 的"灵魂"。它的核心思想是:让序列中的每个词,都能直接"看到"序列中的所有其他词,并计算出它们之间的关联程度

具体来说,自注意力机制的计算过程分为四步:

第一步:生成 Q、K、V 矩阵

对于输入序列中的每个词,模型通过三个不同的线性变换,生成三个向量:

  • Q(Query,查询):代表"我在找什么"。每个词通过 Q 向量来表达"我想了解什么信息"
  • K(Key,键):代表"我能提供什么"。每个词通过 K 向量来表达"我包含了什么信息"
  • V(Value,值):代表"我实际包含的内容"。每个词通过 V 向量来表达"我实际要传递的信息"

可以把 Q、K、V 类比为搜索引擎中的"搜索词"、"网页标题"和"网页内容"------你输入搜索词(Q),系统匹配标题(K),返回内容(V)。

第二步:计算注意力分数

对于每个词,计算它的 Q 向量与所有词的 K 向量的点积(内积)。点积越大,说明两个词的相关性越高。

复制代码
注意力分数矩阵 = Q × K^T

# 如果序列长度为 4,则得到一个 4×4 的矩阵
# 矩阵中第 i 行第 j 列的值,表示"第 i 个词对第 j 个词的关注程度"

第三步:缩放 + Softmax

将注意力分数除以 √d_k(d_k 是 K 向量的维度),然后经过 Softmax 转换为概率分布。除以 √d_k 是为了防止点积过大导致 Softmax 的梯度消失。

复制代码
注意力权重 = Softmax(注意力分数 / √d_k)

第四步:加权求和

将注意力权重与 V 矩阵相乘,得到最终的输出。每个词的输出是所有词 V 向量的加权平均,权重由注意力分数决定。

复制代码
输出 = 注意力权重 × V

一个直观的例子

假设输入句子是:" 一个苹果 ,它很"。

对于"它"这个词,自注意力机制会计算出它和"苹果"的关联度最高(因为"它"指代的是"苹果"),和"甜"的关联度次之(因为"甜"是苹果的属性),和"我"、"吃"的关联度较低。

所以"它"的最终输出向量中,会融入更多来自"苹果"和"甜"的信息,而不是"我"和"吃"的信息。这就是自注意力机制的核心价值------它让每个词都能"理解"它和句子中其他词的关系。

5.4 多头注意力(Multi-Head Attention)

单头注意力只能学到一种"关系模式"。多头注意力则是同时运行多个自注意力机制(原文中 h=8),每个"头"关注不同的关系模式:

  • 头 1 可能关注"主谓关系"("我"→"吃")
  • 头 2 可能关注"动宾关系"("吃"→"苹果")
  • 头 3 可能关注"修饰关系"("苹果"→"甜")
  • 头 4 可能关注"指代关系"("它"→"苹果")

然后将所有头的输出拼接在一起,经过一个线性变换,得到最终的输出。多头注意力让模型能同时从多个角度理解文本,这是它比单头注意力强大得多的原因。

5.5 位置编码(Positional Encoding)

Transformer 没有 RNN 的循环结构,因此它没有内置的"位置感知"能力------模型不知道"我"在"吃"的前面还是后面。为了解决这个问题,Transformer 在输入嵌入(Input Embedding)上叠加了位置编码

位置编码是一个与输入嵌入维度相同的向量,它包含了词在序列中的位置信息。原文使用的是正弦/余弦函数生成的位置编码:

复制代码
PE(pos, 2i)   = sin(pos / 10000^(2i/d_model))
PE(pos, 2i+1) = cos(pos / 10000^(2i/d_model))

# pos = 词在序列中的位置
# i = 位置编码向量的维度索引
# d_model = 模型的嵌入维度

通过这种方式,每个位置都有一个唯一的编码,模型可以区分"苹果很好吃"和"好苹果很吃"这两个完全不同的句子。

5.6 Transformer 的三种变体

自 2017 年以来,Transformer 架构演化出了三种主要变体,分别应用于不同的场景:

变体 结构 代表模型 核心能力 典型应用
仅编码器(Encoder-only) 只使用编码器部分 BERT、RoBERTa 文本理解、分类、抽取 情感分析、命名实体识别、搜索结果排序
仅解码器(Decoder-only) 只使用解码器部分 GPT 系列、Claude、Llama 文本生成、对话 ChatGPT、AI 写作、代码生成
编码器-解码器(Encoder-Decoder) 完整使用两部分 T5、BART、原始 Transformer 序列到序列转换 机器翻译、文本摘要

为什么 GPT 系列只用解码器?

因为 GPT 的核心目标是"生成文本"------给定前面的内容,预测下一个词。解码器的自回归特性(每一步生成都依赖之前生成的内容)天然适合这个任务。而编码器的双向注意力(可以看到整个序列)在生成任务中反而是劣势------因为生成时未来的词是不可见的。

这就是为什么 GPT 的完整名称是 Generative Pre-trained Transformer(生成式预训练 Transformer)------"生成式"这三个字,暗示了它使用解码器架构的事实。

5.7 从 Transformer 到 GPT:缩放的魔力

Transformer 架构的另一个关键特性是可扩展性:它的架构天然适合大规模并行计算(GPU/TPU),这让训练超大模型成为可能。研究者们发现,只需要扩大 Transformer 的规模(更多层、更宽维度、更多训练数据),模型的能力就会持续提升,甚至涌现出意想不到的能力。

从 GPT-1(1.17 亿参数)到 GPT-4(据估计超过 1 万亿参数),参数量的指数级增长带来了能力的质变:

  • GPT-1(2018):能完成简单的句子补全
  • GPT-2(2019):能生成几段连贯的文本
  • GPT-3(2020):涌现出少样本学习能力------不需要专门训练就能完成翻译、编程等任务
  • GPT-4(2023):多模态理解、高级推理、代码生成、通过律师资格考试
  • GPT-5.1(2025-2026):原生多模态、超强推理、Agent 自主执行

整个过程中,核心架构没有本质变化------仍然是 Transformer 解码器。变化的是规模:更多的参数、更多的数据、更多的算力。这就是 Scaling Law(缩放定律)的力量。


六、大语言模型(LLM):核心概念与主流模型盘点

4.1 什么是大语言模型

**LLM(Large Language Model,大语言模型)**是一种基于海量文本数据训练、能理解和生成人类语言的人工智能模型 1

这个定义中的三个关键词:

  • 海量文本数据:训练数据量以 TB 为单位。GPT-4 的训练数据包括了互联网上的网页、书籍、学术论文、代码仓库、维基百科等几乎所有公开可获取的文本。这意味着模型"读过"的内容远超任何人类一生能读完的量。
  • 理解和生成:LLM 不只是"预测下一个词"的文字接龙机器。在足够大的规模下,模型涌现出了真正的理解能力------它能理解上下文、理解隐含含义、理解逻辑关系。同时,它能生成流畅、连贯、有逻辑的长文本。
  • 人类语言:LLM 主要处理的是自然语言,但它的能力已经扩展到代码(编程语言本质上也是一种"语言")、数学公式、结构化数据等。

4.2 LLM 的核心能力

LLM 的能力可以概括为以下几个方面:

文本生成:这是 LLM 最基础的能力。给定一段提示词,模型生成连贯的续写文本。这包括文章写作、代码生成、诗歌创作、对话回复等。

上下文理解:LLM 能理解对话的上下文------包括之前说过的话、隐含的意图、语气和情感。在上下文窗口(Context Window)内,模型能保持对对话历史的完整记忆。

推理能力:足够大的 LLM 展现出了逻辑推理能力。它能分析问题、拆解步骤、推理出结论。Chain-of-Thought(链式思考)提示技术就是专门用来激发模型推理能力的。

多语言能力:LLM 的训练数据通常包含多种语言,因此它能理解和生成多种语言的文本。像 Qwen、DeepSeek、GLM 等国产模型在中英文双语能力上尤其出色。

指令遵循:经过指令微调(Instruction Tuning)的 LLM 能准确理解并执行用户的指令------"用表格列出"、"翻译成英文"、"用通俗的语言解释"------模型会根据指令调整输出格式和风格。

4.3 主流大语言模型一览(2026 年 6 月)

以下是最新主流大语言模型的盘点,按开发商和发布时间排列 234

一、国际顶级模型

模型 开发商 核心特性 上下文窗口 突出优势
GPT-5.5 OpenAI(美国) 多模态,原生音视频处理,超强推理,Agent原生支持,编程能力质变 1M 推理能力最强,工具调用最稳定,综合能力领先,Terminal-Bench 82.7%
GPT-5.1 OpenAI(美国) 多模态,实时音视频交互,自适应推理模式 400K 性价比高,图像理解能力强,生态成熟
Claude Opus 4.6 Anthropic(美国) 1M上下文(已GA),自适应推理,128K输出,Context Compaction 1M 超长文档处理、编程最强、安全对齐标杆
Claude Sonnet 4.6 Anthropic(美国) 1M上下文(已GA),平衡性能与成本,编程能力强 1M 日常使用的性价比之选,长文档处理
Claude Sonnet 4.5 Anthropic(美国) 平衡性能与成本,编程能力强,智能体长时运行 200K 日常使用的性价比之选(已下线)
Gemini 2.5 Pro Google(美国) 多模态,深度融合搜索,Deep Think深度推理 1M (计划扩展至2M 上下文窗口最大之一,MMLU-Pro领先,搜索集成
Gemini 2.5 Flash Google(美国) 多模态,超低延迟,高吞吐 1M 性价比高,快速响应,适合大规模应用

二、中国国产模型

模型 开发商 核心特性 上下文窗口 突出优势
DeepSeek V4 DeepSeek(中国) 推理与编程能力极强,成本极低,1.6T参数MoE 1M SWE-bench领先,复杂逻辑推理,开源MIT协议
DeepSeek V3.2 DeepSeek(中国) 671B参数,37B激活,DSA稀疏注意力 128K 性价比之王,开源MIT协议
DeepSeek-R1 DeepSeek(中国) 推理能力极强,成本极低 128K 推理性价比之王,开源
Qwen 3.5 (235B) 阿里(中国) 全栈AI能力,阿里云生态,原生多模态 最高1M(Plus/Flash 256K) 中文能力最强,电商/企业场景,支持1M长上下文
Qwen 3 阿里(中国) 开源,MoE架构,8款模型从0.6B到235B 262K (可扩展至1M via YaRN) 开源社区活跃,可私有化部署,多规格选择
GLM-5.2 智谱AI(中国) 百万上下文,编程Agent,MIT协议开源 1M 百万上下文开源旗舰,编程能力强,可商用
GLM-5.1 智谱AI(中国) 上下文理解,多任务处理 200K 中文理解,本土化适配
Kimi K2.6 月之暗面(中国) 超长上下文,联网搜索,Thinking模式 256K 长文理解,联网搜索,性价比高
Kimi K2.7 Code 月之暗面(中国) 编程专用,MoE架构,MIT协议开源 256K 编程能力强,开源可商用
豆包(Doubao-Seed-2.0) 字节跳动(中国) 与抖音生态深度集成,消费级应用 128K 消费级应用,亿级用户,多模态
混元 腾讯(中国) 微信/腾讯云生态,企业级安全 128K 企业级安全,社交场景,腾讯生态集成

三、开源模型

模型 开发商 核心特性 上下文窗口 突出优势
Llama 4 Scout Meta(美国) 开源,多模态,MoE架构,17B激活/109B总参数 10M 全球最大上下文窗口,开源社区,可私有化部署
Llama 4 Maverick Meta(美国) 开源,多模态,MoE架构,17B激活/400B总参数 1M 高质量开源,可私有化部署,企业级

五、许可证速查

许可证类型 可商用 代表模型
MIT协议 ✅ 完全可商用 DeepSeek V4, GLM-5.2, Kimi K2.7 Code
Apache 2.0 ✅ 完全可商用 Llama 4系列
商业授权 ❌ 需付费 GPT系列, Claude系列, Gemini系列
限制性开源 ⚠️ 需审批 部分国产模型

六、上下文窗口排行榜

排名 模型 上下文窗口
1 Llama 4 Scout 10M
2 Gemini 2.5 Pro(计划) 2M
3 GPT-5.5 / Claude Opus 4.6 / Sonnet 4.6 / DeepSeek V4 / GLM-5.2 1M
4 Gemini 2.5 Pro / Flash / Qwen 3.5旗舰版 / Llama 4 Maverick 1M
5 GPT-5.1 / Qwen 3 400K / 262K
6 Claude Sonnet 4.5 / GLM-5.1 200K
7 Kimi K2.6 / K2.7 256K
8 DeepSeek V3.2 / R1 / 豆包 / 混元 128K

数据来源:各模型官方文档、技术报告、API规格说明(2026年6月)

选择模型的核心考量因素

  • 任务类型:编程任务 Claude 系列表现优秀;推理任务 GPT-5.1 和 DeepSeek-R1 都很强;中文任务 Qwen 和 GLM 有天然优势
  • 成本预算:DeepSeek 系列的 API 价格极低(输入 0.14/百万 Token,输出 0.28/百万 Token),是预算有限时的首选;GPT-5.1 和 Claude Opus 4.6 价格最高但能力最强
  • 上下文长度:需要处理超长文档(如 20 万字的合同、代码库)时,Claude 和 Gemini 的超长上下文窗口是刚需
  • 数据隐私:需要私有化部署时,Llama 4、Qwen、DeepSeek 等开源模型是唯一选择

七、Prompt(提示词):结构、类型与工程化方法

5.1 什么是 Prompt

**Prompt(提示词)**是用户或系统提供给大语言模型的指令或文本,用于引导模型生成特定输出。它是人与 LLM 交互的"接口"------Prompt 的质量直接决定了输出结果的质量。

可以把 Prompt 理解为"给 AI 下达的任务说明书"。一份好的说明书,应该包含:任务是什么、背景信息、输出格式、风格要求、约束条件。写得越清楚,AI 完成得越好。

那么关于提示词的解析,我之前也有一篇文章有进行解析,大家可以去看看。

5.2 系统提示词 vs 用户提示词

Prompt 分为两个层次,它们的角色和生命周期完全不同:

维度 用户提示词(User Prompt) 系统提示词(System Prompt)
定义 由终端用户直接输入,触发单次任务 由开发者预设,嵌入系统后端
核心功能 传达即时需求(提问、指令) 定义模型角色、行为规范、知识边界
生命周期 单次对话 持续影响所有交互
类比 操作指令 操作系统
示例 用户输入:"查询订单 #12345" 预设:"你是一名客服,用友好语气解答问题,不知道就说不知道"

系统提示词如同"操作系统",它定义了 AI 的底层行为规则------它是什么角色、它应该用什么语气、它知道什么不知道什么、它不能做什么。用户提示词如同"操作指令",它驱动单次任务------"翻译这段文字"、"帮我写一篇文章"、"分析这个数据"。

系统提示词的典型内容

复制代码
你是一个专业的技术支持助手,为公司的 SaaS 产品提供技术支持。

行为准则:
- 回答简洁准确,先说结论再展开细节
- 当不确定时,明确说明"我不确定",绝不编造信息
- 优先引导用户查看官方文档中的相关章节
- 处理敏感信息(如账号、密码)时,主动提醒用户注意安全
- 对于需要操作数据库或服务器的请求,必须确认用户有相应权限

知识边界:
- 你了解产品的所有公开功能
- 你不了解未公开的内部 API
- 你无法访问用户的真实数据

5.3 提示词的基本结构:CO-STAR 框架

设计提示词时,可以遵循 CO-STAR 结构化框架,它确保提示词覆盖了所有关键维度 5

缩写 含义 说明 示例
C Context(背景) 提供足够的背景信息,帮助 AI 理解任务的上下文和环境 "平台:微信公众号,读者 20-35 岁,晚上 9 点发布"
O Objective(目标) 明确说明希望 AI 完成的具体目标或任务 "写一篇约 300 字的美食短文"
S Style(风格) 指定 AI 生成内容的风格 "市井烟火气,轻快爽利,口语化"
T Tone(语气) 确定 AI 生成内容的语调 "热情馋人,像朋友深夜发美食照片"
A Audience(受众) 描述目标受众的特征 "20-35 岁城市白领,晚上 9 点有点饿"
R Response(响应格式) 指定 AI 回应的格式和具体要求 "标题不超过 15 字,正文分 3 段,每段空一行"

CO-STAR 框架的实战例子

复制代码
【角色】
你是一名资深美食专栏作家,擅长用文字"让读者流口水"。

【背景】
- 平台:微信公众号,读者 20-35 岁,晚上 9 点,有点饿
- 对象:西安肉夹馍(腊汁肉夹白吉馍)
- 卖点:馍酥脆、肉软烂、肥不腻、瘦不柴

【任务】
写一篇约 300 字的美食短文,要求:
1. 开头用一句话抓住注意力
2. 分别描写"馍"和"肉",各用至少 1 个比喻
3. 结尾让读者产生"现在就想吃"的冲动
4. 自然融入"酥、脆、软、烂、香"5 个关键词

【输出格式】
- 标题:不超过 15 字
- 正文:分 3 段(开头 / 描写 / 结尾),每段空一行

【补充约束】
- 语气:热情馋人,像朋友深夜发美食照片;用"你"制造对话感,加拟声词(咔嚓、滋啦、嗯~)
- 风格:市井烟火气,轻快爽利;句子偏短,口语化(贼香、一口下去、没谁了)
- 不写制作过程,不写店铺地址
- 禁用"垂涎欲滴""回味无穷""唇齿留香"等陈词滥调
- 每段至少一个短句(不超过 10 字)

这个例子展示了 CO-STAR 框架的完整应用:角色定位(美食专栏作家)、背景信息(平台、读者、对象)、任务目标(300 字美食短文)、输出格式(标题 + 3 段正文)、风格约束(热情、口语化、禁用陈词滥调)。每个维度都为 AI 的生成提供了明确的指引,减少了模糊和不确定性。

5.4 什么是提示词工程(Prompt Engineering)

**Prompt Engineering(提示词工程)**是指通过设计和优化输入给大语言模型的提示词,来引导模型生成更准确、更稳定、更符合预期结果的一种工程方法。

它不是"写一句好话"这么简单,而是一套系统的方法论,包括:

  • 任务分析:理解 AI 需要完成什么任务,确定关键约束条件和成功标准
  • 结构设计:选择合适的提示词框架(如 CO-STAR),组织信息层次
  • 迭代优化:根据输出结果不断调整提示词,逐步逼近最佳效果
  • 测试验证:用不同的输入测试提示词的稳定性,确保在各种情况下都能得到预期结果
  • 版本管理:将提示词作为"代码"来管理,记录修改历史,进行 A/B 测试

一个真实的 Prompt Engineering 工作流程:

复制代码
第 1 版:简单指令
"帮我写一篇关于人工智能的文章"
→ AI 输出:一篇泛泛而谈的 AI 科普文,没有针对性

第 2 版:添加角色和约束
"你是一名技术博主,写一篇 2000 字关于人工智能的技术文章,面向有编程基础的读者"
→ AI 输出:有深度了,但结构松散,没有重点

第 3 版:使用 CO-STAR 框架
"【角色】技术博主 【背景】面向有 2 年编程经验的开发者 【任务】写一篇 2000 字文章,聚焦 AI 在代码生成领域的应用 【输出格式】包含 3 个实战案例,每个案例有代码示例"
→ AI 输出:结构清晰,有针对性,但案例不够深入

第 4 版:添加示例和约束
"【角色】技术博主... 【示例】案例应该包含:问题描述、AI 如何解决、代码对比(手动写 vs AI 生成)、效果对比 【约束】不要泛泛而谈,每个案例必须具体到工具名称和实际使用场景"
→ AI 输出:达到了预期效果

八、提示词设计技巧:从基础到进阶

6.1 基础技巧

技巧一:角色提示(Role Prompting)

通过设定身份来约束模型的语气、专业深度和思维方式。角色提示是 Prompt Engineering 中最基础也最有效的技巧之一。

复制代码
你是一位资深的 Python 架构师,拥有 15 年后端开发经验。请用专业但易懂的语言回答以下问题。

你是一位善解人意的心理咨询师,擅长倾听和引导。请用温和、不评判的语气回应以下倾诉。

角色的设定会显著影响 AI 的输出风格和内容质量。一个"Python 架构师"会给出更专业、更深入、更结构化的回答;一个"心理咨询师"会给出更温和、更开放、更有同理心的回应。

技巧二:结构化指令引导

通过特定分隔符、列表和 Markdown 格式来清晰地界定指令的不同部分,防止模型混淆。

常用的分隔符:

  • """''' --- 包裹长文本(如"翻译以下内容:"""...""")

  • 【】[] --- 标注不同部分(如"【背景】... 【任务】... 【约束】...")

  • XML 标签 --- 精确标注不同内容块(如 <context>...</context><task>...</task>

  • Markdown 标题 --- 用 ### 组织层次结构

    【背景】
    以下是一段技术文档的摘录。

    【任务】
    将这段文档翻译成中文,保持技术术语的准确性。

    【约束】

    • 不要添加原文中没有的信息
    • 技术术语保留英文并在括号中标中文
    • 保持原文的段落结构

    【原文】
    """
    The Transformer architecture uses self-attention mechanisms to process
    all tokens in parallel, eliminating the sequential bottleneck of RNNs.
    """

技巧三:少样本提示(Few-Shot Prompting)

提供 1-3 个正确的输入输出示例,让模型快速学习格式和规则。模型在看到示例后,会自动"理解"你期望的模式。

复制代码
将以下产品名称转换为对应的英文缩写。格式:产品名称 → 缩写

机器学习 → ML
人工智能 → AI
自然语言处理 → NLP
深度学习 →

模型在看到前三个示例后,会理解"提取首字母大写"的规则,输出"DL"。

少样本提示的关键在于:示例的质量比数量重要。一个好的示例胜过三个普通示例------它应该精确地展示你期望的格式、风格和内容深度。

6.2 进阶推理技巧

技巧四:链式思考(Chain-of-Thought,CoT)

让模型分步推理,先思考再输出答案,大幅提升复杂问题的准确率。CoT 的核心思想是:不直接要答案,而是要求展示推理过程 6

复制代码
请一步步推理以下问题,展示你的完整思考过程,最后得出结论:

一件衣服原价是 200 元,先打 8 折,再减去满 100 减 20 的优惠券,
最后还要加上 5% 的税费。小李用这张优惠券买这件衣服,实际支付多少钱?

让我们一步步思考:

模型会这样推理:

复制代码
步骤 1:计算打折后的价格
200 × 0.8 = 160 元

步骤 2:检查是否满足优惠券条件
160 元 ≥ 100 元,满足满 100 减 20 的条件
160 - 20 = 140 元

步骤 3:计算税费
140 × 1.05 = 147 元

结论:小李实际支付 147 元。

如果没有 CoT 提示,模型可能直接输出一个错误的答案(比如漏掉税费或优惠券条件判断错误)。CoT 让模型"慢下来",把推理过程外显化,每个步骤都可以被验证,从而大幅提高准确率。

CoT 适用场景

  • 数学计算题
  • 多步骤逻辑推理
  • 代码调试("请逐步分析这段代码的执行流程")
  • 决策分析("请分析这个方案的优缺点,然后给出建议")

CoT 不适用场景

  • 简单的知识问答("法国的首都是哪里?"------不需要推理)
  • 创意写作("写一首诗"------不需要分步推理)
  • 格式转换("把这段文字翻译成英文"------不需要推理)

技巧五:自我一致性(Self-Consistency)

传统 CoT 只走一条推理路径;自我一致性则探索多条路径,最终聚合为一致答案。它不再依赖"一次思考定生死",而是通过"多次尝试 + 投票机制"来提高准确率 7

复制代码
请从不同角度独立思考以下问题三次,每次采用不同的表达方式或拆解顺序,
展示完整推理过程。然后比较三个答案,选择最合理且一致的结果作为最终输出。

问题:
小明有 60 张游戏卡牌,他每天卖出 5 张。第 3 天结束后,他休息了 2 天没卖,
之后继续每天卖 5 张。问他一共用了多少天才卖完?

要求:
1. 每次推理必须独立,不能复制前面的内容
2. 最终输出格式为:

→ 第一次推理:...
→ 第二次推理:...
→ 第三次推理:...
→ 综合判断与最终答案:...

模型会进行三次独立推理:

复制代码
→ 第一次推理(按天数计算):
前 3 天卖出 15 张,剩余 45 张
第 4-5 天休息,未卖出
第 6 天起继续卖,每天 5 张
45 ÷ 5 = 9 天
经历天数:3(卖)+ 2(休)+ 9(卖)= 14 天

→ 第二次推理(按卖出的天数计算):
总共需要卖 60 ÷ 5 = 12 天
前 3 天卖出,中间休息 2 天,剩余 9 天卖出
实际经历:3 + 2 + 9 = 14 天

→ 第三次推理(按日期排列):
第 1 天:卖 5,剩 55
第 2 天:卖 5,剩 50
第 3 天:卖 5,剩 45
第 4 天:休息
第 5 天:休息
第 6 天:卖 5,剩 40
...
第 14 天:卖 5,剩 0
总共 14 天

→ 综合判断与最终答案:14 天(三次推理结果一致)

自我一致性的核心价值在于:降低单次推理的随机误差。LLM 的推理过程有一定随机性------同一个问题问两次,可能得到不同的推理路径。自我一致性通过多次独立推理然后投票,降低了这种随机性带来的错误风险。

6.3 优化与迭代策略

技巧六:由浅入深(Iterative Refinement)

不要指望一次写出完美的 Prompt。先从简单的指令开始,观察输出,再根据不足逐步添加约束条件和背景。这是一个"测试 → 调整 → 再测试"的循环过程。

复制代码
迭代 1(基础指令):
"帮我写一个 Python 函数,实现快速排序"

→ 问题:输出缺少注释,没有类型提示,没有测试用例

迭代 2(添加约束):
"帮我写一个 Python 函数实现快速排序,请包含:
- 类型提示(Type Hints)
- 详细的 docstring
- 关键步骤的注释"

→ 问题:输出格式不够规范,缺少边界条件处理

迭代 3(添加格式要求):
"帮我写一个 Python 函数实现快速排序,请包含:
- 类型提示(Type Hints)
- Google 风格的 docstring
- 关键步骤的注释
- 处理空数组、单元素数组、大量重复元素的边界情况
- 在 docstring 中包含 3 个测试用例的示例
- 使用 TypeVar 实现泛型版本"

→ 输出达到了预期质量

迭代的关键原则

  • 每次只改一个维度,观察效果后再改下一个
  • 如果某个修改没有改善输出,回退到上一个版本
  • 把 Prompt 当作代码来管理------用 Git 记录每次修改
  • 测试 Prompt 的稳定性------用 5 个不同的输入测试,确保输出质量一致

九、生成参数详解:Temperature、Top-P、Top-K 与采样策略

9.1 为什么需要了解生成参数

很多人使用大语言模型时,只关注 Prompt 怎么写,却忽略了生成参数对输出质量的巨大影响。同样的 Prompt,不同的参数配置,可能产生截然不同的结果------一个严谨准确,一个天马行空。

生成参数控制的是模型"如何选择下一个词"。理解这些参数,能让你在"创造力"和"准确性"之间精准拿捏。比如写诗时需要高温度(大胆想象),写代码时需要低温度(严谨准确)。19

9.2 Temperature(温度):控制"创造力"的旋钮

Temperature 是最常用的生成参数,它控制模型输出的"随机性"和"创造性"。

在模型生成每个词时,它实际上是在计算"下一个词的概率分布"------比如在"我今天吃了"之后,模型会计算出"饭"的概率是 0.4,"面"是 0.3,"苹果"是 0.1......Temperature 的作用就是调整这个概率分布的"陡峭度":

  • Temperature = 0:模型总是选择概率最高的词(贪婪策略)。输出完全确定,同样的输入永远得到同样的输出。适合需要精确、一致结果的场景
  • Temperature < 0.5:概率分布变得更陡峭,高概率词的概率更高,低概率词的概率更低。输出比较保守、稳定、可预测。适合代码生成、事实性问答、翻译
  • Temperature = 1.0:保持原始概率分布,不做任何调整。这是大多数模型的默认值
  • Temperature > 1.0:概率分布变得更平坦,低概率词的概率被提高,高概率词的概率被降低。输出更多样、更有创意、但也更容易跑偏。适合创意写作、头脑风暴、诗歌生成

直观理解:把 Temperature 想象成"酒精度"------0 度时人完全清醒,说话严谨准确;1 度时微醺,说话更有趣但也有点飘;2 度时醉了,可能说出天马行空的话,但也可能前言不搭后语。

Temperature 的实战建议

Temperature 适用场景 效果
0 ~ 0.2 代码生成、数学计算、事实提取 输出精确、稳定、可复现
0.3 ~ 0.5 技术文档、翻译、数据分析 输出准确、偶尔有合理的变化
0.6 ~ 0.8 通用对话、内容写作、邮件 平衡准确性和流畅性
0.9 ~ 1.2 创意写作、广告文案、头脑风暴 输出多样、有创意、但可能不够严谨
1.3 ~ 1.5 诗歌、故事、艺术创作 输出极富想象力,但可能偏离主题

9.3 Top-P(核采样):动态截断概率尾部

Top-P (也叫 Nucleus Sampling,核采样)是另一种控制输出多样性的方法。它的核心思想是:只从累积概率达到 P 的最小词集合中采样,砍掉概率太低的"长尾"词

举个例子:模型计算出下一个词的概率分布是:

  • "饭":40%
  • "面":25%
  • "苹果":15%
  • "火锅":8%
  • "零食":5%
  • "药":3%
  • "石头":2%
  • "电脑":1%
  • "宇宙":0.5%
  • "量子":0.5%

如果 Top-P = 0.9,模型会从累积概率达到 90% 的词中采样------也就是"饭"(40%)+ "面"(25%)+ "苹果"(15%)+ "火锅"(8%)= 88%,再加"零食"(5%)= 93%。所以候选词集是"饭、面、苹果、火锅、零食"这 5 个词。剩下的"药、石头、电脑、宇宙、量子"被直接排除------它们的概率太低,不太可能是有意义的选择。

Top-P 与 Temperature 的区别

  • Temperature 是"缩放"概率分布(改变所有词的概率比例)
  • Top-P 是"截断"概率分布(直接排除概率太低的词)
  • 两者可以同时使用------先用 Temperature 调整分布,再用 Top-P 截断尾部

Top-P 的实战建议 19

Top-P 值 效果 适用场景
0.1 ~ 0.5 极度保守,只选最可能的词 需要严格准确性的场景
0.7 ~ 0.9 平衡准确性和多样性(推荐默认值) 通用对话、内容写作
0.9 ~ 0.95 允许更多样的选择 创意写作、头脑风暴
1.0 不做任何截断(等同于禁用 Top-P) 需要最大多样性的场景

9.4 Top-K:固定候选词数量

Top-K 是最简单粗暴的截断策略:只从概率最高的 K 个词中采样,其余全部排除

  • Top-K = 1:等价于 Temperature = 0(贪婪策略),只选概率最高的那个词
  • Top-K = 40:只从概率最高的 40 个词中选(多数模型的默认值)
  • Top-K = 0:禁用 Top-K(不限制候选词数量)

Top-K 的问题:它不够灵活。如果概率分布很集中(比如概率最高的 3 个词就占了 95%),Top-K=40 会把很多概率极低的词也纳入候选------这些词几乎不可能是好的选择,但它们的加入会引入噪声。如果概率分布很分散(比如 100 个词平分概率),Top-K=40 又可能排除掉一些合理的候选词。

这就是为什么 Top-P 通常比 Top-K 更受欢迎------Top-P 会根据实际概率分布动态调整候选词数量,而不是机械地固定为 K 个。

9.5 其他重要参数

Repetition Penalty(重复惩罚):降低已经被生成过的词的概率,防止模型陷入重复循环。值通常在 1.0-1.3 之间。1.0 表示不惩罚,1.2 表示适度惩罚(降低已出现词 20% 的概率)。值太高会导致模型刻意回避已出现的词,输出不自然。

Frequency Penalty(频率惩罚):根据词在已生成文本中出现的次数来惩罚------出现次数越多,惩罚越重。这与 Repetition Penalty 不同:Repetition Penalty 是"出现过就惩罚",Frequency Penalty 是"出现越多惩罚越重"。

Presence Penalty(存在惩罚):类似 Frequency Penalty,但惩罚力度与出现次数无关------只要出现过就惩罚,不管出现几次。这鼓励模型引入新话题和词汇。

Min-P:2024 年提出的新参数,作为 Top-P 的补充。它设置一个"最小概率门槛"------只有概率超过最大概率 × Min-P 的词才能被采样。比如 Min-P = 0.1,如果最大概率是 0.4,那么只有概率 ≥ 0.04 的词才能被采样。这有效地排除了"虽然属于 Top-P 集合但概率极低"的词。

9.6 参数组合实战指南

场景一:写代码

复制代码
Temperature: 0.1
Top-P: 0.9
Repetition Penalty: 1.0(不惩罚)

→ 代码需要精确,一点都不能错。低温度确保每次输出都是最"正确"的选择。

场景二:通用对话

复制代码
Temperature: 0.7
Top-P: 0.9
Repetition Penalty: 1.05

→ 平衡准确性和流畅性,轻微防止重复。

场景三:创意写作

复制代码
Temperature: 1.0
Top-P: 0.95
Repetition Penalty: 1.1
Frequency Penalty: 0.1

→ 高温度 + 高 Top-P 让输出充满想象力,适度的惩罚防止用词单调。

场景四:事实性问答

复制代码
Temperature: 0.0
Top-P: 1.0(禁用)
Repetition Penalty: 1.0

→ 零温度 + 无截断,选择最可能的词,确保输出稳定可复现。

场景五:头脑风暴

复制代码
Temperature: 1.2
Top-P: 0.95
Frequency Penalty: 0.3
Presence Penalty: 0.2

→ 高温度 + 宽松截断 + 强惩罚,鼓励模型不断引入新话题和词汇。


十、Token(词元):计费单位、上下文窗口与模型理解能力的基石

10.1 什么是 Token

Token(词元)是大语言模型处理文本时的最小语义单位。它不是字,也不是单词,而是将文本拆解为模型可理解的离散单元 8

Token 通过分词器(Tokenizer)将文本拆分而来。不同模型的分词器不同,同一个词在不同模型中可能被拆分成不同的 Token。比如:

文本 GPT-4 分词器 Claude 分词器
"人工智能" 2 个 Token("人工" + "智能") 1 个 Token("人工智能")
"unbelievable" 3 个 Token("un" + "believe" + "able") 2 个 Token("unbelieve" + "able")
"Hello World" 2 个 Token("Hello" + " World") 2 个 Token("Hello" + " World")

Token 的计算规则(以英文为例,粗略估计):

  • 1 个英文单词 ≈ 1-1.5 个 Token
  • 1 个中文字 ≈ 1.5-2 个 Token(中文的 Token 效率比英文低)
  • 1 个标点符号 ≈ 1 个 Token
  • 代码的 Token 效率通常比自然语言高(因为代码中的关键词和符号更短)

10.2 Token 的三大作用

作用一:计费单位

几乎所有商用大模型都按 Token 收费------输入 Token + 输出 Token,每百万 Token 一个价格。不同模型的价格差异巨大:

模型 输入价格(每百万 Token) 输出价格(每百万 Token)
GPT-5.1 $2.50 $10.00
GPT-4o $2.50 $10.00
Claude Opus 4.6 $15.00 $75.00
Claude Sonnet 4.5 $3.00 $15.00
DeepSeek-V3 $0.14(约 ¥1) $0.28(约 ¥2)
DeepSeek-R1 $0.55 $2.19
Qwen 3.5 $0.50 $2.00

这就是为什么 DeepSeek 引发了"价格屠夫"的讨论------它的 API 价格比 GPT-4o 低 18 倍,比 Claude Opus 低 100 倍以上。对于日均 Token 消耗量大的场景(如客服系统、内容生成平台),模型选择直接决定了运营成本。

Token 消耗的隐性成本 :很多人只关注输出 Token 的费用,忽略了输入 Token。实际上,每次对话都需要把整个对话历史 + 系统提示词作为输入发送给模型。如果对话已经进行了 20 轮,每轮的输入都包含前面所有的对话内容,输入 Token 的数量会随着对话轮次线性增长,最终可能远超输出 Token。

作用二:上下文长度限制

模型有最大上下文窗口(如 8K、32K、128K、256K、1M Token),超过上限模型就无法处理,会截断或报错。

上下文窗口大小决定了模型一次能"看到"多少内容。不同场景对上下文窗口的需求:

场景 典型 Token 需求
简单问答 1K-4K
文章生成 4K-16K
代码审查(单个文件) 8K-32K
长文档分析(合同、论文) 32K-128K
代码库级别分析 128K-256K
整本书级别的分析 256K-1M

作用三:决定模型理解能力

Token 切分越合理,模型越能理解语义。分词器的质量直接影响模型的语言理解能力------如果分词器把一个完整的语义单元(如"人工智能")拆成了两个无关的片段("人"+"工"+"智"+"能"),模型就需要花费额外的"注意力"来理解这些片段之间的关系。

10.3 Token 的两种分类

输入 Token(Prompt Token / Input Token):发给模型的内容,包括:

  • 用户的问题
  • 历史对话记录(之前的问答)
  • 上传的文档、图片、代码
  • 系统提示词

输出 Token(Completion Token / Output Token):模型生成的回答。

Token 消耗的典型分布

复制代码
一次对话的总 Token 消耗 = 输入 Token + 输出 Token

假设一个 20 轮对话:
- 系统提示词:500 Token(每轮都包含)
- 每轮用户输入:约 200 Token
- 每轮 AI 输出:约 500 Token
- 第 20 轮的输入包含:系统提示词 + 前 19 轮的全部内容

第 20 轮的输入 Token ≈ 500 + (200+500) × 20 = 14,500 Token
第 20 轮的输出 Token ≈ 500 Token
第 20 轮总消耗 = 15,000 Token

整个对话的总 Token 消耗 ≈ 150,000 Token(实际可能更多)

这就是为什么长对话的 API 费用比预期高------每次对话都在"重复发送"之前的内容。


十一、会话记忆(Chat Memory):让对话保持连贯的核心机制

11.1 什么是会话记忆

在对话系统中,会话记忆(Chat Memory)指的是模型对历史对话内容的存储与利用机制。它让 AI 能够"记住"之前说过什么,从而在后续对话中做出连贯的回应 9

会话记忆包括:

  • 用户之前说过的话:你的偏好、你的需求、你提到过的人名地名
  • 模型之前的回答:AI 说过什么、给出了什么建议
  • 当前对话的上下文状态:对话进行到哪一步了、当前在讨论什么话题

没有会话记忆的对话

复制代码
用户:我在做一个 Spring AI 项目
AI:好的,Spring AI 是一个不错的框架

用户:怎么接入大模型?
AI:请问您使用的是什么框架?需要我帮您推荐吗?

有会话记忆的对话

复制代码
用户:我在做一个 Spring AI 项目
AI:好的,Spring AI 是一个不错的框架

用户:怎么接入大模型?
AI:在 Spring AI 中接入大模型,你需要在 pom.xml 中添加 spring-ai-openai-spring-boot-starter 依赖,
然后在 application.yml 中配置 API Key...(基于之前的上下文,AI 知道你在用 Spring AI)

第二句虽然没提"Spring AI",但 AI 能理解你是在延续上文------这就是会话记忆在起作用。

11.2 会话记忆的作用

上下文连贯:能理解"它"、"这个"、"那个"等指代,让对话流畅不脱节。没有会话记忆,每次对话都像"第一次见面",所有指代都会丢失。

减少重复输入:无需每次重复背景信息,交互更高效。没有会话记忆,每次开始新的话题都需要重新说一遍"我在做一个 Java 项目,用 Spring Boot 框架,数据库是 MySQL..."

个性化体验:记住用户偏好、历史偏好,提供定制回复。比如记住"你上次说喜欢用 Python",下次推荐代码时优先给 Python 版本。

多轮任务完成:逐步收集信息,支持复杂任务。比如"帮我写一个用户注册接口"→"加上邮箱验证"→"再加一个手机号验证"→"最后加上密码强度检查",每一步都在前一步的基础上迭代。

11.3 会话记忆的实现方式

LLM 的会话记忆不是"独立的记忆系统",而是通过将历史对话内容作为上下文的一部分发送给模型来实现的。每次对话时,模型会收到:

复制代码
系统提示词
+
历史对话记录(用户问题 1 + AI 回答 1 + 用户问题 2 + AI 回答 2 + ...)
+
当前用户问题

模型的"记忆"本质上就是这些历史对话文本。模型看到的不是"记忆数据库",而是"对话历史文本"。这就是为什么会话记忆受上下文窗口限制------超过窗口上限的历史对话会被截断或遗忘。


十二、上下文窗口(Context Window):从"背包容量"理解模型记忆边界

12.1 上下文窗口的概念

**上下文窗口(Context Window)**是大语言模型一次最多能处理的输入 Token 数量 10

这个限制是硬性的------不是"建议不要超过",而是"超过就无法处理"。如果把 LLM 比作一个人,上下文窗口就是它的"工作记忆容量"------一次只能记住这么多内容,超过的部分会丢失。

12.2 上下文窗口与会话记忆的关系

这两个概念经常被混淆,但它们的关系可以用一个直观的比喻来理解:

上下文窗口 = 背包容量

当前输入 + 会话记忆 + 系统提示词 = 你要装进去的东西

如果东西太多(超过背包容量),就不能全部装进去。你只能选择:

  • 丢掉一些东西(截断历史对话)
  • 压缩东西(用摘要代替完整对话)
  • 换一个更大的背包(使用上下文窗口更大的模型)

实际情况

复制代码
假设上下文窗口 = 128K Token

系统提示词:2K Token
用户当前输入:1K Token
剩余可用空间:128K - 2K - 1K = 125K Token

这些 125K Token 可以装:
- 约 25 万英文字符(1 Token ≈ 4 英文字符)
- 约 62,500 个中文字(1 Token ≈ 2 个中文字符)
- 约 200 页 A4 文档
- 或约 150 轮之前的对话历史

当对话历史超过 150 轮时,最早的对话会被"遗忘"。

12.3 上下文窗口的演进

上下文窗口的大小在过去两年中经历了爆炸式增长:

时间 模型 上下文窗口
2022 年 GPT-3.5 4K Token
2023 年 GPT-4 8K-32K Token
2023 年 Claude 2 100K Token
2024 年 GPT-4 Turbo 128K Token
2024 年 Claude 3 200K Token
2024 年 Gemini 1.5 Pro 1M Token
2025 年 Claude Opus 4 262K Token
2025 年 Gemini 2.5 Pro 1M Token
2026 年 GPT-5.1 256K Token
2026 年 Claude Opus 4.6 1M Token(Beta)
2026 年 Gemini 3.1 Pro 1M Token

1M Token 意味着什么?它可以一次性处理:

  • 约 150 万英文字符
  • 约 50 万个中文字
  • 一整部《三体》三部曲
  • 或一个中等规模代码库的全部源代码

12.4 上下文窗口的"天花板效应"

上下文窗口越大越好吗?不完全是。有两个实际问题需要考虑:

注意力稀释:当上下文窗口非常大时,模型对中间和后半部分内容的"注意力"会下降。研究表明,LLM 对上下文开头和结尾的内容关注度最高,对中间部分关注度较低。这被称为"Lost in the Middle"(迷失在中间)现象。

成本暴增:每次对话都要把整个上下文窗口的内容发送给模型。即使你的问题只有 100 个 Token,如果上下文窗口中有 100K 的文档,你仍然需要为这 100K 的输入 Token 付费。大上下文窗口的"隐形成本"是 API 费用的显著增加。

实用建议:不要因为模型支持 1M Token 就把整本书丢进去。更高效的做法是:先用 RAG 检索出相关片段,再把片段放入上下文窗口。这样既保证了准确性,又控制了成本。


十三、多模态(Multimodal):文本、图像、音频、视频的融合智能

13.1 什么是多模态

**多模态(Multimodal)**是指融合文本、图像、音频、视频等多种类型信息,让模型能理解、生成不同模态数据的技术 1112

单模态 vs 多模态

  • 单模态模型只能处理一种数据类型。比如纯文本模型只能理解和生成文字,你给它一张图片它完全不知道该怎么处理
  • 多模态模型能同时处理多种数据类型。比如 GPT-4o 能理解图片中的文字和物体,能识别语音中的情绪,还能生成图片

从单模态到多模态的转变,本质上是让 AI 的感知能力从"只能读文字"扩展到"像人一样综合感知"------人不会只用眼睛看,也不会只用耳朵听,而是多种感官协同工作,形成对世界的完整理解。

13.2 常见的模态类型

模态 输入能力 输出能力 示例
文本(Text) 理解自然语言 生成自然语言 问答、翻译、写作
图像(Image) 识别物体、场景、文字 生成图片、编辑图片 文生图、图生文、图片编辑
音频(Audio) 语音识别、音乐理解 语音合成、音乐生成 语音助手、音乐创作
视频(Video) 场景理解、行为识别 视频生成、视频编辑 Sora、可灵、即梦

13.3 多模态的典型应用场景

智能问答 ------ 上传图片 + 提问

复制代码
场景:医疗影像分析
用户上传一张 X 光片,提问:"这张 X 光片中有异常吗?"
AI 分析图片中的骨骼结构,识别可能的骨折或病变,给出初步判断和建议

文生图 ------ 文本描述 → 图片

复制代码
场景:AI 绘画
用户输入:"一只穿着宇航服的柴犬,站在月球表面,背景是蓝色的地球"
AI 生成对应的图片

代表工具:DALL-E 3、Midjourney、Stable Diffusion、Seedream(字节跳动)

图生文 ------ 图片 → 文字描述

复制代码
场景:商品描述生成
用户上传一张商品图片
AI 自动生成商品标题、描述、卖点

语音助手 ------ 语音 → 文本 → LLM → 语音

复制代码
场景:智能客服
用户:"我要查询我的订单状态"
AI 先做语音识别(ASR):"我要查询我的订单状态"(文字)
→ 交给 LLM 理解意图并查询订单
→ 生成回复文字:"您的订单已发货,预计明天到达"
→ 语音合成(TTS):用户听到 AI 的语音回复

视频理解 ------ 视频摘要、行为识别

复制代码
场景:安防监控
监控摄像头实时分析视频流
AI 识别异常行为(如"有人闯入禁区"),自动告警

视频生成 ------ 文字描述 → 视频

复制代码
场景:创意内容制作
用户输入:"一只猫在月球上弹钢琴,背景是星空"
AI 生成对应的短视频

代表工具:Sora(OpenAI)、可灵(快手)、即梦(字节跳动)

13.4 多模态的技术核心

多模态模型的核心挑战是模态对齐------如何让模型理解"这段文字"和"这张图片"描述的是同一个东西。

技术实现上,有两种主要路径:

路径一:统一编码。将文本、图像、音频等不同模态的数据统一编码到同一个向量空间中。在这个空间中,语义相近的内容(无论是什么模态)向量距离也相近。比如"猫"这个词的文本向量,和一张猫的图片向量,在向量空间中应该非常接近。

路径二:跨模态注意力。使用 Transformer 的注意力机制,让模型在处理一种模态时,能同时"关注"到另一种模态的信息。比如在生成图片描述时,模型的注意力可以在图片的不同区域和已生成的文字之间自由切换。

当前最先进的多模态模型(如 GPT-5.1、Gemini 2.5 Pro)同时使用了这两种技术,实现了原生多模态理解和生成。


十四、RAG(检索增强生成):给 AI 装上"外挂大脑"

14.1 什么是 RAG

**RAG(Retrieval Augmented Generation,检索增强生成)**是一种结合外部知识库检索与大模型生成的技术。核心是让大模型在回答前先"查资料"(检索外部知识库),再基于检索到的权威信息生成答案 1314

RAG 就像给 AI 装上了"外挂大脑":让它在回答问题时,先从外部知识库中检索相关片段,再将这些片段作为上下文,输入给模型。这样,AI 的回答就基于真实、最新数据,大幅减少"幻觉"(编造答案),同时支持动态知识更新。

14.2 一个直观的类比:开卷考试 vs 闭卷考试

  • 传统 LLM:就像闭卷考试------你只能靠死记硬背(训练数据),可能把"秦始皇统一六国"错记成"秦始皇统一七国"
  • RAG:就像开卷考试------给你发了一本历史书(RAG 的知识库),你先快速翻书找到"秦朝"章节(检索),再根据书里的内容组织答案(生成),确保答案是真实的

RAG 让 AI 从"背书机器"升级为"会查资料的专家",适合需要高准确性的场景(如医疗咨询、法律问答、企业知识库)。

14.3 RAG 解决的核心问题

问题一:知识过时

大模型训练数据是"历史的"------GPT-4 的训练数据截止到 2024 年某个时间点,之后发生的事它一概不知。而 RAG 可以接入最新文档、实时数据、内部知识库,实现"动态知识"。

复制代码
传统 LLM:
问:"2026 年诺贝尔物理学奖获得者是谁?"
答:"我无法回答,我的训练数据截止到 2024 年..."(或编造一个答案)

RAG 增强的 LLM:
问:"2026 年诺贝尔物理学奖获得者是谁?"
→ 检索 → 从最新新闻中找到答案
答:"2026 年诺贝尔物理学奖授予了..."

问题二:幻觉(Hallucination)

模型容易"编答案"------当它不知道答案时,它会生成一个看起来合理但实际上是错误的回答。RAG 基于真实文档,为回答提供依据,大幅降低幻觉。

问题三:私有知识

模型默认不知道公司内部数据、私有文档、业务规则。RAG 可以接入企业知识库、本地文件,实现"企业专属 AI"。

复制代码
场景:客服 AI
传统 LLM:不知道你们公司的退货政策
RAG 增强的 LLM:检索公司内部的退货政策文档,基于文档内容回答

问题四:上下文窗口限制

模型不能一次读太多内容。RAG 只检索"相关片段"而不是全部数据,节省 Token。

复制代码
场景:分析 1000 页的公司手册
传统 LLM:无法一次性放入上下文窗口(超过 128K Token 限制)
RAG 增强的 LLM:检索与用户问题相关的 3-5 个片段,只放入这几个片段

问题五:可解释性

传统模型回答是"黑盒"------你不知道它为什么这么回答。RAG 可以返回"引用来源",支持溯源。

复制代码
RAG 增强的回答:
"根据《2026 年公司员工手册》第 3 章第 2 节,年假的计算方式为...
(来源:员工手册 v2026.1, 第 15 页)"

14.4 RAG 的工作流程

RAG 的完整工作流程分为两个阶段:离线索引阶段在线查询阶段

离线索引阶段(准备知识库)

  1. 文档加载:从各种来源加载文档------PDF、网页、数据库、API 返回数据
  2. 文档分割:将长文档分割成适当大小的"块"(Chunk)。每个 Chunk 通常为 500-1000 个 Token
  3. 向量化:使用嵌入模型(Embedding Model)将每个 Chunk 转换为向量(一串数字)。语义相近的文本,向量距离也相近
  4. 存储:将向量存储到向量数据库(Vector Database)中,如 Pinecone、Weaviate、Milvus、Chroma

在线查询阶段(用户提问时)

  1. 用户提问:用户提出一个问题
  2. 查询向量化:将用户的问题也转换为向量
  3. 相似度检索:在向量数据库中搜索与问题向量最相似的 Chunk(通常返回 Top 3-5 个)
  4. 构建提示词:将检索到的 Chunk 作为上下文,与用户的问题整合到一个 Prompt 中
  5. LLM 生成:将整合后的 Prompt 发送给 LLM,LLM 基于提供的上下文生成答案
  6. 返回结果:返回答案(可选地附带引用来源)

RAG 的提示词模板

复制代码
你是一个专业的问答助手。请基于以下提供的参考信息回答用户的问题。
如果参考信息中没有相关内容,请明确说明"根据现有资料,我无法回答这个问题"。

【参考信息】
{检索到的 Chunk 1}
{检索到的 Chunk 2}
{检索到的 Chunk 3}

【用户问题】
{用户的问题}

【回答要求】
- 基于参考信息回答,不要编造
- 如果参考信息中有引用来源,请在回答中标注
- 如果参考信息中没有答案,明确说明

14.5 RAG 的进阶形态

基础的 RAG 已经非常强大,但 2025-2026 年出现了几种进阶形态:

Graph RAG(图谱 RAG):不只是在向量数据库中搜索相似片段,而是构建知识图谱------将文档中的实体(人物、组织、地点、概念)和它们之间的关系提取出来,形成图结构。查询时,AI 可以在知识图谱中导航,找到间接关联的信息。这对于需要理解"关系"和"层次"的复杂查询尤其有效。

Agentic RAG(智能体 RAG):将 RAG 与 Agent 机制结合。Agent 不只是"检索一次 → 生成答案",而是可以"检索 → 分析 → 发现信息不足 → 再次检索 → 再分析 → 生成答案"。这种多轮迭代的检索方式,类似于人类在查资料时"看了第一篇文章 → 发现还有疑问 → 继续查第二篇文章"的过程。

多模态 RAG:不只是检索文本,还能检索图片、表格、视频。比如用户问"这个产品的设计图在哪里",RAG 可以在知识库中检索相关的图片并返回给用户。


十五、Embedding 与向量数据库:AI 理解语义的"数字密码"

15.1 什么是 Embedding(嵌入)

**Embedding(嵌入)**是将文本、图像、音频等非结构化数据转换为固定长度的数值向量(一串数字)的技术。这个向量"编码"了原始数据的语义信息------语义相近的内容,向量在数学空间中的距离也相近 20

举个例子:

  • "猫"的 Embedding 向量可能是:0.23, -0.45, 0.78, 0.12, ...(假设 768 维)
  • "狗"的 Embedding 向量可能是:0.21, -0.43, 0.75, 0.15, ...(和"猫"很接近!)
  • "电脑"的 Embedding 向量可能是:-0.67, 0.89, -0.12, 0.34, ...(和"猫"完全不同)

"猫"和"狗"的向量距离很近(因为它们都是宠物、动物、四条腿),而"猫"和"电脑"的向量距离很远。这就是 Embedding 的核心价值------把语义的相似性转化为数学上的距离

15.2 Embedding 模型的工作原理

Embedding 模型本质上是一个"压缩编码器"------输入一段文本,输出一个固定长度的向量。这个向量"压缩"了文本的核心语义特征。

训练 Embedding 模型的核心思想是:让语义相近的文本产生相近的向量,语义不同的文本产生距离远的向量。这通常通过对比学习(Contrastive Learning)来实现------模型在训练时看到"正例对"(语义相近的文本对,如"猫"和"小猫咪")和"负例对"(语义不同的文本对,如"猫"和"汽车"),学习将正例的向量拉近、负例的向量推远。

15.3 主流 Embedding 模型对比(2026 年)

以下是当前主流的 Embedding 模型 20

模型 开发商 维度 突出特点 适用场景
Gemini Embedding 2 Google 768 / 3072 综合性能最强,多语言支持优秀 通用 RAG、多语言搜索
text-embedding-3-large OpenAI 256-3072(可调) 支持维度压缩,灵活性强 通用 RAG、API 集成
Qwen3-VL-2B 阿里 1536 开源,多模态(支持图文混合) 中文 RAG、多模态检索
BGE-M3 BAAI(智源) 1024 开源,支持多语言和稠密+稀疏混合检索 中文 RAG、混合检索
Cohere Embed v4 Cohere 1024 专为 RAG 优化,压缩率高 企业级 RAG
Jina Embeddings v3 Jina AI 1024 支持 89 种语言,任务特定嵌入 多语言 RAG、长文档

选择 Embedding 模型的关键考量

  • 语言:中文场景优先选 BGE-M3、Qwen3-VL;多语言场景选 Gemini Embedding 2、Jina
  • 维度:维度越高,表示的语义信息越多,但存储和检索的成本也越高
  • 开源 vs 闭源:开源模型可以本地部署,数据不出域,适合对隐私有要求的场景
  • 多模态:如果知识库中混合了文本和图片,需要选支持多模态的 Embedding 模型

15.4 向量数据库:Embedding 的"存储引擎"

向量数据库是专门为存储和检索高维向量数据而设计的数据库。与传统数据库(如 MySQL、PostgreSQL)不同,向量数据库的核心操作不是"精确匹配"(WHERE name = '张三'),而是相似度搜索(找到与查询向量最相似的 Top-K 个向量)。

为什么需要专门的向量数据库?

传统数据库的索引结构(如 B-Tree)是为精确匹配和范围查询优化的,在高维向量搜索中效率极低。向量数据库使用专门的索引算法(如 HNSW、IVF、PQ),能在毫秒级完成百万甚至十亿级向量的相似度搜索。

主流向量数据库对比(2026 年) 20

数据库 类型 突出特点 适用场景
Pinecone 托管云服务 零运维,自动扩展,开发者体验最好 快速原型、不想管运维的团队
Weaviate 开源 功能最丰富,支持混合搜索、多模态 复杂搜索需求、自托管
Milvus / Zilliz Cloud 开源 + 云服务 十亿级向量规模,企业级基础设施 大规模生产环境
Qdrant 开源 Rust 编写,性能优秀,API 设计精良 高性能场景、自托管
Chroma 开源 轻量级,Python 原生,开发者友好 本地开发、原型验证
Redis 开源 不是纯向量数据库,但支持向量搜索 已有 Redis 的团队、实时应用

选型建议

  • 快速上手:Chroma(本地)或 Pinecone(云端)
  • 功能丰富:Weaviate(混合搜索、多模态)
  • 大规模生产:Milvus / Zilliz Cloud
  • 性能优先:Qdrant
  • 已有 Redis 基础设施:Redis 向量搜索

十六、模型训练与微调:从预训练到对齐的完整技术栈

16.1 大模型是怎么"炼"出来的

一个大语言模型的诞生,通常经过三个阶段:

阶段一:预训练(Pre-training)------ 让模型学会"语言本身"

预训练是大模型的基础。在这个阶段,模型在海量文本数据上(通常是数万亿 Token),学习预测下一个词(Next Token Prediction)。这个阶段的目标是让模型学会语言的模式------语法、词汇、常识、推理能力。

预训练的核心特点:

  • 数据量巨大:GPT-4 的训练数据估计在 10-20 万亿 Token 之间,涵盖了互联网上几乎所有公开可获取的文本
  • 算力成本极高:训练 GPT-4 级别的模型,需要数千张 GPU 运行数周甚至数月,成本估计在 5000 万到 1 亿美元之间
  • 无监督学习:不需要人工标注数据,只需要"预测下一个词"这个简单的任务------因为每个词都可以作为下一个词预测的目标

预训练完成后,模型叫做 Base Model(基座模型)。基座模型已经学会了语言,但有一个问题:它只会"续写",不会"对话"。你问它"法国的首都是哪里?",它可能回答"法国的首都是哪里?这是一个关于地理的问题......"------它不知道这是一个问题,需要给出答案,而不是续写。

阶段二:监督微调(Supervised Fine-Tuning,SFT)------ 让模型学会"对话"

SFT 使用高质量的人工标注数据(通常是几万到几十万条),让模型从"续写模式"切换到"对话模式"。标注数据通常包含:

  • 用户问题和理想回答的配对
  • 多样化任务:问答、翻译、摘要、代码生成、创意写作等
  • 高质量、多样性、安全性并重

经过 SFT 后,模型学会了"理解指令"和"按指令回应"。但 SFT 有一个局限:它只能模仿训练数据中的回答风格,无法判断"什么样的回答更好"。

阶段三:偏好对齐(Preference Alignment)------ 让模型学会"什么样的回答更好"

这是让模型从"能回答问题"到"回答得好"的关键一步。主要有两种技术路线 2122

16.2 RLHF(基于人类反馈的强化学习)

RLHF(Reinforcement Learning from Human Feedback)是 2022 年由 OpenAI 在 InstructGPT 论文中提出的方法,至今仍是主流的对齐技术之一。

RLHF 的工作流程分为三步:

  1. 收集偏好数据:给模型同一个 Prompt,生成多个不同的回答,让人类标注者选择"哪个更好"。比如对于"如何学编程",回答 A 是"很简单的,跟着教程就行",回答 B 是"建议从 Python 开始,因为语法简单,社区活跃。推荐资源:Python 官方教程、CS50 课程......"------标注者会选 B(更详细、更有帮助)

  2. 训练奖励模型(Reward Model):用收集到的偏好数据训练一个"奖励模型",它能预测人类会喜欢哪个回答。奖励模型本质上是一个分类器------输入一个 Prompt + 回答,输出一个"奖励分数"(这个回答有多好)

  3. 用强化学习优化:使用 PPO(Proximal Policy Optimization)算法,让模型生成回答,奖励模型打分,然后根据分数调整模型参数,让模型倾向于生成高分回答

RLHF 的优缺点

  • 优点:效果好,能显著提升模型的有用性、诚实性和无害性
  • 缺点:需要训练和维护一个额外的奖励模型,训练过程不稳定,需要大量人工标注

16.3 DPO(直接偏好优化)

DPO(Direct Preference Optimization)是 2023 年底由 Stanford 提出的方法,它简化了 RLHF 的流程。DPO 不需要训练单独的奖励模型,也不需要使用强化学习------它直接从偏好数据中优化模型。

DPO 的核心思想是:将偏好数据直接转化为一个损失函数,让模型"更喜欢"被人类选中的回答,"更不喜欢"被人类拒绝的回答。它把 RLHF 的"三步走"(采集偏好→训练奖励模型→强化学习)简化为"一步走"(直接从偏好数据优化)。

DPO 的优缺点:

  • 优点:简单、稳定、不需要奖励模型、不需要强化学习、训练效率高
  • 缺点:在复杂任务上的效果可能不如精心调优的 RLHF

2026 年的趋势:到 2026 年,DPO 已经成为大多数团队的首选方案(简单、稳定、效果好),而 RLHF 主要用于需要极致性能的场景。同时,出现了"迭代 DPO"和"在线 DPO"等改进版本,进一步缩小了与 RLHF 的差距 21

16.4 RLAIF(基于 AI 反馈的强化学习)

RLAIF(Reinforcement Learning from AI Feedback)是 RLHF 的变体,用 AI 替代人类来判断回答的好坏。这解决了 RLHF 的一个核心瓶颈:人类标注的成本高、速度慢、一致性差

RLAIF 的工作流程与 RLHF 类似,但偏好判断由 AI(通常是另一个更强大的模型)来完成。研究表明,在某些任务上,AI 的判断与人类判断高度一致,有时甚至更一致(因为 AI 不会疲劳,不会因为情绪波动而产生不一致的判断)。

16.5 微调方法的选型总结

方法 需要的数据 训练成本 稳定性 效果 适用场景
SFT 几千到几万条高质量问答对 低到中 让模型学会特定领域的对话风格
RLHF 几万条偏好数据 + 奖励模型训练 最好 追求极致性能,有充足资源
DPO 几千到几万条偏好数据 很好 大多数生产场景的首选
RLAIF 用 AI 判断替代人类 人类标注成本太高的场景
LoRA(低秩适配) 几百到几千条数据 极低 中等 快速微调、资源受限的场景

LoRA(Low-Rank Adaptation) 是 2024-2026 年最流行的轻量级微调方法。它不修改原始模型的所有参数,而是添加少量可训练参数(通常是原始参数的 0.1%-1%),大幅降低了微调的计算和存储成本。一个 7B 参数的模型,用 LoRA 微调可能只需要一个消费级 GPU。


十七、AI 模型评测体系:如何判断一个模型"好不好"

17.1 为什么需要评测基准

在 2026 年,市面上有几十个大语言模型,每个都声称自己"在某方面最强"。但普通用户怎么判断哪个模型真正适合自己?这就是评测基准的价值------它们提供了标准化的测试框架,让不同模型的能力可以被客观比较。

但评测基准也有局限性:模型可能"刷榜"(针对评测集优化,但不代表真实能力提升)评测集可能过时或泄露单一评测分数不能反映综合能力。理解评测基准的"能做什么"和"不能做什么",是每个 AI 从业者必备的素养 23

17.2 核心评测基准一览

知识类评测

基准 评测内容 饱和状态 2026 年顶尖分数
MMLU 57 个学科的多选题(数学、历史、法律、医学等) 接近饱和(Top 模型 >88%) Gemini 3.1 Pro: 91.2%
MMLU-Pro MMLU 的升级版,更难,选项从 4 个增加到 10 个 未饱和 Top 模型 85-92%
GPQA Diamond 研究生级别的物理、化学、生物问题 未饱和 Claude Opus 4.6: 68.4%

推理类评测

基准 评测内容 2026 年顶尖分数
MATH 竞赛级数学问题 GPT-5 系列表现最突出
ARC-AGI 抽象推理和模式识别 人类水平约 85%,AI 仍低于人类
BIG-Bench Hard 超出模型舒适区的困难任务集合 各模型差距较大

编程类评测

基准 评测内容 2026 年顶尖分数
HumanEval 164 个 Python 编程问题 接近饱和(Top 模型 >95%)
HumanEval+ HumanEval 的增强版,修正了不完整的测试用例 未饱和
SWE-bench 真实 GitHub Issue 修复 DeepSeek V4: 81%,Claude Opus 4.6: ~78%
Aider Polyglot 多语言编程能力 Claude Opus 4.6: 82.1%

综合评测

基准 评测方式 2026 年顶尖分数
Chatbot Arena (LMSYS) 人类盲测投票,计算 Elo 分数 GPT-5.5、Claude Opus 4.6 领先
Arena Hard Chatbot Arena 的自动版,用 GPT-4 作为评判 反映模型在实际对话中的表现

17.3 如何正确看待评测分数

不要只看一个分数。一个在 MMLU 上得分最高的模型,可能在编程任务上表现平平。更何况,MMLU 等基准已经接近饱和------Top 15 个模型在 MMLU-Pro 上的分数都超过了 87%,2% 的差距在测量误差范围内。

关注对你重要的维度。如果你主要用模型写代码,看 SWE-bench 和 HumanEval+ 比看 MMLU 更有意义。如果你用模型做创意写作,Chatbot Arena 的 Elo 分数可能比任何基准都更有参考价值。

警惕刷榜。有些模型在评测集上表现优异,但在真实场景中表现一般------因为它们可能被"针对训练"过。最可靠的评测是你自己的实际体验------用你的真实任务测试不同的模型,看哪个真正满足你的需求。


十八、AI Agent 架构:从单兵作战到多智能体协作

18.1 什么是 AI Agent

AI Agent(智能体)是一个能够感知环境、自主决策、规划行动路径、调用工具以达成目标的自主系统。与传统的"问答式" AI 不同,Agent 不只是"回答问题",而是"完成任务" 24

Agent 的核心能力:

  • 感知(Perception):理解环境输入------用户指令、上下文、工具返回结果
  • 规划(Planning):将复杂目标拆解为可执行的步骤序列
  • 行动(Action):调用工具(搜索、代码执行、API 调用、浏览器操作)来执行步骤
  • 反思(Reflection):评估执行结果,发现错误,调整策略

18.2 Agent 的核心架构

一个典型的 AI Agent 包含以下组件:

大脑(LLM):Agent 的核心推理引擎。它负责理解任务、拆解步骤、决定何时调用什么工具、判断任务是否完成。

工具(Tools):Agent 可以调用的外部能力。常见工具包括:

  • 搜索引擎(获取最新信息)
  • 代码执行器(运行 Python/JavaScript 代码)
  • 浏览器(访问网页、填写表单、点击按钮)
  • API 调用(与外部系统交互)
  • 文件系统(读写文件)
  • 数据库(查询和操作数据)

记忆(Memory):Agent 的状态存储。分为:

  • 短期记忆(Short-term Memory):当前任务中的上下文和历史步骤
  • 长期记忆(Long-term Memory):跨任务的持久化知识(如用户偏好、历史经验)

规划器(Planner):将用户的大目标拆解为具体的、可执行的小步骤。比如"帮我做一个电商网站"→ 拆解为"设计数据库 → 搭建后端 API → 构建前端页面 → 部署上线"。

反思器(Reflector):评估每一步的执行结果。如果某一步失败,反思器会分析原因并调整策略------"上一步的 API 调用返回了 403 错误,可能是因为没有权限,我需要先检查 API Key 的配置"。

18.3 多智能体系统(Multi-Agent System)

2025-2026 年,AI Agent 的发展方向从"单兵作战"转向了"多智能体协作"。多个 Agent 各自承担不同的角色,协同完成复杂任务 24

层级化指挥链(Hierarchical Chain of Command)

复制代码
[规划 Agent ------ 指挥官]
    ├── [执行 Agent A ------ 前端小组]
    ├── [执行 Agent B ------ 后端小组]
    ├── [执行 Agent C ------ 测试小组]
    └── [监控 Agent ------ 情报官]

指挥官 Agent 接收任务,拆解为子任务,分配给各个执行 Agent,并监控整体进度。执行 Agent 各自完成自己的子任务,向指挥官汇报结果。监控 Agent 负责检查质量和发现潜在问题。

主流多智能体框架

框架 开发商 核心特点 适用场景
LangGraph LangChain 低层控制,图结构定义 Agent 交互流程 需要精细控制 Agent 协作逻辑的场景
CrewAI CrewAI 角色驱动,易于定义 Agent 的角色和目标 快速搭建多 Agent 协作系统
AutoGen Microsoft 对话式多 Agent,支持人机协作 研究、复杂推理、代码生成
OpenAI Swarm OpenAI 轻量级,实验性框架 快速实验多 Agent 模式

两种组织模式

  • 顺序执行(Sequential):Agent A 完成 → Agent B 接手 → Agent C 接手。适合流程明确的线性任务
  • 层级执行(Hierarchical):指挥官 Agent 派发任务 → 执行 Agent 并行工作 → 指挥官汇总结果。适合可以并行处理的复杂任务

18.4 Agent 的挑战与风险

可靠性问题:Agent 可能在多步推理中出错,而且错误会累积------"第一步错了,第二步基于错误的前提继续推理,最终结果可能完全偏离"。

安全问题:Agent 拥有自主执行能力(操作浏览器、运行代码、调用 API),如果失控可能造成实际损害。比如 Agent 可能误删文件、发送错误邮件、执行危险命令。

成本问题:Agent 的每次推理和工具调用都需要消耗 Token,复杂任务可能需要几十甚至上百次 LLM 调用。一个 Agent 任务可能消耗 50 万 Token,成本远超普通对话。

控制问题:如何在"让 Agent 自主执行"和"保持人类控制"之间找到平衡,是 Agent 设计的核心挑战。目前的主流做法是"关键步骤需要人类确认"------Agent 在执行高风险操作(如删除、付款、发送)前,必须等待人类批准。


十九、AI 幻觉深度解析:为什么 AI 会"一本正经地胡说八道"

19.1 什么是 AI 幻觉

**AI 幻觉(Hallucination)**是指大语言模型生成的内容看似合理、流畅、自信,但实际上与事实不符、凭空编造的现象 25

典型的幻觉表现:

  • 编造不存在的论文、书籍、人物、事件
  • 给出看似合理但实际上是错误的数学计算结果
  • 对事实性问题的回答中包含明显错误的信息
  • 生成引用的法律条文、技术文档,但原文中并不存在

关键是:幻觉的输出通常非常流畅、自信,如果不仔细核实,很容易被误导。这就是为什么幻觉是 AI 应用中最危险的陷阱之一。

19.2 幻觉的成因

成因一:训练数据的局限性

模型的训练数据可能包含错误信息、过时信息、偏见信息。模型学到的不是"真理",而是"训练数据中的模式"。如果训练数据中大部分关于某个话题的信息都是错误的,模型也会输出错误的答案。

成因二:概率本质

LLM 本质上是一个"概率预测器"------它预测的是"下一个词最可能是什么",而不是"下一个词是否真实"。当模型遇到知识盲区时,它不会说"我不知道",而是会选择概率最高的词来续写------即使这个词可能导致错误的信息。

成因三:上下文窗口的限制

当需要的信息超出了上下文窗口的范围,模型只能基于不完整的信息生成答案。就像一个人只看了书的目录就写书评------内容看起来可能合理,但细节是编造的。

成因四:过度泛化

模型在训练中学会了"模式",但有时会把模式应用到不适用的情况。比如模型知道"诺贝尔奖得主通常有很高的学术成就",可能会把某个领域的知名学者"错误地"列为诺贝尔奖得主。

19.3 幻觉的缓解策略

策略一:RAG(检索增强生成)

这是目前最有效的幻觉缓解方法。让模型从外部知识库中检索相关信息,再基于检索到的信息生成答案。相当于"先查资料再回答",而不是"凭记忆回答"。

策略二:精确提示词(Precision Prompting)

在 Prompt 中明确约束模型的行为:

  • "如果你不确定,请明确说明'我不确定',不要猜测"
  • "请基于以下提供的参考信息回答,不要使用参考信息之外的内容"
  • "对于事实性陈述,请标注信息来源"

策略三:多步验证(Multi-Step Verification)

让模型生成答案后,再让模型(或另一个模型)检查答案中的每个事实性陈述。类似人类写文章后的"校对"过程------第一遍写,第二遍检查。

策略四:Best-of-N 采样

对于同一个问题,让模型生成 N 个不同的回答,然后选择最一致、最合理的那个。如果多个回答中出现了相同的事实陈述,这个陈述更可能是正确的;如果只有一个回答中出现了某个陈述,它可能是编造的。

策略五:降低 Temperature

对于事实性要求高的场景,使用低 Temperature(0-0.3)可以减少模型的"创造性"和"随机性",从而降低幻觉的概率。但代价是输出可能更"机械"。

策略六:外部知识验证

让模型在生成答案后,自动调用搜索引擎或知识图谱来验证关键事实。如果发现不一致,标记或修正。


二十、AI 安全、对齐与伦理:让 AI 向善的关键议题

20.1 为什么 AI 安全如此重要

随着 AI 能力的快速增长,一个关键问题日益突出:如何确保越来越强大的 AI 系统,始终按照人类的价值观和利益行事? 26

这不是一个遥远的未来问题------已经有很多真实案例:

  • AI 生成的深度伪造(Deepfake)被用于诈骗和虚假信息传播
  • 模型在回答中无意泄露训练数据中的隐私信息
  • 模型的偏见导致对特定群体的不公平对待(如招聘中的性别偏见、贷款审批中的种族偏见)
  • AI 被用于生成恶意代码、钓鱼邮件、虚假评论

20.2 AI 对齐(AI Alignment)

AI 对齐的目标是:确保 AI 系统的行为与人类的价值观、意图和期望保持一致

对齐的三个层次:

  • 指令对齐:AI 能准确理解并执行用户的指令("帮我翻译这段文字"→ 确实翻译了)
  • 意图对齐:AI 能理解用户指令背后的真实意图(用户说"我好无聊",AI 应该提供有趣的内容,而不是说"无聊是一种情绪状态")
  • 价值观对齐:AI 的行为符合人类的道德和伦理标准(当用户要求生成仇恨言论时,AI 应该拒绝)

核心对齐技术 26

  • RLHF / DPO:通过人类偏好数据训练模型,让模型倾向于生成"好"的回答
  • Constitutional AI(宪法 AI):Anthropic 提出的方法,给模型设定一套"宪法"(行为准则),让模型在生成回答时自我检查是否符合宪法
  • Red Teaming(红队测试):专门的团队(内部或外部)尝试"攻击"模型,发现漏洞和风险,然后修复
  • AlphaAlign:2026 年提出的新方法,用纯强化学习激励模型主动进行安全推理,而不是简单地拒绝回答

20.3 AI 偏见与公平性

AI 模型可能从训练数据中学习并放大社会中存在的偏见:

  • 性别偏见:"护士"在模型生成中更可能是女性,"CEO"更可能是男性
  • 种族偏见:某些种族在犯罪预测中被错误地标记为高风险
  • 地域偏见:对某些地区或文化的刻板印象

偏见问题的根源在于:训练数据反映了人类社会的既有偏见,模型不加批判地学习并放大了这些偏见。解决偏见需要从数据收集、模型训练、评估测试三个环节同时入手。

20.4 AI 监管与治理(2026 年最新进展)

欧盟 AI 法案(EU AI Act):全球最全面、最具影响力的 AI 监管法规,2026 年已全面生效。它按风险等级将 AI 应用分为四类:不可接受风险(禁止)、高风险(严格监管)、有限风险(透明度要求)、低风险(无额外要求)。违规罚款最高可达全球年收入的 7% 或 3500 万欧元 26

中国 AI 治理:2026 年,中国发布了《人工智能应用伦理安全指引 1.0》,明确了 AI 应用的伦理安全理念与原则,包括以人为本、智能向善、公平公正、安全可控、隐私保护等 26。同时,中国在生成式 AI 服务管理、深度合成内容标识、个人信息保护等方面也有一系列法规。

企业自监管:OpenAI、Anthropic、Google、Meta 等公司都建立了内部的安全团队和红队测试机制。Anthropic 的"负责任扩展政策"(RSP)要求模型在能力达到一定阈值时,必须通过额外的安全测试才能继续扩展。

20.5 个人使用 AI 的安全建议

  1. 不输入敏感信息:不要在对话中输入密码、身份证号、银行卡号等敏感信息。AI 服务商可能使用你的对话数据来改进模型
  2. 核实关键信息:对于 AI 生成的法律、医疗、金融建议,必须通过专业渠道核实
  3. 谨慎对待深度伪造:当看到"太像真的"的图片、视频、音频时,保持怀疑态度。AI 生成的媒体越来越难以肉眼分辨
  4. 理解 AI 的局限性:AI 不是万能的,它在某些领域表现优秀,在其他领域可能完全不可靠
  5. 关注输出偏见:注意 AI 的输出是否包含性别、种族、地域等方面的偏见

二十一、Vibe Coding 深入:从概念到实践的全景解析

12.1 Vibe Coding 的核心哲学

Vibe Coding 这个术语最早由 Andrej Karpathy(OpenAI 联合创始人、前 Tesla AI 总监)在 2025 年初提出。他用这个词来描述一种全新的编程体验:你不再一行行写代码,而是用自然语言描述你想要什么,AI 来生成代码,你负责验收、反馈、迭代。

这种工作方式的核心理念是:把"实现"外包给 AI,把"判断"留给自己。开发者从"代码的生产者"转变为"需求的描述者和质量的把关者"。

Vibe Coding 已经逐渐成为新一代开发方式的主流趋势。以下几个岗位的兴起,也印证了这一点:

  • AI 应用开发工程师:专注于用 AI 工具开发和部署 AI 驱动的应用。核心技能不是"写很多代码",而是"用自然语言高效地驱动 AI 生成代码"
  • Agent 开发工程师:专注于设计和开发 AI Agent 系统。需要理解 Agent 的决策机制、工具调用流程、安全边界和与外部系统的集成
  • AI 算法工程师:专注于 AI 模型的研发和优化。这个方向要求最高,需要深厚的数学和机器学习基础

前两个方向是大多数开发者未来可以重点努力和发展的方向。AI 时代的开发者核心竞争力不再是"写代码的速度",而是:

  1. 需求理解能力:能清晰、准确地描述需求(Prompt Engineering 的核心技能)
  2. 代码审查能力:能快速判断 AI 生成的代码是否正确、高效、安全
  3. 系统设计能力:能设计整体架构,将 AI 生成的零散代码组织成完整系统
  4. 迭代优化能力:能通过多轮反馈让 AI 生成越来越好的代码

12.2 Vibe Coding 工具深度对比

AI 原生 IDE:这类工具在传统 IDE 的基础上深度集成 AI 能力,是目前开发者日常使用最频繁的工具。

Cursor

  • 基于 VS Code 内核,对所有 VS Code 插件完全兼容
  • Agent 模式是 Cursor 的杀手级功能------AI 能自主理解整个项目结构,跨文件修改代码,运行终端命令,检查错误并自动修复
  • Composer 功能可以一次性生成多个文件(如"帮我创建一个完整的 REST API,包括 model、controller、service 和 test")
  • Tab 自动补全的预测准确率远超传统的代码补全------AI 不仅预测你要写什么代码,还能预测你要做什么操作
  • 支持接入 OpenAI、Anthropic、Google 等多个模型提供商

Windsurf

  • Codeium 出品,在 AI 交互体验上做了独特创新
  • Flow 模式自动分析上下文并执行多步操作------比如你改了一个函数名,它能自动找到所有调用了这个函数的地方并同步修改
  • Cascade 功能理解项目的整体结构,提供项目级别的建议和重构方案
  • 价格比 Cursor 低,对个人开发者更友好

Trae

  • 字节跳动出品,对中文开发者体验做了深度优化
  • 内置 Builder 模式,适合快速构建项目原型------你描述需求,它一次性生成完整项目
  • 与国内开发者常用的工具和平台(如飞书、阿里云)集成更好
  • 在对中文指令的理解和中文项目的支持上相比 Cursor 有天然优势

CLI 工具:在终端中直接使用,不需要图形界面,适合在远程服务器上工作或追求极致效率的开发者。

Claude Code

  • Anthropic 官方 CLI 工具,深度集成 Claude 系列模型
  • 理解整个代码库的结构,不仅仅是当前打开的文件
  • 代理式执行------你能告诉它"帮我修这个 bug",它会自己读代码、找到问题、修改代码、运行测试、确认修复
  • 支持 Git 感知------能理解代码的变更历史,生成更合理的修改建议

Aider

  • 开源 CLI 工具,支持几乎所有主流 LLM(OpenAI、Anthropic、DeepSeek、Ollama 本地模型等)
  • 自动 Git 集成------每次修改自动生成有意义的 commit message
  • 在地图编辑模式中,Aider 能精确修改代码中的特定位置
  • 支持多文件编辑------一次请求可以同时修改多个相关文件

Cline

  • VS Code 插件形式,但本质是 CLI 工作流
  • 支持自主执行终端命令------AI 能安装依赖、运行测试、部署应用
  • 每一次操作前都会请求你的确认,兼顾了自主性和安全性

即时生成工具:这些工具的特点是"一句话生成完整项目",适合快速验证想法和生成 Demo。

Devin

  • 号称"首个 AI 软件工程师",能独立完成从理解需求到部署上线的全过程
  • 拥有自己的浏览器、终端和编辑器------能像人类开发者一样使用这些工具
  • 适合复杂、多步骤的开发任务

秒哒

  • 字节跳动出品,中文友好
  • 一键生成完整项目,包含前端、后端和数据库
  • 适合快速构建原型和 MVP

码上飞

  • 即时生成,快速出原型
  • 界面直观,操作简单
  • 适合非技术背景的创业者快速验证产品想法

12.3 Vibe Coding 的最佳实践

Vibe Coding 虽然降低了编程的门槛,但要做好它,仍然需要遵循一些原则:

原则一:需求描述要结构化

模糊的需求得到模糊的代码。使用 CO-STAR 框架来描述你的开发需求------背景(Context,项目环境和技术栈)、目标(Objective,要解决什么问题)、风格(Style,代码风格偏好)、约束(Tone/Constraints,性能要求、兼容性要求)、响应格式(Response,期望的输出格式)。

复制代码
【背景】React 19 + TypeScript + Tailwind CSS 项目
【任务】创建一个可复用的数据表格组件
【约束】
- 支持排序、分页、行选择
- 响应式设计,移动端折叠为卡片视图
- 支持暗色模式
- TypeScript 严格模式,不使用 any
- 包含单元测试
【输出格式】
- 组件文件:DataTable.tsx
- 类型定义:types.ts
- 样式:使用 Tailwind CSS 类
- 测试文件:DataTable.test.tsx

原则二:分步推进,不要一步到位

不要试图让 AI 一次生成 5000 行代码。正确的方式是:

  1. 先生成数据模型和类型定义
  2. 再生成核心逻辑
  3. 再添加 UI 组件
  4. 再添加错误处理和边界情况
  5. 最后添加测试

每一步完成后再进行下一步,每一步都验证 AI 的输出是否正确。这比"一次性生成全部"的成功率高得多。

原则三:读代码比写代码更重要

Vibe Coding 时代,开发者的核心工作从"写代码"转变为"读代码和审代码"。AI 生成的代码不一定正确,甚至可能包含安全漏洞或性能问题。开发者需要有足够的技术判断力来:

  • 快速判断生成的代码是否正确
  • 识别潜在的性能问题和安全风险
  • 理解代码的整体结构是否合理
  • 确保代码符合项目的架构规范

原则四:用好 Git,做好版本控制

AI 生成的代码经常需要回退。频繁提交、写好 commit message,是 Vibe Coding 的好习惯。建议每次让 AI 完成一个独立的小任务后,先审查代码,确认无误后立即提交。这样如果 AI 后续的修改搞砸了,可以轻松回退。


二十二、总结:一张图看清核心概念之间的关系

13.1 概念全景图

复制代码
人工智能(AI)
    │
    ├── 七十年发展简史:三次寒冬、两次复兴、一次爆发
    │
    ├── 机器学习(ML)── 让机器从数据中学习规则
    │       │
    │       ├── 传统 ML:线性回归、决策树、SVM、K-Means
    │       │
    │       └── 深度学习(DL)── 多层神经网络,自动学习特征
    │               │
    │               ├── CNN:图像识别
    │               ├── RNN/LSTM:序列处理
    │               └── Transformer:大语言模型的基础
    │                       │
    │                       ├── 编码器-解码器架构
    │                       ├── 自注意力机制(Q、K、V)
    │                       ├── 多头注意力
    │                       └── 位置编码
    │                       │
    │                       └── 大语言模型(LLM)
    │                               │
    │                               ├── 训练:预训练 → SFT → RLHF/DPO 对齐
    │                               │
    │                               ├── 输入:Prompt(提示词)
    │                               │       ├── 系统提示词(角色、规则)
    │                               │       ├── 用户提示词(任务指令)
    │                               │       └── CO-STAR 框架(Context/Objective/Style/Tone/Audience/Response)
    │                               │
    │                               ├── 生成控制:Temperature / Top-P / Top-K / Repetition Penalty
    │                               │
    │                               ├── 处理单位:Token(词元)
    │                               │       ├── 输入 Token(计费)
    │                               │       └── 输出 Token(计费)
    │                               │
    │                               ├── 记忆机制:会话记忆(Chat Memory)
    │                               │       └── 受限于 上下文窗口(Context Window)
    │                               │
    │                               ├── 能力扩展:多模态(Multimodal)
    │                               │       ├── 文本
    │                               │       ├── 图像
    │                               │       ├── 音频
    │                               │       └── 视频
    │                               │
    │                               ├── 知识增强:RAG(检索增强生成)
    │                               │       ├── Embedding 模型(语义向量化)
    │                               │       ├── 向量数据库(相似度检索)
    │                               │       ├── Graph RAG(知识图谱增强)
    │                               │       ├── Agentic RAG(多轮迭代检索)
    │                               │       └── 引用溯源
    │                               │
    │                               ├── Agent 能力:自主感知、规划、执行、反思
    │                               │       ├── 单智能体
    │                               │       └── 多智能体协作(LangGraph、CrewAI、AutoGen)
    │                               │
    │                               ├── 风险与挑战
    │                               │       ├── 幻觉(Hallucination)
    │                               │       └── 安全与伦理(对齐、偏见、隐私)
    │                               │
    │                               └── 评测体系:MMLU / HumanEval / SWE-bench / GPQA / Chatbot Arena
    │
    └── 其他 AI 分支:专家系统、进化算法、模糊逻辑...

13.2 核心概念速查表

概念 一句话定义 关键作用
AI 让机器模拟人类智能 总目标
ML 让机器从数据中学习 AI 的核心实现方式
DL 多层神经网络自动学习 ML 的强力分支,当前 AI 爆发的原因
Transformer 基于自注意力机制的序列处理架构 所有大语言模型的"发动机"
LLM 基于海量文本训练的语言模型 当前 AI 应用的核心引擎
Prompt 给 LLM 的指令 人机交互的接口
CO-STAR 结构化提示词框架 确保 Prompt 覆盖所有关键维度
Temperature 控制模型输出的随机性 在"创造力"和"准确性"之间调节
Top-P 动态截断低概率词 排除不合理的候选词,提高输出质量
Token LLM 处理的最小语义单位 计费、容量、理解的基础
会话记忆 模型对对话历史的存储和利用 保持对话连贯性
上下文窗口 模型一次能处理的最大 Token 数 记忆容量的硬限制
多模态 融合文本、图像、音频、视频 让 AI 像人一样综合感知
Embedding 将文本转换为语义向量 语义搜索和 RAG 的基础
向量数据库 存储和检索高维向量 RAG 的"存储引擎"
RAG 检索外部知识库 + 生成答案 解决知识过时、幻觉、私有知识问题
预训练 在海量数据上学习"下一个词预测" 大模型的基础能力来源
SFT 用高质量标注数据微调 让模型从"续写"切换到"对话"
RLHF 基于人类反馈的强化学习 让模型输出更符合人类偏好
DPO 直接从偏好数据优化 更简单、更稳定的对齐方法
LoRA 低秩适配微调 大幅降低微调成本
AI Agent 自主感知、规划、执行的智能体 从"问答"到"完成任务"的进化
多智能体 多个 Agent 协作完成复杂任务 处理单个 Agent 无法完成的复杂任务
幻觉 模型生成看似合理但错误的内容 AI 应用中最危险的陷阱
AI 对齐 确保 AI 行为符合人类价值观 让 AI 向善的技术基础

附录 A:关键词中英文对照表

中文 英文 缩写
人工智能 Artificial Intelligence AI
机器学习 Machine Learning ML
深度学习 Deep Learning DL
大语言模型 Large Language Model LLM
提示词 Prompt ---
提示词工程 Prompt Engineering ---
词元 Token ---
检索增强生成 Retrieval Augmented Generation RAG
卷积神经网络 Convolutional Neural Network CNN
循环神经网络 Recurrent Neural Network RNN
链式思考 Chain of Thought CoT
少样本提示 Few-Shot Prompting ---
上下文窗口 Context Window ---
多模态 Multimodal ---
向量数据库 Vector Database ---
嵌入 Embedding ---
智能体 Agent ---
副驾驶 Copilot ---
自注意力 Self-Attention ---
多头注意力 Multi-Head Attention MHA
位置编码 Positional Encoding ---
监督微调 Supervised Fine-Tuning SFT
基于人类反馈的强化学习 Reinforcement Learning from Human Feedback RLHF
直接偏好优化 Direct Preference Optimization DPO
低秩适配 Low-Rank Adaptation LoRA
幻觉 Hallucination ---
AI 对齐 AI Alignment ---
红队测试 Red Teaming ---

附录 B:推荐学习路径

如果读完这篇文章后,想要深入某个方向,以下是推荐的学习路径:

方向一:AI 应用开发

  1. 掌握 Prompt Engineering(CO-STAR 框架、CoT、自我一致性)
  2. 学习至少一个 AI 原生 IDE(Cursor、Windsurf、Trae)
  3. 理解 RAG 的原理和实现(LangChain / LlamaIndex)
  4. 学习 Agent 开发(OpenClaw、LangGraph、AutoGPT)

方向二:AI 算法研究

  1. 深入理解 Transformer 架构(论文《Attention Is All You Need》)
  2. 学习深度学习框架(PyTorch / TensorFlow)
  3. 理解模型训练和微调(Fine-tuning、RLHF、DPO)
  4. 跟进前沿论文(arXiv、ACL、NeurIPS、ICML)

方向三:AI 产品设计

  1. 理解 LLM 的能力边界(什么能做、什么不能做)
  2. 学习 Prompt Engineering 的系统化方法
  3. 掌握 RAG 的产品设计(知识库设计、检索策略、用户交互)
  4. 理解 AI 产品的安全与伦理(幻觉、偏见、隐私)

Sources

  1. OpenAI GPT-5.1 Documentation --- GPT-5 系列模型能力与 API 参考
  2. Anthropic Claude Models Overview --- Claude 系列模型概览
  3. DeepSeek API Pricing --- DeepSeek 模型 API 定价
  4. Google Gemini --- Gemini 多模态模型
  5. Prompt Engineering Guide --- CO-STAR 框架与提示词工程全面指南
  6. Chain-of-Thought Prompting Elicits Reasoning in Large Language Models --- CoT 论文(Google Research, 2022)
  7. Self-Consistency Improves Chain of Thought Reasoning in Language Models --- 自我一致性论文
  8. OpenAI Tokenizer --- Token 分词器在线工具
  9. LangChain Memory Documentation --- 会话记忆实现参考
  10. Context Window in Large Language Models --- 上下文窗口研究综述
  11. GPT-4o Multimodal Capabilities --- OpenAI 多模态能力介绍
  12. Multimodal AI: A Survey --- 多模态 AI 综述
  13. Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks --- RAG 原始论文(Meta AI, 2020)
  14. LangChain RAG Documentation --- RAG 实现教程
  15. Graph RAG: A Survey --- Graph RAG 技术综述 (2024)
  16. Vibe Coding: The Rise of AI-Assisted Development --- AI 编程趋势分析
  17. AI Index Report 2026 --- Stanford HAI --- 2026 年 AI 技术评测报告,MMLU-Pro 基准分数
  18. LLM Leaderboard Guide 2026 --- 2026 年 LLM 排行榜与评测指南
  19. LLM Sampling Parameters Explained 2026 --- Temperature、Top-P、Top-K 等采样参数详解
  20. Vector Databases and Embeddings Guide 2026 --- 向量数据库与 Embedding 模型选型指南
  21. RLHF vs DPO 2026: Production Decision Framework --- RLHF 与 DPO 在生产环境中的选择框架
  22. Advanced Fine-Tuning Techniques for Multi-Agent Orchestration --- AWS 微调技术实践
  23. Every Major AI Benchmark Explained 2026 --- 2026 年 AI 评测基准全面解读
  24. Best AI Agent Frameworks 2026: LangGraph vs CrewAI vs AutoGen --- 2026 年主流 AI Agent 框架对比
  25. Detecting & Mitigating Hallucinations in Generative AI --- AI 幻觉检测与缓解策略
  26. The Ultimate Guide to AI Ethics and Responsible Use 2026 --- AI 伦理与负责任使用指南
  27. Claude Opus 4.6 技术全解读 --- Claude Opus 4.6 新特性详解
  28. Attention Is All You Need --- Transformer 原始论文(Google, 2017)
  29. 中国《人工智能应用伦理安全指引1.0》 --- 2026 年中国 AI 伦理安全指引
  30. AI Safety 2026: The Race to Align Advanced AI Systems --- AI 安全对齐技术进展
相关推荐
Bamtone202515 分钟前
Bamtone班通:TDR阻抗测试仪如何高效助力AI服务器高速信号完整性验证?
服务器·人工智能·阻抗测试·阻抗分析
必须会一定会38 分钟前
AI 编程工具选型:Cursor、Claude Code、Codex、OpenCode 与 DeepSeek Harness 的产品形态和成本边界
人工智能·ai编程
tqs_1234544 分钟前
大模型工程化高频踩坑总结:RAG、Agent、检索、模型优化全复盘
人工智能
chunmiao30321 小时前
NVIDIA Vera CPU 交付 AWS:为智能体设计的 CPU 进入规模化出货
人工智能
十三画者1 小时前
【文献分享】PANORAMIC:用于空间组学共定位分析的分层不确定性传播框架
人工智能·深度学习·数据挖掘·数据分析·集成学习
cczixun2 小时前
从工具交互到自主进化:2026智能体平台产业发展全景解析
人工智能·智能体
benchmark_cc2 小时前
1000只ETF的5分钟K线如何批量获取?QuantDash分页策略与高性能Python实践
开发语言·人工智能·爬虫·python·算法·quantdash·量化数据源
sel_92 小时前
【PEFT】参数高效微调(PEFT)技术详解:从原理到 LoRA/QLoRA 实战
人工智能·python·深度学习·算法·机器学习·参数高效微调
机器人猎头David2 小时前
机器人猎头公司(倍利福猎头公司)案例分享
人工智能·机器人·招聘·具身智能·人形机器人·猎头公司·机器人猎头公司