AI核心概念大串联

一、底层引擎:LLM

定义与架构

  • LLM 全称:Large Language Model(大语言模型),简称大模型
  • 底层架构:基于Transformer(2017年Google团队在论文《Attention Is All You Need》中提出)
  • 工作原理:本质是文字接龙游戏,通过预测下一个概率最高的词生成连续文本

发展历程

时间 事件 意义
2017年 Transformer架构提出 奠定大模型的技术基础
2018年 GPT-1发布 开启新的范式转变
2022年11月 GPT-3.5发布 首个达到可用级别的大模型
2023年3月 GPT-4发布 大幅提升AI能力天花板
2023年后 Claude、Gemini等应用出现 AI赛道从OpenAI独角戏变为多强竞争

二、数据处理单元:Token

核心特性

  • 定义:大模型处理文本的最小单位(词元化),通过Tokenizer(分词器)将用户输入的文本切分为片段给到大模型
  • 编码过程:User->Tokenizer->LLM。两步走------1.切分文本为N个Token,2.映射Token(文字)为Token ID(数字)。
  • 解码过程:LLM->Tokenizer->User。一步走------将1个Token ID(数字)映射为Token(文字)。

Token 与自然语言单位的关系

语言 与 Token 的关系 示例
中文 非一一对应,可能被拆分 "工作坊" => "工作"+"坊"
简单英文单词 常见词通常对应1个Token "hello" => 1 Token
复杂英文单词 可能被拆分 "helpful" => "help"+"ful"
特殊字符 可能需要多个Token展示 √ => 3 Token

Token 量化参考

  • 1 个 Token ≈ 0.75 个英文单词
  • 1 个 Token ≈ 1.5-2 个汉字
  • 40万 Token ≈ 60-80万汉字 或 30万英文单词

三、临时记忆体:Context(上下文)

核心概念

  • 定义:大模型每次处理任务时接收的信息总和,相当于模型的"临时记忆"
  • 容量限制:由上下文窗口(Context Window)定义,即Context能容纳的最大Token数量

主流模型 Context Window 对比

模型 Context Window (Token) 约对应汉字数量
GPT-5.4 105万 约157.5万
Gemini 3.1 Pro 100万 约150万
Claude Opus 4.6 100万 约150万

突破Context Window限制的方案

  • RAG 技术(检索增强生成):从知识库中抽取与问题最相关的片段,仅将关键信息送入模型,降低Token消耗

四、指令交互:Prompt(提示词)

定义与分类

  • Prompt :大模型接收的具体问题或指令,直接决定模型的输出质量
  • Prompt类型
    -- User Prompt :用户输入的具体任务(如:帮我写一首诗 or 请帮我写一首五言绝句,主题是秋天的落叶,风格要悲凉一点)
    -- System Prompt:开发者后台配置的人设与做事规则(如:你是一个耐心的数学老师,当学生问你数学问题时,不要直接给答案,而是要一步步引导学生思考,帮助他们理解解题的思路)

Prompt Engineering(提示词工程)

  • 核心原则:清晰、具体、明确(研究怎么把问题/指令说清楚,让大模型更精准地理解你的意图)
  • 现状:曾经重要,但重要性逐渐下降,主要是大模型能力提升快,越来越会推测模糊问题/指令的意图

五、外部能力扩展:Tool(工具/函数)

核心作用

  • 定义:大模型调用的外部函数,使其能够感知和影响外部环境
  • 解决痛点:弥补大模型无法获取实时信息(如天气)、计算能力有限等弱点

核心作用

  1. 用户提问->平台转发至大模型(转发内容还包含目前可用的工具列表,如天气查询工具、计算器工具)
  2. 大模型分析->生成工具调用指令
  3. 平台执行调用->平台获取结果->平台返回调用结果至大模型
  4. 大模型整理结果->自然语言输出

角色分工

角色 职责
用户 输入问题/指令
大模型 1.选择工具、生成调用参数,2.归纳总结工具执行结果
工具 执行具体功能(如查询天气)
平台(Agent) 串联流程:转发信息、执行工具调用(传话筒角色,因为用户、大模型和工具无法直接对话)

六、工具调用:MCP

  • 全称:Model Context Protocol(模型上下文协议)
  • 本质:统一的工具接入规范,解决不同平台接入规范不一致的问题(比如:OpenAI、Anthropic、Google三个平台各自有接入规范,需要写多个接入规范,只想弄一个统一的技术规范标准)
  • 价值:工具开发者只需按MCP规范开发一次,即可在所有支持MCP的平台使用(类比手机都统一用Type-C充电口)

七、自主决策系统:Agent

  • 定义 :能够自主规划、自主调用工具,持续工作直至完成用户任务的系统
  • 核心能力:多步骤推理、工具选择、流程控制
  • 代表产品:Claude Code、Codex、Gemini CLI等
  • 典型构建模式:React、Plan and Execute等

八、任务定制:Agent Skill

核心能力

  • 定义:给Agent的说明文档,包含任务规则、执行步骤、输出格式等
  • 结构
    --元数据层:name(名称)、description(描述)
    --指令层:目标、执行步骤、判断规则、输出格式、示例

技术实现

  • 存储形式:Markdown文档(文档必须为"SKILL.md")
  • 存放位置:特定目录(如Claude Code找到用户目录的".claude/skills"文件夹)
  • 加载机制:仅在用户问题与技能名称/描述相关时加载完整指令

九、概念体系回顾

核心引擎 => 数据单位 => 记忆空间 => 交互接口 => 外部能力 => 工具标准 => 决策系统 => 任务定制

  • LLM:大模型
  • Token:大模型处理数据的最基本单元
  • Context:大模型每次处理任务时接收到的信息总和
  • Context Window:大模型的Context最多能够存储的Token量
  • Prompt(User/System):用户或系统当前给大模型下达的具体指令或问题
  • Tool:大模型用来感知和影响外部环境的函数
  • MCP:统一了工具接入格式的标准协议
  • Agent:能自主规划和调用工具、直至解决用户问题的程序
  • Agent Skill:给Agent看的说明文档

十、补充细节

  • Transformer架构:虽由Google提出,但由OpenAI通过GPT系统引爆
  • Token切分原理:基于BPE(字节对编码)算法,模型自主学习的文本切分规则
  • Agent Skill高级特性:支持允许代码、引用资源,采用渐进式披露机制节省Token
  • RAG技术:通过检索相关片段而非全文,有效解决Context Window限制问题

视频指路:https://www.bilibili.com/video/BV1E7wtzaEdq/?spm_id_from=333.337.search-card.all.click\&vd_source=f50ab1a8c52791f592580e80a16e5536

相关推荐
_Jimmy_1 小时前
AI应用开发工程师面试题库
人工智能·python·深度学习·机器学习·知识图谱
阿里云大数据AI技术1 小时前
FalconSeek 技术解析:阿里云 Elasticsearch 云原生内核如何让查询性能飙升600%
人工智能·elasticsearch
了不起的云计算V1 小时前
破局“Demo陷阱”:中国电子云以“新星”AI重构关键行业智能决策体系
人工智能·重构
Elastic 中国社区官方博客2 小时前
将你的 Grafana Kubernetes 仪表板迁移到 Elastic Observability:相同的 PromQL,30 倍更快的查询
大数据·人工智能·elasticsearch·搜索引擎·容器·kubernetes·grafana
中微极客2 小时前
2026主流AI Agent框架技术选型与性能对比
运维·网络·人工智能
灵机一物2 小时前
合伙制律所分红和提成律师个税怎么合规优化?
大数据·人工智能
dreamer_83992 小时前
AI智能合同比对系统:从零搭建实战教程
人工智能·python
Microvision维视智造2 小时前
10ppm是什么概念?锂电生产管控国标给AI视觉下了硬指标
人工智能·计算机视觉·视觉检测·机器视觉
初晴融雪-快雪时晴2 小时前
AI应用:二级市场AI应用全景深度分析(多表格结构化全文)
人工智能
XMAIPC_Robot2 小时前
软硬协同实时控制|RK3588业务调度+FPGA硬件时序,ethercat实现半导体设备微秒级响应(125us)
linux·arm开发·人工智能·fpga开发