大模型是什么?

目录

[LLM(Large language model)](#LLM(Large language model))

大模型读文字的方式:token

[大模型的短期记忆上限:上下文窗口(Context window)](#大模型的短期记忆上限:上下文窗口(Context window))

对话的角色结构(system,user,assistant)

大模型可以做什么


LLM(Large language model)

"大"在哪里:

参数量大:数千亿的参数量

训练数据大:被研发人员喂了大量各行各业的知识

工作模式:根据给出的前文上下文,预测下一个最可能出现的文字


大模型读文字的方式:token

Token是大模型处理文本的基本单位

一个token对应1~2个汉字,0.5~1个单词

  • 模型能处理的文本长度上限(也叫上下文窗口)是按token来算的
  • API调用的费用也是按token来算的
  • 流式输出一段一段吐的就是 Token

大模型的短期记忆上限:上下文窗口(Context window)

大模型每次对话时,能看见的内容总量上限,用Token衡量

大模型本身是"无记忆的",每一次提问对于大模型来讲都是一次新的提问,大模型并不记得上次聊了什么

应用代码在负责记忆,每次对话都要把前面的对话打包成一个列表发给大模型

所以对话越多,token越多,上下文窗口就会被写满

Agent需要管理记忆,执行长任务时,主动决定传入哪些历史


对话的角色结构(system,user,assistant)

既然历史对话要靠消息列表来传递,就要为每一个消息定义一个角色(role)

system:系统提示,定义模型的"身份设定和行为规则",用户看不见,但是模型会遵守

user:用户输入

assistant:模型的回答

模型只有看见消息列表才知道之前说过什么


大模型可以做什么

  1. 听得懂人话,能理解用户意图

  2. 会思考,拆解任务,做决策

  3. 能生成符合要求的回答

  4. 看的懂规则,能根据指定的规则执行


大模型做不到什么

  1. 没有执行能力,只会出主意 → agent

  2. 只有基于训练日期之前的知识,遇到不会的问题,会产生幻觉 → RAG

  3. 上下文窗口有限,记不住太长的内容 → RAG

相关推荐
咖啡星人k25 分钟前
想私有化部署 AI 开发平台?MonkeyCode 给出的答案是开源 + 离线
人工智能·大模型·ai编程·monkeycode
mCell2 小时前
用 Cordis 从零构建一个 Mini DeepSeek Harness
typescript·agent·deepseek
ArkAPI2 小时前
Claude Code 连发安全修复:AI 编程 Agent 的权限,正在成为新的“安全事故高发区”
人工智能·大模型·api·codex·ai工具·claude code·arkapi
nix.gnehc3 小时前
Agent 的解剖 -- Harness 到底在解什么
agent
神奇霸王龙3 小时前
Agent 准入门控屠夫:5 旗舰 4 维度评估
linux·运维·数据库·ai·ai作画·agent·ai编程
一拳不是超人3 小时前
DeepSeek Harness 为什么敢说"一切皆插件"?拆透 Cordis 引擎的五大核心机制
前端·人工智能·agent
Tisfy3 小时前
Codex:通过编辑配置文件添加带Bearer的自定义MCP
数据库·大模型·agent·codex·mcp
Eloudy5 小时前
ReAct 原理简介
前端·javascript·人工智能·react.js·agent·gpu
x865 小时前
Agent 的搜索引擎:Agentic Resource Discovery 规范,以及它解决不了的信任问题
搜索引擎·agent
dogstarhuang6 小时前
大模型 API 停服怎么办:用 API 网关实现多模型统一接入与可切换架构
人工智能·后端·架构·大模型·api·数字化转型·ai应用