一文讲透AI大模型相关的专业名词

一.LLM

1.全称Large Language Model(大语言模型,简称"大模型")

LLM:Large Language Model(大语言模型,简称"大模型")。
基本上,现在所有的大模型都是基于Transformer这套架构训练出来的。

说白了,大模型的底层引擎就是"Transformer"

"Transformer"是由Google发明(点火者),但是真正推广者是OpenAI。

2.我们平时见到的大模型有哪些?

  • ChatGPT (OpenAI)
  • 通义千问 (阿里)
  • 文心一言 (百度)
  • 豆包 (字节跳动)
  • Kimi (月之暗面)
  • DeepSeek (深度求索)
  • 等等

3.大模型是怎么工作的?

  • 本质就是一个文字接龙游戏

举例

  • 当用户问"鸿剑的文章怎么样"?然后大模型对此做出思考。
  • 一会,思考的结果是"特别",发送给用户。然后再把"特别"这个词抓回去,再回答"的"拼接到"特别"后面,发送给用户,然后再抓回去,再思考出"棒",拼接到"特别的"后面,答案是"特别的棒",然后再抓回去。发现该问题回答完了,就会输出一个结束标志(图中的绿色对钩)。
  • 说白了,本质就是一个词一个词往外蹦的,所以我们用deepseek时,也能明显发现大模型给答案时,就是一个一个词的生成的(也叫流式生成),本质原因就是因为这个大模型的生成特点,就是文字接龙游戏。

二.Token

解析:

  • 大模型本质上是一个庞大的数学函数,里面跑的全是矩阵运算。因此大模型接收的只能是数字,输出的也只能是数字。说白了大模型压根不认识人类写的文字。
  • 所以人类要和大模型沟通,需要一个中间人(翻译官),即Tokenizer。它负责编码(将文字转为数字)和解码(将数字转为文字)。
  • 所以Token是大模型处理文本的基本单位
  • 而Token不能说对应一个文字、或一个英文单词,而是具体分情况,但是大致比例如下图所示。
相关推荐
牛油果子哥q7 小时前
LLM安全与内容风控全栈落地: Prompt注入、越狱攻击、幻觉风控、敏感词过滤、C++风控网关、多级审核体系、线上攻防实战
ai·llm
武子康9 小时前
小智服务端怎样组织 ASR、LLM、TTS?先追本次连接实际使用的对象
人工智能·llm·agent
kolyle9 小时前
万级 QPS 下的 Token 分发系统架构:从 0 到 1 跑通 AI 时代的“水电煤“
开发语言·人工智能·系统架构·token·qps·极智词元·大模型私有化部署
掰头战士9 小时前
Prompt Cache,如果agent全靠LLM方做隐式缓存实在不够用。
前端·llm·agent
Code_Artist10 小时前
☢︎自然语言 → 机器码:这到底是 AI 编程的终极形态,还是一个伪命题?
人工智能·llm·ai编程
前端双越老师10 小时前
张三的 10 亿元 AI 梦:从“造神”到“活下去”
llm·agent·芯片
桃西西呀11 小时前
机器眼里没有脸,怎么识别人脸?手写 CNN 拆开卷积层与 BatchNorm
人工智能·深度学习·llm
bestcxx11 小时前
DeepSeek 的“快”与“全”:一次关于搜索、爬虫与信息时效性的讨论
ai·llm
谢白羽12 小时前
MiniMax-H3 : 4卡 H20-3e一套权重部署实践/8卡H200部署优化实测
笔记·llm·论文·大模型部署·sglang
气象复杂15 小时前
手写 ReAct 跑了 30 个任务:模型 0 格式失败,丢的 10 步全是我写的解析器
llm