揭秘大语言模型:从文字到数字,token 是如何变成向量的?

揭秘大语言模型:从文字到数字,token 是如何变成向量的?


你有没有想过,ChatGPT 这样的大语言模型是怎么 "看懂" 文字的?其实,它们靠的是一套 "数字密码"------ 把文字变成向量。今天就用大白话,带你看懂这个神奇过程。

第一步:文字先拆成 "小零件"------token

大模型处理文字前,会先把句子拆成最小单位 "token"。就像把拼图拆成小块,方便后续处理。

(此处建议配图:左侧是一句话 "我爱吃苹果",被拆成右侧的 token "我""爱""吃""苹果",每个 token 用不同颜色方块表示)

token 分三种常见类型:

  • 单词级:比如 "apple" 就是一个 token
  • 子词级:长单词会拆成片段,如 "unhappy" 拆成 "un""happy"
  • 字符级:每个字 / 字母单独算,如 "cat" 拆成 "c""a""t"

第二步:给 "小零件" 贴标签 ------ 从 token 到 ID

拆好的 token 不能直接被模型识别,得先变成数字。就像给每个零件编个唯一编号,比如:

(此处建议配图:左侧是不同 token "我""爱""a""b",右侧对应数字 ID "1""2""3""4",用箭头连接)

  • "我"→ID:1
  • "爱"→ID:2
  • "a"→ID:3

第三步:编号变 "坐标"------ID 到向量

有了 ID,还要通过 "嵌入层" 变成向量。向量就像 token 在数字空间里的 "坐标",比如 [0.2, 0.5, -0.3](维度通常有几百到几千)。

(此处建议配图:一个表格样式的 "嵌入层查找表",行是 ID,列是向量维度,ID "1" 对应一行数字,用箭头指向一个三维坐标点表示向量)

向量的 "成长记":从随机到有意义

刚生成的向量是随机数字,没啥含义。但经过海量文本训练后,奇迹发生了:

(此处建议配图:左侧是杂乱分布的向量点,标注 "训练前";右侧是聚集的向量群,"高兴""开心" 聚在一堆,"大""小" 分在两边,标注 "训练后")

  • 模型通过 "损失函数" 判断预测对错,用 "梯度下降" 调整向量数值
  • 最后,语义近的 token 向量会靠得近(如 "爸爸" 和 "父亲"),相反的则离得远(如 "冷" 和 "热")

为啥要费这劲?

因为模型只懂数学运算。向量让文字能被 "计算":比如 "国王 - 男人 + 女人≈王后",这种神奇的语义关系,就是靠向量运算实现的。

(此处建议配图:用箭头表示向量运算,"国王" 向量减去 "男人" 向量,加上 "女人" 向量,箭头终点指向 "王后" 向量)


从文字拆成 token,到变成 ID,再转化为有语义的向量,这三步就是大模型 "理解" 语言的核心。看似复杂的过程,本质是把人类语言翻译成机器能懂的数字密码。

未来随着技术发展,这套 "翻译系统" 会越来越精准,说不定哪天,模型真能像人类一样理解文字背后的喜怒哀乐呢~

相关推荐
萤丰信息8 分钟前
技术赋能安全:智慧工地构建城市建设新防线
java·大数据·开发语言·人工智能·智慧城市·智慧工地
AI视觉网奇27 分钟前
音频分类模型笔记
人工智能·python·深度学习
Dante但丁30 分钟前
手扒Github项目文档级知识图谱构建框架RAKG(保姆级)Day4
人工智能
用户51914958484538 分钟前
使用JavaScript与CSS创建"移动高亮"导航栏
人工智能·aigc
百度Geek说41 分钟前
第一!百度智能云领跑视觉大模型赛道
算法
Java中文社群1 小时前
淘宝首位程序员离职,竟投身AI新公司做这事!
人工智能·后端·程序员
big_eleven1 小时前
轻松掌握数据结构:二叉树
后端·算法·面试
big_eleven1 小时前
轻松掌握数据结构:二叉查找树
后端·算法·面试
失散131 小时前
自然语言处理——02 文本预处理(上)
人工智能·自然语言处理
CoovallyAIHub1 小时前
农田扫描提速37%!基于检测置信度的无人机“智能抽查”路径规划,Coovally一键加速模型落地
深度学习·算法·计算机视觉