【计算机科学技术/AI领域】名词释义:词元(token)!

在AI领域,词元(Token) 是大语言模型处理文本时使用的基本单位。它指的是模型将输入文本分割成的一个个片段,这些片段可以是单词、子词、单个字符甚至标点符号。

核心要点:

  1. 分词(Tokenization):将文本转换成词元序列的过程,是模型理解文本的第一步。

  2. 数字化:每个独特的词元都会被映射成一个唯一的数字ID,以便模型进行计算。

  3. 并非总是"词":例如,英文中"playing"可能被分成"play"和"ing"两个子词词元;中文中,一个汉字、一个词语或一个标点都可能是一个独立的词元。

  4. 影响与限制:模型的上下文长度(如128K)就是指它能处理的词元总数上限。同时,计费也常以词元数为基础。

简单例子:

句子"我爱AI。"可能会被分词为 ["我", "爱", "AI", "。"] 四个词元,然后每个词元被转换为对应的数字ID输入模型。

相关推荐
搬砖的小码农_Sky42 分钟前
AI Agent:macOS Sequoia 部署 OpenClaw 完整教程
人工智能·macos·ai·人机交互
无心水2 小时前
【Harness:设计规范】15、Harness 成熟度模型(H0-H3):你的 AI 智能体在第几层
人工智能·设计规范·openclaw·养龙虾·harness·hermes·honcho
Raink老师8 小时前
【AI面试临阵磨枪-79】实时数据 RAG:订单、商家、物流、天气、动态库存
人工智能·面试·职场和发展
是一个Bug8 小时前
Agent(智能体)应用 的入门学习路径
学习·机器学习
脑极体8 小时前
点亮星河AI+鸿蒙,一座艺术场馆的日神觉醒
人工智能·华为·harmonyos
Cosolar8 小时前
Chroma向量库面试学习指南
数据库·人工智能·面试·职场和发展·数据库架构
BUG指挥官8 小时前
Claude Code的自动化编程
人工智能
意图共鸣8 小时前
意图共鸣科技《认知智能白皮书》——感知与执行分离:认知架构(CA)如何重塑大模型底层结构
人工智能·架构
等一个人的@8 小时前
让数据自己开口:数睿通智库新增智能问数模块
人工智能·自然语言处理
ZGi.ai8 小时前
人工审查节点:让自动化工作流多一步人工把关
运维·人工智能·自动化·人机协同·智能体工作流·人工审查