【计算机科学技术/AI领域】名词释义:词元(token)!

在AI领域,词元(Token) 是大语言模型处理文本时使用的基本单位。它指的是模型将输入文本分割成的一个个片段,这些片段可以是单词、子词、单个字符甚至标点符号。

核心要点:

  1. 分词(Tokenization):将文本转换成词元序列的过程,是模型理解文本的第一步。

  2. 数字化:每个独特的词元都会被映射成一个唯一的数字ID,以便模型进行计算。

  3. 并非总是"词":例如,英文中"playing"可能被分成"play"和"ing"两个子词词元;中文中,一个汉字、一个词语或一个标点都可能是一个独立的词元。

  4. 影响与限制:模型的上下文长度(如128K)就是指它能处理的词元总数上限。同时,计费也常以词元数为基础。

简单例子:

句子"我爱AI。"可能会被分词为 ["我", "爱", "AI", "。"] 四个词元,然后每个词元被转换为对应的数字ID输入模型。

相关推荐
冬奇Lab7 小时前
Agent 系列(23):Web Agent——让 Agent 真正浏览网页
人工智能·llm·agent
冬奇Lab7 小时前
每日一个开源项目(第135篇):codebase-memory-mcp - 给 AI Agent 一张代码库的知识图谱
人工智能·开源·llm
IT_陈寒10 小时前
JavaScript的闭包把我坑惨了,说好的内存会自动回收呢?
前端·人工智能·后端
哥布林学者12 小时前
深度学习进阶(三十一)FlashAttention:IO 感知的精确注意力
机器学习·ai
jooloo13 小时前
Codex 间歇性 400 之谜:一条对话里,它为什么有时候用 chat/completions,有时候切到 responses?
人工智能
用户51914958484514 小时前
OpenSSL PKCS#12 PBMAC1 堆栈缓冲区溢出漏洞 (CVE-2025-11187) 分析与验证
人工智能·aigc
用户51914958484515 小时前
HP Sound Research SECOMNService 权限提升漏洞利用工具
人工智能·aigc
用户0183493016915 小时前
给 AI 智能体能力包一层 BFF,前端只调一个接口
人工智能