"词码"作为 Token 候选译名:含义与技术辨析
讨论目标:在尊重"词元"现有规范地位的前提下,评估"词码"能否更直观地表达 token 的离散符号、编号映射、序列处理和计量属性。
摘要
2026年3月,全国科学技术名词审定委员会优先推荐将人工智能领域的 token 译为"词元",并面向社会发布试用。"词元"具有术语中性、结构稳定和衍生表达清晰等优点,但对初学者而言仍比较抽象。
"词码"值得作为候选表达讨论。汉字"码"不只表示数字代码,还出现在"号码、编码、筹码、砝码、一码事、码放"等词语中,能够同时激活以下认知:
- 可识别的符号;
- 可区分的离散类别;
- 可计数、可消耗的单位;
- 可按顺序排列的单元;
- 可映射为数字编号的对象。
因此,"词码"可以定义为:
词码(token)是模型按照特定词码化规则,从文本或其他信息中得到的基本离散符号单位。每个词码对应词表中的一个编号,并作为模型输入、输出、序列长度与服务计量的基本单位。
1. 技术链条:Token 不等于 Token ID
理解"词码"是否准确,首先需要区分三个层次:
text
原始文本
↓ tokenizer / 词元化器
Token 序列
↓ vocabulary mapping / 词表映射
Token ID 序列
↓ embedding layer / 嵌入层
向量序列
↓
大语言模型
例如,某个 tokenizer 可能将文本切分为:
text
["我", "喜欢", "人工智能"]
这些离散字符串片段是 token。词表再将其映射为整数编号:
text
[1287, 5032, 21945]
这些整数是 token ID。随后,模型通过嵌入层把编号映射为连续向量。
因此:
text
token = 词表中的离散符号项
token ID = 该符号项在特定词表中的整数索引
embedding = 模型用于计算的连续向量表示
"词码"若用于表示 token 本身,就必须继续使用"词码编号"表示 token ID,避免把符号项与整数索引混为一谈。
2. 为什么"码"与 Token 具有较高对应度
| "码"的语义 | 汉语实例 | 与 token 的对应关系 |
|---|---|---|
| 可识别符号 | 号码、页码、条码、密码 | token 是词表中的离散符号项 |
| 可计量或交换单位 | 筹码、砝码、价码 | token 用于上下文容量、吞吐量和 API 计费 |
| 类别或事项单位 | 一码事、两码事 | 不同 token 是词表中的不同离散类别 |
| 排列和堆叠 | 码砖、码积木、码放 | 模型处理的是按顺序排列的 token 序列 |
| 计量单位 | 长度单位"码" | 强化"可计数、可度量"的现实语感 |
"码"因此不必只理解为数字编号。例如,筹码不是筹码上的号码,"两码事"也不是两个数字代码。它还可以指规则系统中可区分、可排列、可计数的单位。
3. "词码"比"词元"多表达了什么
"词元"主要表达:
text
词或语言材料 + 基本单元
"词码"则可能同时表达:
text
语言符号
+ 离散类别
+ 编号映射
+ 可计量单位
+ 可排列组合
这使"词码"特别适合解释以下工程和商业语境:
- 输入词码、输出词码;
- 词码序列和词码窗口;
- 词码预算和词码用量;
- 每秒生成词码数;
- 百万词码价格;
- 缓存词码与推理词码。
4. 候选译名比较
| 名称 | 核心意象 | 优势 | 主要局限 |
|---|---|---|---|
| 词元 | 基本单元 | 规范基础强、技术中性、衍生体系稳定 | 初次听感抽象,容易被误解为完整词 |
| 词码 | 编码体系中的离散语言符号或筹码 | 兼具符号、编号、工程和计量感 | 可能与 code 或 token ID 混淆 |
| 语粒 | 语言颗粒 | 切分画面直观,容易理解粒度 | 容易暗示天然颗粒,正式衍生词较弱 |
| 语码 | 语言编码 | 构词自然、覆盖面较宽 | 已是社会语言学中的成熟术语 |
| 语义码 | 带语义的编码 | 听感直观 | 错误暗示每个 token 都有独立完整语义 |
可以把前三者理解为不同视角:
- 词元强调技术本体;
- 语粒强调切分后的形态;
- 词码强调离散符号在数字系统中的存在与运作方式。
5. 为什么不建议使用"语码"与"语义码"
5.1 "语码"已有既定含义
"语码"在社会语言学中通常对应 linguistic code,表示语言、方言、语体或语言变体,并已形成"语码转换""语码混合"等固定表达。
若把 token 也叫"语码",可能产生下列歧义:
text
词元化器把中英语码混合文本切分为语码序列。
前一个"语码"可能指中文和英文两套语言系统,后一个"语码"却指 token,层级明显冲突。
5.2 "语义码"错误前置了语义
一个 token 可能是:
- 完整词;
- 子词或词缀;
- 单个字符;
- 标点或空格组合;
- 字节片段;
- 特殊控制符号。
单个 token 不一定拥有独立、完整的语义。具体语义通常在嵌入和上下文计算中形成:
text
离散符号 → 编号 → 嵌入 → 上下文表示 → 语义形成
因此,"语义码"更适合描述经过语义量化的专门表示,不适合作为通用 token 的译名。
6. 为什么"码元"贴切却不能直接采用
"码元"兼具"编码符号"和"基本单元"的含义,从字面看非常贴切。然而,"码元"已经是数字通信领域对应 symbol 的成熟术语,通常表示具有特定状态或波形的基本信号单位,并与波特率相关。
"码元"不能再被 token 占用,但它反过来证明:"码"在中文科技术语中,确实适合表达离散、可区分、可计量的符号单位。
7. 候选术语体系
| 英文 | "词码"体系候选表达 |
|---|---|
| token | 词码 |
| token ID | 词码编号 |
| tokenization | 词码化 |
| tokenizer | 词码器 / 词码化器 |
| token sequence | 词码序列 |
| token embedding | 词码嵌入 |
| token vocabulary | 词表 / 词码表 |
| special token | 特殊词码 |
| input token | 输入词码 |
| output token | 输出词码 |
| token budget | 词码预算 |
| token usage | 词码用量 |
实际使用中不必机械重命名全部现有术语。例如,vocabulary 继续称为"词表"通常更自然。
8. 从"因特网"到"互联网"的启示
新技术进入中文时,常先经历保留英文、音译或专业圈通行表达。随着技术进入日常生活,能够直接揭示对象结构、功能或使用方式的名称,可能获得更强的传播生命力。
"互联网"比"因特网"更直观地说明"网络与网络相互连接"。类似地,若公众未来主要通过 AI 计费、上下文窗口、生成速度和算力消耗接触 token,"词码"与"数码、编码、筹码、价码、码数"形成的认知网络,可能比"词元"更容易理解。
但 token 比 Internet 更抽象。它同时是词表项、预测类别、序列单位、计费单位和多模态离散单位,很难由一个高度具象的词完整覆盖。
9. 推荐使用方式
正式论文、标准与技术规范
首次出现时写作:
text
词元(token)
后文统一使用"词元"。
术语研究与公众讨论
可以明确提出:
text
"词码"是 token 的候选中文表达。
并说明"词码"指离散符号项,"词码编号"指整数索引。
科普表达
可以使用分层解释:
text
词元:正式名称
语粒:解释文本被切成一小块一小块
词码:解释这些小块如何被识别、编号和计量
语言筹码:解释 API 计费与上下文容量
10. 结论
基于"码"在现代汉语中的完整语义,"词码"不只是 token ID 的形象说法,也可以成为 token 本身的有竞争力候选译名。
词元强调它是模型的基本单位;语粒说明它看起来像什么;词码则解释它在数字系统中怎样存在和运作。
"词码"最大的技术挑战,是必须稳定地区分 token 与 token ID;最大的传播优势,则是能够把离散符号、编号映射、序列处理、上下文计量和服务计费纳入同一个认知框架。
当前正式场景仍宜采用"词元(token)"。但从中文术语演化和公众理解看,"词码"值得继续讨论、测试和使用反馈。
参与讨论
欢迎围绕以下问题提交 Issue 或展开讨论:
- "词码"是否会被普遍误解为 token ID?
- "词码化器"是否比"词元化器"更自然?
- 在图像、音频和动作 token 场景中,"词码"是否仍然适用?
- 正式术语与公众科普是否应该允许双层表达?
- 是否存在兼顾技术准确性与大众直觉的更优译名?
参考资料
- 全国科学技术名词审定委员会:《关于发布试用人工智能领域名词 token 中文名"词元"的公告》,2026年3月25日。
- 中国科学院 / 《中国科学报》:《专家解读 token 中文名为何定为"词元"》,2026年3月30日。
- OpenAI:Tokenizer 与 Token 基础说明。
- 语言学名词资料:"语码"及"语码转换"的既有术语含义。
- 数字通信资料:"码元(symbol)"的既有术语含义。
说明:本文讨论的是中文科技术语的技术准确性与传播效果。"词码"是候选表达,不改变"词元"目前作为优先推荐试用名称的规范地位。