【Transformer】Tokenization详解_BPE_WordPiece_SentencePiece摘要:大模型处理的不是“字”或“词”,而是 token。Tokenization 决定一段文本会被切成多少 token,直接影响上下文长度、API 成本、训练效率、KV Cache、RAG 分块、代码能力和多语言效果。本文从“为什么不能直接按词切分”讲起,解释 token、token id、vocab、embedding 的关系,再用可运行的小实验讲清 BPE、WordPiece、SentencePiece 的直觉,最后讨论特殊 token、chat template、token 成本和 tokenize