【大模型】分词粒度

如何理解分词粒度?

分词粒度是一种要从哪种角度进行分词的;可以包括字符级(character level)、单词级(word level)、子词级(sub-word level)、(字节级(byte level));(很难说字节级应该被认为是一种技巧还是一种分词粒度)

例如对于一句话:This is the Hugging Face Course.,
字符级分词会按照单个字符进行分词,对于上面这段文本,可以分割为:

python 复制代码
['T', 'h', 'i', 's', 't', 'e', 'H', 'u', 'g', 'n', 'F', 'a', 'c', 'C', 'o', 'u', 'r', '.']

如果不区分大小写的话(bert-base-uncased是一个不区分大小写的分词器):会先将原文本全部变为小写:This is the Hugging Face Course.->this is the hugging face course.

python 复制代码
['t', 'h', 'i', 's', 'e', 'u', 'g', 'n', 'f', 'a', 'c', 'o', 'u', 'r', '.']

对于中文而言,以你好,这是一篇关于分词粒度的博客!为例,则会被分割为:

python 复制代码
['你', '好', '这', '是', '一', '篇', '关', '于', '分', '词', '粒', '度', '的', '博', '客']

单词级分词则会按照词进行分词,这种方法对于英文而言十分方便简单:

python 复制代码
['This', 'is', 'Hugging', 'Face', 'Course', '.']

如果按照句子中的空格进行分词,['This', 'is', 'Hugging', 'Face', 'Course.']

中文使用词汇级的分词器似乎并不是很多,似乎也不是很合适。
子词级分词按照词的子词进行分词,类似于利用词根词缀来进行分词。

python 复制代码
['This', 'is', 'the', 'Hu', '##gging', 'Face', 'Course', '.']

中文也有对应的子词级的分词,仍然是上述的文本:

python 复制代码
['你好', ',', '这', '是一', '篇', '关于', '分', '词', '粒', '度', '的', '博客', '!']

(中文分词来自于Qwen2.5

拿房子举个例子叭,尽管不一定贴切;有一个房子,我们可以将房子拆分为厨房、卧室、客厅、卫生间...,这是一种粒度;可以继续拆分为砖、水泥,玻璃...,这又是一种更细的粒度;砖、水泥、玻璃都可以被继续分解为沙子、泥等;这还是一种粒度,因此,房子到底是由什么组成的,取决于从哪种粒度上进行分析。
什么是字符? 字符可以理解文本数据中最小的组成部分。

字符可以是:

字母:AB

数字:01

标点符号:!?

特殊符号:@#

空格、换行等控制字符;

汉字:

等等

相关推荐
阿杰学AI9 小时前
AI核心知识115—大语言模型之 自监督学习(简洁且通俗易懂版)
人工智能·学习·ai·语言模型·aigc·监督学习·自监督学习
Zzj_tju9 小时前
大语言模型技术指南:Transformer 为什么能成为基础架构?核心模块与参数怎么理解
人工智能·语言模型·transformer
gorgeous(๑>؂<๑)9 小时前
【CVPR26-韩国科学技术院】令牌扭曲技术助力多模态大语言模型从邻近视角观察场景
人工智能·语言模型·自然语言处理
Zzj_tju11 小时前
大语言模型和视觉语言模型技术指南:从 Transformer 到多模态系统,全景看懂主流路线
人工智能·语言模型·transformer
2301_7644413313 小时前
2026年1月至4月期间,大模型招投标市场态势
人工智能·语言模型·信息与通信
kyle-fang13 小时前
主流微调工具
人工智能·语言模型
飞Link16 小时前
【AI大模型实战】万字长文肝透大语言模型(LLM):从底层原理解析到企业级Python项目落地
开发语言·人工智能·python·语言模型·自然语言处理
nap-joker17 小时前
基于大语言模型的大规模人群中的生物年龄预测
人工智能·语言模型·自然语言处理·生物年龄·器官特异的生物年龄
Omics Pro17 小时前
上海AI Lab+复旦大学:双轨协同实现自动化虚拟细胞建模
运维·人工智能·语言模型·自然语言处理·数据挖掘·数据分析·自动化
sp_fyf_202418 小时前
【大语言模型】 揭秘OPD:大语言模型的长度膨胀与稳定化策略
人工智能·深度学习·神经网络·机器学习·语言模型