NLP英文分词

词级分词(word level)

词级分词是指将文本按词语切分。是最传统、最直观的分词方式。英文中,空格和标点往往是天然的分隔符。

分词效果如下:

缺陷 :

词级分词,在实际应用中,容易出现未知词(Out of Vocabulary)问题。例如此表中已有

复制代码
I love you he her ...

如果分词中突然出现个chatGPT,模型就无法识别到这个词。只能用UNK标记。使用字符级分词,就不会有这个问题。如下。

字符级分词 (character level)

字符级分词,是以单个字符为最小单元的分词方法。文本中的每一个字母、数字、标点甚至空格,都被视作一个独立的token。效果如下:

这种分词方式不会有oov问题。

缺陷 :

单个字符语义信息极弱,输入序列长度大大增加。

子词级分词 (subword level)

子词分词,是基于词级分词和字符级分词之间的一种分词方法。它将词语切分成更小的单元:子词(subword),例如:词根、前缀、后缀、词片段。

与词级分词相比,可以缓解OOV问题。

与字符级分词相比,它能更好的保留一定的语义结构。

子词分词,可以在 https://tiktokenizer.vercel.app/ 体验,如下图.

图中,有6个单词,用子词级分词,得到8个token。

常见的子词算法有:

  • BPE(Byte Pair Encoding)
  • WordPiece
  • Unigram Language Model

其中,BPE是最早被广泛应用的字词分词方法。其基本思想是,在训练阶段,首先将语料中的词汇拆分为单个字符,构建初始此表;然后统计语料中,出现频率最高的相邻字符对,将其合并为新的子词单元,并加入词表。这个过程持续进行,直到此表达到预设上限。

关于BPE算法,详细可以了解:https://huggingface.co/learn/llm-course/chapter6/5?fw=pt

相关推荐
Dawson Zhu13 分钟前
《Agentic Design Patterns》第 9 章导读:学习与适应(Learning and Adaptation)
人工智能·语言模型·架构·aigc·agi
IT研究所20 分钟前
AI-ITR平台如何减少客户问题反复升级?
大数据·运维·人工智能·低代码·自然语言处理·安全架构·企微
SEO_juper30 分钟前
用 Python 写一个 GEO 可见性检查脚本:你的网站现在能被 AI 引用吗
开发语言·人工智能·爬虫·python·seo·外贸独立站
小易老师AI实战36 分钟前
RLHF深度详解(超通俗+原理+工程+对比):大模型对齐的核心基石
人工智能·大模型·sft·rlhf·ppo·人类反馈强化学习·llm 对齐
资深电气设计37 分钟前
高压直流母线系统测试是什么?宜迈思液冷直流负载方案技术说明
人工智能
数智工坊38 分钟前
视觉SLAM第12讲|地图构建:单目稠密重建、RGB-D点云与八叉树地图全解析
人工智能·深度学习·矩阵·机器人
回眸&啤酒鸭1 小时前
【回眸】OpenSwarm 多智能体协作系统实战指南
大数据·前端·人工智能
博图光电1 小时前
Libra 27105相关技术参数
人工智能·数码相机
IT_陈寒1 小时前
SpringBoot自动配置差点让我加班到凌晨
前端·人工智能·后端
yumgpkpm2 小时前
Acceldata ODP(Open Data Platform)3.3.6.4(RHEL9)保姆级完整安装手册
大数据·人工智能·hive·hadoop·kafka·hbase·cloudera