词形还原、词干提取、字词切分
分词 将字符串分割成标记。"标记"故意保持模糊,因为合适的粒度取决于任务。传统自然语言处理使用词级。变换模型使用子词级。没有空格的语言使用字符级。
词干提取 用规则切掉后缀。快速、激进、简单。running -> run。organization -> organ。第二个就是失败模式。
词形还原 使用语法知识将单词归约到词典形式。速度较慢,但准确,需要查找表或形态学分析器。ran -> run(需要知道"ran"是"run"的过去式)。better -> good(需要知道比较级形式)。
一文看懂自然语言处理NLP(4个应用+5个难点+6个实现步骤) | 管好 AI 这帮小兔崽子
OOV问题
OOV(Out-of-Vocabulary),即**"词汇表外词",指的是在自然语言处理(NLP)任务中,某个词没有出现在模型的预训练词汇表或训练数据中,导致模型无法直接识别或处理该词。
OOV的影响 机器翻译:无法翻译未登录词,导致漏译或错误翻译。 语音识别:无法识别新词或专有名词,输出错误文本。 文本分类/情感分析:丢失关键信息,影响预测准确性。 命名实体识别(NER):无法识别新的人名、机构名等。
OOV的解决方案 方法:将所有OOV**词替换成一个统一的标记(如 <UNK> 、 <OOV>)。 优点:简单易实现,适用于大多数NLP任务。 缺点:丢失词的具体信息,影响模型性能。
词性标注(part-of-speech tagging,缩写为POS tagging、PoS tagging或POST)
命名实体识别
命名实体识别(NER):从文本中精准提取人名、地名、机构名的完整指南 | 道满PythonAI - 道满PythonAI
句子分析
一文概览NLP句法分析:从理论到PyTorch实战解读 - 知乎
(一)WordNet:以同义词集为核心的词汇语义生态
1985年普林斯顿大学启动的WordNet项目,打破了传统词典的字母排序桎梏,以"人类认知中的词义关联"为核心构建词汇网络。其核心创新在于"同义词集(Synset)"------将表达同一概念的多个词形(如"car""automobile""motorcar")归为一组,形成语义的基本单元。每个Synset配备唯一标识符、注释(Gloss)及例句,精准区分易混淆语义,例如"bank"的两个核心Synset分别对应"金融机构"与"河岸"的释义。截至2.0版本,WordNet已涵盖15.2万个词形、11.5万个词义,形成覆盖名词、动词、形容词、副词的庞大体系,其中动词"run"的词义数量甚至超过其词形数量,直观反映了英语词汇的多义性特征。
Synset之间通过十余种语义关系编织成网,这些关系分为"纵向层级"与"横向关联"两类:纵向以上下位关系(Hypernym/Hyponym)构建概念层级,如"dog"→"canine"→"mammal"→"animal"的抽象链条;横向则通过同义、反义、部分整体(Part-of)、蕴涵(蕴含)等关系建立关联,如"buy"蕴含"pay","hot"反义于"cold"。这种网络结构使词汇语义具备了"可计算性"------通过Synset间的路径长度、层级深度等指标,可量化词义相似度,为NLP任务提供数学化的语义依据。
(二)知网:以义原为原子的概念常识解构
与WordNet聚焦词汇关联不同,知网(HowNet)由董振东先生于1999年提出,其核心目标是"揭示概念的本质及概念之间的关联",构建汉英双语的常识知识体系。知网的理论基石是"义原(Sememe)"------将概念拆解为不可再分的最小语义单位,如"人"可分解为"动物动物""智能智能""成年成年"等义原,"医生"则进一步补充"职业职业""治病治病"等特征义原。截至最新版本,知网共定义1618个义原,分为10大类,各类义原通过树状结构存储,类间则形成网状关联,构成覆盖概念语义的"原子库"。
知网对概念的描述通过"语义表达式(DEF字段)"实现,每个概念的DEF字段由义原及关系符号组成,精准刻画其语义本质与关联属性。例如"父亲"的DEF字段可表示为"人人∩男性男性∩直系亲属直系亲属∩长辈长辈∩生育关系→子女生育关系→子女",清晰展现其与"母亲""子女"的概念关联。这种"分解-组合"的逻辑,使知网突破了词汇的语言边界,能够捕捉不同语言中概念的本质共性------如英语"father"与汉语"父亲"虽词形迥异,却共享相同的核心义原集合,为跨语言语义对齐提供了底层支撑。
【自然语言处理】语义基石:WordNet与知网赋能自然语言处理的深层逻辑与实践路径 - 技术栈
基于统计的NLP技术
AI自然语言处理NLP原理与Python实战:31. NLP中的统计学习方法1.背景介绍 自然语言处理(Natural - 掘金
统计nlp的基本假设