01 NLP入门:什么是自然语言处理(附完整知识框架)
系列文章目录
前言
如果让我用一句话回答"NLP 是什么",我会说:
自然语言处理(Natural Language Processing, NLP)是让计算机能够"看懂"、"听懂"并"生成"人类语言的一门学科,它位于计算机科学、人工智能和语言学三者的交汇处。
你可能每天都在和 NLP 打交道------搜索时输入关键词、用语音助手定闹钟、让翻译软件翻译一段英文、甚至现在读到的这篇文章背后的推荐系统,背后都离不开 NLP 技术。
这篇文章是《NLP 教学专栏》的第一篇,我会带你建立一个完整的知识框架,为后续十篇文章的学习打下地基。

1. 什么是自然语言处理
自然语言是指人类在日常交流中使用的语言,如中文、英文、日文等。它和编程语言最大的区别在于:自然语言充满歧义、模糊和不规则。
比如"苹果"既可以指水果,也可以指手机品牌;"他跑得很快"和"程序跑起来了"里的"跑"含义完全不同。正是因为这种复杂性,让机器理解语言才如此困难。
NLP 的核心目标可以拆成两个方向:
| 方向 | 含义 | 典型任务 |
|---|---|---|
| 理解(NLU) | 让机器读懂文本的含义 | 文本分类、情感分析、命名实体识别 |
| 生成(NLG) | 让机器用自然语言输出内容 | 机器翻译、文本摘要、对话生成 |
💡 小贴士:理解是"输入文本 → 语义表示",生成是"语义意图 → 输出文本",两者常常组合使用。
2. NLP 的发展历程
NLP 的发展可以粗略分为三个阶段,理解这个脉络能帮你理解为什么现在的技术长这样:
2.1 规则时代(1950s--1980s)
早期研究者试图用人工编写的规则来理解语言,比如"如果句子以'是否'开头,那它就是一个疑问句"。这种方式在限定场景下有效,但规则一旦遇到例外就崩溃,维护成本极高。
2.2 统计时代(1990s--2010s)
随着计算能力提升,研究者开始让机器从大量语料中自动学习统计规律。代表成果包括:
- TF-IDF:衡量词在文档中的重要程度
- N-gram 模型:基于词共现概率预测下一个词
- 隐马尔可夫模型(HMM):用于分词、词性标注等序列任务
2.3 深度学习时代(2013--至今)
2013 年 Word2Vec 的提出,标志着分布式词向量成为主流。随后 RNN、LSTM、注意力机制、Transformer 相继登场,再到 BERT、GPT 等预训练大模型的爆发,NLP 进入了"预训练 + 微调"和"大模型"的新纪元。
📌 一句话总结:NLP 经历了"人写规则 → 机器统计 → 深度神经网络自动学习"的演进,今天的成果建立在前面几十年的积累之上。
3. NLP 的核心任务
下面用一张表梳理 NLP 领域最常见的任务,这也是后续文章会逐一深入的主题:
| 任务类型 | 任务名称 | 一句话说明 |
|---|---|---|
| 分类类 | 文本分类 | 判断一段文本属于哪个类别(如新闻分类) |
| 分类类 | 情感分析 | 判断文本表达的是正面/负面/中性情绪 |
| 抽取类 | 命名实体识别(NER) | 抽取人名、地名、机构名等实体 |
| 抽取类 | 关键词抽取 | 找出文本中最核心的词语 |
| 生成类 | 机器翻译 | 将一种语言翻译成另一种语言 |
| 生成类 | 文本摘要 | 把长文本压缩成简短摘要 |
| 生成类 | 对话系统 | 与用户进行多轮自然对话 |
| 匹配类 | 语义相似度 | 判断两句话语义是否相近 |
| 匹配类 | 问答系统(QA) | 根据问题从文本中找出答案 |
4. NLP 的典型应用场景
NLP 已经渗透进我们生活的方方面面:
- 搜索引擎:理解你的搜索意图,返回最相关的结果
- 智能客服:自动回答用户常见问题,减轻人工压力
- 语音助手:Siri、小爱同学等,听懂你的语音指令
- 机器翻译:出国旅行、阅读外文资料的必备工具
- 内容推荐:理解文章主题,给你推荐感兴趣的内容
- 舆情分析:监控社交媒体上公众对品牌的情感倾向
5. 一个完整的 NLP 项目长什么样
无论任务多复杂,一个标准的 NLP 项目流程基本固定,这也是本专栏第 10 篇文章要动手实践的内容:
text
原始文本 → 文本预处理 → 特征/向量化 → 模型训练 → 模型评估 → 部署上线
其中每一步都有对应的技术栈:
| 步骤 | 常用技术/工具 |
|---|---|
| 文本预处理 | jieba、正则表达式、去停用词 |
| 特征/向量化 | TF-IDF、Word2Vec、BERT 向量 |
| 模型训练 | 逻辑回归、LSTM、Transformer |
| 模型评估 | 准确率、精确率、召回率、F1 |
| 部署上线 | Flask、FastAPI、Docker |
6. 学习 NLP 需要什么基础?
如果你是零基础,不用害怕,按下面的路径准备即可:
- Python 基础:变量、循环、函数、列表/字典,会用第三方库
- 机器学习基础:理解什么是训练、特征、模型、评估
- 线性代数基础:向量、矩阵、点积(理解词向量必备)
- 一点点概率统计:条件概率、贝叶斯公式(理解语言模型必备)
不需要一上来就啃高深的数学推导,先跑通流程,再回头补理论,是最适合入门者的策略。
总结
这一篇我们建立了 NLP 的整体认知:
- NLP 是让机器理解并生成人类语言的学科
- 它经历了规则 → 统计 → 深度学习三个阶段
- 常见任务包括分类、抽取、生成、匹配四大类
- 应用场景覆盖搜索、客服、翻译、推荐等
- 标准项目流程是"预处理 → 向量化 → 训练 → 评估 → 部署"
下一篇我们将进入实战第一步:文本预处理,学会把原始、杂乱的文本清洗成干净、可用的语料。
📌 下篇预告 :02 文本预处理:从原始文本到干净语料
参考资料
- 宗成庆.《统计自然语言处理》
- Christopher D. Manning. Introduction to Information Retrieval
- CSDN 技术社区 NLP 相关专栏