01-NLP入门-什么是自然语言处理

01 NLP入门:什么是自然语言处理(附完整知识框架)

系列文章目录


前言

如果让我用一句话回答"NLP 是什么",我会说:

自然语言处理(Natural Language Processing, NLP)是让计算机能够"看懂"、"听懂"并"生成"人类语言的一门学科,它位于计算机科学、人工智能和语言学三者的交汇处。

你可能每天都在和 NLP 打交道------搜索时输入关键词、用语音助手定闹钟、让翻译软件翻译一段英文、甚至现在读到的这篇文章背后的推荐系统,背后都离不开 NLP 技术。

这篇文章是《NLP 教学专栏》的第一篇,我会带你建立一个完整的知识框架,为后续十篇文章的学习打下地基。


1. 什么是自然语言处理

自然语言是指人类在日常交流中使用的语言,如中文、英文、日文等。它和编程语言最大的区别在于:自然语言充满歧义、模糊和不规则

比如"苹果"既可以指水果,也可以指手机品牌;"他跑得很快"和"程序跑起来了"里的"跑"含义完全不同。正是因为这种复杂性,让机器理解语言才如此困难。

NLP 的核心目标可以拆成两个方向:

方向 含义 典型任务
理解(NLU) 让机器读懂文本的含义 文本分类、情感分析、命名实体识别
生成(NLG) 让机器用自然语言输出内容 机器翻译、文本摘要、对话生成

💡 小贴士:理解是"输入文本 → 语义表示",生成是"语义意图 → 输出文本",两者常常组合使用。


2. NLP 的发展历程

NLP 的发展可以粗略分为三个阶段,理解这个脉络能帮你理解为什么现在的技术长这样:

2.1 规则时代(1950s--1980s)

早期研究者试图用人工编写的规则来理解语言,比如"如果句子以'是否'开头,那它就是一个疑问句"。这种方式在限定场景下有效,但规则一旦遇到例外就崩溃,维护成本极高。

2.2 统计时代(1990s--2010s)

随着计算能力提升,研究者开始让机器从大量语料中自动学习统计规律。代表成果包括:

  • TF-IDF:衡量词在文档中的重要程度
  • N-gram 模型:基于词共现概率预测下一个词
  • 隐马尔可夫模型(HMM):用于分词、词性标注等序列任务

2.3 深度学习时代(2013--至今)

2013 年 Word2Vec 的提出,标志着分布式词向量成为主流。随后 RNN、LSTM、注意力机制、Transformer 相继登场,再到 BERT、GPT 等预训练大模型的爆发,NLP 进入了"预训练 + 微调"和"大模型"的新纪元。

📌 一句话总结:NLP 经历了"人写规则 → 机器统计 → 深度神经网络自动学习"的演进,今天的成果建立在前面几十年的积累之上。


3. NLP 的核心任务

下面用一张表梳理 NLP 领域最常见的任务,这也是后续文章会逐一深入的主题:

任务类型 任务名称 一句话说明
分类类 文本分类 判断一段文本属于哪个类别(如新闻分类)
分类类 情感分析 判断文本表达的是正面/负面/中性情绪
抽取类 命名实体识别(NER) 抽取人名、地名、机构名等实体
抽取类 关键词抽取 找出文本中最核心的词语
生成类 机器翻译 将一种语言翻译成另一种语言
生成类 文本摘要 把长文本压缩成简短摘要
生成类 对话系统 与用户进行多轮自然对话
匹配类 语义相似度 判断两句话语义是否相近
匹配类 问答系统(QA) 根据问题从文本中找出答案

4. NLP 的典型应用场景

NLP 已经渗透进我们生活的方方面面:

  • 搜索引擎:理解你的搜索意图,返回最相关的结果
  • 智能客服:自动回答用户常见问题,减轻人工压力
  • 语音助手:Siri、小爱同学等,听懂你的语音指令
  • 机器翻译:出国旅行、阅读外文资料的必备工具
  • 内容推荐:理解文章主题,给你推荐感兴趣的内容
  • 舆情分析:监控社交媒体上公众对品牌的情感倾向

5. 一个完整的 NLP 项目长什么样

无论任务多复杂,一个标准的 NLP 项目流程基本固定,这也是本专栏第 10 篇文章要动手实践的内容:

text 复制代码
原始文本 → 文本预处理 → 特征/向量化 → 模型训练 → 模型评估 → 部署上线

其中每一步都有对应的技术栈:

步骤 常用技术/工具
文本预处理 jieba、正则表达式、去停用词
特征/向量化 TF-IDF、Word2Vec、BERT 向量
模型训练 逻辑回归、LSTM、Transformer
模型评估 准确率、精确率、召回率、F1
部署上线 Flask、FastAPI、Docker

6. 学习 NLP 需要什么基础?

如果你是零基础,不用害怕,按下面的路径准备即可:

  1. Python 基础:变量、循环、函数、列表/字典,会用第三方库
  2. 机器学习基础:理解什么是训练、特征、模型、评估
  3. 线性代数基础:向量、矩阵、点积(理解词向量必备)
  4. 一点点概率统计:条件概率、贝叶斯公式(理解语言模型必备)

不需要一上来就啃高深的数学推导,先跑通流程,再回头补理论,是最适合入门者的策略。


总结

这一篇我们建立了 NLP 的整体认知:

  • NLP 是让机器理解并生成人类语言的学科
  • 它经历了规则 → 统计 → 深度学习三个阶段
  • 常见任务包括分类、抽取、生成、匹配四大类
  • 应用场景覆盖搜索、客服、翻译、推荐等
  • 标准项目流程是"预处理 → 向量化 → 训练 → 评估 → 部署"

下一篇我们将进入实战第一步:文本预处理,学会把原始、杂乱的文本清洗成干净、可用的语料。

📌 下篇预告02 文本预处理:从原始文本到干净语料


参考资料

  • 宗成庆.《统计自然语言处理》
  • Christopher D. Manning. Introduction to Information Retrieval
  • CSDN 技术社区 NLP 相关专栏
相关推荐
回眸&啤酒鸭2 天前
【回眸】Minicart 电商购物车核心功能落地指南
人工智能
一隅论数智2 天前
给AI一张“业务概念地图“:本体如何从哲学走向企业智能
大数据·人工智能·经验分享·笔记·学习·学习方法·政务
AI的探索之旅2 天前
97 个 OpenCV 实例(三十):双目立体,从标定到点云
人工智能·opencv·计算机视觉
AlbertZein2 天前
Step-5-Preview 上手实测:3D 游戏、金融分析、网页设计一次跑完
人工智能·aigc
LaughingZhu2 天前
Product Hunt 每日热榜 | 2026-09-19
人工智能·深度学习·神经网络·搜索引擎·百度
美狐美颜SDK开放平台2 天前
开发直播APP时如何接入视频美颜SDK?开发流程与注意事项
android·人工智能·计算机视觉·音视频·直播美颜sdk
wukangjupingbb2 天前
智能网联汽车安全能力框架
人工智能
龙亘川2 天前
明月照湾区,智启新赛道:从顶流文旅IP盛会看智慧文旅升级路径
人工智能·智慧城市·开源软件·数据可视化
飞猫的边缘AI2 天前
边缘AI应用:家用AI摄像头怎么做数据训练?
人工智能·边缘计算·ai算法·边缘ai