01-NLP入门-什么是自然语言处理

01 NLP入门:什么是自然语言处理(附完整知识框架)

系列文章目录


前言

如果让我用一句话回答"NLP 是什么",我会说:

自然语言处理(Natural Language Processing, NLP)是让计算机能够"看懂"、"听懂"并"生成"人类语言的一门学科,它位于计算机科学、人工智能和语言学三者的交汇处。

你可能每天都在和 NLP 打交道------搜索时输入关键词、用语音助手定闹钟、让翻译软件翻译一段英文、甚至现在读到的这篇文章背后的推荐系统,背后都离不开 NLP 技术。

这篇文章是《NLP 教学专栏》的第一篇,我会带你建立一个完整的知识框架,为后续十篇文章的学习打下地基。


1. 什么是自然语言处理

自然语言是指人类在日常交流中使用的语言,如中文、英文、日文等。它和编程语言最大的区别在于:自然语言充满歧义、模糊和不规则

比如"苹果"既可以指水果,也可以指手机品牌;"他跑得很快"和"程序跑起来了"里的"跑"含义完全不同。正是因为这种复杂性,让机器理解语言才如此困难。

NLP 的核心目标可以拆成两个方向:

方向 含义 典型任务
理解(NLU) 让机器读懂文本的含义 文本分类、情感分析、命名实体识别
生成(NLG) 让机器用自然语言输出内容 机器翻译、文本摘要、对话生成

💡 小贴士:理解是"输入文本 → 语义表示",生成是"语义意图 → 输出文本",两者常常组合使用。


2. NLP 的发展历程

NLP 的发展可以粗略分为三个阶段,理解这个脉络能帮你理解为什么现在的技术长这样:

2.1 规则时代(1950s--1980s)

早期研究者试图用人工编写的规则来理解语言,比如"如果句子以'是否'开头,那它就是一个疑问句"。这种方式在限定场景下有效,但规则一旦遇到例外就崩溃,维护成本极高。

2.2 统计时代(1990s--2010s)

随着计算能力提升,研究者开始让机器从大量语料中自动学习统计规律。代表成果包括:

  • TF-IDF:衡量词在文档中的重要程度
  • N-gram 模型:基于词共现概率预测下一个词
  • 隐马尔可夫模型(HMM):用于分词、词性标注等序列任务

2.3 深度学习时代(2013--至今)

2013 年 Word2Vec 的提出,标志着分布式词向量成为主流。随后 RNN、LSTM、注意力机制、Transformer 相继登场,再到 BERT、GPT 等预训练大模型的爆发,NLP 进入了"预训练 + 微调"和"大模型"的新纪元。

📌 一句话总结:NLP 经历了"人写规则 → 机器统计 → 深度神经网络自动学习"的演进,今天的成果建立在前面几十年的积累之上。


3. NLP 的核心任务

下面用一张表梳理 NLP 领域最常见的任务,这也是后续文章会逐一深入的主题:

任务类型 任务名称 一句话说明
分类类 文本分类 判断一段文本属于哪个类别(如新闻分类)
分类类 情感分析 判断文本表达的是正面/负面/中性情绪
抽取类 命名实体识别(NER) 抽取人名、地名、机构名等实体
抽取类 关键词抽取 找出文本中最核心的词语
生成类 机器翻译 将一种语言翻译成另一种语言
生成类 文本摘要 把长文本压缩成简短摘要
生成类 对话系统 与用户进行多轮自然对话
匹配类 语义相似度 判断两句话语义是否相近
匹配类 问答系统(QA) 根据问题从文本中找出答案

4. NLP 的典型应用场景

NLP 已经渗透进我们生活的方方面面:

  • 搜索引擎:理解你的搜索意图,返回最相关的结果
  • 智能客服:自动回答用户常见问题,减轻人工压力
  • 语音助手:Siri、小爱同学等,听懂你的语音指令
  • 机器翻译:出国旅行、阅读外文资料的必备工具
  • 内容推荐:理解文章主题,给你推荐感兴趣的内容
  • 舆情分析:监控社交媒体上公众对品牌的情感倾向

5. 一个完整的 NLP 项目长什么样

无论任务多复杂,一个标准的 NLP 项目流程基本固定,这也是本专栏第 10 篇文章要动手实践的内容:

text 复制代码
原始文本 → 文本预处理 → 特征/向量化 → 模型训练 → 模型评估 → 部署上线

其中每一步都有对应的技术栈:

步骤 常用技术/工具
文本预处理 jieba、正则表达式、去停用词
特征/向量化 TF-IDF、Word2Vec、BERT 向量
模型训练 逻辑回归、LSTM、Transformer
模型评估 准确率、精确率、召回率、F1
部署上线 Flask、FastAPI、Docker

6. 学习 NLP 需要什么基础?

如果你是零基础,不用害怕,按下面的路径准备即可:

  1. Python 基础:变量、循环、函数、列表/字典,会用第三方库
  2. 机器学习基础:理解什么是训练、特征、模型、评估
  3. 线性代数基础:向量、矩阵、点积(理解词向量必备)
  4. 一点点概率统计:条件概率、贝叶斯公式(理解语言模型必备)

不需要一上来就啃高深的数学推导,先跑通流程,再回头补理论,是最适合入门者的策略。


总结

这一篇我们建立了 NLP 的整体认知:

  • NLP 是让机器理解并生成人类语言的学科
  • 它经历了规则 → 统计 → 深度学习三个阶段
  • 常见任务包括分类、抽取、生成、匹配四大类
  • 应用场景覆盖搜索、客服、翻译、推荐等
  • 标准项目流程是"预处理 → 向量化 → 训练 → 评估 → 部署"

下一篇我们将进入实战第一步:文本预处理,学会把原始、杂乱的文本清洗成干净、可用的语料。

📌 下篇预告02 文本预处理:从原始文本到干净语料


参考资料

  • 宗成庆.《统计自然语言处理》
  • Christopher D. Manning. Introduction to Information Retrieval
  • CSDN 技术社区 NLP 相关专栏
相关推荐
飞Link14 分钟前
动作方法中的分割与过度分割方法全解析(含代码实战与踩坑案例)
人工智能·python·算法·计算机视觉
小鹿的周先生24 分钟前
第四章-SpringAI-函数调用&ToolCalling
开发语言·人工智能·python
minhuan25 分钟前
AI Infra全栈拆解:大模型应用背后的基础设施,算力集群、网络、存储与服务治理体系26.0
人工智能·架构·ai infra·ai基础设施·ai任务调度
江畔柳前堤26 分钟前
具身智能全景深度指南(2026年9月版):从“会聊天的AI“到“能干活的机器“
大数据·javascript·图像处理·人工智能·分布式·智慧城市·原型模式
麻花地35 分钟前
RealTalk_AI:基于 Qwen3.5 LiveTranslate 的实时双向语音翻译工具
人工智能
张继雁37 分钟前
不同类型磨削液使用安全注意事项
人工智能·深度学习·安全·业界资讯·远程工作·空间计算
Mr数据杨38 分钟前
用会计信息做GDP增速预测的时序回归实战解析
人工智能·数据分析·kaggle竞赛
ClouGence40 分钟前
一句话直出可运行程序!GLM‑5.3 系列多任务实测
人工智能·agent·ai编程
Mr数据杨1 小时前
企业年报文本变化预测实战 从文本回归到信息披露分析
人工智能·数据分析·kaggle竞赛