深度学习
深度学习,是机器学习的分支,它是通过构建多层神经网络来实现自主学习和预测的能力。深度学习的核心是深度神经网络,它由多个层次的神经元组成,每一层都可以提前出不同的特征信息,从而实现对复杂数据的学习和预测。深度学习的应用范围非常广泛,包括图像识别、语言识别、自然语言处理等领域。
相比于传统机器学习(如SVM、决策树)需要人工设计特征(特征工程),深度学习本质区别在于,它不仅能自动学习参数(权重),更重要的是,它能通过多层结构自动从原始数据中逐层构建出高层次的抽象特征(如从像素到边缘,再到轮廓,最后到物体部件),从⽽避免了传统机器学习中繁琐的⼈⼯特征⼯程。
神经⽹络的参数学习就是深度学习,典型的神经⽹络架构如下所示。

输⼊层和输出层之间的层被称为隐藏层,层与层之间的连接密度和类型构成了网络的配置。
神经⽹络由多个层组成,包括:
输⼊层(Input Layer):接收原始输⼊数据。
隐藏层(Hidden Layer):对输⼊数据进行处理,可以有多个隐藏层。
输出层(Output Layer):产生最终的输出结果。
如果⽤数学语言描述深度学习的本质,它不再是简单的 y=f(x),而是:
y = f(...f(f(x))...)
这⾥的每个 f 通常代表神经网络的⼀层(Layer),而整个模型就是这些层功能的逐级嵌套。
按照数据模态分类
计算机视觉
图像分类是计算机视觉中最基础也是最核心的任务,给定一张输入图像,算法需要从预定义的类别集合中指定一个最能描述该图像内容的标签。识别图中是什么。

目标检测
目标检测可以理解为一个核心问题:它不仅要回答图像里有什么,还要回答他们在哪里。
目标检测的任务是:
识别:确定图像中物体的类别
定位:用一个边界框精确框出每个物体的位置

语义分割
语义分割是计算机视觉中比目标检测更进一步的任务。如果说目标检测关心的是哪里有什么,那么语义检测关心的是每个像素是什么。
语义分割的目标是:将图像中的每一个像素点都划分到对应的类别中。

实例分割
在图像或者视频中,实例分割是将每个感兴趣的物体的轮廓精确描绘出来,并且区分开同一类别的不同个体。
目标跟踪
目标检测关注的是单张图片,而目标跟踪关注的是视频流。在视频的第一帧给定一个目标,在后续的帧中持续定位这个目标的位置。核心在于建立时序上的关联,知道这一帧的物体就是上一帧的那个物体。

关键点检测
关键点检测不关心物体的轮廓,它只寻找那些能定义形状的特定目标(x,y)。

文字与符号识别(OCR)
文字与符号识别,通常被归为光学字符识别的范畴,是计算机视觉中专门处理图像中的文字和符号任务。它的目标是:让计算机像人一样,从图片、视频帧或则扫描文档中读出文本内容,并转化为可编辑、可搜索的字符信息。
自然语言处理(NLP)
自然语言处理是人工智能领域中以自然语言文本为核心处理对象,研究如何建立人类语言形式与机器可计算机语义之间可逆映射关系的学科。它旨在赋予计算机具备对语⾔符号进⾏形态分析、语义理解、逻辑推理及连贯⽣成的能⼒,从⽽消除⼈类⾃然语⾔的模糊性、歧义性与机器严格指令系统之间的鸿沟。
常见任务:
自然语言理解:文本分类、情感分析、命名实体识别、语义相似度
自然语言生成:机器翻译、对话生成、文章摘要提取
值得注意的是,从之前的任务分类到大模型统一都是需要单独训练一个小模型,但是现在大语言模型已经通过一系列预训练+微调/提示词的方式,几乎能用同一个模型完成以上所有任务。
语音处理
语⾳处理是⼀⻔涉及信号处理、计算机科学、语⾔学和⼈⼯智能的交叉学科,核⼼⽬标是让机器能够分析、理解、合成和处理⼈类的语⾳信号。
常见任务
语音识别(微信语言转文字)、语音合成
多模态
多模态是⼈⼯智能领域的⼀个核⼼概念,指同时处理、理解或⽣成两种及以上不同类型数据(模
态)的技术。在⼈类认知中,我们天然就是多模态的------通过视觉、听觉、触觉等多种感官来理解世界。
常⻅的模态包括:
视觉:图像、视频、图表、⼿势
听觉:语⾳、⾳乐、环境声⾳
⽂本:⾃然语⾔、符号、代码
传感器数据:触觉(压⼒、振动)、深度图(如激光雷达)、惯性测量单元数据、体温等。
深度学习和传统机器学习的区别
| 对比维度 | 传统机器学习 | 深度学习 |
|---|---|---|
| 特征提取方式 | 高度依赖人工特征工程,需专家手动设计特征 | 端到端学习,自动从原始数据中抽象出高阶特征 |
| 模型可解释性 | 强可解释性(如决策树、线性回归),能清晰看到推理路径 | "黑盒"模型,内部复杂非线性映射难以直观解释决策逻辑 |
| 数据依赖性 | 小样本场景下效果稳定,不易过拟合 | 依赖海量标注数据,大数据规模下才展现压倒性性能优势 |
| 计算资源消耗 | 训练资源需求较低,普通机器即可运行 | 训练需庞大算力集群(GPU/TPU)和大存储投入 |
| 部署特点 | 模型通常轻量,易于部署 | 推理阶段经模型压缩后可部署到端侧设备 |