1. 研究的是什么?机器学习是什么?
研究的是什么?
机器学习(Machine Learning, ML)是人工智能(AI)的一个核心子领域。它研究的不是"如何编写解决特定问题的代码",而是 "如何让计算机从数据中自动学习规律并改进性能" 。
其核心研究对象包括:
- 数据与模式: 如何从高维、噪声数据中提取有效的特征和潜在规律。
- 模型与假设空间: 设计什么样的数学结构(如神经网络、决策树)来拟合这些规律。
- 优化与学习机制: 如何通过算法自动调整模型参数,使其在未知数据上表现最好(即泛化能力)。
- 评估与理论边界: 为什么模型有效?需要多少数据才能学好?(涉及统计学习理论)。
机器学习是什么?
用一句经典定义概括:机器学习是一门多领域交叉学科,涉及概率论、统计学、逼近论、凸分析、算法复杂度理论等多门学科。
通俗来说,传统编程是 输入 + 规则 = 输出,而机器学习是 输入 + 输出 = 规则。它让计算机具备类似人类的"经验总结"能力,而不是死记硬背指令。
2. 有哪些经典算法?
机器学习算法通常按学习方式分类,以下是各领域的基石级算法:
表格
下载为表格
导出为图片
| 类别 | 经典算法 | 核心思想/特点 |
|---|---|---|
| 监督学习 (有标签) | 线性/逻辑回归 | 最基础的基线模型,解释性强,用于回归和二分类。 |
| 支持向量机 (SVM) | 寻找最大间隔超平面,引入核技巧处理非线性,小样本时代王者。 | |
| 决策树 / 随机森林 / GBDT / XGBoost | 基于树结构的集成方法。XGBoost/LightGBM 至今仍是结构化表格数据的竞赛与工业界首选。 | |
| K近邻 (KNN) | "物以类聚",基于距离度量,简单但计算量大。 | |
| 无监督学习 (无标签) | K-Means / DBSCAN | 聚类代表算法,分别基于质心划分和密度连通性。 |
| PCA / t-SNE | 降维与可视化,PCA保留方差,t-SNE保留局部流形结构。 | |
| 深度学习 (表示学习) | CNN (卷积神经网络) | 利用局部连接和权值共享,图像处理的事实标准。 |
| RNN / LSTM / Transformer | 序列建模。Transformer 凭借自注意力机制彻底改变了NLP及多模态领域。 | |
| 强化学习 (交互反馈) | Q-Learning / PPO | 通过与环境交互最大化累积奖励,PPO是目前最通用的策略梯度算法。 |
💡 提示: 没有"万能"的算法。根据"没有免费午餐定理",算法的选择高度依赖于数据类型、规模以及业务目标。
3. 机器学习跟数学/线性代数之间的关系
如果把机器学习比作一座大厦,数学就是地基和钢筋混凝土。不懂数学可以调用库(调包),但懂数学才能理解原理、调试模型和创新。
🔢 线性代数:机器学习的"语言"与"引擎"
线性代数是ML中最直接、最高频使用的数学工具:
- 数据的表示: 数据集被表示为矩阵 X∈Rn×dX∈Rn×d ,单个样本是向量。所有运算本质上是矩阵运算。
- 模型的表达: 神经网络的每一层本质上都是线性变换 y=Wx+by=Wx+b 加上非线性激活函数。权重 WW 就是矩阵。
- 计算效率: GPU加速的核心就是并行矩阵乘法。理解张量运算、广播机制是高效编程的前提。
- 核心分解技术: SVD(奇异值分解)、特征值分解是降维(PCA)、推荐系统、数据压缩的数学基础。
- 几何直觉: 点积衡量相似度,范数衡量距离/正则化,投影理解最小二乘法。
📐 其他关键数学分支
- 微积分(尤其是多元微积分): 用于优化。梯度下降法依赖偏导数和链式法则(反向传播的数学本质)来计算损失函数对参数的梯度。
- 概率论与数理统计: 用于建模不确定性。贝叶斯推断、极大似然估计、分布假设、正则化的概率解释等都离不开它。它是理解"为什么模型能泛化"的关键。
- 最优化理论: 研究如何将学习问题转化为凸/非凸优化问题,以及算法的收敛性保证。
📌 总结关系
线性代数提供了"骨架"和"运算载体",微积分提供了"学习动力"(梯度),概率统计提供了"灵魂"(不确定性与推断)。
对于初学者,建议优先掌握矩阵运算、特征值/SVD、梯度与链式法则、概率分布与贝叶斯公式,这足以支撑理解绝大多数经典算法和深度学习基础。