机器学习入门笔记 | 基础算法及其应用场景

监督式机器学习是最常用且最成功的机器学习类型之一。

当你希望根据给定的输入来预测某个结果,并且我们有输入/输出对示例时,就使用监督学习。我们根据这些输入/输出对来构建机器学习模型,这些对构成了我们的训练集。

那些从输入/输出对中学习的机器学习算法被称为监督学习算法。

监督学习通常先需要人工来构建训练集,之后就能实现自动化处理,从而加快原本繁琐或难以完成的任务。目标是对从未见过的新数据做出准确的预测。

监督机器学习问题主要有两种类型,分类和回归。

在机器学习过程中,最重要的一环或许就是理解你所处理的数据,以及这些数据与你要解决的问题之间有何关联。随机选择一种算法并把数据输入其中是无效的。在开始构建模型之前,有必要先了解数据集中的情况。每种算法在适用数据类型及问题场景方面都有所不同。

对于许多算法而言,设置合适的参数对于获得良好性能至关重要。有些算法对我们如何表示输入数据也很敏感,尤其是特征的缩放方式。

如果不了解模型的假设条件以及参数设置的含义,就盲目地将算法应用于数据集,则很难得到准确的模型。了解这些模型及其在特定情境下的应用场景,对于在实际应用中成功运用机器学习来说至关重要。

最近邻点

对于小型数据集而言,适合作为基准,易于解释。

线性模型

作为首选算法来尝试,它适用于非常大的数据集,也适用于极高维度的数据。

朴素贝叶斯

仅用于分类。比线性模型更快,适用于非常大的数据集和高维数据,但通常不如线性模型准确。

决策树

运行速度极快,无需对数据进行缩放,可可视化且易于解释。

随机森林

几乎总能优于单个决策树,具有很强的鲁棒性和强大性能。无需数据缩放,但不适用于极高维稀疏数据。

梯度提升决策树

通常略优于随机森林。训练速度较慢,但预测速度比随机森林更快,内存占用更小。相比随机森林,需要更多的参数调优。

支持向量机

对于特征含义相似、规模中等的数据集效果很好。需要对数据进行缩放,且对参数敏感。

神经网络

能够构建非常复杂的模型,尤其适用于大数据集。对数据缩放和参数选择较为敏感。大型模型训练所需时间较长。


在构建机器学习解决方案时,你应该牢记以下问题:我收集到的数据能够回答那个问题吗?将我的问题表述为机器学习问题的最佳方式是什么?我收集的数据是否足以代表我想要解决的问题?我提取了数据的哪些特征?这些特征能否帮助做出正确的预测?这个机器学习解决方案将如何与我研究或商业产品的其他部分进行交互?

在处理新数据集时,最好从简单的模型开始,比如线性模型、朴素贝叶斯或最近邻分类器,看看能取得怎样的效果。在对数据有了更多了解之后,再考虑使用能够构建更复杂模型的算法,如随机森林、梯度提升决策树、SVM或神经网络。

在不同数据集上试验这些算法,能有更深入的理解。

相关推荐
不会就选b42 分钟前
算法日常・每日刷题--<贪心>7
数据结构·算法·leetcode
moonrailgun1 小时前
用 Node.js 复刻 Codex Astra 的终端星光
前端·javascript·算法
ai小陈2 小时前
PyTorch Profiler性能分析实战:定位GPU训练中的慢算子
人工智能·深度学习·机器学习·ai·性能优化·gpu算力
罗西的思考2 小时前
[Agent Memory / 强化学习] MemPO源码学习笔记 ---(1)--- 总体
人工智能·算法·机器学习
lvwangshu2 小时前
图论:LCA、树的直径、树的重心、二分图与 Tarjan 缩点
算法·图论
来让爷抱一个3 小时前
2026 语义缓存实战:把命中契约写进SPEC,MonkeyCode 云端跑通
人工智能·机器学习·缓存
302wanger3 小时前
干与湿:AI 拿走脑力之后,人剩下什么
算法
xiao5kou4chang6kai44 小时前
AI-XGBoost机器学习与生态—植被与土地利用识别、土壤碳氮空间预测、生物多样性驱动机制、土壤微生物功能预测、生态退化与风险识
人工智能·机器学习·生态·xgboost·地学
计算机编程-吉哥4 小时前
脑肿瘤MRI智能识别系统:基于深度学习的像素级脑肿瘤语义分割平台【计算机毕业设计选题推荐】
人工智能·python·深度学习·算法·毕业设计·课程设计·大数据毕业设计选题推荐
自小吃多4 小时前
高云FPGA ModelSim中的仿真
笔记·嵌入式硬件·fpga开发