数据挖掘:关联规则,异常检测,挖掘的标准流程,评估指标,误差,聚类,决策树

数据挖掘:关联规则

2022找工作是学历、能力和运气的超强结合体,遇到寒冬,大厂不招人,可能很多算法学生都得去找开发,测开
测开的话,你就得学数据库,sql,oracle,尤其sql要学,当然,像很多金融企业、安全机构啥的,他们必须要用oracle数据库
这oracle比sql安全,强大多了,所以你需要学习,最重要的,你要是考网络警察公务员,这玩意你不会就别去报名了,耽误时间!
与此同时,既然要考网警之数据分析应用岗,那必然要考数据挖掘基础知识,今天开始咱们就对数据挖掘方面的东西好生讲讲 最最最重要的就是大数据,什么行测和面试都是小问题,最难最最重要的就是大数据技术相关的知识笔试


### 文章目录

  • [数据挖掘:关联规则](#文章目录 数据挖掘:关联规则 @TOC 关联规则 异常检测 数据挖掘的标准流程 数据挖掘的经典算法 训练误差和泛华误差 分类算法评估指标:hold-out method 聚类方法 总结)
  • [@[TOC](文章目录)](#文章目录 数据挖掘:关联规则 @TOC 关联规则 异常检测 数据挖掘的标准流程 数据挖掘的经典算法 训练误差和泛华误差 分类算法评估指标:hold-out method 聚类方法 总结)
  • [关联规则](#文章目录 数据挖掘:关联规则 @TOC 关联规则 异常检测 数据挖掘的标准流程 数据挖掘的经典算法 训练误差和泛华误差 分类算法评估指标:hold-out method 聚类方法 总结)
  • [异常检测](#文章目录 数据挖掘:关联规则 @TOC 关联规则 异常检测 数据挖掘的标准流程 数据挖掘的经典算法 训练误差和泛华误差 分类算法评估指标:hold-out method 聚类方法 总结)
  • [数据挖掘的标准流程](#文章目录 数据挖掘:关联规则 @TOC 关联规则 异常检测 数据挖掘的标准流程 数据挖掘的经典算法 训练误差和泛华误差 分类算法评估指标:hold-out method 聚类方法 总结)
  • [数据挖掘的经典算法](#文章目录 数据挖掘:关联规则 @TOC 关联规则 异常检测 数据挖掘的标准流程 数据挖掘的经典算法 训练误差和泛华误差 分类算法评估指标:hold-out method 聚类方法 总结)
  • [训练误差和泛华误差](#文章目录 数据挖掘:关联规则 @TOC 关联规则 异常检测 数据挖掘的标准流程 数据挖掘的经典算法 训练误差和泛华误差 分类算法评估指标:hold-out method 聚类方法 总结)
  • [分类算法评估指标:hold-out method](#文章目录 数据挖掘:关联规则 @TOC 关联规则 异常检测 数据挖掘的标准流程 数据挖掘的经典算法 训练误差和泛华误差 分类算法评估指标:hold-out method 聚类方法 总结)
  • [聚类方法](#文章目录 数据挖掘:关联规则 @TOC 关联规则 异常检测 数据挖掘的标准流程 数据挖掘的经典算法 训练误差和泛华误差 分类算法评估指标:hold-out method 聚类方法 总结)
  • [总结](#文章目录 数据挖掘:关联规则 @TOC 关联规则 异常检测 数据挖掘的标准流程 数据挖掘的经典算法 训练误差和泛华误差 分类算法评估指标:hold-out method 聚类方法 总结)

关联规则

如果相关性很大,那就可以去掉其中一个属性


异常检测

数据挖掘的标准流程





这些不仅是理论,更是实际业务会遇到的东西




NLP



长尾问题

数据挖掘的经典算法

这些可能会考的

去年就考了聚类哦

TP:实际为正,预测为正

FP:实际为负,预测为正

FN:实际为正,预测为负

TN:实际为负,预测为负

准确率acc,是TP和TN的在所有情况中的占比

recall ,数据中所有正类中,真正被预测为正类的比例。就是被真的召回的正类比例

precise ,在所有被预测为正类中,实际正类的比例【精确是正类的】这俩别混了

ROC是pr的曲线

检测出来了,但是你也不能误报

往往希望,recall高一点,而误报也要小

误报了

误报率是负样本认为正了

召回是1000个中的5个,好low

训练误差和泛华误差

分类算法评估指标:hold-out method

train和test,随机分组的交叉验证

k-fold,k组,但是每次k-1个为训练集,而剩下一组为训练集

轮番高k次

k一般是10,叫十指交叉验证

留一验证

当数据量很小,就留一个样本作为测试集

分组,组元素个数为1

聚类方法

先了解,后面会详细讲解的

看层次





Nt就是正类

Ntk是确实是真的正类

离差

Ck中的i与中心u的距离

l簇和u簇的中心距离,越远越好

C4.5算法

开始具体的算法了


总结

提示:重要经验:

1)

2)学好oracle,即使经济寒冬,整个测开offer绝对不是问题!同时也是你考公网络警察的必经之路。

3)笔试求AC,可以不考虑空间复杂度,但是面试既要考虑时间复杂度最优,也要考虑空间复杂度最优。

相关推荐
宋一诺334 小时前
机器学习——什么时候使用决策树
人工智能·决策树·机器学习
电鱼智能的电小鱼16 小时前
虚拟现实教育终端技术方案——基于EFISH-SCB-RK3588的全场景国产化替代
linux·网络·人工智能·分类·数据挖掘·vr
小王毕业啦19 小时前
2022年 国内税务年鉴PDF电子版Excel
大数据·人工智能·数据挖掘·数据分析·数据统计·年鉴·社科数据
坚持就完事了19 小时前
平滑技术(数据处理,持续更新...)
信息可视化·数据挖掘·数据分析
liuweidong080220 小时前
【Pandas】pandas DataFrame sample
python·数据挖掘·pandas
华科云商xiao徐21 小时前
网页抓取混淆与嵌套数据处理流程
爬虫·数据挖掘
XYu123011 天前
豆瓣图书评论数据分析与可视化
python·数据挖掘·数据分析
AIBigModel1 天前
经典ReLU回归!重大缺陷「死亡ReLU问题」已被解决
人工智能·数据挖掘·回归
苏苏susuus1 天前
机器学习:决策树和剪枝
决策树·机器学习·剪枝
qq_436962182 天前
奥威BI+AI数据分析:企业数智化转型的加速器
人工智能·数据挖掘·数据分析