数据挖掘可以挖掘什么类型的模式?

一、挖掘频繁模式、关联和相关性

频繁模式(frequent pettern)是在数据中频繁出现的模式。

频繁项集一般是指频繁的在事务数据集中一起出现的商品的集合。

频繁出现的子序列,如顾客倾向于先买相机,再买内存卡这样的模式就是一个(频繁)序列模式。

子结构可能涉及不同的机构模式,如图、数或格。如果一个子结构频繁出现,则可称为(频繁)结构模式。

挖掘频繁模式可以发现数据中有趣的关联和相关性。

关联规则可分为单维关联规则和多维关联规则。

二、用于预测分析的分类与回归

分类是找出描述和区分数据类或概念的模型,以便能够使用模型预测类标号未知的对象的类标号。

分类和回归是有监督的学习方法。数据集分为训练集和测试集。

分类是预测类别的标号。

回归是建立连续值函数模型,即用来预测难以获得的数据值或缺失的数据。

两种方法可以成为数值预测和类标号预测。

三、聚类分析

聚类分析是一种无监督的学习方法。

聚类的特点是最大化类簇间的距离、最小化类簇内样本的距离。

四、离群点分析

大部分数据挖掘方法都将离群点视为噪声或异常而丢弃。

但在欺诈检测等应用中,离群点的出现则很重要。


参考文献:数据挖掘:概念与技术(原书第三版)

相关推荐
#卢松松#2 分钟前
用AI做网站,已经到了找BUG阶段了
人工智能·创业创新
ysu_03144 分钟前
PINNs的参数反演——从“正问题”到“逆问题”的工程改造
人工智能·pytorch·深度学习·mcmc·参数反演·逆问题·darcy流
joinwell524 分钟前
没收到回复,再点一次会启动两个 AI 吗?
人工智能·后端
hzxxxz5 分钟前
2000份投稿里的共性-工具建设可复用的4条原则
人工智能
Bolt5 分钟前
Agent: 将 harness 工程升级到认知工程
人工智能·架构·agent
桃西西呀6 分钟前
限速 30 和限速 80 只差一个数字,卷积网络怎么分得清?
人工智能·深度学习·llm
Behaviour11 分钟前
Sam Altman 预热本周重磅产品发布,或为 GPT-6 Sol
人工智能·chatgpt·aigc·openai·vibecoding
宣宣猪的小花园.15 分钟前
【机器学习】过拟合与泛化:模型为什么会“刷题很强、实战失灵”
人工智能·算法·机器学习
71777716 分钟前
有没有国产 GitLab?Gitee 与极狐 GitLab 等主流替代方案对比
人工智能·gitee
幂律智能24 分钟前
幂律副总裁李融受邀参加新加坡 TechLaw.Fest 圆桌讨论,分享中国法律科技创新实践
人工智能