金融机器学习方法:K-均值算法

目录

1.算法介绍

2.算法原理

3.python实现示例


1.算法介绍

K均值聚类算法是机器学习和数据分析中常用的无监督学习方法之一,主要用于数据的分类。它的目标是将数据划分为几个独特的、互不重叠的子集或"集群",以使得同一集群内的数据点彼此相似,而不同集群的数据点则尽可能不同。

2.算法原理

  1. 选择K个初始质心,这些质心可以是随机选取的数据点或其他方法得到的。
  2. 根据每个数据点到质心的距离,将其分配给最近的质心,形成K个集群。
  3. 重新计算每个集群的质心。
  4. 重复上述步骤,直到质心不再发生变化或达到一定的迭代次数

3.python实现示例

python 复制代码
import numpy as np
from sklearn.cluster import KMeans
import matplotlib.pyplot as plt

# 随机生成数据
np.random.seed(0)
points = np.vstack([
    np.random.normal(0, 0.5, size=(100, 2)),
    np.random.normal(1, 0.25, size=(100, 2)),
    np.random.normal(2, 0.6, size=(100, 2))
])

# 使用KMeans进行聚类
kmeans = KMeans(n_clusters=3)
kmeans.fit(points)
labels = kmeans.predict(points)
centroids = kmeans.cluster_centers_

# 可视化结果
plt.scatter(points[:, 0], points[:, 1], c=labels)
plt.scatter(centroids[:, 0], centroids[:, 1], color='red', marker='X')
plt.show()

结果图:


相关推荐
风吹心凉4 小时前
python3基础2026.7.22
开发语言·python
小猴子爱上树5 小时前
一站式解决图片视频翻译难题的高效AI工具
人工智能·python·音视频
weixin_538601976 小时前
智能体测开Day31
开发语言·python
lbb 小魔仙6 小时前
Git + Python 项目工作流最佳实践:pre-commit、CI、CHANGELOG 自动化
git·python·ci/cd
dyxal6 小时前
最长公共子序列(LCS)
python·算法
你驴我6 小时前
WhatsApp Cloud API 速率限制下的令牌桶与退避策略实践
网络·后端·python
AC赳赳老秦6 小时前
司法公开数据采集应用:OpenClaw 抓取裁判文书公开信息,批量整理同类参考案例
java·大数据·python·数据挖掘·数据分析·php·openclaw
小大宇7 小时前
Python 集成 Conda
开发语言·python·conda
初学者,亦行者8 小时前
利用Pyecharts绘制堆叠柱状图
python·信息可视化·数据分析
林泽毅8 小时前
PyTRIO:当强化学习不再需要本地GPU
人工智能·python·深度学习·机器学习