生物信息与机器学习6 - 有监督学习算法和无监督学习算法

1.有监督学习算法

有监督学习算法推荐:

决策树分类器 - 适合处理分类问题,容易理解和可视化;

KNN分类器 - 对于简单的单特征分类也很有效;

逻辑回归 (多分类) - 使用one-vs-all策略处理多类别。

有监督学习的选择:

如果数据分布比较简单,建议使用KNN;

如果需要清晰的决策边界,使用决策树;

如果数据呈现线性可分的特征,可以使用逻辑回归。

python 复制代码
import matplotlib.pyplot as plt
import numpy as np
from sklearn.tree import DecisionTreeClassifier
from sklearn.neighbors import KNeighborsClassifier
from sklearn.linear_model import LogisticRegression
from sklearn.model_selection import train_test_split

# 生成示例数据
X = np.random.rand(100, 1) * 10  # 单特征数据
y = np.where(X < 2.5, 0,
        np.where(X < 5, 1,
            np.where(X < 7.5, 2, 3)))  # 4个类别

# 分割数据集
X_train, X_test, y_train, y_test = train_test_split(X, y, test_size=0.2)

# 1. 决策树
dt_clf = DecisionTreeClassifier()
dt_clf.fit(X_train, y_train)
dt_score = dt_clf.score(X_test, y_test)

# 2. KNN
knn_clf = KNeighborsClassifier(n_neighbors=3)
knn_clf.fit(X_train, y_train)
knn_score = knn_clf.score(X_test, y_test)

# 3. 逻辑回归
lr_clf = LogisticRegression(multi_class='ovr')
lr_clf.fit(X_train, y_train)
lr_score = lr_clf.score(X_test, y_test)

print(f"决策树准确率: {dt_score:.3f}")
print(f"KNN准确率: {knn_score:.3f}")
print(f"逻辑回归准确率: {lr_score:.3f}")

2. 无监督学习算法

无监督学习算法推荐:

K-means聚类 - 最常用的聚类算法;

DBSCAN - 基于密度的聚类。

无监督学习选择:

如果类别数量已知(本例中是4个),推荐使用K-means;

如果类别数量未知,可以尝试使用DBSCAN。

python 复制代码
from sklearn.cluster import KMeans, DBSCAN
from sklearn.metrics import silhouette_score

# 使用数据为上述生成数据
# K-means聚类
kmeans = KMeans(n_clusters=4, random_state=42)
kmeans_labels = kmeans.fit_predict(X)

# DBSCAN聚类
dbscan = DBSCAN(eps=0.5, min_samples=5)
dbscan_labels = dbscan.fit_predict(X)

# 计算轮廓系数
kmeans_silhouette = silhouette_score(X, kmeans_labels)
print(f"K-means轮廓系数: {kmeans_silhouette:.3f}")

# 可视化结果
plt.figure(figsize=(12, 4))

plt.subplot(121)
plt.scatter(X, np.zeros_like(X), c=kmeans_labels)
plt.title('K-means聚类结果')

plt.subplot(122)
plt.scatter(X, np.zeros_like(X), c=dbscan_labels)
plt.title('DBSCAN聚类结果')

plt.tight_layout()
plt.show()
相关推荐
墨城烟柳Q19 分钟前
自动化爬虫-selenium模块万字详解
爬虫·python·selenium·自动化
raoxiaoya21 分钟前
python安装selenium,geckodriver,chromedriver
开发语言·python·selenium
武子康21 分钟前
大数据-207 数据挖掘 机器学习理论 - 多重共线性 矩阵满秩 线性回归算法
大数据·人工智能·算法·决策树·机器学习·矩阵·数据挖掘
小邓的技术笔记22 分钟前
20241106,LeetCode 每日一题,用 Go 实现整数回文数判断
算法·leetcode·golang
IronmanJay23 分钟前
【LeetCode每日一题】——802.找到最终的安全状态
数据结构·算法·leetcode··拓扑排序·802.找到最终的安全状态·反向图
兔兔爱学习兔兔爱学习1 小时前
leetcode328. Odd Even Linked List
算法
Dxy12393102161 小时前
python使用requests发送请求ssl错误
开发语言·python·ssl
gxchai1 小时前
利用pythonstudio写的PDF、图片批量水印生成器,可同时为不同读者生成多组水印
python
£suPerpanda1 小时前
牛客周赛 Round65 补题DEF
开发语言·数据结构·c++·算法·深度优先·动态规划·图论
ao_lang1 小时前
剑指offer第五天
python·算法·cpp