人工智能数据分析Python常用库 05 seaborn、pandas库绘图

文章目录

一、seaborn库绘图

seaborn是一个基于matplotlib,且数据结构与pandas统一的统计图制作库。

1、matplotlib与seaborn折线图对比

matplotlib作图:

python 复制代码
import matplotlib.pyplot as plt
import numpy as np

x = np.linspace(0, 10, 500)

# np.cumsum()计算累加和,每一行元素都是其及其上所有行元素之和
# axis=0表示沿着列方向计算,即在同一列,逐行元素相加
y = np.cumsum(np.random.randn(500, 6), axis=0)

with plt.style.context("classic"):
    plt.plot(x, y)
    plt.legend("ABCDEF", ncol=2, loc="upper left")  # ncol=2 表示图例中有2列

plt.show()

seaborn作图:

python 复制代码
import matplotlib.pyplot as plt
import numpy as np
import seaborn as sns

x = np.linspace(0, 10, 500)

# np.cumsum()计算累加和,每一行元素都是其及其上所有行元素之和
# axis=0表示沿着列方向计算,即在同一列,逐行元素相加
y = np.cumsum(np.random.randn(500, 6), axis=0)

sns.set()   # 使用 Seaborn 的默认样式设置
plt.plot(x, y)
plt.legend("ABCDEF", ncol=2, loc="upper left")
plt.show()

2、matplotlib与seaborn柱形图对比

matplotlib作图:

python 复制代码
import matplotlib.pyplot as plt
import numpy as np

x = ["G" + str(i) for i in range(1, 6)]
y = 2 * np.arange(1, 6)

plt.figure(figsize=(8, 4))
plt.barh(x, y, align="center", height=0.5, alpha=0.8, color="blue")
plt.tick_params(axis="both", labelsize=13)

plt.show()

seaborn作图:

注: 在 Seaborn 2.0 版本 之后,sns.barplot() 不再支持仅靠位置参数传递 x, y,必须使用关键字参数。

Seaborn 默认:

垂直柱状图 :类别变量在 X 轴,数值变量在 Y 轴(默认 sns.barplot(x=类别, y=数值))。

水平柱状图:类别变量在 Y 轴,数值变量在 X 轴(sns.barplot(x=数值, y=类别))。

python 复制代码
import matplotlib.pyplot as plt
import numpy as np
import seaborn as sns


x = ["G5", "G4", "G3", "G2", "G1"]
y = 2 * np.arange(5, 0, -1)

sns.barplot(x=y, y=x, linewidth=5)
plt.show()

3、以鸢尾花数据集为例

python 复制代码
import matplotlib.pyplot as plt
import seaborn as sns

# 加载 Seaborn 自带的 iris 数据集
# 返回的变量iris为pandas的DataFrame类型
iris = sns.load_dataset("iris")

# sns.pairplot()生成的每个子图,都是数据集中两两特征组合的可视化
# 对角线上的图 是该变量本身的分布(默认是直方图)
# hue="species" 让不同物种以不同颜色显示。
sns.pairplot(data=iris, hue="species")

plt.show()

查看数据集iris前5行数据:

python 复制代码
import seaborn as sns

iris = sns.load_dataset("iris")
print(iris.head())

二、pandas库绘图

1、线形图

python 复制代码
import matplotlib.pyplot as plt
import numpy as np
import pandas as pd

df = pd.DataFrame(np.random.randn(1000,4).cumsum(axis=0),
                  columns=list("ABCD"),
                  index=np.arange(1000))

# print(df.head())

# 使用 Pandas 提供的 plot() 方法生成折线图
# 每一列产生一条折线
df.plot()
plt.show()

2、柱形图

多组数据竖图:

python 复制代码
import matplotlib.pyplot as plt
import numpy as np
import pandas as pd

df = pd.DataFrame(np.random.randn(10,4),
                  columns=list("ABCD"))

print(df.head())

# 每一列产生一个柱形图
df.plot.bar()
plt.show()

多组数据累加竖图:

python 复制代码
import matplotlib.pyplot as plt
import numpy as np
import pandas as pd

df = pd.DataFrame(np.random.randn(10,4),
                  columns=list("ABCD"))

print(df.head())

# 每一列产生一个柱形图
df.plot.bar(stacked=True)
plt.show()

多组数据累加横图:

python 复制代码
import matplotlib.pyplot as plt
import numpy as np
import pandas as pd

df = pd.DataFrame(np.random.randn(10,4),
                  columns=list("ABCD"))

print(df.head())

# 每一列产生一个柱形图
df.plot.barh(stacked=True)
plt.show()

3、直方图和密度图

普通直方图:

python 复制代码
import matplotlib.pyplot as plt
import numpy as np
import pandas as pd

df = pd.DataFrame({"A": np.random.randn(1000) + 3,
                   "B": np.random.randn(1000),
                   "C": np.random.randn(1000) - 3})

print(df.head())

df.plot.hist(bins=20)
plt.show()

累加直方图:

python 复制代码
import matplotlib.pyplot as plt
import numpy as np
import pandas as pd

df = pd.DataFrame({"A": np.random.randn(1000) + 3,
                   "B": np.random.randn(1000),
                   "C": np.random.randn(1000) - 3})

print(df.head())

# 这里只画了A数据的图
# 在 x 轴上,显示 "A" 数据的数值范围;
# 在 y 轴上,表示每个区间值的累积频数。
df["A"].plot.hist(cumulative=True)
plt.show()

概率密度图:

注:用核密度估计(Kernel Density Estimation, KDE) 来画图,这种图形方式展示的是数据的平滑概率密度函数,可以让你看到数据分布的形态。

python 复制代码
import matplotlib.pyplot as plt
import numpy as np
import pandas as pd

df = pd.DataFrame({"A": np.random.randn(1000) + 3,
                   "B": np.random.randn(1000),
                   "C": np.random.randn(1000) - 3})

print(df.head())

# 这里只画了A数据的图
df["A"].plot(kind="kde")
plt.show()

4、散点图

housing.csv文件:

链接: https://pan.baidu.com/s/1Gj51eGj1G_X8TL4-v2gm7Q

提取码: 2adm


python 复制代码
import matplotlib.pyplot as plt
import pandas as pd
import seaborn as sns

housing = pd.read_csv("housing.csv")    # housing为DataFrame类型
print(housing.head())

# 基于地理数据的人口、房价可视化
with sns.axes_style("white"):
    housing.plot(kind="scatter", x="longitude", y="latitude", alpha=0.6,
                 s=housing["population"]/100, label="population",
                 c="median_house_value", cmap="jet", colorbar=True)
plt.legend()
plt.axis([-125, -113.5, 32, 43])    # 设置图表的坐标轴范围
plt.show()

5、多子图

python 复制代码
import matplotlib.pyplot as plt
import numpy as np
import pandas as pd

df = pd.DataFrame(np.random.randn(1000,4).cumsum(axis=0),
                  columns=list("ABCD"),
                  index=np.arange(1000))
print(df.head())

# sharex=False:每个子图的 x 轴独立,即每个子图都有自己的 x 轴。
df.plot(subplots=True, figsize=(6, 16),layout=(2,2),sharex=False)
plt.show()
相关推荐
yaoming1681 分钟前
python性能优化方案研究
python·性能优化
源于花海29 分钟前
迁移学习相关的期刊和会议
人工智能·机器学习·迁移学习·期刊会议
码云数智-大飞1 小时前
使用 Python 高效提取 PDF 中的表格数据并导出为 TXT 或 Excel
python
DisonTangor2 小时前
DeepSeek-OCR 2: 视觉因果流
人工智能·开源·aigc·ocr·deepseek
薛定谔的猫19822 小时前
二十一、基于 Hugging Face Transformers 实现中文情感分析情感分析
人工智能·自然语言处理·大模型 训练 调优
发哥来了2 小时前
《AI视频生成技术原理剖析及金管道·图生视频的应用实践》
人工智能
biuyyyxxx2 小时前
Python自动化办公学习笔记(一) 工具安装&教程
笔记·python·学习·自动化
数智联AI团队2 小时前
AI搜索引领开源大模型新浪潮,技术创新重塑信息检索未来格局
人工智能·开源
极客数模3 小时前
【2026美赛赛题初步翻译F题】2026_ICM_Problem_F
大数据·c语言·python·数学建模·matlab
不懒不懒3 小时前
【线性 VS 逻辑回归:一篇讲透两种核心回归模型】
人工智能·机器学习