掌握 Pandas DataFrame 的复杂过滤技巧

准备工作

在开始之前,我们需要先安装 Pandas 包。你可以使用以下命令进行安装:

复制代码
pip install pandas

安装好所需的包后,让我们正式进入主题。


Pandas DataFrame 复杂过滤

DataFrame 是 Pandas 中用于存储和操作数据的对象。它非常强大,因为我们可以利用条件、逻辑运算符和 Pandas 的函数对数据进行过滤。

让我们先创建一个简单的 DataFrame 对象:

复制代码
import pandas as pd

df = pd.DataFrame({
    'Name': ['Alice', 'Leah', 'Jessica', 'Kenny', 'Brad'],
    'Age': [50, 27, 22, 30, 40],
    'Salary': [100000, 154000, 120000, 78000, 88000],
    'Occupation': ['Doctor', 'Soldier', 'Doctor', 'Accountant', 'Florist']
})

接下来,我们将学习如何对这些示例数据进行过滤。首先,可以根据特定条件进行数据筛选:

复制代码
df[df['Age'] > 30]

输出:

复制代码
    Name  Age  Salary Occupation
0  Alice   50  100000     Doctor
4   Brad   40   88000    Florist

我们也可以结合 And(&)运算符来组合多个条件:

复制代码
df[(df['Age'] > 25) & (df['Salary'] < 100000)]

输出:

复制代码
    Name  Age  Salary  Occupation
3  Kenny   30   78000  Accountant
4   Brad   40   88000     Florist

同样地,也可以用 Or(|)运算符组合条件:

复制代码
df[(df['Salary'] < 100000) | (df['Occupation'] == 'Soldier')]

输出:

复制代码
    Name  Age  Salary  Occupation
1   Leah   27  154000     Soldier
3  Kenny   30   78000  Accountant
4   Brad   40   88000     Florist

此外,我们还可以利用字符串函数进行数据过滤。例如,筛选出某列包含特定值的数据:

复制代码
df[df['Occupation'].str.contains('Sol')]

输出:

复制代码
    Name  Age  Salary Occupation
1  Leah   27  154000    Soldier

如果你需要按照特定字符串值进行过滤,可以使用以下方法:

复制代码
df[df['Occupation'].isin(['Doctor', 'Florist'])]

输出:

复制代码
      Name  Age  Salary Occupation
0    Alice   50  100000     Doctor
2  Jessica   22  120000     Doctor
4     Brad   40   88000    Florist

还可以通过 lambda 函数对数据进行过滤:

复制代码
df[df['Name'].apply(lambda x: len(x) > 5)]

输出:

复制代码
      Name  Age  Salary Occupation
2  Jessica   22  120000     Doctor

如果你想简化操作,可以使用 query 方法来过滤数据:

复制代码
df.query('Age < 30 and Salary > 100000')

输出:

复制代码
      Name  Age  Salary Occupation
1     Leah   27  154000    Soldier
2  Jessica   22  120000     Doctor

最后,我们可以将前面学到的各种过滤条件进行组合:

复制代码
df[(df['Age'] > 30) & (
    (df['Salary'] > 60000) | 
    (df['Occupation'].str.contains('Doc')))]

输出:

复制代码
    Name  Age  Salary Occupation
0  Alice   50  100000     Doctor
4   Brad   40   88000    Florist

掌握这些过滤函数,将大大提升你的数据分析能力。

相关推荐
Dxy12393102162 小时前
python如何通过链接下载保存视频
python·spring·音视频
Terio_my2 小时前
Java bean 数据校验
java·开发语言·python
无咎.lsy3 小时前
裸K初级篇 - (一)蜡烛突破信号
python
可触的未来,发芽的智生5 小时前
新奇特:神经网络的集团作战思维,权重共享层的智慧
人工智能·python·神经网络·算法·架构
jerryinwuhan5 小时前
Python数据挖掘之基础分类模型_支持向量机(SVM)
python·支持向量机·数据挖掘
StarPrayers.5 小时前
基于PyTorch的CIFAR10加载与TensorBoard可视化实践
人工智能·pytorch·python·深度学习·机器学习
深蓝电商API6 小时前
实战破解前端渲染:当 Requests 无法获取数据时(Selenium/Playwright 入门)
前端·python·selenium·playwright
程序边界7 小时前
AI时代如何高效学习Python:从零基础到项目实战de封神之路(2025升级版)
人工智能·python·学习
TTGGGFF8 小时前
云端服务器使用指南:利用Python操作mysql数据库
服务器·数据库·python
jie*8 小时前
小杰深度学习(four)——神经网络可解释性、欠拟合、过拟合
人工智能·python·深度学习·神经网络·scikit-learn·matplotlib·sklearn