python之size,count的区别

在 Pandas 中,size()count() 都是用于统计分组后的数据量,但它们的计算逻辑和返回值有本质区别。以下是两者的详细对比:


1. size() 方法

  • 功能 :统计每个分组的 总行数 (包括所有列的空值 NaN)。
  • 返回值 :一个 Series,索引为分组键,值为每个组的 总行数
  • 特点
    • 不区分列,只统计行数
    • 包含空值(NaN)的行
示例
python 复制代码
import pandas as pd
import numpy as np

data = pd.DataFrame({
    '户型': ['一室', '一室', '两室', '两室', '三室'],
    '价格': [100, np.nan, 200, 250, 300]
})

# 使用 size
size_result = data.groupby('户型').size()
print(size_result)

输出:

plain 复制代码
户型
一室    2
三室    1
两室    2
dtype: int64

2. count() 方法

  • 功能 :统计每个分组中 非空值(Non-NaN)的数量,按列分别统计。
  • 返回值 :一个 DataFrame,索引为分组键,每列为该列的非空值数量。
  • 特点
    • 按列统计
    • 排除空值(NaN)的行
示例
python 复制代码
# 使用 count
count_result = data.groupby('户型').count()
print(count_result)

输出:

plain 复制代码
      价格
户型    
一室   1  # 价格列有一个 NaN
三室   1
两室   2

对比表格

方法 统计对象 是否包含空值 返回类型 典型场景
size() 所有行数 ✅ 包含 Series 统计每个分组的样本总量
count() 每列的非空值数 ❌ 不包含 DataFrame 分析数据完整度(缺失值统计)

使用场景

size()** 的适用场景**

统计每个分组的 总数据条数,例如:

python 复制代码
# 统计每个户型出现的总次数(无论价格是否缺失)
house_type_counts = data.groupby('户型').size()
count()** 的适用场景**

分析每列的 数据完整度,例如:

python 复制代码
# 检查价格列的缺失情况
price_valid_counts = data.groupby('户型')['价格'].count()

扩展用法

统计单列的非空值数量
python 复制代码
# 等效于 data.groupby('户型')['价格'].count()
price_count = data.groupby('户型').count()['价格']
综合使用示例
python 复制代码
# 计算价格均值时自动过滤缺失值
mean_price = data.groupby('户型')['价格'].mean()

# 通过 count 验证参与计算的样本量
valid_samples = data.groupby('户型')['价格'].count()

总结

  • 如果只需要知道 每组有多少行数据 (无论是否有空值),用 size()
  • 如果需要分析 每列的有效数据量 (排除空值),用 count()
相关推荐
亿牛云爬虫专家1 小时前
Kubernetes下的分布式采集系统设计与实战:趋势监测失效引发的架构进化
分布式·python·架构·kubernetes·爬虫代理·监测·采集
产品经理独孤虾4 小时前
人工智能大模型如何助力电商产品经理打造高效的商品工业属性画像
人工智能·机器学习·ai·大模型·产品经理·商品画像·商品工业属性
蹦蹦跳跳真可爱5895 小时前
Python----OpenCV(图像増强——高通滤波(索贝尔算子、沙尔算子、拉普拉斯算子),图像浮雕与特效处理)
人工智能·python·opencv·计算机视觉
nananaij5 小时前
【Python进阶篇 面向对象程序设计(3) 继承】
开发语言·python·神经网络·pycharm
雷羿 LexChien5 小时前
从 Prompt 管理到人格稳定:探索 Cursor AI 编辑器如何赋能 Prompt 工程与人格风格设计(上)
人工智能·python·llm·编辑器·prompt
敲键盘的小夜猫6 小时前
LLM复杂记忆存储-多会话隔离案例实战
人工智能·python·langchain
高压锅_12206 小时前
Django Channels WebSocket实时通信实战:从聊天功能到消息推送
python·websocket·django
胖达不服输8 小时前
「日拱一码」020 机器学习——数据处理
人工智能·python·机器学习·数据处理
吴佳浩8 小时前
Python入门指南-番外-LLM-Fingerprint(大语言模型指纹):从技术视角看AI开源生态的边界与挑战
python·llm·mcp
吴佳浩8 小时前
Python入门指南-AI模型相似性检测方法:技术原理与实现
人工智能·python·llm