本文介绍如何利用 pd.crosstab 将分类变量(如顾客评分)按分组(如门店)展开为多个计数列,高效实现"一店一行、三评计数"的宽表转换,并控制列序与轴标签。 本文介绍如何利用 `pd.crosstab` 将分类变量(如顾客评分)按分组(如门店)展开为多个计数列,高效实现"一店一行、三评计数"的宽表转换,并控制列序与轴标签。在数据分析中,常需将长格式的分类计数数据(如每条记录代表一次门店评分)聚合为宽格式汇总表(如每行代表一家门店,各列分别显示 High / Medium / Low 的出现次数)。Pandas 提供了简洁高效的解决方案------pd.crosstab,它专为构建二维频数交叉表而设计。以下是一个典型场景:原始 DataFrame 包含两列 'Shop' 和 'Review',其中 'Review' 取值为 'High'、'Medium' 或 'Low',但同一店铺可能有多条评分记录。目标是生成新 DataFrame,每行唯一对应一个店铺,并新增三列分别统计该店各评分等级的数量。首先,构造示例数据:import pandas as pddata = \['store1', 'High', 'store1', 'Medium', 'store2', 'Low', 'store2', 'Low']df = pd.DataFrame(data, columns='Shop', 'Review')为确保输出列严格按 'High' → 'Medium' → 'Low' 顺序排列(而非默认字母序),推荐先将 'Review' 列转为有序分类类型(Categorical):df'Review' = pd.Categorical(df'Review', categories='High', 'Medium', 'Low')接着调用 pd.crosstab 进行交叉计数:result = pd.crosstab(df'Shop', df'Review')print(result)输出为: Zeemo AI 一款专业的视频字幕制作和视频处理工具
相关推荐
Q26433650232 小时前
【有源码】基于 Hadoop 生态的化妆品销售数据存储分析与可视化 面向化妆品行业的用户画像构建与销售机会识别研究2601_962078197 小时前
Python中calendar.weekday用法2601_962218617 小时前
万象生鲜系统业财一体化底层打通技术自动生成经营账单2601_966949657 小时前
为什么量化策略需要大量历史股票数据?从回测可信度理解数据规模2601_962885727 小时前
如何用 Python 扫描 A 股跳空缺口并统计缺口回补概率?李高钢8 小时前
Python FastAPI 框架入门:从零搭建你的第一个高性能 API 服务ocean21038 小时前
2025-2026年Python面试高频知识点洞察Warson_L9 小时前
Python的OrderedDict隐擎fox9 小时前
高性能网络爬虫架构设计:基于 Python 的长连接复用与分布式会话池调度实践Warson_L9 小时前
Python的TypedDict