手机销量分析案例

项目背景

  • 某电商商城随着业务量的发展,积累了大量的用户手机销售订单数据。决策层希望能够通过对这些数据的分析了解更多的用户信息及用户的分布,从而可以指导下一年的市场营销方案以及更加精准的定位市场,进行广告投放。

数据说明

  • 数据时间从 2017.01.01至2019.03.31 共41800 条,数据存储在 excel 文件 中(Phone.xlsx)。

import pandas as pd

data = pd.read_excel('./Phone.xlsx')

data.head()

data.shape

(41800, 20)

  • 查看缺失数据的个数和占比

#查看缺失数据

for col in data.columns:

null_count = datacol.isnull().sum()

if null_count > 0:

p = str(null_count / datacol.size * 100)+'%'

print(col+':'+p)

年:100.0%

月:100.0%

年龄段:100.0%

  • 缺失值处理

data'年' = data'订单日期'.dt.year

data'月' = data'订单日期'.dt.month

#数据分箱:

#0-16,17-26,27-36,37-49

data'年龄段' = pd.cut(data'年龄',bins=0,16,26,36,49)

  • 查看消费者对不同手机品牌的青睐程度

#查看不同品牌手机的累计销量和累计销售额,且对累计销量进行降序

data.groupby(by='品牌')\['销售额','数量'].sum().sort_values('数量',ascending=False)

  • 查看不同品牌的不同型号数量

p_count_list = \[\] #品牌名称和品牌型号的数量

for p in data'品牌'.unique():

#可以将p表示品牌的行数据

p_df = data.locdata\['品牌' == p]

p_count = p_df'型号'.nunique() #品牌对应不同型号的数量

p_count_list.append(p,p_count)

pd.DataFrame(p_count_list,columns='品牌','型号数量')

#分组聚合

data.groupby(by='品牌')'型号'.nunique()

#分类汇总

data.pivot_table(index='品牌',values='型号',aggfunc='nunique')

  • 查看不同品牌中价格最高和最低的型号是什么

data.groupby(by='品牌','型号')'价格'.agg('max','min')

  • 查看不同月份的销量情况,哪些月份销量比较高

data.groupby(by='月')'数量'.sum().sort_values(ascending=False)

3 16582

1 16420

2 15561

12 11060

5 11026

7 10987

11 10960

8 10884

4 10863

10 10833

6 10733

9 10644

Name: 数量, dtype: int64

  • 不同年龄段的购买力

data.groupby(by='年龄段')'数量'.sum().sort_values(ascending=False)

年龄段

(16, 26] 74573

(26, 36] 68910

(0, 16] 1758

(36, 49] 1312

Name: 数量, dtype: int64

  • 查看不同省份不同城市的购买力情况

data.pivot_table(index='省份名字','城市名字',values='数量',aggfunc='sum').sort_values('数量',ascending=False)

  • 查看不同品牌的不同机身内存的订单量(只考虑订单量,不考虑一个订单中包含几个已购商品)

pd.crosstab(index=data'品牌',columns=data'机身内存')

内容来源于大数据分析课程。

相关推荐
2601_966949652 分钟前
批量 K 线不只是提速:因子研究中的数据质量、复权与回测偏差
开发语言·python·数据分析·pandas·量化交易·股票数据·quantdash
一位正在转型AI全栈的前端工程师3 分钟前
AI 全栈学习之旅 -Week 11:从 CLI 到浏览器:用 FastAPI、SSE 和 Vue 3 做一个可审核的 ReAct Agent
前端·python
AI职业加油站8 分钟前
2026大数据运维行业趋势复盘:大数据运维工程师赋能发展
大数据·运维·人工智能·学习·数据分析·职场发展
洛阳纸贵9 分钟前
AI-PyTorch(一)基础代码实操和自动求导
人工智能·pytorch·python
2601_9622845017 分钟前
uv:终结 Python 虚拟环境管理乱局
python·项目管理·uv·虚拟环境·依赖管理
Patrick在香港26 分钟前
Claude + Python 数据管道:一次字段改名,786 行历史数据被静默重写
开发语言·windows·python·claude·数据工程·数据校验·数据管道
sibylyue35 分钟前
【报表和BI大屏】ECharts数据可视化大屏 / 驾驶舱
前端·信息可视化·echarts
BYSJMG43 分钟前
计算机毕业设计选题推荐:基于大数据的水质多指标关联分析与可视化的设计与实现,Spark 加 K-Means 做水质分群
大数据·hadoop·信息可视化·数据分析·spark·kmeans·课程设计
the局外人44 分钟前
学习 FastAPI 的 Day 3:企业级目录与数据库迁移
后端·python·fastapi
Ray13331 小时前
交付级定时数据管道:改 JSON 声明调度,84 个单测全绿
python