Python----数据分析(电影数据分析)

一、数据来源

数据网址 http://grouplens.org/datasets/movielens/

数据集包含3个文件,文件中包含电影信息表,评分用户信息,评分信息。

二、数据加载

python 复制代码
import pandas as pd
import matplotlib.pyplot as plt
#支持中文显示
plt.rcParams['font.family']='Kaiti'
# 使用非unicode的负号,当使用中文时候要设置
plt.rcParams['axes.unicode_minus']=False

加载用户信息 user id | age | gender | occupation | zip code

python 复制代码
user_names=['user_id' , 'age' , 'gender' , 'occupation' , 'zip_code']
user_df=pd.read_table('./ml-100k/u.user',sep='|',names=user_names)
user_df

加载电影信息 movie id | movie title | release date | video release date | IMDb URL

python 复制代码
movie_names=['movie_id', 'movie_title' , 'release_date' , 'video_release','date' , 'IMDb_URL' ]
movie_df=pd.read_table('./ml-100k/u.item',sep='|',names=movie_names,encoding='iso8859-1',usecols=range(6))
movie_df

加载评分信息 user id | item id | rating | timestamp

python 复制代码
data_names=['user_id' , 'item_id' , 'rating' , 'timestamp' ]
data_df=pd.read_table('./ml-100k/u.data',sep='\t',names=data_names)
data_df

数据合并

python 复制代码
user_data_df=pd.merge(user_df,data_df)
all_df=pd.merge(user_data_df,movie_df,left_on='item_id',right_on='movie_id')
all_df

三、数据清洗

把不需要的列删除

python 复制代码
all_df.drop(columns=['item_id'],inplace=True)

查看有无缺失值

python 复制代码
all_df.info()

思考缺失值对数据的影响,对缺失值进行操作

python 复制代码
all_df.drop(columns=['video_release'],inplace=True)

python 复制代码
all_df.dropna(axis=1,how='all',inplace=True)

查看是否有异常值

python 复制代码
all_df.describe()

查看是否有重复值

python 复制代码
all_df.duplicated(subset=['user_id','movie_id']).any()

四、数据分析

查看性别对于观看电影是否有影响

python 复制代码
all_df['gender'].value_counts().plot(kind='pie',autopct='%.2f%%')

获取评分次数最多的前10部电影

python 复制代码
all_df['movie_title'].value_counts().sort_values(ascending=False).head(10)

python 复制代码
all_df.groupby('movie_title')['movie_title'].count().sort_values(ascending=False).head(10)
python 复制代码
all_df.groupby('movie_title')['movie_title'].count().sort_values(ascending=False).head(10).plot(kind='bar')

获取评分最高的前10部电影

python 复制代码
all_df.groupby('movie_title')['rating'].mean().sort_values(ascending=False).head(10)

python 复制代码
all_df.groupby('movie_title').agg({'rating':'mean'})['rating'].sort_values(ascending=False).head(10)

因思考到有些电影观看人数较为稀少,通过某一人偏爱,导致分值较高,导致数据不准确,添加人数限制,以求数据相对准确

python 复制代码
all_100=all_df.groupby('movie_title')['rating'].agg(['mean','count'])['count']>100
all_df.groupby('movie_title')['rating'].agg(['mean','count'])[all_100].sort_values(by=['mean','count'],ascending=False).head(10)
python 复制代码
all_df.groupby('movie_title')['rating'].agg(['mean','count'])[all_100].sort_values(by=['mean','count'],ascending=False).head(10).plot(kind='bar',y='count')

不同年龄段对某部电影的评分

查看年龄描述分布

python 复制代码
all_df['age'].describe()

对年龄进行直方分布

python 复制代码
all_df['age'].plot(kind='hist',bins=20)

对年龄进行分组,每十岁分为一组

python 复制代码
age_bins = np.arange(0,81,10)
pd.cut(all_df['age'],bins=age_bins,right=False)

添加新的标签列,查看该所属年龄属于哪个区间

python 复制代码
all_df['age_group']=pd.cut(all_df['age'],bins=age_bins,right=False)

对年龄区间进行分组,查看该年龄段对电影评分的平均值和评分数量

python 复制代码
all_df.groupby('age_group')['rating'].agg(['mean','count'])

对电影名称和年龄区间进行分组,计算出评分的平均值,然后进行列重组,将空值填充为0

python 复制代码
all_df.groupby(['movie_title','age_group'])['rating'].mean().unstack().fillna(0)

获取评分次数top100电影的id

python 复制代码
args=all_df['movie_id'].value_counts().sort_values(ascending=False).head(100)

查看 电影id有没有在前100里面

python 复制代码
all_df[all_df['movie_id'].isin(args.index)]

对电影标题和年龄区间进行分组 ,然后对电影评分如上操作

python 复制代码
all_df[all_df['movie_id'].isin(args.index)].groupby(['movie_title','age_group'])['rating'].mean().unstack().fillna(0)

通过索引筛选 不同年龄段对某部电影的评分

python 复制代码
all_df.set_index('movie_id').loc[args.index].groupby(['movie_title','age_group'],observed=False)['rating'].mean().unstack().fillna(0)
相关推荐
知乎的哥廷根数学学派13 分钟前
基于生成对抗U-Net混合架构的隧道衬砌缺陷地质雷达数据智能反演与成像方法(以模拟信号为例,Pytorch)
开发语言·人工智能·pytorch·python·深度学习·机器学习
WangYaolove131434 分钟前
Python基于大数据的电影市场预测分析(源码+文档)
python·django·毕业设计·源码
知乎的哥廷根数学学派1 小时前
基于自适应多尺度小波核编码与注意力增强的脉冲神经网络机械故障诊断(Pytorch)
人工智能·pytorch·python·深度学习·神经网络·机器学习
yeziyfx1 小时前
kotlin中 ?:的用法
android·开发语言·kotlin
charlie1145141911 小时前
嵌入式的现代C++教程——constexpr与设计技巧
开发语言·c++·笔记·单片机·学习·算法·嵌入式
古城小栈1 小时前
Rust 网络请求库:reqwest
开发语言·网络·rust
hqwest2 小时前
码上通QT实战12--监控页面04-绘制6个灯珠及开关
开发语言·qt·qpainter·qt事件·stackedwidget
i橡皮擦2 小时前
TheIsle恐龙岛读取游戏基址做插件(C#语言)
开发语言·游戏·c#·恐龙岛·theisle
cnxy1882 小时前
Python爬虫进阶:反爬虫策略与Selenium自动化完整指南
爬虫·python·selenium
bing.shao2 小时前
golang 做AI任务执行
开发语言·人工智能·golang