数据可视化分析之跨国在线零售业务
·
使用环境jupyter notebook pyhon3
本次作业使用的数据集是来自Kaggle的一个跨国在线零售业务的交易数据,该公司在英国注册,主要销售礼品。 每个记录由8个属性组成,具体的含义如下表:
字段名称 类型 含义 举例
InvoiceNo string 订单编号(退货订单以C开头) 536365
StockCode string 产品代码 85123A
Description string 产品描述 WHITE METAL LANTERN
Quantity integer 购买数量(负数表示退货) 6
InvoiceDate string 订单日期和时间 12/1/2010 8:26
UnitPrice double 单价(英镑) 3.39
CustomerID integer 客户编号 17850
Country string 国家名称 United Kingdom
1.查看数据基本信息
import numpy as np
import pandas as pd
file=open(r'D:\数据分析\Online_Retail.csv')
file_data=pd.read_csv(file)
file_data

2.查看数据中是否有缺失值
pd.isnull(file_data)
3.不对缺失的数据进行补全,直接删除
file_data2=file_data.dropna()
file_data2

4.将 列CustomerID 数据类型设置为整型
file_data2['CustomerID'].astype(dtype='int')
5.是否有重复的数据
file_data2.duplicated()
6.增加新列 消费总金额,由单价和数量计算得到
file_data2['TotalAmountConsumed']=file_data2['UnitPrice']*file_data2['Quantity']
file_data2
7.分析订单量最大的5个客户是谁,每个客户的消费额是多少。消费最多的5个客户是谁
file_data3=file_data2.sort_values(by='Quantity',ascending=False).head(5)
file_data3
file_data3['CustomerID']
file_data3['TotalAmountConsumed']
file_data4=file_data2.sort_values(by='TotalAmountConsumed',ascending=False).head(5)
file_data4['CustomerID']
8.订单数前3的国家
file_data3['Country'].head(3)
9.消费额前5个国家
file_data5=file_data2.sort_values(by='TotalAmountConsumed',ascending=False).head(5)
file_data5['Country']

更多推荐












所有评论(0)