使用环境jupyter notebook  pyhon3

本次作业使用的数据集是来自Kaggle的一个跨国在线零售业务的交易数据,该公司在英国注册,主要销售礼品。 每个记录由8个属性组成,具体的含义如下表:
字段名称 类型 含义 举例
InvoiceNo string 订单编号(退货订单以C开头) 536365
StockCode string 产品代码 85123A
Description string 产品描述 WHITE METAL LANTERN
Quantity integer 购买数量(负数表示退货) 6
InvoiceDate string 订单日期和时间 12/1/2010 8:26
UnitPrice double 单价(英镑) 3.39
CustomerID integer 客户编号 17850
Country string 国家名称 United Kingdom 

1.查看数据基本信息

import numpy as np
import pandas as pd
file=open(r'D:\数据分析\Online_Retail.csv')
file_data=pd.read_csv(file)
file_data

2.查看数据中是否有缺失值

pd.isnull(file_data)

3.不对缺失的数据进行补全,直接删除

file_data2=file_data.dropna()
file_data2

4.将 列CustomerID  数据类型设置为整型

file_data2['CustomerID'].astype(dtype='int')

5.是否有重复的数据

file_data2.duplicated()

6.增加新列 消费总金额,由单价和数量计算得到

file_data2['TotalAmountConsumed']=file_data2['UnitPrice']*file_data2['Quantity']
file_data2

7.分析订单量最大的5个客户是谁,每个客户的消费额是多少。消费最多的5个客户是谁

​
file_data3=file_data2.sort_values(by='Quantity',ascending=False).head(5)
file_data3

​

file_data3['CustomerID']

file_data3['TotalAmountConsumed']

file_data4=file_data2.sort_values(by='TotalAmountConsumed',ascending=False).head(5)
file_data4['CustomerID']

8.订单数前3的国家

file_data3['Country'].head(3)

9.消费额前5个国家

file_data5=file_data2.sort_values(by='TotalAmountConsumed',ascending=False).head(5)
file_data5['Country']

更多推荐