数据挖掘实践学习一数据集处理未完待续

原創

方糖冰红茶

2020-06-27 08:58

前言

8月份参加的DataWhale组织的组队学习活动，自以为是地报了MySQL，数据挖掘和爬虫，结果只有MySQL完成得还可以了，数据挖掘不厚道地随便搞了一下，蒙混过关，爬虫搞了一半最后被请出了群聊。

虽然没有完成，但好处保留了这些资料和高手们的聊天记录，现在想把没做完和做好的事情做完做好，可以照着别人的脚步，跟着做，这叫站在巨人的肩膀上。做的这些，当然都是为了一份工作。

第一部分是数据集处理，即拿到数据集后，对数据字段的意义和类型、数据的分布、以及数据的缺失值进行了解和分析，然后做相应的处理。

引用一位群友的总结，即这一部分包括：1、剔除无用的特征；2、缺失值的处理；3、异常值和离群值的处理；4、分类数据的编码；5、时间类特征的处理；6、其他特征的处理。

这一边日志，我主要进行数据值的处理，用python的数据可视化包展示一下数据的分布，这里也复习一下Matplotlib和seaborn，不然真的过去学的都忘了。至于时间类和其他特征处理，放在一下篇，专门学习一下特征工程。

数据集说明

这是DataWhale提供的一个金融数据集，数据集已经做了脱密处理。需要做的是预测用户的贷款是否会逾期。数据字段"status" 是结果标签：0表示未逾期，1表示逾期。

数据集将会三七分，三分测试集七分训练集。随机种子设置为2018。

导入常用的工具包

导入数据

导入数据并查看DataFrame结构：总共有4754行数据，90个字段。

字段分析

查看每个字段的唯一值有多少个，如果只有一个唯一值，那么这个字段特征没有什么用，如果字段的唯一值跟总数据行数相等，那么也是无关字段

从以上可以看出，'bank_card_no','source','Unnamed: 0','custid','trade_no'是无用特征

接下来，对每个字段的意义进行探究，从常理上判断一个特征字段是否具有意义。

每个字段随机选取5个数查看

然后逐个看

将字段分类

按照常理去掉一部分无效字段，比如卡号，客户姓名。一般日期信息应该主要用于做季节性趋势性分析，或这用户生命周期的分析，等进步一再看。

删除无用字段

缺失值处理

对每个字段的缺失值进行统计，再按缺失值数量大小排序：

或者通过计算缺失值的比例来看

可见，student_feature 有2998个缺失值，缺失值占比63%，这个字段需要删掉。

对于缺失值的处理，这里参考一片文章：

http://blog.sina.com.cn/s/blog_1523c35670102xlcf.html

这里使用最填充法去处理缺失值，即填充均值，众数或者中位数。

一般来说，如果是数值型变量，若存在的变量值是正态分布则选择均值填充，若是偏态分布，则选择中位数填充；如果不是数值型变量，则选择众数填充。

由于均值又受到异常值和利群值的影响，所以先看看数值型的数据分布和离群数据。

为了画图方便，这里将所有的数值型字段分层三部分：

异常情况：16，23，25这三个图出现最左/最右暴增的情况，即data_int1[15,22,24] ==>> rank_trad_1_month, trans_top_time_last_1_month, consume_top_time_last_1_month。。。待以后进一步分析。

第21个图出现分段情况，即'avg_price_last_12_month'

第二段没有特殊情况出现。

第18个图出现分段情况，即 'consfin_credit_limit'

对于出现分段情况的 'avg_price_last_12_month','consfin_credit_limit'，很奇怪的是通过画大图分析，却没有看到它们分段的情况。。。暂时不去探究了。

考虑以上图形基本都呈偏态分布，所以最后使用中位数对数值类型的缺失值进行填充。

接下的步骤：

填充数值类缺失值

对于时间日期类特征的分析，填充时间类缺失值

填充标签类缺失值

数据类型转换，将标签类型的字段转为数值类型，参考 https://zhuanlan.zhihu.com/p/87203369

--- 未完待续 ---

發表評論

所有評論

還沒有人評論，想成為第一個評論的人麼? 請在上方評論欄輸入並且點擊發布.

相關文章

泛统计理论初探——模型泛化能力增强技巧

數據挖掘-機器學習模型泛化增強技巧機器學習模型泛化能力增強技巧簡介在之前的文章中，我們已經介紹了三種提高模型泛化能力的方法，即前一篇文章介紹的L1正則化、L2正則化、DropOut方法。在本文中，我們將會從數據角度、模型

喷火龙与水箭龟

2020-07-08 04:17:12

泛统计理论初探——过拟合与欠拟合探讨

數據挖掘-過擬合與欠擬合的簡介過擬合與欠擬合簡介在我們數據挖掘的學習中，經常會出現過擬合和欠擬合的情況。比如使用BP神經網絡進行預測的時候，可能會造成數據的過擬合；使用簡單的一元線性迴歸的進行預測的時候，可能會造成數據的欠擬合

喷火龙与水箭龟

2020-07-08 04:17:12

2020年7月编程语言排名，C语言与Java拉大距离，黑马R排名第八

雲棲號資訊：【點擊查看更多行業資訊】在這裏您可以找到不同行業的第一手的上雲資訊，還在等什麼，快來！ TIOBE編程社區2020年7月編程語言排行榜如期而至，你的生活工作是否也是這樣如期而至呢?看看7月編程語言排行榜又有哪些變化呢?你所心儀

雲棲號資訊小哥

2020-07-10 16:07:49

云计算与大数据合体，能给我们带来什么？

雲棲號資訊：【點擊查看更多行業資訊】在這裏您可以找到不同行業的第一手的上雲資訊，還在等什麼，快來！雲計算和大數據的結合可以說是相輔相成，因爲雲計算爲大數據提供了可以彈性擴展相對便宜的存儲空間和計算資源，使得中小企業也可以像大型企業一樣通過

雲棲號資訊小編

2020-07-08 18:46:59

Mysql疑难杂症收集

Mysql疑難雜症收集 By Eagoo 　　　　一、可疑問題：　　　　　　　　mysql>show processlist; 　　　　

单线程的娃

2020-07-08 12:00:56

[深度之眼]LeNet/AlexNet/VGGNet/InceptionNet/ResNet实现fashion_mnist分类

本文使用五種經典卷積神經網絡，實現fashion_mnist十分類問題，並對比準確度和運行時間LeNet5 原理AlexNet8 原理VGGNet16 原理InceptionNet10 原理ResNet18 原理用到的包： im

2020-07-08 11:53:37

最近邻搜索神器——一文读懂局部敏感哈希LSH原理

什麼是LSH? LSH主要用來解決高維空間中點的近似最近鄰搜索問題,即Approximate Nearest Neighbor(ANN)。在實際的應用中我們所面對的數據是海量的,並且有着很高的維度。在對數據的各種操作中,查詢操作

2020-07-08 05:33:08

[B11]数据挖掘实战：客户流失预警系统

*這是一個數據挖掘的小項目，將從以下幾個方面來分析：數據清洗與格式轉換探索性數據分析特徵篩選特徵工程建立多種基礎模型，嘗試多種算法模型調參/提升模型評估測試/結論彙報分析與準備數據數據簡介 State:州名

学Python的莫小白

2020-07-08 05:05:48

数据调度平台系统二大种类及其实现方法与流程

什麼是調度系統調度系統，更確切地說，作業調度系統（Job Scheduler）或者說工作流調度系統（workflow Scheduler）是任何一個稍微有點規模，不是簡單玩玩的大數據開發平臺都必不可少的重要組成部分。除了Crontab

taskctl调度工具

2020-07-08 04:22:11

泛统计理论初探——常见正则化技巧简介

數據挖掘-正則化方法簡介常見正則化方法介紹正則化方法是數據挖掘或者神經網絡應用裏常見的一種方法，該類方法其實是一種對於過擬合進行優化的思路，即當模型在訓練集和測試集的預測準確率差距非常大的時候，比如模型在訓練集預測準確率

喷火龙与水箭龟

2020-07-08 04:17:13

泛统计理论初探——探讨梯度下降学习率优化技巧

數據挖掘-梯度下降學習率優化簡介學習率優化方法簡介本文準備介紹的主要內容是在梯度下降方法中，對於學習速率這個超參數的優化思路。在之前的三篇文章裏，分別介紹了對梯度本身的優化的常見策略和技巧，但是沒有對學習速率的優化進行介

喷火龙与水箭龟

2020-07-08 04:17:13

泛统计理论初探——DBSCAN方法简介

數據挖掘-聚類算法之DBSCAN DBSCAN算法簡介在之前的文章裏，我們探討了最常見的一種聚類算法，即Kmeans算法，在本文中，我們將簡要介紹DBSCAN算法，同時將比較DBSCAN方法相對於Kmeans的優缺點。 DBSC

喷火龙与水箭龟

2020-07-08 04:17:12

泛统计理论初探——梯度下降新方法简介

數據挖掘-梯度下降新方法簡介梯度下降新方法簡介在之前的兩篇文章裏，我們介紹了梯度下降方法的歷史和演變，從批量梯度下降、隨機梯度下降方法到後續的新方法如動量加速法、AdaGrad、RMSprop、Adadelta方法等，本

喷火龙与水箭龟

2020-07-08 04:17:12

泛统计理论初探——均值漂移算法初探

數據挖掘-均值漂移聚類算法均值漂移聚類算法簡介本文主要是介紹均值漂移聚類算法，又稱爲Mean-Shift-Cluster，該算法屬於無監督學習的聚類方法。主要從算法的使用場景、步驟、核心思路等角度去介紹算法。之前其實也介紹過一

喷火龙与水箭龟

2020-07-08 04:17:12

泛统计理论初探——再谈梯度下降方法优化

數據挖掘-再談梯度下降優化方法再談梯度下降優化方法在上一篇文章，我們簡單的介紹了梯度下降方法和一些簡單的優化方法，比如隨機梯度下降方法可以對原有的梯度下降方法進行優化和加速，在這個基礎上又有小批量梯度下降方法和動量加速梯

喷火龙与水箭龟

2020-07-08 04:17:12

24小時熱門文章

最新文章

最新評論文章