數據挖掘工具pandas（十）離散化處理

原創

TFATS

2020-05-26 13:56

一，什麼是數據的離散化

連續屬性的離散化就是將連續屬性的值域上，將值域劃分爲若干個離散的區間，最後用不同的符號或整數值代表落在每個子區間中的屬性值。

二，qcut()

import pandas as pd
import numpy as np
from matplotlib import pyplot as plt

# 構造數據
temp = pd.DataFrame(np.random.normal(0,100,(500,505)))
stock_list = ["股票"+ str(i) for i in range(temp.shape[0])]
date = ["第"+ str(i)+"天" for i in range(temp.shape[1])]
temp.index = stock_list
temp.columns = date

# 取出單列數據
p_change = temp["第1天"]

# 利用plt畫圖
# p_change.hist(bins=80)
# plt.show()

# 使用qcut自動分組；10爲共分成組的數量
a = pd.qcut(p_change,10)

# 返回值使用value_counts()得到 每組數據的區間；每組的個數（基本相等）
print(a.value_counts())

三，cut()

import pandas as pd
import numpy as np
from matplotlib import pyplot as plt

# 構造數據
temp = pd.DataFrame(np.random.normal(0,100,(500,505)))
stock_list = ["股票"+ str(i) for i in range(temp.shape[0])]
date = ["第"+ str(i)+"天" for i in range(temp.shape[1])]
temp.index = stock_list
temp.columns = date

# 取出單列數據
p_change = temp["第1天"]

# 利用plt畫圖
# p_change.hist(bins=80)
# plt.show()

# 使用cut自己進行分組,使用自己定義的組距進行分組
bins = [-500,-100,-7,-5,-3,0,3,5,7,100,500]
a = pd.cut(p_change,bins)
print(a)
print(a.value_counts())

四，變成啞變量矩陣

import pandas as pd
import numpy as np
from matplotlib import pyplot as plt

# 構造數據
temp = pd.DataFrame(np.random.normal(0,100,(500,505)))
stock_list = ["股票"+ str(i) for i in range(temp.shape[0])]
date = ["第"+ str(i)+"天" for i in range(temp.shape[1])]
temp.index = stock_list
temp.columns = date

# 取出單列數據
p_change = temp["第1天"]

# 利用plt畫圖
# p_change.hist(bins=80)
# plt.show()

# 使用cut自己進行分組,使用自己定義的組距進行分組
bins = [-500,-100,-7,-5,-3,0,3,5,7,100,500]
a = pd.cut(p_change,bins)
print(a)
# prefix爲展示列名稱前的文字
print(pd.get_dummies(a,prefix="rise"))

發表評論

所有評論

還沒有人評論，想成為第一個評論的人麼? 請在上方評論欄輸入並且點擊發布.

數據挖掘工具pandas（十）離散化處理

一，什麼是數據的離散化

二，qcut()

三，cut()

四，變成啞變量矩陣

七天.NET 8操作SQLite入門到實戰 - （2）第七天Blazor班級管理頁面編寫和接口對接

自學編程兩個月，現在我月入 4 萬元

百度安全多篇議題入選Blackhat Asia以硬技術發現“芯”問題

「實戰應用」如何用圖表控件LightningChart創建2D氣泡圖

GtkSharp 設置窗口背景透明

Google Chrome驅動程序 124.0.6367.62（正式版本）去哪下載？

如何使用軟碟通製作啓動U盤

django配置多進程按日期分割處理日誌

Package ‘zipp’ requires a different Python：3.5.2 not in ‘ 大於等於3.6’

Ubuntu apt-get和pip源更換以及apt update和upgrade 的區別

關於GIT，你只需要看這篇文章。

https://yachay.unat.edu.pe/blog/index.php?comment_area=format_blog&comment_component=blog&comment_co

linux以太網驅動總結