降维技术简介

原創

2020-06-23 22:49

为什么需要降维

数据的维度过高，需要存储数据的空间非常大，降维可以降低数据存储所需的空间；
数据的维数过高，某些算法的时间复杂度很高，降维到较小的维数可以缓解计算/训练时间，而且有些算法因为数据的维度过高，不能执行，需要降维处理使算法work；
数据中通常可能存在一些冗余特征，降维可以消除这些冗余特征。因为数据中的某些特征本身就互相关联，只需要知道它们中的一种特征即可。因此，全部存储没有意义，反而消耗存储空间，因为它们中只需要一个就能符合你的要求；
降维有助于可视化数据。很难以更高的维度可视化数据，因此将空间缩小到2D或3D可以让我们更清楚地绘制和观察模式。

降维是什么

若原特征空间是维的,现希望降至维

降维和特征选择

只保留最相关的变量从原始数据集，这种技术被称为特征选择；
通过找到一组较小的新变量，每个变量都是输入变量的组合，包含与输入变量基本相同的信息，这种技术称为降维。

从字面意义上看，降维和特征选择都可以看作降维。

分类

降维方法分为线性和非线性降维，非线性降维又分为基于核函数和基于特征值的方法。

1、线性降维方法：

PCA 、ICA LDA、LFA、LPP(LE的线性表示)

2、非线性降维方法：

（1）基于核函数的非线性降维方法：KPCA 、KICA、KDA

（2）基于特征值的非线性降维方法（流型学习）：ISOMAP、LLE、LE、LPP、LTSA、MVU

具体的降维方法以及代码实现网上有很多，请看推荐阅读部分！

推荐阅读

降维方法 -简直太全！- 附Python代码（Random Forest、Factor Analysis、corr、PCA、ICA、IOSMA

12种降维技术的全面指南

發表評論

所有評論

還沒有人評論，想成為第一個評論的人麼? 請在上方評論欄輸入並且點擊發布.

相關文章

Python模块调用与执行

一、模塊調用。複雜的程序都是多模塊的，所謂的模塊，在Python中就是一個py文件，不同的模塊實現不同的功能。一個模塊要調用其他模塊裏的東西，包括函數、變量等，需要“先導入模塊”。這些模塊都存放在同一目錄下，才能在一個模塊中導入並調

2020-07-08 01:59:55

Caffe Linux

1. Caffe Linux （For Ubuntu (>= 17.04)） Installing pre-compiled Caffesudo apt install caffe-cpu Installing Caffe f

2020-07-07 19:32:38

机器学习之SVM(Hinge Loss+Kernel Trick)原理推导与解析

支持向量機（Support Vector Machine, SVM）是一類按監督學習方式對數據進行二元分類的廣義線性分類器（generalized linear classifier），其決策邊界是對學習樣本求解的最大邊距超平面。

2020-07-07 17:45:19

机器学习之K_means（附简单手写代码）

聚類是一個將數據集中在某些方面相似的數據成員進行分類組織的過程，聚類就是一種發現這種內在結構的技術，聚類技術經常被稱爲無監督學習。 k均值聚類是最著名的劃分聚類算法，由於簡潔和效率使得他成爲所有聚類算法中最廣泛使用的。給定一個數據

2020-07-07 17:45:19

PCA（1）：基础知识介绍

PCA算法思路：首先利用樣本集及特徵構建一個樣本矩陣，然後利用樣本矩陣計算得到一個協方差矩陣，再計算協方差矩陣的特徵值和特徵向量，保留特徵值前k個大的對應的特徵向量作爲新的維度方向，再將原始樣本數據轉換到新的空間維度。（

2020-07-07 15:17:22

矩阵的SVD分解（理论到计算结果）

爲什麼要用到SVD分解？從特徵值和特徵向量說起：首先回顧下特徵值和特徵向量的定義：其中A是一個m*m的實對稱矩陣，x是一個m維向量，則我們說λ是矩陣A的一個特徵值，而x是矩陣A的特徵值λ所對應的特徵向量。求出特徵值和特徵向量有什麼好

2020-07-07 15:17:20

PCA（2）：PCA算法实现的两种方式

因爲樣本個數和特徵維度的是不相等de，所以組成的矩陣不是方陣。第一種方式：特徵分解思路基於樣本特徵維度，先求協方差矩陣---->再特徵分解（因爲協方差矩陣是方陣，所以可以使用特徵分解的思路）第二種方式：SVD分解 SVD理論：htt

2020-07-07 15:17:18

Coursera吴恩达机器学习编程练习ex5——正则化线性回归与偏差和方差

1. linearRegCostFunction.m function [J, grad] = linearRegCostFunction(X, y, theta, lambda) %LINEARREGCOSTFUNCTION Comp

不跑步就等肥

2020-07-07 15:12:31

一篇基于pthon和scikt-learn的关于机器学习的介绍

A Gentle Introduction to Machine Learning with Pythonand Scikit-learn 一篇基於pthon和scikt-learn的關於機器學習的介紹 GuillermoMon

2020-07-07 09:31:56

机器学习入门指引

機器學習，作爲門時髦、熱門的計算機應用技術，特別是隨着深度學習的流行，推動“大數據+深度模型”的模式，爲人工智能和人機交互的發展提供巨大的空間。和數據挖掘一樣，利用大量的數據分析建立有效的模型以便提供分類或者決策支持，機

2020-07-07 04:51:36

【matplotlib】进一步的了解以及在你的图上添加必要的部分

一. 進一步瞭解figure和axes 之前我在實驗樓中瞭解到，figure和axes相當於是畫畫的時候畫板和畫布的關係。一般而言，你只能創建一個畫板，但是一個畫板上可以有多個畫布。此外還有一種理解方法，我們需要對axes這個對象做更加

2020-07-06 23:05:21

机器学习练习之k均值

k-means屬於聚類分析的其中一種算法，聚類分析在機器學習、數據挖掘、模式識別、決策支持和圖像分割中有廣泛的應用。聚類是無監督的分類方法，所謂無監督就是沒有給定訓練數據的標籤信息，所以聚類出來的結果的類別是未定義的，而分類

2020-07-06 16:46:46

Self-Taught Learning

自編碼器是一個三層的feed-forward神經網絡模型，輸入層經過隱含層的特徵表示後再重構出跟輸入層逼近的輸出層，中間的隱含層是特徵表示層，表示對輸入層學習到的特徵，這些特徵可能更好地表示了數據，如果用學到的特徵來訓練數據分

2020-07-06 16:46:46

PCA与Whitening

一、PCA PCA即主成分分析(Principle Components Analysis)，是統計機器學習、數據挖掘中對數據進行預處理的常用的一種方法。PCA的作用有2個，一個是數據降維，一個是數據的可視化。在實際應用數據中，

2020-07-06 16:46:46

机器学习练习之朴素贝叶斯

練習來自http://openclassroom.stanford.edu/MainFolder/DocumentPage.php?course=MachineLearning&doc=exercises/ex6/ex6.htm

2020-07-06 16:46:46

24小時熱門文章

最新文章

最新評論文章