機器學習中的必修數學（一）

原創

Star-Technology

2020-06-21 05:17

機器學習的領域
基本的機器學習算法的分類
得分函數
如圖，經過一系列的計算，最後得到的概率就叫得分函數
損失函數
得分函數與真實數據比較之後的誤差叫做損失函數
機器學習中的算法簡介
無監督學習（連續型）：SVD、PCA、K-means
無監督學習（離散型）：Apriori、FP-Growth、Hidden Markov Model
監督學習（連續型）：Regression（Linear、Polynomial）、Decsion Trees、Random Forests
監督學習（離散型）：Classification（KNN、Trees、Logistic Regression、Native-Bayes、SVM）
Scikit-learn Algorithm Cheat sheet
兩邊夾定理/夾逼定理
導數
導數是曲線的斜率，二階導數是斜率變化快慢的反映

9. 方向導數

10. 梯度

11. 凸函數

12. 琴生不等式
如果是凸函數

13. 常見的概率分佈

14. 概率

15. 常見函數的導數

16. 泰勒公式

17. 概率與統計的關注點

18. 概率統計與機器學習的關係

19. 方差

20. 協方差
協方差矩陣的特徵分解-SVD
協方差是用來評價兩個隨機變量的線性關係
方差同時除以X的標準差和Y的標準差得出來的是相關係數

21. 期望

22. SVD的幾何意義
原始數據，比如每一行都是一個文本，每列都是一個單詞，實際上，我們對於每一個文本都可以用裏面所有的單詞出現的次數的一個向量作爲表示，向量的每一行都對應的一個文本，變成一個矩陣，但是有一個問題，假設詞語的個數有60個億，那麼有60億的詞語就有60億的列，因爲太大，所以放不下，因此需要使用方法截短，怎麼挑出來？就是一個降維的問題
23. 矩陣乘法在計算中的優勢
內積：向量和矩陣相乘

發表評論

所有評論

還沒有人評論，想成為第一個評論的人麼? 請在上方評論欄輸入並且點擊發布.

相關文章

泛統計理論初探——模型泛化能力增強技巧

數據挖掘-機器學習模型泛化增強技巧機器學習模型泛化能力增強技巧簡介在之前的文章中，我們已經介紹了三種提高模型泛化能力的方法，即前一篇文章介紹的L1正則化、L2正則化、DropOut方法。在本文中，我們將會從數據角度、模型

喷火龙与水箭龟

2020-07-08 04:17:12

泛統計理論初探——過擬合與欠擬合探討

數據挖掘-過擬合與欠擬合的簡介過擬合與欠擬合簡介在我們數據挖掘的學習中，經常會出現過擬合和欠擬合的情況。比如使用BP神經網絡進行預測的時候，可能會造成數據的過擬合；使用簡單的一元線性迴歸的進行預測的時候，可能會造成數據的欠擬合

喷火龙与水箭龟

2020-07-08 04:17:12

2020年7月編程語言排名，C語言與Java拉大距離，黑馬R排名第八

雲棲號資訊：【點擊查看更多行業資訊】在這裏您可以找到不同行業的第一手的上雲資訊，還在等什麼，快來！ TIOBE編程社區2020年7月編程語言排行榜如期而至，你的生活工作是否也是這樣如期而至呢?看看7月編程語言排行榜又有哪些變化呢?你所心儀

雲棲號資訊小哥

2020-07-10 16:07:49

雲計算與大數據合體，能給我們帶來什麼？

雲棲號資訊：【點擊查看更多行業資訊】在這裏您可以找到不同行業的第一手的上雲資訊，還在等什麼，快來！雲計算和大數據的結合可以說是相輔相成，因爲雲計算爲大數據提供了可以彈性擴展相對便宜的存儲空間和計算資源，使得中小企業也可以像大型企業一樣通過

雲棲號資訊小編

2020-07-08 18:46:59

Mysql疑難雜症收集

Mysql疑難雜症收集 By Eagoo 　　　　一、可疑問題：　　　　　　　　mysql>show processlist; 　　　　

单线程的娃

2020-07-08 12:00:56

[深度之眼]LeNet/AlexNet/VGGNet/InceptionNet/ResNet實現fashion_mnist分類

本文使用五種經典卷積神經網絡，實現fashion_mnist十分類問題，並對比準確度和運行時間LeNet5 原理AlexNet8 原理VGGNet16 原理InceptionNet10 原理ResNet18 原理用到的包： im

2020-07-08 11:53:37

最近鄰搜索神器——一文讀懂局部敏感哈希LSH原理

什麼是LSH? LSH主要用來解決高維空間中點的近似最近鄰搜索問題,即Approximate Nearest Neighbor(ANN)。在實際的應用中我們所面對的數據是海量的,並且有着很高的維度。在對數據的各種操作中,查詢操作

2020-07-08 05:33:08

[B11]數據挖掘實戰：客戶流失預警系統

*這是一個數據挖掘的小項目，將從以下幾個方面來分析：數據清洗與格式轉換探索性數據分析特徵篩選特徵工程建立多種基礎模型，嘗試多種算法模型調參/提升模型評估測試/結論彙報分析與準備數據數據簡介 State:州名

学Python的莫小白

2020-07-08 05:05:48

數據調度平臺系統二大種類及其實現方法與流程

什麼是調度系統調度系統，更確切地說，作業調度系統（Job Scheduler）或者說工作流調度系統（workflow Scheduler）是任何一個稍微有點規模，不是簡單玩玩的大數據開發平臺都必不可少的重要組成部分。除了Crontab

taskctl调度工具

2020-07-08 04:22:11

泛統計理論初探——常見正則化技巧簡介

數據挖掘-正則化方法簡介常見正則化方法介紹正則化方法是數據挖掘或者神經網絡應用裏常見的一種方法，該類方法其實是一種對於過擬合進行優化的思路，即當模型在訓練集和測試集的預測準確率差距非常大的時候，比如模型在訓練集預測準確率

喷火龙与水箭龟

2020-07-08 04:17:13

泛統計理論初探——探討梯度下降學習率優化技巧

數據挖掘-梯度下降學習率優化簡介學習率優化方法簡介本文準備介紹的主要內容是在梯度下降方法中，對於學習速率這個超參數的優化思路。在之前的三篇文章裏，分別介紹了對梯度本身的優化的常見策略和技巧，但是沒有對學習速率的優化進行介

喷火龙与水箭龟

2020-07-08 04:17:13

泛統計理論初探——DBSCAN方法簡介

數據挖掘-聚類算法之DBSCAN DBSCAN算法簡介在之前的文章裏，我們探討了最常見的一種聚類算法，即Kmeans算法，在本文中，我們將簡要介紹DBSCAN算法，同時將比較DBSCAN方法相對於Kmeans的優缺點。 DBSC

喷火龙与水箭龟

2020-07-08 04:17:12

泛統計理論初探——梯度下降新方法簡介

數據挖掘-梯度下降新方法簡介梯度下降新方法簡介在之前的兩篇文章裏，我們介紹了梯度下降方法的歷史和演變，從批量梯度下降、隨機梯度下降方法到後續的新方法如動量加速法、AdaGrad、RMSprop、Adadelta方法等，本

喷火龙与水箭龟

2020-07-08 04:17:12

泛統計理論初探——均值漂移算法初探

數據挖掘-均值漂移聚類算法均值漂移聚類算法簡介本文主要是介紹均值漂移聚類算法，又稱爲Mean-Shift-Cluster，該算法屬於無監督學習的聚類方法。主要從算法的使用場景、步驟、核心思路等角度去介紹算法。之前其實也介紹過一

喷火龙与水箭龟

2020-07-08 04:17:12

泛統計理論初探——再談梯度下降方法優化

數據挖掘-再談梯度下降優化方法再談梯度下降優化方法在上一篇文章，我們簡單的介紹了梯度下降方法和一些簡單的優化方法，比如隨機梯度下降方法可以對原有的梯度下降方法進行優化和加速，在這個基礎上又有小批量梯度下降方法和動量加速梯

喷火龙与水箭龟

2020-07-08 04:17:12

24小時熱門文章

最新文章

最新評論文章