《機器學習理論導引》閱讀攻略

原創

2020-06-29 13:18

{"type":"doc","content":[{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null}},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null},"content":[{"type":"text","text":" 最近在讀《機器學習理論導引》。這本書是西瓜書的作者周志華老師領銜、南大LAMDA四位教授共同撰寫的新書，權威就自不必說。封面畫了一隻充滿了阿里巴巴和四十大盜風格的木箱子，一看就是童話故事官方指定用來裝寶貝的那一種，大家就按慣例起了個綽號，叫“寶箱書”。"}]},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null},"content":[{"type":"text","text":" 剛接觸機器學習應該都有一個共同的感覺，就是機器學習不太好學習。主要的難題有兩個，第一個自然是數學，機器學習需要大量的數學基礎知識，一個個張牙舞爪的數學公式很容易讓人望而卻步。可是，當我們好不容易鼓起勇氣，爲了學好機器學習，決心和數學死磕到底，我們很快又會遇到第二個難題，知識面太過寬泛，就算願意硬啃，也讓人無從下嘴。我在以前的文章反覆說過，機器學習是算法，不是一種算法，是一羣算法的總稱。機器學習雖然要求解的問題來來去去就那幾個大類，但解題思路是一個賽一個精奇，不同思想下設計出來的算法自然也就猶如八仙過海。精彩是挺精彩的，但是自然涉及的數學基礎自然五花八門，從學習的角度來看，總感覺要學的東西東一塊西一塊的不成體系，缺乏一條循序漸進的主軸，甚至連起點在哪裏都不太好找。"}]},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null},"content":[{"type":"text","text":" 《機器學習理論導引》就是要解決這個問題。這本書的定位是“給學習和研究機器學習理論提供一個入門引導”，這話是我從書裏抄的，寫得相當官方，如果沒看完這本書，光看這句話確實不太容易明白究竟是什麼意思。其實很簡單，我們學習一門知識，習慣上總是從基礎學習，畢竟從小就說要夯實基礎再往上學嘛。可是，上面已經說了，機器學習的理論知識客觀上確實存在並非同根同源的問題，真的能找到所謂的“機器學習基礎理論知識”嗎？"}]},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null},"content":[{"type":"text","text":" 答案是可以的。機器學習算法腦洞頻閃，但既然都叫機器學習，那自然都能抽象出一些共同的特點來，能夠被歸入同一套學習框架之中。這套從機器學習中通過高度抽象而來理論框架，就叫學習理論，顧名思義，是專門研究機器學習如何學習的理論體系，是機器學習算法理論的理論，這也是《機器學習理論導引》的主要內容。"}]},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null},"content":[{"type":"text","text":" 如果你對這個詞很陌生，不要緊，它是本篇的主角，接下來我們會用很長的篇幅介紹學習理論到底都研究哪些問題。總而言之，和機器學習算法散漫的知識點相比，學習理論顯然更爲系統，看上去更符合我們平時印象當中的“基礎理論體系”。"}]},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null},"content":[{"type":"text","text":" 那難道其它教材都不知道有學習理論的存在嗎？當然不是，實際上很多的機器學習教材都有涉及。不過，市面上機器學習的教材主要還是着眼於算法，對學習理論的介紹通常分散在不同的章節當中，仍然無法避免知識點割裂的問題。另一些教材爲了強調邏輯的關聯，選擇了另一個極端，即只選擇學習理論中具體的某一種深入介紹，有一點研究專著的意思，這種選擇確實能夠避免了割裂問題，但同時也只好犧牲了知識的全面性。"}]},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null},"content":[{"type":"text","text":" 教材市場的這種現狀其實並不奇怪，癥結在於機器學習的基礎理論一點也不“基礎”。我們說過，學習理論是機器學習理論的理論，是高度抽象的學習理論框架。看到“高度抽象”幾個字，你也許會突然明白點什麼。初次翻《機器學習理論引導》，特別是以前已經看過一些機器學習相關教材的同學，可能會有種用頭霧水的感覺。我們習慣看到機器學習的書裏面用不同的章節介紹線性模型、決策樹、神經網絡之類的知識，但《機器學習理論導引》這本書卻不是這麼回事，翻開目錄，除了第一章預備知識裏提了一嘴支持向量機，正片裏全是可學性、複雜度、遺憾界之類搞不清從哪冒出來的怪詞，搞不清和我們過往熟悉的那一套機器學習知識都有什麼關聯，自然就不太容易搞清楚應該怎樣閱讀。"}]},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null},"content":[{"type":"text","text":" 這也正是本文的重點，這本書書名叫《機器學習理論導引》，定位是“導引”，不過正如上面所說，學習理論高度抽象，連《導引》翻開都是陌生艱澀的名詞，容易讓人摸不着頭腦。我想，如果再有一篇《導引》的導引，介紹一下這本書都寫了些什麼內容，都有什麼作用，又是按什麼邏輯串在一起的，讀起來也許就友好多了。"}]},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null},"content":[{"type":"text","text":" 那麼接下來我們就專聊怎麼讀的問題。我覺得有必要從書的封面說起。拿到書後我第一個問題就是，封面是不是畫錯了？機器學習總要自帶一點科幻光環，機器學習的書也一般會選擇在封面放個機器人或者機器腦之類的科幻符號，爲啥這本書的封面非要放一隻古裏古氣的箱子？"}]},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null},"content":[{"type":"text","text":" 答案恰恰和書的組織結構密切相關。《機器學習理論導引》這本書介紹的是機器學習中的學習理論，本書一共八個章節，除了第一章預備知識外，每章介紹一種學習理論的問題，一共介紹了七種重要概念和理論工具。“七”這個數字在周老師看來有着非凡意義，周老師在前言裏自曝是武俠迷，“七”讓他一下想起了古龍先生的代表作《七種武器》，而第七種武器正好是“什麼都能往裏裝”的神奇箱子。周老師說，他忍不住要致敬《七種武器》，這就有了封面的寶箱，“寶箱書”也因此而得名。"}]},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null},"content":[{"type":"text","text":" 學習理論的研究對象是機器學習是怎樣學習的，很多的課題，哪怕此前已經對機器學習有所瞭解，可能剛接觸時仍會感到陌生。要比較流暢地閱讀本書，首先需要了解《機器學習理論導引》是根據怎樣的組織邏輯、按照怎樣的主線介紹學習理論。"}]},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null},"content":[{"type":"text","text":" 首先講的是可學性，這是學習理論的基礎。先說說“可學性”這個詞，是不是給人一種每一個字我都認識，但合在一起就不知道是什麼意思的感覺？這個詞和機器學習中的“學習”密切相關，英文叫Learnable，直譯過來就是可學（習）性。聽起來很複雜，其實意思很簡單，機器學習的能力是有上限的，這裏不是指某一款模型，而是在座的各位，也就是有些任務是無法通過機器學習來完成的。如果把機器學習要完成的任務看作是一道數學題，那可學性指的就是這道題是否有解，也就是能否通過機器學習來達到目標，反之亦然。"}]},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null},"content":[{"type":"text","text":" 這一章有一個非常重要的學習理論，需要重點學習，叫概率近似正確理論，一般採用它的英文縮寫，寫作PAC理論。PAC理論是學習理論中最基本的理論，不難想見，“學習能力”是一個高度抽象的概念，我們可以用直白的語言解釋它的含義，那要給出形式化的定義並不容易。PAC學習正是給出了一個抽象刻畫機器學習能力的框架。這是一項開創性的工作，由圖靈獎得主Valiant創立，並籍此開創了“計算學習理論”這個新的研究領域。"}]},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null},"content":[{"type":"text","text":" 接下來講的是複雜度。這一章承接上一章，可學性關注的是問題是否有解，而複雜度關注的是有多難解。在PAC理論中，可學性與假設空間的複雜程度密切相關，假設空間越複雜，搜索解的難度越大。當假設空間是有限的時候，可以通過層層篩選搜索解，但這就有了一個限制條件：假設空間必須有限。數學不喜歡侷限，同時，很多模型的假設空間並非是有限的，那這時應該怎樣刻畫複雜度呢？這就是本章的主要內容。"}]},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null},"content":[{"type":"text","text":" 本章同樣有一個非常重要的概念，VC維。一般機器學習的教材如果選擇放入一點學習理論的內容，通常至少會包括兩個知識點，一個是前一章的PAC理論，另二個就着本章的VC維。VC維是一種刻畫假設空間複雜度常用的方法，當然這不是唯一一種，本章同時也介紹了另一種，名爲Rademacher複雜度。"}]},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null},"content":[{"type":"text","text":" 也許大家第一次看，會覺得PAC理論、VC維這些知識太過抽象，也不知道學來能有什麼用。這些知識確實不太容易學懂，但都是學習理論的基礎，也是最常用的研究工具，絕不是爲學而學，學完就扔了的，後續的章節會反覆使用這些基礎和工具來研究更具體的問題。書裏接下來安排的三章，包括第4章的泛化界、第5章的穩定性和第6章的一致性，可以看作是同一個大問題的三個大塊，這個大問題就是模型效果評價。在機器學習中，模型效果毫無疑問是最需要關注的問題之一。"}]},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null},"content":[{"type":"text","text":" 機器學習模型效果好不好，一般業內會用泛化能力強不強來評價。什麼叫“泛化”呢？泛化指的是模型在不同數據集中的預測效果。爲什麼要考慮這個問題呢？如果看過我寫的那本面向初學者的《機器學習算法的數學解析和Python實現》知道，所謂機器學習，就是擬合數據。要使用機器學習模型，首先是需要經過訓練的，模型訓練需要數據，這部分數據稱爲訓練數據，或者叫訓練集。"}]},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null},"content":[{"type":"text","text":" 這裏有一個隱含的知識點，每個數據集都有自己的分佈特徵，使用訓練集訓練模型，模型擬合的其實是訓練集的特徵，這就可能導致一個問題，過擬合問題。過擬合直白來說，就是模型學得太好了，這是初學者很費解的一個詞，學得太好怎麼能叫問題呢？這個問題我在《機器學習算法的數學解析和Python實現》也專門進行了介紹，學得太好當然不是問題，問題是不同的數據集可能會有不同的分佈特徵，模型在訓練集上學得太好，在其它數據集上，具體來說，是在其它分佈特徵上，模型的預測性能反而可能下降，也就是過擬合使得模型的泛化能力下降了。這可能就會產生一個現象，泛化能力差的模型在訓練時看起來效果不錯，可是一部署到生產環境就變成了笑話，完全不可用了。這就是爲什麼無論是學術界還是工業界，都非常關心模型的泛化能力。"}]},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null},"content":[{"type":"text","text":" 爲了具體研究這個問題，《機器學習理論導引》首先介紹了泛化界，包括泛化誤差上界和泛化誤差下界。泛化界主要是基於不同的假設空間複雜度度量，這裏就用到了前面譬如VC維等的知識，與具體的學習算法無關，但有一個侷限，這些泛化誤差界只能用於有限VC維學習算法的泛化性，而對無限VC維的學習算法無能爲力。要解決這個問題，書裏接着介紹了穩定性，用來刻畫訓練集的擾動對算法效果產生的影響。"}]},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null},"content":[{"type":"text","text":" 接下來書裏介紹了一致性理論，同樣是聚焦訓練集，但這一次開了一個很大的腦洞。工業界有個說法，如果模型效果不行，首先要做的是多收集數據。多收集數據在實踐上效果確實好，所以口口相傳廣爲人知，但大家在用的時候肯定都很關心，到底什麼樣的模型才能和數據規模保持這種線性增長關係，裏面會不會也有個“看臉”的問題。一致性理論就是假設訓練數據不斷增加，最後趨向於無窮的過程中，學習算法通過訓練是否趨向於貝葉斯最優分類器。簡單來說，一致性研究的就是哪些模型適合通過無腦堆數據來提升預測效果。"}]},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null},"content":[{"type":"text","text":" 接下來的第7章的收斂率，研究的是模型訓練階段的優化問題，這是個實踐中非常重要的問題。我在《機器學習算法的數學解析和Python實現》中介紹，模型訓練很像馬戲團訓練動物，是通過反饋獎勵來進行，具體的目標就是使得損失函數最小化。那怎麼達到最小化呢？這就是個優化問題，最常見的就是選擇梯度下降法。"}]},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null},"content":[{"type":"text","text":" 但是，紙上得來終覺淺，一到實踐你就會發現，是不是選擇了梯度下降法就萬事大吉呢？不是，還有一個收斂問題。首先梯度並不是一定就肯乖乖下降，還有可能上升，這就是非常叫人討厭的梯度爆炸，更常見的問題是另一種，就是梯度雖然下降，但下降得非常慢，兩百年過去了才降一點點，使得訓練時間非常長。這些就是收斂問題，包括兩個方面內容，一是什麼條件才能夠收斂，也就是收斂條件，另一個則是本書第7章要介紹的收斂率，也就是收斂的速度如何。"}]},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null},"content":[{"type":"text","text":" 最後一章第8章，介紹的是遺憾界。遺憾英文regret，是一項性能評價指標，大家也許聽到的不多，覺得有點陌生，這也不奇怪，因爲這一章已經跨出了機器學習的傳統範疇，進入到在線學習的領域。遺憾（regret）主要是用來評價在線學習。在線學習的訓練方法和我們熟悉的不太一樣，所謂在線學習，就是用於訓練的數據集一直在不斷動態更新，這和我們熟悉的用一塊靜態數據作爲訓練集來訓練模型的方式不太一樣，訓練目標也從最小化損失函數，變成了最小化累計損失。因此，評價模型效果的指標也有所區別，使用的是比較結果，具體來說，是在線損失與離線算法的最小損失的差值，這就是遺憾。研究遺憾的取值邊界，這就是本章重點關注的遺憾界問題。"}]},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null},"content":[{"type":"text","text":"下回再聊。"}]},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null},"content":[{"type":"text","text":" "}]},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null},"content":[{"type":"text","text":" "}]},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null},"content":[{"type":"text","text":"莫凡 "}]},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null},"content":[{"type":"text","text":"網名木羊同學。娛樂向機器學習解說選手，《機器學習算法的數學解析與Python實現》作者，前沿技術發展觀潮者，擅長高冷技術的“白菜化”解說，微信公衆號“睡前機器學習”，個人知乎號“木羊”。"}]}]}

發表評論

所有評論

還沒有人評論，想成為第一個評論的人麼? 請在上方評論欄輸入並且點擊發布.

相關文章

AI從入門到入門之手寫數字識別模型java方式Dense全連接神經網絡實現

前言：授人以魚不如授人以漁.先學會用，在學原理，在學創造，可能一輩子用不到這種能力，但是不能不具備這種能力。這篇文章主要是介紹算法入門Helloword之手寫圖片識別模型java中如何實現以及部分解釋。目前大家對於人工智能-機器學習-神經網

2024-04-19 23:17:21

Pinecone: 大模型時代的智能索引與搜索解決方案

隨着人工智能技術的飛速發展，大模型（Large Models）已成爲衆多領域的重要工具。無論是自然語言處理、圖像識別還是其他複雜任務，大模型都展現出了強大的性能。然而，隨着模型規模的不斷擴大，數據量的激增，如何有效地管理、索引和搜索這些模型

2024-04-19 11:29:43

軟件測試從自動化到智能化，大模型開始加入

隨着科技的飛速發展，軟件行業也在不斷地演進和創新。作爲軟件行業的關鍵環節之一，軟件測試行業也在經歷着前所未有的變革。從最初的手動測試，到自動化測試，再到如今的智能化測試，軟件測試行業正在經歷一場深刻的技術革命。在這場革命中，Testin雲測

2024-04-19 00:53:25

裁員了！別錯過2024年大數據工程師必備的10項技能

在當今快速發展的世界中，數據被視爲新的石油。隨着對數據驅動洞察的日益依賴，大數據工程師的角色比以往任何時候都更爲關鍵。這些專業人員在管理和優化組織內的數據操作中扮演着至關重要的角色。在本文中，我們將探索2024年大數據工程師必須具備的十

2024-04-16 11:00:53

DevOps已死？2024年的DevOps將如何發展

隨着我們進入2024年，DevOps也隨之發生變化。新興的技術、變化的需求和發展的方法正在重新定義有效實施DevOps實踐。 IDC預測顯示，未來五年，支持DevOps實踐的產品市場繼續保持健康且快速增長，2022年-2027年的複合年增長

2024-04-08 12:51:44

從模型到部署，教你如何用Python構建機器學習API服務

本文分享自華爲雲社區《Python構建機器學習API服務從模型到部署的完整指南》，作者：檸檬味擁抱。在當今數據驅動的世界中，機器學習模型在解決各種問題中扮演着重要角色。然而，將這些模型應用到實際問題中並與其他系統集成，往往需要構建API

2024-04-08 10:33:17

測試左移已經開始影響DevOps的發展？

在軟件開發的早期，該過程通常是開發人員編寫代碼，再將其交給質量保證（QA）進行測試。這種瀑布開發方法可能會導致質量問題和延遲，因爲問題是在週期後期發現的。一、瞭解DevOps和測試左移 DevOps是Development和Operati

2024-04-07 12:48:37

黑盒Prompt優化：提升大模型反饋效果的新思路

隨着人工智能技術的快速發展，大模型在各種應用場景中發揮着越來越重要的作用。然而，如何提升大模型的反饋效果，使其更加準確、高效地爲用戶提供服務，一直是研究者和開發者關注的焦點。本文提出了一種新的思路——黑盒Prompt優化，旨在通過改進輸入提

2024-03-29 00:01:17

分佈式數據庫技術的演進和發展方向

這些年大家都在談分佈式數據庫，各大企業也紛紛開始做數據庫的分佈式改造。那麼，所謂的分佈式數據庫到底是什麼？採用什麼架構？優勢在哪？爲什麼越來越多企業選擇它？分佈式數據庫技術會向什麼方向發展？帶着這些疑問，一探究竟吧！參與文末的話題互動

2024-03-26 11:34:43

利用RAG技術打破大模型幻覺

隨着人工智能技術的不斷進步，大模型在各個領域中發揮着越來越重要的作用。然而，大模型幻覺問題一直是制約其進一步發展的瓶頸。爲了解決這一問題，研究者們不斷探索新的技術和方法。近年來，一種名爲RAG（檢索增強生成）的技術備受關注，它通過結合知識圖

2024-03-21 00:28:34

與 NVIDIA 再次合作、深度參與 GTC，Zilliz 與全球頂尖開發者共迎 AI 變革時刻！

Zilliz 與全球的頂尖開發者齊聚 GTC 2024。近日，備受關注的 NVIDIA GTC 2024 已拉開序幕，來自世界各地的頂尖 AI 開發者齊聚美國加州聖何塞會議中心，共同探索行業未來。作爲去年被 NVIDIA CEO 黃仁

2024-03-19 21:26:53

多模態+大模型會帶來哪些“化學反應”？

導語：沒人懷疑，2024 年，AI 依然將是科技界的主角。上個月，OpenAI 推出了可以生成 60 秒高清視頻的視頻生成模型 Sora，掀起了對多模態模型的進一輪討論。多模態大模型技術的最新進展如何？這一波新技術，對於行業和消費者的體驗會

2024-03-15 13:45:01

婦女節：打開 AI 視界，成就“她力量”

根據國內招聘平臺獵聘發佈的《2024 女性人才數據洞察報告》，從 2023 年 3 月到 2024 年 2 月，女性在 AIGC 領域的求職人次同比增長了 190.49%。隨着人工智能時代的降臨，女性正以前所未有的姿態，在技術的助力下，蛻變

2024-03-09 01:06:57

AI安全白皮書 | “深度僞造”產業鏈調查以及四類防禦措施

以下內容，摘編自頂象防禦雲業務安全情報中心正在製作的《“深度僞造”視頻識別與防禦白皮書》，對“深度僞造”感興趣的網友，可前往頂象留言，在該白皮書完成後，會爲您免費寄送一份電子版。 “深度僞造”就是創建高度逼真的虛假視頻或虛假錄音，然

2024-03-08 00:45:22

深入學習NumPy庫在數據分析中的應用場景

在數據科學與機器學習領域，NumPy（Numerical Python）是一個經常被提及的重要工具。它是Python語言中一個非常強大的庫，提供了高性能的多維數組對象以及用於處理這些數組的工具。NumPy不僅僅是一個用於數值計算的庫，它還

2024-03-02 00:30:28

24小時熱門文章

最新文章

最新評論文章