理解深度神經網絡——DNN(Deep Neural Networks)

原創

凌晨四点天使之城

2020-04-28 10:56

深度神經網絡——DNN 是深度學習的基礎。

要理解DNN最好先搞清楚它的模型。本篇博文主要對DNN的模型與前向傳播算法做一個易於理解的總結。

1.從感知機到神經網絡的理解。

感知機是這麼一種模型：一個有若干輸入和一個輸出的模型。看下圖：

輸出和輸入之間學習到一個線性關係，得到中間輸出結果：

接着是一個神經元激活函數：

從而得到想要的結果1或者-1.

這個模型只能用於二元分類，且無法學習比較複雜的非線性模型，因此在工業界無法使用。

而神經網絡則在感知機的模型上做了擴展，總結下主要有三點：

1. 加入了隱藏層，隱藏層可以有多層，增強模型的表達能力，如下圖實例，當然增加了這麼多隱藏層模型的複雜度也增加了好多。

2. 輸出層的神經元也可以不止一個輸出，可以有多個輸出，這樣模型可以靈活的應用於分類迴歸，以及其他的機器學習領域比如降維和聚類等。多個神經元輸出的輸出層對應的一個實例如下圖，輸出層現在有4個神經元了。

2. 對激活函數做擴展，感知機的激活函數是sign(z)雖然簡單但是處理能力有限，因此神經網絡中一般使用的其他的激活函數，比如我們在邏輯迴歸裏面使用過的Sigmoid函數，即：

還有後來出現的tanx, softmax,和ReLU等。通過使用不同的激活函數，神經網絡的表達能力進一步增強。以後會有專門的激活函數專欄。

2.DNN的基本結構

神經網絡是基於感知機的擴展，而DNN可以理解爲有很多隱藏層的神經網絡。多層神經網絡和深度神經網絡DNN其實也是指的一個東西，DNN有時也叫做多層感知機（Multi-Layer perceptron,MLP）。

從DNN按不同層的位置劃分，DNN內部的神經網絡層可以分爲三類，輸入層，隱藏層和輸出層,如下圖示例，一般來說第一層是輸入層，最後一層是輸出層，而中間的層數都是隱藏層。

層與層之間是全連接的，也就是說，第i層的任意一個神經元一定與第i+1層的任意一個神經元相連。雖然DNN看起來很複雜，但是從小的局部模型來說，還是和感知機一樣，即一個線性關係：

由於DNN層數多，則我們的線性關係係數w和偏倚b的數量也就是很多了。具體的參數在DNN是如何定義的呢？

3 DNN前向傳播算法數學原理

4 DNN前向傳播算法

所謂的DNN前向傳播算法就是利用若干個權重係數矩陣W,偏倚向量b來和輸入值向量x進行一系列線性運算和激活運算，從輸入層開始，一層層的向後計算，一直到運算到輸出層，得到輸出結果爲值。

輸入: 總層數L，所有隱藏層和輸出層對應的矩陣W,偏倚向量b，輸入值向量x

輸出：輸出層的輸出。

5 DNN反向傳播算法要解決的問題

6 DNN反向傳播算法的基本思路

在進行DNN反向傳播算法前，我們需要選擇一個損失函數，來度量訓練樣本計算出的輸出和真實的訓練樣本輸出之間的損失。

DNN可選擇的損失函數有不少，爲了專注算法，這裏使用最常見的均方差來度量損失。

即對於每個樣本，我們期望最小化下式：

損失函數有了，用梯度下降法迭代求解每一層的w,b。

7 DNN反向傳播算法過程

由於梯度下降法有批量（Batch），小批量(mini-Batch)，隨機三個變種，爲了簡化描述，這裏我們以最基本的批量梯度下降法爲例來描述反向傳播算法。實際上在業界使用最多的是mini-Batch的梯度下降法。區別僅僅在於迭代時訓練樣本的選擇。

8 均方差損失函數+Sigmoid激活函數的問題

在講反向傳播算法時，我們用均方差損失函數和Sigmoid激活函數做了實例，首先我們就來看看均方差+Sigmoid的組合有什麼問題。

首先我們回顧下Sigmoid激活函數的表達式爲：

9 交叉熵損失函數+Sigmoid激活函數改進DNN算法收斂速度

發表評論

所有評論

還沒有人評論，想成為第一個評論的人麼? 請在上方評論欄輸入並且點擊發布.

相關文章

攻擊者正在利用AI，對保險公司發起大規模欺詐

保險欺詐一直是保險行業面臨的重要挑戰之一，尤其隨着技術的進步，欺詐者也在不斷更新其手段，利用AI技術，包括生成式模型、機器學習和數據分析工具等欺騙保險公司，而AI技術的應用正成爲他們的新工具，使其犯罪行爲更加隱蔽和複雜，挑戰保險行業的防欺詐

2024-05-10 00:55:17

AIGC在京東廣告創意的技術應用

一、前言電商廣告圖片不僅能夠抓住消費者的眼球，還可以傳遞品牌核心價值和故事，建立起與消費者之間的情感聯繫。然而現有的廣告圖片大多依賴人工製作，存在效率和成本的限制。儘管最近AIGC技術取得了卓越的進展，但其在廣告圖片的應

京東雲開發者

2024-05-08 23:24:18

AI繪圖新選擇：Fooocus工具發佈，小顯存助力大模型運行

隨着人工智能技術的飛速發展，AI繪圖工具已經成爲了衆多創作者們的得力助手。它們能夠基於深度學習算法，快速生成高質量的圖像，爲設計、藝術等領域注入了新的活力。然而，傳統的AI繪圖工具往往對硬件要求較高，使得許多擁有較低配置設備的用戶望而卻步。

2024-05-07 23:30:10

GLM國產大模型訓練加速：高效性能與成本優化的實踐

隨着人工智能技術的不斷進步，大模型的訓練成爲了推動深度學習領域發展的重要力量。然而，傳統的訓練方式往往面臨着性能瓶頸和高昂的成本問題，這使得許多研究者和開發者望而卻步。爲了解決這一難題，我們探索了使用OneFlow框架對GLM國產大模型進行

2024-05-07 23:30:09

LoRA微調語言大模型的實用技巧

一、引言隨着深度學習技術的快速發展，語言大模型在自然語言處理領域取得了顯著的進展。然而，傳統的微調方法通常需要大量的計算資源和時間，對於實際應用來說並不友好。爲了解決這個問題，LoRA微調技術應運而生。LoRA（Low-Rank Adap

2024-04-28 11:30:13

京東廣告研發——效率爲王：廣告統一檢索平臺實踐

1、系統概述實踐證明，將互聯網流量變現的在線廣告是互聯網最成功的商業模式，而電商場景是在線廣告的核心場景。京東服務中國數億的用戶和大量的商家，商品池海量。平臺在兼顧用戶體驗、平臺、廣告主收益的前提推送商品具有挑戰性。京東廣告檢索平臺

2024-04-25 23:17:47

Stable Diffusion中的embedding

Stable Diffusion中的embedding 嵌入，也稱爲文本反轉，是在 Stable Diffusion 中控制圖像樣式的另一種方法。在這篇文章中，我們將學習什麼是嵌入，在哪裏可以找到它們，以及如何使用它們。什麼是嵌入embe

2024-04-25 21:31:13

大模型區域落地再加速！百度“文心中國行”西部首站落地成都錦江

4 月 24 日，“文心中國行”西部地區首站落地成都錦江。成都市錦江區白鷺灣新經濟總部功能區、錦江區投資促進局與百度飛槳攜手合作，打造成都人工智能的新產業、新模式、新業態。來自成都政產學研各界的領導、專家、企業嘉賓，共同探討如何降低 AI

2024-04-25 11:41:53

文心中國行走進成都！4 月 24 日一起把握大模型時代的產業新機遇

4 月 24 日，文心中國行將走進成都。屆時，政府、企業與高校的相關專家和業界同仁將現場分享生成式人工智能與大模型最新進展，從人工智能政策解讀、大模型技術，到產業創新應用的實踐案例，讓參會者全方位瞭解大模型時期的發展與創新機遇。大會還特別

2024-04-23 11:41:07

文心大模型“你說我畫”：PaddleHub與PaddleSpeech的協同實踐

在人工智能領域中，自然語言處理和計算機視覺是兩個非常活躍的研究方向。隨着深度學習技術的發展，這兩個領域之間的交叉融合產生了許多令人興奮的應用場景。其中，“你說我畫”就是這樣一個結合自然語言處理和計算機視覺技術的創新應用。 “你說我畫”的核心

2024-04-22 11:29:20

探索時間序列大模型：TimeGPT的魅力與實踐

在數據科學的各個領域中，時間序列分析一直扮演着重要角色。無論是預測股票價格、氣候變化，還是分析醫療數據，時間序列模型都發揮着不可或缺的作用。然而，傳統的時間序列分析方法在處理複雜數據時常常面臨諸多挑戰，如數據稀疏性、非線性關係等。爲了應對這

2024-04-22 11:29:17

京東廣告研發——AIGC在京東廣告創意的技術應用

一、前言電商廣告圖片不僅能夠抓住消費者的眼球，還可以傳遞品牌核心價值和故事，建立起與消費者之間的情感聯繫。然而現有的廣告圖片大多依賴人工製作，存在效率和成本的限制。儘管最近AIGC技術取得了卓越的進展，但其在廣告圖片的應用還存在缺乏

2024-04-22 11:16:30

Create 2024 分論壇：百度大模型安全解決方案護航開發者一起創造未來

4月16日，百度Create AI開發者大會在深圳國際會展中心（寶安）舉行，大會以“創造未來”爲主題，匯聚了當前科技和產業革命中的開發者先鋒力量。自去年3月16日發佈知識增強大語言模型文心一言以來，百度不斷推動文心大模型的升級迭代，每一次版

2024-04-19 21:33:25

AI大模型應用架構（ALLMA）白皮書解讀

隨着人工智能技術的不斷髮展，AI大模型成爲推動生產、生活方式變革，助推產業智能化轉型升級，驅動數字經濟高質量發展等社會經濟發展方面的新引擎。爲了全面展示AI大模型的發展全貌，爲各界提供新思路，本文將對AI大模型應用架構（ALLMA）白皮書進

2024-04-19 11:29:39

文心大模型ERNIE-Tiny：輕量化技術的全面解讀

隨着人工智能技術的日益成熟，大模型成爲了衆多領域的研究熱點。大模型通過龐大的數據量和複雜的網絡結構，實現了對數據的深度挖掘和高效處理。然而，大模型的龐大體積和高計算成本也限制了其在一些實際場景中的應用。爲了解決這一問題，文心大模型ERNIE

2024-04-18 11:29:53

24小時熱門文章

最新文章

最新評論文章