論文閱讀-week1：Going deeper with convolutions（Inception v1 ）

原創

观生生不息

2020-06-16 10:28

一、基礎知識

1. 卷積（Convolution）：

對應局部感知，原理是在觀察某個物體時，既不能觀察每個像素，也不能一次觀察整體，而應該先從局部開始認識。

2. 卷積核（Convolution Kernel）：

卷積核的大小常見的有1x1、3x3、5x5；比較容易忽略的是，卷積核是有深度的，即輸入的通道數；卷積核的個數對應本次的通道數，即特徵圖數。

例如：Input(28, 28, 32) ==> Conv(kernel_size=(3, 3), filters=64, strides=(2, 2), padding='SAME') ==> Output(28, 28, 64)

輸入的shape是(28, 28, 32) ；其中28*28是圖像的長和寬；32是通道數(理解：圖像的三個通道分別是R、G、B)。

通過一個卷積層；卷積核的大小是(3, 3)；卷積核的深度32；卷積核的個數是64，即輸出的通道/特徵圖數是64；padding='SAME'保證了輸出的長和寬依舊是28*28。

3. 池化（Pooling）

卷積對應某個局部特徵，池化操作針對每個通道，將更大尺寸上的卷積特徵聚合（Aggregation）爲更全局性的特徵，對應於Cross Region。與之相對的是使用1x1卷積核可以做到Cross Channel。

池化操作起到升維或降維的作用。與之相對的是使用1x1卷積核也可以起到升維或降維的作用。

二、1x1卷積核

1. 理解：

1x1卷積層其實可以理解爲全連接層。

如下圖，左圖是全連接層：輸入是a1-a5，輸出是b1-b5，b1 = a1*w1_1 + a2*w1_2 + ... + a6*w1_6；... ；b5 = a1*w5_1 + a2*w5_2 + ... + a6*w5_6。

右圖是1x1卷積層，輸入是6*6*32（藍色立方體），取其中一部分1*1*32（h1_1-h1_32）與卷積核（k1-k32）進行卷積（藍色立方體中的黃色立方體），得到的結果是y1=h1_1*k1 + h1_2*k2 + ... + h1_32*k32（綠點），因爲藍色立方體可以被分爲6*6=36個1*1*32的小立方體，所以可以得到y1-y36。綜上，右圖相當於一個輸入是k1-k32，輸出是y1-y36的全連接層，y1 = k1*h1_1 + k2*h1_2 + ... + k32*h1_32；... ；y36 = k1*h36_1 + k2*h36_2 + ... + k32*h36_32。

2. 作用

1）降/升維：

例如輸入爲6*6*32，1x1卷積的形式是1*1*32，當有16個卷積核的時候，此時輸出爲6*6*16。即控制1x1卷積核的個數小/大於輸入通道數，即可起到降/升維的作用。

2）跨通道信息交互：

使用1x1卷積核，實現降維和升維的操作其實就是channel間信息的線性組合變化，例如上述輸入爲6*6*32，通過16個1x1的卷積核之後，得到輸出6*6*16，即原來的32個通道跨通道線性組合爲了16個通道，實現了跨通道（Cross Channel）信息交互。

3）減少計算量：

左圖需要的計算量爲：5*5*192*28*28*32=120422400。

右圖需要的計算量爲：1*1*192*28*28*16 + 5*5*16*28*28*32=2408448 + 10035200 = 12443648。約爲左圖計算量的0.1033。

三、Inception模塊

1. 多尺度進行卷積再聚合：

提高模型性能的方法有增加網絡層次（深度）和增加每一層的神經元數量（寬度），但相應問題有：

1. 參數數量會大幅增加，網絡容易過擬合；

2. 需要強大的算力。

文章提出的解決方法：

1. 使用“稀疏性連接”來避免過擬合的問題，然而其計算框架導致稀疏層計算能力浪費；

2. 通過concat拼接多個卷積結果來解決計算能力浪費的問題。

具體做法：

1. 採用卷積核大小爲1×1、3×3、5×5的卷積結構；採用在許多卷積神經網絡中起到關鍵作用的max pooling（3×3）結構；即多個稀疏網絡；

2. 因爲密集矩陣的計算性能高，因此最終所有並行的卷積、池化結果被concat（即feature map的大小不變，channel增加）在一起，即將稀疏矩陣聚類爲較爲密集的子矩陣，來提高計算性能。

2.使用1x1卷積減少計算：

上述方法參數數目仍然較多，尤其是5×5的卷積會帶來大量計算，文章借鑑Network in Network的1x1卷積來降維經過降維，參數數量只剩下原來的12.75%。

四、GoogleNet網絡

1. 採用Inception模塊堆疊而成；

2. 網絡越到後面，特徵也越抽象。因爲要將這些抽象特徵進一步組合起來提取更高維的特徵，網絡不能只關注小範圍內的特徵信息了，所以需要讓感受野大一些，看到更多的抽象信息。因此，3×3和5×5卷積的比例要增加；

3. 在底層保持傳統卷積不變，在高層使用Inception結構；

4. 基於Network in Netw論文中的思想，在最後使用了average pooling來代替展開爲全連接層的形式。實驗也證明這樣可以提高top-1準確率大概0.6%；

5. 最後加的全連接層主要是爲了便於大家將網絡用於其他的數據集finetune；

6. 網絡中使用了dropout防止過擬合；

7. 網絡有旁路，即兩個輔助的softmax層。主要作用是，避免梯度消失，幫助梯度的傳導。實際測試模型的時候，會將這兩個softmax去除。

參考

論文原文：https://arxiv.org/pdf/1409.4842v1.pdf

https://www.cnblogs.com/tianqizhi/p/9665436.html

https://blog.csdn.net/sscc_learning/article/details/79863922

https://blog.csdn.net/amusi1994/article/details/81091145

https://zhuanlan.zhihu.com/p/33305030

https://blog.csdn.net/hongbin_xu/article/details/83280821

https://blog.csdn.net/weixin_39953502/article/details/80966046

發表評論

所有評論

還沒有人評論，想成為第一個評論的人麼? 請在上方評論欄輸入並且點擊發布.

相關文章

Stable Diffusion中的embedding

Stable Diffusion中的embedding 嵌入，也稱爲文本反轉，是在 Stable Diffusion 中控制圖像樣式的另一種方法。在這篇文章中，我們將學習什麼是嵌入，在哪裏可以找到它們，以及如何使用它們。什麼是嵌入embe

2024-04-25 21:31:13

AI從入門到入門之手寫數字識別模型java方式Dense全連接神經網絡實現

前言：授人以魚不如授人以漁.先學會用，在學原理，在學創造，可能一輩子用不到這種能力，但是不能不具備這種能力。這篇文章主要是介紹算法入門Helloword之手寫圖片識別模型java中如何實現以及部分解釋。目前大家對於人工智能-機器學習-神經網

2024-04-19 23:17:21

Pinecone: 大模型時代的智能索引與搜索解決方案

隨着人工智能技術的飛速發展，大模型（Large Models）已成爲衆多領域的重要工具。無論是自然語言處理、圖像識別還是其他複雜任務，大模型都展現出了強大的性能。然而，隨着模型規模的不斷擴大，數據量的激增，如何有效地管理、索引和搜索這些模型

2024-04-19 11:29:43

軟件測試從自動化到智能化，大模型開始加入

隨着科技的飛速發展，軟件行業也在不斷地演進和創新。作爲軟件行業的關鍵環節之一，軟件測試行業也在經歷着前所未有的變革。從最初的手動測試，到自動化測試，再到如今的智能化測試，軟件測試行業正在經歷一場深刻的技術革命。在這場革命中，Testin雲測

2024-04-19 00:53:25

裁員了！別錯過2024年大數據工程師必備的10項技能

在當今快速發展的世界中，數據被視爲新的石油。隨着對數據驅動洞察的日益依賴，大數據工程師的角色比以往任何時候都更爲關鍵。這些專業人員在管理和優化組織內的數據操作中扮演着至關重要的角色。在本文中，我們將探索2024年大數據工程師必須具備的十

2024-04-16 11:00:53

DevOps已死？2024年的DevOps將如何發展

隨着我們進入2024年，DevOps也隨之發生變化。新興的技術、變化的需求和發展的方法正在重新定義有效實施DevOps實踐。 IDC預測顯示，未來五年，支持DevOps實踐的產品市場繼續保持健康且快速增長，2022年-2027年的複合年增長

2024-04-08 12:51:44

從模型到部署，教你如何用Python構建機器學習API服務

本文分享自華爲雲社區《Python構建機器學習API服務從模型到部署的完整指南》，作者：檸檬味擁抱。在當今數據驅動的世界中，機器學習模型在解決各種問題中扮演着重要角色。然而，將這些模型應用到實際問題中並與其他系統集成，往往需要構建API

2024-04-08 10:33:17

測試左移已經開始影響DevOps的發展？

在軟件開發的早期，該過程通常是開發人員編寫代碼，再將其交給質量保證（QA）進行測試。這種瀑布開發方法可能會導致質量問題和延遲，因爲問題是在週期後期發現的。一、瞭解DevOps和測試左移 DevOps是Development和Operati

2024-04-07 12:48:37

黑盒Prompt優化：提升大模型反饋效果的新思路

隨着人工智能技術的快速發展，大模型在各種應用場景中發揮着越來越重要的作用。然而，如何提升大模型的反饋效果，使其更加準確、高效地爲用戶提供服務，一直是研究者和開發者關注的焦點。本文提出了一種新的思路——黑盒Prompt優化，旨在通過改進輸入提

2024-03-29 00:01:17

分佈式數據庫技術的演進和發展方向

這些年大家都在談分佈式數據庫，各大企業也紛紛開始做數據庫的分佈式改造。那麼，所謂的分佈式數據庫到底是什麼？採用什麼架構？優勢在哪？爲什麼越來越多企業選擇它？分佈式數據庫技術會向什麼方向發展？帶着這些疑問，一探究竟吧！參與文末的話題互動

2024-03-26 11:34:43

利用RAG技術打破大模型幻覺

隨着人工智能技術的不斷進步，大模型在各個領域中發揮着越來越重要的作用。然而，大模型幻覺問題一直是制約其進一步發展的瓶頸。爲了解決這一問題，研究者們不斷探索新的技術和方法。近年來，一種名爲RAG（檢索增強生成）的技術備受關注，它通過結合知識圖

2024-03-21 00:28:34

與 NVIDIA 再次合作、深度參與 GTC，Zilliz 與全球頂尖開發者共迎 AI 變革時刻！

Zilliz 與全球的頂尖開發者齊聚 GTC 2024。近日，備受關注的 NVIDIA GTC 2024 已拉開序幕，來自世界各地的頂尖 AI 開發者齊聚美國加州聖何塞會議中心，共同探索行業未來。作爲去年被 NVIDIA CEO 黃仁

2024-03-19 21:26:53

多模態+大模型會帶來哪些“化學反應”？

導語：沒人懷疑，2024 年，AI 依然將是科技界的主角。上個月，OpenAI 推出了可以生成 60 秒高清視頻的視頻生成模型 Sora，掀起了對多模態模型的進一輪討論。多模態大模型技術的最新進展如何？這一波新技術，對於行業和消費者的體驗會

2024-03-15 13:45:01

婦女節：打開 AI 視界，成就“她力量”

根據國內招聘平臺獵聘發佈的《2024 女性人才數據洞察報告》，從 2023 年 3 月到 2024 年 2 月，女性在 AIGC 領域的求職人次同比增長了 190.49%。隨着人工智能時代的降臨，女性正以前所未有的姿態，在技術的助力下，蛻變

2024-03-09 01:06:57

AI安全白皮書 | “深度僞造”產業鏈調查以及四類防禦措施

以下內容，摘編自頂象防禦雲業務安全情報中心正在製作的《“深度僞造”視頻識別與防禦白皮書》，對“深度僞造”感興趣的網友，可前往頂象留言，在該白皮書完成後，會爲您免費寄送一份電子版。 “深度僞造”就是創建高度逼真的虛假視頻或虛假錄音，然

2024-03-08 00:45:22

24小時熱門文章

35K*14 薪，入職了！這公司只要不裁員，我能一直呆下去！

最新文章

最新評論文章