yolov3 tiny訓練自己的數據集進行物體檢測 (只檢測行人)

原創

风语者和波波娃

2020-02-25 17:27

說明：我的電腦是個16年3500元買的筆記本（勇氣可嘉：）

環境：額外的包之類的，我用的anaconda，可以非常容易安裝各類包，如果運行顯示缺包，那就去environment去安裝對應的包。

我的版本：python 3.7.4 - tensorflow 1.13.1 - numpy 1.16.0 - keras 2.2.4

1. 下載Github上面的文件

https://github.com/qqwweee/keras-yolo3

直接下載zip。本文是針對以上文件內容的微小改動來訓練自己的數據

2. 下載預訓練的權值

https://pjreddie.com/media/files/yolov3-tiny.weights

下載完成後放入上面解壓文件的目錄下 C:\Users\...\Desktop\keras-yolo3-master，下文所述“[目錄]”，皆指向此目錄

3. 下載數據集文件（自己製作也行，自己製作參考其他博客）

https://pan.baidu.com/s/15ewJZoav2ebmkqBf2bPyeA 提取碼：anv2

此處爲博主z649431508收集的數據集，放在代碼同一目錄下解壓（去掉外面多套的文件夾VOCdevkit，沒有多套請忽略該提示）。

解壓後可以把裏面文件刪除只保留：Annotations、ImageSets和JPEGImages。

將ImageSets\Main 文件夾下的txt文件全部刪掉

用python寫個腳本生成一個txt文件，仿照下圖形式，裏面的內容一直到009963（也就是該數據集裏面最後一張圖片），完事後這個train.txt放到 \VOCdevkit\VOC2007\ImageSets\Main下（這裏如果覺得數據集太多可以設置idx<5000）

python代碼如下：

idx = 1
f = open('train.txt', 'w')
while idx < 9964:
    f.write('{:0>6d}'.format(idx) + '\n')
    idx += 1
f.close()

4. 修改相關文件配置

修改voc_annotation.py，將class改爲：classes = ["person"]（我們只識別人所以只保留person），將sets改爲：sets=[('2007', 'train')]
修改model_data/voc_classes.txt 和 coco_classes.txt，刪除多餘類，只保留person（這一行）
修改yolov3-tiny.cfg，將[yolo]下的classes改爲=1，將[yolo]上的[convolutional]下的filter改爲filters=18 [因爲3 * ( classes + x + y + w + h + score )]，因爲tiny yolov3只有兩個不同輸出分支張量，所以總共需要修改兩處[yolo]和其上面的[convolutional]下的內容
修改train.py裏面，找到anchors_path，改爲anchors_path = 'model_data/tiny_yolo_anchors.txt'
修改yolo.py裏面，修改使得 "anchors_path": 'model_data/tiny_yolo_anchors.txt'

5. 生成.txt文件

運行anaconda prompt（以下“運行”所指，皆爲在anaconda prompt下鍵入指令）

運行voc_annotation.py

目錄下會生成名字前綴爲2007_的txt文件，然後刪掉它們的前綴 "2007_"，得到train.txt內容如下，每行的內容前面是路徑，後面五個數字爲一組，前四個是標記的box的xywh，後面一個0表示person。

（可選）運行kmeans.py文件，利用kmeans算法找到最合適的6個不同尺寸的anchor，用此文件替換model_data下的anchor文件。根據我自己的數據集，得到如下anchor

6. 運行 convert.py 將之前下載的預訓練權重（30M文件）轉化成keras網絡的權重（生成 .h5 文件）

python convert.py -w yolov3-tiny.cfg yolov3-tiny.weights model_data/tiny_yolo_weights.h5

6.x 如果不訓練，此時可以直接運行驗證別人訓練好的網絡的性能(*)

python yolo_video.py --image

test/person.jpg（要在目錄下創建test文件夾，裏面放上一張圖片命名person.jpg）

7. 訓練網絡

python train.py

下面的圖片是我整合所有圖片數據集後進行訓練的結果，因爲圖片太多，所有我修改了50+50epoch，改爲15+5epoch

8. 測試自己得到的權值

在 logs/000/下有你剛剛（'~'）訓練得到的權值文件 trained_weights_stage_1.h5（前15epoch得到）以及 trained_weights_final.h5(15+5epoch得到）

修改 yolo.py："model_path": 'logs/000/trained_weights_final.h5'

9. 效果

運行 6.x 所述內容

我通過整合數據並且加入自己標記的數據後，一共有10000張圖片，其中4000張包含人的。在只解封最後兩層訓練了15個epoch，然後解封所有層訓練了5個epoch。訓練後的效果感覺上其實不如官網權重的效果好，不過也不差太多。

10. 其他

附yolov3-tiny網絡參數和結構圖：

參考：

https://www.jianshu.com/p/d76adef49293

https://blog.csdn.net/lly1122334/article/details/89019891

發表評論

所有評論

還沒有人評論，想成為第一個評論的人麼? 請在上方評論欄輸入並且點擊發布.

相關文章

LoRA微調語言大模型的實用技巧

一、引言隨着深度學習技術的快速發展，語言大模型在自然語言處理領域取得了顯著的進展。然而，傳統的微調方法通常需要大量的計算資源和時間，對於實際應用來說並不友好。爲了解決這個問題，LoRA微調技術應運而生。LoRA（Low-Rank Adap

2024-04-28 11:30:13

京東廣告研發——效率爲王：廣告統一檢索平臺實踐

1、系統概述實踐證明，將互聯網流量變現的在線廣告是互聯網最成功的商業模式，而電商場景是在線廣告的核心場景。京東服務中國數億的用戶和大量的商家，商品池海量。平臺在兼顧用戶體驗、平臺、廣告主收益的前提推送商品具有挑戰性。京東廣告檢索平臺

2024-04-25 23:17:47

Stable Diffusion中的embedding

Stable Diffusion中的embedding 嵌入，也稱爲文本反轉，是在 Stable Diffusion 中控制圖像樣式的另一種方法。在這篇文章中，我們將學習什麼是嵌入，在哪裏可以找到它們，以及如何使用它們。什麼是嵌入embe

2024-04-25 21:31:13

大模型區域落地再加速！百度“文心中國行”西部首站落地成都錦江

4 月 24 日，“文心中國行”西部地區首站落地成都錦江。成都市錦江區白鷺灣新經濟總部功能區、錦江區投資促進局與百度飛槳攜手合作，打造成都人工智能的新產業、新模式、新業態。來自成都政產學研各界的領導、專家、企業嘉賓，共同探討如何降低 AI

2024-04-25 11:41:53

文心中國行走進成都！4 月 24 日一起把握大模型時代的產業新機遇

4 月 24 日，文心中國行將走進成都。屆時，政府、企業與高校的相關專家和業界同仁將現場分享生成式人工智能與大模型最新進展，從人工智能政策解讀、大模型技術，到產業創新應用的實踐案例，讓參會者全方位瞭解大模型時期的發展與創新機遇。大會還特別

2024-04-23 11:41:07

文心大模型“你說我畫”：PaddleHub與PaddleSpeech的協同實踐

在人工智能領域中，自然語言處理和計算機視覺是兩個非常活躍的研究方向。隨着深度學習技術的發展，這兩個領域之間的交叉融合產生了許多令人興奮的應用場景。其中，“你說我畫”就是這樣一個結合自然語言處理和計算機視覺技術的創新應用。 “你說我畫”的核心

2024-04-22 11:29:20

探索時間序列大模型：TimeGPT的魅力與實踐

在數據科學的各個領域中，時間序列分析一直扮演着重要角色。無論是預測股票價格、氣候變化，還是分析醫療數據，時間序列模型都發揮着不可或缺的作用。然而，傳統的時間序列分析方法在處理複雜數據時常常面臨諸多挑戰，如數據稀疏性、非線性關係等。爲了應對這

2024-04-22 11:29:17

京東廣告研發——AIGC在京東廣告創意的技術應用

一、前言電商廣告圖片不僅能夠抓住消費者的眼球，還可以傳遞品牌核心價值和故事，建立起與消費者之間的情感聯繫。然而現有的廣告圖片大多依賴人工製作，存在效率和成本的限制。儘管最近AIGC技術取得了卓越的進展，但其在廣告圖片的應用還存在缺乏

2024-04-22 11:16:30

Create 2024 分論壇：百度大模型安全解決方案護航開發者一起創造未來

4月16日，百度Create AI開發者大會在深圳國際會展中心（寶安）舉行，大會以“創造未來”爲主題，匯聚了當前科技和產業革命中的開發者先鋒力量。自去年3月16日發佈知識增強大語言模型文心一言以來，百度不斷推動文心大模型的升級迭代，每一次版

2024-04-19 21:33:25

AI大模型應用架構（ALLMA）白皮書解讀

隨着人工智能技術的不斷髮展，AI大模型成爲推動生產、生活方式變革，助推產業智能化轉型升級，驅動數字經濟高質量發展等社會經濟發展方面的新引擎。爲了全面展示AI大模型的發展全貌，爲各界提供新思路，本文將對AI大模型應用架構（ALLMA）白皮書進

2024-04-19 11:29:39

文心大模型ERNIE-Tiny：輕量化技術的全面解讀

隨着人工智能技術的日益成熟，大模型成爲了衆多領域的研究熱點。大模型通過龐大的數據量和複雜的網絡結構，實現了對數據的深度挖掘和高效處理。然而，大模型的龐大體積和高計算成本也限制了其在一些實際場景中的應用。爲了解決這一問題，文心大模型ERNIE

2024-04-18 11:29:53

文檔圖像大模型

隨着信息技術的快速發展，文檔處理已經成爲日常生活和工作中不可或缺的一部分。傳統的文檔處理方法往往需要人工參與，效率低下且易出錯。近年來，隨着深度學習技術的突破，文檔圖像大模型在智能文檔處理領域嶄露頭角，爲提升文檔處理性能提供了新的解決方案。

2024-04-18 11:29:52

王海峯：百度 500 萬 AI 人才培養目標已提前達成

4 月 16 日，以“創造未來”爲主題的 Create 2024 百度 AI 開發者大會在深圳國際會展中心成功舉辦。百度首席技術官王海峯以“技術築基，星河璀璨”爲題，發表演講，解讀了智能體、代碼、多模型等多項文心大模型的關鍵技術和最新進展。

2024-04-17 23:41:11

提高 RAG 應用準確度，時下流行的 Reranker 瞭解一下？

檢索增強生成（RAG）是一種新興的 AI 技術棧，通過爲大型語言模型（LLM）提供額外的“最新知識”來增強其能力。基本的 RAG 應用包括四個關鍵技術組成部分： Embedding 模型：用於將外部文檔和用戶查詢轉換成 Embeddi

2024-04-17 21:20:19

從零開始學習大模型

隨着人工智能技術的快速發展，大模型已成爲許多領域的熱門話題。然而，大模型的創建並不是一件容易的事情。在本文中，我們將從零開始學習如何創建一個大模型，幫助讀者掌握大模型的創建過程。一、數據收集創建大模型的首要任務是收集數據。數據是大模型的

2024-04-16 11:29:26

24小時熱門文章

最新文章

最新評論文章