DB算法分析《Real-time Scene Text Detection with Differentiable Binarization》

原創

智能血压计

2020-02-22 07:11

算法架構圖：

算法分析

總覽，主要包含三個部分：
- backbone提取特徵（特徵金字塔）
- 特徵金字塔被上採樣到相同尺度構建一個特徵圖F
- 使用F來預測概率圖P和閾值圖T，並通過P和T來生成二值圖B
一些細節：
- 預設的圖片大小【640，640】
- 在訓練階段：P、T、B都會進行loss計算，並bp，其中P、B會使用相同的標籤
- 在推理階段，P、B都可以被用於計算bbox
- DB模塊的優勢：
  - 幫助區分非常近的模塊
  - 自己的理解其實就是對邊界做了加強學習，讓邊界更準了，同時免去了複雜的後處理，連通區域的計算其實就在裏面了
- 閾值圖T的學習可以監督或者非監督，監督效果更好
- 閾值圖T的用法是，用於對P的二值化
- 關於DB模塊
  - 損失函數，及其導數：

deformable conv：可形變的卷積，提供可形變感受野，對大寬高比有效果
標註生成：基於PSEnet標註的生成規則。收縮和擴展的長度計算公式（6），其中收縮和擴展之間的像素爲T的正樣本，其餘爲負樣本

損失函數：
- loss計算方式這裏，其實就是交叉熵，因爲x受T影響，bp到P時，可以理解爲P會影響最終的結果，同時P也可以被學習
- 其中阿爾法爲1.0，貝塔爲10，Ls、Lb爲負採樣交叉熵損失，採樣比1:3；Lt爲平滑後的L1損失，只計算Gd內部的像素（可能是爲了避免樣本不平衡的問題，類似於負採樣）

在推理階段，使用P或者B生成bbox差不多
box生成規則：
- 首先使用閾值進行二值化（預設0.2）
- 通過二值化後的map尋找連接區域（對應標註的Gs，收縮圖）

通過公式（10）反推文本區域：
訓練細節：
- 所有的模型先使用Synthtext與訓練10w個iter
- 然後finetuning 各自數據集1200epoch，類別totaltext1500個訓練集的話，標註數據2k個應該足夠了
- lr設置方面：
  - 初始化0.007
  - 每個iter改變一次：lr= (1 − iter/maxiter )^power，power=0.9，maxter=epoch*（iterperepoch）,decay=0.0001，moment=0.9
- 數據增強方面：
  - -10-10隨機旋轉
  - 隨機裁剪
  - 隨機偏移
  - all resize 640*640
- 預測階段，等比例
缺陷：
- 重疊文本無法處理

模型效果（附帶數據說明）

1）彎曲文本：

2、多方向文本

3、多語言

4、中英文

智能血壓計

發佈了23 篇原創文章 · 獲贊 18 · 訪問量 2萬+

發表評論

所有評論

還沒有人評論，想成為第一個評論的人麼? 請在上方評論欄輸入並且點擊發布.

相關文章

GLM國產大模型訓練加速：高效性能與成本優化的實踐

隨着人工智能技術的不斷進步，大模型的訓練成爲了推動深度學習領域發展的重要力量。然而，傳統的訓練方式往往面臨着性能瓶頸和高昂的成本問題，這使得許多研究者和開發者望而卻步。爲了解決這一難題，我們探索了使用OneFlow框架對GLM國產大模型進行

2024-05-07 23:30:09

Stable Diffusion中的embedding

Stable Diffusion中的embedding 嵌入，也稱爲文本反轉，是在 Stable Diffusion 中控制圖像樣式的另一種方法。在這篇文章中，我們將學習什麼是嵌入，在哪裏可以找到它們，以及如何使用它們。什麼是嵌入embe

2024-04-25 21:31:13

O2OA(翱途)開發平臺爲待辦創建配置郵件通知

O2OA(翱途)開發平臺[下稱O2OA開發平臺或者O2OA]的消息機制允許開發者通過配置實現郵件通知。本篇主要闡述如何實現待辦消息的郵件通知。一、先決條件： 1、O2Server服務器正常運行，系統安裝部署請參考

2024-05-09 23:10:17

理論+實踐，帶你瞭解分佈式訓練

本文分享自華爲雲社區《大模型LLM之分佈式訓練》，作者：碼上開花_Lancer。隨着語言模型參數量和所需訓練數據量的急速增長，單個機器上有限的資源已無法滿足大語言模型訓練的要求。需要設計分佈式訓練（Distributed Trainin

2024-05-08 22:38:41

打開神經網絡的黑箱子

卷積神經網絡每個卷積核提取不同的特徵。每個卷積覈對輸入進行卷積，生成一個feature map，這個feature map即體現了該卷積核從輸入中提取的特徵，不同的feature map顯示了圖像中不同的特徵。淺層卷積核提取：邊緣、顏

2024-05-06 00:41:39

京東廣告研發 —— 京東推薦廣告排序機制演化

1、序言：廣告排序機制的前世今生 1.1、簡介：廣告排序機制在線廣告是國內外各大互聯網公司的重要收入來源之一，而在線廣告與傳統廣告最大的區別就在於其超大規模的實時競價環境：數以萬計的廣告主在一天內可以參與億級別的流量競拍。在這複雜的實

2024-04-24 23:17:14

03-爲啥大模型LLM還沒能完全替代你？

1 不具備記憶能力的它是零狀態的，我們平常在使用一些大模型產品，尤其在使用他們的API的時候，我們會發現那你和它對話，尤其是多輪對話的時候，經過一些輪次後，這些記憶就消失了，因爲它也記不住那麼多。 2 上下文窗口的限制大模型對其inpu

2024-04-23 01:07:00

輕鬆復現一張AI圖片

輕鬆復現一張AI圖片現在有一個非常漂亮的AI圖片，你是不是想知道他是怎麼生成的？今天我會交給大家三種方法，學會了，什麼圖都可以手到擒來了。需要的軟件在本教程中，我們將使用AUTOMATIC1111 stable diffusio

2024-04-22 21:30:45

攻擊者正在利用AI，對保險公司發起大規模欺詐

保險欺詐一直是保險行業面臨的重要挑戰之一，尤其隨着技術的進步，欺詐者也在不斷更新其手段，利用AI技術，包括生成式模型、機器學習和數據分析工具等欺騙保險公司，而AI技術的應用正成爲他們的新工具，使其犯罪行爲更加隱蔽和複雜，挑戰保險行業的防欺詐

2024-05-10 00:55:17

AIGC在京東廣告創意的技術應用

一、前言電商廣告圖片不僅能夠抓住消費者的眼球，還可以傳遞品牌核心價值和故事，建立起與消費者之間的情感聯繫。然而現有的廣告圖片大多依賴人工製作，存在效率和成本的限制。儘管最近AIGC技術取得了卓越的進展，但其在廣告圖片的應

京東雲開發者

2024-05-08 23:24:18

AI繪圖新選擇：Fooocus工具發佈，小顯存助力大模型運行

隨着人工智能技術的飛速發展，AI繪圖工具已經成爲了衆多創作者們的得力助手。它們能夠基於深度學習算法，快速生成高質量的圖像，爲設計、藝術等領域注入了新的活力。然而，傳統的AI繪圖工具往往對硬件要求較高，使得許多擁有較低配置設備的用戶望而卻步。

2024-05-07 23:30:10

LoRA微調語言大模型的實用技巧

一、引言隨着深度學習技術的快速發展，語言大模型在自然語言處理領域取得了顯著的進展。然而，傳統的微調方法通常需要大量的計算資源和時間，對於實際應用來說並不友好。爲了解決這個問題，LoRA微調技術應運而生。LoRA（Low-Rank Adap

2024-04-28 11:30:13

京東廣告研發——效率爲王：廣告統一檢索平臺實踐

1、系統概述實踐證明，將互聯網流量變現的在線廣告是互聯網最成功的商業模式，而電商場景是在線廣告的核心場景。京東服務中國數億的用戶和大量的商家，商品池海量。平臺在兼顧用戶體驗、平臺、廣告主收益的前提推送商品具有挑戰性。京東廣告檢索平臺

2024-04-25 23:17:47

大模型區域落地再加速！百度“文心中國行”西部首站落地成都錦江

4 月 24 日，“文心中國行”西部地區首站落地成都錦江。成都市錦江區白鷺灣新經濟總部功能區、錦江區投資促進局與百度飛槳攜手合作，打造成都人工智能的新產業、新模式、新業態。來自成都政產學研各界的領導、專家、企業嘉賓，共同探討如何降低 AI

2024-04-25 11:41:53

文心中國行走進成都！4 月 24 日一起把握大模型時代的產業新機遇

4 月 24 日，文心中國行將走進成都。屆時，政府、企業與高校的相關專家和業界同仁將現場分享生成式人工智能與大模型最新進展，從人工智能政策解讀、大模型技術，到產業創新應用的實踐案例，讓參會者全方位瞭解大模型時期的發展與創新機遇。大會還特別

2024-04-23 11:41:07

24小時熱門文章

Spring Cloud 部署時如何使用 Kubernetes 作爲註冊中心和配置中心

最新文章

最新評論文章