語音識別端到端解碼資料彙總

原創

2019-03-04 03:17

端到端模型相比於傳統的hmm-gmm模型，有如下幾個優點：

不需要發音詞典。因爲模型直接輸出character或word；在中英混輸場景下，中文的發音體系和英文的發音體系不一樣(中文有第一聲，第二聲等)，如果使用傳統的hmm-gmm，需要做音素的映射。
不同語言可以使用同一套端到端框架。而在傳統的hmm-gmm中，比如英文，中文甚至混輸，他們使用hmm state數是不一樣的，所以不能使用同一套hmm-gmm結構；
不需要強制對齊。

等等。。。。。

因此端到端模型越來越受到各大公司的青眯，比如百度的Deep Speech，facebook的wav2letter++等。在端到端模型中，我們不需要像傳統的HMM-GMM模型那樣構建HCLG圖，而是直接在輸出label上做prefix beam search。

推薦幾篇比較好的prefix beam search學習資料：

這篇文章形象的解釋了什麼是beam search:
https://www.zhihu.com/question/54356960/answer/293804923

這篇博客詳細介紹了prefix beam search，以及如何引入語言模型作爲輔助:
https://towardsdatascience.com/intuitively-understanding-connectionist-temporal-classification-3797e43a86c

這篇博客主要介紹了greedy search、Beam Search和prefix beam search的區別，並給出代碼實現:
https://github.com/DingKe/ml-tutorial/blob/master/ctc/CTC.ipynb

發表評論

所有評論

還沒有人評論，想成為第一個評論的人麼? 請在上方評論欄輸入並且點擊發布.

相關文章

Python: Base64文件編碼、解碼

base64.py 模型提供了將二進制數據編碼爲可印刷的 ASCII 字符和將這些編碼後的數據返回到二進制數據的方法。一、方法 b64encode(s, altchars=None) 1. 使用 Base64 編碼類字節對象（bytes

2020-07-08 02:30:58

十、FFmpeg視頻播放之快進快退

1、處理快進快退（seek）命令本章我將給大家講解怎麼給我們的播放器添加快進、快退、定位功能，這也是幾乎所有播放器都有的功能。爲實現此功能，我們要用到av_seek_frame函數，這個函數非常簡單易用。我們用鍵盤上的左右鍵分別表

2020-07-07 06:46:16

八、FFmpeg把音頻流同步到視頻流

1、同步音頻現在我們已經有了一個比較像樣的播放器了，最後讓我們再來看一下剩下的一些簡單的細節。在上章中我們說過也可以把音頻同步到視頻的，本章我們就來實現這個功能。這和把視頻同步到音頻是類似的：用一個內部視頻時鐘記錄視頻線程播放了多久，然

2020-07-07 06:46:16

六、FFmpeg-優化音頻解碼播放流程

一、音頻解碼播放概述前面我們用SDL處理了音頻流，SDL會啓動一個線程監聽音頻回調函數。本章中，我們仿照音頻的處理方式來處理視頻的顯示。這樣會使得代碼更加模塊化，易於開發維護。到我們對音視頻進行同步時，這種模塊化會使得同步的實現會非常方

2020-07-07 06:46:16

有哪個軟件可以進行文件識別？學生上班族都在用它

現如今，對於各種不同功能的手機APP，我們的需求也變得越來越大。我們會在手機下載具備美圖功能、聯繫功能或娛樂功能等的軟件，此外，有利於學習、工作的軟件我們也一樣不落下。例如，學生、上班族都在使用的“錄音轉文字助手”APP，這個軟件能夠幫助

2020-07-08 03:40:47

python實現百度語音之語音識別

這篇文字是基於前輩分享的基礎上寫出來的。前輩在這裏： http://blog.sina.com.cn/s/blog_7cedb56d0102vb5p.html http://blog.csdn.net/wolfblood_

2020-07-06 19:28:32

kaldi源碼分析(四)-單音素訓練

文章目錄steps/train_mono.sh steps/train_mono.sh 單音素訓練是使用kaldi進行所有傳統聲學模型訓練的起始部分，尤爲重要。在進行聲學模型訓練時，首先使用單高斯模型進行模型訓練。聲學模型的對齊

2020-07-06 10:47:07

kaldi源碼分析(一)--kaldi腳本

文章目錄數據準備發音詞典 L.fst提取特徵聲學模型訓練語言模型訓練解碼數據準備發音詞典 L.fst 將之前的詞典轉換爲L.fst 以及 topo文件 utils/prepare_lang.sh --position-dep

2020-07-06 10:47:07

kaldi源碼分析(三)-特徵處理

文章目錄特徵相關腳本分析steps/compute_cmvn_stats.sh提取特徵腳本（steps/make_mfcc.sh steps/make_mfcc_pitch.sh steps/make_

2020-07-06 10:47:00

基於srilm的語言模型訓練簡介（一）

文章目錄一、語言模型訓練二、語言模型打分三、語言模型剪枝四、語言模型合併五、語言模型使用詞典限制一、語言模型訓練 ##功能 #讀取分詞後的text文件或者count文件，然後用來輸出最後彙總的count文件或者語言模型 ##參數

2020-07-06 10:47:00

kaldi源碼分析(二)-數據準備

文章目錄kaldi數據準備發音詞典數據準備聲學模型數據準備語言模型數據準備 kaldi數據準備在本次記錄中主要記錄的是發音詞典以及聲學模型的數據準備，語言模型僅僅簡單介紹。發音詞典數據準備發音詞典數據準備的階段主要目的是生成

2020-07-06 10:47:00

Python調用百度語音REST API

（百度的rest接口的部分網址發生了一定的變化，相關代碼已更新）百度通過 REST API 的方式給開發者提供一個通用的 HTTP 接口，基於該接口，開發者可以輕鬆的獲得語音合成與語音識別能力。SDK中只提供了PHP、C和JA

狼血wolfblood

2020-07-06 04:43:41

大量的新聞語料庫

http://media.cnr.cn/option,com_content,task,category,sectionid,11,id,555,Itemid,349.html 我找了好久新聞類的語料總算在這裏找到了不過還要轉化一下頻

2020-07-04 22:47:19

LSTM實現語音識別

序言：語音識別作爲人工智能領域重要研究方向，近幾年發展迅猛，其中RNN的貢獻尤爲突出。RNN設計的目的就是讓神經網絡可以處理序列化的數據。本文筆者將陪同小夥伴們一塊兒踏上語音識別之夢幻旅途，相信此處風景獨好。內容目錄環境準備

2020-07-03 22:01:29

京東智聯雲智能RPA商城應用案例：獨立解決90%以上的顧客諮詢問題，節省了上億成本|百萬人學AI評選

2020 無疑是特殊的一年，而 AI 在開年的這場”戰疫“中表現出了驚人的力量。站在“新十年”的起點上，CSDN【百萬人學AI】評選活動正式啓動。本屆評選活動在前兩屆的基礎上再度升級，設立了「AI優秀案例獎Top 30」、「AI新銳公

2020-07-03 21:41:29

24小時熱門文章

最新文章

最新評論文章