2021 年機器學習語音合成指南

原創

2021-05-12 09:23

{"type":"doc","content":[{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null},"content":[{"type":"text","marks":[{"type":"italic"},{"type":"strong"}],"text":"本文最初發表於 Africa Post Online 網站，經網站授權，InfoQ 中文站翻譯並分享"},{"type":"text","marks":[{"type":"italic"}],"text":"。"}]},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null}},{"type":"blockquote","content":[{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null},"content":[{"type":"text","text":"Respeecher 是烏克蘭一家人工智能初創企業，該公司在語音到語音的語音合成領域有很深的造詣，爲我們介紹了 2021 年機器學習語音合成的指南：從文本到語音發展爲語音到語音，即聲音克隆的語音合成。"}]}]},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null}},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null},"content":[{"type":"text","text":"每天，我們都會產生2.5 EB字節的數據，並且這個速度還在持續增長。近兩年來，我們創造了有史以來"},{"type":"link","attrs":{"href":"https:\/\/www.forbes.com\/sites\/bernardmarr\/2018\/05\/21\/how-much-data-do-we-create-every-day-the-mind-blowing-stats-everyone-should-read\/#794b7a8660ba?fileGuid=Y4gS1w0WzFwIwK7P","title":"","type":null},"content":[{"type":"text","text":"90% 的數據"}]},{"type":"text","text":"。這個世界充滿了數據，所以人們需要創建一個系統來組織所有的信息量。"}]},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null}},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null},"content":[{"type":"text","text":"這些系統發展到越來越複雜的階段，最終已成爲不可或缺的東西。下面我們來看一下從機器學習到語音合成的演變歷程。"}]},{"type":"heading","attrs":{"align":null,"level":2},"content":[{"type":"text","text":"機器學習：新時代已經開始"}]},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null}},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null},"content":[{"type":"text","text":"你在 Youtube 上獲得的視頻建議，你在 Pinterest 上看到的匹配圖片，你在谷歌上輸入關鍵詞時得到的結果，你的社交媒體 Feed 流或你的語音助手 Siri 等等，都是機器學習的日常應用。沒有機器學習我們能活下去嗎？能，但是我們會放棄人工智能給我們帶來的很多便利。爲什麼我們要這麼做呢？"}]},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null}},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null},"content":[{"type":"text","text":"這基本上是一個簡單的過程：Facebook 或 YouTube 這樣的平臺收集關於我們和我們偏好的數據，並且利用機器學習系統，它們能夠非常準確地預測你接下來想要接收的信息，這樣它們就可以提供準確的信息。"}]},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null}},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null},"content":[{"type":"text","text":"以類似的方式，你的麥克風記錄下你的語音命令，將其發送到相應的服務，然後你收到來自 Alexa 或 Siri 等語音助手的相關響應，返回到你的設備。語音助手通過機器學習，學會了如何以令人滿意的方式作出響應，而不需要學習如何使用它們得到的數據。"}]},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null}},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null},"content":[{"type":"text","text":"長話短說，機器學習在我們的行爲和偏好中找到了模式，並將其應用於我們下一個請求或需要。"}]},{"type":"heading","attrs":{"align":null,"level":2},"content":[{"type":"text","text":"機器學習向語音合成的快速發展"}]},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null}},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null},"content":[{"type":"text","text":"顯然，機器學習並非總是如此先進。直到 20 世紀 50 年代，統計方法才得以發現和完善。50 年代以後，爲了進行第一批機器學習研究，人們開發出了一系列簡單的算法。"}]},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null}},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null},"content":[{"type":"text","text":"60 年代，隨着貝葉斯方法和概率推理技術的應用，機器學習取得了一定的發展勢頭。但機器學習的有效性在 70 年代遭到了質疑，那就是我們現在所說的時期：“人工智能的冬天”。"}]},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null}},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null},"content":[{"type":"text","text":"80 年代對反向傳播進行的新研究幸運地導致了機器學習研究方法的復甦。在 90 年代，這種方法主要是數據驅動，而非隨後幾十年來被使用的知識驅動。人們創建了能分析大量數據並從結果中學習的程序。支持向量機（SVM）和遞歸神經網絡（RNN）得到了廣泛的應用。"}]},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null}},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null},"content":[{"type":"text","text":"如今，我們對深度學習功能變得如此準確感到敬畏，我們生活中有很大一部分受到軟件和應用的影響，它們使用語音合成、支持向量聚類、核方法以及監督學習和無監督學習的機器學習方法。"}]},{"type":"heading","attrs":{"align":null,"level":2},"content":[{"type":"text","text":"爲何對機器學習如此大驚小怪？"}]},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null}},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null},"content":[{"type":"text","text":"機器學習也許是自微芯片以來最偉大的技術革新。只要我們學會運用它的力量，就會進入一個新的科技時代。"}]},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null}},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null},"content":[{"type":"text","text":"自動駕駛汽車？數字個人助理？智能家居？通過交通預測更容易通勤？電子郵件過濾？搜索引擎結果提煉？在線欺詐檢測？真讓你說着了！"}]},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null}},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null},"content":[{"type":"text","text":"機器學習最重要的一點是，它可以提高我們的業務、日程安排、健康和生活質量。假如我們能讓我們的機器進行分析、測試，並最終學習，它們就能教會我們怎樣生活得更好、更快樂。"}]},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null}},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null},"content":[{"type":"text","text":"當今機器學習技術的一個主要應用就是人工生成人類聲音，即語音合成。"}]},{"type":"heading","attrs":{"align":null,"level":2},"content":[{"type":"text","text":"通過機器學習進行語音合成"}]},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null}},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null},"content":[{"type":"text","text":"任何文本都可以通過語音合成器轉換成語音。這就是所謂的文本到語音。這種系統包括兩個部分：前端對每個單詞進行語音轉寫，並將文本分成短語、從句和句子；後端（合成器）將符號化語言表示轉換成語音。"}]},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null}},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null},"content":[{"type":"text","text":"語音合成器越好，它與人聲的相似性就越高。比這還要好的是，我們有語音到語音的合成器。當我們需要時，只要有人類聲音的樣本，該系統就能準確地再現出來。根據這種簡單的聲音樣本，系統可以產生任何話語。人耳無法分辨出原始聲音和合成聲音。"}]},{"type":"heading","attrs":{"align":null,"level":2},"content":[{"type":"text","text":"2020 年機器學習語音合成指南"}]},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null}},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null},"content":[{"type":"text","text":"很可能，你已經經歷了不止一次的語音合成：著名的虛擬個人助理 Siri、谷歌 Home 以及各種各樣的聊天機器人。它們是如何以如此人性化的方式與我們對話的呢？下面來分析這一過程："}]},{"type":"heading","attrs":{"align":null,"level":3},"content":[{"type":"text","text":"1. 連接方法"}]},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null}},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null},"content":[{"type":"text","text":"這是一種廣泛使用的語音合成技術。首先，我們需要有一個相當大的數據庫，其中包含預先錄製的語音序列；其次，我們將它們連接成一個全新的、可聽的語音。這一方法的侷限性是很難擴展（每當我們需要不同風格的語音時，都需要新的數據集）和機器人聲音（最終合成產品在自然人類聲音方面缺乏一致性）。"}]},{"type":"heading","attrs":{"align":null,"level":3},"content":[{"type":"text","text":"2. 參數化方法"}]},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null}},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null},"content":[{"type":"text","text":"參數化模型的使用是由於上述方法難以進行擴展處理所致。利用該模型，我們可以通過輸入定義來控制語音生成。"}]},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null}},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null},"content":[{"type":"text","text":"參數化模型主要研究聲學特性的生成，通過聲碼器把輸入轉換成聲音。在我們需要時，錄製的人類聲音會經過一組參數的修改進行更改。"}]},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null}},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null},"content":[{"type":"text","text":"但是，這兩種方法正逐步被現代語音合成方法所取代，即所謂的深度學習。"}]},{"type":"heading","attrs":{"align":null,"level":3},"content":[{"type":"text","text":"3. 深度學習方法"}]},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null}},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null},"content":[{"type":"text","text":"採用機器學習的語音合成達到了實時聲音克隆的程度。只要一小段某人的聲音樣本，就能生成任何新的動態和獨特的聲音內容。該系統能立即學習聲音、語調、單詞和句子之間的停頓、重點、音量和速率，並以與原始採樣聲音完全相同的聲學特徵輸出文本到語音的話語。"}]},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null}},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null},"content":[{"type":"text","text":"合乎倫理嗎？如果聲音樣本的主人表示同意，那當然合乎倫理！"}]},{"type":"heading","attrs":{"align":null,"level":2},"content":[{"type":"text","text":"Respeecher如何利用機器學習克隆聲音？"}]},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null}},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null},"content":[{"type":"text","text":"首先，我們以道德方式使用它。未經聲音樣本所有者書面同意，我們不能處理任何聲音樣本，也不能將人工智能技術用於任何欺騙性的用途。"}]},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null}},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null},"content":[{"type":"text","text":"此外，這是一個非常簡單的過程：我們收集目標和源聲音，施展我們的人工智能魔法，然後，瞧！你就有了你需要的聲音，可供你支配。"}]},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null}},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null},"content":[{"type":"text","text":"你也不用擔心演員不在了，因爲只要有他的聲音樣本，你就可以根據演員的聲音生成你想要的任何話語。而且，我們的"},{"type":"link","attrs":{"href":"https:\/\/www.respeecher.com\/?fileGuid=Y4gS1w0WzFwIwK7P","title":"","type":null},"content":[{"type":"text","text":"聲音克隆"}]},{"type":"text","text":"服務讓演員們的工作變得更簡單，因爲他們不再需要在錄音棚花費大量的時間。這樣，我們就可以幫助公司在製作視頻和音頻內容（電影、動畫、視頻遊戲、廣告）時，提高時間和經濟效益。"}]},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null}},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null},"content":[{"type":"text","text":"乏味又費錢的配音過程，現在已經和說“聲音克隆”一樣簡單了。比方說，我們可以使用任何一種聲音樣本來生成話語，這樣我們就能從一位已故演員身上找回聲音。"}]},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null}},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null},"content":[{"type":"text","text":"Respeecher是最簡單、最專業的方式，可以爲任何類型的項目創造無盡的音頻：電影和電視、遊戲、廣告、動畫、播客和有聲書、醫療保健、呼叫中心。將貴公司的“語音物流”交給我們，我們將幫助你爲你的項目複製完美的語音。我們的目標是，在未來將我們的聲音克隆服務擴展到更廣的領域。"}]},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null}},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null},"content":[{"type":"text","text":"這不是文字轉語音，而是語音轉語音技術，這就是爲什麼我們克隆出來的聲音中永遠不會有那種機器人的、沒有感情的聲音。我們提供出色的效果：人耳無法區分真實的聲音和克隆的聲音。"}]},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null}},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null},"content":[{"type":"text","marks":[{"type":"strong"}],"text":"作者介紹："}]},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null}},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null},"content":[{"type":"text","text":" Respeecher是烏克蘭一家人工智能初創企業，旗下基於人工智能技術研發的變聲軟件可以幫助客戶實現變聲或語音合成功能，可以將用戶的語音轉換爲諸如明星的聲音，在確保語音情感的同時儘可能保留原有的語音細節。他們同好萊塢某製片廠展開合作，將該技術運用到了某部電影中，未來計劃在娛樂業之外向呼叫行業進軍。"}]},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null}},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null},"content":[{"type":"text","marks":[{"type":"strong"}],"text":"原文鏈接："}]},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null}},{"type":"paragraph","attrs":{"indent":0,"number":0,"align":null,"origin":null},"content":[{"type":"text","text":"https:\/\/africanpostonline.com\/2021-guide-to-speech-synthesis-through-machine-learning\/"}]}]}

發表評論

所有評論

還沒有人評論，想成為第一個評論的人麼? 請在上方評論欄輸入並且點擊發布.

相關文章

AI從入門到入門之手寫數字識別模型java方式Dense全連接神經網絡實現

前言：授人以魚不如授人以漁.先學會用，在學原理，在學創造，可能一輩子用不到這種能力，但是不能不具備這種能力。這篇文章主要是介紹算法入門Helloword之手寫圖片識別模型java中如何實現以及部分解釋。目前大家對於人工智能-機器學習-神經網

2024-04-19 23:17:21

Pinecone: 大模型時代的智能索引與搜索解決方案

隨着人工智能技術的飛速發展，大模型（Large Models）已成爲衆多領域的重要工具。無論是自然語言處理、圖像識別還是其他複雜任務，大模型都展現出了強大的性能。然而，隨着模型規模的不斷擴大，數據量的激增，如何有效地管理、索引和搜索這些模型

2024-04-19 11:29:43

軟件測試從自動化到智能化，大模型開始加入

隨着科技的飛速發展，軟件行業也在不斷地演進和創新。作爲軟件行業的關鍵環節之一，軟件測試行業也在經歷着前所未有的變革。從最初的手動測試，到自動化測試，再到如今的智能化測試，軟件測試行業正在經歷一場深刻的技術革命。在這場革命中，Testin雲測

2024-04-19 00:53:25

裁員了！別錯過2024年大數據工程師必備的10項技能

在當今快速發展的世界中，數據被視爲新的石油。隨着對數據驅動洞察的日益依賴，大數據工程師的角色比以往任何時候都更爲關鍵。這些專業人員在管理和優化組織內的數據操作中扮演着至關重要的角色。在本文中，我們將探索2024年大數據工程師必須具備的十

2024-04-16 11:00:53

DevOps已死？2024年的DevOps將如何發展

隨着我們進入2024年，DevOps也隨之發生變化。新興的技術、變化的需求和發展的方法正在重新定義有效實施DevOps實踐。 IDC預測顯示，未來五年，支持DevOps實踐的產品市場繼續保持健康且快速增長，2022年-2027年的複合年增長

2024-04-08 12:51:44

從模型到部署，教你如何用Python構建機器學習API服務

本文分享自華爲雲社區《Python構建機器學習API服務從模型到部署的完整指南》，作者：檸檬味擁抱。在當今數據驅動的世界中，機器學習模型在解決各種問題中扮演着重要角色。然而，將這些模型應用到實際問題中並與其他系統集成，往往需要構建API

2024-04-08 10:33:17

測試左移已經開始影響DevOps的發展？

在軟件開發的早期，該過程通常是開發人員編寫代碼，再將其交給質量保證（QA）進行測試。這種瀑布開發方法可能會導致質量問題和延遲，因爲問題是在週期後期發現的。一、瞭解DevOps和測試左移 DevOps是Development和Operati

2024-04-07 12:48:37

黑盒Prompt優化：提升大模型反饋效果的新思路

隨着人工智能技術的快速發展，大模型在各種應用場景中發揮着越來越重要的作用。然而，如何提升大模型的反饋效果，使其更加準確、高效地爲用戶提供服務，一直是研究者和開發者關注的焦點。本文提出了一種新的思路——黑盒Prompt優化，旨在通過改進輸入提

2024-03-29 00:01:17

分佈式數據庫技術的演進和發展方向

這些年大家都在談分佈式數據庫，各大企業也紛紛開始做數據庫的分佈式改造。那麼，所謂的分佈式數據庫到底是什麼？採用什麼架構？優勢在哪？爲什麼越來越多企業選擇它？分佈式數據庫技術會向什麼方向發展？帶着這些疑問，一探究竟吧！參與文末的話題互動

2024-03-26 11:34:43

利用RAG技術打破大模型幻覺

隨着人工智能技術的不斷進步，大模型在各個領域中發揮着越來越重要的作用。然而，大模型幻覺問題一直是制約其進一步發展的瓶頸。爲了解決這一問題，研究者們不斷探索新的技術和方法。近年來，一種名爲RAG（檢索增強生成）的技術備受關注，它通過結合知識圖

2024-03-21 00:28:34

與 NVIDIA 再次合作、深度參與 GTC，Zilliz 與全球頂尖開發者共迎 AI 變革時刻！

Zilliz 與全球的頂尖開發者齊聚 GTC 2024。近日，備受關注的 NVIDIA GTC 2024 已拉開序幕，來自世界各地的頂尖 AI 開發者齊聚美國加州聖何塞會議中心，共同探索行業未來。作爲去年被 NVIDIA CEO 黃仁

2024-03-19 21:26:53

多模態+大模型會帶來哪些“化學反應”？

導語：沒人懷疑，2024 年，AI 依然將是科技界的主角。上個月，OpenAI 推出了可以生成 60 秒高清視頻的視頻生成模型 Sora，掀起了對多模態模型的進一輪討論。多模態大模型技術的最新進展如何？這一波新技術，對於行業和消費者的體驗會

2024-03-15 13:45:01

婦女節：打開 AI 視界，成就“她力量”

根據國內招聘平臺獵聘發佈的《2024 女性人才數據洞察報告》，從 2023 年 3 月到 2024 年 2 月，女性在 AIGC 領域的求職人次同比增長了 190.49%。隨着人工智能時代的降臨，女性正以前所未有的姿態，在技術的助力下，蛻變

2024-03-09 01:06:57

AI安全白皮書 | “深度僞造”產業鏈調查以及四類防禦措施

以下內容，摘編自頂象防禦雲業務安全情報中心正在製作的《“深度僞造”視頻識別與防禦白皮書》，對“深度僞造”感興趣的網友，可前往頂象留言，在該白皮書完成後，會爲您免費寄送一份電子版。 “深度僞造”就是創建高度逼真的虛假視頻或虛假錄音，然

2024-03-08 00:45:22

深入學習NumPy庫在數據分析中的應用場景

在數據科學與機器學習領域，NumPy（Numerical Python）是一個經常被提及的重要工具。它是Python語言中一個非常強大的庫，提供了高性能的多維數組對象以及用於處理這些數組的工具。NumPy不僅僅是一個用於數值計算的庫，它還

2024-03-02 00:30:28

24小時熱門文章

最新文章

2021 年機器學習語音合成指南

最新評論文章