花樣試用微軟語音服務曉曉

来源:https://www.cnblogs.com/viter/archive/2019/04/11/10685402.html
-Advertisement-
Play Games

受微軟美女員工 Grace Peng 邀請(也可能是套路???),參加微軟神經語音(沒錯,就是神經)曉曉的試用,首先是看到了群裡面的消息,然後就是發送申請,等待回覆,過了幾天後,收到了一個機器人發來的賬號密碼,告訴我已經幫我申請了免費試用的賬號,直接登錄即可使用了。其實一直都有接觸各種 TTS 的服... ...


前言

受微軟美女員工 Grace Peng 邀請(也可能是套路???),參加微軟神經語音(沒錯,就是神經)曉曉的試用,首先是看到了群裡面的消息,然後就是發送申請,等待回覆,過了幾天後,收到了一個機器人發來的賬號密碼,告訴我已經幫我申請了免費試用的賬號,直接登錄即可使用了。其實一直都有接觸各種 TTS 的服務,但是在測試微軟曉曉的過程中發現,在擬人方面,曉曉的發音似乎被訓練得很不錯,在語法方面,曉曉支持 SSML 語法,具體參見:https://www.w3.org/TR/speech-synthesis/ 什麼是 SSML,來自百度百科 語音合成標記語言 的解釋。

1. 準備工作

話不多說,馬上開始,首先登錄 Azure portal,

1.1 選擇 “認知服務”,添加一個新的 Speech 訂閱 命名為:MySpeechService

1.2 等待部署完成

1.3 Speech 部署完成後

點擊左側列表中的 “所有資源”連接,進入資源管理面板

1.4 選擇資源,查看密鑰

在資源面板點擊剛纔創建好的 MySpeechService,進入詳情後點擊 “鍵”(keys),可以看到已經生成好的密鑰,等一下調用 Speech 服務的時候需要用到,好了,準備工作已經完成了,下麵就寫兩行代碼試試。

2. 開始試用

創建一個控制台項目:MySpeechApp,進行一些簡單的編碼工作,在正式編碼之前,需要來瞭解一下調用流程

從上面的流程圖可以瞭解到,首先,我們需要使用創建好的 Speech 服務中的密鑰去換取訪問 Token ,然後,使用 Token 調用 Speech 主機,傳遞文本,下載語音文件,整個流程結束。

  • 註意:通過上面的流程,只能合成 10 分鐘以內的語音文件。

好了,流程已經看懂了,下麵正式開始編碼。

2.1 定義公共的變數備用
    class Program
    {
        private const string TOKEN_URI = "https://southeastasia.api.cognitive.microsoft.com/sts/v1.0/issuetoken";
        private const string SUB_KEY = "36290bbded8f4cb59e34e50ed7be60b0";
        private const string HOST = "https://southeastasia.tts.speech.microsoft.com/cognitiveservices/v1";
        private const string RESOURCE_NAME = "MySpeechService";
    }

TOKEN_URI:換取 Token 調用的 URL
SUB_KEY:資源密鑰,就是 1.4 中的 鍵(keys)
HOST:Speech 主機,因為給我分配的是東南亞的,所以這裡地區也必須選擇 southeastasia,資源面板上也沒有說明,一開始使用的是 westus ,總是提示身份驗證異常,坑了好幾分鐘。
RESOURCE_NAME:資源名稱,就是我們創建的服務名,這沒什麼好說的

2.2 換取訪問Token
        private static async Task<string> GetTokenAsync()
        {
            using (var httpClient = new HttpClient())
            {
                httpClient.DefaultRequestHeaders.Add("Ocp-Apim-Subscription-Key", SUB_KEY);
                var builder = new UriBuilder(TOKEN_URI);

                var result = await httpClient.PostAsync(builder.Uri.AbsoluteUri, null);

                return await result.Content.ReadAsStringAsync();
            }
        }

代碼比較簡單,就是一個 Http 請求的封裝而已,核心內容是 httpClient.DefaultRequestHeaders.Add("Ocp-Apim-Subscription-Key", SUB_KEY);,把資源密鑰加入請求頭中。

2.2 合成語音
        private static async Task RequestSSML(string authToken, string text, string fileName)
        {
            Console.WriteLine("準備中...");
            using (var httpClient = new HttpClient())
            {
                var body = "<speak xmlns=\"http://www.w3.org/2001/10/synthesis\" xmlns:mstts=\"http://www.w3.org/2001/mstts\" version=\"1.0\" xml:lang=\"zh-CN\"><voice name=\"Microsoft Server Speech Text to Speech Voice (zh-CN, XiaoxiaoNeural)\">" + text + "</voice></speak>";
                var request = new HttpRequestMessage()
                {
                    Method = HttpMethod.Post,
                    RequestUri = new Uri(HOST),
                    Content = new StringContent(body, Encoding.UTF8, "application/ssml+xml")
                };
                request.Headers.Add("Authorization", "Bearer " + authToken);
                request.Headers.Add("Connection", "Keep-Alive");
                request.Headers.Add("User-Agent", RESOURCE_NAME);
                request.Headers.Add("X-Microsoft-OutputFormat", "riff-24khz-16bit-mono-pcm");

                Console.WriteLine("正在進行遠程過程調用...");

                var response = await httpClient.SendAsync(request);
                if (response.StatusCode != System.Net.HttpStatusCode.OK)
                {
                    Console.WriteLine("The Response {0}", response.StatusCode);
                    return;
                }
                using (var stream = await response.Content.ReadAsStreamAsync())
                {
                    stream.Position = 0;
                    Console.WriteLine("正在下載語音文件 {0} ...", fileName);
                    using (var fs = new FileStream(fileName, FileMode.Create, FileAccess.Write, FileShare.ReadWrite))
                    {
                        await stream.CopyToAsync(fs);
                        fs.Close();
                    }
                }
                Console.WriteLine("文本轉換語音成功");
                Console.WriteLine("===============\n");
            }
        }

這段代碼也非常的簡單,首先是構造一個 SSML 文件格式的 Body,併在請求頭中加入 AuthToken 還有其它的一些頭部標識,然後就開始正式的請求語音文件,最後將合成好的語音文件保存到本地。

2.3 開始調用過程
        static void Main(string[] args)
        {
            var result = GetTokenAsync().ConfigureAwait(false).GetAwaiter();
            string token = result.GetResult();

            var text1 = "你好,我是來自博客園的技術愛好者 Ron Liang;很高興可以試用 Speech,希望一切順利。";
            var task1 = RequestSSML(token, text1, "1.wav");
            task1.ConfigureAwait(false).GetAwaiter().GetResult();

            var text2 = "小哥哥,來一發<prosody rate=\"-40.00%\" volume=\"-80.00%\" duration=\"1.5s\">嗎?</prosody>";
            var task2 = RequestSSML(token, text2, "2.wav");
            task2.ConfigureAwait(false).GetAwaiter().GetResult();

            var text3 = "蒿嗨偶,肝絕忍僧衣襟搗打的高草,肝絕忍僧衣襟搗打了巔峰。蒿贈寒,蒿朵母,蒿懸猜。";
            var task3 = RequestSSML(token, text3, "3.wav");
            task3.ConfigureAwait(false).GetAwaiter().GetResult();

            Console.WriteLine("按任意鍵退出");
            Console.ReadKey();
        }

上面有3段文本,對應合成3段語音,1和3是純粹搗亂的,第二段文本中加入了SSML標記prosody,其屬性表示:rate=-40%(降低語速),volume=80%(降低音量),duration=1.5s(延時1.5s)

2.3 按 F5 運行程式

非常完美的運行成功,我們得到了3個語音文件,分別是:

  • 正常版:
  • 你好,我是來自博客園的技術愛好者 Ron Liang;很高興可以試用 Speech,希望一切順利。




  • 撩人版:
  • 小哥哥,來一發嗎?




  • 方言版:
  • 蒿嗨偶,肝絕忍僧衣襟搗打的高草,肝絕忍僧衣襟搗打了巔峰。蒿贈寒,蒿朵母,蒿懸猜。




結束語

整體來說,在普通的語境環境下,曉曉的表現還是不錯的,整體令人滿意,但是在自定義 SSML 的時候,就非常的麻煩,我調整了不下30分鐘,都沒有達到一個令人滿意的結果;當然,曉曉還有別的優點,比如可以自定義語音字體,你可以請聲優來訓練專業你自己的語音字體,只為你一個人服務。

代碼托管在GitHub上了
https://github.com/lianggx/Examples/tree/master/MySpeechApp


您的分享是我們最大的動力!

-Advertisement-
Play Games
更多相關文章
  • 接上一篇:《Java8新特性之stream》,下麵繼續接著講Stream 5、流的中間操作 常見的流的中間操作,歸為以下三大類:篩選和切片流操作、元素映射操作、元素排序操作: 5.1、篩選和切片 例如以訂單數據為例,在做報表展示時,會根據訂單狀態、用戶信息、支付結果等狀態來分別展示(即過濾和統計展示 ...
  • 用 Python 獲取 B 站播放歷史記錄 最近 B 站出了一個年度報告,統計用戶一年當中在 B 站上觀看視頻的總時長和總個數。過去一年我居然在 B 站上看了2600+個視頻,總計251個小時,居然花了這麼多時間,嚇得我差點把 Bilibili App 卸載了... 然而我又很好奇,到底我在 B 站 ...
  • static可以修飾變數,修飾的變數直接屬於某各類,不局限於某個方法,無法在成員方法中修飾變數,也不可以在靜態方法中修飾變數。被static修飾的方法屬於靜態方法(類方法),與對象無關,與類有關。final可以修飾類、變數、方法,abstract可以修飾類,方法;final與abstract不能同時 ...
  • 1122. 音樂節拍 (Standard IO) 時間限制: 1000 ms 空間限制: 262144 KB 具體限制 1122. 音樂節拍 (Standard IO) 時間限制: 1000 ms 空間限制: 262144 KB 具體限制 1122. 音樂節拍 (Standard IO) 時間限制: ...
  • ChromeDriver版本支持的Chrome版本 v2.46 v72-74 v2.45 v71-73 v2.44 v70-72 v2.43 v69-71 v2.42 v68-70 v2.41 v67-69 v2.40 v66-68 v2.39 v66-68 v2.38 v65-67 v2.37 v ...
  • 今天老師講了一天狗跳樓的問題,昨天解開始說了,今天都沒講新課, 所以,今天自學了Scanner類及String的類型轉換 先來Scanner類實現鍵盤輸入功能: 代碼: package pkg1; import java.util.Scanner; public class Test{ public ...
  • 神奇的老師在網上看到狗跳樓的視頻然後就想到拋物線問題; 還是 屬性和方法的調用: package sklx; public class Dog{ private float v = 30.0f; private float g = 9.8f; //水平方向本質就是勻速直線運動 public floa ...
  • 一.概述 在物理層之間相互通信必須保護資源,需要實現身份驗證和授權,通常針對同一個用戶存儲。對於資源安全設計包括二個部分,一個是認證,一個是API訪問。 1 認證 認證是指:應用程式需要知道當前用戶的身份時,需要進行身份驗證,確定用戶是否有效。最常見的身份驗證協議是SAML2p,WS-Federat ...
一周排行
    -Advertisement-
    Play Games
  • 移動開發(一):使用.NET MAUI開發第一個安卓APP 對於工作多年的C#程式員來說,近來想嘗試開發一款安卓APP,考慮了很久最終選擇使用.NET MAUI這個微軟官方的框架來嘗試體驗開發安卓APP,畢竟是使用Visual Studio開發工具,使用起來也比較的順手,結合微軟官方的教程進行了安卓 ...
  • 前言 QuestPDF 是一個開源 .NET 庫,用於生成 PDF 文檔。使用了C# Fluent API方式可簡化開發、減少錯誤並提高工作效率。利用它可以輕鬆生成 PDF 報告、發票、導出文件等。 項目介紹 QuestPDF 是一個革命性的開源 .NET 庫,它徹底改變了我們生成 PDF 文檔的方 ...
  • 項目地址 項目後端地址: https://github.com/ZyPLJ/ZYTteeHole 項目前端頁面地址: ZyPLJ/TreeHoleVue (github.com) https://github.com/ZyPLJ/TreeHoleVue 目前項目測試訪問地址: http://tree ...
  • 話不多說,直接開乾 一.下載 1.官方鏈接下載: https://www.microsoft.com/zh-cn/sql-server/sql-server-downloads 2.在下載目錄中找到下麵這個小的安裝包 SQL2022-SSEI-Dev.exe,運行開始下載SQL server; 二. ...
  • 前言 隨著物聯網(IoT)技術的迅猛發展,MQTT(消息隊列遙測傳輸)協議憑藉其輕量級和高效性,已成為眾多物聯網應用的首選通信標準。 MQTTnet 作為一個高性能的 .NET 開源庫,為 .NET 平臺上的 MQTT 客戶端與伺服器開發提供了強大的支持。 本文將全面介紹 MQTTnet 的核心功能 ...
  • Serilog支持多種接收器用於日誌存儲,增強器用於添加屬性,LogContext管理動態屬性,支持多種輸出格式包括純文本、JSON及ExpressionTemplate。還提供了自定義格式化選項,適用於不同需求。 ...
  • 目錄簡介獲取 HTML 文檔解析 HTML 文檔測試參考文章 簡介 動態內容網站使用 JavaScript 腳本動態檢索和渲染數據,爬取信息時需要模擬瀏覽器行為,否則獲取到的源碼基本是空的。 本文使用的爬取步驟如下: 使用 Selenium 獲取渲染後的 HTML 文檔 使用 HtmlAgility ...
  • 1.前言 什麼是熱更新 游戲或者軟體更新時,無需重新下載客戶端進行安裝,而是在應用程式啟動的情況下,在內部進行資源或者代碼更新 Unity目前常用熱更新解決方案 HybridCLR,Xlua,ILRuntime等 Unity目前常用資源管理解決方案 AssetBundles,Addressable, ...
  • 本文章主要是在C# ASP.NET Core Web API框架實現向手機發送驗證碼簡訊功能。這裡我選擇是一個互億無線簡訊驗證碼平臺,其實像阿裡雲,騰訊雲上面也可以。 首先我們先去 互億無線 https://www.ihuyi.com/api/sms.html 去註冊一個賬號 註冊完成賬號後,它會送 ...
  • 通過以下方式可以高效,並保證數據同步的可靠性 1.API設計 使用RESTful設計,確保API端點明確,並使用適當的HTTP方法(如POST用於創建,PUT用於更新)。 設計清晰的請求和響應模型,以確保客戶端能夠理解預期格式。 2.數據驗證 在伺服器端進行嚴格的數據驗證,確保接收到的數據符合預期格 ...