花樣試用微軟語音服務曉曉_ZenDei技術網路在線

受微軟美女員工 Grace Peng 邀請（也可能是套路？？？），參加微軟神經語音（沒錯，就是神經）曉曉的試用，首先是看到了群裡面的消息，然後就是發送申請，等待回覆，過了幾天後，收到了一個機器人發來的賬號密碼，告訴我已經幫我申請了免費試用的賬號，直接登錄即可使用了。其實一直都有接觸各種 TTS 的服... ...

前言

受微軟美女員工 Grace Peng 邀請（也可能是套路？？？），參加微軟神經語音（沒錯，就是神經）曉曉的試用，首先是看到了群裡面的消息，然後就是發送申請，等待回覆，過了幾天後，收到了一個機器人發來的賬號密碼，告訴我已經幫我申請了免費試用的賬號，直接登錄即可使用了。其實一直都有接觸各種 TTS 的服務，但是在測試微軟曉曉的過程中發現，在擬人方面，曉曉的發音似乎被訓練得很不錯，在語法方面，曉曉支持 SSML 語法，具體參見：https://www.w3.org/TR/speech-synthesis/ 什麼是 SSML，來自百度百科語音合成標記語言的解釋。

1. 準備工作

話不多說，馬上開始，首先登錄 Azure portal,

1.1 選擇 “認知服務”，添加一個新的 Speech 訂閱命名為：MySpeechService

1.2 等待部署完成

1.3 Speech 部署完成後

點擊左側列表中的 “所有資源”連接，進入資源管理面板

1.4 選擇資源，查看密鑰

在資源面板點擊剛纔創建好的 MySpeechService，進入詳情後點擊 “鍵”(keys)，可以看到已經生成好的密鑰，等一下調用 Speech 服務的時候需要用到，好了，準備工作已經完成了，下麵就寫兩行代碼試試。

2. 開始試用

創建一個控制台項目：MySpeechApp，進行一些簡單的編碼工作，在正式編碼之前，需要來瞭解一下調用流程

從上面的流程圖可以瞭解到，首先，我們需要使用創建好的 Speech 服務中的密鑰去換取訪問 Token ，然後，使用 Token 調用 Speech 主機，傳遞文本，下載語音文件，整個流程結束。

註意：通過上面的流程，只能合成 10 分鐘以內的語音文件。

好了，流程已經看懂了，下麵正式開始編碼。

2.1 定義公共的變數備用

    class Program
    {
        private const string TOKEN_URI = "https://southeastasia.api.cognitive.microsoft.com/sts/v1.0/issuetoken";
        private const string SUB_KEY = "36290bbded8f4cb59e34e50ed7be60b0";
        private const string HOST = "https://southeastasia.tts.speech.microsoft.com/cognitiveservices/v1";
        private const string RESOURCE_NAME = "MySpeechService";
    }

TOKEN_URI：換取 Token 調用的 URL
SUB_KEY：資源密鑰，就是 1.4 中的鍵（keys）
HOST：Speech 主機，因為給我分配的是東南亞的，所以這裡地區也必須選擇 southeastasia，資源面板上也沒有說明，一開始使用的是 westus ，總是提示身份驗證異常，坑了好幾分鐘。
RESOURCE_NAME：資源名稱，就是我們創建的服務名，這沒什麼好說的

2.2 換取訪問Token

        private static async Task<string> GetTokenAsync()
        {
            using (var httpClient = new HttpClient())
            {
                httpClient.DefaultRequestHeaders.Add("Ocp-Apim-Subscription-Key", SUB_KEY);
                var builder = new UriBuilder(TOKEN_URI);

                var result = await httpClient.PostAsync(builder.Uri.AbsoluteUri, null);

                return await result.Content.ReadAsStringAsync();
            }
        }

代碼比較簡單，就是一個 Http 請求的封裝而已，核心內容是 httpClient.DefaultRequestHeaders.Add("Ocp-Apim-Subscription-Key", SUB_KEY);，把資源密鑰加入請求頭中。

2.2 合成語音

        private static async Task RequestSSML(string authToken, string text, string fileName)
        {
            Console.WriteLine("準備中...");
            using (var httpClient = new HttpClient())
            {
                var body = "<speak xmlns=\"http://www.w3.org/2001/10/synthesis\" xmlns:mstts=\"http://www.w3.org/2001/mstts\" version=\"1.0\" xml:lang=\"zh-CN\"><voice name=\"Microsoft Server Speech Text to Speech Voice (zh-CN, XiaoxiaoNeural)\">" + text + "</voice></speak>";
                var request = new HttpRequestMessage()
                {
                    Method = HttpMethod.Post,
                    RequestUri = new Uri(HOST),
                    Content = new StringContent(body, Encoding.UTF8, "application/ssml+xml")
                };
                request.Headers.Add("Authorization", "Bearer " + authToken);
                request.Headers.Add("Connection", "Keep-Alive");
                request.Headers.Add("User-Agent", RESOURCE_NAME);
                request.Headers.Add("X-Microsoft-OutputFormat", "riff-24khz-16bit-mono-pcm");

                Console.WriteLine("正在進行遠程過程調用...");

                var response = await httpClient.SendAsync(request);
                if (response.StatusCode != System.Net.HttpStatusCode.OK)
                {
                    Console.WriteLine("The Response {0}", response.StatusCode);
                    return;
                }
                using (var stream = await response.Content.ReadAsStreamAsync())
                {
                    stream.Position = 0;
                    Console.WriteLine("正在下載語音文件 {0} ...", fileName);
                    using (var fs = new FileStream(fileName, FileMode.Create, FileAccess.Write, FileShare.ReadWrite))
                    {
                        await stream.CopyToAsync(fs);
                        fs.Close();
                    }
                }
                Console.WriteLine("文本轉換語音成功");
                Console.WriteLine("===============\n");
            }
        }

這段代碼也非常的簡單，首先是構造一個 SSML 文件格式的 Body，併在請求頭中加入 AuthToken 還有其它的一些頭部標識，然後就開始正式的請求語音文件，最後將合成好的語音文件保存到本地。

2.3 開始調用過程

        static void Main(string[] args)
        {
            var result = GetTokenAsync().ConfigureAwait(false).GetAwaiter();
            string token = result.GetResult();

            var text1 = "你好，我是來自博客園的技術愛好者 Ron Liang；很高興可以試用 Speech，希望一切順利。";
            var task1 = RequestSSML(token, text1, "1.wav");
            task1.ConfigureAwait(false).GetAwaiter().GetResult();

            var text2 = "小哥哥，來一發<prosody rate=\"-40.00%\" volume=\"-80.00%\" duration=\"1.5s\">嗎？</prosody>";
            var task2 = RequestSSML(token, text2, "2.wav");
            task2.ConfigureAwait(false).GetAwaiter().GetResult();

            var text3 = "蒿嗨偶，肝絕忍僧衣襟搗打的高草，肝絕忍僧衣襟搗打了巔峰。蒿贈寒，蒿朵母，蒿懸猜。";
            var task3 = RequestSSML(token, text3, "3.wav");
            task3.ConfigureAwait(false).GetAwaiter().GetResult();

            Console.WriteLine("按任意鍵退出");
            Console.ReadKey();
        }

上面有3段文本，對應合成3段語音，1和3是純粹搗亂的，第二段文本中加入了SSML標記prosody，其屬性表示：rate=-40%(降低語速),volume=80%(降低音量),duration=1.5s(延時1.5s)

2.3 按 F5 運行程式

非常完美的運行成功，我們得到了3個語音文件，分別是：

正常版：
你好，我是來自博客園的技術愛好者 Ron Liang；很高興可以試用 Speech，希望一切順利。

撩人版：
小哥哥，來一發嗎？

方言版：
蒿嗨偶，肝絕忍僧衣襟搗打的高草，肝絕忍僧衣襟搗打了巔峰。蒿贈寒，蒿朵母，蒿懸猜。

結束語

整體來說，在普通的語境環境下，曉曉的表現還是不錯的，整體令人滿意，但是在自定義 SSML 的時候，就非常的麻煩，我調整了不下30分鐘，都沒有達到一個令人滿意的結果；當然，曉曉還有別的優點，比如可以自定義語音字體，你可以請聲優來訓練專業你自己的語音字體，只為你一個人服務。

代碼托管在GitHub上了
https://github.com/lianggx/Examples/tree/master/MySpeechApp

花樣試用微軟語音服務曉曉

前言