Azure AI FoundryのText to Speech REST APIは、テキストを音声に変換するための主要手段として、Neural音声や多言語対応をサポートしています。2026年5月19日時点での更新では、APIの認証方法、対応地域、サンプルリクエストとレスポンス、利用時の注意点が整理されており、開発者はトークン取得、エンドポイント選定、音声スタイルやレートの管理を確認する必要があります。この記事では、管理者や開発者が知るべき設定、移行や展開のポイントを具体例とともに解説します。
REST APIを利用する前に確認すべき基本事項
認証方式とAPIキーの管理
REST APIは二つの認証方式をサポートしています:
- Ocp-Apim-Subscription-Key: リソースキーを直接ヘッダに指定
- Authorization Bearerトークン: トークン交換を経てアクセストークンを取得
どちらか一方が必要です。トークン方式はセキュリティが高く、短期利用や自動化に向いています。
対応地域とエンドポイント
APIはリージョン単位で提供されており、選んだリソースの地域に対応するエンドポイントを利用する必要があります。例:
- 東日本:
https://japaneast.tts.speech.microsoft.com/cognitiveservices/v1 - 米国中部:
https://centralus.tts.speech.microsoft.com/cognitiveservices/v1
誤ったエンドポイントでは401 Unauthorizedエラーが発生するため注意が必要です。
サポートされる音声とスタイル
REST APIではNeural音声を中心に、多言語・多スタイルが利用可能です。具体例:
- 女性の英語音声「JennyNeural」: 標準的なアシスタントやニュース読み上げ
- 男性の中国語音声「YunxiNeural」: 語り・チャット・感情表現など複数スタイル
- マルチリンガル音声もあり、同一音声で複数言語を発話可能
| 音声名 | 性別 | 言語 | スタイル例 | WordsPerMinute |
|---|---|---|---|---|
| JennyNeural | 女性 | en-US | assistant, chat, cheerful | 152 |
| YunxiNeural | 男性 | zh-CN | narration-relaxed, chat, serious | 293 |
注意点として、プレビュー中の音声・スタイルは利用可能地域が限定されています。
テキストを音声に変換する手順
- エンドポイントと認証を確認
- SSMLまたはプレーンテキストを用意
- HTTP POSTリクエストを送信
curl -X POST "https://<region>.tts.speech.microsoft.com/cognitiveservices/v1" \
-H "Authorization: Bearer <token>" \
-H "Content-Type: application/ssml+xml" \
-d "<speak version='1.0'>こんにちは</speak>"
- レスポンス音声ファイルを保存・再生
注意すべきエラーと対応
- 401 Unauthorized: 認証情報の不一致
- 429 Too Many Requests: 利用上限超過
- 400 Bad Request: SSMLやヘッダのフォーマット不備
- 502 Bad Gateway: サーバ側の問題、再試行が必要
管理者・開発者向けの展開ポイント
- コスト管理: Neural音声は標準音声より高額。利用頻度・音声タイプごとに確認
- 音声選定: 文章の長さや用途に応じてWordsPerMinuteを参考に最適化
- 地域制限: 国やリージョンによる音声・スタイルの制限を事前確認
- 自動化対応: トークン方式を使うと短期間・スクリプトでの呼び出しが容易
REST APIはSpeech SDKに比べ機能は限定されますが、サーバレスや自動化用途では有効です。まずはサンプルリクエストで動作確認し、エンドポイント・音声・認証の設定を確実に整えてから本番運用に移行することが推奨されます。

コメント