Azure AI FoundryでCustom Voiceを使っている、またはこれからブランド音声・キャラクター音声・音声エージェントを作る予定がある場合、今回のポイントは明確です。Custom Voiceの作成・学習・展開に関するポータル体験が、Microsoft Foundryポータル側で一般提供(GA)になりました。 これにより、承認済みのCustom Voice利用者は、音声タレントの録音、同意ステートメント、データ品質チェック、ニューラル音声モデルの学習と展開をFoundry中心の流れで扱いやすくなります。Azure Updates上の「Launched」は本番利用可能な状態を示しますが、Custom Voice自体は引き続き制限付きアクセスの要素を含むため、「誰でも自由に任意の声を作れるようになった」とは考えないことが重要です。(マイクロソフト Azure)
Azure AI FoundryのCustom VoiceポータルGAで何が変わったのか
今回の更新は、Azure AI SpeechのCustom Voice機能そのものが突然別物になる変更ではなく、Custom Voiceのオーサリング体験がMicrosoft Foundryポータルに移ったことが中心です。
Custom Voiceは、録音された人間の音声サンプルをファインチューニングデータとして使い、アプリケーション向けに独自の合成音声を作成するText to Speech機能です。Microsoftのドキュメントでは、ブランドやキャラクターを表現する自然な合成音声を作成できる機能として説明されています。(Microsoft Learn)
実務上は、次のような作業場所の整理と捉えると分かりやすいです。
| 観点 | これまで意識していた作業 | 今回の更新後に重視すべきこと |
|---|---|---|
| 作成画面 | Speech Studio中心のCustom Voice作成 | Microsoft FoundryポータルのFine-tune体験を確認 |
| 利用対象 | Custom Voiceの承認済み顧客 | 制限付きアクセスの承認状況を再確認 |
| データ準備 | 録音データと台本をアップロード | 音声タレント同意、録音品質、文字起こし整合性をFoundry上の流れで確認 |
| 学習 | Neural voiceモデルのトレーニング | 用途に合う学習方式を選択 |
| 展開 | カスタムエンドポイントにデプロイ | エンドポイント種類、認証、コスト、切替手順を確認 |
管理者や開発者が最初に確認すべきなのは、「既存のアプリがすぐ壊れるか」ではなく、今後の作成・運用手順、権限、同意管理、デプロイ手順をFoundry基準で見直せる状態になっているかです。
影響を受ける利用者と受けにくい利用者
今回の更新で直接影響を受けやすいのは、Azure AI SpeechのCustom Voiceを使って、独自の音声を作成・学習・展開しているチームです。特に、コンタクトセンター、接客ボット、ナレーション生成、教育コンテンツ、ゲームキャラクター、社内向けAIアシスタントなどで、ブランド固有の声を使いたい組織は確認しておく価値があります。
一方で、標準のText to Speech音声だけを使っているアプリや、既存の音声合成API呼び出しだけを行っているアプリでは、今回の更新だけで実装変更が必須になるとは限りません。Custom Voiceは、標準音声ではなく独自音声を作るための仕組みです。既存の標準音声だけで要件を満たしている場合は、まずCustom Voice導入の必要性を判断すれば十分です。(Microsoft Learn)
ただし、次のいずれかに当てはまる場合は、早めに確認してください。
- Speech StudioでCustom Voiceの作成・学習・展開を運用している
- 複数部門で音声モデルやエンドポイントを管理している
- 音声タレントの同意文書・録音データの管理フローが曖昧
- 生成AIエージェントやCopilot風の社内アシスタントに独自音声を組み込む予定がある
- 既存エンドポイントの停止・再開・切替を自動化している
特に最後の項目は見落とされがちです。ポータル体験の更新であっても、運用チームが「誰が、どの画面で、どのエンドポイントを止めるのか」を把握していないと、費用やリリース作業で混乱します。
管理者が確認すべき設定とガバナンス
Custom Voiceは、単なる便利な音声生成機能ではありません。人の声をもとに合成音声を作るため、権限、同意、用途制限、説明責任を含めて管理する必要があります。
MicrosoftはCustom Neural VoiceをLimited Access機能として扱っており、登録と承認が必要で、承認された用途に限定して利用する必要があります。また、音声タレントから明示的な許可を得ること、合成音声であることをユーザーに開示すること、フィードバック経路を用意することなどの要件が示されています。(Microsoft Learn)
承認済みアクセスを確認する
まず、対象のAzureサブスクリプション、Speechリソース、Microsoft FoundryプロジェクトでCustom Voiceの利用権限があるか確認します。
GAと聞くと「全テナントで自由に使える」と誤解しがちですが、Custom Voiceでは不正利用やディープフェイク対策の観点から、アクセス制限が残ります。管理者は、次の3点を明文化しておくと安全です。
| 確認項目 | 見るべきポイント |
|---|---|
| 利用承認 | Custom VoiceまたはCustom Neural Voiceの承認を受けているか |
| 利用用途 | 承認時に申請したユースケースと実際の利用が一致しているか |
| 利用者 | Foundryでモデル作成・学習・展開できる担当者が限定されているか |
「PoCでは使えたから本番でも使える」と判断するのは危険です。PoC、評価、社内デモ、本番サービスでは、利用目的・開示・同意・保存期間の扱いが変わる場合があります。
音声タレントの同意ステートメントを管理する
Professional Voiceのファインチューニングでは、学習前に音声タレントの同意ステートメント録音を提出する必要があります。この録音は、音声タレントが自分の音声データをProfessional Voiceのファインチューニングに使うことに同意していることを示すもので、学習データの話者と同一人物かを確認するためにも使われます。(Microsoft Learn)
実務では、次のような管理台帳を用意しておくと後から困りません。
| 管理項目 | 記録例 |
|---|---|
| 音声タレント名 | 同意ステートメント内の氏名と一致させる |
| 会社名 | 録音内で読み上げた会社名と一致させる |
| 対象言語 | 同意文と録音言語を一致させる |
| 承認用途 | コールセンター、教材、社内アシスタントなど |
| 契約範囲 | 利用期間、媒体、地域、再学習可否 |
| 削除・停止条件 | 契約終了時、本人からの申請時など |
ありがちな失敗は、同意ファイルだけをアップロードして、社内側の契約書・利用範囲・更新日を別管理にしてしまうことです。後から「この声を別サービスにも使ってよいのか」が分からなくなるため、Foundry上の設定と社内台帳を紐づけて管理しましょう。
データ保存とプライバシーを確認する
Microsoftのデータ・プライバシー説明では、Custom Neural Voiceで扱うデータとして、音声タレントの同意ステートメント、学習データ、文字起こし、テストスクリプト、合成に使うテキスト入力などが整理されています。顧客の学習データは、その顧客のCustom Voiceモデル作成に使われ、MicrosoftのText to Speechモデルのトレーニングや改善には使われないと説明されています。(Microsoft Learn)
管理者は、少なくとも次を確認してください。
- 学習データを誰がアップロードできるか
- 元音声ファイルと文字起こしをどこに保存するか
- Azure Blob Storage URLやSASを使う場合、有効期限とアクセス範囲が適切か
- 本番で使わない古いデータセットやエンドポイントを放置していないか
- 合成音声であることを利用者にどう伝えるか
音声データは、個人情報や生体情報に近い扱いが必要になる場合があります。法務・セキュリティ・広報・プロダクト担当を巻き込み、技術チームだけで判断しない体制を作ることが重要です。
開発者が確認すべき作成・学習・展開の流れ
開発者にとっての変更点は、Custom Voiceの作成フローをMicrosoft FoundryポータルのFine-tune体験として把握する必要があることです。Microsoft Learnでは、新しいFoundryポータルで「Build」から「Models」へ進み、AI Servicesタブで「Azure Speech – Text to Speech」を選び、Fine-tuneからProfessional voiceの基本情報を設定する流れが示されています。(Microsoft Learn)
基本フローを整理する
開発者向けには、次の順番で確認すると迷いにくくなります。
| 手順 | 作業内容 | 確認ポイント |
|---|---|---|
| 1 | FoundryでText to SpeechのFine-tuneを開始 | 対象プロジェクト、Speechリソース、リージョン |
| 2 | Professional voiceを選択 | 音声の性別、学習データ言語、Voice name |
| 3 | 音声タレントを登録 | 同意ステートメント、氏名、会社名、言語 |
| 4 | 学習データをアップロード | 音声ファイル、台本、データ形式 |
| 5 | データ品質を確認 | サンプリングレート、ノイズ、発音スコア、台本不一致 |
| 6 | モデルを学習 | Neural、HD、multilingualなど用途に合う方式 |
| 7 | エンドポイントへ展開 | High performanceまたはFast-resume、コスト確認 |
| 8 | アプリへ組み込み | EndpointId、Voice name、SSML、認証設定 |
この流れを開発手順書に落とし込むときは、「画面のクリック手順」だけでなく、失敗時の判断基準も書いておくと実用的です。たとえば「発音スコアが低い場合は、台本の誤字、読み間違い、無音区間、ノイズを確認する」といった具体的な基準です。
学習データの品質チェックで見るべきポイント
Custom Voiceの品質は、モデル設定よりも学習データの品質に大きく左右されます。Microsoftのドキュメントでは、Professional voice fine-tuningのデータセットには音声録音と対応する文字起こしが含まれ、個別発話の場合は各音声ファイルが単一発話で15秒未満であることなどが示されています。(Microsoft Learn)
また、データアップロード後には自動検証が行われ、ファイル形式、サイズ、サンプリングレートなどがチェックされます。発音スコアが70未満の場合は、音声エラーやスクリプト不一致を示すことが多く、全体スコアが70未満の発話は拒否されると説明されています。(Microsoft Learn)
失敗しやすいポイントは次の通りです。
| 失敗例 | 原因 | 対処 |
|---|---|---|
| アップロード後に多数の発話が拒否される | 音声IDと台本IDが一致していない | ファイル名と台本IDの対応表を作ってから再アップロード |
| 発音スコアが低い | 読み間違い、台本の表記ゆれ、ノイズ | 台本を音声通りに修正し、必要なら録り直す |
| 声の品質が安定しない | 収録環境、音量、話速、感情表現がばらつく | 同じマイク・同じ距離・同じ収録条件で録る |
| 学習後に用途と合わない声になる | 台本が実際の利用シーンと違う | コールセンターならFAQ、教材なら説明文など実運用に近い台本を使う |
| リリース後にコストが想定より高い | 使わないエンドポイントを起動したまま | 未使用時はSuspendを運用手順に入れる |
特に、日本語音声では、数字、記号、略語、英単語、会社名、製品名の読みが品質に影響しやすくなります。「Azure AI Foundry」をどう読ませるか、「Copilot」をカタカナに寄せるか英語風にするかなど、ブランド表記の読み方を台本段階で決めておくと、後工程の手戻りを減らせます。
学習方式は用途から選ぶ
Professional Voiceでは、Neural、Neural – HD Voice、Neural – multilingual、Neural – multi style、Neural – cross lingualなどの学習方式が用意されています。Microsoft Learnでは、HD Voiceは動的な会話向けに最適化されたLLMベースの音声、multilingualは単一言語の学習データから複数言語を話す音声、multi styleは複数のスタイルや感情を持つ音声、cross lingualは学習データと異なる言語を話す音声として説明されています。(Microsoft Learn)
選定の目安は次の通りです。
| 用途 | 向いている方式の考え方 |
|---|---|
| コールセンターの自動応答 | リアルタイム性と聞き取りやすさを優先。必要に応じてHD Voiceを検討 |
| ブランドナレーション | 安定したトーンと収録品質を重視 |
| ゲーム・キャラクター | multi styleで感情表現の必要性を検討 |
| 多言語展開 | multilingualまたはcross lingualの対応言語を確認 |
| 社内デモ | まず標準音声やCustom voice liteとの違いを整理 |
ここで注意したいのは、「高機能な方式を選べば常に良い」というわけではない点です。用途がFAQ読み上げ中心なら、感情表現よりも聞き取りやすさ、レスポンス、運用コストのほうが重要です。
移行・展開時に注意すべきエンドポイント運用
Custom Voiceモデルをアプリで使うには、学習済みモデルをカスタム音声エンドポイントに展開します。Microsoft Learnでは、Standard(S0)のSpeechリソースで最大50個のエンドポイントを作成できること、Fine-tuned Professional Voiceを使うには音声モデル名を指定し、カスタムURIをHTTPリクエストで直接使い、同じSpeechリソースでText to Speechの認証を行う必要があると説明されています。(Microsoft Learn)
High performanceとFast-resumeを使い分ける
Foundryでエンドポイントを展開する際、Endpoint typeとしてHigh performanceまたはFast-resumeを選ぶ場面があります。High performanceは会話AIやコールセンターボットのようなリアルタイム・高ボリューム合成向け、Fast-resumeは利用頻度が低い音声コンテンツ作成向けと説明されています。(Microsoft Learn)
実務では、次のように判断するとよいでしょう。
| エンドポイント種別 | 向いているケース | 注意点 |
|---|---|---|
| High performance | 常時稼働の音声エージェント、コンタクトセンター、低遅延が重要なサービス | 対応リージョンとコストを事前確認 |
| Fast-resume | ナレーション生成、社内コンテンツ作成、利用頻度が低いバッチ的用途 | 大量・リアルタイム用途には不向きな可能性 |
リリース前には、想定ピーク時の音声合成リクエスト数、許容遅延、リージョン、予算を合わせて確認してください。
モデル更新時は新エンドポイントへの切替を前提にする
Custom Voiceの更新で見落としやすいのが、モデルの差し替えです。Microsoft Learnでは、音声モデルを最新エンジンバージョンに更新した場合や新しい音声に切り替える場合、既存エンドポイントに新モデルを再デプロイすることはサポートされず、新しいエンドポイントへデプロイしてトラフィックを切り替える必要があると説明されています。テスト環境で新エンドポイントへ流して確認し、問題がなければ本番へ移行し、移行中は旧エンドポイントを保持することも推奨されています。(Microsoft Learn)
つまり、運用設計では次のような切替手順が必要です。
| フェーズ | 作業 |
|---|---|
| 事前準備 | 新モデルを作成し、新エンドポイントへ展開 |
| 検証 | テスト環境でEndpointId、Voice name、SSMLを確認 |
| 本番切替 | アプリ設定や環境変数で新エンドポイントへ切替 |
| 監視 | 応答遅延、エラー率、音声品質、ユーザー反応を確認 |
| ロールバック | 問題があれば旧エンドポイントへ戻す |
| 後片付け | 安定稼働後に旧エンドポイント削除または停止 |
本番アプリにエンドポイントURLやVoice nameを直書きしていると、切替時に修正漏れが起きます。環境変数、Key Vault、構成管理ツールなどで差し替えやすくしておきましょう。
使わないエンドポイントはSuspendを検討する
Custom Voiceのエンドポイントは、使っていない間もコスト管理の対象になります。Microsoft Learnでは、エンドポイントをSuspendすると利用していないリソースのコストを抑えられ、Suspend中は課金されず、Resume後は同じエンドポイントURLを使い続けられると説明されています。(Microsoft Learn)
検証用、イベント用、キャンペーン用の音声エンドポイントは、使い終わった後に放置されがちです。月次で次の棚卸しを行うと、無駄なコストを減らせます。
- Succeeded状態のエンドポイント一覧
- 最終利用日
- 所有部門
- 本番・検証・一時利用の区分
- Suspendまたは削除の判断
- 関連するアプリ設定の有無
Speech Studioとの違いで混同しやすい点
今回の更新でCustom Voiceのポータル体験がFoundry側に一般提供された一方、すべてのCustom Voice関連体験が同じ扱いになるわけではありません。
たとえば、Custom voice liteは、Professional Recordingに投資する前にデモ・評価するためのプロジェクトタイプですが、Microsoft Learnでは「Speech Studioでのみ利用可能で、Microsoft Foundryポータル、REST API、SDKでは利用できない」と説明されています。(Microsoft Learn)
そのため、次のように整理しておくと混乱を避けられます。
| 機能・用途 | 主な確認先 | 注意点 |
|---|---|---|
| Professional voice fine-tuning | Microsoft Foundryポータル | 承認、同意、学習データ、展開を確認 |
| Personal voice | Microsoft FoundryポータルまたはCustom Voice REST API | user consent statementとPersonal voice IDを管理 |
| Custom voice lite | Speech Studio | Foundryポータルでは利用不可 |
| API自動化 | Custom Voice REST API関連ドキュメント | Preview表記や本番可否を慎重に確認 |
また、Custom Voice REST APIへの移行ドキュメントでは、v3 Text to Speech REST APIのSuspend/Resume操作が退役予定で、Custom Voice APIの操作を使う必要があるとされています。ただし、その移行ドキュメント自体はPreview表記を含むため、本番ワークロードで採用する場合は、現在のサポート状態と社内基準に照らして確認してください。(Microsoft Learn)
管理者・開発者向けの実践チェックリスト
今回のAzure AI Foundry更新を受けて、まずは次のチェックリストを使って現状を確認してください。
| 対象 | チェック項目 | 優先度 |
|---|---|---|
| 管理者 | Custom VoiceのLimited Access承認状況を確認 | 高 |
| 管理者 | 音声タレントの契約、同意、利用範囲を台帳化 | 高 |
| 管理者 | Foundryでモデル作成・展開できるユーザーを制限 | 高 |
| 管理者 | 合成音声であることの開示方針を確認 | 高 |
| 開発者 | FoundryのFine-tune画面で既存モデル・デプロイを確認 | 高 |
| 開発者 | エンドポイントURL、EndpointId、Voice nameの管理方法を確認 | 高 |
| 開発者 | モデル更新時の新エンドポイント切替手順を作成 | 中 |
| 開発者 | 学習データの品質基準を定義 | 高 |
| 開発者 | Suspend/Resumeの運用ルールを決める | 中 |
| 共通 | Speech StudioとFoundryで扱う機能差を整理 | 中 |
特に本番利用中のチームは、「Foundryにログインできるか」だけで確認を終えないでください。重要なのは、承認済みの用途で、同意済みの音声データを使い、品質確認済みのモデルを、安全にデプロイ・切替・停止できるかです。
今回の更新をどう活用すべきか
今回のCustom Voiceポータル体験のGAは、音声AIをAzure AI Foundryの開発・運用フローに近づける更新です。今後、音声エージェント、AIアシスタント、Copilot的な対話体験に独自音声を組み込む場面では、モデル、データ、評価、展開をFoundry側でまとめて扱えることが重要になります。
一方で、Custom Voiceは「声」という個人性の強いデータを扱うため、便利さだけで導入すると、同意、用途、開示、コスト、モデル更新でつまずきます。
まずは、次の順番で進めるのがおすすめです。
- 既存のCustom Voice利用状況と承認状態を確認する
- 音声タレントの同意・契約・利用範囲を整理する
- Foundryポータルで作成・学習・展開フローを検証する
- 学習データの品質基準を決める
- エンドポイント切替とSuspend/Resumeの運用手順を作る
- 本番導入前に、開示文言と問い合わせ窓口を整える
Azure AI FoundryでCustom Voiceを使う価値は、単に「人間らしい声」を作ることではありません。ブランドやサービスの体験を損なわず、安全に、継続運用できる音声基盤を作ることにあります。今回のGAをきっかけに、ポータル操作の確認だけでなく、権限・同意・データ品質・展開ルールまで含めて見直しておきましょう。

コメント