Azure AI Speechの音声クローン(Custom Neural Voice)とAzure China 21Vianetでの利用可否・代替案

Azure AI Speechの音声クローン(Custom Neural Voice / Custom Voice)をグローバルAzureで作り、中国のAzure(21Vianet)から使えるのかは、設計と運用の前提を大きく左右します。この記事では利用可否の結論、グローバルと21Vianetの違い、そして中国環境で現実的に取り得る代替案までを実務目線で整理します。

目次

結論:グローバルで作成した音声クローンを、21Vianet(中国)から「同じリソースとして」利用することはできない

先に結論から整理すると、Azure AI Speechの音声クローン機能(Custom Neural Voice / Custom Voice)は、Microsoft Azure operated by 21Vianet(いわゆるAzure China、以下21Vianet環境)ではサポートされていません。21Vianet環境で提供されるSpeech関連機能は、音声認識(Speech to Text)、読み上げ(Text to Speech)、音声翻訳(Speech Translation)などの“コア機能”が中心で、「自分専用のクローン音声を作る」カテゴリは対象外です。

さらに重要なのは、グローバルAzureと21Vianet環境は、単なる「リージョン違い」ではなく“別クラウド”として分離されている点です。21Vianet環境は中国国内にある物理的に分離されたクラウドで、運営・契約・エンドポイントが独立しています。そのため、グローバルAzure側で作成したCustom Voice(音声クローン)を、21Vianet側のサブスクリプションやキーで呼び出す、といった使い方は前提として成立しません。

一方で、「中国のアプリがグローバル側のSpeechエンドポイントをインターネット経由で叩く」こと自体は技術的にゼロではありません。しかしその場合は、グローバル側に別途サブスクリプション/Speechリソースを用意し、データ越境やネットワーク到達性、法令順守を含めて設計し直す必要があります。要件次第では現実的ではない、というのが実務上の落としどころになります。

用語整理:Custom Neural Voice(音声クローン)=「Custom Voice」として提供されるTTSのカスタマイズ機能

ドキュメント上の表記は時期により揺れますが、一般に「Custom Neural Voice(CNV)」は、SpeechのText to Speech(TTS)を“特定の話者・ブランド向けにカスタム化する”機能群を指します。Microsoft Learnでは、現在「Custom voice(カスタムボイス)」として整理され、音声サンプルと台本(スクリプト)を使って音声モデルをトレーニングし、デプロイ(エンドポイント化)して利用する流れが基本です。

また、Custom voiceは責任あるAIの観点から利用条件・審査(申請)が設けられており、誰でもすぐに本番用途で自由に使えるタイプの機能ではありません。つまり「技術的に作れるか」だけでなく「申請が通るか/運用できるか」も要件に組み込む必要があります。

Custom Voiceの提供範囲:グローバルAzureではリージョン依存、21Vianet(中国)では未提供

グローバルAzure側では、Speech service supported regionsの表に、Custom voiceやPersonal voiceなどの提供有無がリージョン別に掲載されています。ここで注意したいのは、「Custom voiceが使えるリージョン」と「Custom voiceのトレーニングまでできるリージョン」が同一とは限らない点です。例えば、Custom voice列が有効でも、Custom voice training(学習)が別列で制限されるケースがあります。

そして21Vianet環境については、Speech service in sovereign clouds(主権クラウド)において、Microsoft Azure operated by 21VianetでUnsupported features(非対応機能)としてCustom voice / Personal voiceが明確に列挙されています。ここが最も重要な一次情報です。

項目グローバル AzureAzure China(21Vianet)
音声クローン(Custom Voice / Custom Neural Voice)リージョンによって利用可(学習可否もリージョン依存)未提供(非対応機能として明記)
標準音声 / ニューラル音声(Text to Speech)利用可利用可
Speech to Text(音声認識)利用可(カスタムスピーチ含む)利用可(カスタムスピーチ含む)
Speech Translation(音声翻訳)利用可利用可(リアルタイム中心)
ポータル / 運用主体Microsoftのグローバルクラウド21Vianetが独立運営・契約

なぜ「グローバルで作った音声クローン」を21Vianetから使えないのか:設計上の前提は“別クラウド”

21Vianet環境は、Microsoft Learn上でも「中国国内にある物理的に分離されたクラウド」と説明されています。運用も契約もエンドポイントも独立しており、同じAzureというブランドでも、実態としては別のクラウドインスタンスです。

この分離は、単に“管理画面が違う”程度ではなく、次のような実装・運用の挙動として表面化します。

  • エンドポイントのドメインが異なる(例:グローバルはspeech.microsoft.comや*.speech.microsoft.com系、21Vianetは*.speech.azure.cn系)
  • 同じキーを別リージョン/別クラウドに持ち込めない(リージョンとリソースにひもづく)
  • データ所在(データが処理・保管される場所)の前提が異なる

特にSpeechは、リージョンが違うだけでも「キーが有効なのは作成リージョンだけ」「別リージョンに対して使うと認証エラーになる」と明記されています。これが“別クラウド”ならなおさらで、21Vianetのキーでグローバル側のリソースを使う、という発想自体が成立しません。

21Vianet(中国)で利用できるSpeech関連サービス:できること・できないこと

21Vianet環境でもSpeech自体は利用でき、音声認識や読み上げなどの主要機能は実装可能です。Microsoft Learnの主権クラウド向けページでは、21VianetでのSupported features(対応機能)/Unsupported features(非対応機能)が一覧化されています。

カテゴリ21Vianet(中国)での提供状況補足(実務上の意味)
Speech Studio対応中国クラウド用のStudio(ドメインも別)を使う
Speech to Text(リアルタイム/バッチ)対応音声認識の中核は実装可能
Custom Speech(カスタムスピーチ)対応用語・話し方に寄せたSTT改善が狙える
Pronunciation assessment(発音評価)対応学習/教育系で使いやすい
Text to Speech(標準音声/ニューラル音声)対応“既製の声”での読み上げは可能
Speech translation(リアルタイム音声翻訳)対応通訳/翻訳の基本機能は利用可能
Custom Voice / Personal Voice(音声クローン系)非対応本人声・ブランド声の作成はできない
Text to speech avatar / Voice live / LLM speech 等非対応会話UX高度化の一部は中国側で制約が出る

エンドポイントとリージョンの違い:実装でつまずきやすいポイント

21Vianet環境は、Speech SDKやREST APIのエンドポイント形式がグローバルとは異なります。Microsoft Learnには、21Vianet向けのREST APIエンドポイント形式と、利用できる中国リージョン(China East 2 / China North 2 / China North 3)およびリージョン識別子(chinaeast2など)がまとまっています。

「同じSDKコードを動かしたのに認証で落ちる」「リージョン名は合っているのに到達しない」といったトラブルの多くは、クラウドの取り違え(グローバル前提のエンドポイントを中国で使う)で起きます。運用チームが後から引き継ぐ場合も考え、設定値は“クラウド種別”ごとに明確に分離するのが安全です。

用途グローバル Azure(概念)21Vianet(中国)の例実務メモ
STT(短い音声のREST)グローバル用のエンドポイント体系https://<REGION>.stt.speech.azure.cn/<...>中国はspeech.azure.cn系
TTS(REST)グローバル用のエンドポイント体系https://<REGION>.tts.speech.azure.cn/<...>同じSSMLでも機能差が出る場合があるため検証必須
利用可能な中国リージョン多数China East 2 / China North 2 / China North 3中国側は選択肢が限られる

「グローバルで音声クローンを作る」場合に押さえるべき現実:リージョン、申請、データ所在

Custom Voice(音声クローン)を本気で使いたい場合、設計上の論点は大きく3つあります。

  • リージョン選定:Custom voiceの提供有無、学習(training)の可否、高性能エンドポイントの可否がリージョンで変わる
  • 利用申請:Responsible AIの観点からアクセスが制限され、申請が必要
  • データ所在:Speechは基本的にリソースを作ったリージョン内で処理される前提で、越境を前提にしない設計が取りやすい

特にリージョンについては、Speech service supported regionsで、Custom voiceが利用可能なリージョンや、Custom voice trainingが可能なリージョンが表形式で示されています。たとえばEast US、West Europe、Southeast AsiaなどはCustom voice関連の列が有効になっており、要件(遅延、運用体制、データ所在)に合わせて選定します。

要件別の設計パターン:現場で破綻しない選び方

パターンA:音声クローン最優先(中国提供は必須ではない)

「ブランド声を使いたい」「特定キャラクターの声がプロダクト価値そのもの」という場合、中国環境に寄せるよりも、Custom Voiceが使えるグローバルAzureのリージョンで完結させる構成が基本です。アプリも同じクラウド側に寄せることで、遅延やネットワーク断の影響を最小化できます。

このパターンでは、最初に“提供対象国”と“データ処理場所”の整理が重要です。特に中国ユーザー向けに音声を扱う場合、データ越境の取り扱いが絡むため、技術判断だけで突っ走らない方が安全です。

パターンB:中国(21Vianet)での提供が最優先(データを中国外に出せない/出したくない)

「中国国内ユーザーに低遅延で提供したい」「データを中国国内に留めたい」「現地規制や社内方針で越境を避けたい」という場合は、21Vianet環境のSpeech機能(STT/TTS/翻訳/カスタムスピーチ)で設計するのが現実的です。

この場合、音声クローンは要件から外す(もしくは中国向けは別の声・別のUXにする)という割り切りが必要になります。中国向けだけ既製のニューラル音声を採用し、読み上げ品質はSSMLや音声後処理で詰める、という落としどころが多いです。

パターンC:グローバル向けと中国向けを“別プロダクトに近い”形で二重運用する

グローバルではCustom Voice、中国では既製のニューラル音声、といった形でクラウドも機能も分けて運用するパターンです。手間は増えますが、クラウド境界(別契約・別エンドポイント・別機能)を前提にした設計なので、後から破綻しにくいのが利点です。

実務のポイントは「コードを二重にする」のではなく、設定と運用を二重にする発想にすることです。たとえば同じアプリでも、環境変数や構成管理で以下を切り替えられるようにします。

  • Speechリソースのクラウド種別(Global / 21Vianet)
  • リージョン識別子とエンドポイント
  • TTSの音声名(グローバル=Custom Voice、中国=既製ニューラル音声)
  • ログ/監査/データ保持のポリシー

パターンD:中国環境からグローバル音声クローンを呼ぶ(技術的には可能でも“要件適合”が難しいことが多い)

「アプリは21Vianetに置くが、TTSだけグローバルのCustom Voiceを使いたい」という相談はよくあります。しかし、このパターンは次のリスクが同時に乗ります。

  • クラウドまたぎ:21Vianetのテナント/サブスクリプションとグローバル側は独立(運用・請求・権限が分断)
  • ネットワーク:越境通信の遅延・不安定性、到達性の問題
  • コンプライアンス:音声データやテキストが越境する設計になる可能性

どうしても検討する場合は、「何が中国外に出るのか(テキスト、音声、ログ)」「どこで処理されるのか」「誰が運用・監査するのか」を先に確定し、法務・セキュリティと合意してからPoCに入るのが安全です。

要件推奨アプローチ理由
音声クローンが必須、主な利用地域は中国外グローバルAzureでCustom Voice中心に設計機能が揃い、クラウド境界問題を避けられる
中国国内での提供が必須、越境を避けたい21VianetでSTT/TTS(既製ニューラル音声)中心Custom Voiceが非対応のため、要件を現実解に寄せる
グローバルも中国も同一UXを狙いたい二重運用(中国は代替音声)+差分吸収クラウド分離を前提にした方が長期運用で破綻しにくい
中国からグローバルCustom Voiceを呼びたい原則は非推奨(やるなら越境・到達性を前提に徹底検証)ネットワークと規制で運用難度が跳ね上がる

21Vianet(中国)でTTS品質を上げる実務的な工夫:音声クローンがなくても“聞ける音”には寄せられる

Custom Voiceが使えない場合でも、中国側で「機械っぽさ」を軽減したり、プロダクトとしての“声の統一感”を出したりする余地はあります。ここでは、実務で効きやすい順に整理します。

既製ニューラル音声の選定を“プロダクト設計”としてやる

TTSの声選びは単なる好みではなく、解約率・問い合わせ率に直結するUI要素です。例えばコールセンター用途なら「聞き取りやすさ(速度・滑舌)」「数字や固有名詞の読み間違い耐性」を重視し、キャラクター用途なら「抑揚」「テンション」「年齢感」を優先します。中国向けはまず“対象言語の既製ニューラル音声を前提”に、プロトタイプ音声を複数用意して関係者レビューを回すのが近道です。

SSMLで読み上げの自然さを調整する

同じ音声でも、SSML(読み上げ用マークアップ)で間(ポーズ)、読み、速度、強調を調整するだけで“人が話している感”は上がります。特に中国語は固有名詞・英数字・略語が混ざるケースが多いので、読みの設計(製品名、型番、略称)を先に決め、テンプレート化すると運用が安定します。

テキスト整形(前処理)で、音声品質の8割が決まる

音声合成の品質はモデルだけでなく、入力テキストの質に大きく左右されます。以下は効果が出やすい前処理です。

  • 数値・単位・日付の読みを統一(例:2025/12/14をどう読むか)
  • 記号や括弧、URLなどを読み上げ用に置換
  • 固有名詞辞書(製品名、人名、地名)を整備
  • チャットのような短文は、文末や句読点を整えて“話し言葉”に寄せる

音声ファイルの後処理で“プロ品質”に近づける

読み上げた音声に対して、アプリ側でノーマライズ(音量均一化)や無音トリム、軽いEQを入れるだけでも聞き疲れが減ります。Custom Voiceがない状況では、こうした“音作り”が最終品質を底上げします(ただし過度な加工は不自然さを生むので、検証しながら段階的に入れるのが安全です)。

実装・運用のチェックリスト:相談が多い落とし穴を先に潰す

  • クラウド種別を最初に固定する:「中国ユーザー向け」=「21Vianet必須」なのかを要件として明文化する
  • Speechで使う機能一覧を表にする:STT/TTS/翻訳/カスタムスピーチ/発音評価/クローン音声を並べ、21Vianetの非対応項目を確実に除外する
  • リージョンとエンドポイントの設計を分離する:設定ファイルでクラウド別に持ち、運用手順書にも反映する
  • キーの取り回しを誤らない:リージョンやクラウドをまたいで使えない前提で設計し、誤設定時のアラートを入れる
  • 越境の可能性を棚卸しする:音声・テキスト・ログ・監査データがどこに流れるかを図にして、法務/セキュリティと合意する

よくある質問

グローバルAzureで作ったCustom Voice(音声クローン)を、21VianetのSpeechリソースに“移植”できますか?

できません。21Vianet環境ではCustom Voice自体が非対応機能として扱われており、そもそも中国側に同等の受け皿がありません。また、21Vianetは物理的に分離された別クラウドで、リソースやキーを相互に共有する前提では運用されていません。

21Vianet環境でも「ニューラル音声」は使えますか?

はい。21Vianetの対応機能として、Text to SpeechのStandard voiceおよびNeural voiceが挙げられています。音声クローンは不可でも、既製のニューラル音声による読み上げは可能です。

中国向けにも“ブランドの声”を揃えたいです。現実的な代替は?

最も現実的なのは、中国向けは既製のニューラル音声を採用し、SSMLとテキスト前処理、音声後処理で“話し方”と“聞こえ方”を寄せる方法です。グローバル向けはCustom Voice、中国向けは既製音声という二段構えにし、プロダクト上は「中国版の標準ボイス」という扱いにしてしまうと、運用が安定します。

なぜリージョンやクラウドが違うとキーが使えないのですか?

Speechはリージョン単位でエンドポイントとキーが紐づいており、異なるリージョンに対して同じキーを使うと認証エラーになることが明記されています。21Vianetはそれ以前に“別クラウド”でエンドポイント体系も異なるため、グローバルのキーを中国クラウドに持ち込む、という設計は避けるべきです。

まとめ:音声クローンを軸にするならグローバル、中国で完結させるなら21Vianetの範囲で最適化する

音声クローン(Custom Neural Voice / Custom Voice)は、プロダクト体験を差別化できる一方で、利用条件や提供クラウドが明確に制約されます。21Vianet(中国)では音声クローンが非対応であり、グローバルで作ったクローン音声を“そのまま中国のAzureで使う”ことはできません。要件に応じて「グローバル向け」と「中国向け」を分け、同じSpeechでも機能セット・エンドポイント・運用体制を切り替える設計が、長期運用で最も事故が少ない選択肢になります。

この記事を書いた人

実務の現場で詰まりがちなポイントを地図にするITブログ「IT trip」を運営。Windows/Office(Teams・Excel)からSQL、サーバ運用、ガジェットまで、再現性のある手順と“なぜそうなるか”を丁寧に解説します。読んだらすぐ試せること、そして迷った人の次の一歩が見えることを大切にしています。

コメント

コメントする

目次