Azure AI FoundryでCustom Avatar/Custom VideoポータルがGAに:変更点と管理者の確認事項

Azure AI FoundryでCustom AvatarやCustom Videoを使う場合、今回のポイントは「アバター作成・動画生成の作業導線がMicrosoft Foundryポータルに統合され、一般提供として扱われるようになったこと」です。既存のAzure AI SpeechやSpeech Studioの知識が不要になるわけではありませんが、承認済みの顧客は、俳優・出演者の動画をアップロードし、カスタム動画アバターを微調整し、合成のトーキングヘッド動画を作成する流れをFoundry側で進めやすくなります。(マイクロソフトアジュール)

ただし、管理者が最初に見るべきなのは「使えるかどうか」ではなく、「誰の肖像・声を、どの用途で、どのリージョンとコスト管理のもとで使うか」です。Custom text to speech avatarはLimited Access機能であり、利用には登録・承認・用途制限が関係します。全ユーザーがAzureポータルから自由に作れる機能として扱うと、権利処理・説明責任・コストの面でつまずきやすくなります。(Microsoft Learn)

目次

Azure AI FoundryのAI/Copilot更新で何が変わるのか

今回の更新は、Azure AI SpeechのCustom AvatarとCustom Videoのオーサリング体験を、Microsoft Foundryポータルに一般提供として取り込むものです。Azure Updates上の「Launched」は、一般提供・本番利用可能な状態を示すステータスですが、Custom Avatarの利用可否はLimited Access承認や対象ユースケースに左右されます。(マイクロソフトアジュール)

実務上の変化は、次のように整理できます。

観点これまで意識していたこと今回の更新後に意識すべきこと
作成場所Speech StudioやAzure AI Speech側の画面を中心に確認Microsoft FoundryポータルのFine-tuningやPlaygroundから作成・利用する導線を確認
対象機能Text to speech avatar、Custom Avatarを個別に理解Custom Avatar、Custom Video、Voice Live、API利用を一連の体験として設計
利用者音声・動画担当者や一部の開発者管理者、開発者、コンテンツ制作、法務・広報・セキュリティが関与
リスク管理技術検証が中心肖像権・同意・用途承認・合成であることの開示・コスト監視まで含めて管理
展開方法PoCごとに個別設定しがちFoundryプロジェクト単位で権限、モデル名、デプロイ、利用ログを整理

ここで誤解しやすいのは、「Copilotにアバター機能が自動追加される」という話ではない点です。Azure AI Foundry上で、音声AI・アバター・動画生成を使ったアプリやエージェント体験を作りやすくなる更新と捉えるのが正確です。Text to speech avatarは、テキストから自然な音声で話すフォトリアルな人物動画を生成でき、API連携またはFoundry上のノーコード体験から利用できます。(Microsoft Learn)

Custom AvatarとCustom Videoでできること

Azure AI SpeechのText to speech avatarは、テキストを入力し、人物アバターが話している動画を生成する機能です。標準アバターだけでなく、承認済みの顧客は自社ブランドや製品向けのカスタムアバターを作成できます。カスタム動画アバターは動画録画をもとに微調整され、半身または全身表現をサポートします。(Microsoft Learn)

機能何ができるか向いている用途
Text to Speech Avatarテキストから、アバターが話す動画を生成案内動画、教育コンテンツ、社内説明、デモ動画
Custom Video Avatar俳優・出演者の動画をもとに独自アバターを微調整ブランド固有の案内役、製品説明、ローカライズ動画
Voice sync for avatar学習動画内の音声を使い、アバター専用の声を作成同じ人物らしい見た目と話し方を組み合わせたい場合
Professional voiceとの併用別プロセスで作成した高品質なカスタム音声を利用より自然なブランド音声を重視する場合
API利用SDKやSSMLでアバターモデル名を指定Webアプリ、受付システム、AIエージェント連携

動画アバターは、バッチ合成とリアルタイム合成の両方で使えます。動画アバターの出力は標準で1920×1080、カスタムアバターでは4Kトレーニングを選べる場合があり、フレームレートは25FPSです。バッチ合成ではH264、HEVC、AV1など、リアルタイム合成ではH264が使われます。(Microsoft Learn)

影響を受ける利用者とチーム

今回のAzure AI Foundry更新は、単に「動画を作る人」だけの話ではありません。特に本番利用を考える場合、管理者・開発者・コンテンツ責任者が同じ前提で動く必要があります。

対象者確認すべきこと
Azure管理者Microsoft FoundryまたはSpeechリソース、リージョン、S0、権限、課金、デプロイ削除手順
開発者API・SDK・SSMLで指定するモデル名、エンドポイント、バッチ/リアルタイムの使い分け
コンテンツ制作担当収録品質、台本、表情・姿勢・照明、合成動画であることの表示方法
法務・広報出演者の同意、使用範囲、公開先、二次利用、削除・停止時の運用
セキュリティ担当Blob Storageの公開範囲、SAS URL、アクセス権限、監査ログ、承認済み用途の逸脱防止

特に重要なのは、Custom Avatarが「実在人物の見た目や声に近い合成コンテンツ」を扱う点です。Microsoftのドキュメントでは、Custom text to speech avatarは有害なディープフェイクや誤解を招くコンテンツへの対策を目的にLimited Accessとして扱われ、利用は登録時にMicrosoftが承認した用途に限定されます。(Microsoft Learn)

管理者が最初に確認すべき設定

Limited Accessの承認状況を確認する

Custom text to speech avatarは、Limited Accessの対象です。申請フォームから登録し、Microsoft管理顧客などの条件や承認済みユースケースに基づいて利用可否が判断されます。申請には組織のメールアドレスを使う必要があり、個人メールでは拒否される可能性があります。(Microsoft Learn)

社内展開前に、次の3点を確認してください。

確認項目判断基準
承認済みかCustom text to speech avatarのLimited Access承認を受けているか
承認用途と合っているか申請時に選択・承認された用途から外れていないか
利用主体が明確かどの部門、どのAzureサブスクリプション、どのプロジェクトで使うか決まっているか

「PoCだから社外公開しない」という理由だけで、同意や承認確認を後回しにするのは危険です。後から公開範囲が広がると、収録済みデータやモデルの利用範囲を再確認する手戻りが発生します。

リージョンとリソース条件を確認する

カスタムアバターの作成には、カスタムアバタートレーニングをサポートするリージョン内のMicrosoft Foundryリソースが必要です。また、Custom Avatarは標準のS0 FoundryまたはSpeechリソースをサポートします。(Microsoft Learn)

既存のAzure AI Speech環境がある場合でも、次を確認してください。

項目確認ポイント
リージョントレーニング対応リージョンか。利用先リージョンにコピーが必要か
リソース種別FoundryまたはSpeechリソースが要件を満たしているか
価格レベルS0で作成されているか
権限Fine-tuning、データアップロード、デプロイ操作を誰が実行できるか
ネットワークBlob Storageからアップロードする場合、取得可能なURLになっているか

Blob Storageからデータをアップロードする場合、ストレージアカウントはパブリックネットワークアクセスを許可し、単純な匿名GETで取得できるURLが必要です。SAS URLなどを使えますが、追加認証やユーザー操作を必要とするURLはサポートされません。(Microsoft Learn)

コスト管理を先に決める

Custom Avatarは、トレーニングとデプロイの両方でコスト管理が必要です。Microsoft Learnでは、カスタムアバターのトレーニングはデータ量により変動し、平均で20〜40コンピュート時間程度かかると説明されています。また、モデルをデプロイすると、そのエンドポイントを使っていない間も継続稼働分の課金が発生します。(Microsoft Learn)

コスト発生ポイント管理方法
トレーニング事前に必要データを絞り、再学習回数を減らす
デプロイ検証用デプロイは期限を決め、未使用時は削除する
Text to speech利用文字数や動画生成回数を見積もる
ストレージ収録データ、生成動画、SAS URLの保存期間を定義する
再作成モデル名やデータ不備による作り直しを防ぐ

検証環境では「作ったまま放置」が最も起きやすい失敗です。検証用のデプロイには、終了日、削除担当、削除確認のチェックリストを用意しておくと安全です。

開発者が確認すべき実装ポイント

モデル名は後から使い回す前提で設計する

カスタムアバターモデルの名前は、SDKやSSML入力でアバター名として指定されます。モデル名には英数字、ハイフン、アンダースコアのみが使え、同じSpeechまたはAI Servicesリソース内で一意である必要があります。(Microsoft Learn)

実装で困らないように、命名規則を先に決めてください。

例:

brandname-avatar-ja-v1
brandname-avatar-en-v1
support-avatar-prod-v1
support-avatar-stg-v1

避けたい命名は、test1、demo-new、tanaka-finalのように、用途・言語・環境・版数が分からない名前です。モデル名がコードやSSMLに入るため、後から整理しようとすると設定変更が広範囲に及びます。

バッチ生成とリアルタイム生成を使い分ける

Text to speech avatarは、非同期のバッチ合成とリアルタイム合成に対応します。動画教材や製品説明動画のように事前生成できるものはバッチ、受付アバターや対話型エージェントのように応答性が必要なものはリアルタイムが候補になります。(Microsoft Learn)

方式向いているケース注意点
バッチ合成研修動画、FAQ動画、ローカライズ済み説明動画生成完了まで待つ設計が必要
リアルタイム合成対話UI、受付、AIエージェント、ライブチャットレイテンシ、接続品質、失敗時の代替応答が重要
Foundry Playground非エンジニアによる試作、表現確認本番運用前に権限・履歴・承認フローを整える
API/SDK自社アプリやWebサービスへの組み込みモデル名、リージョン、認証情報、課金監視を構成管理する

Voice LiveやAPI連携まで含めて検証する

デプロイ後のカスタムアバターは、Microsoft FoundryのText to Speech Avatar、Voice Live、またはAPIから利用できます。Foundryの画面から開く場合はカスタムアバターが選択済みになる導線もあり、ModelsナビゲーションからCustomタブで選ぶこともできます。(Microsoft Learn)

開発者は、画面上で動画が作れたかどうかだけで判断せず、次の観点をテストしてください。

  • APIから同じモデル名で呼び出せるか
  • 開発・検証・本番でリソースやモデル名を取り違えないか
  • 音声合成の言語、声、発音が想定どおりか
  • 生成失敗時にユーザーへ何を返すか
  • 合成動画であることをUI上で明示できるか
  • 監査ログや利用履歴を後から追えるか

移行・展開時の進め方

現時点の公式情報からは、既存のCustom Avatarプロジェクトに対して強制移行や既存APIの破壊的変更が発生するとは読み取れません。そのため、既存利用者は「すぐ置き換える」よりも、「新規作成・追加学習・次期PoCからFoundryポータルの導線を検証する」進め方が現実的です。Microsoft Learn上でも、FoundryポータルでFine-tuningからCustom avatarを開始する手順と、Speech Studio側の手順が併記されています。(Microsoft Learn)

おすすめの展開手順は次の通りです。

ステップ実施内容完了条件
棚卸し既存のSpeechリソース、アバターモデル、デプロイ、利用アプリを一覧化モデル名、リージョン、用途、担当者が分かる
承認確認Limited Access、使用許諾、出演者同意、公開範囲を確認承認済み用途と実利用が一致している
小規模PoC1人の出演者、1用途、1言語でFoundry導線を検証品質、コスト、手順、責任者を評価できる
開発検証API、Voice Live、バッチ生成、失敗時処理を確認本番相当の認証・監視で動作する
ガバナンス審査表示文言、開示、問い合わせ窓口、削除手順を確認公開前チェックリストを通過する
段階展開部門内、限定公開、外部公開の順に広げる利用状況と問題報告を追跡できる

移行で最も避けたいのは、制作チームだけがFoundryポータルで動画を作成し、開発・管理・法務が後から追いかける状態です。生成AIの動画は公開後の影響が大きいため、最初のPoCから承認フローを含めて設計してください。

失敗しやすいポイントと対策

出演者の同意を「撮影許可」だけで済ませてしまう

Custom Avatarでは、出演者の動画を使ってニューラルアバターモデルを作成します。Microsoft Learnでは、出演者から関連法令に基づく十分な同意を取得し、画像や声の利用を認める同意ステートメント動画をアップロードする必要があると説明されています。さらに、同意動画とトレーニング動画内の人物が同一かを確認する仕組みもあります。(Microsoft Learn)

単なる撮影許可では不十分です。少なくとも、次の内容を契約・同意文書で明確にしてください。

項目明確にする内容
利用目的どのサービス、どの動画、どの顧客接点で使うか
利用期間いつまで利用できるか
利用地域国内のみか、海外公開も含むか
声の扱いVoice syncやCustom Neural Voiceを使うか
再学習追加収録やモデル更新に同意が必要か
削除・停止退職、契約終了、本人申し出時の扱い

1つのワークスペースに複数アバターのデータを混ぜる

Microsoft Learnでは、異なるアバターのデータを1つのFine-tuning workspaceに混ぜないよう注意されています。1体のアバターごとに専用のワークスペースを作るのが基本です。(Microsoft Learn)

複数ブランド、複数言語、複数出演者で展開する場合は、最初からプロジェクト構成を分けましょう。後からデータの出どころが分からなくなると、再学習、削除、権利確認のすべてが難しくなります。

収録品質を軽視する

カスタムアバターの品質は、トレーニングに使う動画の品質に大きく左右されます。Microsoftの透明性ノートでは、プロの撮影環境、グリーンスクリーン、明るく均一な照明、高いS/N比の音声が推奨されています。また、話す速度、姿勢、表情、手の動き、俳優の位置、照明の一貫性が自然なアバター作成に重要です。(Microsoft Learn)

PoCでありがちな失敗は、Web会議用カメラや会議室照明で収録してしまうことです。技術検証としては動いても、本番品質に届かず再収録になる可能性があります。公開予定がある場合は、初回から本番に近い撮影条件で試してください。

合成コンテンツであることを表示しない

Text to speech avatarは、AI生成動画であることを示す透明性が重要です。Microsoftの透明性ノートでは、Text to speech avatarがC2PA標準を採用し、アバター出力にはウォーターマークが自動付与されると説明されています。また、ユーザーが実在人物と誤認しないよう、音声・画像・動画の合成性を開示することが求められます。(Microsoft Learn)

実務では、次のような表示を検討できます。

この動画は、本人の許諾に基づいて作成されたAIアバターを使用しています。
この案内は合成音声・合成映像を含みます。内容に関するお問い合わせは〇〇窓口までご連絡ください。

表示を小さく置くだけではなく、公開ページ、動画説明欄、社内ガイドライン、問い合わせ窓口まで含めて設計することが重要です。

どの活用シーンに向いているか

Custom AvatarとCustom Videoは、実在人物らしい表現力が必要な場面で効果を発揮します。ただし、Custom text to speech avatarは承認済み用途に限定されるため、「面白そうだから広告に使う」「有名人風の案内役を作る」といった発想で進めるべきではありません。Microsoftの透明性ノートでは、カスタムアバターの承認済み用途として、公共サービス・情報案内、翻訳・ローカライズなどが示されています。(Microsoft Learn)

検討しやすい例は次の通りです。

活用シーン向いている理由注意点
多言語の案内動画同じ人物イメージで複数言語の案内を作りやすい翻訳品質と発音確認が必要
研修・オンボーディング更新頻度の高い説明を動画化しやすい社内でも合成であることを明示
製品・サービス説明ブランドの案内役を統一できる誇張表現や誤情報のチェックが必要
受付・問い合わせ導線Voice LiveやAPIと組み合わせやすいリアルタイム応答の失敗時設計が必要
公共・施設案内情報伝達の一貫性を保ちやすい承認済み用途との一致を確認

逆に、ニュース報道、政治的主張、本人の意図が誤解されやすい発言、医療・法律・金融など高リスク判断を伴う説明では、合成アバターの利用可否を慎重に検討すべきです。技術的に作れることと、組織として公開してよいことは別です。

管理者・開発者が今すぐやるべきこと

今回のAzure AI Foundry更新は、Custom AvatarとCustom Videoを試しやすくする一方で、組織内の管理項目も増やします。最初にやるべきことは、動画を作ることではなく、利用できる前提を整理することです。

まず、Limited Accessの承認状況、対象サブスクリプション、リージョン、S0リソースを確認してください。次に、出演者の同意、用途、公開範囲、合成であることの表示方法を文書化します。そのうえで、1体のアバター、1つの用途、限定された公開範囲でPoCを行い、品質・コスト・API連携・削除手順まで検証するのが安全です。

開発者は、モデル名、リージョン、エンドポイント、SSML/API呼び出し、バッチ/リアルタイムの使い分けを構成管理に含めてください。管理者は、デプロイの放置課金、Blob Storageの公開設定、SAS URLの扱い、承認済み用途からの逸脱を重点的に監視します。

Azure AI FoundryのCustom AvatarとCustom Videoは、うまく使えば動画制作やAIエージェント体験を大きく変えます。一方で、実在人物の肖像・声・信頼に関わる機能です。小さく試し、権利と説明責任を固め、運用ルールを作ってから広げることが、最も失敗しにくい導入方法です。

この記事を書いた人

実務の現場で詰まりがちなポイントを地図にするITブログ「IT trip」を運営。Windows/Office(Teams・Excel)からSQL、サーバ運用、ガジェットまで、再現性のある手順と“なぜそうなるか”を丁寧に解説します。読んだらすぐ試せること、そして迷った人の次の一歩が見えることを大切にしています。

コメント

コメントする

目次