Azure AI Foundryのカスタム写真アバター作成がGAに:変更点と管理者の確認ポイント

Azure AI Foundryでブランド独自のアバターを使いたい企業にとって、今回の更新は「申請・個別対応に頼る検証」から「Foundryの画面上で作成フローを進める」方向へ進んだ点が重要です。2026年6月4日に公開または更新されたAzure Updatesでは、Microsoft FoundryのNextGen fine-tuning portalで「Self-serve custom photo avatar creation」が一般提供、つまりGAとして案内されています。GAは本番利用を前提にしたリリース段階ですが、アバターは人物の肖像や合成音声を扱うため、リージョン、権限、同意取得、利用者への開示、課金管理を確認してから展開する必要があります。(Microsoft Azure)

目次

Azure AI Foundryのカスタム写真アバター作成で何が変わったのか

今回の変更点は、Azure AI Foundry、現在の表記ではMicrosoft Foundry上で、カスタム写真アバターの作成をセルフサービス化したことです。対象は、アバター付きの音声エージェントを作る企業や、ブランドの人物像・キャラクターを使った動画コンテンツを作成したい企業です。

Microsoft Learnの手順では、Microsoft Foundryにサインインし、New Foundryを有効にしたうえで、BuildFine-tuneAI ServicesFine-tuneへ進み、モデルとしてAzure Speech - Text to Speech Avatarを選び、種類としてPhoto avatarを選択する流れが示されています。写真は既存画像をアップロードするだけでなく、Foundryに保存済みの画像を再利用したり、AIで作成したキャラクターを使ったりできます。(Microsoft Learn)

従来のカスタムアバターでは、動画収録、同意確認、トレーニング、展開といった準備が重くなりがちでした。カスタム写真アバターは、写真1枚から作成できる点が大きな違いです。ただし、実在人物の写真を使う場合は本人の同意が必要で、同意ステートメントを読み上げた動画の提出と確認が求められます。(Microsoft Learn)

利用者にとってのメリット

Azure AI Foundryのカスタム写真アバターは、単に「顔画像を動かせる機能」ではありません。音声合成、アバター動画生成、リアルタイム対話を組み合わせ、ブランドの顔を持ったAIエージェントや動画コンテンツを作るための部品として考えるべきです。

たとえば、次のような用途で効果が出やすくなります。

  • 製品紹介動画や社内研修動画に、ブランドの案内役を登場させる
  • Webサイトやアプリ上の音声エージェントに、企業独自のアバターを設定する
  • カスタマーサポート、教育、オンボーディングで、毎回同じトーンの説明を提供する
  • 標準アバターではなく、企業・サービスの世界観に合った人物像を使う

Microsoftのドキュメントでは、作成したカスタム写真アバターをFoundry内のVoice Liveでパーソナライズされた音声エージェントに使ったり、Text to Speech Avatarで動画コンテンツ作成に使ったり、API経由で利用したりする導線が案内されています。(Microsoft Learn)

カスタム写真アバター、カスタム動画アバター、標準アバターの使い分け

どの方式を選ぶかは、「ブランド性」「制作コスト」「表現力」「運用リスク」で判断すると失敗しにくくなります。

選択肢向いているケース主な注意点
標準アバターまず機能検証したい、人物の肖像管理を避けたい、短期間でPoCを行いたいブランド独自性は出しにくい
カスタム写真アバター1枚の写真からブランド用アバターを作りたい、音声エージェントや説明動画に使いたい写真品質、本人同意、表示解像度、開示設計を確認する
カスタム動画アバターより高い表現力、全身・動き・収録品質を重視したい収録準備やトレーニング負荷が大きい

Microsoft Learnでは、カスタム動画アバターは開始に10分程度の動画収録が必要で、カスタム写真アバターは写真1枚で作成できると説明されています。また、写真アバターの解像度はバッチ合成・リアルタイム合成のどちらも512×512と示されています。高解像度の人物動画や全身表現を期待して導入すると、要件と合わない可能性があります。(Microsoft Learn)

管理者が最初に確認すべきポイント

管理者は、ポータルに機能が表示されるかどうかだけで判断せず、利用条件、リージョン、データ管理、課金、責任あるAIの観点をセットで確認する必要があります。

確認項目見るべきポイント放置した場合のリスク
利用資格カスタムText to Speech Avatarの利用条件、Limited Accessの扱い、Microsoft管理下の顧客要件本番直前に利用できない、承認済みユースケース外で使ってしまう
リージョンFoundryプロジェクト、Speechリソース、アプリ設定のリージョン整合性認証エラー、機能未表示、データ所在地の誤認
同意取得実在人物の写真利用、同意動画、契約上の利用範囲肖像・声・利用範囲をめぐるトラブル
データ保護トレーニングデータ、生成物、バッチ処理時の保存先削除手順や保管期間が不明確になる
課金TTS利用料、アバター利用、モデル展開時の継続課金使っていないエンドポイントで費用が発生
開示設計AIアバターであることを利用者に明示するUI・文言ユーザーが実在人物と誤認する

特にリージョンは重要です。Azure Speechのキーはリージョンに紐づいており、異なるリージョンのキーを使うと認証エラーになります。また、データはSpeechリソースが作成されたリージョン内で保存・処理されると説明されています。管理者は、アプリの設定値、環境変数、Key Vault内のキー、Foundryプロジェクトのリージョンをまとめて点検してください。(Microsoft Learn)

リージョンとリソース設計の注意点

Azure AI Foundryのプロジェクトを作成できるリージョンと、SpeechのText-to-speech avatar機能を使えるリージョンは必ずしも同じではありません。Microsoft Foundryのリージョン情報では、機能ごとのリージョン差、モデル可用性、クォータ、依存サービスの確認が必要とされています。(Microsoft Learn)

Text-to-speech avatarのリージョン表には、Real-time avatarBatch avatarCustom avatarCustom video avatar trainingCustom photo avatar creationVoice sync for avatarといった列があります。日本向けの検証でありがちな失敗は、「Japan EastにFoundryプロジェクトが作れるから、カスタム写真アバター作成も使えるはず」と考えてしまうことです。機能ごとの対応状況は別途確認し、必要であれば対応リージョンにSpeechまたはAI Servicesリソースを用意する必要があります。(Microsoft Learn)

本番設計では、少なくとも次を確認しておきましょう。

  • 利用予定リージョンでCustom photo avatar creationが有効か
  • Voice LiveやText to Speech Avatarの利用リージョンと一致しているか
  • 本番、検証、開発でリソースを分けるか
  • データ所在地や社内コンプライアンス要件に合うか
  • リージョン別クォータと想定トラフィックに余裕があるか

写真データの準備で失敗しやすいポイント

カスタム写真アバターは写真1枚で始められる一方、どんな画像でも品質よく動くわけではありません。公式手順では、肩から上が写っている画像、顔が正面を向いている画像、顔が隠れていない画像が推奨されています。影が強い写真、アクセサリーやジュエリーが目立つ写真、頭部が一部切れている写真は避けるべきです。また、通常の人間の比率から大きく外れた漫画的な目など、カートゥーン調の特徴はサポート対象外とされています。(Microsoft Learn)

実務では、次のような基準で素材を選ぶと手戻りを減らせます。

画像の条件推奨避けたい例
構図肩から上、正面、顔全体が見える横顔、見切れ、極端な俯瞰・煽り
明るさ顔に均一に光が当たっている片側だけ強い影、逆光、暗い室内
装飾シンプルな服装・髪型大きな帽子、サングラス、派手なアクセサリー
人物性実在または仮想の人間らしい顔極端なデフォルメ、非人間キャラクター
権利使用許諾と利用範囲が明確広報素材を無断転用、退職者の写真を流用

特に企業アバターでは、マーケティング部門が持っている宣材写真をそのまま使いたくなります。しかし、宣材写真の利用許諾が「Web掲載」までで、AIアバター生成や合成動画利用を含んでいないケースがあります。写真の品質だけでなく、契約上の利用範囲も必ず確認してください。

実在人物を使う場合は同意取得を運用フローに組み込む

実在人物の写真からカスタム写真アバターを作る場合、本人の同意は技術的な前提条件であり、法務・人事・広報の確認事項でもあります。公式手順では、対象者が自分の画像利用を認める同意ステートメントを読み上げた動画を提出し、Microsoftが事前定義されたスクリプトとの一致や、動画内の顔と写真が同一人物かを確認すると説明されています。(Microsoft Learn)

Microsoftの責任あるAI関連ドキュメントでは、アバタータレントは自分のアバターモデルがどこで、どのように使われるかを管理できるべきであり、顧客は明示的な書面許可を得る必要があるとされています。契約には、利用期間、利用目的、コンテンツ上の制限などを含めるべきです。(Microsoft Learn)

社内で運用するなら、次のような承認フローを用意すると安全です。

工程担当確認内容
ユースケース申請企画・開発部門どのサービスで、誰に向けて、何を話すか
権利確認法務・広報写真、氏名、声、肖像の利用範囲
同意取得人事・契約担当書面同意、同意動画、利用期間
技術作成開発・AI管理者Foundryでの作成、リージョン、アクセス権
公開前審査セキュリティ・ブランド管理表示文言、AI開示、誤認防止、ログ確認
運用管理サービス責任者削除依頼、利用停止、問い合わせ対応

開示設計は「小さな注記」では不十分

アバターは、音声だけの合成よりも実在人物と誤認されやすい領域です。Microsoftの開示ガイドラインでは、Text to Speech Avatarは自然なリップシンクや表情を伴い、リアルな合成音声と組み合わせると本物の人物動画と見分けにくい場合があるため、すべてのText to Speech Avatar機能に高い開示が必要だと説明されています。(Microsoft Learn)

そのため、フッターに小さく「AIを使用しています」と書くだけでは不十分になりがちです。初回表示時、会話開始時、動画の冒頭、ヘルプ画面など、ユーザーが体験を誤解しないタイミングで明示する必要があります。Microsoftのデザインパターンでは、明示的な開示と暗黙的な手がかりを組み合わせ、体験の最初に示すことが推奨されています。(Microsoft Learn)

実装例としては、次のような文言が考えられます。

この案内役は、当社が作成したAIアバターです。表示される顔と音声は合成技術により生成されています。実在の担当者がリアルタイムで話しているものではありません。

音声エージェントであれば、初回の発話で短く説明する方法も有効です。

こんにちは。私はAIアバターの案内役です。ご質問に自動応答します。

開発者が確認すべき実装ポイント

開発者は、カスタム写真アバターの作成そのものよりも、作成後のアプリ組み込みでつまずきやすくなります。Foundry上でプレビューできても、本番アプリではリージョン、キー、エンドポイント、モデル名、SDK設定、コンテンツポリシーがそろっていないと動作しません。

Microsoft Learnでは、Text to Speech Avatarのサンプルとして、バッチ合成のREST、リアルタイム合成のSDK、Voice Live APIでのアバター利用が案内されています。動画生成なのか、ライブチャットなのかで実装方式が変わるため、最初にユースケースを分けて設計してください。(Microsoft Learn)

実装シーン確認すること
動画を非同期生成するバッチ合成API、保存先、削除手順、処理時間、再生成コスト
リアルタイム対話に使うVoice Live、遅延、セッション管理、ユーザーへの開示
Webアプリに組み込むブラウザ対応、ネットワーク制限、キー管理、CORSやバックエンド経由の呼び出し
複数環境で使う開発・検証・本番のリソース分離、モデル名、設定ファイル管理
監査対象にする生成内容、問い合わせ履歴、利用者への説明、停止手順

また、Azure Speechではリージョン識別子をSDK設定やREST APIエンドポイントに使います。キーはリージョン単位でスコープされるため、japaneastのリソースキーでwestus2向けの処理を呼び出すような構成は避ける必要があります。(Microsoft Learn)

課金と停止手順を事前に決める

アバター機能は、作成できた時点で安心してはいけません。公式ドキュメントでは、アバターのリアルタイムセッションやバッチコンテンツ作成中は、Text to Speechの料金が別途発生すると説明されています。また、カスタムアバターモデルをデプロイすると、エンドポイントの利用有無にかかわらず継続稼働時間に対して課金されるため、不要なデプロイは削除してコストを抑える必要があります。(Microsoft Learn)

管理者は、次のルールを運用開始前に決めておくとよいでしょう。

  • PoC用のアバターは終了日を決めて削除確認する
  • デプロイ済みモデルの棚卸しを月次で行う
  • 使っていないエンドポイントは削除する
  • 部門別にリソースグループやタグを分ける
  • 予算アラートやAzure Cost Managementで利用料を監視する

「検証で作ったアバターをそのまま放置する」ことが、もっとも起こりやすい無駄なコストです。特に複数部門がFoundryを使う組織では、誰が作成し、誰が停止判断をするかまで決めておきましょう。

データ保護と削除の考え方

Text to Speech Avatarでは、入力テキスト、音声、動画、トレーニングデータ、同意動画など、性質の異なるデータが関係します。Microsoftのデータ・プライバシー文書では、顧客のトレーニングデータは顧客のカスタムアバターモデル作成にのみ使われ、MicrosoftのText to Speech Avatarモデルの学習や改善には使われないと説明されています。(Microsoft Learn)

一方で、バッチAPIで使うスクリプトや生成された音声・動画はAzure Storageに保存され、削除APIで削除できるとされています。リアルタイム合成では入力テキストや生成された音声・動画をMicrosoftが保存しないと説明されていますが、アプリ側でログや録画を残す設計にしている場合は、組織側のデータ管理責任が残ります。(Microsoft Learn)

本番導入前に、少なくとも次の整理が必要です。

  • アバター作成に使う写真と同意動画の保管場所
  • 生成した動画の保存期間
  • 利用者との会話ログを残すかどうか
  • 削除依頼を受けた場合の対応手順
  • モデル、デプロイ、ストレージ上の生成物を分けた削除手順
  • 退職者・契約終了者のアバター利用停止フロー

既存環境からの移行・展開で注意すべきこと

今回のGAは、カスタム写真アバター作成をFoundry NextGen fine-tuning portalで扱えるようにする更新です。既存の標準アバターや既存のText to Speech Avatar利用を直ちに置き換えるというより、ブランド用アバターの作成・運用方法を見直すタイミングと捉えるのが現実的です。

既存環境がある場合は、次の順序で確認してください。

順序作業判断基準
現状把握既存のSpeech Studio、Foundry、API利用を棚卸しするどのリソース・リージョン・モデルを使っているか
対象選定カスタム写真アバターに置き換える候補を選ぶ標準アバターではブランド要件を満たせないか
リージョン確認対応リージョンと社内要件を照合するデータ所在地、低遅延、利用可能機能
権利確認実在人物・キャラクター素材の契約を確認するAIアバター生成・動画利用を含むか
小規模検証Foundryで作成し、Voice LiveまたはText to Speech Avatarで試す表情、音声、遅延、ユーザー開示
本番展開API設定、監査、課金監視、停止手順を整える運用担当者が管理できるか

注意したいのは、写真アバターを作れるようになったからといって、すべての用途で動画アバターを置き換えられるわけではない点です。全身の動き、4K相当の動画表現、細かなジェスチャー、服装差分が必要な場合は、カスタム動画アバターや別の制作手段を検討する必要があります。

導入前チェックリスト

Azure AI Foundryのカスタム写真アバターを本番で使う前に、次の項目を確認してください。

  • Microsoft FoundryのNew Foundry環境でFine-tuneの導線を確認した
  • 対象リージョンでText-to-speech avatarとCustom photo avatar creationが利用できる
  • SpeechまたはAI Servicesリソース、キー、エンドポイント、アプリ設定のリージョンが一致している
  • 実在人物を使う場合、書面同意と同意動画を準備した
  • 写真の品質基準を満たしている
  • AIアバターであることを明示するUI・音声・文言を設計した
  • 生成動画、会話ログ、トレーニングデータ、同意データの保存・削除ルールを決めた
  • デプロイ済みモデルの停止・削除手順を運用に入れた
  • PoC、本番、部門別の課金監視を設定した
  • 問い合わせや不適切利用の報告窓口を用意した

まとめ:GA化で使いやすくなったが、管理なしの展開は危険

Azure AI FoundryのSelf-serve custom photo avatar creationのGAは、企業がブランド独自のAIアバターを作りやすくする重要な更新です。特に、アバター付き音声エージェントや説明動画を内製したい組織にとって、Foundry上で作成から利用導線まで確認できる点は大きなメリットです。

一方で、人物の写真、合成音声、動画生成を扱う以上、通常のAIモデル追加よりもガバナンスが重要です。まずは対応リージョンと利用条件を確認し、次に写真素材・同意取得・開示文言・課金停止手順を整えましょう。小規模な検証で品質と運用負荷を見極めてから、本番の音声エージェントやコンテンツ制作に展開するのが安全です。

この記事を書いた人

実務の現場で詰まりがちなポイントを地図にするITブログ「IT trip」を運営。Windows/Office(Teams・Excel)からSQL、サーバ運用、ガジェットまで、再現性のある手順と“なぜそうなるか”を丁寧に解説します。読んだらすぐ試せること、そして迷った人の次の一歩が見えることを大切にしています。

コメント

コメントする

目次