Azure Databricksの外部データ接続が再整理|2026年6月16日更新の変更点

Azure Databricksの公式ドキュメント「Connect to data sources and external services」は、2026年6月16日に更新されました。結論からいうと、今回の重要点は、外部データソースへの接続方法がUnity Catalog接続を中心に再整理されたことです。

公式ページには、既存接続の停止、強制移行、料金改定、対応期限は記載されていません。そのため、すぐに設定を変更する必要はありません。ただし、読み取り専用ならフェデレーション、継続的な取り込みならLakeflow Connect、書き込みや独自ドライバーが必要ならJDBC接続またはSpark Data Source APIというように、用途ごとの推奨ルートが明確になっています。既存環境では、資格情報をコードやクラスターに直接設定していないかを確認しておくべきです。(Microsoft Learn)

目次

Azureの新機能・変更点:Azure Databricksの外部データ接続はどう変わったか

2026年6月16日版の公式ページでは、Azure Databricksから外部システムへ接続する方法が、次のように分類されています。

接続方法主な用途データ移動読み書き
クエリフェデレーション外部データベースをその場で検索なし読み取り専用
カタログフェデレーション外部カタログ配下のファイルを直接検索原則なし主に読み取り専用
マネージドインジェストSaaSやデータベースからDeltaテーブルへ取り込みありAzure Databricks側へ取り込み
ストリーミングコネクタメッセージバスやイベントデータの継続取り込みあり取り込み
サードパーティ統合ETL、リバースETL、外部製品との連携製品による製品による
Spark Data Source APISparkから外部DBを柔軟に操作クエリによる読み書き
JDBC接続任意のJDBCドライバーによる外部DB接続クエリによる読み書き

これらはすべて同じ接続方式ではありません。データをコピーせず参照する方法、Azure Databricksへ取り込む方法、外部システムへ書き込む方法が明確に分けられています。(Microsoft Learn)

Unity Catalog接続が外部接続の中心になる

Unity Catalogの「接続」は、外部システムのエンドポイント、資格情報、構成パラメーター、所有者などを保持するセキュリティ保護可能なオブジェクトです。

ノートブックやジョブごとにユーザー名やパスワードを設定するのではなく、接続情報をUnity Catalogへ集約できます。権限を持つユーザーは接続を再利用でき、実際の資格情報を接続利用者から隠すことも可能です。(Microsoft Learn)

ただし、次の3種類は用途が異なります。

オブジェクト対象代表的な用途
Unity Catalog接続データベース、SaaS、HTTPサービスなどフェデレーション、JDBC、マネージド取り込み
ストレージ資格情報クラウドオブジェクトストレージAzure Data Lake Storageへのアクセス
サービス資格情報ストレージ以外のクラウドサービス外部クラウドサービスのAPI呼び出し

Azure Data Lake Storageへのアクセスにサービス資格情報を使うなど、用途を取り違えないようにしてください。クラウドストレージにはストレージ資格情報、非ストレージ型クラウドサービスにはサービス資格情報を使用します。(Microsoft Learn)

クエリフェデレーションとカタログフェデレーションが分けて説明された

最新の接続ガイドでは、フェデレーションが「クエリフェデレーション」と「カタログフェデレーション」に分けて整理されています。

クエリフェデレーションは、PostgreSQL、MySQL、SQL Server、Snowflakeなどの外部データベースへJDBC経由でクエリをプッシュダウンします。データを事前に取り込まずに検索できるため、アドホック分析、概念実証、段階的な移行に向いています。一方で、クエリは読み取り専用で、Azure Databricksと接続先データベースの両方で処理が発生します。(Microsoft Learn)

カタログフェデレーションは、Hive MetastoreやSnowflake Horizon Catalogなどの外部カタログをUnity Catalogへ接続します。外部カタログのメタデータを取り込み、実データが置かれているファイルストレージへAzure Databricksから直接アクセスする方式です。クエリ処理はAzure Databricks側で実行されるため、外部データベースの計算リソースを使うクエリフェデレーションとは費用構造が異なります。(Microsoft Learn)

Lakeflow Connectのマネージドインジェストが選択肢として明確になった

外部データを定期的にAzure Databricksへ取り込みたい場合は、Lakeflow Connectのマネージドコネクタが主要な選択肢になります。

Lakeflow Connectでは、SaaS、リレーショナルデータベース、ファイルストレージ、ストリーミングサービスなどからデータを取り込み、Unity Catalogで管理されたテーブルへ保存できます。パイプラインはサーバーレスコンピューティングとLakeflow Spark Declarative Pipelinesを利用します。対応するソースでは、初回に全件を取り込み、その後は変更分だけを処理する増分取り込みが行われます。(Microsoft Learn)

管理者がデータ取り込み画面を使用する場合は、接続とパイプラインを同時に作成できます。一方、管理者以外のユーザーや、API、SDK、Databricks CLI、Declarative Automation Bundlesからパイプラインを作成するユーザーには、管理者が先に接続を作成しておく必要があります。(Microsoft Learn)

「Drivers」ではなくSpark Data Source APIとして整理された

最新の英語版では、従来の一般的な「Drivers」という説明が、より具体的な「Spark Data Source API」に置き換えられています。

Spark Data Source APIは、外部データベースへの読み取りと書き込み、接続先固有のSQL実行、任意のJDBCドライバーやカスタムコネクタの利用が必要な場合に選択します。読み取り専用で済む場合は、細かいアクセス制御が可能なクエリフェデレーションが推奨されています。(Microsoft Learn)

2026年6月19日時点では、日本語版ページの最終更新日は2026年4月19日で、英語版と一部の表現や分類が一致していません。最新仕様を判断するときは、更新日が新しい英語版も確認するのが安全です。(Microsoft Learn)

用途別に選ぶAzure Databricksの接続方法

接続方式は、製品名ではなく「データを動かすか」「書き込みが必要か」で選ぶと判断しやすくなります。

実現したいこと第一候補判断のポイント
ADLS内のファイルやテーブルを管理したいUnity Catalogのストレージ資格情報接続オブジェクトではなく外部ロケーションやボリュームを使用
外部DBを一時的に分析したいクエリフェデレーションデータをコピーせず読み取り専用で検索
外部カタログを段階的に移行したいカタログフェデレーション既存カタログを残したままUnity Catalogで管理
外部データを定期的にDeltaテーブルへ取り込みたいLakeflow Connect増分取り込み、スケジュール、運用管理を重視
外部DBへ書き込みたいJDBC接続またはSpark Data Source APIフェデレーションは原則として書き込み不可
特定バージョンのJDBCドライバーを使いたいJDBC Unity Catalog接続資格情報を集中管理しながら独自ドライバーを利用
MongoDBなどの専用Sparkコネクタを使いたい専用クラスター上のカスタムコネクタクラスターへのライブラリ導入と保守が必要
外部クラウドサービスのAPIを呼びたいサービス資格情報ストレージアクセスには使用しない

「読み取り専用なのに生のJDBC接続を使用する」「定期取り込みなのに毎回フルコピーする」といった構成は、権限管理やコスト、運用負荷が大きくなりやすいため、見直し候補になります。

誰に影響する変更なのか

今回の更新によって、既存環境が自動的に変更されるわけではありません。ただし、次の担当者は接続方式と運用ルールを確認する必要があります。

Azure Databricks管理者

Unity Catalog接続の作成権限、所有者、利用者グループを確認します。特に、管理者以外がLakeflow Connectのパイプラインを作成する環境では、接続を事前作成してUSE CONNECTIONを付与する運用が必要です。

データエンジニア

既存のJDBC処理、ETLジョブ、ストリーミング処理を、フェデレーション、マネージドインジェスト、Spark Data Source APIのどれに分類するか確認します。

セキュリティ担当者

ノートブック、ジョブ、クラスター設定に資格情報が直接書かれていないかを確認します。Unity Catalog接続、ストレージ資格情報、サービス資格情報、Databricks Secretsを用途に応じて使い分けます。

FinOps・コスト管理担当者

Lakeflow Connectのサーバーレス使用量、フェデレーションによる接続先データベースの負荷、ネットワーク転送量を確認します。接続方式を変えると、Azure Databricks側と接続先側のどちらで計算コストが発生するかも変わります。

管理者が行う確認手順

既存のUnity Catalog接続を棚卸しする

Catalog ExplorerのConnections画面、または次のSQLで接続を一覧表示できます。

SHOW CONNECTIONS;

接続ごとの詳細は、次のSQLで確認します。

DESCRIBE CONNECTION <connection-name>;

確認する項目は、接続タイプ、所有者、接続先、利用グループ、使用中のパイプラインや外部カタログです。資格情報そのものだけでなく、接続を作成した個人が退職・異動した場合に備えて、所有者が個人に固定されていないかも確認してください。(Microsoft Learn)

権限を確認する

接続作成には、原則としてメタストア管理者権限またはCREATE CONNECTION権限が必要です。

マネージドインジェストを管理者以外へ許可する場合は、対象の接続に対するUSE CONNECTIONに加え、出力先カタログやスキーマに対する権限も必要です。データベースコネクタでは、構成によってCREATE TABLEやCREATE VOLUMEも必要になります。(Microsoft Learn)

なお、メタストアレベルのUSE CONNECTIONだけでは、個別の接続をパイプラインで使用できない場合があります。実際に使用させる接続オブジェクトへ、明示的に権限を付与してください。(Microsoft Learn)

ネットワーク設定を別途確認する

Unity Catalog接続を作成しても、ネットワーク通信が自動的に許可されるわけではありません。

接続オブジェクトが管理するのは、主に接続先URL、ホスト、ポート、認証情報などです。アウトバウンド通信、ファイアウォール、Private Link、VNetピアリング、サーバーレスの送信制御は、別のネットワーク設定で管理します。(Microsoft Learn)

Lakeflow Connectでクラウドデータベースへ接続する場合はPrivate Linkを利用できる構成があります。オンプレミスのデータベースでは、Azure ExpressRouteなどを含めた経路を確認します。(Microsoft Learn)

接続テストが成功しても、本番データ量でのタイムアウト、帯域不足、接続数制限までは確認できません。少量、通常量、ピーク量の3段階で検証するのが安全です。

既存環境は移行すべきか

公式ページには、既存のJDBC接続や従来型コネクタを廃止する期限は記載されていません。従来の接続方法への案内も引き続き掲載されています。そのため、全接続を一斉に移行するのではなく、リスクが高い構成から段階的に見直します。(Microsoft Learn)

現在の構成見直す理由移行候補
ノートブックにDBパスワードを直接記述漏えい、複製、更新漏れのリスクUnity Catalog接続またはSecrets
読み取り専用処理で生のJDBCを使用権限管理や資格情報管理が分散クエリフェデレーション
独自ジョブで外部DBを定期フルコピーソース負荷と処理時間が増えやすいLakeflow Connect
クラスターごとにドライバーと資格情報を設定コンピューティング変更時の保守負担JDBC Unity Catalog接続
特定クラスターにデータ権限を依存利用可能な計算環境が固定されるUnity Catalogのグループ権限
外部クラウドサービスのキーをコードに記述監査と利用者制御が難しいサービス資格情報

移行時は、既存接続をすぐに削除しないことが重要です。新旧の経路を並行稼働させ、取得件数、データ型、遅延、接続先負荷、料金を比較してから切り替えます。

料金は変わるのか

「Connect to data sources and external services」の更新ページには、新しい料金や価格改定は記載されていません。ただし、選択する接続方式によって、課金される処理の場所が変わります。

接続方式主な料金確認ポイント
クエリフェデレーションAzure Databricksのコンピューティング、接続先DBの計算負荷、データ転送
カタログフェデレーションAzure Databricksのコンピューティング、オブジェクトストレージ、ネットワーク転送
Lakeflow Connectサーバーレスパイプライン、ジョブ、取り込み先ストレージ、接続先サービス
Spark Data Source APIクラスターまたはサーバーレス使用量、外部DB、ネットワーク転送
JDBC接続利用するコンピューティング、外部DBのクエリ負荷、ドライバー運用
サードパーティ統合外部製品の契約料金、Databricks使用量、データ転送

クエリフェデレーションでは、Azure Databricksと外部データベースの両方で処理が行われます。頻繁な全件検索を実行すると、接続先データベースのCPUや同時接続数に影響する可能性があります。定期的に大量データを利用する場合は、Lakeflow Connectで取り込んだ方が低遅延かつ運用しやすいケースがあります。(Microsoft Learn)

Lakeflow Connectはサーバーレスコンピューティングを利用します。Azure Databricks側の利用量は、system.billing.usageシステムテーブルでワークロードやパイプライン単位に確認できます。料金評価では、少なくとも1回は代表的なデータ量で実行し、実測値を取得してください。(Microsoft Learn)

確認しておきたい注意点

JDBC Unity Catalog接続はプレビュー状態を確認する

リンク先の公式情報では、JDBC Unity Catalog接続はDatabricks Runtime 18.1およびDBSQL 2025.40以降を対象としたPublic Previewです。SQLウェアハウスでは、関連するネットワーク機能のプレビュー参加も必要とされています。

本番システムで利用する場合は、サポート条件、対象リージョン、使用するコンピューティング、プレビュー機能の社内利用基準を確認してください。(Microsoft Learn)

フェデレーションは外部DBの負荷をなくす機能ではない

クエリフェデレーションはデータコピーを省けますが、外部データベースにクエリを実行します。BIツールから多数のユーザーが同時に参照すると、接続先のCPU、メモリ、同時実行数に影響します。

概念実証では問題がなくても、本番運用では接続数、タイムアウト、クエリのプッシュダウン範囲を確認する必要があります。

ストリーミングではSecretsが引き続き選択肢になる

ストリーミングソースの標準コネクタでは、資格情報をDatabricks Secretsへ保存する方法が引き続き推奨されています。すべての接続情報を一律にサービス資格情報へ移行するのではなく、コネクタの対応方法に合わせて選択してください。(Microsoft Learn)

ドキュメント更新日をサービス提供開始日と混同しない

2026年6月16日は、この接続ガイドの更新日です。すべての接続機能が同日に一般提供されたことを意味するわけではありません。

コネクタごとに一般提供、Public Preview、Betaなどの提供状態が異なるため、実際に採用する機能の個別ページを確認する必要があります。

まず行うべき対応

今回のAzure Databricksの変更点は、既存環境を直ちに変更するものではなく、外部データ接続の推奨設計を分かりやすく整理したものです。

最初にSHOW CONNECTIONSで既存接続を棚卸しし、次の基準で分類してください。

  • 読み取り専用ならクエリフェデレーションまたはカタログフェデレーション
  • 継続的に取り込むならLakeflow Connect
  • 書き込みや独自ドライバーが必要ならJDBC接続またはSpark Data Source API
  • ADLSへのアクセスならストレージ資格情報
  • ストレージ以外のクラウドサービスならサービス資格情報

その後、権限、ネットワーク経路、資格情報の保管場所、実測コストを非本番環境で確認します。既存方式に廃止期限は示されていないため、一斉移行ではなく、コードに資格情報が残っている接続や、管理が属人化している接続から優先的に改善するのが現実的です。

この記事を書いた人

実務の現場で詰まりがちなポイントを地図にするITブログ「IT trip」を運営。Windows/Office(Teams・Excel)からSQL、サーバ運用、ガジェットまで、再現性のある手順と“なぜそうなるか”を丁寧に解説します。読んだらすぐ試せること、そして迷った人の次の一歩が見えることを大切にしています。

コメント

コメントする

目次