デプロイ用のネットワーク サービス

構成するネットワーク サービスは、選択したデプロイ オプション(VM またはクラスタ)とインフラストラクチャによって異なります。

このドキュメントは、AI Hypercomputer デプロイのネットワーク サービスを理解したいアーキテクト、ネットワーク エンジニア、デベロッパーを対象としています。このドキュメントは、クラウド ネットワーキングと分散コンピューティングのコンセプトについて基本的な知識があることを前提としています。デプロイ オプションの詳細については、デプロイ オプションの概要をご覧ください。

ネットワーク アーキテクチャ、プロトコル、ハードウェア トポロジの詳細については、GPU ネットワーキングの概要をご覧ください。

Cluster Toolkit を使用した AI 最適化 GKE デプロイのネットワーキング

Cluster Toolkit を使用して AI 最適化 GKE クラスタを作成すると、ブループリントは次のようにネットワークを構成します。

  • ブループリントでは、メインの GKE クラスタにデフォルトの VPC ネットワークを使用します。
  • 2 つの追加の VPC が作成されます。1 つは 2 つ目のホスト ネットワーク インターフェース カード(NIC)用、もう 1 つは GPU 間リモート ダイレクト メモリ アクセス(RDMA)トラフィック用です。
  • ブループリントは、事前構成された Google 管理のネットワーク プロファイルを GPU トラフィックに使用される VPC に適用します。このプロファイルは、高速で低レイテンシの RDMA パフォーマンスを実現するようにネットワークを自動的に構成します。
  • ブループリントは、アクセラレータ VM 上の各 RDMA NIC に対して、8 つの専用サブネットを RDMA VPC 内に自動的に作成します。
  • クラスタ内のノード間のすべての TCP、UDP、ICMP トラフィックを許可するファイアウォール ルールを構成します。

GKE デプロイのネットワーキング

GKE 設定のネットワーク構成は、ワークロード タイプとインフラストラクチャによって異なります。

  • 汎用 GPU または非分散型ワークロードの場合は、GPUDirect RDMA を使用せずに GKE クラスタを作成します。この構成では、すべての通信に単一の VPC ネットワークを使用します。
  • クラスタ化された GPU または分散ワークロードの場合は、GPUDirect RDMA を有効にして GKE クラスタを作成します。この構成では、汎用トラフィックを高帯域幅の GPU 間通信から分離するマルチ VPC 環境を使用します。

Slurm クラスタ デプロイ向けのネットワーキング

Cluster Toolkit を使用して、A4 シリーズや A3 Ultra シリーズなどのカスタマイズ可能なブループリントを介して AI / ML ワークロードをデプロイします。

クラスタ化された GPU Slurm デプロイのブループリントで構成されるネットワーク コンポーネントは次のとおりです。

  • このブループリントでは、Slurm コントロール プレーン用のプライマリ VPC、一般的なホストレベルのトラフィック用のセカンダリ VPC、GPU 間の通信専用の高性能 VPC の 3 つの個別の VPC が作成されます。
  • GPU データプレーンの場合、ブループリントは RoCE 用に最適化された事前構成済みの Google 管理ネットワーク プロファイルを適用します。
  • このブループリントは、Filestore サービスに必要な専用の IP アドレス範囲を設定します。この範囲は、クラスタの共有 /home ディレクトリを提供します。
  • クラスタノードのカスタム VM イメージのビルド プロセスでのみ使用される、一時的な分離されたイメージビルド VPC を作成します。

Compute Engine インスタンスのネットワーキング

Compute Engine を使用して、スタンドアロン VM、一括コンピューティング インスタンス、マネージド インスタンス グループ(MIG)を作成できます。具体的なネットワーク要件は、マシンタイプのインフラストラクチャ モデルによって異なります。

  • クラスタ化された GPU: これらのマシンシリーズ(A4X Max、A4X、A4、A3 Ultra、A3 Mega、8 個の GPU を備えた A3 High)では、マルチ VPC ネットワーク構成を使用して、一般的なホスト間トラフィックを高帯域幅の GPU 間通信から分離する必要があります。
  • 汎用 GPU: これらのマシンシリーズ(G2、G4、A2、T4 または V100 を搭載した N1)は、すべての通信に gVNIC インターフェースを介した単一 VPC アーキテクチャを使用します。A3 Edge は例外で、4 つのデータ VPC と GPUDirect-TCPX が必要です。

マシンタイプの NIC とネットワーク構成の詳細については、ネットワーキングと GPU マシンをご覧ください。

次のステップ