規劃及建立 AI 基礎架構

本文將摘要說明如何在 AI Hypercomputer 上建立叢集,以執行 AI 工作負載。具體來說,這份文件會引導您完成啟動叢集時的程序,並說明可選擇的項目。除了手動評估,您也可以在 Google Cloud 控制台中提示 Gemini,比較工作負載和預算的用量選項。詳情請參閱「使用 Compute Advisor 設計 AI 基礎架構」。

本文假設您熟悉 AI 和 ML 工作負載的常用術語,例如模型訓練和推論。此外,本文也假設您已找出需要判斷最佳機型和部署容量的特定 AI 工作負載,例如基礎模型預先訓練、微調或推論。

啟動叢集

啟動叢集需要完成下列步驟:

  1. 判斷工作負載並選擇機型
  2. 選擇使用選項並取得容量
  3. 選擇部署選項
  4. 選擇自動調度管理工具
  5. 選擇作業系統和叢集映像檔
  6. 建立叢集
  7. 為工作負載佈建儲存空間

判斷工作負載並選擇機型

為 AI 工作負載選取機型。AI Hypercomputer 支援建立叢集 GPU 和一般 GPU 的叢集。

為協助您選擇,請先判斷工作負載需求,然後比對建議的機型和 GPU 類型:

  • 叢集 GPU:最適合大規模、高效能的工作負載,例如預先訓練基礎模型、微調大型模型,以及跨多個主機進行推論。
  • 一般 GPU:最適合主流推論和服務、檢索增強生成 (RAG),以及符合成本效益的中小型模型訓練和微調。

如要為工作負載選擇建議的機型,請參考下表:

GPU 類型 工作負載或用途 建議的機器類型
叢集 GPU 預先訓練基礎模型,並在多個主機上進行推論 A4X Max (NVIDIA GB300)*A4X (NVIDIA GB200)*
大型模型訓練、微調和推論 A4 (NVIDIA B200)、A3 Ultra (NVIDIA H200 141GB)
主流模型推論和微調 A3 Mega (NVIDIA H100 80GB)、A3 High (NVIDIA H100 80GB)
一般 GPU 高處理量的邊緣服務和推論 A3 Edge (NVIDIA H100 80GB)
高效能單一節點服務和小型微調 A2 (NVIDIA A100)
最具成本效益的入門級推論 G4 (NVIDIA RTX PRO 6000)、N1 (NVIDIA T4 或 V100)
主流推論、RAG 和中小型模型訓練 G2 (NVIDIA L4)

如要瞭解各個機器系列的詳細資訊,請參閱「關於 GPU 加速器」。

選擇用量方案並取得容量

請根據所選機器類型,以及您使用一般 GPU 或叢集 GPU,選擇 GPU 資源的計費方案

一般 GPU 的用量選項

計費方案 適用的裝置 適用情境 如何要求
以量計價 所有一般 GPU 不需要保證容量的工作負載。 建立運算執行個體或叢集,並指定標準佈建模型。如需相關操作說明,請參閱「建立 VM 執行個體」。

提示:如要提高取得一般 GPU 容量的機會,請使用彈性啟動或 Spot。
標準預訂和標準未來預留項目 所有一般 GPU 需要立即確保容量的工作負載 (標準預留項目),或需要確保特定未來日期的容量 (標準未來預留項目)。 建立隨需預留項目或未來預留項目要求。如需操作說明,請參閱「預留容量」。
彈性啟動 所有 GPU 機器類型,但 A4X Max 和 A4X 除外。 需要短期密集叢集 (最長七天) 的工作負載。提供密集資源配置,支援的機型最高可享 53% 折扣,否則適用標準以量計價費率。 使用 Compute Engine、Cluster Director、Cluster Toolkit 或 GKE 建立要求。資源一經啟用 (不會立即啟動),系統就會佈建資源。如需操作說明,請參閱「取得容量」一節。
Spot 所有 GPU 機型,但 A4X Max 和 A4X 除外。 容錯、批次或短期工作負載。提供最高折扣 (61% 至 90%),但運算資源隨時可能遭到搶占。 使用 Spot 佈建模式立即建立執行個體或節點集區。如需操作說明,請參閱「取得容量」一節。

叢集 GPU 的使用選項

計費方案 適用的裝置 適用情境 如何要求
AI Hypercomputer 的未來預留項目 所有叢集式 GPU 和 A3 Edge 機型。 需要長時間穩定性的工作負載,例如預先訓練基礎模型,或在多個主機上進行基礎模型推論。提供密集資源分配,vCPU 和 GPU 最高可享 53% 折扣。 透過 Google 帳戶團隊,要求在未來的開始日期和時間提供容量。
日曆模式的未來預留項目 所有叢集 GPU,A4X Max 和 A4X 除外。 時長固定 (最長 90 天) 且需要穩定性的工作負載,例如預先訓練或微調模型。提供密集資源配置,折扣最高可達 53%。 自行提出未來時段的預留要求; Google Cloud 必須核准要求。如需操作說明,請參閱「預留容量」。
彈性啟動 所有 GPU 機器類型,但 A4X Max 和 A4X 除外。 需要短期密集叢集 (最長七天) 的工作負載。提供密集資源分配,支援的機型最高可享 53% 折扣;否則適用標準以量計價費率。 使用 Compute Engine、Cluster Director、Cluster Toolkit 或 GKE 建立要求。資源一經啟用 (並非立即啟動),系統就會開始佈建。如需操作說明,請參閱「取得容量」一文。
Spot 所有 GPU 機型,但 A4X Max 和 A4X 除外。 容錯、批次或短期工作負載。提供最高折扣 (61% 至 90%),但運算資源隨時可能遭到搶占。 使用 Spot 佈建模式立即建立執行個體或節點集區。如需操作說明,請參閱「取得容量」一節。

選擇部署選項

請根據叢集部署作業所需的控制層級,選擇下列其中一個選項:

高度管理

高度代管的部署選項可自動設定及調度運算、網路和儲存空間資源,減少叢集管理作業的負擔。如要部署及設定基礎架構,請使用 Cluster Director、Cluster Toolkit 或 GKE。

  • Cluster Director:這項Google Cloud 產品可自動執行叢集的複雜設定和配置作業,協助您為叢集設定運算、網路和儲存空間資源,盡可能提升效能並減少停機時間。Cluster Director 專為 IT 管理員和 AI 研究人員設計,可避免管理叢集的額外負擔,讓他們專注於執行工作負載。

  • Cluster Toolkit:Google 提供的開放原始碼工具,可簡化 GKE 或 Compute Engine 的叢集設定和部署作業。您可以使用預先定義的藍圖部署常見設定,例如搭配 Slurm 的 A4 機型。您可以修改藍圖,自訂部署作業和軟體堆疊。

  • GKE: 代管式 Kubernetes 服務和開放原始碼容器自動化調度管理平台。GKE 提供自動調度資源和高可用性等功能。此外,它還能自動化調度管理容器化應用程式、支援專用硬體,並與 Google Cloud生態系統相容,因此非常適合部署及管理 AI 或機器學習工作負載。您可以直接使用 GKE 或 Cluster Toolkit 部署 GKE 叢集。

減少管理,增加控制權

如要更精細地控管叢集和安裝在叢集上的軟體,請使用代管 Compute Engine 執行個體群組 (MIG) 建立 Compute Engine 叢集,或大量建立執行個體。然後在執行個體上,手動安裝所需的任何金鑰軟體。

選擇自動調度管理工具

自動調度管理工具可自動管理叢集。有了協調器,您就不必管理叢集中的每個運算執行個體。自動調度管理工具 (例如 Slurm 或 GKE) 會處理工作佇列、資源分配、自動調度資源 (適用於 GKE) 等工作,以及其他日常叢集管理工作。

  • Slurm:Slurm 是開放原始碼協調器,通常用於 HPC、AI 或 ML 工作負載。如要使用代管 Slurm 服務,可以改用 Cluster Director。如要原生使用 Slurm,可以採用 Cluster Toolkit (提供叢集藍圖,可在叢集上自動安裝 Slurm),或在 Compute Engine 叢集上手動安裝 Slurm。

  • GKE:GKE 是以 Kubernetes 為基礎建構的代管服務,Kubernetes 是一種開放原始碼容器自動化調度管理平台。GKE 能夠自動化調度管理容器化應用程式、支援專用硬體,並在 Google Cloud 生態系統中扮演重要角色,因此非常適合部署及管理 AI 或機器學習工作負載。您可以直接使用 GKE 或 Cluster Toolkit 部署 GKE 叢集。

  • 使用自有的自動調度管理工具:如要使用其他自動調度管理工具,請使用 Compute Engine 叢集。建立 Compute Engine 叢集是 Google Cloud提供的最少管理選項。選擇這項服務表示您要負責設定、維護及更新執行個體。

選擇作業系統映像檔

您應使用的映像檔取決於所用的 GPU 基礎架構 (叢集 GPU 或一般 GPU),以及叢集的部署方式 (GKE、Slurm 或 Compute Engine)。如果是 GKE 叢集,請使用 Container-Optimized OS。如果是 Compute Engine 和 Slurm 叢集,請選取已針對加速器 (例如 GPU) 最佳化的作業系統映像檔。此外,您也可以為工作負載選取深度學習軟體層 (DLSL) 容器映像檔。

如需詳細資訊,請參閱 AI Hypercomputer 圖片

GKE 叢集適用的映像檔

如要建立 GKE 叢集,請使用 Standard 和 Autopilot 模式的預設容器 OS 映像檔。不過,在標準模式中,您也可以選擇使用其他可用的映像檔,例如 Ubuntu。

如果使用 Cluster Toolkit 部署叢集,則只能使用容器 OS 映像檔,因為這些映像檔內建於叢集藍圖。如要進一步瞭解各個節點映像檔,請參閱 GKE 說明文件中的「節點映像檔」。

GKE 也提供深度學習軟體層 (DLSL) 容器映像檔,可安裝 NVIDIA CUDA 和 NCCL 等套件,以及 PyTorch 等機器學習框架,為深度學習工作負載提供即時可用的環境。這些預先建構的 DLSL 容器映像檔經過測試和驗證,可在 GKE 叢集上順暢運作。

Compute Engine 叢集適用的 OS 映像檔

AI Hypercomputer 提供最佳化映像檔,可透過 Compute Engine 執行 AI 和 ML 工作負載。選擇你最熟悉的作業系統:

  • Rocky Linux 9 加速器
  • Rocky Linux 8 加速器
  • Ubuntu 24.04 LTS 加速器
  • Ubuntu 22.04 LTS 加速器

如果您使用 Cluster Toolkit,這些加速器映像檔已與 Cluster Toolkit 藍圖一併封裝,因為 Cluster Toolkit 會建立擴充 Ubuntu LTS Accelerator OS 映像檔的自訂映像檔。

如要進一步瞭解各個 OS 映像檔,請參閱 Compute Engine 說明文件中的「作業系統詳細資料」。

建立叢集

查看叢集建立程序並為工作負載做出初步決策後,請使用下列其中一個選項建立叢集:

為工作負載佈建儲存空間

根據效能、成本和儲存空間架構需求,選擇要佈建的儲存空間服務