叢集 GPU 總覽

叢集式 GPU 專為人工智慧 (AI) 和機器學習 (ML) 工作負載進行最佳化,可優先處理大規模分散式訓練、多主機推論,以及複雜的高效能運算 (HPC) 工作。

透過叢集 GPU,團隊可使用專用網路結構和同步維護作業,部署及擴充數千個互連加速器,做為單一緊密耦合的系統。這個系列適合需要極致運算、記憶體和高速網路同步處理的工作負載。常見用途包括預先訓練數兆參數的基礎模型、提供前沿模型服務,以及模擬藥物探索。

叢集式 GPU 的主要特性

  • 同步維護: Google Cloud 同時更新叢集中的所有節點,避免單一節點重新啟動導致工作停滯。
  • 自動健康狀態監控:系統會主動找出落後者,並監控硬體故障或無聲資料損毀。
  • 主動更換節點:系統會從備用集區中,將健康狀態良好的機器上效能不佳的 VM 逐出並重新排程。
  • 符合軌道的拓撲:符合軌道的拓撲會將 GPU 對 GPU 的流量與標準主機通訊隔離,確保大規模多節點協調作業的效能不受抖動影響。
  • 進階通訊協定:這些機型系列支援高頻寬互連,包括 GPUDirect RDMA (以 RoCE 為基礎)。

叢集 GPU 系列和技術規格

請參閱下表,瞭解頂級叢集式 GPU 機器系列的規格和工作負載。如要進行百京級訓練,請使用 A4X 或 A3 Ultra 系列。

A4X Max 和 A4X 系列

如果您要訓練大規模的 Exascale 基礎模型,或是執行高度複雜的裸機高效能運算 (HPC) 模擬,請使用 A4X Max 或 A4X 系列機器。這些系列搭載 NVIDIA GB300 Grace Blackwell Ultra Superchip,可滿足極端的運算和記憶體需求。

A4X Max (裸機)

A4X Max 機型使用 NVIDIA GB300 Grace Blackwell Ultra Superchip (nvidia-gb300), 非常適合基礎模型訓練和服務。A4X Max 機型可做為裸機執行個體使用。

A4X Max 是以 NVIDIA GB300 NVL72 為基礎的百京級平台。每部機器都有兩個插槽,搭載 NVIDIA Grace CPU 和 Arm Neoverse V2 核心。這些 CPU 會透過快速晶片對晶片 (NVLink-C2C) 通訊,連線至四個 NVIDIA B300 Blackwell GPU。

已連結 NVIDIA GB300 Grace Blackwell Ultra Superchip
機型 vCPU 數量1 執行個體記憶體 (GB) 附加的本機 SSD (GiB) 實體 NIC 數量 網路頻寬上限 (Gbps)2 GPU 數量 GPU 記憶體3
(GB HBM3e)
a4x-maxgpu-4g-metal 144 960 12,000 6 3,600 4 1,116

1 在其中一個可用的 CPU 平台中,我們會以單一硬體超執行緒的形式提供 vCPU。
2輸出頻寬上限不得超過指定數量。實際輸出頻寬取決於目的地 IP 位址和其他因素。如要進一步瞭解網路頻寬,請參閱「網路頻寬」。
3GPU 記憶體是 GPU 裝置上的記憶體,可用於暫時儲存資料。這與執行個體的記憶體不同,專門用於處理需要高頻寬的繪圖密集型工作負載。

A4X

A4X 機型使用 NVIDIA GB200 Grace Blackwell Superchip (nvidia-gb200), 非常適合基礎模型訓練和部署。

A4X 是以 NVIDIA GB200 NVL72 為基礎的百億級平台。每部機器都有兩個插槽,搭載 NVIDIA Grace CPU 和 Arm Neoverse V2 核心。這些 CPU 會連線至四個 NVIDIA B200 Blackwell GPU,並透過快速晶片對晶片 (NVLink-C2C) 通訊。

已連結 NVIDIA GB200 Grace Blackwell 超級晶片
機型 vCPU 數量1 執行個體記憶體 (GB) 附加的本機 SSD (GiB) 實體 NIC 數量 網路頻寬上限 (Gbps)2 GPU 數量 GPU 記憶體3
(GB HBM3e)
a4x-highgpu-4g 140 884 12,000 6 2,000 4 744

1 在其中一個可用的 CPU 平台中,我們會以單一硬體超執行緒的形式提供 vCPU。
2輸出頻寬上限不得超過指定數量。實際輸出頻寬取決於目的地 IP 位址和其他因素。如要進一步瞭解網路頻寬,請參閱「網路頻寬」。
3GPU 記憶體是 GPU 裝置上的記憶體,可用於暫時儲存資料。這與執行個體的記憶體不同,專門用於處理需要高頻寬的繪圖密集型工作負載。

A4 系列

如要訓練需要大量平行處理規模的頂尖基礎模型,請使用 A4 系列機器,盡量縮短處理時間並提高硬體輸送量。

A4 機型連接NVIDIA B200 Blackwell GPU (nvidia-b200),非常適合基礎模型訓練和部署。

已連結的 NVIDIA B200 Blackwell GPU
機型 vCPU 數量1 執行個體記憶體 (GB) 附加的本機 SSD (GiB) 實體 NIC 數量 網路頻寬上限 (Gbps)2 GPU 數量 GPU 記憶體3
(GB HBM3e)
a4-highgpu-8g 224 3,968 12,000 10 3,600 8 1,440

1 在其中一個可用的 CPU 平台中,我們會以單一硬體超執行緒的形式提供 vCPU。
2輸出頻寬上限不得超過指定數量。實際輸出頻寬取決於目的地 IP 位址和其他因素。如要進一步瞭解網路頻寬,請參閱「網路頻寬」。
3GPU 記憶體是 GPU 裝置上的記憶體,可用於暫時儲存資料。這與執行個體的記憶體不同,專門用於處理需要高頻寬的繪圖密集型工作負載。

A3 系列 (Ultra、Mega 和 High,配備 8 個 GPU)

如需執行大規模分散式訓練,或在多個主機上提供大型資料集表格的尖端模型,請使用 A3 系列機器,盡量縮短主機間的網路延遲時間。

A3 Ultra

已附加的 NVIDIA H200 GPU
機型 vCPU 數量1 執行個體記憶體 (GB) 附加的本機 SSD (GiB) 實體 NIC 數量 網路頻寬上限 (Gbps)2 GPU 數量 GPU 記憶體3
(GB HBM3e)
a3-ultragpu-8g 224 2,952 12,000 10 3,600 8 1128

A3 Mega

附加的 NVIDIA H100 GPU
機型 vCPU 數量1 執行個體記憶體 (GB) 附加的本機 SSD (GiB) 實體 NIC 數量 網路頻寬上限 (Gbps)2 GPU 數量 GPU 記憶體3
(GB HBM3)
a3-megagpu-8g 208 1,872 6,000 9 1,800 8 640

A3 High

附加的 NVIDIA H100 GPU
機型 vCPU 數量1 執行個體記憶體 (GB) 附加的本機 SSD (GiB) 實體 NIC 數量 網路頻寬上限 (Gbps)2 GPU 數量 GPU 記憶體3
(GB HBM3)
a3-highgpu-1g 26 234 750 1 25 1 80
a3-highgpu-2g 52 468 1,500 1 50 2 160
a3-highgpu-4g 104 936 3,000 1 100 4 320
a3-highgpu-8g 208 1,872 6,000 5 1,000 8 640

1 在其中一個可用的 CPU 平台中,我們會以單一硬體超執行緒的形式提供 vCPU。
2輸出頻寬上限不得超過指定數量。實際輸出頻寬取決於目的地 IP 位址和其他因素。如要進一步瞭解網路頻寬,請參閱「網路頻寬」。
3GPU 記憶體是 GPU 裝置上的記憶體,可用於暫時儲存資料。這與執行個體的記憶體不同,專門用於處理需要高頻寬的繪圖密集型工作負載。

取得容量

如要取得叢集式 GPU 的運算容量,需要協調管理高效能加速器的供需。由於這些資源實際位於專用網路架構內,因此您必須透過代管工作流程提出要求。

您可以透過帳戶團隊預留容量,也可以使用未來的預留項目和 Dynamic Workload Scheduler。

後續步驟