叢集式 GPU 專為人工智慧 (AI) 和機器學習 (ML) 工作負載進行最佳化,可優先處理大規模分散式訓練、多主機推論,以及複雜的高效能運算 (HPC) 工作。
透過叢集 GPU,團隊可使用專用網路結構和同步維護作業,部署及擴充數千個互連加速器,做為單一緊密耦合的系統。這個系列適合需要極致運算、記憶體和高速網路同步處理的工作負載。常見用途包括預先訓練數兆參數的基礎模型、提供前沿模型服務,以及模擬藥物探索。
叢集式 GPU 的主要特性
- 同步維護: Google Cloud 同時更新叢集中的所有節點,避免單一節點重新啟動導致工作停滯。
- 自動健康狀態監控:系統會主動找出落後者,並監控硬體故障或無聲資料損毀。
- 主動更換節點:系統會從備用集區中,將健康狀態良好的機器上效能不佳的 VM 逐出並重新排程。
- 符合軌道的拓撲:符合軌道的拓撲會將 GPU 對 GPU 的流量與標準主機通訊隔離,確保大規模多節點協調作業的效能不受抖動影響。
- 進階通訊協定:這些機型系列支援高頻寬互連,包括 GPUDirect RDMA (以 RoCE 為基礎)。
叢集 GPU 系列和技術規格
請參閱下表,瞭解頂級叢集式 GPU 機器系列的規格和工作負載。如要進行百京級訓練,請使用 A4X 或 A3 Ultra 系列。
A4X Max 和 A4X 系列
如果您要訓練大規模的 Exascale 基礎模型,或是執行高度複雜的裸機高效能運算 (HPC) 模擬,請使用 A4X Max 或 A4X 系列機器。這些系列搭載 NVIDIA GB300 Grace Blackwell Ultra Superchip,可滿足極端的運算和記憶體需求。
A4X Max (裸機)
A4X Max
機型使用 NVIDIA GB300 Grace Blackwell Ultra Superchip (nvidia-gb300),
非常適合基礎模型訓練和服務。A4X Max 機型可做為裸機執行個體使用。
A4X Max 是以 NVIDIA GB300 NVL72 為基礎的百京級平台。每部機器都有兩個插槽,搭載 NVIDIA Grace CPU 和 Arm Neoverse V2 核心。這些 CPU 會透過快速晶片對晶片 (NVLink-C2C) 通訊,連線至四個 NVIDIA B300 Blackwell GPU。
| 已連結 NVIDIA GB300 Grace Blackwell Ultra Superchip | |||||||
|---|---|---|---|---|---|---|---|
| 機型 | vCPU 數量1 | 執行個體記憶體 (GB) | 附加的本機 SSD (GiB) | 實體 NIC 數量 | 網路頻寬上限 (Gbps)2 | GPU 數量 | GPU 記憶體3 (GB HBM3e) |
a4x-maxgpu-4g-metal |
144 | 960 | 12,000 | 6 | 3,600 | 4 | 1,116 |
1 在其中一個可用的 CPU 平台中,我們會以單一硬體超執行緒的形式提供 vCPU。
2輸出頻寬上限不得超過指定數量。實際輸出頻寬取決於目的地 IP 位址和其他因素。如要進一步瞭解網路頻寬,請參閱「網路頻寬」。
3GPU 記憶體是 GPU 裝置上的記憶體,可用於暫時儲存資料。這與執行個體的記憶體不同,專門用於處理需要高頻寬的繪圖密集型工作負載。
A4X
A4X
機型使用 NVIDIA GB200 Grace Blackwell Superchip (nvidia-gb200),
非常適合基礎模型訓練和部署。
A4X 是以 NVIDIA GB200 NVL72 為基礎的百億級平台。每部機器都有兩個插槽,搭載 NVIDIA Grace CPU 和 Arm Neoverse V2 核心。這些 CPU 會連線至四個 NVIDIA B200 Blackwell GPU,並透過快速晶片對晶片 (NVLink-C2C) 通訊。
| 已連結 NVIDIA GB200 Grace Blackwell 超級晶片 | |||||||
|---|---|---|---|---|---|---|---|
| 機型 | vCPU 數量1 | 執行個體記憶體 (GB) | 附加的本機 SSD (GiB) | 實體 NIC 數量 | 網路頻寬上限 (Gbps)2 | GPU 數量 | GPU 記憶體3 (GB HBM3e) |
a4x-highgpu-4g |
140 | 884 | 12,000 | 6 | 2,000 | 4 | 744 |
1 在其中一個可用的 CPU 平台中,我們會以單一硬體超執行緒的形式提供 vCPU。
2輸出頻寬上限不得超過指定數量。實際輸出頻寬取決於目的地 IP 位址和其他因素。如要進一步瞭解網路頻寬,請參閱「網路頻寬」。
3GPU 記憶體是 GPU 裝置上的記憶體,可用於暫時儲存資料。這與執行個體的記憶體不同,專門用於處理需要高頻寬的繪圖密集型工作負載。
A4 系列
如要訓練需要大量平行處理規模的頂尖基礎模型,請使用 A4 系列機器,盡量縮短處理時間並提高硬體輸送量。
A4
機型連接NVIDIA B200 Blackwell GPU
(nvidia-b200),非常適合基礎模型訓練和部署。
| 已連結的 NVIDIA B200 Blackwell GPU | |||||||
|---|---|---|---|---|---|---|---|
| 機型 | vCPU 數量1 | 執行個體記憶體 (GB) | 附加的本機 SSD (GiB) | 實體 NIC 數量 | 網路頻寬上限 (Gbps)2 | GPU 數量 | GPU 記憶體3 (GB HBM3e) |
a4-highgpu-8g |
224 | 3,968 | 12,000 | 10 | 3,600 | 8 | 1,440 |
1 在其中一個可用的 CPU 平台中,我們會以單一硬體超執行緒的形式提供 vCPU。
2輸出頻寬上限不得超過指定數量。實際輸出頻寬取決於目的地 IP 位址和其他因素。如要進一步瞭解網路頻寬,請參閱「網路頻寬」。
3GPU 記憶體是 GPU 裝置上的記憶體,可用於暫時儲存資料。這與執行個體的記憶體不同,專門用於處理需要高頻寬的繪圖密集型工作負載。
A3 系列 (Ultra、Mega 和 High,配備 8 個 GPU)
如需執行大規模分散式訓練,或在多個主機上提供大型資料集表格的尖端模型,請使用 A3 系列機器,盡量縮短主機間的網路延遲時間。
A3 Ultra
| 已附加的 NVIDIA H200 GPU | |||||||
|---|---|---|---|---|---|---|---|
| 機型 | vCPU 數量1 | 執行個體記憶體 (GB) | 附加的本機 SSD (GiB) | 實體 NIC 數量 | 網路頻寬上限 (Gbps)2 | GPU 數量 | GPU 記憶體3 (GB HBM3e) |
a3-ultragpu-8g |
224 | 2,952 | 12,000 | 10 | 3,600 | 8 | 1128 |
A3 Mega
| 附加的 NVIDIA H100 GPU | |||||||
|---|---|---|---|---|---|---|---|
| 機型 | vCPU 數量1 | 執行個體記憶體 (GB) | 附加的本機 SSD (GiB) | 實體 NIC 數量 | 網路頻寬上限 (Gbps)2 | GPU 數量 | GPU 記憶體3 (GB HBM3) |
a3-megagpu-8g |
208 | 1,872 | 6,000 | 9 | 1,800 | 8 | 640 |
A3 High
| 附加的 NVIDIA H100 GPU | |||||||
|---|---|---|---|---|---|---|---|
| 機型 | vCPU 數量1 | 執行個體記憶體 (GB) | 附加的本機 SSD (GiB) | 實體 NIC 數量 | 網路頻寬上限 (Gbps)2 | GPU 數量 | GPU 記憶體3 (GB HBM3) |
a3-highgpu-1g |
26 | 234 | 750 | 1 | 25 | 1 | 80 |
a3-highgpu-2g |
52 | 468 | 1,500 | 1 | 50 | 2 | 160 |
a3-highgpu-4g |
104 | 936 | 3,000 | 1 | 100 | 4 | 320 |
a3-highgpu-8g |
208 | 1,872 | 6,000 | 5 | 1,000 | 8 | 640 |
1 在其中一個可用的 CPU 平台中,我們會以單一硬體超執行緒的形式提供 vCPU。
2輸出頻寬上限不得超過指定數量。實際輸出頻寬取決於目的地 IP 位址和其他因素。如要進一步瞭解網路頻寬,請參閱「網路頻寬」。
3GPU 記憶體是 GPU 裝置上的記憶體,可用於暫時儲存資料。這與執行個體的記憶體不同,專門用於處理需要高頻寬的繪圖密集型工作負載。
取得容量
如要取得叢集式 GPU 的運算容量,需要協調管理高效能加速器的供需。由於這些資源實際位於專用網路架構內,因此您必須透過代管工作流程提出要求。
您可以透過帳戶團隊預留容量,也可以使用未來的預留項目和 Dynamic Workload Scheduler。
後續步驟
- 如要瞭解如何取得容量,請參閱「用量方案」。
- 如要評估基礎架構需求,請參閱「選擇基礎架構」。
- 如要規劃網路拓撲,請參閱「叢集環境的 GPU 網路需求」。
- 如要預留運算資源,請參閱「預留容量」。