如要有效率地執行人工智慧 (AI) 或機器學習 (ML) 工作負載,您必須同時選取工作負載協調器和部署平台。這些元件的運作方式如下:
自動調度管理工具會排定及執行工作。
部署選項會管理自動調度管理工具。
找出要用於執行工作負載的 GPU 基礎架構 (叢集 GPU 或一般 GPU) 後,請按照本文的指引,找出最適合工作負載和管理層級的協調器和部署作業。
如要查看可用於執行工作負載的 GPU 機器類型,請參閱「GPU 機器」。
比較自動化調度管理工具和部署選項
AI Hypercomputer 提供多種協調器和部署選項,適用於運算執行個體。這些選項包括全代管叢集 (可讓您專注於工作負載),以及自助式管理環境 (可精細控管運算執行個體的維護和更新方式)。
下表比較執行 AI 工作負載時可用的協調器和部署選項:
| 產品 | 自動調度管理工具 | 技術複雜度 | 適用對象 | 主要優點 |
|---|---|---|---|---|
| Cluster Director | Slurm | 低 | AI 研究人員、資料科學家 | 代管 Slurm 叢集的生命週期 |
| Google Kubernetes Engine (GKE) | Kubernetes | 中至高 | 機器學習工程師、平台工程師 | 容器自動化調度管理和資源調度 |
| Cluster Toolkit | Slurm、Kubernetes | 中 | ML dZevOps、平台工程師 | 經過驗證的基礎架構即程式碼藍圖 |
| Compute Engine | 自訂 / 無 | 高 | 基礎架構架構師 | 精細控管作業系統和網路 |
選擇自動調度管理工具和部署選項
如要選擇自動調度管理工具和部署選項,請使用下列流程圖:
上述流程圖會詢問下列問題:
您是否要為工作負載進行叢集自動化調度管理?
- 是:請前往問題 2。
- 否:使用 Compute Engine。
您是否要執行標準容器化應用程式?
- 是:使用 GKE。
- 否:請前往問題 3。
要讓 Google 管理叢集生命週期嗎?
- 是:使用 Cluster Director。
- 否:使用 Cluster Toolkit。
支援的自動調度管理工具
自動調度管理工具可自動管理叢集,不必個別管理每個運算執行個體。Slurm 或 Kubernetes 等自動調度管理工具會處理工作排隊、資源分配和自動調整大小。
Slurm:開放原始碼自動化調度管理工具,常用於 AI、機器學習和 HPC 工作負載。您可以搭配使用 Slurm 與 Cluster Toolkit 或 Cluster Director。
Kubernetes:開放原始碼容器自動化調度管理平台。您可以直接使用 GKE 或透過 Cluster Toolkit 部署 Kubernetes。
自訂或無:如果您偏好其他協調器,或想管理運算執行個體但不想使用協調器,請使用 Compute Engine。這個選項可提供最高等級的控制權,但您必須手動設定、維護及更新運算執行個體。
支援的部署平台
找出適合您用途的建議協調器和部署選項後,請詳閱下方的說明,確認其管理層級和功能符合工作負載需求。
代管和自動化平台
如要避免管理叢集的開銷,專心執行工作負載,請使用下列任一代管平台:
Cluster Director:全代管服務,可自動執行 Slurm 叢集的生命週期。使用 Cluster Director 簡化 Slurm 叢集的設定和配置作業。Cluster Director 會自動執行叢集的生命週期,讓您專注於執行 AI、機器學習或 HPC 工作負載。詳情請參閱「 Cluster Director 總覽」。
GKE:代管型 Kubernetes 環境,專為 AI 和機器學習工作負載最佳化。使用 GKE 協調容器化工作負載、整合專用 Compute Engine 硬體,以及運用 Topology Aware Scheduling (TAS) 等 GKE 專屬功能。詳情請參閱 GKE 總覽。
半代管和自行管理的平台
如需精細控管作業系統、核心設定或驅動程式版本,請使用半代管或自行管理的平台:
Cluster Toolkit:開放原始碼工具包,提供經過驗證且可自訂的藍圖,用於部署可重現的 AI 和 ML 環境。並運用基礎架構即程式碼 (IaC) 原則,提供高度彈性和控制權。詳情請參閱 Cluster Toolkit 總覽。
Compute Engine:可自訂的運算服務,提供最大程度的控制權,讓您從頭開始建構自訂環境。雖然 Compute Engine 並非獨立的自動調度管理工具,但對於偏好建構及管理專屬自訂堆疊的使用者來說,Compute Engine 是基礎。詳情請參閱 Compute Engine 總覽。