Tentang opsi penggunaan akselerator untuk workload AI/ML di GKE

Halaman ini menjelaskan teknik yang tersedia yang dapat Anda gunakan untuk mendapatkan akselerator komputasi, seperti GPU atau TPU, berdasarkan persyaratan workload AI/ML Anda. Teknik ini disebut opsi pemakaian akselerator di GKE. Memahami berbagai opsi pemakaian membantu Anda mengoptimalkan penggunaan resource untuk menghindari penggunaan resource yang kurang optimal, meningkatkan kemungkinan mendapatkan resource, dan menyeimbangkan biaya dan performa.

Halaman ini ditujukan untuk admin dan operator Platform yang berkoordinasi dengan engineer Machine Learning (ML) untuk mendapatkan resource yang diperlukan agar berhasil men-deploy workload AI/ML.

Untuk mempelajari lebih lanjut peran umum dan contoh tugas yang kami referensikan dalam Google Cloud konten, lihat Peran dan tugas pengguna GKE umum.

Memahami opsi pemakaian

Anda dapat memilih dari opsi berikut untuk menggunakan akselerator di GKE:

  • Sesuai permintaan: Anda menggunakan TPU atau GPU di GKE tanpa mengatur kapasitas terlebih dahulu. Sebelum meminta resource, Anda harus memiliki kuota sesuai permintaan yang cukup untuk jenis dan jumlah akselerator tertentu. Sesuai permintaan adalah opsi pemakaian yang paling fleksibel; namun, tidak ada jaminan bahwa resource sesuai permintaan yang cukup akan tersedia untuk memenuhi permintaan Anda.
  • Pemesanan: Anda memesan resource untuk jangka waktu tertentu. Pemesanan dapat berupa salah satu hal berikut:
    • Pemesanan untuk masa mendatang: Anda memesan resource untuk durasi yang biasanya lebih lama untuk waktu tertentu di masa mendatang. Anda memiliki akses eksklusif ke resource yang dipesan selama jangka waktu tersebut. Pemesanan untuk masa mendatang memerlukan interaksi dengan Manajer Akun Teknis (TAM). Untuk mengetahui informasi selengkapnya, lihat TPU dan GPU.
    • Pemesanan untuk masa mendatang hingga 90 hari (dalam mode kalender): Anda meminta kapasitas untuk jangka waktu tertentu, dengan penasihat kalender yang menyarankan tanggal yang tersedia. Pemesanan untuk masa mendatang hingga 90 hari (dalam mode kalender) menawarkan fleksibilitas yang lebih besar untuk durasi yang lebih singkat dan penelusuran kapasitas layanan mandiri. Untuk mengetahui informasi selengkapnya, lihat Permintaan pemesanan untuk masa mendatang dalam mode kalender.
    • Pemesanan on-demand: Anda dapat meminta pemesanan on-demand untuk disediakan segera setelah kapasitas tersedia, mirip dengan opsi on-demand. Saat pemesanan aktif, Anda membayar resource, baik Anda menggunakannya atau tidak.
  • Flex-start: Anda mengamankan resource yang dialokasikan secara padat untuk workload berdurasi singkat tanpa pemesanan. Anda meminta jumlah GPU atau TPU tertentu, dan Compute Engine akan menyediakannya saat kapasitas tersedia. GPU atau TPU berjalan tanpa gangguan hingga tujuh hari. Untuk mengetahui informasi selengkapnya, lihat penyediaan flex-start.
  • Spot: Anda menyediakan Spot VM, yang memungkinkan Anda mendapatkan diskon signifikan, tetapi Spot VM dapat dihentikan kapan saja, dengan peringatan 30 detik. Untuk mengetahui informasi selengkapnya, lihat Spot VM.

Untuk mengoptimalkan keberhasilan penyediaan di bawah batasan resource komputasi, Anda dapat mengatur opsi ini menggunakan ComputeClasses.

Memahami kuota akselerator di GKE

Kuota dan batas sistem membatasi penggunaan Google Cloud resource Anda untuk mendukung ketersediaan resource bagi semua Google Cloud pengguna. Kuota memiliki nilai default, tetapi biasanya Anda dapat meminta penyesuaian. Batas sistem adalah nilai tetap yang tidak dapat diubah. Secara default, project umumnya tidak dilengkapi dengan kuota akselerator yang signifikan. Anda harus meminta dan menerima persetujuan untuk kuota untuk jenis dan region akselerator tertentu.

Pertimbangkan karakteristik berikut saat mengelola kuota yang dibutuhkan workload Anda:

  • Anda harus meminta kuota yang diperlukan untuk setiap opsi pemakaian. Untuk mengidentifikasi kuota yang diperlukan untuk setiap opsi pemakaian, lihat parameter "Kuota" yang sesuai yang tercantum dalam tabel memilih opsi pemakaian. Jika kuota tidak mencukupi, upaya untuk membuat cluster, node pool, atau men-deploy workload yang memerlukan akselerator akan gagal dengan error Quota exceeded.

  • Anda harus meminta kuota saat menggunakan ComputeClasses kustom di Autopilot. Node yang disediakan untuk memenuhi persyaratan ComputeClass masih menggunakan kuota project Anda untuk akselerator yang ditentukan.

  • Google Cloud Akun Uji Coba Gratis memiliki batasan untuk meminta penambahan kuota untuk resource bernilai tinggi seperti GPU dan TPU. Untuk memiliki akses ke kuota akselerator, upgrade ke akun berbayar.

Untuk memeriksa dan meminta kuota, buka halaman Kuota di Google Cloud konsol. Anda dapat memfilter kuota akselerator dan meminta penambahan.

Mengidentifikasi opsi pemakaian

Gunakan pertimbangan berikut untuk memilih opsi pemakaian terbaik untuk workload AI/ML Anda:

  • Jenis workload: pertimbangkan jenis workload yang ingin Anda terapkan. Persyaratan GKE bervariasi jika Anda menjalankan workload pelatihan atau inferensi:
    • Pelatihan: memerlukan resource berperforma tinggi dengan memori yang signifikan. Workload pelatihan biasanya memiliki masa pakai yang ditentukan dengan baik. Workload ini umumnya lebih mudah direncanakan karena tidak terlalu rentan terhadap lonjakan mendadak dalam penggunaan resource.
    • Inferensi: biasanya memerlukan akselerator yang dioptimalkan untuk skalabilitas dan biaya yang lebih rendah. Workload inferensi dapat memerlukan memori akselerator yang signifikan selama lonjakan mendadak dalam penggunaan resource.
  • Masa pakai berdasarkan fase penerapan: pertimbangkan sasaran bisnis Anda jika Anda menjalankan Proof of Concept (POC), evaluasi platform, pengembangan atau pengujian aplikasi, produksi, atau pengoptimalan.
  • Waktu untuk menyediakan: tentukan apakah workload Anda memerlukan eksekusi segera atau dapat dijalankan di masa mendatang. Jika eksekusi di masa mendatang memungkinkan, tentukan seberapa fleksibel waktu mulainya.
  • Keseimbangan antara biaya dan performa: evaluasi persyaratan performa workload dan batasan anggaran Anda untuk memilih akselerator yang paling hemat biaya. Pertimbangkan konsekuensi antara biaya akselerator dan karakteristik performanya. Ingatlah bahwa akselerator baru mungkin memberikan rasio biaya-performa yang lebih baik.

Memilih opsi pemakaian

Gunakan tabel berikut untuk memilih opsi pemakaian:

Opsi pemakaian Parameter penyediaan Akselerator yang didukung Detail Contoh workload
Pemesanan sesuai permintaan
  • Waktu untuk menyediakan: Segera (dengan pemesanan yang disetujui)
  • Masa pakai: Jangka panjang (per pemesanan)
  • GPU apa pun (kecuali A4X, A4, atau A3 Ultra)
  • TPU apa pun
  • Biaya: Anda akan dikenai biaya untuk seluruh periode pemesanan.
  • Kuota: kuota akan otomatis ditingkatkan sebelum kapasitas dikirimkan.
  • Workload berskala besar dan berjalan lama seperti model dasar pra-pelatihan atau inferensi multi-host.
  • Workload produksi.
Pemesanan untuk masa mendatang
  • Waktu untuk menyediakan: Segera (dengan pemesanan yang disetujui)
  • Masa pakai: Jangka panjang (per pemesanan)
  • G2
  • A2
  • A3 Tinggi dengan 8 GPU
  • A3 Mega
  • A3 Edge
  • Biaya: Anda akan dikenai biaya untuk seluruh periode pemesanan.
  • Kuota: kuota akan otomatis ditingkatkan sebelum kapasitas dikirimkan.
  • Workload berskala besar dan berjalan lama seperti model dasar pra-pelatihan atau inferensi multi-host.
  • Workload produksi.
Pemesanan untuk masa mendatang hingga 90 hari (dalam mode kalender)
  • Waktu untuk menyediakan: Segera (dengan pemesanan yang disetujui)
  • Masa pakai: Hingga 90 hari
  • A4
  • A3 Ultra
  • A3 Mega
  • A3 Tinggi dengan 8 GPU
  • A3 Edge
  • Ironwood (TPU7x)
  • TPU v6e
  • TPU v5p
  • TPU v5e
  • Biaya: diskon (hingga 53%). Anda akan dikenai biaya untuk periode pemesanan.
  • Kuota: tidak ada kuota yang dikenai biaya.
  • Workload terdistribusi berjangka pendek seperti fine-tuning model, simulasi, atau inferensi batch, yang memerlukan waktu mulai yang tepat.
  • Workload untuk evaluasi platform, benchmarking, atau pengujian pengoptimalan.
Mode penyediaan Flex-start
  • Waktu untuk menyediakan: Sesuai permintaan (bergantung pada ketersediaan)
  • Masa pakai: Hingga 7 hari per alokasi
  • Semua kelompok GPU kecuali A4X
  • Semua versi TPU
  • Workload batch seperti pelatihan model kecil, fine-tuning, atau inferensi yang dapat diskalakan dengan waktu mulai yang fleksibel.
  • Workload untuk POC atau pengujian integrasi.
Spot VM
  • Waktu untuk menyediakan: Sesuai permintaan (bergantung pada ketersediaan)
  • Masa pakai: Variabel, dapat dihentikan dengan peringatan 30 detik
  • Semua kelompok GPU kecuali A4X
  • Semua versi TPU
  • Workload fault-tolerant dengan prioritas lebih rendah seperti CI/CD, analisis data, atau komputasi berperforma tinggi (HPC).
  • Workload yang sangat mudah terganggu.
Sesuai permintaan (GPU atau TPU)
  • Waktu untuk menyediakan: Segera (bergantung pada ketersediaan)
  • Masa pakai: Tidak ada batasan
  • Semua kelompok GPU kecuali A4X, A4, atau A3 Ultra
  • Semua versi TPU
  • Biaya: Anda membayar sesuai penggunaan.
  • Kuota: Kuota sesuai permintaan GPU atau TPU akan dikenai biaya.
  • Workload tujuan umum yang memerlukan eksekusi segera.

Mengoptimalkan biaya dan penyediaan workload dengan ComputeClasses

Anda dapat menggunakan ComputeClasses untuk mengelola dan mengotomatiskan strategi penggunaan akselerator secara dinamis dengan menentukan daftar konfigurasi penggantian berbasis prioritas. Selama operasi penskalaan, GKE mencoba menyediakan node sesuai dengan hierarki prioritas yang Anda tetapkan.

Daftar berikut menjelaskan opsi pemakaian yang tersedia dengan ComputeClasses dan cara mengonfigurasinya. Untuk mengetahui manifes YAML lengkap, lihat Contoh opsi pemakaian dengan ComputeClasses.

  • Pemesanan: Anda dapat menentukan nama pemesanan di reservations kolom di ComputeClass. Hal ini memastikan bahwa GKE pertama-tama mencoba menggunakan kapasitas yang dipesan sebelum kembali.
  • Mode penyediaan Flex-start: aktifkan antrean fleksibel menggunakan kolom flexStart di ComputeClass, dan konfigurasi durasi penggantian node penggantian menggunakan kolom nodeRecycling.
  • Spot VM: instruksikan GKE untuk menggunakan Spot VM saat menyediakan node untuk aturan prioritas tersebut dengan menetapkan spot kolom ke true.
  • Kapasitas sesuai permintaan yang dikombinasikan dengan kebijakan lokasi multi-zona: Deklarasikan konfigurasi mesin standar dalam daftar prioritas dan konfigurasi strategi lokasi penggantian menggunakan location kolom.

ComputeClasses tidak mendukung Pemesanan untuk masa mendatang atau Pemesanan untuk masa mendatang hingga 90 hari (dalam mode kalender).

Contoh opsi pemakaian dengan ComputeClasses

Bagian berikut memberikan contoh konfigurasi untuk strategi ini.

Pemesanan dengan konfigurasi penggantian

Konfigurasi ini paling cocok untuk workload yang dapat mentoleransi gangguan, bukan workload yang bergantung pada data persisten atau perlu dijalankan hingga selesai.

Konfigurasi ini menetapkan strategi penggantian yang tangguh menggunakan langkah-langkah berikut:

  1. Gunakan pemesanan terlebih dahulu: GKE mencoba menyediakan node menggunakan pemesanan kapasitas khusus yang telah Anda beli.
  2. Kembali ke Flex-start: Jika kapasitas pemesanan digunakan sepenuhnya, GKE akan kembali ke resource flex-start berdurasi singkat dan diskon.
  3. Kembali ke Sesuai permintaan: Sebagai penggantian terakhir, GKE menyediakan resource sesuai permintaan standar.
  4. Migrasikan kembali ke pemesanan: Mengaktifkan migrasi aktif menginstruksikan GKE untuk otomatis mengonsolidasikan dan memigrasikan workload kembali ke node pemesanan yang diprioritaskan lebih tinggi segera setelah kapasitas tersedia. Migrasi ini dapat mengganggu.

    apiVersion: cloud.google.com/v1
    kind: ComputeClass
    metadata:
      name: ha-gpu-fallback
    spec:
      activeMigration:
        optimizeRulePriority: true # Migrate workloads back to reservation when capacity releases
      priorities:
      # Priority 1: Consume specific corporate reservation first
      - gpu:
          type: nvidia-l4
          count: 1
        reservations:
          affinity: Specific
          specific:
          - name: reserved-l4-pool
            project: my-project
            zones: [us-central1-a]
      # Priority 2: Fallback to Flex Start (short-duration allocation)
      - gpu:
          type: nvidia-l4
          count: 1
        flexStart:
          enabled: true
      # Priority 3: Fallback to On-demand resources
      - gpu:
          type: nvidia-l4
          count: 1
    

Mode penyediaan Flex-start dengan konfigurasi daur ulang node

Konfigurasi ini mengelola kapasitas berdurasi singkat dan diskon dengan waktu aktif berkelanjutan menggunakan langkah-langkah berikut:

  1. Minta VM Flex-start: GKE meminta instance VM dari antrean flex-start (yang berjalan tanpa gangguan hingga tujuh hari).
  2. Pantau masa berlaku sewa: GKE melacak durasi node flex-start aktif yang tersisa.
  3. Aktifkan daur ulang node: Dua puluh menit (1.200 detik) sebelum masa berlaku sewa VM berakhir, GKE akan otomatis menyediakan node pengganti.
  4. Jadwalkan ulang workload: Workload dimigrasikan ke node baru, dan melanjutkan eksekusi tanpa gangguan layanan.

    apiVersion: cloud.google.com/v1
    kind: ComputeClass
    metadata:
      name: flex-node-recycling
    spec:
      priorities:
      - gpu:
          type: nvidia-l4
          count: 1
        flexStart:
          enabled: true
          nodeRecycling:
            leadTimeSeconds: 1200 # Automatically launch replacement node before VM lease expires
    

Konfigurasi kebijakan alokasi multi-zona

Konfigurasi ini melewati batasan suplai zona tunggal menggunakan langkah-langkah berikut:

  1. Tentukan zona target: Anda mencantumkan beberapa zona cadangan (seperti us-central1-a, us-central1-b, dan us-central1-c) dalam aturan prioritas.
  2. Perluas parameter target: Anda menetapkan kebijakan lokasi ke ANY. Setelan ini menginstruksikan autoscaler cluster untuk menelusuri kapasitas yang diminta di semua zona yang ditentukan.
  3. Analisis ketersediaan zona: selama peristiwa penskalaan, GKE memindai zona yang ditentukan.
  4. Sediakan di zona yang tersedia: GKE segera menyediakan node workload yang diminta di zona target mana pun yang memiliki kapasitas yang cocok. Strategi ini mencegah pemblokiran dalam antrean alokasi.

    apiVersion: cloud.google.com/v1
    kind: ComputeClass
    metadata:
      name: broad-zonal-serving
    spec:
      priorities:
      - gpu:
          type: nvidia-l4
          count: 1
        location:
          zones: [us-central1-a, us-central1-b, us-central1-c]
          locationPolicy: ANY # Provision accelerator in any target zone with supply
    

Langkah berikutnya