Kemampuan pengelolaan cluster

Seri mesin A4X Max, A4X, A4, A3 Ultra, A3 Mega, dan A3 High (8 GPU) dirancang untuk memungkinkan Anda menjalankan cluster kecerdasan buatan (AI) dan machine learning (ML) skala besar serta menyediakan kemampuan pengelolaan cluster berikut:

Kolokasi resource infrastruktur AI

Saat menggunakan A4X Max, A4X, A4, A3 Ultra, A3 Mega, dan A3 High (8 GPU), Anda dapat meminta mesin host yang disediakan Compute Engine sedekat mungkin. Mesin ini menawarkan fitur berikut:

  • Compute Engine menyediakan mesin sebagai blok resource.

  • Jaringan dinamis machine learning (ML) menghubungkan mesin.

Pengaturan resource ini meminimalkan hop jaringan dan mengoptimalkan latensi jaringan terendah. Untuk mempelajari lebih lanjut cara mendapatkan kapasitas untuk men-deploy blok mesin yang dioptimalkan untuk akselerator yang dialokasikan secara padat, lihat Ringkasan kapasitas.

Penempatan sesuai topologi cluster

Setelah membuat instance komputasi menggunakan jenis mesin A4X Max, A4X, A4, A3 Ultra, A3 Mega, dan A3 High (8 GPU), Anda bisa mendapatkan informasi topologi di tingkat node dan cluster. Informasi ini membantu Anda melakukan hal berikut:

  • Menyesuaikan desain aplikasi atau workload untuk makin meminimalkan latensi jaringan.

  • Memahami dan memecahkan masalah latensi jaringan dan performa untuk instance yang sering berkomunikasi satu sama lain. Masalah ini dapat terjadi jika instance ditempatkan berjauhan secara tidak terduga.

Secara khusus, dukungan untuk fitur topologi adalah sebagai berikut:

Untuk mengetahui informasi selengkapnya, lihat Melihat topologi instance komputasi.

Mode operasional cluster

Saat Anda memesan kapasitas untuk membuat instance atau cluster komputasi menggunakan jenis mesin A4X Max, A4X, A4, A3 Ultra, A3 Mega, dan A3 High (8 GPU), jenis mesin yang Anda pesan akan menentukan mode operasional cluster untuk instance. Mode ini menentukan perilaku instance Anda setelah error host atau laporan host yang salah. Mode operasional yang tersedia untuk instance adalah mode terkelola, tempat Compute Engine secara otomatis mengganti mesin yang rusak , tetapi menahan sebagian kapasitas yang Anda pesan untuk membantu memastikan instance Anda memiliki resource yang diperlukan untuk memulai ulang. Atau mode semua kapasitas, tempat Anda memiliki akses ke kapasitas yang dipesan secara penuh, tetapi bertanggung jawab untuk mengelola kegagalan dan pemeliharaan yang direncanakan.

Untuk mengetahui informasi selengkapnya, lihat Mode operasional pemesanan.

Kontrol dan penjadwalan pemeliharaan cluster

Anda mengontrol pemeliharaan mesin A4X Max, A4X, A4, A3 Ultra, A3 Mega, dan A3 High (8 GPU) menggunakan penjadwalan sesuai topologi dalam blok resource. Kemampuan ini membantu menyinkronkan upgrade sehingga workload Anda lebih tahan terhadap peristiwa host dan meminimalkan gangguan. Pendekatan ini membantu meningkatkan goodput workload Anda.

Untuk memfasilitasi kontrol penuh atas peristiwa pemeliharaan, Anda dapat menggunakan fitur berikut:

Jenis penjadwalan pemeliharaan

Saat Anda memesan kapasitas untuk membuat instance atau cluster komputasi mesin A4X Max, A4X, A4, A3 Ultra, A3 Mega, dan A3 High (8 GPU), Anda dapat menentukan cara Compute Engine memelihara infrastruktur tempat instance Anda berjalan. Berdasarkan jenis mesin yang ingin Anda gunakan untuk instance, Anda dapat memilih antara pemeliharaan yang disinkronkan di seluruh instance (dikelompokkan), atau jadwal pemeliharaan yang berbeda (independen).

Untuk mengetahui informasi selengkapnya, lihat Jenis penjadwalan pemeliharaan.

Mengelola peristiwa host

Setelah membuat instance A4X Max, A4X, A4, A3 Ultra, A3 Mega, dan A3 High (8 GPU) serta memulai workload, Anda dapat menyiapkan pemberitahuan dan menerima notifikasi saat pemeliharaan untuk instance atau blok yang dipesan dijadwalkan, dimulai, atau selesai. Anda juga dapat melihat dan, jika diperlukan, memulai pemeliharaan secara manual pada instance atau blok yang dipesan sebelum waktu yang dijadwalkan. Opsi ini membantu Anda mengontrol dan meminimalkan waktu nonaktif workload secara proaktif.

Untuk informasi selengkapnya, lihat referensi berikut:

Alat diagnostik dan pemantauan cluster

Untuk pemantauan dan pemecahan masalah, mesin A4X Max, A4X, A4, A3 Ultra, A3 Mega, dan A3 High (8 GPU) menyertakan layanan berikut:

Apa langkah selanjutnya?