תכנון ויצירה של תשתית AI

במאמר הזה מוסבר איך ליצור אשכול לעומסי עבודה של AI ב-AI Hypercomputer. באופן ספציפי, במאמר הזה מוסבר על התהליך ועל האפשרויות שצריך לבחור כשמתחילים להשתמש באשכול. במקום לבצע הערכה ידנית, אפשר להנחות את Gemini במסוף Google Cloud להשוות בין אפשרויות הצריכה של עומס העבודה והתקציב שלכם. מידע נוסף זמין במאמר בנושא תכנון תשתית AI באמצעות Compute Advisor.

במסמך הזה אנחנו מניחים שאתם מכירים את המינוח הנפוץ לעומסי עבודה של AI ו-ML, כמו אימון מודלים והסקת מסקנות. בנוסף, אנחנו מניחים שזיהיתם את עומס העבודה הספציפי של ה-AI שאתם צריכים לקבוע עבורו את סוג המכונה האופטימלי ואת הקיבולת הנדרשת לפריסה – לדוגמה, אימון מוקדם של מודל בסיסי, שיפור או הסקה.

הפעלת אשכול

הפעלת אשכול כוללת את השלבים הבאים:

  1. קביעת עומס העבודה ובחירת סוג המכונה
  2. בחירת אפשרות צריכה וקבלת קיבולת
  3. בחירת אפשרות פריסה
  4. בחירת כלי לניהול תזמור
  5. בחירת מערכת ההפעלה ותמונת האשכול
  6. יצירת האשכול
  7. הקצאת נפח אחסון לעומס העבודה

קביעת עומס העבודה ובחירת סוג המכונה

בוחרים סוג מכונה לעומס העבודה של ה-AI. ‫AI Hypercomputer תומך ביצירת אשכולות גם עבור GPU באשכולות וגם עבור GPU כלליים.

כדי לעזור לכם לבחור, אתם צריכים להגדיר את הדרישות של עומס העבודה ולהתאים אותן לסוג המכונה ולסוג ה-GPU המומלצים:

  • יחידות GPU באשכול: האפשרות הכי טובה לעומסי עבודה גדולים עם ביצועים גבוהים, כמו אימון מוקדם של מודלים בסיסיים, כוונון עדין של מודלים גדולים והסקת מסקנות בכמה מארחים.
  • מעבדי GPU כלליים: הכי טובים להסקת מסקנות ולשירות מיינסטרים, ליצירה עם שיפור אחזור (RAG) ולאימון ולכוונון עדין של מודלים קטנים עד בינוניים בצורה חסכונית.

כדי להתאים את עומס העבודה לסוג המכונה המומלץ, אפשר להשתמש בטבלה הזו:

סוג ה-GPU עומס עבודה או תרחיש שימוש סוגי מכונות מומלצים
מעבד גרפי (GPU) באשכול אימון מראש של מודלים בסיסיים והסקת מסקנות במספר מארחים A4X Max ‏ (NVIDIA GB300)*, ‏ A4X ‏ (NVIDIA GB200)*
אימון, כוונון עדין והסקת מסקנות של מודלים גדולים A4 (NVIDIA B200), ‏ A3 Ultra (NVIDIA H200 141GB)
הסקה וכוונון עדין של מודלים פופולריים A3 Mega (NVIDIA H100 80GB), ‏ A3 High (NVIDIA H100 80GB)
מעבד גרפי (GPU) כללי הסקה והצגה של נתונים מהקצה בתפוקה גבוהה A3 Edge (NVIDIA H100 80GB)
הצגת נתונים בשרת עם צומת יחיד וביצועים גבוהים, ושיפורים בקנה מידה קטן A2 (NVIDIA A100)
הסקת מסקנות ברמת הכניסה עם אופטימיזציה של העלויות G4 (NVIDIA RTX PRO 6000), ‏ N1 (NVIDIA T4 או V100)
הסקת מסקנות מיינסטרים, RAG ואימון מודלים קטנים עד בינוניים G2 (NVIDIA L4)

מידע מפורט על כל סדרת מכונות זמין במאמר מידע על מאיצי GPU.

בחירת אפשרות צריכה וקבלת קיבולת

בוחרים אפשרות צריכה למשאבי ה-GPU על סמך סוג המכונה שנבחר והאם משתמשים ב-GPU כללי או ב-GPU באשכול.

אפשרויות צריכה של מעבדי GPU כלליים

אפשרות צריכה זמין עבור למי זה מתאים How to request
על פי דרישה כל יחידות ה-GPU לשימוש כללי. עומסי עבודה שלא דורשים קיבולת מובטחת. יוצרים מכונה וירטואלית או אשכול ומציינים את מודל ההקצאה הרגיל. הוראות מפורטות במאמר יצירת מכונות וירטואליות.

טיפ: כדי להגדיל את הסיכויים לקבל קיבולת GPU כללית, כדאי להשתמש ב-Flex-start או ב-Spot.
הזמנות רגילות והזמנות רגילות לעתיד כל יחידות ה-GPU לשימוש כללי. עומסי עבודה שנדרשת להם קיבולת מובטחת באופן מיידי (הזמנות רגילות) או בתאריך ספציפי בעתיד (הזמנות רגילות לעתיד). שליחת בקשה למקום שמור על פי דרישה או למקום שמור לעתיד. הוראות מפורטות מופיעות במאמר בנושא הזמנת קיבולת.
Flex-start כל סוגי המכונות עם GPU, מלבד A4X Max ו-A4X. עומסי עבודה שדורשים אשכולות צפופים לזמן קצר, עד שבעה ימים. התכונה מאפשרת הקצאת משאבים צפופה וקבלת הנחה של עד 53% על סוגי מכונות נתמכים. אחרת, חלים התעריפים הרגילים על פי דרישה. יצירת בקשה באמצעות Compute Engine,‏ Cluster Director,‏ Cluster Toolkit או GKE. המשאבים מוקצים ברגע שהם הופכים לזמינים (זמן ההתחלה לא מיידי). הוראות מפורטות מופיעות במאמר בנושא קבלת נפח אחסון.
Spot כל סוגי המכונות עם GPU, מלבד A4X Max ו-A4X. עומסי עבודה (workloads) עמידים בכשלים, באצווה או לטווח קצר. ההנחה הכי גדולה (בין 61% ל-90%), אבל יכול להיות שמשאבי המחשוב ייקטעו בכל שלב. ליצור מכונות או מאגרי צמתים באופן מיידי באמצעות מודל הקצאת Spot. הוראות מפורטות מופיעות במאמר בנושא קבלת נפח אחסון.

אפשרויות צריכה של יחידות GPU באשכול

אפשרות צריכה זמין עבור למי זה מתאים How to request
הזמנות עתידיות ב-AI Hypercomputer כל ה-GPU המקובצים וסוגי המכונות A3 Edge. עומסי עבודה שנדרשת בהם יציבות למשך תקופה ממושכת, כמו אימון מוקדם של מודלים בסיסיים או הסקת מסקנות של מודלים בסיסיים במספר מארחים. הנחות של עד 53% על vCPU ו-GPU, וחלוקת משאבים צפופה. אפשר לבקש קיבולת דרך צוות התמיכה בחשבונות Google לתאריך ולשעה עתידיים של התחלה.
הזמנות עתידיות במצב יומן כל המעבדים הגרפיים המקובצים, מלבד A4X Max ו-A4X. עומסי עבודה שפועלים עד 90 ימים ודורשים יציבות, כמו אימון מוקדם או שיפור מודלים. המינוי הזה מציע הקצאת משאבים צפופה והנחה של עד 53%. ליצור בקשה בשירות עצמי למקום שמור לתאריך ולשעה עתידיים; Google Cloud צריך לאשר את הבקשה. הוראות מפורטות מופיעות במאמר בנושא הזמנת קיבולת.
Flex-start כל סוגי המכונות עם GPU מלבד A4X Max ו-A4X. עומסי עבודה שדורשים אשכולות צפופים לזמן קצר, עד שבעה ימים. התכונה מאפשרת הקצאת משאבים צפופה וקבלת הנחה של עד 53% על סוגי מכונות נתמכים. אחרת, חלים התעריפים הרגילים על פי דרישה. יצירת בקשה באמצעות Compute Engine,‏ Cluster Director,‏ Cluster Toolkit או GKE. המשאבים מוקצים ברגע שהם זמינים (זמן ההתחלה לא מיידי). הוראות מפורטות מופיעות במאמר בנושא קבלת נפח אחסון.
Spot כל סוגי המכונות עם GPU למעט A4X Max ו-A4X. עומסי עבודה (workloads) עמידים בכשלים, באצווה או לטווח קצר. ההנחה הכי גדולה (בין 61% ל-90%), אבל יכול להיות שמשאבי המחשוב ייקטעו בכל שלב. ליצור מכונות או מאגרי צמתים באופן מיידי באמצעות מודל הקצאת Spot. הוראות מפורטות מופיעות במאמר בנושא קבלת נפח אחסון.

בחירת אפשרות פריסה

בהתאם לרמת השליטה שאתם צריכים על פריסת האשכול, אתם יכולים לבחור בין האפשרויות הבאות:

ניהול מתקדם

אפשרויות פריסה מנוהלות מאוד מאפשרות להגדיר ולתזמן באופן אוטומטי את משאבי המחשוב, הרשת והאחסון, וכך מצמצמות את התקורה התפעולית של ניהול אשכולות. כדי לפרוס ולהגדיר את התשתית, משתמשים ב-Cluster Director, ב-Cluster Toolkit או ב-GKE.

  • Cluster Director:Google Cloud מוצר שמבצע אוטומציה של ההגדרה והקביעה המורכבות של תצורת האשכולות, ועוזר לכם להגדיר משאבי מחשוב, רשת ואחסון לאשכולות כדי למקסם את הביצועים ולמזער את זמן ההשבתה. ‫Cluster Director מיועד לאדמינים בתחום ה-IT ולחוקרי AI שרוצים להימנע מהתקורה של ניהול אשכול, ולהתמקד בהרצת עומסי העבודה שלהם.

  • Cluster Toolkit: כלי בקוד פתוח שמוצע על ידי Google ומפשט את ההגדרה והפריסה של אשכולות ב-GKE או ב-Compute Engine. אתם משתמשים בתוכניות מוגדרות מראש כדי לפרוס הגדרות נפוצות, כמו סוגי מכונות A4 עם Slurm. אתם יכולים לשנות את תוכניות הפריסה כדי להתאים אישית את הפריסות ואת חבילת התוכנה שלכם.

  • GKE: שירות Kubernetes מנוהל ופלטפורמה לתזמור קונטיינרים עם קוד פתוח. ‫GKE מציע תכונות כמו התאמה אוטומטית לעומס וזמינות גבוהה. היא גם יכולה לתזמן אפליקציות מבוססות-קונטיינרים, לתמוך בחומרה ייעודית ותואמת למערכת האקולוגית של Google Cloud, ולכן היא מתאימה לפריסה ולניהול של עומסי עבודה של AI או ML. אפשר לפרוס אשכולות GKE ישירות או באמצעות Cluster Toolkit.

פחות ניהול, יותר שליטה

כדי לקבל שליטה מדויקת יותר באשכולות ובתוכנה שמותקנת בהם, אפשר ליצור אשכול Compute Engine באמצעות קבוצות מופעי מכונה מנוהלים (MIG) ב-Compute Engine או באמצעות יצירת מופעים בכמות גדולה. לאחר מכן, מתקינים באופן ידני את כל תוכנת המפתח שצריך במופעים.

בחירת כלי לתזמור

מנהל תזמור אוטומטי מאפשר לנהל את האשכולות באופן אוטומטי. בעזרת כלי תזמור, לא צריך לנהל כל מופע חישוב באשכול. כלי תזמור, כמו Slurm או GKE, מטפל במשימות כמו הוספה לתור של עבודות, הקצאת משאבים, שינוי גודל אוטומטי (במקרה של GKE) ומשימות אחרות של ניהול אשכולות שמתבצעות מדי יום.

  • Slurm: ‏ Slurm הוא כלי לתזמור בקוד פתוח שמשמש בדרך כלל לעומסי עבודה של HPC,‏ AI או ML. כדי לנהל את Slurm, אפשר להשתמש ב-Cluster Director. כדי להשתמש ב-Slurm באופן מקורי, אפשר להשתמש ב-Cluster Toolkit (שמציע תוכניות אב לשימוש באשכולות שמתקינות את Slurm באשכולות באופן אוטומטי), או להתקין את Slurm באשכול Compute Engine באופן ידני.

  • GKE: ‏ GKE הוא שירות מנוהל שמבוסס על Kubernetes, פלטפורמה לתזמור בין קונטיינרים של קוד פתוח. ‫GKE הוא פתרון אידיאלי לפריסה ולניהול של עומסי עבודה של AI או ML, כי הוא מאפשר תזמור של אפליקציות מבוססות-קונטיינרים, הוא תומך בחומרה ייעודית והוא חלק מהמערכת האקולוגית של Google Cloud Google Cloud. אפשר לפרוס אשכולות GKE ישירות או באמצעות Cluster Toolkit.

  • שימוש במערכת תזמור משלכם: כדי להשתמש במערכות תזמור אחרות, צריך להשתמש באשכולות של Compute Engine. יצירת אשכול Compute Engine היא האפשרות הכי פחות מנוהלת שמוצעת ב- Google Cloud. אם תבחרו באפשרות הזו, תהיו אחראים להגדרה, לתחזוקה ולעדכון של המופעים.

בחירת קובץ אימג' של המערכת

התמונה שבה צריך להשתמש תלויה בתשתית ה-GPU שבה משתמשים (GPU באשכול או GPU כללי) ובאופן שבו מתכננים לפרוס את האשכולות (GKE,‏ Slurm או Compute Engine). באשכולות GKE, משתמשים במערכת הפעלה שמותאמת לקונטיינרים. במקרים של אשכולות Compute Engine ו-Slurm, בוחרים קובץ אימג' של מערכת הפעלה שעבר אופטימיזציה למאיצים, כמו GPU. בנוסף, אפשר לבחור קובץ אימג' של קונטיינר של שכבת תוכנה ללמידה עמוקה (DLSL) לעומס העבודה.

מידע נוסף מופיע במאמר תמונות של AI Hypercomputer.

תמונות לאשכולות GKE

כדי ליצור אשכולות GKE, משתמשים בתמונות ברירת המחדל של מערכת ההפעלה של הקונטיינר גם במצב Standard וגם במצב Autopilot. עם זאת, במצב רגיל, אפשר גם לבחור להשתמש בתמונות זמינות אחרות, כמו Ubuntu.

אם משתמשים ב-Cluster Toolkit כדי לפרוס את האשכול, אפשר להשתמש רק בתמונות של מערכת ההפעלה של הקונטיינר, כי אלה התמונות שמוטמעות בתוכניות הבסיסיות של האשכול. מידע נוסף על כל תמונת צומת זמין במאמר בנושא תמונות צומת במסמכי התיעוד של GKE.

ב-GKE יש גם תמונות קונטיינר של שכבת תוכנה ללמידה עמוקה (DLSL) שמתקינות חבילות כמו NVIDIA CUDA ו-NCCL, וגם מסגרות ML כמו PyTorch, וכך מספקות סביבה מוכנה לשימוש עבור עומסי עבודה של למידה עמוקה. תמונות הקונטיינרים המוכנות מראש של DLSL נבדקות ומאומתות כדי לוודא שהן פועלות בצורה חלקה באשכולות GKE.

קובצי אימג' של מערכת הפעלה לאשכולות Compute Engine

‫AI Hypercomputer מציע תמונות שעברו אופטימיזציה להרצת עומסי עבודה של AI ו-ML באמצעות Compute Engine. בחר את מערכת ההפעלה שאתה הכי מכיר:

  • מאיץ Rocky Linux 9
  • ‫Rocky Linux 8 accelerator
  • מאיץ Ubuntu 24.04 LTS
  • מאיץ Ubuntu 22.04 LTS

אם אתם משתמשים ב-Cluster Toolkit, תמונות המאיצים האלה כבר כלולות בתוכניות של Cluster Toolkit, כי Cluster Toolkit יוצר תמונות מותאמות אישית שמרחיבות את תמונות מערכת ההפעלה של Ubuntu LTS Accelerator.

מידע נוסף על כל תמונת מערכת הפעלה זמין במאמר פרטים על מערכת ההפעלה במסמכי התיעוד של Compute Engine.

יצירת האשכול

אחרי שבודקים את תהליך יצירת האשכול ומקבלים החלטות ראשוניות לגבי עומס העבודה, יוצרים את האשכול באמצעות אחת מהאפשרויות הבאות:

הקצאת נפח אחסון לעומס העבודה

בוחרים שירות אחסון להקצאה על סמך דרישות הביצועים, העלות וארכיטקטורת האחסון.