קבוצות של מופעי מכונה מנוהלים (MIG) מאפשרות ליצור, להגדיר ולנהל מחזור חיים של אוסף מכונות וירטואליות באופן אוטומטי. קבוצות MIG מספקות יתרונות כמו זמינות גבוהה באמצעות תיקון תוכנה אוטומטי ופריסות אזוריות (בכמה אזורים), התאמה אוטומטית לעומס כדי להתמודד עם עומסים משתנים ועדכונים בהדרגה פשוטים לאפליקציות. מידע נוסף מופיע במאמר בנושא קבוצות מנוהלות של מופעים.
אפשר להשתמש ב-MIG כדי ליצור ולנהל מכונות וירטואליות של TPU לגרסאות TPU v5p, v6e ו-TPU7x. אפשר ליצור קבוצות MIG עם TPU VM אחת, TPU VM עצמאיות (שנקראות גם פרוסות של מארח יחיד) וקבוצות MIG עם TPU VM שמחוברות ביניהן (שנקראות גם פרוסות של כמה מארחים).
לכל פרוסה ב-MIG עם מארח יחיד יש לכל היותר מכונת TPU וירטואלית אחת. המכונות הווירטואליות של TPU ב-MIG לא מחוברות באמצעות קישורי inter-chip interconnect (ICI).
פרוסת TPU מרובת מארחים מכילה כמה מכונות וירטואליות של TPU שמחוברות ביניהן באמצעות קישורי ICI.
קבוצות MIG עם מכונת TPU וירטואלית אחת
אפשר ליצור ולנהל מכונת TPU וירטואלית יחידה באמצעות MIG על ידי הגדרת גודל היעד של ה-MIG לאחד. הגישה הזו שימושית אם רוצים להשתמש בתכונות של MIG כמו תיקון אוטומטי של מופע יחיד. מידע נוסף זמין במאמר בנושא יצירת קבוצת MIG עם פרוסות TPU במארח יחיד.
קבוצות MIG עם פרוסות TPU במארח יחיד
יצירת קבוצת מופעי מכונה מנוהלים (MIG) עם כמה מופעי TPU עצמאיים מועילה לעומסי עבודה שדורשים כמה TPU VM נפרדות, אבל לא צריכות להיות מקושרות באמצעות קישורי ICI לעומסי עבודה מבוזרים. לדוגמה:
- הסקת מסקנות (Inference): כל מכונה וירטואלית ב-MIG יכולה לטפל בבקשות להסקת מסקנות באופן עצמאי. קבוצת מופעי מכונה מנוהלים (MIG) מאפשרת לכם לשנות את מספר המופעים שמשרתים את התוכן בהתאם לביקוש ולנהל אותם כקבוצה.
- משימות מקבילות ועצמאיות: קבוצת MIG מספקת דרך לנהל הרבה משימות קטנות ועצמאיות של אימון או חישובים אחרים שאפשר להריץ במקביל במכונות וירטואליות יחידות של TPU.
- ניהול: קבוצות MIG מספקות את התכונות הבאות:
- Deployment: מגדירים תבנית של הגדרות מכונה פעם אחת ומשתמשים ב-MIG כדי ליצור כמה מכונות TPU VM זהות.
- יכולת הרחבה: אפשר לשנות את מספר המכונות הווירטואליות של TPU על ידי שינוי הגודל של קבוצת המופעים המנוהלת (MIG).
- עדכונים מדורגים: עדכון התוכנה או סוג המכונה בכל המכונות הווירטואליות בצורה מבוקרת.
- יעילות מבחינת עלות: במקרים שבהם המשימות לא דורשות את העוצמה המלאה או את יכולת הקישוריות של פרוסת TPU גדולה, שימוש בכמה פרוסות TPU קטנות ועצמאיות יכול להיות יעיל יותר מבחינת עלות.
מידע נוסף זמין במאמר בנושא יצירת קבוצת MIG עם פרוסות TPU במארח יחיד.
קבוצות של מכונות וירטואליות עם פלח רשת מרובה מארחים
בניגוד לקבוצות של פרוסות TPU עצמאיות, MIG שהוגדר לפרוסה מרובת מארחים מנהל קבוצה של מכונות TPU VM שמקושרות באופן הדוק באמצעות קישורי ICI. כך נוצרת פרוסת TPU לוגית אחת.
יתרונות וביצועים
קבוצות MIG של חלקי TPU מרובי-מארחים מספקות את ההתאמה לעומס ואת הביצועים שנדרשים לעומסי עבודה אינטנסיביים של למידת מכונה.
- אימון מבוזר: אימון של מודלים של למידת מכונה דורש לעיתים קרובות יותר כוח TPU ממה שמכונת TPU וירטואלית אחת יכולה לספק. בפרוסות TPU גדולות יותר, החישוב מתבצע על פני הרבה שבבי TPU ומכונות וירטואליות, והקישורים של ICI מאפשרים תקשורת מהירה ביניהם. השלב הזה חיוני לשיפור הביצועים.
- רוחב פס גבוה של קישוריות פנימית: רשת ה-ICI מספקת רוחב פס גבוה יותר וזמן אחזור נמוך יותר בין שבבי ה-TPU בפרוסת ה-TPU, בהשוואה לרשת הסטנדרטית של מרכז הנתונים (DCN). השלב הזה חיוני לפעולות סינכרוניות שמאפיינות אימון של מודלים גדולים.
פעולות אטומיות במחזור החיים
כדי לשמור על השלמות של הטופולוגיה המקושרת, ה-MIG מנהל את כל הפלח כיחידה אחת שלא ניתן לחלק לאורך מחזור החיים שלו.
- יצירה: כל המכונות הווירטואליות בפרוסה מוקצות יחד. אם אין מספיק קיבולת בריאה ומקושרת לכל הטופולוגיה המבוקשת, הפרוסה לא נוצרת.
- מחיקה: קבוצת ה-MIG מוחקת את כל הפלח כיחידה אחת.
- שינוי הגודל: שינוי הגודל מוגבל לשינוי קנה מידה מ-0 לגודל המלא של הפרוסה, או מהגודל המלא של הפרוסה בחזרה ל-0. אי אפשר לשנות את הגודל של פרוסת מכונות וירטואליות באופן חלקי.
דרישות להגדרה
כדי להגדיר קבוצת מופעים מנוהלת (MIG) עם כמה מארחים, צריך להגדיר גם את טופולוגיית הקישוריות הפיזית וגם את מאפייני המופעים.
- מדיניות עומס עבודה: צריך לציין מדיניות עומס עבודה עם הפרמטר
accelerator-topology(לדוגמה, 4x4, 8x8 או 4x4x4). ההגדרה הזו קובעת שמכונות ה-VM יטופלו כחלק אחד ומקושר. מידע על טופולוגיה זמין במאמר טופולוגיית TPU. - תבנית של הגדרות מכונה: מגדירה מאפיינים כמו סוג המכונה, תמונת הדיסק והגדרות אחרות לכל מכונה וירטואלית בפלח.
זמינות של פרוסות ושחזור במקרה של כשל
כשמשתמשים ב-MIG כדי ליצור פלח TPU מרובה-מארחים, מערכת Compute Engine מנהלת באופן אוטומטי את תהליך השחזור של הפלח. אם מתרחשת שגיאה במארח או ב-ICI, הפרוסה עוברת למצב REACTIVATING. כל המכונות הווירטואליות בפרוסה יעברו למצב REPAIRING, אבל לא בהכרח באותו הזמן. לאחר מכן, מערכת Compute Engine תשחזר אוטומטית את הפרוסה על ידי הפעלה מחדש של המכונות הווירטואליות יחד בקיבולת תקינה.
עם זאת, כשמשתמשים במכונות וירטואליות מסוג Spot, מחיקה מקדימה גורמת לסיום המופעים. במקרה כזה, שירות Compute Engine לא יפעיל מחדש את הפרוסה באופן אוטומטי.
שחזור לאחר הפרעה במכונה
אם מוחקים או מפסיקים מופע TPU, או מפסיקים מופע מתוך מערכת ההפעלה, הפרוסה תעבור למצב FAILED. בתרחיש הזה, הפרוסה נשארת במצב FAILED עד שיוצרים אותה מחדש.
כדי ליצור מחדש את הפרוסה, צריך למחוק את ה-MIG וליצור אותו מחדש, או לשנות את הגודל של ה-MIG ל-0 ואז להגדיל אותו.
מידע נוסף על מצבי הפרוסות זמין במאמר בנושא צפייה בסטטוס של פרוסת TPU.
מגבלות
בקטעים הבאים מוסבר על המגבלות שחלות על יצירת קבוצת MIG עם מכונות וירטואליות של TPU.
מגבלות על תבניות של מכונות
לתבניות של מכונות וירטואליות שמציינות סוג מכונת TPU יש את המגבלות הבאות:
כשמשתמשים במודל הקצאת משאבים שמוגבל לשמירת מקום, צריך להגדיר את פעולת סיום המופע למחיקה.
יחידות TPU יכולות לצרוך רק הזמנות שמטורגטות באופן ספציפי.
אי אפשר לציין מדיניות מיקום.
כשמשתמשים בתבנית של הגדרות מכונה כדי ליצור קבוצת MIG עבור פרוסת TPU עם כמה מארחים, אי אפשר להשבית את ההפעלה האוטומטית מחדש על ידי הגדרת השדה
scheduling.automaticRestartלערךfalse. המגבלה הזו חלה על מודלים של הקצאת הרשאות מסוגים רגיל, גמיש ובהתאם להזמנה.
מגבלות על MIG
ל-MIG עם מעבדי TPU יש את המגבלות הבאות:
פעולות במחזור החיים: אי אפשר להפסיק, להתחיל, להמשיך או להשהות מופעי TPU. כדי לשנות הגדרות שדורשות הפעלה מחדש או כדי להפסיק את החיובים, צריך למחוק את המופעים.
חלוקת אזורים של קבוצת MIG אזורית: צריך להגדיר את צורת חלוקת היעד לערך
ANY_SINGLE_ZONE.עדכוני הגדרות אישיות בקבוצת מופעים מנוהלת (MIG):
- אי אפשר לעדכן קבוצת MIG שיוצרת פלח TPU עם כמה מארחים בגלל טופולוגיית המאיץ המוגדרת.
- כדי לעדכן קבוצת MIG שיוצרת פרוסות TPU במארח יחיד, אפשר להשתמש בשיטות אוטומטיות או סלקטיביות.
עם זאת, העדכונים של פרוסת TPU עם מארח יחיד לא תומכים בפעולת ההפעלה מחדש (
RESTART). אם נדרשת הפעלה מחדש והפעולה הכי משבשת שמותרת היא החלפה (REPLACE), כלי העדכון יחליף את המופע. אחרת, ניסיון העדכון ייכשל עם שגיאה.
בנוסף, המגבלות הבאות חלות על MIG שיוצר פרוסת TPU מרובת מארחים:
מדיניות לגבי גודל יעד: צריך להגדיר את מצב המדיניות לגבי גודל יעד לערך
BULK. אחרי שמגדירים את המצב הזה, אי אפשר לשנות אותו.גודל היעד: במצב הפעלה בכמות גדולה, אפשר להגדיר את גודל היעד ל-
0או למספר המופעים שנדרשים ליצירת הטופולוגיה של המאיץ.מדיניות עומס עבודה: צריך לציין מדיניות עומס עבודה שבה מוגדרת טופולוגיית המאיץ. אחרי שמגדירים את מדיניות העומס, אי אפשר לשנות או להסיר את המדיניות מה-MIG.
תיקונים שהופעלו על ידי MIG: צריך להשבית את התיקונים שהופעלו על ידי MIG על ידי הגדרת השדה
defaultActionOnFailureלערךDO_NOTHING. בהגדרה הזו, ה-MIG לא מבצע פעולה כלשהי על מופע שנכשל. Compute Engine משחזר אוטומטית את המכונה שנכשלה על ידי הפעלה מחדש של כל המכונות באותו חלק בקיבולת תקינה.
תכונות שלא נתמכות: קבוצות של מכונות וירטואליות עם TPUs לא תומכות בתכונות הבאות:
- גמישות במכונות
- בקשות לשינוי גודל כדי לקבל את כל המשאבים בבת אחת
- הגדרה עם שמירת מצב
- ב-MIG שיוצר פרוסת TPU מרובת-מארחים, אין תמיכה גם באפשרויות הבאות: