סקירה כללית על AI ניתן להסברה ב-BigQuery
במאמר הזה מוסבר איך BigQuery ML תומך בבינה מלאכותית (AI) שניתן להסביר אותה, לפעמים נקראת XAI.
ה-AI שניתן להסבר עוזר לכם להבין את התוצאות שמודל לחיזוי של למידת מכונה מייצר למשימות של סיווג ורגרסיה, על ידי הגדרה של התרומה של כל תכונה בשורה של נתונים לתוצאה החזויה. המידע הזה נקרא בדרך כלל שיוך תכונות. אתם יכולים להשתמש במידע הזה כדי לוודא שהמודל מתנהג כמצופה, לזהות הטיה במודלים שלכם ולמצוא דרכים לשפר את המודל ואת נתוני האימון.
יכולת הסברה מקומית לעומת יכולת הסברה גלובלית
יש שני סוגים של יכולת הסברה: יכולת הסברה מקומית ויכולת הסברה גלובלית. הם נקראים גם חשיבות מקומית של מאפיינים וחשיבות גלובלית של מאפיינים.
- הסבר מקומי מחזיר ערכי שיוך של תכונות לכל דוגמה מוסברת. הערכים האלה מתארים את מידת ההשפעה של תכונה מסוימת על התחזית ביחס לתחזית הבסיסית.
- יכולת הסברה גלובלית מחזירה את ההשפעה הכוללת של התכונה על המודל, ולרוב מתקבלת על ידי צבירת שיוכי התכונה על פני קבוצת הנתונים כולה. ערך מוחלט גבוה יותר מצביע על כך שהתכונה השפיעה יותר על התחזיות של המודל.
פתרונות AI הניתן להסברה ב-BigQuery ML
ה-AI שנותן הסברים ב-BigQuery ML תומך במגוון מודלים של למידת מכונה, כולל מודלים של סדרות זמנים ומודלים שאינם של סדרות זמנים. כל אחד מהמודלים משתמש בשיטה אחרת להסבר.
| קטגוריית המודל | סוגי מודלים | שיטת ההסברה | הסבר בסיסי על השיטה | פונקציות הסבר מקומיות | פונקציות הסבר גלובליות |
|---|---|---|---|---|---|
| מודלים בפיקוח | רגרסיה לינארית ולוגיסטית | ערכי Shapley | ערכי שפלי למודלים ליניאריים שווים ל-model weight * feature
value, כאשר ערכי המאפיינים הם סטנדרטיים והמשקלים של המודל הם
מאומנים עם ערכי המאפיינים הסטנדרטיים. |
ML.EXPLAIN_PREDICT1 |
ML.GLOBAL_EXPLAIN2 |
| שגיאות תקניות וערכי P | שגיאות תקניות וערכי p משמשים לבדיקת מובהקות ביחס למשקלים של המודל. | לא רלוונטי | ML.ADVANCED_WEIGHTS4 |
||
| עצים מחוזקים יער אקראי |
Tree SHAP | Tree SHAP הוא אלגוריתם לחישוב ערכי SHAP מדויקים למודלים שמבוססים על עץ החלטות. | ML.EXPLAIN_PREDICT1 |
ML.GLOBAL_EXPLAIN2 |
|
| חישוב צריכת הנתונים המשוערת | הפונקציה מחשבת קירוב של ערכי התרומה של התכונה. הוא מהיר ופשוט יותר בהשוואה ל-Tree SHAP. | ML.EXPLAIN_PREDICT1 |
ML.GLOBAL_EXPLAIN2 |
||
| חשיבות התכונות על סמך מדד ג'יני | ציון גלובלי של חשיבות התכונה שמציין עד כמה כל תכונה הייתה שימושית או בעלת ערך בבניית מודל העץ המחוזק או מודל היער האקראי במהלך האימון. | לא רלוונטי | ML.FEATURE_IMPORTANCE |
||
| AutoML Tables | דגימת Shapley | מודל Shapley עם דגימה מקצה קרדיט לתוצאה של המודל לכל תכונה, ומתחשב בפרמוטציות שונות של התכונות. השיטה הזו מספקת קירוב של ערכי Shapley המדויקים על סמך דגימה. | לא רלוונטי | ML.GLOBAL_EXPLAIN2 |
|
| מודלים של פעולות על ציר הזמן | ARIMA_PLUS | פירוק של סדרת נתונים על ציר הזמן | מפרק את סדרת הזמנים לכמה רכיבים אם הרכיבים האלה קיימים בסדרת הזמנים. הרכיבים כוללים מגמה, עונתיות, חגים, שינויים הדרגתיים, עליות וירידות חדות. פרטים נוספים זמינים במאמר בנושא modeling pipeline של ARIMA_PLUS. | ML.EXPLAIN_FORECAST3 |
לא רלוונטי |
| ARIMA_PLUS_XREG | פירוק של סדרות עיתיות ו ערכי Shapley |
מפרק את סדרת הזמנים למספר רכיבים, כולל מגמה, עונתיות, חגים, שינויים הדרגתיים, עליות וירידות חדות
(בדומה ל-ARIMA_PLUS).
השיוך של כל רגרסור חיצוני מחושב על סמך ערכי Shapley, ששווים ל-model weight * feature value. |
ML.EXPLAIN_FORECAST3 |
לא רלוונטי |
1ML_EXPLAIN_PREDICT היא גרסה מורחבת של ML.PREDICT.
2ML.GLOBAL_EXPLAIN מחזירה את ההסבר הגלובלי שמתקבל על ידי חישוב הממוצע של השיוך המוחלט שכל מאפיין מקבל לכל השורות בקבוצת הנתונים של ההערכה.
3ML.EXPLAIN_FORECAST היא גרסה מורחבת של ML.FORECAST.
4ML.ADVANCED_WEIGHTS היא גרסה מורחבת של ML.WEIGHTS.
המאמרים הבאים
- מידע נוסף על פונקציות והצהרות SQL נתמכות עבור מודלים שתומכים בהסבר על התוצאות זמין במאמר מסלולי משתמשים מקצה לקצה למודלים של למידת מכונה.