Meta נכנסת למשחק השבבים: MTIA 300, שבב האימון הראשון שלה — עם NIC מובנה

Meta חשפה את MTIA 300, החבר הראשון ביכולת training במשפחת ה-Meta Training and Inference Accelerator הפנימית שלה. בעוד שדורות MTIA קודמים התמקדו ב-inference, MTIA 300 עברה אופטימיזציה ל-training של מודלי הדירוג וההמלצה שמפעילים את מערכות הפרסום וה-feed של Meta — עומסי עבודה שבהם GPU כלליים משאירים ביצועים על השולחן.
הבחירה הארכיטקטונית הבולטת היא chiplets של NIC (network interface controller) המשולבים ישירות על גבי המאיץ, בתוספת מנועי הורדת-תקשורת שמטפלים בהעברת נתונים בין שבבים. Meta עיצבה במשותף את ספריית התקשורת HCCL שלה כדי לנצל את החומרה הזו, וטוענת שהיא עולה בביצועים על GPU כלליים בעומסי המלצה בכך שהיא מונעת בזבוז מחזורי compute על תקורת networking.
המהלך הוא חלק מדחיפה רחבה יותר של ה-hyperscalers להפחית את התלות בסיליקון של NVIDIA עבור עומסים מתמחים. Google (TPU), Amazon (Trainium) ו-Microsoft (Maia) כולן רודפות אחר מאיצים מותאמים, אך השילוב ההדוק של Meta של networking על שבב ה-training הוא הימור ייחודי המכוון ישירות לצרכיה הפנימיים עתירי-ההמלצות. הוא משתלב עם הכרזת MetaRoCE המקבילה של Meta, transport של RDMA מתחילת הדף עבור Ethernet בקנה-מידה של AI.
סיליקון מותאם רק לעתים נדירות מדיח את NVIDIA לחלוטין — MTIA 300 מכוון למחלקת עומסים ספציפית, לא ל-training של LLM מובילים, שם Meta עדיין מוציאה סכומים כבדים על GPU. אזהרת Micron ב-Hot Chips שבעיות זיכרון HBM גרמו ל-17% מהפסקות ה-training של Llama 3 של Meta מדגישה שצווארי בקבוק של זיכרון ו-networking נותרים חריפים ללא קשר למאיץ. הקוראים כדאי שיעקבו האם MTIA 300 תזיז באופן משמעותי את תמהיל הוצאות ההון על GPU של Meta, והאם עיצוב ה-NIC המובנה ישפיע על מפות הדרכים של המתחרים.