מאיץ ה-inference החדש: NVIDIA Groq 3 LPX נכנס לייצור מלא

NVIDIA הכריזה ש-Groq 3 LPX, מאיץ inference אינטראקטיבי ל-AI שנבנה כהרחבה של פלטפורמת Vera Rubin שלה, נכנס לייצור מלא. NVIDIA טוענת שהמאיץ מספק יצירת tokens מהירה במיוחד למערכות אג'נטיות — תגובות מהירות עד פי 4 מהחלופה הקרובה ביותר — ומכוונת לעומסים אינטראקטיביים רגישי-latency שבהם זמן התגובה מעצב ישירות את חוויית המשתמש ואת התפוקה של ה-agent.
מהירות ה-inference הפכה לזירת קרב אסטרטגית ככל שמערכות אג'נטיות מכפילות את מספר קריאות המודל למשימה; יצירה מהירה יותר לכל token מצטברת לאורך שרשראות reasoning ארוכות. Groq 3 LPX ממצב את NVIDIA להגן ספציפית על שוק ה-inference, בהשלמה לשליטתה ב-training. לצדו, NVIDIA הכריזה על Jetson Orin Nano 2, שמכפיל את ביצועי ה-inference לרובוטיקת edge, ומאפשר להריץ LLMs מובילים ומודלי vision-language on-device — והרחיבה את ההישג של NVIDIA ממרכז הנתונים ועד ל-edge של הרובוטיקה (ראו גם את עבודת הניווט הרובוטי חוצת-הגופים שלה).
עליית מדרגת הייצור מגיעה על רקע תחרות מתעצמת ב-custom-silicon: דיווחים ש-chip ה-inference שעיצבה OpenAI בעצמה, 'Jalapeño', עקף את GB200/GB300 של NVIDIA ביעילות מאותתים שה-hyperscalers וחברות ה-AI בונים חלופות דווקא כדי לחמוק מכוח התמחור של NVIDIA ב-inference. Groq 3 LPX וכן NVHBM/NVLink Fusion הם התשובה של NVIDIA — לשמור את הפלטפורמה המשולבת בקדמת המהירות והיעילות הגולמית. שווה לעקוב אחר benchmarks עצמאיים שיאמתו את טענת פי 4 והאם chips ל-inference בהתאמה אישית מ-OpenAI ואחרות ישחקו את נתח ה-inference של NVIDIA ככל שעומסים אג'נטיים יגדלו.