Nemotron 3.5 Lightning של NVIDIA מגיע ל-SageMaker JumpStart לעומסים agentic

Nemotron 3.5 Lightning הוא המודל הפתוח החדש ביותר של NVIDIA, עיצוב Mixture-of-Experts בן 30 מיליארד פרמטרים המפעיל רק 3 מיליארד פרמטרים לכל token ותומך בחלון context של מיליון token. הוא נבנה במיוחד עבור workloads agentic בנפח גבוה ותמידיים — code review, ניטור אבטחה ומשימות אחרות שבהן throughput מתמשך חשוב יותר מאינטליגנציית שיא גולמית. NVIDIA טוענת ל-throughput גבוה עד פי 4 והשלמת משימות מהירה עד 30% לעומת אופציות דומות.
ההפצה ב-AWS היא וו החדשות: המודל זמין כעת ישירות ב-Amazon SageMaker JumpStart, ומאפשר ללקוחות AWS לעשות לו deploy מבלי להקים stack inference משלהם. NVIDIA גם פרסמה מדריך מפתחים מעמיק על בניית Nemotron 3.5 Lightning עם quantization מסוג NVFP4 ו-quantization-aware distillation דרך ה-Model Optimizer שלה, המכוון לצוותים שצריכים לפגוע ביעדי latency, זיכרון ומחשוב ספציפיים על החומרה שלהם.
מבחינה תחרותית, Nemotron 3.5 Lightning הוא התשובה של NVIDIA לגל המודלים הפתוחים הסיני בהובלת Qwen של Alibaba. דוח 'State of Open Models' של הקיץ מ-Hugging Face שידך את השניים במפורש כעדות לדחיפה של יצרני חומרה אמריקאים לתוך inference מקומי, וציין שרק כ-1% מההורדות כעת הולכות למודלים בני 100B+ פרמטרים — מודלי MoE קטנים ויעילים מנצחים. לפי הדיווחים, NVIDIA גם מפתחת משפחת Nemotron 4 גדולה בהרבה עם לפחות טריליון פרמטרים, שעשויה להגיע בסתיו המאוחר של 2026.
התת-טקסט האסטרטגי: NVIDIA שמוכרת מודלים פתוחים יעילים שרצים בכל מקום עדיין מוכרת בסופו של דבר יותר מהסיליקון שלה עצמה, בין אם בענן או ב-edge. עבור לקוחות AWS המשיכה המעשית היא מודל agentic מוכן-ל-deploy עם כלכלת throughput חזקה; ההסתייגות היא שמודלי MoE יכולים להיות מסובכים לשרת ביעילות, וזו בדיוק הסיבה שהנתיב המנוהל של JumpStart אטרקטיבי.