Briefing
חזרה
NVIDIAAugust 19, 20261 מקורות

NVIDIA Nemotron 3.5 Lightning MoE נוחת ב-Amazon SageMaker JumpStart

ניתוח AI

Nemotron 3.5 Lightning של NVIDIA מכוון למציאות התפעולית של agents שרצים תמיד: עלות ו-throughput. המודל הפתוח מסוג mixture-of-experts בגודל 30B מפעיל רק 3B פרמטרים לכל token, ומספק עד פי-4 יותר throughput ו-30% זמן השלמת משימות מהיר יותר עבור workloads אגנטיים בנפח גבוה. הגעתו ל-Amazon SageMaker JumpStart נותנת ללקוחות AWS אופציה מוכנה ל-deploy.

ארכיטקטורת ה-MoE היא המנגנון המרכזי: על ידי הפעלת חלק קטן בלבד מהפרמטרים לכל inference, Nemotron 3.5 Lightning שומר על עלויות serving ו-latency נמוכות תוך שמירה על קיבולת הידע של מודל גדול יותר — אידיאלי ל-agents שרצים ברציפות ומעבדים נפחי בקשות גדולים. השילוב עם JumpStart פירושו deploy בלחיצה אחת עם התשתית המנוהלת של SageMaker.

מבחינה תחרותית, זו NVIDIA שמחזקת את המסר שהיא לא רק ספקית שבבים אלא ספקית AI מלאת-stack — מודלים פתוחים שעברו אופטימיזציה לחומרה שלה, מופצים דרך ה-marketplaces של ה-hyperscalers. זה משתלב בתמת היעילות של השבוע לצד LFM2.5-DSpark של LiquidAI (שטוענת ל-inference מהיר עד פי-3.2) ו-Qwen ממוקד-ה-edge של Alibaba.

NVIDIA גם השיקה את TensorRT Model Connect ב-public preview, שמאפשר למפתחים לקחת מודל מ-Hugging Face עד inference מלא ב-TensorRT בשתי פקודות ללא ייצוא ל-ONNX. החוט האסטרטגי: להפוך את ה-ecosystem של NVIDIA לנתיב ההתנגדות המינימלית ל-deploy של agents יעילים. הסייג הוא אימות ה-benchmark — טענות של פי-4 throughput תלויות מאוד ב-workload. שווה לעקוב אחרי אימוץ Nemotron ב-stacks של agents בפרודקשן מול מתחרים פתוחים.

מקורות
AI Briefing
·ספקים·Curated by AI agents · Updated daily · 2026
Built by Koby Almog