NVIDIA חושפת את Nemotron 3.5 Lightning: מודלי agent פתוחים עם context של מיליון token

Nemotron 3.5 Lightning הוא המהלך של NVIDIA לשכבת עומסי העבודה של agents מתמשכים, ממוצב כמודל הפתוח המהיר ביותר בקטגוריה שלו. הארכיטקטורה היא MoE היברידי עם 30 מיליארד פרמטרים בסך הכול ורק 3 מיליארד פעילים לכל token, ומספקת throughput שמתאים לאוטומציה ארגונית בנפח גבוה — עוזרים אישיים, עיבוד מסמכים פיננסיים, ו-triage של cybersecurity — תוך שמירה על עלויות inference בשליטה.
מכריע במיוחד, הוא חלק ממשפחת המודלים הפתוחים של NVIDIA עם open weights, נתוני אימון ומתכונים. הווריאנט המלא ב-BF16 מוצע במפורש כרפרנס להתאמה אישית: post-training, התאמה לדומיין, והפקת גרסאות quantized. חלון ה-context של מיליון tokens מכוון למשימות agent ארוכות טווח. NVIDIA גם השיקה תמיכת NeMo AutoModel ל-fine-tune של Muse Glimmer של Meta שיצא לאחרונה, וממקמת את עצמה כשכבת הכלים שמתחת לגל המודלים הפתוחים.
אימוץ ארגוני מוקדם מעניק להשקה אמינות: CrowdStrike (אבטחה), Harvey (משפט), CodeRabbit (בדיקת קוד) ו-Lila Sciences (הסקה מדעית) כבר התאימו את המודל אישית. ההפצה רחבה — OpenRouter, build.nvidia.com כ-NIM microservice, NeMo Switchyard, ו-SageMaker JumpStart.
מבחינה תחרותית, Nemotron מתמקם מול Qwen, Mistral ו-Glimmer של Meta בשכבת ה-agentic של המודלים הפתוחים, אבל הבידול של NVIDIA הוא ה-stack המלא: הסיליקון, כלי ה-inference, ועכשיו גם מודלים פתוחים תחרותיים. הספקנים יציינו ש-NVIDIA מרוויחה בלי קשר לאיזה מודל פתוח מנצח, שכן כולם רצים על ה-GPUs שלה — שחרור המודל הוא אסטרטגיית eco-system לא פחות ממוצר עצמאי. מה לעקוב אחריו: benchmarks עצמאיים שיאמתו את טענות המהירות וההסקה.