NVIDIA משחררת את DeepSeek-V4.1-Flash-NVFP4 ב-4 ביט ל-Blackwell תחת רישיון MIT

חברת NVIDIA שחררה גרסה מכומתת ל-4-bit של DeepSeek V4.1-Flash, הממותגת NVFP4 ומכווננת ספציפית ל-GPUs מסוג Blackwell GB300 שלה. המודל המאופטם תומך בחלון ההקשר המלא של מיליון token ללא כל retraining, ו-NVIDIA מדווחת על שינויי דיוק של לא יותר מ-1.5 נקודות על פני שישה benchmarks בהשוואה למקור — ירידה קטנה מספיק כדי להפוך את גרסת ה-4-bit לישימה בפרודקשן. הוא מופץ תחת רישיון MIT לשימוש מסחרי ולא-מסחרי כאחד.
המשמעות הטכנית היא פורמט ה-NVFP4 עצמו: דיוק 4-bit מפחית דרמטית את טביעת הרגל בזיכרון ומגדיל את ה-throughput של ה-inference על חומרת Blackwell, ועשיית זאת עם פחות מ-1.5 נקודות סטייה ב-benchmark על מודל MoE של 552 מיליארד פרמטרים היא אימות משמעותי לכלי הדיוק-הנמוך של NVIDIA. בשילוב עם ה-KV cache הזעיר ממילא של DeepSeek בגודל 890 בתים, build של NVFP4 הופך את הרצת מודל פתוח בקנה מידה מוביל על node בודד ברמה גבוהה להרבה יותר מעשית.
אסטרטגית, מעניין ש-NVIDIA מאופטמת ומפרסמת באופן פעיל build רשמי של מודל פתוח סיני — סיגנל שהאינטרס המסחרי של NVIDIA הוא במקסום ביקוש ל-GPU על פני כל מודל שמפתחים רוצים להריץ, ללא קשר למקור. זה גם מעמיק את מומנטום האקוסיסטם של DeepSeek שבו מפתחים מדווחים על ביטול מנויים לטובת self-hosting.
ההסתייגויות: מספרי הדיוק מדווחים על ידי NVIDIA על שישה benchmarks, וכימות 4-bit יכול להתדרדר באופן בלתי צפוי על משימות out-of-distribution או reasoning קשה שאינן נלכדות ב-benchmarks סטנדרטיים — אותה הסתייגות 'trade-off איכות ב-reasoning קשה יותר' שמשתמשי DeepSeek סימנו למודל הבסיס. ובכל זאת, לצוותים עם חומרת Blackwell, NVFP4 מוריד באופן משמעותי את עלות הרצת מודל פתוח מוביל עם הקשר של מיליון token.