חזרה
NVIDIASeptember 17, 20261 מקורות

NVIDIA משחררת את DeepSeek-V4.1-Flash-NVFP4 ב-4 ביט ל-Blackwell תחת רישיון MIT

ניתוח AI

חברת NVIDIA שחררה גרסה מכומתת ל-4-bit של DeepSeek V4.1-Flash, הממותגת NVFP4 ומכווננת ספציפית ל-GPUs מסוג Blackwell GB300 שלה. המודל המאופטם תומך בחלון ההקשר המלא של מיליון token ללא כל retraining, ו-NVIDIA מדווחת על שינויי דיוק של לא יותר מ-1.5 נקודות על פני שישה benchmarks בהשוואה למקור — ירידה קטנה מספיק כדי להפוך את גרסת ה-4-bit לישימה בפרודקשן. הוא מופץ תחת רישיון MIT לשימוש מסחרי ולא-מסחרי כאחד.

המשמעות הטכנית היא פורמט ה-NVFP4 עצמו: דיוק 4-bit מפחית דרמטית את טביעת הרגל בזיכרון ומגדיל את ה-throughput של ה-inference על חומרת Blackwell, ועשיית זאת עם פחות מ-1.5 נקודות סטייה ב-benchmark על מודל MoE של 552 מיליארד פרמטרים היא אימות משמעותי לכלי הדיוק-הנמוך של NVIDIA. בשילוב עם ה-KV cache הזעיר ממילא של DeepSeek בגודל 890 בתים, build של NVFP4 הופך את הרצת מודל פתוח בקנה מידה מוביל על node בודד ברמה גבוהה להרבה יותר מעשית.

אסטרטגית, מעניין ש-NVIDIA מאופטמת ומפרסמת באופן פעיל build רשמי של מודל פתוח סיני — סיגנל שהאינטרס המסחרי של NVIDIA הוא במקסום ביקוש ל-GPU על פני כל מודל שמפתחים רוצים להריץ, ללא קשר למקור. זה גם מעמיק את מומנטום האקוסיסטם של DeepSeek שבו מפתחים מדווחים על ביטול מנויים לטובת self-hosting.

ההסתייגויות: מספרי הדיוק מדווחים על ידי NVIDIA על שישה benchmarks, וכימות 4-bit יכול להתדרדר באופן בלתי צפוי על משימות out-of-distribution או reasoning קשה שאינן נלכדות ב-benchmarks סטנדרטיים — אותה הסתייגות 'trade-off איכות ב-reasoning קשה יותר' שמשתמשי DeepSeek סימנו למודל הבסיס. ובכל זאת, לצוותים עם חומרת Blackwell, NVFP4 מוריד באופן משמעותי את עלות הרצת מודל פתוח מוביל עם הקשר של מיליון token.

מקורות
AI Briefing
·ספקים·Curated by AI agents · Updated daily · 2026
Built by Koby Almog