חזרה
DeepSeekSeptember 19, 20263 מקורות

DeepSeek V4.1 Flash מכווץ את ה-KV cache ל-890 בייטים ל-token — פי 4 פחות זיכרון ל-agents

ניתוח AI

DeepSeek השיקה את V4.1 Flash, מודל multimodal מסוג Mixture-of-Experts בן 552 מיליארד פרמטרים שמפעיל רק 8B פרמטרים ב-prefill ו-16B ב-decode, בשילוב ארכיטקטורת Causal Encoder-Decoder מעוצבת מחדש שמכווצת את ה-KV cache הגלובלי ל-890 בייטים per token — בערך רבע מהטביעה של V4-Flash. הצמצום הזה של פי-4 בזיכרון הוא הכותרת: הוא מאפשר להכניס הרבה יותר sessions מקבילים של agents לכל GPU וחותך את תמחור קריאות ה-cache עד 57% ($0.006 מול $0.014 per MTok). המודל יוצא תחת רישיון MIT עם חלון context של מיליון tokens, ומאפשר self-hosting ושימוש מסחרי.

הכלכלה היא הסיפור. עבור עומסי agentic ששומרים contexts ארוכים חיים על פני תורים רבים, ה-KV cache הוא עלות הזיכרון הדומיננטית, וצמצום של פי-4 מיתרגם ישירות ליותר sessions לכל GPU ולחשבונות inference נמוכים יותר per token. DeepSeek גם טוענת ש-V4.1 Flash עוקף את GPT-5.6 Sol של OpenAI ואת Claude Opus-5.0 של Anthropic בכמה benchmarks של coding agentic — מיצוב אגרסיבי שמשלב איכות ברמה מובילה עם מודל פתוח ושירות זול בהרבה.

NVIDIA הדגישה את המומנטום כשפרסמה גרסת NVFP4 ב-4 ביט מכווננת ל-GPUs מסוג Blackwell GB300, שתומכת במלוא ה-context של מיליון tokens עם סטייה של לא יותר מ-1.5 נקודות בדיוק על פני שישה benchmarks, גם היא תחת רישיון MIT — אות בולט לכך שיצרנית החומרה מבצעת אופטימיזציה למודל פתוח סיני.

ההתלהבות בקהילה הייתה חזקה: מפתחים ב-r/DeepSeek דיווחו על ביטול מנויי Claude ו-Codex, כשאחד ציין ש'$10 נותנים לך בערך 2B tokens לחודש שימוש.' ספקנים סימנו פשרות איכות במשימות reasoning קשות יותר, והזהירו שניצחונות ב-benchmark לא תמיד שורדים שימוש agentic בעולם האמיתי. ובכל זאת, ה-cache של 890 הבייטים כונה בהרחבה 'מהלך תשתית ה-agentic שאף אחד לא ציפה לו.'

מקורות
AI Briefing
·ספקים·Curated by AI agents · Updated daily · 2026
Built by Koby Almog