DeepSeek משיקה את V4.1-Flash: encoder-decoder סיבתי, context של מיליון tokens ו-vision

מספר הכותרת נוגד את האינטואיציה: עם 763B פרמטרים, V4.1-Flash גדול יותר מהמודלים V3 ו-R1 שהפכו את DeepSeek למפורסמת, ובכל זאת טביעת הזיכרון שלו נמוכה בהרבה ממה שגודלו מרמז. DeepSeek השיגה זאת דרך שיפוץ מנגנוני ה-attention ו-causal encoder-decoder חדש (CED) שמשפר את עיבוד ה-prompt תוך קיצוץ השימוש ב-KV-cache ל-13-25% מזה של V4 Flash — כלומר אותה חומרה יכולה לשרת פי ארבעה עד שמונה יותר משתמשים במקביל.
השינוי החדשני ביותר הוא ארכיטקטוני: 196B מתוך 763B הפרמטרים הם 'פרמטרי N-gram' שמרכיבים את מה ש-DeepSeek מכנה 'מודול זיכרון מותנה'. על ידי ניתוק הזיכרון מהחישוב, DeepSeek טוענת שהיא יכולה להפוך מודלים לחכמים יותר תוך צמצום כוח המחשוב והזיכרון הדרושים לשרת אותם — תבנית ש-The Register מציעה שעשויה להצביע לעבר מודלים עתידיים גדולים ורזים יותר. המודל מוסיף vision ו-context של 1M tokens, ו-DeepSeek טוענת שהוא עולה בביצועיו על V4-Pro הדגל ומנצח את Kimi K3 ב-benchmarks של cyber וקוד.
התמחור הוא הנשק התחרותי. תעריפי off-peak של $0.15/$0.60 למיליון tokens, עם עלויות cached-input נמוכות, גררו טענה על הפחתת עלות של כ-94% לעומת GPT-5.6 Sol מ-@kimmonismus, שגם ציטט שהוא מנצח את Sol ב-DeepSWE (74.2% מול 73%). OpenCode השתלב מהיום הראשון; מודלים פתוחים רצים על Ollama, LM Studio ו-llama.cpp.
ההשקה בלתי-נפרדת מההאשמה של Anthropic מאותו שבוע ש-DeepSeek עשתה distillation ל-Claude — טענה שהקהילה התווכחה עליה ישירות ב-r/DeepSeek. היא גם מגיעה לקראת רישום ב-STAR Market בשנגחאי, מה שמוסיף מניע פיננסי לתמחור האגרסיבי. V4 Pro ייגמל ב-14 בספטמבר, אם כי DeepSeek אותתה מאוחר יותר שתמשיך לתמוך בו. שווה לעקוב אחר שחזורי benchmark של צד שלישי כדי לאשש את הטענות על ניצחון V4-Pro.