DeepSeek משיקה את V4.1-Flash: 552 מיליארד פרמטרים, vision מובנה ו-output זול ב-60%

DeepSeek שחררה את V4.1-Flash, מודל mixture-of-experts עם 552 מיליארד פרמטרים כוללים (8B פעילים בקלט, 16B בפלט), חלון context של מיליון tokens, והבנה ויזואלית מולטימודלית נייטיבית. תמחור ה-API חותך את V4-Pro של DeepSeek עצמה בעד 60%, ב-0.30 דולר למיליון tokens קלט ו-1.20 דולר למיליון פלט בשעות שיא, מוזל בחצי מחוץ לשעות השיא. ארכיטקטורה חדשה מספקת הפחתה פי ארבעה בעלויות זיכרון KV-cache — בערך 890 בייט ל-token, שמאפשרת context של מיליון על כ-1GB — שבוני התשתית ב-Hacker News הצביעו עליה כפיצ'ר הבולט לסוכנים ארוכי-טווח.
הקבלה בקהילה הייתה רועשת ומפוצלת. thread ב-r/DeepSeek שהכריז 'DeepSeek v4.1 Flash הוא באמת מדהים' (184 upvotes) ישב לצד אחר שכינה אותו 'הורדה ברמת יצירתיות, אינטליגנציה וניהול state' (141 upvotes) — הפיצול הקלאסי בין רווחי עלות/יעילות לנסיגות ביכולת גולמית. קהל ה-hosting המקומי התווכח אם הוא באמת מנצח את Kimi K3.
תוך שעות משחרורו ברישיון MIT ל-Hugging Face ב-10 בספטמבר, מפתחים הפשיטו את שכבות הבטיחות שלו והעלו פורקים 'abliterated' לא מצונזרים שמשכו תעבורת הורדות יציבה — מה שהחיה מחדש את הדיון על הפשטת בטיחות ממודלים פתוחים, שחוזר עם כל שחרור פתוח מסוגל. מגמת וריאנט GGUF בסגנון heretic/uncensored של Qwen הייתה נראית ב-r/LocalLLaMA.
תחרותית, V4.1-Flash מחדד את מיצוב מובילות העלות של DeepSeek מול Qwen, Kimi ומודלים פתוחים מערביים, ונוחת כש-DeepSeek שכרה את CITIC Securities ו-CFO ראשון לקראת IPO פוטנציאלי ב-STAR Market של שנחאי בשווי של כ-74 מיליארד דולר. DeepSeek הוזכרה גם בדוח האיומים של Anthropic כחברה שמזקקת את Claude, כך שרווחי היעילות שלה נושאים עננת IP. שווה לעקוב אם יעילות ה-KV-cache מתורגמת לחיסכון עלות אמיתי בסוכנים ואיך הפורקים ה-abliterated משתלבים בשיחה הרגולטורית על בטיחות המודלים הפתוחים.