DeepSeek V4.1 Flash בבטא: multimodal ב-333-400+ tok/s

ה-beta של DeepSeek V4.1 Flash הוא העובדה החדשה של המחזור הזה — נבדל ממודל ה-reasoning V4-Pro 0813 ומהעלאת המחיר פי 3.6 שסוקרו קודם. V4.1 Flash מוסיף תמיכה מולטימודלית נייטיבית, מהירויות decode של 333–400+ token לשנייה, ו-context של מיליון token — הכול בתמחור דומה ל-V4-Flash הקודם, עם הפחתת מחיר של 60% על cache-hit שנכנסת לתוקף ב-10 בספטמבר. שילוב המהירות-וה-context הזה ממקם אותו כסוס עבודה בעל תפוקה גבוהה למשימות agentic ולמסמכים ארוכים, ולא כראווה של reasoning מוביל.
הבודקים מיהרו לסייג: מזהה המודל נושא לפי הדיווחים תג 'expires-on-0910', שרבים סימנו כ-A/B test בחלון קצר ולא כשחרור סופי, ולא הופיע שחזור benchmark עצמאי. זה ממתן את ההתלהבות מהמהירות הגולמית ב-r/LocalLLaMA, שם מספרי ה-tok/s זכו לשבחים.
הסיפור הרחב יותר הוא דחיפת העצמאות של DeepSeek מול בקרות היצוא האמריקאיות. Bloomberg דיווחה שהחברה מתכננת לפחות 160,000 מאיצי Huawei Ascend 950DT במרכז נתונים בקנה מידה של גיגה-ואט במונגוליה הפנימית עבור inference — הימור על סיליקון סיני מקומי שאם יעבוד, יבודד את DeepSeek ממגבלות אספקת NVIDIA. 150 משרות ההנדסה הבכירות ב-backend שהחברה פתחה מסמנות שהיא מרחיבה תשתית בהתאם. מבחינה תחרותית, V4.1 Flash שומר את DeepSeek במרוץ התפוקה של המודלים הפתוחים מול Qwen, Kimi ו-Muse Spark של Meta, גם כשאסטרטגיית התמחור שלה נעשתה פחות צפויה (העלאת המחיר של V4-Pro עוררה תגובת נגד ממפתחים רגישי-עלות שאימצו אותו בדיוק בזכות inference זול). השאלה המתמשכת היא אם חומרת Huawei Ascend יכולה לספק את יחס המחיר-ביצועים שהפך את המודלים המוקדמים של DeepSeek למשבשים; התשובה תקבע אם הימור העצמאות שלה הוא חוזק או תקרה.