DeepSeek הולכת על 8 טריליון פרמטרים: כמעט פי שלושה מהמודל הפתוח הגדול ביותר

DeepSeek מסמנת חזרה לקנה מידה גולמי. המנכ"ל Liang Wenfeng חשף למשקיעים שהחברה מאמנת כרגע מודל של 2 טריליון פרמטרים ומכוונת לדגל של 8 טריליון פרמטרים — מספר שיהפוך אותו לגדול פי כמעט שלושה מ-Kimi K3 של Moonshot AI, כיום המודל הפתוח הגדול ביותר עם 2.8 טריליון פרמטרים. אם זה יתממש כמודל פתוח, זה ירים דרמטית את התקרה של מחנה המודלים הפתוחים.
השאיפה עומדת במתח עם הנרטיב המקביל של DeepSeek סביב יעילות ב-V4.1-Flash, שהדגיש לעשות יותר עם פחות זיכרון. יחד שני החוטים מרמזים על אסטרטגיה מפוצלת: מודלי Flash היפר-יעילים להרצת agents רגישה לעלות, ומודל מוביל ענק שיתחרה ביכולת גולמית מול GPT-6 Astra, Gemini ו-Claude. כפי שהחברה עצמה ציינה, ספירת הפרמטרים הכוללת אינה שווה ישירות לפרמטרים הפעילים בכל inference — ארכיטקטורות MoE מפעילות רק חלק מהם — כך שהמספר של 8T הוא הצהרת כוונות וגישה לכוח מחשוב לא פחות מאשר ערובה ליכולת.
התזמון חשוב לאור תוכניות החומרה של DeepSeek: 160,000 שבבי Huawei Ascend 950DT במונגוליה הפנימית עם סיליקון אימון צפוי ברבעון הרביעי של 2026. אימון מודל של 8T פרמטרים דורש כוח מחשוב עצום, והיכולת של DeepSeek להבטיח שבבים מקומיים בצל מגבלות הייצוא היא הגורם המכריע. עבור התעשייה הרחבה יותר, ההכרזה היא תזכורת שמרוץ ה-scaling רחוק מלהסתיים גם כשיעילות והכלכלה של agents שולטות בשיח — ושחברות ה-AI הסיניות מתכוונות להתחרות ממש בפסגת עקומת הפרמטרים, לא רק על מחיר.