Alibaba משיקה את Qwen3.8-Max: מודל MoE של 2.4 טריליון פרמטרים עם חלון הקשר של מיליון tokens

Alibaba חשפה את Qwen3.8-Max, מודל Mixture-of-Experts בגודל 2.4 טריליון פרמטרים שמפעיל 95 מיליארד פרמטרים לכל שאילתה, תומך בקלט טקסט, תמונה ווידאו, ומציע חלון context של מיליון tokens. הוא זמין באופן כללי דרך QwenCloud ו-Alibaba Cloud Model Studio, במחיר של 2.00 דולר למיליון input tokens ו-6.00 דולר output, עם קלט cached נמוך עד 0.25 דולר. שחרורי המודלים הפתוחים של Qwen3.8-Max ושל Qwen3.8-27B קטן יותר מתוכננים ל-12 באוגוסט 2026.
המודל כבר עושה רעש תחרותי: חשבון Qwen של Alibaba הכריז שהוא מדורג במקום ה-5 ב-Artificial Analysis Intelligence Index ובמקום ה-1 ב-Agentic Index — הופעה חזקה עבור עומסי עבודה agentic שעזרה לדחוף את הכיסוי שלו ב-Hacker News ל-464 נקודות. הפרשן העצמאי Simon Willison ציין התרגשות מיוחדת לא מהמודל Max הענק אלא מגרסאות המודלים הפתוחים 'בגודל laptop' הקרובות של Qwen 3.8, מה שמדגיש כמה משיתוף התודעה של Qwen מגיע ממודלים שניתן להריץ מקומית.
Alibaba זיווגה את השקת המודל עם איחוד פלטפורמות, ומיזגה את QoderWork, MuleRun ו-Wukong לפלטפורמת agent ארגונית מאוחדת QwenWork שנמצאת כעת ב-beta ציבורי — סימן למהלך full-stack ממודל גולמי ועד agents שנפרסו. Forbes מיסגרה את השחרור כעדות לכך שסין מצמצמת את פער היכולת עם חברות ה-AI האמריקאיות.
מבחינה תחרותית, Qwen3.8-Max נוחת באמצע מלחמת מחיר-ויכולת אינטנסיבית בסין לצד V4-Flash של DeepSeek, ולוחץ על חברות ה-AI המערביות בכלכלה לכל token בדיוק כש-OpenAI הופכת את Luna לחינמי ו-DeepSeek מזהירה מפני העלאות. חלון ה-context של מיליון tokens ותמחור הקלט ה-cached האגרסיבי מכוונים לעומסי עבודה agentic ולמסמכים ארוכים שבהם context מתמשך חשוב. פריט המעקב המרכזי הוא שחרור המודלים הפתוחים ב-12 באוגוסט: אם הגרסאות הקטנות יספקו איכות סמוכת-חזית בקנה מידה של laptop, הן עשויות להזיז באופן משמעותי את נוף ה-local-LLM.