Briefing
חזרה
AlibabaAugust 27, 20262 מקורות

Alibaba משיקה את Qwen3.8-Flash-Next: מודל פתוח 125B/6B-active עם context של מיליון token

ניתוח AI

Alibaba השיקה את Qwen3.8-Flash-Next ב-26–27 באוגוסט — מודל מולטימודלי פתוח שמציג תצוגה מקדימה של ארכיטקטורת Qwen4 הקרובה. לפי צוות Qwen, המודל מונה 125B פרמטרים בסך הכול אך מפעיל רק כ-6B לכל token — עיצוב sparse/MoE שממוטב ליעילות — ותומך ב-context מקורי של 262,144 tokens הניתן להרחבה עד מיליון. הוא ממוצב לעבודת קוד זולה ומהירה בייצור ולעבודת long-context, וכבר משולב בכלים כמו OpenCode Go.

הכלכלה היא הסיפור. על ידי הפעלת חלק מהפרמטרים לכל token, Alibaba מורידה גם את עלויות ה-training וגם את עלויות ה-inference, ומאפשרת לה לתמחר נמוך יותר תוך שהיא טוענת ליכולות מולטימודליות וחשיבה ארוכת-טווח חזקות. זה מכוון ישירות לשכבה ה'זולה-מהירה' שכיום צפופה עם DeepSeek V4-Flash, Gemini 3.7/3.8 Flash של Google ו-GLM-5.3 — שם פערי המחיר המדווחים מגיעים עד פי 5. Alibaba גם שילחה וריאנט קטן יותר, Qwen 3.8-27B, ל-Amazon SageMaker JumpStart, מה שמאותת על הפצה ארגונית מעבר לסין.

ההקשר חשוב עבור Alibaba ספציפית: לאחר capex כבד בתשתית AI, החברה דוחפת להפוך את ה-AI שלה ליעיל כלכלית, ומודלי Qwen עברו לפי הדיווחים מיליארדי הורדות. מודל דגל זול יותר הוא גם נשק תחרותי וגם מנוף רווחיות.

אנליסטים מזריקים זהירות: aibusiness ואחרים מציינים שעלות token נמוכה 'אינה כל הסיפור', ושארגונים חייבים לשקול דיוק, אמינות, latency וסחיפת שפה לפני בחירה על בסיס מחיר בלבד. ההסתייגות הזו מתוזמנת היטב — משתמשי r/DeepSeek דיווחו ש-V4-Flash 'נסחף לרוסית', תזכורת לכך שאופטימיזציית עלות אגרסיבית במודלי שכבת flash עלולה להצף רגרסיות איכות. שווה לעקוב אחר benchmarks של צד-שלישי מול DeepSeek V4-Flash ו-Gemini 3.8 Flash, והאם טענות ה-context של מיליון tokens של Qw3.8-Flash-Next יעמדו בעומסי agent אמיתיים.

מקורות
AI Briefing
·ספקים·Curated by AI agents · Updated daily · 2026
Built by Koby Almog