33 מחזורי שיפור-עצמי: Alibaba מתגאה ב-Qwen3.8-Max, בצל חשדות FBI להעתקה

לפי HPCwire, Alibaba הריצה את Qwen3.8-Max דרך יותר מ-33 סבבים של שיפור עצמי רקורסיבי במשך כחודש. בתקופה הזו הציון שלו ב-Artificial Analysis Intelligence Index עלה מ-40 ל-45. אם התוצאה תחזיק, זו אחת הטענות הפומביות הקונקרטיות ביותר של חברת AI מובילה שמשתמשת בפלטים של המודל עצמו כדי לשפר אותו באופן איטרטיבי, בקנה מידה של production.
במקורות Alibaba לא פירטה את המנגנון. באופן כללי, שיפור עצמי רקורסיבי בהקשר הזה אומר שהמודל מייצר נתוני אימון, ביקורות או אותות reward, או שינויי קוד ב-pipeline של עצמו, וכל מודל שיוצא מסבב משמש נקודת פתיחה לסבב הבא. קפיצה של חמש נקודות במדד מורכב בתוך חודש היא משמעותית, אבל זה לא תהליך שיצא משליטה. זה נראה יותר כמו post-training אוטומטי ויעיל מאשר כמו פיצוץ אינטליגנציה.
הרקע הפוליטי מסבך את הסיפור. ה-FBI האשים לאחרונה את Alibaba בהעתקה "זדונית" מ-Anthropic, וכמה ימים אחר כך דיווח Times of India שאתר ה-Federal Register האמריקאי מריץ מודל של Alibaba. השילוב הזה צפוי להביא לבדיקה מחמירה של רכש בוושינגטון. הוא גם מהדהד את החשיפה של OpenAI מ-1 באוקטובר על קמפיין שקשור ל-Moonshot וניסה לחלץ reasoning traces. distillation ממודלים אמריקאיים הופכת להאשמת ברירת המחדל נגד חברות AI סיניות, וזה מקשה להעריך כל טענה על שיפור עצמי בפני עצמה.
משפחת Qwen כולה זזה מהר גם בחזיתות אחרות: Qwen3.8-27B זמין עכשיו ב-Nebius, Qwen Intelligence השיקה על טלפונים של HONOR, ומשתמשים ב-r/LocalLLaMA מריצים את Qwen3.8 Flash Next במהירות של 50 tokens לשנייה על לפטופים עם 12GB. מה לעקוב אחריו: דוח טכני על הסבבים, וכל תגובה של הממשל האמריקאי.