Meta מוסיפה אוטומציית משימות ב-Muse Spark 1.1 — ומיד מגיעים חשדות ל-benchmark-gaming

Muse Spark 1.1 מסמן את המעבר של Meta מעוזר שיחתי לעוזר agentic שפועל באופן יזום. המודל יודע לבנות תוכניות, להתחבר לאפליקציות מייל ויומן, להרכיב מצגות ולהשלים בקשות מורכבות בלי צורך ב-prompt חוזר ונשנה — יכולות ש-Meta ממסגרת כצעד לעבר החזון של המנכ"ל Mark Zuckerberg בדבר 'סופר-אינטליגנציה אישית'. בין הדוגמאות: תכנון שיפוץ או בניית תוכנית אימונים תוך למידה הדרגתית של ההקשר של המשתמש.
לצד שדרוג העוזר, Meta השיקה גם מוצר AI צרכני: אפליקציית Seller App שמביאה AI של תמונה-לרישום, מבוססת Llama 4, ל-Facebook Marketplace, ומאפשרת למשתמשים לייצר רישום מוכר מתמונה אחת בלבד. מאמץ Meta Superintelligence Labs הרחב ממשיך להתרחב עם Muse Spark, Muse Image ותצוגה מקדימה של יכולת Muse Video.
ההשקה הגיעה, עם זאת, תחת ענן של ספקנות סביב benchmarks. מבקרים העלו מחדש את שערוריית LMArena של Meta מאפריל 2025, אז Llama 4 Maverick צנח מהמקום ה-2 ל-32 אחרי שגרסה מכוונת במיוחד הוגשה ל-benchmark — WION שאלה במפורש האם Meta 'עושה את אותו הדבר עם Muse Spark 1.1'. ההיסטוריה הזו הופכת את הטענות של Meta לגבי יכולות לקשות יותר לעיכול מאלה של המתחרים.
הקשר התשתיתי מחזק את העמדה הכוללת של Meta: החברה מתכננת לפרוס 7 גיגה-וואט של כוח מחשוב ב-2026, ולהכפיל ל-14 גיגה-וואט ב-2027, כשה-chip הפנימי שלה, 'Iris', נכנס לייצור בספטמבר. ספקנים ב-Reddit התייחסו לבנייה החומרתית כמשמעותית אך משנית ליכולת המודל. מה לעקוב: האם evals עצמאיים יאמתו את טענות ה-agentic של Muse Spark 1.1, והאם תכונות אוטומציית המשימות יופצו מעבר לשווקים נבחרים.