Anthropic מעלה את סיכון ה-misalignment ל׳נמוך׳, חושפת Model 2 סודי — ורושמת רבעון רווחי ראשון

דוח הסיכונים האחרון של Anthropic מסמן שינוי בולט בחשבונאות הבטיחות של החברה עצמה: היא העלתה את הערכת הסיכון של misalignment קטסטרופלי בדרגה אחת, מ'נמוך מאוד' ל'נמוך'. במקביל, Anthropic חשפה את 'Model 2', מערכת מובילה פנימית שהיא מתארת כמסוגלת יותר מ-Claude Mythos 5 הזמין לציבור אך שלא שחררה. הדוח מזהיר ש-R&D של AI אוטומטי ומאיץ-את-עצמו עשוי להפוך לקטגוריית סיכון מרכזית ככל שמודלים מתחילים לתרום באופן משמעותי לפיתוח היורשים שלהם.
הגילוי הפיננסי משמעותי לא פחות. Anthropic דיווחה על הכנסות Q2 של 11.5 מיליארד דולר עם רווח תפעולי מתואם חיובי — הרבעון הרווחי הראשון שלה — אבן דרך שממסגרת אותה מחדש מחברת מחקר שורפת מזומנים לעסק מסחרי בר-קיימא. הדוח גם אישר שפלט של Claude נושא כעת watermarks בלתי-נראים מסוג SynthID-Text לצורך ציות ל-EU AI Act, וקשר את נרטיב הסיכון למחלוקת ה-watermarking שסערה בקרב בסיס המשתמשים שלה באותו שבוע.
תגובת הקהילה נחצתה בחדות. חלק שיבחו את השקיפות של שדרוג פומבי של קטגוריית סיכון וחשיפת מודל לא-משוחרר כגילוי-לב זהיר. אחרים קראו זאת באור קודר יותר: מדוע לגנוז מודל מסוגל יותר Model 2 אלא אם יש חששות בטיחות לא-מגולים, ומה זה אומר שמדדי הזיהוי של Anthropic עצמה 'רוויים'? שרשור סוער ב-X משך תגובה ישירה נדירה מ-Dario Amodei, וסיקור ב-r/Anthropic וב-moneycontrol הגביר את האזהרה ש'R&D של AI עלול להאיץ במהירות'.
עבור התעשייה, הדוח הוא נקודת נתונים בנושא הגדול יותר של השבוע — חברות ה-AI המובילות מתחרות בו-זמנית על יכולת ומתחזקות עמדה על בטיחות וכלכלה. השאלות הפתוחות: האם 'נמוך' הוא הערכה מחדש אמיתית או גידור, מתי (או האם) Model 2 יישלח, והאם רווחיות ב-11.5 מיליארד דולר משנה את תיאבון הסיכון של Anthropic לקראת סבב הגיוס הענק המדווח.