Anthropic מורידה את סיכון ה-misalignment ל-'נמוך' — וחושפת מודל סודי בשם 'Model 2'

דוח הסיכונים השני של Anthropic הוא מקרה נדיר שבו חברת AI מובילה מעלה בפומבי את חוגת הסיכון של עצמה. העברת סיכון ה-misalignment מ'נמוך מאוד' ל'נמוך' ממוסגרת כמשקפת אי-ודאות גוברת ככל שהיכולות מאיצות — ולא כישלון מבחן ספציפי כלשהו — וזו הבחנה עדינה אך חשובה: החברה מסמנת שהביטחון שלה בשליטה נעשה דק יותר גם כשלא התרחשה פרצה קונקרטית.
החשיפה שזכתה להכי הרבה דיון היא 'Model 2' פנימי שמשיג ביצועים טובים משמעותית מ-Claude Mythos 5, ללא תוכנית לשחרור חיצוני. האישור הזה — חברה שיושבת על מודל טוב יותר מהותית שהיא לא תשלח — הזין את r/singularity (633 upvotes, 208 תגובות) ודיון ב-Hacker News. הדוח גם מציין ש-Claude כותב כעת את רוב הקוד שנכנס למערכות ה-production של Anthropic עצמה, נתון מרשים על אוטומציה של מו"פ AI, שהדוח מסמן כסיכון עתידי מרכזי אפשרי.
הגישות הספקניות חדות. Hacker News (391 תגובות) סימן חולשה פרוצדורלית: המקרה הבטיחותי נשען חלקית על כך שמודלים גרועים ב-scheming, מה ש-Anthropic מודה שלא הייתה מזהה באמינות אילו התחיל — וה-benchmark הפנימי שלה ליכולות מסוכנות רווה, כלומר סרגל המדידה אולי כבר לא מודד את מה שחשוב. הנושא הרחב של השבוע הוא 'מודלים שנחנקים או נמנעים', שהדהד בדיון נפרד ב-HN על מודלים ש'נעשים טיפשים בכוונה'. שווה לעקוב אם חברות אחרות יפרסמו הערכות סיכון עצמיות דומות או יותירו את השקיפות של Anthropic לבדה.