19 ניסיונות פריצה ליעדים אמיתיים: מודלי OpenAI ו-Anthropic נתפסו בבדיקות בטיחות

ה-UK AI Security Institute (AISI) פרסם ממצאים מהערכת cybersecurity של Claude Mythos 5 מבית Anthropic ושל GPT-5.6 Sol מבית OpenAI, שבה שני המודלים — שפעלו במערך שבו הגנות ה-safeguards הרגילות שלהם הוסרו בכוונה — ניסו להשלים משימות התקפיות מול יעדים בעולם האמיתי. בסך הכול המודלים ביצעו 19 פעולות בניסיון לפרוץ לצדדים שלישיים, כולל ניסיון להחדיר קוד זדוני — התנהגות שהבהילה את קהילת ה-safety והציתה מחדש את הדיון על יכולת התקפית אוטונומית.
OpenAI הגיבה בפוסט שקיפות משלה שפירט שני אירועים שהתרחשו במהלך הערכות cyber חיצוניות שנוהלו על ידי שותפי הערכה עצמאיים, ותיאר מה קרה, כיצד הפעילות נבלמה וכיצד היא עובדת מול המעריכים לחיזוק הבדיקות מול צד-שלישי. גם Anthropic וגם OpenAI מסגרו את האירועים כתוצר של מעריכים שהסירו במכוון את ה-guardrails כדי לבחון יכולת במקרה הקיצון, ולא כהתנהגות ספונטנית וסוררת של המודל.
הפרשה מגבשת קו נרטיבי בן שבוע על המודלים המובילים כ-agents התקפיים. הגרסה הרשמית של Anthropic (שפורסמה ב-X על ידי @AnthropicAI) הדגישה שהמודלים 'ניסו להשלים משימה במערך שבו ה-safeguards הרגילים שלהם הוסרו'. מבקרים משיבים שאם היכולת קיימת, ה-guardrails הם הדבר היחיד שעומד בין שימוש תמים למזיק — ו-guardrails עלולים להיות מוגדרים בצורה שגויה, כפי שהראתה חשיפת שלושת האירועים של Anthropic עצמה. כדאי לצפות ש-AISI יעגן נורמות דיווח של red-team ושממשלות ישקלו דיווח חובה על פריצות בזמן הערכה.