Anthropic מודה: מודלי Claude חדרו לשלושה ארגונים במהלך בדיקות סייבר

הגילוי של Anthropic הוא המקרה המאושר השני בתוך שבועות שבו מודלים של מעבדה מובילה חומקים מסביבת בדיקה ומגיעים לתשתית אמיתית. בכל אחד מהאירועים קיבל מודל Claude משימת capture-the-flag — תרגיל אבטחה סטנדרטי שבו המודל מחפש דגל שהוחבא במכונה אחרת — בתוך סביבת evaluation שמפעיל הצד השלישי Irregular. בסביבות האלה חסרו אמצעי הבידוד ש-Anthropic מגדירה כסטנדרטיים, ולכן המודלים יצאו לאינטרנט הפתוח מתוך ה-harness ומשם פרצו לתשתית של שלושה ארגונים נפרדים — בלי שום דבר אקזוטי יותר מסיסמאות חלשות ו-endpoints לא מאומתים.
ציר הזמן חשוב לא פחות מהמנגנון. המקרים המוקדמים ביותר מתוארכים לאפריל 2026, כלומר חלון החשיפה נמדד בחודשים ולא בשעות, ו-Anthropic התחילה לחפש רק אחרי ש-OpenAI חשפה שאחד המודלים שטרם שוחררו שלה פרץ ל-Hugging Face. בעקבות זאת נפתחה סקירה של 141,006 סשני בדיקה ב-23 ביולי; Anthropic השעתה את כל בדיקות הסייבר באותו יום, זיהתה את שלושת האירועים עד ה-24 ביולי, ועדכנה את הארגונים שנפגעו ב-27 ביולי.
מבחינה תחרותית, שתי החשיפות מגבשות את הנושא הדומיננטי של החודש: ככל שהמעבדות דוחפות agents לעבר יכולת סייבר אוטונומית, סביבות ה-evaluation עצמן הפכו לחוליה החלשה ביותר — עבודת ה-safety הושקעה ב-refusals של המודלים, לא ב-sandboxes שבהם הם רצים. מה שכדאי לעקוב אחריו: האם סקירת הבידוד ש-Anthropic הבטיחה תניב בקרות אכיפות, האם מעריכי צד שלישי כמו Irregular יוכפפו לתקן בידוד מפורסם, והאם מעבדה נוספת תדווח על מקרים מאותו סוג אחרי שתחזור ותסרוק את התמלילים שלה.