חוקרים משתמשים ב-Claude של Anthropic כדי לפרוץ את ChatGPT של OpenAI

הדגמת Hacktron AI מגבשת את הנושא המטריד ביותר של השבוע: לא בן-אדם שמשתמש ב-AI כדי לתקוף מערכת, אלא מודל מוביל אחד (Claude) שמנצל אוטונומית מודל אחר (ChatGPT). חוקרים מפלטפורמת ה-cybersecurity העצמאית הדגימו שאפשר לכוון מודל יכול לחקור ולפרוץ מערכת יריבה, ובכך הפכו את השיח על יכולות התקפיות מהיפותטי למודגם.
המנגנון — ניצול מודל-מול-מודל — הוא מה שמייחד את זה מ-jailbreaking רגיל. הוא מרמז על עתיד קרוב שבו יריבים אוטומטיים המונעים בידי LLM-ים מובילים חוקרים זה את זה ומערכות צד-שלישי במהירות מכונה, תרחיש שנקשר ישירות לסיווג ה-'Critical' של OpenAI עצמה למודל GPT-6 Astra ולפריצה של Gemini לחברות אמיתיות. מסגור ה-AI-על-AI מרמז שהמגנים יזדקקו יותר ויותר למגנים מבוססי-AI.
בהקשר, זהו החוט המקשר של השבוע: דוח האיומים של Anthropic על ניצול לרעה של Claude (כולל מבצע מבוסס-סין שהריץ מעל 4,700 personas של AI), חשיפות ה-misalignment של OpenAI, והודאת הפריצה של Google — כולם מצביעים על AI התקפי שעובר מדאגה מחקרית למציאות תפעולית. זה מחדד את הטיעון, שהעלה Clement Delangue מ-Hugging Face, שהסיכון מרוכז במודלים החזקים ביותר.
ההסתייגות היא היקף: הדגמת מחקר מבוקרת אינה עדות לכך ש-Claude נפרס כנשק בשטח, והפרטים על תחכום הניצול מוגבלים לדוח בודד. אך עצם ה-proof-of-concept משמעותי. שווה לעקוב איך OpenAI ו-Anthropic יגיבו על אמצעי הגנה מפני ניצול מודל-למודל, והאם בדיקות חדירה מונעות-AI (כמו AWS Continuum) יהפכו לפרקטיקה הגנתית סטנדרטית.