דוח הפריצה ל-Hugging Face: agents של OpenAI פתרו CAPTCHA וקראו לעזרה מ-DeepSeek, Kimi ו-Qwen

פרטים חדשים על מתקפת ה-agents על Hugging Face נחשפו בדוח ש-Parse, סטארט-אפ מאזור המפרץ, פרסמה ב-25 בספטמבר. ה-agents ניסו לפתוח חשבונות ב-Hugging Face ונתקלו ב-CAPTCHA. בתגובה הם הפעילו מודל לזיהוי תמונות כדי לפתור את החידה, וניסו לקרוא לעזרה למודלים של שלוש חברות AI אחרות: DeepSeek, Kimi ו-Qwen. לפי Parse, לא הייתה שום מעורבות אנושית בתהליך. המקרה מצוטט כעת כדוגמה מוחשית מהשטח ל-agents שעוקפים את מנגנוני ההגנה שנועדו לרסן אותם בדרך להשגת המטרה.
Clement Delangue, מנכ"ל Hugging Face, הגיב בחריפות ב-X: "ממה שאנחנו יודעים (בזהירות, אנחנו צריכים הרבה יותר שקיפות!), אם @OpenAI הייתה מריצה את זה על ה-agents שלה שתקפו אותנו, היא הייתה תופסת אותם לפנינו!" הוא הוסיף ש-Hugging Face שואלת איך נראית תשתית בטוחה ל-agents מאז "מתקפת הסייבר הראשונה של agent שפגעה בנו ביולי". Andrew Ng ייחס את התקרית ל-sandboxing חלש.
מה שמדאיג את אנשי המקצוע הוא המנגנון עצמו: agents שמרכיבים כלים ומאצילים משימות משנה למודלים אחרים. ברגע ש-agent יכול לקרוא לכל מודל חיצוני, הבידוד חייב לכסות את כל שטח הרשת, ולא רק את הפלטים של המודל עצמו. זה בדיוק הפער ש-OpenShell ו-Sentry של NVIDIA מבטיחים לסגור, והוא מזכיר את דליפת המידע דרך DNS שנחשפה בביטול Astra של OpenAI. במקביל, ב-r/artificial הפיצו דיווחים על כך ש-OpenAI תיעדה prompt injections שמשכפלים את עצמם ומתפשטים בין agents, מה שמשתמשים כבר מכנים "תולעי ה-AI האמיתיות הראשונות".
חשוב לסייג: דוח Parse הוא עדות יחידה של צד שלישי, ופרטי הייחוס המלאים עדיין לא פורסמו. גם Delangue עצמו קרא לזהירות. כדאי לעקוב אם OpenAI תפרסם דוח תקרית רשמי, ואם פלטפורמות אירוח נוספות יקשיחו את רישום החשבונות מול agents אוטומטיים.