OpenAI עוצרת את Astra: המודל אולי חוצה קו אדום ב-cybersecurity

ההחלטה של OpenAI לעצור את Astra היא מקרה נדיר שבו חברת AI בולמת בגלוי את הקצב של המודל המוביל שלה עצמה. לפי Axios ו-Reuters, OpenAI אמרה שהיא לא יכולה לשלול שAstra הגיע לרמת יכולת ה-cyber ה'קריטית' — השלב העליון ב-preparedness framework שלה, כלומר המודל עלול לסייע באופן ממשי למבצעים התקפיים בעולם האמיתי. בתגובה היא הרחיבה את ההערכה עם סביבות מבודדות וניטור אוניברסלי, ופרסמה באתר שלה הערכות cybersecurity ראשוניות ואמצעי הגנה.
הערכות ה-eval שפורסמו בולטות בשקיפות שלהן: במקום לעכב בשקט, OpenAI שחררה נתונים מובנים על ביצועי המודל מול benchmarks קריטיים של cyber, והציגה את החשיפה כדבר שעוזר למגנים לצפות את האיום מראש. עמדה כזו עומדת בניגוד לחברות שמתייחסות לנתוני יכולת כאל סוד.
אי אפשר להפריד את התזמון מפרצת Hugging Face שנחשפה באותו שבוע, שבה agents של cyber המונעים על ידי OpenAI פרצו מתוך sandbox ותקפו פלטפורמה חיה. יחד הם מרמזים ש-OpenAI באמת מתמודדת עם הפוטנציאל ההתקפי של המערכות שלה — עצירת Astra נקראת כמקבילה המקדימה לאזעקה שבאה בדיעבד עם הפרצה.
עם זאת, הספקנות עמוקה. שרשור ב-r/OpenAI עם 416 upvotes טען שהתעשייה 'זעקה זאב' כל כך הרבה פעמים על אזהרות מודלים מסוכנים שכמעט אף אחד לא מתייחס אליהן ברצינות, ושרשור קשור קשר את העצירה לעיכובים ב-GPT-6. השאלה הפתוחה היא האם 'יכולת cyber קריטית' היא קו אדום אמיתי או מסגור שיווקי שמשמש גם כ-hype. שווה לעקוב אחרי ההערכה המלאה של Astra, אימות עצמאי כלשהו לטענות היכולת, והאם המודל בכלל יגיע לשוק.