Perplexity סומכת על GPT-6 Astra עם מערכות production מקצה לקצה

מקרה הבוחן הוא חלק מהמאמץ של OpenAI להוכיח ש-Astra מוכן לפרודקשן לעבודת agent בסיכון גבוה, ולא רק לצ'אט. Perplexity אומרת שהיא משתמשת במודל לכתיבת תקשורת פנימית, לשינוי תוכנה ולניטור מערכות פרודקשן, ו — הטענה המרכזית — בודקת אותו הרבה פחות תכופות מאשר עם מודלים קודמים, מה שמעיד שה-agent מריץ לולאות אוטונומיות ארוכות יותר עם פחות פיקוח אנושי.
מסגור ה'אמון' הזה הוא הדחף האסטרטגי: OpenAI טוענת ש-Astra חוצה סף אמינות שבו מהנדסים יכולים להאציל ניטור של מערכות חיות. בשילוב עם מקרה בוחן נלווה על Devin של Cognition שמשתמש ב-Astra כדי לבדוק את העבודה של עצמו, OpenAI בונה נרטיב ש-Astra סוגר את לולאת האימות-העצמי שמנעה מ-agents להגיע לפרודקשן.
ההקשר הופך את זה לחרב פיפיות. באותו שבוע, תלונות על שדרוג לאחור של Astra של OpenAI עצמה צפו ב-Reddit, ודוח האיומים של Anthropic תיעד agents שמנוצלים כנשק — כך ש'פחות פיקוח אנושי על מערכות פרודקשן' עומד בניגוד לחרדת הבטיחות המקבילה של התעשייה. האם הפקדת agent על ניטור פרודקשן היא יעילות זהירה או האצלה מוקדמת מדי היא בדיוק המתח שעליו נסוב מאמר ההאטה של Amodei.