מחקר של Apple חושף את Agent Seer ובוחן חוסר-עקביות בייסיאני ב-LLM

Agent Seer מייצר תרחישי בדיקה להערכת AI agents שמשתמשים בכלים, על ידי ניצול מפרטי הכלים — שמות פונקציות ותיאורים בשפה טבעית — במקום להסתמך על benchmarks סטטיים שנכתבו ידנית. היתרון המרכזי הוא שהוא מתרחב על פני מערכות אקולוגיות של כלים שמתפתחות במהירות ושאותן benchmarks קבועים לא מסוגלים לעקוב אחריהן — בעיה בוערת כשספריות הכלים של agents משתנות מדי שבוע.
המאמר השני חוקר LLMs כחוקי עיבוד מידע כדי לכמת חוסר עקביות פנימי באמונות ההסתברותיות שלהם, ומראה שהמודלים 'לא עקביים באופן בייסיאני' — הם נכשלים בעדכון רציונלי של אמונות לא-ודאיות כשהעדויות מגיעות. Apple ממסגרת זאת כמשמעותי לתחומים בעלי סיכון גבוה כמו רפואה, מדע ומשפט, שבהם מערכת חייבת לייצג ולעדכן אי-ודאות בצורה קוהרנטית.
יחד, העבודות מסמנות שתפוקת המחקר של Apple נשארת חזקה גם בזמן שהיא מקצצת בכוח האדם של Siri ושל מוצרי ה-ML — מתח שעובר לאורך השבוע של Apple. שני המאמרים גם נוגעים ברגע הרחב יותר של agentic-safety בתעשייה: Agent Seer מציע גישת הערכה מתרחבת בדיוק כשה-breach של Hugging Face חשף כמה גרוע agents נבדקים לפני deployment, והמחקר הבייסיאני מכמת בדיוק את אותו סוג של חוסר-אמינות בהיסק שהופך agents אוטונומיים למסוכנים. שווה לעקוב אם השיטות האלה יגיעו למוצרים של Apple עצמה או ישפיעו על תקני הערכה בתעשייה.