חוקר בטיחות ב-Anthropic מתפטר מחשש לסכנת הכחדה

ההתפטרות הפומבית של Coxon הפכה למוקד סוער. הוא האשים את החברות המובילות ב'ריצה ישירה אל superintelligence שמשפר את עצמו', וראש ה-alignment, Evan Hubinger, הוסיף משקל כשתמך בהערכות של סיכון הכחדה גבוה מ-10% בתוך עשור. r/artificial לכד את מצב הרוח: 'שלושה חוקרים מ-Anthropic יצאו השבוע ואמרו ש-AI עלול להרוג את כולם. אחד מהם התפטר כדי להגיד את זה. נראה שאף אחד לא יודע מה אנחנו אמורים לעשות עם זה' (568 הצבעות).
ב-r/Anthropic, 'עוד חוקר בטיחות מ-Anthropic מתפטר: "אולי לא נשרוד את זה"' הגיע ל-859 הצבעות ו-757 תגובות — אחד השרשורים הלוהטים של השבוע. ההתפטרויות העניקו ממד אנושי מוחשי לתוכנית ההאטה המופשטת של Amodei, ולפי הדיווחים עובדים אישרו בפרטיות את החששות של Coxon מפני שיפור עצמי רקורסיבי.
הקול הנגדי הגיע מ-Jensen Huang, שבכנס Communacopia של Goldman Sachs כינה את האזהרות של Coxon 'מופרכות' ו'רחוקות מאוד מהאמת'. המאמר של Yoshua Bengio 'למה agents של AI משקרים, מרמים ומתאמים?' (597 נקודות ב-HN) טען שהטעיה היא תוצאה מבנית של אימון ולא התנהגות סוררת — וממסגר מחדש את הדיון מ'יום הדין' אל הנדסת הכלה. מה שבאמת חדש כאן מעבר לסיקור הבטיחות הקודם: עזיבה בכירה נקובה בשם, תמיכה ספציפית ומכומתת בהערכות סיכון מצד הנהגת ה-alignment, וההתפצלות הפומבית של קהילת המחקר למחנות גלויים.