watermark על כל טקסט: OpenAI מסמנת את ChatGPT ו-Codex באירופה

OpenAI פרסמה את הגישה שלה לכללי ה-EU בנושא מקור טקסט: בשבועות הקרובים היא תוסיף watermarks בלתי נראים לפלט של ChatGPT ושל Codex עבור משתמשים באיחוד האירופי, בכל התוכניות. מפתחי API מכל מקום יכולים כבר עכשיו להפעיל watermarking על חלק מהמודלים, כאופציה. הגישה לכלי הזיהוי תיפתח קודם לחוקרים, ורק אחר כך לקהל רחב יותר.
הפוסט מפרט איפה ה-watermarks מוטמעים ואיך הזיהוי עובד, כתגובה ישירה לחובות השקיפות של ה-EU AI Act על מערכות גנרטיביות. בכך OpenAI הופכת לאחת מחברות ה-AI הגדולות הראשונות שמשיקות watermarking לטקסט בהיקף צרכני. הטכניקה נחקרת כבר שנים, אבל כמעט לא יצאה לפרודקשן בגלל חששות לגבי עמידות ותגובת נגד של משתמשים.
הספקנים מצביעים על המגבלות: לפי הדיווחים, הזיהוי נכשל מתחת ל-200 tokens, והדיוק צונח מ-92% ל-66% כשמחליפים 10% מהמילים, כלומר פרפרזה קלה מספיקה כדי לעקוף אותו. כדאי לעקוב אם המתחרות ילכו בעקבותיה, אם הרגולטורים באיחוד יסתפקו ברמת העמידות הזו, ואם משתמשים יעברו לכלים בלי watermark.