OpenAI מגדילה את פלטפורמת האחסון Habitat כדי לשרת מיליארד משתמשי ChatGPT

לפי הבלוג ההנדסי של OpenAI, Habitat התחיל את דרכו כספריית Python פנימית וצמח לפלטפורמת אחסון מבוזרת גלובלית שעומדת בבסיס ChatGPT. המספרים שבכותרת מדהימים: מיליארד משתמשים ו-22 מיליון בקשות בשנייה, נתונים שמכמתים עד כמה טביעת הרגל של ChatGPT הפכה לענקית ואת התשתית הנדרשת כדי לשמור עליו רספונסיבי ברחבי העולם.
הפוסט ממוסגר כ-'חלק ראשון', מה שמרמז על סדרה שתפרט את הבחירות הארכיטקטוניות — חלוקת נתונים, replication, עקביות וניהול latency — הנדרשות כדי לפעול בקנה מידה כזה. עבור חברה שרק נאלצה להשהות את תוכנית ה-Pro שלה ב-200$ לחודש כי GPT-6 Astra הציף את הקיבולת (סיפור נפרד), פרסום פנימיות של scaling אחסון משמש גם כאיתות שהמגבלה היא כוח מחשוב ל-inference, ולא שכבת האחסון של נתוני המשתמשים.
הקהילה ההנדסית קוראת פוסטים כאלה כמו שקראה את המאמרים המוקדמים של Google על Bigtable ו-Spanner: כחלון להצצה לאופן שבו hyperscaler פותר בעיות שרוב החברות לעולם לא נתקלות בהן. הנתון של '22M בקשות בשנייה' בפרט ממקם את ההיקף של ChatGPT ביחס לשירותים אחרים בקנה מידה של האינטרנט ומדגיש את המעבר של OpenAI מחברת AI מחקרית למפעילת תשתית מן המניין.
מבחינה אסטרטגית, הבעלות על ה-stack הזה והיכולת לתאר אותו חשובה למחויבויות האמינות ללקוחות ארגוניים (המגזר הפיננסי, חוזים ממשלתיים) שזקוקים להבטחות ש-ChatGPT יכול להתרחב ללא כשלים בשלמות הנתונים או בזמינות. זה גם ממצב את הידע התשתיתי של OpenAI כגורם מבדל מול מתחרים שנשענים על אחסון מנוהל של ספקי ענן. הסתייגויות: בלוג של חברה הוא דיווח עצמי, דל בטרייד-אופים הקשים ביותר, ולא מציע benchmarks עצמאיים. שווה לעקוב אחר החלקים הבאים לארכיטקטורה קונקרטית והאם OpenAI תפתח ב-open-source או תהפוך למוצר משהו מ-Habitat.