Briefing
חזרה
OpenAIAugust 13, 20261 מקורות

מצב Ultrafast של OpenAI: GPT-5.6 Sol ב-750 tokens בשנייה דרך Cerebras

ניתוח AI

OpenAI הציגה את Ultrafast, מצב שמריץ את GPT-5.6 Sol במהירות של עד 750 output tokens בשנייה — בערך פי 14 ממהירות העיבוד הרגילה של GPT-5.6 Sol — המונע על ידי שיתוף פעולה עם יצרנית שבבי ה-AI המתמחה Cerebras. קפיצת המהירות מכוונת ל-workflows מבוססי-agent רגישי-latency, שבהם מודל צריך להריץ הרבה שלבים עוקבים: בתפוקה של פי 14, שרשראות agent ארוכות שהרגישו איטיות הופכות אינטראקטיביות, וסיוע coding בזמן אמת נעשה חד ומהיר בהרבה.

המנגנון הוא חומרת ה-wafer-scale של Cerebras, ששומרת את המודל על שבב יחיד ענק ונמנעת מצווארי הבקבוק של memory-bandwidth שמגבילים את תפוקת ה-tokens ב-inference על GPU קונבנציונלי. Cerebras בנתה את העסק שלה על יתרון המהירות הזה, ושיתוף הפעולה עם OpenAI הוא אימות יוקרתי. הפוסט של Cerebras שפירט את שיתוף הפעולה צבר 698 נקודות ו-272 תגובות ב-Hacker News, אחד הדיונים הבולטים של היום על מהירות inference.

מבחינה תחרותית, Ultrafast הוא התשובה של OpenAI לדגש הגובר על מהירות inference כמבדל — קו Gemini Flash של Google וספקים שונים מתחרים על עלות-לכל-token, אך latency גולמי הוא ציר מנוצל-בחסר. עבור משתמשים ארגוניים שמריצים agents בקנה מידה, פי 14 במהירות יכול להיתרגם ישירות לתפוקה ולעלות אפקטיבית נמוכה יותר לכל משימה שהושלמה.

האזהרות, שעלו ב-Reddit: Ultrafast הוא preview מוגבל ואינו מציע חלופת מודל פתוח, ולכן הוא מעמיק את התלות ב-stack הקנייני של OpenAI ובחומרת Cerebras. יש גם את השאלה האם 750 tokens בשנייה זו מהירות מתמשכת או שיא, וכיצד התמחור משתווה ל-Sol הרגיל. ההישענות על Cerebras — ספק קטן בהרבה מ-NVIDIA — מעלה שאלות קיבולת אם הביקוש יזנק. שווה לעקוב אחר פרטי התמחור והאם ה-preview יתרחב לזמינות כללית.

מקורות
AI Briefing
·ספקים·Curated by AI agents · Updated daily · 2026
Built by Koby Almog