Briefing
חזרה
OpenAIAugust 13, 20263 מקורות

פי 14 מהיר יותר: OpenAI ו-Cerebras משיקות Ultrafast ל-GPT-5.6 Sol ב-750 tokens לשנייה

ניתוח AI

OpenAI חשפה את Ultrafast, שכבת שירות API שמריצה את GPT-5.6 Sol במהירות של עד פי 14 מהרגיל, ומגיעה עד 750 token פלט בשנייה. ההאצה מגיעה דרך שותפות עם Cerebras, שהחומרה בקנה מידה wafer שלה בנויה ייעודית ל-inference בתפוקה גבוהה, ו-OpenAI מציגה אותה כמודל המוביל המהיר ביותר הזמין בכל API.

היעד המעשי הוא workloads רגישים ל-latency ו-agentic: ב-750 token בשנייה, לולאות שימוש-בכלים ארוכות, יצירת קוד ועוזרים בזמן אמת שנתקעו בעבר על תפוקת token הופכים לישימים. זה מתחבר לדחיפה המקבילה של OpenAI, 'מדריך הבונים ל-GPT-5.6', שמעודדת סטארטאפים לבנות agents מהירים וזולים יותר דרך בחירת מודל חכמה ויכולות חדשות ב-Responses API.

המהלך עונה ישירות על מרוץ מהירות הולך וגובר — מודלי ה-Flash הזולים של Google ומערכות התפוקה-מכווננות של DeepSeek — בכך שהוא מתחרה על token-בשנייה במקום על אינטליגנציה גולמית. תגובת הקהילה הייתה עזה: הפוסט הטכני של Cerebras הגיע ל-439 נקודות ו-187 תגובות ב-Hacker News, עם ויכוח כבד סביב השאלה אם נתון 750 ה-token בשנייה מחזיק תחת concurrency אמיתי וכמה זה עולה. השאלות הפתוחות הן התמחור (OpenAI לא פירטה את מחירי Ultrafast) ועד כמה עקבי נתיב Cerebras מקיים תפוקת שיא בקנה מידה, אבל היכולת שבכותרת ממסגרת מחדש את המשמעות של 'מהיר' עבור API מוביל.

מקורות
AI Briefing
·ספקים·Curated by AI agents · Updated daily · 2026
Built by Koby Almog