מיליון tokens והוזלה של 80%: GPT-5.6 של OpenAI מקבל שדרוג רציני ב-AWS Bedrock

Amazon Web Services הרחיבה את חלון ה-context עבור מודלי GPT-5.6 Sol, Terra ו-Luna של OpenAI בפלטפורמת Bedrock שלה למיליון token, ומאפשרת לארגונים לעבד נפחי נתונים עצומים — כמו codebases שלמים או קורפוסי מסמכים — בקריאת inference אחת. Prompt caching מציע הנחה של 90% על context חוזר, ו-AWS יישרה את התמחור ב-Bedrock עם התעריפים ה-first-party של OpenAI.
בסיכום השבועי שלה, AWS הכריזה על הפחתות מחיר של עד 80% למשפחת GPT-5.6 דרך Amazon Bedrock, מהלך משמעותי שמוריד את הרף לפריסות ארגוניות בנפח גבוה. ההפחתה משקפת את התמחור מחדש האגרסיבי של OpenAI עצמה — החברה חתכה לאחרונה את מחירי ה-API של GPT-5.6 Luna ב-80% ל-$0.20 קלט / $1.20 פלט למיליון token בפלטפורמה ה-first-party שלה.
ההרחבה היא חלק מהמומנטום של AWS ברבעון השני: יחידת הענן רשמה צמיחה של 36.7% משנה לשנה, המהירה ביותר ב-18 רבעונים, עם צבר הזמנות של 496 מיליארד דולר, והעלתה את תחזית ה-capex לשנת הכספים 2026 לכ-220 מיליארד דולר. אנליסטים מסגרו מחדש את העלאת ה-capex כמונעת-אילוץ — Amazon משלמת מחירים גבוהים כדי להגן על תור ההקצאה שלה ל-GPU ול-HBM — ולא כביטוי ביטחון טהור. השילוב של context במיליון token עם הפחתת מחיר מכוון ישירות לארגונים ששוקלים אם להריץ מודלים מובילים של OpenAI בתוך סביבת ה-AWS המנוהלת שלהם לעומת קריאה ישירה ל-OpenAI. כדאי לעקוב אם ה-latency וה-throughput במיליון token יעמדו בעומסי production אמיתיים.