OpenAI משפרת את prompt caching ב-GPT-6 עם שיעורי פגיעה גבוהים יותר ו-breakpoints מפורשים

לצד השקת GPT-6 Sol ו-Luna, OpenAI שחררה שדרוג טכני ל-prompt caching של GPT-6 שמכוון היישר לכלכלת המפתחים. השינויים כוללים שיעורי cache hit גבוהים יותר, breakpoints מפורשים שמאפשרים למפתחים לסמן היכן מסתיים ה-context שניתן לשמור ב-cache, אבחון חדש לראות את התנהגות ה-caching, ובקרות עדינות יותר שיחד מפחיתות גם latency וגם עלות.
Prompt caching חשוב במיוחד ל-workloads מסוג agent ו-RAG ששולחים שוב ושוב בלוקי context גדולים ויציבים (system prompts, סכימות של כלים, מסמכים) בכל קריאה. על ידי העלאת שיעורי ה-hit וחשיפת breakpoints מפורשים, OpenAI מאפשרת למפתחים להבטיח שחלק גדול יותר מה-context החוזר יוגש מה-cache במקום לעבור עיבוד מחדש, מה שחותך את העלות לקריאה ומאיץ את התגובות.
המסגור האסטרטגי עקבי עם מלחמת המחירים של השבוע: מעבר להורדה בחצי של מחירי ה-token ל-Sol ו-Luna, caching טוב יותר מוריד עוד את העלות האפקטיבית למשימה — המדד ש-Sam Altman הדגיש כשאמר שהמודלים החדשים 'עולים אף פחות למשימה'. עבור פיצ'רים ב-production בנפח גבוה, רווחי ה-caching יכולים להיות חשובים לא פחות ממחירי ה-token של הכותרת.
מבחינה תחרותית, prompt caching הוא כבר סטנדרט בסיסי — גם Opus 5.5 של Anthropic וגם ה-harness של Strands מ-AWS נשענים על caching וניהול context (Strands טוענת ל-28% פחות עלות token בין השאר בזכות ברירות מחדל אלה). בקרת ה-breakpoints המפורשת של OpenAI היא מבדל בחוויית המפתח, שנותנת יותר דטרמיניזם מ-caching מובלע. האזהרה: רווחי ה-caching תלויים מאוד בצורת ה-workload, כך שהחיסכון בעולם האמיתי ישתנה, ומפתחים ירצו לאמת את טענות ה-hit-rate עם האבחון החדש. מה לעקוב: האם מודל ה-breakpoint המפורש יהפוך לסטנדרט דה-פקטו שספקים אחרים יעתיקו.