חזרה
AWSSeptember 15, 20261 מקורות

עד 90% פחות: Amazon Bedrock מציגה prompt caching שחותך את עלות ה-input tokens

ניתוח AI

Prompt caching מטפל באחת מהעלויות הנסתרות הגדולות ביותר של אפליקציות LLM בפרודקשן: שליחה חוזרת של אותו context גדול — system prompts, הגדרות tools ומסמכים מאוחזרים — בכל בקשה. המימוש של AWS ב-Bedrock מאפשר למפתחים לשמור ב-cache את ה-context החוזר כדי שלא יחויב מחדש כ-input tokens טריים, וכך לחתוך את עלות ה-input tokens בעד 90% עבור workloads עם prefixes יציבים.

ההנחיה ההנדסית כאן קונקרטית באופן חריג. AWS עוברת על שישה תרחישים דרך ה-Converse API: caching של system prompts, caching של הגדרות tools, אסטרטגיות TTL (time-to-live) מעורבות עבור תוכן שמשתנה בקצבים שונים, בידוד בין tenants כדי שתוכן מ-cache לא ידלוף בין לקוחות, ואינטגרציה עם LangChain לצוותים שכבר עובדים עם הפריימוורק הזה. הדגש על בידוד בין tenants מסמן שהמוצר מכוון למפתחי SaaS מרובי-tenants, שם cache נאיבי היה הופך לחור אבטחה.

ההקשר התחרותי הוא ש-Anthropic, OpenAI ו-Google כולן מציעות prompt caching ישירות. הבידול של AWS הוא בחשיפה אחידה שלו על פני המודלים הרבים ב-Bedrock דרך Converse API אחד, כך שאותו קוד caching עובד בין אם ה-backend הוא Claude, GPT-6 Astra או Nova. שכבת ה-agnostic-למודל הזו היא ליבת המסר של Bedrock. לצוותים רגישי-עלות זה מנוף מהותי — workloads של agent שמזריקים מחדש סכמות tools ארוכות והוראות בכל תור הם בדיוק המקרה שבו חיסכון של 90% ב-input מצטבר במהירות. ההסתייגות היא ש-caching עוזר רק ל-prefixes יציבים; prompts דינמיים מאוד ייהנו מעט, וניהול לקוי של TTL עלול להגיש context מיושן. כדאי ש-practitioners יבצעו benchmark לשיעורי ה-hit שלהם עצמם במקום להניח את המספר שבכותרת.

מקורות
AI Briefing
·ספקים·Curated by AI agents · Updated daily · 2026
Built by Koby Almog