חזרה
AWSSeptember 10, 20261 מקורות

SageMaker Inference מוסיף ניתוב מודע-prefix — עד 77% פחות latency ל-LLM

ניתוח AI

ניתוב מבוסס-prefix תוקף חוסר יעילות ספציפי בהגשת LLM: כאשר בקשות חולקות prefix משותף — system prompt, בלוק context של RAG, או סכמת כלים של agent — ניתוב שלהן ל-instances שונים מכריח כל אחד לחשב מחדש את אותו KV cache מאפס. על ידי הכוונת בקשות עם אותו prefix לאותו instance, SageMaker שומרת את ה-cache חם ומדלגת על prefill מיותר.

השיפורים שנמדדו משמעותיים: עד 77% הפחתה ב-P50 time-to-first-token על Llama 3.1 70B, כששיעורי פגיעה ב-cache קופצים מכ-25% ליותר מ-80%. עבור עומסי agentic ו-RAG, שבהם prefix משותף וארוך הוא הנורמה, זה מיתרגם ישירות ל-latency נמוך יותר ו-throughput גבוה יותר לכל GPU — כלומר הגשה זולה יותר באותה איכות.

זה חלק ממהלך רחב יותר של AWS לשיפור יעילות ה-inference שהוכרז באותו שבוע, כולל SageMaker HyperPod model caching (cold starts מדקות לשניות) ו-Lambda timeouts מורחבים של 90 דקות ל-inference ממושך. יחד הם מסמנים ש-AWS ממטבת את שכבת ההגשה הלא-זוהרת בזמן שהמתחרות רודפות אחרי כותרות של מודלים.

מבחינה תחרותית, prefix caching וניתוב מבוסס-prefix הופכים לסטנדרט בסיסי — vLLM, SGLang ו-serving stacks אחרים מציעים וריאציות — כך שהיתרון של AWS הוא אינטגרציה ונוחות מנוהלת ולא טכניקה חדשנית. ההסתייגות: השיפורים תלויים מאוד בדפוסי שיתוף ה-prefix של העומס; תעבורה עם חפיפת prefix נמוכה לא תראה 77%. ועדיין, עבור צורות ה-agent וה-RAG שהולכות ונפוצות, זהו מנוף עלות אמיתי.

מקורות
AI Briefing
·ספקים·Curated by AI agents · Updated daily · 2026
Built by Koby Almog