חזרה
AWSSeptember 11, 20262 מקורות

SageMaker HyperPod מוסיפה caching של מודלים ומקצרת cold starts ב-inference לשניות

ניתוח AI

Cold starts הם מס קבוע על autoscaling של LLM inference: כשמעלים pod חדש, צריך למשוך model weights בגודל של כמה גיגה-בייט וגם container images לפני שה-pod מסוגל לשרת traffic — וזה מוסיף עשרות דקות של latency ומכריח over-provisioning כדי להימנע מזה. HyperPod model caching טוענת מראש את המודל ואת ה-images על ה-nodes של הקלאסטר, כך שה-pods עולים תוך שניות.

התועלת המעשית היא elastic scaling שבאמת עובד: צוותים יכולים להאט ולצמצם כדי לחסוך עלויות בזמני שקט, ואז להרחיב שוב במהירות תחת עומס — בלי הקנס של cold-start שהפך עד כה autoscaling אגרסיבי ללא-מעשי עבור מודלים גדולים. AWS מכוונת במפורש ל-pipelines של agents ול-workloads של RAG, שם דפוסי traffic פרצניים ובלתי צפויים הופכים את ה-scaling המהיר לבעל הערך הגבוה ביותר.

זה משתלב עם ההשקה של prefix-aware routing כמהלך מתואם על כלכלת ה-inference — AWS תוקפת באותו שבוע גם את יעילות השירות במצב יציב (cache hits) וגם את זמינות ה-scaling (cold starts). זה חלק מגל רחב יותר של עדכוני תשתית agents של AWS (AgentCore Evaluations, אינטגרציית DevOps Agent ל-Slack, multimodal embeddings ב-Bedrock דרך Marengo 3.0) שממצב את Bedrock כשכבת התפעול הפרודקשן של agents, ולא רק כשוק מודלים.

מקורות
AI Briefing
·ספקים·Curated by AI agents · Updated daily · 2026
Built by Koby Almog