Briefing
חזרה
AWSAugust 6, 20261 מקורות

Amazon ECS מוסיפה תזמון GPU חלקי עם מופעי EC2 G6f

ניתוח AI

Amazon ECS הוסיפה תמיכה בתזמון GPU חלקי בעזרת מופעי EC2 G6f החדשים, שמאפשרים ל-workloads לתפוס מחיצות GPU קטנות עד כדי שמינית מ-GPU מסוג NVIDIA L4 עם 3GB של זיכרון. במקום להקדיש GPU שלם ל-container, צוותים יכולים כעת לדחוס מספר workloads קטנים על GPU פיזי יחיד, ולשפר דרמטית את הניצולת עבור משימות שלא צריכות את מלוא הכוח של GPU שלם.

מקרי השימוש המיועדים הם inference של מודלים קטנים, ניסויים ורינדור גרפי — תרחישים שבהם L4 מלא הוא מוגזם וקיבולת GPU בטלה היא בזבוז מוחלט. ככל שמתרבים מודלים קטנים פתוחים (הגרסאות בגודל מחשב-נייד של Qwen, Mistral 3B Shieldstral, משפחות NVIDIA Nemotron), הכלכליות של הגשת מודלים קטנים רבים בזול הופכת חשובה יותר ויותר, ותזמון חלקי מטפל בזה ישירות בכך שהוא מאפשר ל-GPU יחיד לארח כמה מודלים או דיירים.

התכונה משתלבת בנושא היעילות והעלות של השבוע, שעובר דרך הלחץ התמחירי של DeepSeek, כלכליית ה-cached-input של Qwen, והדחיפה הרחבה להגיש מודלים יכולתיים בזול. עבור AWS, זה חלק מזרם קבוע של שיפורי תשתית — לצד צמתי ElastiCache Graviton4 שמדווחים על תפוקה גבוהה עד 47% ותמורה-למחיר טובה יותר ב-31%, ושילוב מקונסולת Lambda ל-IDE עם Kiro ו-Cursor — שביחד הופכים את הענן שלה דביק יותר עבור workloads של AI.

זהו סיפור תשתית אינקרמנטלי ולא השקה מרעישה, אבל הוא חשוב למי שמריץ inference בקנה מידה: הקצאת GPU חלקית יכולה לחתוך עלויות באופן משמעותי עבור workloads מתפרצים או קלים. השאלות המעשיות הן overhead של התזמון, בידוד בין דיירים שחולקים GPU יחד, וכיצד תמחור G6f משתווה להרצת מופעים שלמים בניצולת נמוכה. עבור צוותים שכבר על ECS, זה מנוף פשוט להשבת בזבוז של הוצאות GPU.

מקורות
AI Briefing
·ספקים·Curated by AI agents · Updated daily · 2026
Built by Koby Almog