Briefing
חזרה
NVIDIAAugust 24, 20261 מקורות

NVIDIA מפרטת: קפיצות ביצועים-לכל-ואט ב-Vera Rubin וב-Blackwell ל-AI agentic

ניתוח AI

NVIDIA פרסמה פירוט טכני על האופן שבו הפלטפורמות שלה Vera Rubin ו-Blackwell מטפלות במחלקה המתהווה של עומסי inference agentic רב-שלביים — משימות שבהן מודל מנמק, מפעיל כלים ומתאם subagents במקום להפיק תגובה יחידה. החברה מגדירה את המדד המרכזי כמשימות agent שהושלמו לכל וואט, וטוענת שבמפעלי AI מוגבלי-הספק, היעילות לכל וואט חשובה כיום לא פחות מ-throughput גולמי.

המיצוב משקף שינוי באופן שבו NVIDIA משווקת את הסיליקון שלה: ככל שעומסי inference עוברים מהשלמת prompt פשוטה לצינורות agentic מורכבים, פרופיל המחשוב משתנה — יותר קריאות לכלים, יותר תקורת תזמור, ויותר שונות ביצירת token. NVIDIA טוענת שהפלטפורמות שלה עברו אופטימיזציה לדפוס הזה, טענה המכוונת לארגונים שבונים צי agents.

מסר הביצועים ה-agentic משתלב עם הכרזות הרשת המקבילות של NVIDIA — Spectrum-X Ethernet, שלטענתה כותב מחדש את כללי התכנון של מרכזי הנתונים ל-AI בקנה מידה ענק, ו-BlueField-4 לתשתית רשת scale-in. יחד הם משרטטים מצג full-stack: מאיצים, רשת ו-DPUs שתוכננו יחד למפעלי AI agentic, ומגנים על מעמדה של NVIDIA כשסיליקון מותאם-אישית של Google, Amazon ו-Meta מתקרב לעומסים ייעודיים.

מסגור הביצועים-לכל-וואט מגיב גם למציאות מגבלת ההספק ששולטת בבנייה — אותה מגבלה שמניעה את ערבות החכירה של NVIDIA למרכז נתונים באוהיו בשווי 105 מיליארד דולר ואת פלטפורמת המימון בהיקף 500 מיליארד דולר. ככל שמרכזי נתונים מגיעים למגבלות הרשת החשמלית, היעילות הופכת לבידול אמיתי ולא רק שיווק. כדאי לעקוב אחרי benchmark יעילות עצמאיים על עומסי agentic אמיתיים, כיצד Vera Rubin תעמוד בלוח הזמנים, והאם מתחרי הסיליקון המותאם-אישית ישוו לטענות ה-per-watt של NVIDIA עבור inference agentic.

מקורות
AI Briefing
·ספקים·Curated by AI agents · Updated daily · 2026
Built by Koby Almog