NVIDIA מציגה TensorRT Multi-Device Inference ב-Dynamo-Triton ל-serving רב-GPU

NVIDIA הוסיפה TensorRT multi-device inference ל-stack שירות המודלים Dynamo-Triton שלה, במיקוד לבעיה מעשית הולכת וגוברת: מודלים גנרטיביים שטביעת הרגל של המחשוב והזיכרון שלהם עולה על מה ש-GPU בודד יכול להכיל או לשרת ביעילות. היכולת החדשה מפשטת את הפצת שירות המודלים על פני מספר GPUs, ומפשיטה חלק ניכר מהמורכבות שהפכה את פריסת ה-inference מרובת ה-GPU למשימת הנדסה מתמחה.
המנגנון חשוב כי גדלי המודלים ממשיכים לגלוש מעבר לקיבולת של GPU בודד — המודל המתוכנן של DeepSeek עם 8 טריליון פרמטרים הוא דוגמה קיצונית, אבל אפילו מודלים מובילים מרכזיים דורשים יותר ויותר sharding על פני מכשירים לשירות ב-latency נמוך. על ידי שילוב multi-device inference באופן טבעי בתוך Dynamo-Triton, NVIDIA מורידה את המחסום עבור ארגונים לשרת מודלים גדולים על פני צי GPUs, ומחזקת את הדומיננטיות שלה לא רק בחומרת האימון אלא גם בשכבת התוכנה של שירות ה-inference.
בנפרד, NVIDIA פרסמה framework טכני להערכת AI agents, שחורג ממדדים פשוטים לעבר השאלה אם agent יכול לבצע שרשרת עבודה על פני עשרות tool calls רצופים מול סביבה חיה. ההנחיה ממסגרת את ה-tool calling כבסיס של benchmarking מודרני ל-LLM ואת השלמת המשימה מקצה לקצה כמדד האמיתי ליכולת ה-agent — תרומה בעיתה כשהתעשייה מתמודדת עם איך להעריך את האמינות של agents אוטונומיים (חשש שהתחדד בעקבות תקריות פריצת ה-agents של השבוע). יחד השחרורים מראים איך NVIDIA מרחיבה את החפיר שלה אל תוך מלוא ה-stack של תוכנת AI: לא רק מכירת GPUs, אלא בעלות על תשתית השירות ומתודולוגיית ההערכה שמעצבות איך מודלים ו-agents נפרסים ונשפטים. עבור ארגונים הבונים על חומרת NVIDIA, האינטגרציה ההדוקה יותר של התוכנה מפחיתה חיכוך; עבור מתחרים, היא מעמיקה את התלות בספק.