חזרה
NVIDIAJuly 31, 20261 מקורות

NVIDIA מעצבת מחדש את מנגנון ה-attention ל-inference מהיר של long-context אינטראקטיבי

ניתוח AI

NVIDIA פרסמה עבודת הנדסה מעמיקה על co-design של מנגנון ה-attention במודלים לצורך inference מהיר ואינטראקטיבי בקונטקסט ארוך. התובנה המרכזית: ככל ש-workloads אגנטיים וקונטקסט ארוך מתרבים — בדיוק אותם workloads שמזינים השבוע את חדשות ה-disaggregated inference של AWS HyperPod ואת מסגרות ה-agent — מנגנון ה-attention צורך חלק הולך וגדל מזמן ה-inference הכולל והופך לצוואר הבקבוק. הגישה של NVIDIA עושה co-design בין חישוב ה-attention של המודל לבין החומרה, כדי לשמור על תגובתיות בהגשת קונטקסט ארוך במקום לתת ל-latency להתנפח ככל שחלונות הקונטקסט גדלים.

העבודה מכוונת ישירות לאינטרס הפלטפורמה של NVIDIA: ככל ש-inference של קונטקסט ארוך ו-workloads אגנטיים רץ ביעילות רבה יותר על ה-GPU שלה, כך ה-ecosystem שלה נדבק חזק יותר. היא משלימה מהלך רחב יותר של NVIDIA השבוע שכלל הנחיות ל-deploy של agents מאובטחים יותר, עוזרי קוד self-hosted המבוססים על NeMo Guardrails ועל StarCoder2-7B NIM, וכן Synthetic Video Detector NIM שהוצג ב-SIGGRAPH 2026 כדי לסייע לחדרי חדשות לסמן deepfakes (אם כי בבדיקות הוא הגיע לדיוק של כ-92% ובשלות צרכנית מוגבלת).

בנפרד, NVIDIA השיקה את Video Codec SDK 13.1, שמוסיף transcode ללא העתקה (zero-copy), AV1 B-frames וחיפוש מדויק לפי frame — במיקוד ל-workloads של וידאו באיכות גבוהה, מ-streaming ועד שיתוף פעולה מרחוק.

עבודת ה-co-design של ה-attention משקפת שלב מתבגר במרוץ תשתיות ה-AI, שבו רווחי יעילות שוליים ב-hot path של ה-inference מתורגמים ישירות ליתרונות עלות ו-latency בקנה מידה גדול. כשמחירי ה-GPU מדווחים כעולים בעד 30% והקהילה מתלוננת על כרטיסים ב-5,000 דולר, סחיטת יותר throughput של inference מכל GPU היא הכרח טכני וכלכלי כאחד. שווה לעקוב האם אופטימיזציות ה-attention הללו ייכנסו לספריות ה-inference של NVIDIA, וכמה שיפור מהירות אמיתי יפיקו deployments של agents בקונטקסט ארוך.

מקורות
AI Briefing
·ספקים·Curated by AI agents · Updated daily · 2026
Built by Koby Almog