ה-agent AVO של NVIDIA עושה 100% ב-ARC-AGI-3: כל 183 השלבים

ה-AVO של NVIDIA השיגה 100% מלאים על ARC-AGI-3, benchmark של reasoning אינטראקטיבי, ופתרה את כל 183 השלבים ב-25 המשחקים הציבוריים של הסוויטה. המסגור של החברה מעניין לא פחות מהתוצאה: AVO היא ארכיטקטורת agent, ו-NVIDIA טוענת במפורש שמודל שפה מוביל הוא רק רכיב אחד — ה-harness שעוטף את ה-agent (תכנון, זיכרון, שימוש בכלים, התאוששות משגיאות) הוא זה שקובע את הביצועים בעולם האמיתי.
התזה הזו ממסגרת מחדש את המרוץ בחזית — לא סביב ה-IQ הגולמי של המודל אלא סביב ההנדסה של הפיגומים שמסביבו. Clement Delangue, מנכ"ל Hugging Face, חיזק את הנקודה וציין ש-NVIDIA 'בנתה harness משלה לקוד כדי לייעל את ה-CUDA GPU kernels', וחזה מעבר מעולם שבו אופטימיזציה ו-post-training למודלים שלך היא קשה, לעולם שבו זה שגרתי. באותו חלון NVIDIA שחררה מודל 'מורה' של 550B שעוקב אחר הוראות ב-Hugging Face, מה שמחזק את נרטיב ה-toolchain.
התוצאה הציתה את פורומי המפתחים. ב-r/singularity הסיפור אסף 1,152 upvotes ו-205 תגובות, כשהוויכוח מתרכז בדיוק בנקודה של NVIDIA — האם ציון של 100% הוא ניצחון של ה-harness, או שהוא חושף את ARC-AGI-3 כניתן ל'שיחוק' ברגע שזורקים עליו מספיק הנדסת agent? הספקנים טוענים ש-benchmark רווי מספר לך יותר על ה-benchmark עצמו מאשר על אינטליגנציה כללית.
מבחינה אסטרטגית, AVO משתלבת בפנייה הרחבה יותר של NVIDIA ל-2026: לצד עסקת Poolside ודחיפת Nemotron, זה מסמן שהחברה רוצה להחזיק לא רק בשבבים ובמודלים אלא גם ב-frameworks של ה-agents שקובעים כמה עבודה שימושית מפיק כל וואט של כוח מחשוב — נושא שמהדהד גם במסרי הביצועים-לוואט של DSX MaxLPS שלה. מה שכדאי לעקוב אחריו הוא האם AVO תשוחרר כמוצר או תישאר הדגמת מחקר.