petaFLOP על השולחן: DGX Spark 64GB של NVIDIA בא להחליף את חשבון הענן

NVIDIA נותנת ל-AI מקומי יותר זיכרון לעבוד איתו. ה-DGX Spark החדש מגיע עם 64GB של unified memory על שבב העל GB10 Grace Blackwell, ועם כוח מחשוב של כ-1 petaFLOP. זה מספיק כדי להריץ מודלים פתוחים בגודל 30B עד 35B פרמטרים ל-agents, ל-fine-tune ול-inference, בלי לשלם לענן לפי token. אפשר לחבר שתי יחידות דרך רשת ConnectX-7 ולקבל תצורה של 128GB לעומסים גדולים יותר. גרסאות OEM מגיעות מ-ASUS, Dell, HP ו-Lenovo.
לצד החומרה NVIDIA הציגה גם מודל דגל: Muse Glimmer של Meta, שמגיע ל-51.2 ב-SWE-Bench Pro עם חלון הקשר של 131K token, וארוז כ-NVIDIA NIM. בנפרד, ב-benchmark ש-F5 הריצה על deploy של NIM נמצא שניתוב שמודע ל-cache ברמת ה-DPU שילש את התפוקה כשזיכרון ה-GPU היה בעומס שיא.
השאלה הכלכלית של מקומי מול ענן עדיין פתוחה. ב-r/LocalLLaMA, פוסט שהשווה כרטיסי GPU עם 32GB VRAM מתחת ל-1,600 דולר קיבל 444 הצבעות, ושרשור אחר שאל אם ה-API של המודלים המובילים בכלל זול יותר מ-inference מקומי. DGX Spark פונה למי שרוצה קופסה מוכנה עם תמיכה, ולא כרטיסים צרכניים יד שנייה. הוא גם מתחרה במחשבי Mac עם Apple Silicon ו-unified memory גדול.
הקושי הוא שמחירי הענן יורדים מהר. ה-0.10 דולר למיליון token קלט ב-cache של OpenAI וה-V4.1-Flash של DeepSeek ברישיון MIT מצמצמים שניהם את ההצדקה הכלכלית לחומרה מקומית. המחיר עצמו לא פורט במקורות. כדאי לעקוב אחרי המחיר בשוק, מועדי הזמינות, והשאלה אם מודלים מקומיים בגודל 30B טובים מספיק לעבודת agents אמיתית בהשוואה ל-API של המודלים המובילים.