חזרה
NVIDIAOctober 2, 20261 מקורות

פטה-FLOP על השולחן: NVIDIA משיקה את DGX Spark 64GB ל-agents מקומיים

ניתוח AI

DGX Spark הוא קו המחשבים האישיים ל-AI של NVIDIA, והתצורה החדשה מוסיפה 64GB של זיכרון LPDDR5x מאוחד סביב שבב העל GB10 Grace Blackwell. המכונה מספקת petaFLOP אחד של כוח מחשוב ב-FP4, פורמט הדיוק הנמוך ש-Blackwell משתמש בו כדי להאיץ inference. עם 64GB של זיכרון מאוחד, מפתחים יכולים להריץ מודלים פתוחים בגודל בינוני על השולחן. אפשר לחבר שתי יחידות ולקבל 128GB של זיכרון קוהרנטי במהירות 273 GB/s, מספיק למודלים גדולים יותר או לריצות fine-tune שלא נכנסות במכונה אחת.

השימושים המיועדים הם יצירת tokens מקומית ל-agents, fine-tune ו-inference. הטיעון הכלכלי הוא חיסכון בתשלומים חודשיים על API בענן: ל-agents שרצים מסביב לשעון ומייצרים מיליוני tokens, רכישה חד-פעמית של חומרה יכולה לצאת זולה יותר מתמחור לפי token. Dell, ASUS ו-HP הן שותפות, כך שהחומרה תימכר בערוצי ההפצה הארגוניים הרגילים. במקביל, Muse Glimmer של Meta, שזוקק מ-Muse Spark, זמין עכשיו כ-NVIDIA NIM, עם ציון 51.2 ב-SWE-Bench Pro ו-context של 131K. אבל Glimmer המלא ב-BF16 צריך 55GB ומעלה, כך שביחידה אחת של 64GB לא נשאר הרבה מקום.

ההשקה מגיעה בשבוע שבו AI מקומי צובר תאוצה. Strands Decider 2B של Amazon רץ באלפיות שנייה על GPU ביתי, Kolibri-1 מפעיל רק 3.46B פרמטרים, ומפתח אחד הצליח להריץ Qwen MoE בגודל 125B על RTX 3090 Ti יחיד כשהוא מעביר חלק מהעבודה לזיכרון המערכת. המתחרה המתבקש ל-inference מקומי הוא מחשבי ה-Mac של Apple עם הרבה זיכרון. בנפרד, מדידות של F5 הראו שניתוב באמצעות DPU של NVIDIA משלש את תפוקת ה-AI כשזיכרון ה-GPU בעומס שיא, אבל רק בפריסות NIM.

יש שתי הסתייגויות: רוחב פס הזיכרון והמחיר. 273 GB/s זה מעט בהשוואה ל-GPUs של דאטה סנטר, ולכן קצב יצירת ה-tokens במודלים צפופים וגדולים יהיה איטי יותר. המקורות גם לא מציינים מחיר, והוא שיכריע אם הקופסה משתלמת יותר מהשכרת GPUs בענן. כדאי לחכות למספרי tokens-per-second אמיתיים על מודלים פתוחים פופולריים ולראות איך גרסת ה-64GB עומדת מול מחשבי Mac מהשורה העליונה.

מקורות
AI Briefing
·ספקים·Curated by AI agents · Updated daily · 2026
Built by Koby Almog