פי 10 מהר יותר: Samsung חושפת את zHBM ומגייסת את ניבלס מסטנפורד

ה-zHBM של Samsung הוא ניסיון לתקוף את חומת רוחב-הפס של הזיכרון שחונקת את זמן ה-inference. על ידי מיקום זיכרון בעל רוחב פס גבוה ב-stack תלת-ממדי ישירות מעל מאיץ ה-AI במקום לצדו, Samsung טוענת שהיא יכולה לדחוף את קצב השיחה למשתמש בערך פי 10 — מכ-100 token לשנייה ל-1,000 — קפיצת מדרגה שתשפר מהותית את התחושה של agents וזמן-אמת ומערכות קול.
המנגנון מכוון לצוואר הבקבוק של הזזת הנתונים: הצמדת הזיכרון והמחשוב מקצרת את המסלול הפיזי ומרחיבה את רוחב הפס האפקטיבי, מה שמשמעותי במיוחד בשלב ה-decode token-אחר-token של inference ב-LLM, שם גישה לזיכרון היא הדומיננטית. אם המספרים יחזיקו, zHBM ממצב את Samsung לא רק כספקית זיכרון אלא כשותפת ארכיטקטורה ב-inference stack.
התזמון מדויק. Huang של NVIDIA חזה באותו יום שמכירות השבבים יוכפלו, והזיכרון הוא המגבלה על כמה מכל כוח המחשוב הזה באמת שמיש. zHBM הוא המהלך של Samsung ללכוד ערך ככל שה-inference מתרחב, בתחרות מול SK Hynix ו-Micron על HBM מהדור הבא תוך בידול על ארכיטקטורה ולא על קיבולת גולמית. גיוס Niebles — אקדמאי computer-vision מכובד מ-Stanford — מסמן ש-Samsung רוצה אמינות במחקר AI, לא רק רכיבים, כשהיא בונה את מרכז ה-AI שלה בצפון אמריקה.
הסתייגויות: zHBM היא חשיפה בפורום, לא מוצר שנשלח, וטענות של פי 10 מ-stack תלת-ממדי מוגבל-חום מזמינות ספקנות לגבי yield, פיזור חום וקצבי token אמיתיים תחת עומס. שווה לעקוב אחרי לוח זמנים למוצריות ו-benchmarks עצמאיים של latency, ואם ספקי המאיצים יתחייבו לתכנן סביבו.