Grok 4.5 עולה לאוויר — הדגל החדש של xAI ל-coding ול-agents

Grok 4.5 הוא הניסיון של xAI להיתפס ברצינות כמתמודדת ב-coding וב-agents ולא כמתקן שקשור ל-X. הטענה המרכזית היא דירוג ראשון ב-Long-Horizon Terminal-Bench לרוחב 46 משימות — benchmark שתוכנן במיוחד למדוד ביצועים agentic מתמשכים ורב-שלביים בסביבות terminal, שבהן המודלים חייבים לבצע debug, להתאושש משגיאות, ולהשלים workflows מורכבים בלי לצאת מהמסלול.
xAI ממצבת את המודל כמצטיין בכל תחומי ה-coding, המשימות ה-agentic ועבודת הידע, עם דגש מיוחד על אמינות בטווח ארוך — אותה יכולת ש-Anthropic הדגישה עבור ה-agents הלילייים של Opus 5. החברה גם מדגישה יחס מחיר-ביצועים חזק על benchmarks של cybersecurity, בחירה חדה לאור פרצת ה-agent הסורר של השבוע והתמקדות התעשייה הפתאומית ביכולות cyber.
מבחינה תחרותית, Grok 4.5 נכנס לחזית צפופה במיוחד: Opus 5 של Anthropic, DeepSeek V4, Gemini 3.6 Flash של Google, Qwen 3.8-Max של Alibaba ו-Kimi K3 של Moonshot כולם שוחררו או הוצגו באותו חלון זמן. שוק המודלים של יולי 2026, כפי שדיווח אחד ניסח זאת, 'צפוף ומסוגל', כשהבידול נשען יותר ויותר על מחיר, אמינות agentic ו-ecosystem ולא על יכולת גולמית.
הספקנים מפעילים את אותה בחינה קפדנית שהפעילו על טענות ה-ARC-AGI של Opus 5: מובילות ב-benchmark יחיד של eval agentic לא מבטיחה אמינות בעולם האמיתי, ול-xAI יש היסטוריה של שיווק אגרסיבי. הסנטימנט הרחב ב-r/LocalLLaMA כלפי טענות 'ברמת החזית' נשאר ספקני, כשהמפתחים רוצים benchmarks הניתנים לשחזור ו-model cards לפני שהם נותנים אמון במספרים. מה לעקוב אחריו: אימות עצמאי של תוצאות ה-Terminal-Bench והאם Grok 4.5 יצבור אחיזה מחוץ ל-ecosystem של X.