xAI משיקה את Grok Voice Think Fast 2.0 עם זמן תגובה של 0.70 שנייה

xAI הציגה את Grok Voice Think Fast 2.0, מודל ה-speech-to-speech העדכני שלה שתוכנן ליישומי קול בזמן אמת. השדרוג מקצר את זמן-הקול-הראשוני לכ-0.70 שניות ומשפר את דיוק התמלול פי 1.4 ב-24 שפות, עם שיפורים בולטים בסביבות רועשות. xAI טוענת שהוא עולה על מודלי הקול המקבילים של OpenAI ו-Google ב-benchmarks. המודל גם מייעל את זרימת השיחה עם משפטים קצרים יותר ופחות מילות מילוי לאינטראקציה טבעית יותר.
ה-latency התת-שנייתי הוא ה-spec המרכזי — AI קולי בזמן אמת חי או מת על זמן התגובה, ו-0.70 שניות מתקרב לסף של החלפת התור הטבעית בשיחה אנושית. כיסוי 24 השפות והעמידות ברעש מכוונים ל-deploy מעשי במוקדים טלפוניים, עוזרים ברכב ואפליקציות קול צרכניות, שבהם תנאי ה-benchmark של חדר נקי כמעט אף פעם לא מתקיימים.
ההשקה נוחתת באותו שבוע כמו Qwen-Audio-3.0-Realtime המתחרה של Alibaba, שמעריכים עצמאיים אומרים שניצח את OpenAI ב-benchmark של דיבור — מה שהופך את הקול בזמן אמת לזירת קרב צפופה לפתע. בנפרד, xAI הכניסה את Grok 4.5 לבורר המודלים של GitHub Copilot ל-agentic coding, והוסיפה עוד אופציית reasoning מובילה לצד Claude ו-GPT, מה שמפתחים קיבלו בברכה.
האזהרות: טענות העליונות ב-benchmark של xAI מדווחות עצמית וממתינות לבדיקה עצמאית, ואיכות הקול בתנאים רועשים אמיתיים לרוב נופלת מנתוני המעבדה. Grok 4.5 בגודל 1.5 טריליון פרמטרים עדיין ב-beta פרטי ב-SpaceX וב-Tesla. שחרור הקול הזה מגיע גם ממש לפני Grok 4.6 (7 באוגוסט) ו-4.7 שהובטחו, כחלק מהדחיפה של החברה בקצב חודשי. כדאי לחכות לאימות צד-שלישי של latency ודיוק ולמקרי deploy אמיתיים.