Google כובשת את פסגת מדד Speech-to-Speech: Gemini 3.8 Live מגיע ל-82.6

Gemini 3.8 Live הוא צעד ארכיטקטוני אמיתי מעבר לצ'אטבוטים שמקריאים טקסט בקול: אלה מודלים native של audio-to-audio ששומרים על שיחה זורמת תוך הרצת כלים ברקע וביצוע reasoning על קלט ויזואלי חי ממצלמה. גרסת ה-Extended Thinking קיבלה 82.6 ב-Speech-to-Speech Index של Artificial Analysis — המקום הראשון החדש — בעוד מודל ה-Live הסטנדרטי רשם 76.0, ושניהם תומכים במעבר אוטומטי בין 97 שפות באמצע משפט.
מבנה התמחור מדורג בכוונה כדי להפוך voice בזמן אמת לכלכלי בקנה מידה גדול: דיאלוג סטנדרטי עולה כ-0.84$ לשעה (בערך 0.005$ לדקה) בעוד reasoning מורכב מרובה-שלבים עולה 3.50$ לשעה. מפתחים ב-Hacker News (319 נקודות, 195 תגובות) השוו זאת לטובה מול ה-stack של OpenAI לזמן אמת, שהושווה לרעה מבחינת עלות. הזמינות היא דרך ה-Gemini API ו-Google AI Studio.
Google צירפה כמה שחרורים נלווים באותו יום — אפליקציית Gemini עצמאית ל-Windows 10/11 עם אינטגרציית Alt+Space, יכולות חינוך של Gemini Notebook בכמעט 100 שפות, ו-Gemini Robotics 2 לשליטה על רובוט בכל הגוף — אבל מודלי ה-Live של הקול הם הכותרת. ההשקה זכתה למקום הראשון ב-Hacker News, אות מפתחים חזק.
המסגור התחרותי ישיר: זו Google שלוחצת עם יתרונות ה-multimodal והעלות שלה מול advanced voice mode של OpenAI ומול גל ה-startups של voice-agents. השאלה הפתוחה היא latency תחת עומס והאם הרצת הכלים ברקע נשארת אמינה בproduction; השבחים המוקדמים התרכזו בהדגמות ובתמחור ולא בפריסה מתמשכת בעולם האמיתי. שווה לעקוב אחר benchmark של latency מצד שלישי בשבועות הקרובים.