Google משיקה את מודלי הקול Gemini 3.8 Live ו-Live Extended Thinking

Google השיקה את Gemini 3.8 Live ו-3.8 Live Extended Thinking, מודלים נייטיביים של speech-to-speech שנבנו ל-voice agents בזמן אמת ברמת פרודקשן. הם זמינים ב-Gemini Live API וב-AI Studio, ומתומחרים ב-0.005 דולר לדקת קלט אודיו ו-0.018 דולר לדקת פלט — בערך 0.84 דולר לשעת קלט, שהקהילה סימנה כזול ביותר הזמין ל-voice agents שניתנים להרחבה. הווריאנט 'Extended Thinking' מוסיף reasoning כמעט בזמן אמת למשימות קוליות מורכבות ורב-שלביות.
ב-benchmarks, Gemini 3.8 Live תפס את המקום הראשון ב-Speech-to-Speech Index עם 82.6 וקיבל 68.6% ב-Tau Voice, מה שנותן ל-Google יתרון איכות מכומת שמצטרף ליתרון התמחור שלה. speech-to-speech נייטיבי (במקום pipeline משורשר של STT→LLM→TTS) הוא ההימור הארכיטקטוני המרכזי, שחותך latency ושומר על פרוזודיה וטיפול בהפרעות שחשובים לשיחה טבעית.
ההשקה ממסגרת מחדש את הנוף התחרותי של voice agents. ה-realtime API של OpenAI ו-Grok Voice על fal שהושק זה עתה ניצבים כעת מול הצעה של Google שמובילה גם ב-benchmark ציבורי וגם בעלות — שילוב נדיר. עבור מפתחים שבונים אוטומציה של מוקדים טלפוניים, עוזרים קוליים וסוכנים שיחתיים, תמחור פרודקשן של 0.84 דולר לשעה משנה את היחידות הכלכליות.
Google צירפה להשקה הכרזות מחקר נוספות — AlphaGenome Atlas שממפה את כל 9 מיליארד השינויים הגנטיים בני אות בודדת בגנום האנושי, ו-WeatherNext 3 עם תחזיות משקעים מדויקות ב-50% יותר — שמדגישות את הרוחב של DeepMind מעבר לצ'אט. השבחים בקהילה התמקדו ב'מוכנות לפרודקשן', ניגוד בולט למודלים קוליים קודמים שנשפטו כדמואים. ההסתייגות: הובלה ב-benchmark על ה-Speech-to-Speech Index היא ציר אחד; חוסן בעולם האמיתי על פני מבטאים, רעש ושפות הוא ציר אחר. שווה לעקוב אחר האימוץ בפריסות קוליות בפרודקשן ואם התמחור מחזיק ככל שהשימוש גדל.