חזרה
GoogleSeptember 15, 20263 מקורות

Google משיקה את מודלי הקול Gemini 3.8 Live ו-Live Extended Thinking

ניתוח AI

Google השיקה את Gemini 3.8 Live ו-3.8 Live Extended Thinking, מודלים נייטיביים של speech-to-speech שנבנו ל-voice agents בזמן אמת ברמת פרודקשן. הם זמינים ב-Gemini Live API וב-AI Studio, ומתומחרים ב-0.005 דולר לדקת קלט אודיו ו-0.018 דולר לדקת פלט — בערך 0.84 דולר לשעת קלט, שהקהילה סימנה כזול ביותר הזמין ל-voice agents שניתנים להרחבה. הווריאנט 'Extended Thinking' מוסיף reasoning כמעט בזמן אמת למשימות קוליות מורכבות ורב-שלביות.

ב-benchmarks, Gemini 3.8 Live תפס את המקום הראשון ב-Speech-to-Speech Index עם 82.6 וקיבל 68.6% ב-Tau Voice, מה שנותן ל-Google יתרון איכות מכומת שמצטרף ליתרון התמחור שלה. speech-to-speech נייטיבי (במקום pipeline משורשר של STT→LLM→TTS) הוא ההימור הארכיטקטוני המרכזי, שחותך latency ושומר על פרוזודיה וטיפול בהפרעות שחשובים לשיחה טבעית.

ההשקה ממסגרת מחדש את הנוף התחרותי של voice agents. ה-realtime API של OpenAI ו-Grok Voice על fal שהושק זה עתה ניצבים כעת מול הצעה של Google שמובילה גם ב-benchmark ציבורי וגם בעלות — שילוב נדיר. עבור מפתחים שבונים אוטומציה של מוקדים טלפוניים, עוזרים קוליים וסוכנים שיחתיים, תמחור פרודקשן של 0.84 דולר לשעה משנה את היחידות הכלכליות.

Google צירפה להשקה הכרזות מחקר נוספות — AlphaGenome Atlas שממפה את כל 9 מיליארד השינויים הגנטיים בני אות בודדת בגנום האנושי, ו-WeatherNext 3 עם תחזיות משקעים מדויקות ב-50% יותר — שמדגישות את הרוחב של DeepMind מעבר לצ'אט. השבחים בקהילה התמקדו ב'מוכנות לפרודקשן', ניגוד בולט למודלים קוליים קודמים שנשפטו כדמואים. ההסתייגות: הובלה ב-benchmark על ה-Speech-to-Speech Index היא ציר אחד; חוסן בעולם האמיתי על פני מבטאים, רעש ושפות הוא ציר אחר. שווה לעקוב אחר האימוץ בפריסות קוליות בפרודקשן ואם התמחור מחזיק ככל שהשימוש גדל.

מקורות
AI Briefing
·ספקים·Curated by AI agents · Updated daily · 2026
Built by Koby Almog