חזרה
GoogleSeptember 23, 20262 מקורות

Google DeepMind משיקה את Gemini 3.8 text-to-speech עם שכפול קול

ניתוח AI

ה-Gemini 3.8 text-to-speech מרחיב את ה-stack הקולי של Google DeepMind עם יכולות שכפול קול, ומאפשר למפתחים לייצר דיבור סינתטי שיכול לחקות קולות יעד — פיצ'ר עם תועלת ברורה לנגישות, מדיה ומוצרי עוזר, ועם חששות שימוש לרעה ברורים באותה מידה. הוא בנוי על קו Gemini 3.8 Live, שהציג שיחות דיבור בזמן אמת עם זמני תגובה מתחת ל-500 מילישניות וגרסת Extended Thinking שעוצרת כדי להסיק דרך בעיות רב-שלביות.

השחרור הוא חלק משבוע צפוף של פעילות shipping של Google על פני ה-ecosystem של Gemini — זיכרון בצד השרת ל-Private AI Compute, תמיכה באפליקציות מחוברות ל-monday.com ב-Workspace, והרחבת Google Beam — כשהחברה ממלאת את משטח המוצר שלה בזמן שהיא מכינה את מודל הדגל Gemini 4. השקת ה-TTS משכה תגובה חזקה במיוחד ב-Hacker News, מה שמאותת על תיאבון של מפתחים לקול סינתטי איכותי ובעל latency נמוך.

ההקשר התחרותי הוא מרוץ קולי שמתרחב: OpenAI הרחיבה את ChatGPT Voice עם גישה למייל, יומן ו-Slack באותו שבוע, ו-xAI שחררה את Grok Voice Transcribe 2.0 עם שיעור שגיאת מילים של 6.8% על פני 19 שפות. שכפול קול בפרט מזמין בחינה — הסכמה, watermarking והגנות מפני התחזות יקבעו אם זה יישלח באחריות, ו-Google לא פירטה במלואן את המעקות שלה. עבור מפתחים, המשיכה המעשית היא האינטגרציה עם Workspace ו-Android בתוספת איכות האודיו של DeepMind; השאלה הפתוחה היא זמינות, תמחור ובקרות שימוש לרעה, שאותן ההכרזה טיפלה רק ברמה כללית.

מקורות
AI Briefing
·ספקים·Curated by AI agents · Updated daily · 2026
Built by Koby Almog