Microsoft נכנסת לזירת הקול: תמלול בזמן אמת ושני מודלי TTS ל-voice agents

Microsoft הוסיפה ב-2 באוקטובר שלושה מודלים חדשים למשפחת MAI. הראשון הוא מודל ה-speech-to-text הראשון של החברה שעובד ב-streaming, ושני האחרים הם מודלי text-to-speech. Microsoft מציגה את שלושתם כחבילה אחת, כאבני הבסיס ל-voice agents ששומעים את המשתמש ועונים לו כמעט בלי השהיה. המטרה היא שהשיחה תרגיש כמו שיחה עם בן אדם, ולא כמו צ'טבוט שמחכה לתורו.
למה streaming כל כך חשוב? תמלול רגיל ב-batch מחכה שהמשפט ייגמר ורק אז מחזיר טקסט. מודל streaming פולט תמלול חלקי תוך כדי שהאודיו נכנס. כך ה-LLM יכול להתחיל לחשוב, ומודל ה-TTS יכול להתחיל לדבר עוד לפני שהמשתמש סיים. ב-voice agent, ה-latency בכל שלב בשרשרת הוא מה שקובע אם השיחה מרגישה חיה או מגושמת. כש-Microsoft מחזיקה את שני הקצוות של ה-pipeline בבית, היא יכולה לכוונן את כל הלולאה, במקום להדביק יחד רכיבים של ספקים שונים.
הזירה התחרותית ברורה. ה-realtime voice stack של OpenAI, ה-Gemini Live של Google ושורה של ספקים ייעודיים כמו ElevenLabs ו-Deepgram כבר נלחמים על מפתחי ה-voice agents. MAI היא תעודת הביטוח של Microsoft, כדי לא להיות תלויה במודלים של אחרים. ה-Copilot החדש, שנבנה מחדש בסוף ספטמבר סביב Home, Code ו-Autopilot, מנתב בין מודלים של כמה חברות AI. Satya Nadella כבר הגדיר את השלב הבא כמרוץ מוצרים ולא כמרוץ מודלים. מודלי דיבור משלה נותנים ל-Azure ברירת מחדל זולה יותר, שהיא גם שולטת בה, לשכבת הקול של המוצר.
כמה הסתייגויות: בסיקור של SiliconANGLE אין benchmarks, אין תמחור ואין רשימת שפות נתמכות. 'Ultra-realistic' נשאר בינתיים טענה שיווקית, עד שמפתחים יבדקו word error rate ברעש רקע, טיפול בקטיעות ואיכות קול. כדאי לעקוב אחרי הזמינות ב-Azure AI Foundry, אחרי התמחור לדקה מול OpenAI realtime, ואחרי השאלה אם מצב הקול של Copilot יעבור מאחורי הקלעים ל-MAI.