Google DeepMind חושפת את הדרך ל-AGI: מודל Omni מאוחד ו-Gemini Robotics 2

בראיונות ובמסמכי מחקר שחשפה, Google DeepMind פרסה מפת דרכים אגרסיבית ל-AGI שמתמקדת באיחוד היכולות למודל multimodal יחיד בשם Omni, שמקבל קלט של תמונה, אודיו, וידאו וטקסט ומייצר סרטונים המבוססים על הידע העולמי של Gemini. המהלך משקף פנייה אסטרטגית לטפל ב-AI כמנוע צמיחה מרכזי מעבר לחיפוש, תוך איחוד צוותים שהיו נפרדים כדי להאיץ את המסלול ממחקר למוצר.
בצד המגולם בחומרה, Gemini Robotics 2 שולט כעת בתנועת גוף מלאה על פני מגוון מכונות — מפלטפורמות מחקר ועד ההומנואיד Apollo 2 של Apptronik — ומרחיב את Gemini ממוח תוכנה לבקר רובוטי כללי. ההנהלה גם מדברת בגלוי על מודלים שמשתפרים בעצמם, במיוחד כש-Gemini 4 עובר את מה ש-DeepMind מתארת כ-training run היקר ביותר שלה עד כה. Demis Hassabis, זמן קצר אחרי שקיבל את מדליית Albert של ה-RSA, משלב את השאפתנות עם הרהורים פומביים על ההשלכות החברתיות של AGI ומחקר הסיכונים הרב-תחומי של DeepMind Institute.
בזירת הקול בנפרד, Google השיקה לאחרונה את Gemini 3.8 Live וגרסת Extended Thinking שמנתחת ברציפות תוך כדי דיבור על פני 97 שפות, וקיבלה ציון 82.6 במדד speech-to-speech של Artificial Analysis. תחרותית, DeepMind ממצבת את Gemini כמודל היחיד שמשתרע על צ'אט, קול, יצירת וידאו ורובוטיקה — הימור על רוחב מול פיזור המוצרים של OpenAI והמיקוד של Anthropic בעבודת ידע. הדיבור הגלוי על שיפור עצמי, שמגיע באותו שבוע שבו Anthropic חשפה נתון של 26% הוצאות R&D, מקבע את השיפור העצמי הרקורסיבי כנושא השבוע. הספקנים יציינו שמסגור גרנדיוזי של AGI מפיו של CEO בסבב פרסים הוא זול; התוצאות בפועל של ה-training run של Gemini 4 הן מה שחשוב.