Google מכניסה הבנת וידאו agentic ל-Gemini

Google הוסיפה agentic video understanding למודלי Gemini האחרונים שלה, יכולת שחורגת מעבר לתמלול פסיבי של וידאו לכיוון מודלים שיכולים להסיק על תוכן וידאו ולנקוט פעולות בהתבסס עליו. Google DeepMind אמרה שהמודלים 'יכולים כעת לנתח סרטונים בדיוק טוב יותר', וההכרזה הודהדה על ידי ה-CEO Demis Hassabis והחשבון הרשמי GoogleDeepMind.
מבחינה טכנית, agentic video understanding משלב הסקה טמפורלית לרוחב frames יחד עם יכולות tool-use ותכנון שמגדירות מערכות אגנטיות — כלומר Gemini לא רק יכול לתאר מה קורה בסרטון אלא גם לתזמר צעדי המשך בהתבסס עליו. זה מרחיב את הטביעה המולטימודלית הרחבה ממילא של Gemini על פני טקסט, תמונות ו-audio אל הבנת וידאו ארוך, תחום תובעני מבחינת מחשוב שבו הדיוק היה חלש היסטורית.
התכונה נוחתת לצד הדחיפה הרחבה של Google ל-AI צרכני, כולל יצירת תמונות ב-Google Pics בתוך Workspace ועדכוני Gemini של החודש. מבחינה תחרותית, הבנת וידאו היא שדה קרב שבו נתוני Google בסדר גודל של YouTube הם יתרון טבעי, וגם מתחרות כמו OpenAI ו-Meta (עם מודלי הקול Muse ומודלי ה-perception שלה) משקיעות בו. הקוראים צריכים לעקוב אחר benchmarks קונקרטיים של דיוק, זמינות ה-API למפתחים, ואיך התכונה מתומחרת יחסית לשכבות ה-Flash האגרסיביות של Gemini.