חזרה
GoogleJune 25, 20262 מקורות

Google מכניסה computer use נייטיב ל-Gemini 3.5 Flash

ניתוח AI

Google DeepMind הכריזה ש-Gemini 3.5 Flash תומך כעת ב-computer use נייטיב ככלי מובנה, מה שמאפשר agents מותאמים שיכולים לראות ולפעול בממשקי browser, mobile ו-desktop. במקום לחבר כל אפליקציה דרך API ייעודי, המודל פועל ויזואלית: הוא לוכד screenshots, מפרש ממשקים גרפיים, ומבצע פעולות כמו לחיצה על כפתורים, מילוי טפסים והפעלת אפליקציות. DeepMind אומרת שהיכולת מציגה תוצאות benchmark חזקות ב-agentic ובשליטת UI, ומגיעה עם אמצעי הגנה ארגוניים אופציונליים להפחתת סיכון.

ההימור הטכני הוא ששליטה ברמת GUI מכלילה טוב יותר מאינטגרציית API-לכל-אפליקציה — agent שיכול לקרוא מסך יכול, עקרונית, להפעיל כל תוכנה שאדם יכול, כולל אפליקציות legacy ללא ממשק תכנותי. הצבת זה ב-tier ה-Flash הזול והמהיר יותר (ולא רק במודל Pro פרימיום) מסמנת ש-Google רוצה שאוטומציה agentic בנפח גבוה תהיה כדאית כלכלית.

תחרותית, זו התשובה של Google לקטגוריה ש-Anthropic חלצה בה ראשונה עם 'computer use' של Claude, ושאליה OpenAI ואחרות דחפו דרך agents בסגנון operator. לעשות זאת נייטיב ב-Flash ולתמחר זאת לקנה מידה זה הבידול ש-Google נשענת עליו. זה גם מגיע במביך לצד הידיעה שה-Gemini 3.5 Pro הגדול יותר נדחה ליולי, כך ש-computer use של Flash נושא חלק מהמומנטום.

הסתייגויות: agents ל-GUI מבוססי vision נותרים שבירים בלייאאוטים דינמיים, איטיים יחסית לקריאות API, ומציבים סיכוני אבטחה אמיתיים (prompt injection דרך תוכן על המסך, לחיצות לא מכוונות). מסגור 'אמצעי ההגנה הארגוניים' האופציונליים מרמז ש-Google יודעת שאמינות ו-safety הם גורמי החסם. שווה לעקוב אחר benchmarks עצמאיים, נתוני latency/עלות, ואיך אמצעי ההגנה מגבילים פעולות בסיכון גבוה כמו תשלומים או הגדרות מערכת.

מקורות
AI Briefing
·ספקים·Curated by AI agents · Updated daily · 2026
Built by Koby Almog