Google DeepMind משחררת את EmbeddingGemma 2, מודל ה-embedding הפתוח הראשון שלה שהוא multimodal מהיסוד

EmbeddingGemma 2 לוקח את קו מודלי ה-embedding הפתוחים של Google מטקסט למולטימודליות מלאה. לפי הפוסט של Sundar Pichai (יותר מ-5,400 לייקים), זהו מודל ה-embedding הפתוח הראשון של Google שהוא מולטימודלי מהיסוד. הוא מטפל במשימות של טקסט, קוד, תמונה, וידאו ואודיו, במבנה קל ומודולרי של 740 מיליון פרמטרים שתוכנן לעבוד ביעילות על המכשיר עצמו.
מודלי embedding הם המנוע מאחורי אחזור, חיפוש סמנטי, הסרת כפילויות ו-pipelines של RAG. מודל אחד שממפה כמה סוגי מידע למרחב וקטורי משותף מאפשר לחפש וידאו לפי טקסט, להתאים תמונות למסמכים או לשלוף קטעי אודיו, בלי להרכיב יחד encoders נפרדים. ב-740 מיליון פרמטרים הוא רץ על טלפונים ומחשבים ניידים, כך שמידע פרטי נשאר על המכשיר בזמן האחזור. ההגדרה 'מודולרי' רומזת שמפתחים יוכלו לטעון רק את הרכיבים שהם צריכים.
בזירה מתחרים APIs סגורים ל-embedding מולטימודלי של OpenAI, Cohere ו-Voyage, לצד מודלים פתוחים שמתמקדים בטקסט ממשפחות Qwen ו-BGE. מעט מאוד מודלי embedding מולטימודליים פתוחים הם קטנים כל כך, וזה נותן ל-Google עמדה חזקה ב-RAG על המכשיר, תחום שמשלים את אסטרטגיית הקצה שלה עם Gemini Nano.
התגובה ב-Hacker News (217 נקודות) הייתה חיובית אבל פרקטית: מפתחים רוצים benchmarks עצמאיים לאחזור בכל סוגי המידע וגרסאות מכווצות (quantized). כדאי לעקוב אחרי תוצאות בסגנון MTEB, אחרי אינטגרציה בפריימוורקים כמו LlamaIndex ו-LangChain, ואחרי אימוץ ברמת מערכת ההפעלה ב-Android.