Mistral חושפת את Robostral Navigate — מודל רובוטיקה עם מצלמה אחת

Robostral Navigate הוא הכניסה של Mistral ל-AI פיזי: מודל בן 8 מיליארד פרמטרים שמאפשר לרובוטים לנווט באמצעות מצלמה יחידה ו-prompts בשפה טבעית. שיעור ההצלחה המדווח של 76.6% ב-benchmarks שלא נראו קודם גבוה ב-9.7 נקודות מגישות מצלמה-יחידה קודמות, מרווח משמעותי בהתחשב בכך שניווט מצלמה יחידה חסכני בחומרה במכוון לעומת מערכי חיישנים מרובים.
בחירת העיצוב היא הסיפור. רוב מערכות ה-vision-language-action (VLA) מצמידות patch features צפופים ל-VLMs בני מיליארדי פרמטרים שכבדים ל-train ואיטיים להרצה. מודל קטן יחסית של 8B שמשיג ניווט מצלמה-יחידה חזק מצביע לעבר stacks רובוטיים זולים ופריסים יותר — הד לדחיפה מחקרית רחבה יותר (ראו עבודת Patch Policy של NYU ששותפה השבוע) לעבר policies יעילים שמנצחים VLAs גדולים יותר עם שבריר מהפרמטרים.
עבור Mistral, השחרור מגוון פורטפוליו שאחרת מוגדר על ידי מודלים של שפה ו-OCR, והוא נוחת באותו שבוע של הרחבת השותפות עם Microsoft וחברותה ב-Open Secure AI Alliance — מקטע עמוס שממצב את Mistral כחברת AI אירופית מלאת-ספקטרום ונוטה-לפתיחות.
הסתייגויות: שיעורי הצלחה ב-benchmarks על משימות 'שלא נראו' שנאספו בקפידה לא תמיד מיתרגמים לסביבות מבולגנות בעולם האמיתי, וניווט מצלמה יחידה מחליף עמידות בעלות — הסתרות ותאורה נותרו קשות. השדה התחרותי צפוף, עם NVIDIA (Cosmos 3 Edge, pipelines של AI פיזי) ואחרים שדוחפים מודלי בסיס לרובוטיקה. מה שיש לעקוב אחריו הוא אם Robostral Navigate יגיע לפריסות בפועל או יישאר הדגמה מחקרית, ואם Mistral תשחרר אותו כמודל פתוח בהתאם לפילוסופיית הפתיחות המוצהרת שלה.