Mistral משיקה את Shieldstral: classifier בטיחות מולטימודלי פתוח בגודל 3B

Mistral השיקה את Shieldstral 1.0, מסווג בטיחות multimodal פתוח וקומפקטי בגודל 3 מיליארד פרמטרים, ברישיון Apache 2.0. החידוש המרכזי הוא מודעות למדיניות בזמן ה-inference: המשתמשים מגדירים סטנדרטים של בטיחות בשפה טבעית כשהם מריצים את המודל, כך שהוא יכול לאכוף כללים שונים על טקסט ותמונות בלי אימון מחדש. Mistral טוענת שהוא רץ ביעילות על GPU יחיד של NVIDIA עם 16GB, תומך ב-12 שפות, ומגיע לממוצע של 83.8% ב-benchmarks של בטיחות תמונות — בשווה למודלי guard גדולים ממנו עד פי שבעה.
העיצוב מכוון לכאב תפעולי אמיתי: מסווגי הבטיחות של היום דורשים בדרך כלל fine-tune בכל פעם שהמדיניות משתנה, מה שהופך אותם לאיטיים ויקרים להתאמה. הגישה של Shieldstral, שמבוססת על מדיניות בשפה טבעית, מאפשרת לצוותים לעדכן כללי מודרציה תוך כדי תנועה, ומאחדת הערכת טקסט ותמונות במודל קומפקטי אחד שזול מספיק כדי לרוץ לצד ה-inference בפרודקשן.
מבחינה אסטרטגית, Shieldstral מחזק את המיצוב של Mistral סביב מודלים פתוחים, ומגיע באותו שבוע שבו מחנה המודלים הפתוחים צבר תאוצה בזכות Nemotron של NVIDIA והמכתב התעשייתי נגד הגבלות מוקדמות מדי על מודלים. הוא גם נוחת בעיצומו של גל אירועי אבטחה של AI — תרמית Mythos, הפריצה ל-Hugging Face, ה-exploit של Muse Spark — שהופכים guardrails זולים וגמישים לדחופים מתמיד עבור ארגונים שמפעילים agents.
הספקנים יציינו שמסווג הוא טוב רק כמו המדיניות שמזינים לו, וש-83.8% בבטיחות תמונות עדיין משאיר פערים משמעותיים במודרציה בסיכון גבוה. שווה לעקוב אחר הערכות עצמאיות מול Llama Guard ומודלי המודרציה של OpenAI, אחר האימוץ ב-pipelines של agents, ואחר השאלה האם מדיניות בזמן inference תעמוד יציבה מול prompts יריביים.