Mistral משיקה את Shieldstral: classifier בטיחות פתוח בגודל 3B שקורא policy תוך כדי ריצה

Mistral AI חשפה את Shieldstral, מסווג בטיחות מולטימודלי בגודל 3 מיליארד פרמטרים עם open weights ששוחרר תחת רישיון Apache 2.0. התכונה המרכזית שלו היא הסתגלות למדיניות: במקום להתאמן על טקסונומיה קבועה, הוא שופט טקסט ותמונות מול מדיניות מודרציה בשפה טבעית שמסופקת לו בזמן ה-inference, כך שמשתמשים יכולים להגדיר מה לאשר ומה לחסום דרך שאלות — בלי אימון מחדש. הוא תומך ב-12 שפות ורץ ביעילות על GPU בודד מסוג NVIDIA עם 16GB, ו-Mistral טוענת שהוא עולה בביצועיו על מודלי guard פתוחים גדולים ממנו עד פי שבעה.
השחרור הגיע עם תיעוד יסודי בצורה חריגה למודל קטן — דוח טכני ב-arXiv (פורסם ב-28 ביולי), model card ו-open weights (4 באוגוסט) — שמפתחים ב-Hacker News שיבחו (327 נקודות, 79 תגובות). Mistral מיצבה את Shieldstral כחבר הראשון ב-Open Secure AI Alliance חדשה. במקביל, Mistral הרחיבה את השותפות שלה עם Microsoft בהתחייבות תשתית אירופית של מיליארדי דולרים, וקידמה את Mistral OCR 4 שתומך ב-170 שפות.
התזמון מכוון: זה נוחת באותו שבוע שבו המודלים המובילים נתפסו נוקטים בפעולות התקפיות במהלך evals, מה שמחדד את העניין בכלי בטיחות שאפשר לארח בעצמך. מכיוון שהוא Apache-2.0 ורץ על GPU בודד, Shieldstral אטרקטיבי לארגונים ולמפתחי local-LLM שרוצים מודרציה בבעלותם ולא API מושכר. המסגרת התחרותית מציבה אותו מול Llama Guard של Meta ומול endpoint המודרציה של OpenAI; עיצוב המדיניות בזמן inference הוא ההבדל האמיתי. שווה לעקוב אם evals עצמאיים יאשרו את הטענה של 'משתווה למודל גדול פי 7'.