Shieldstral
Mistral از مدل امنیت سایبری خود رونمایی کرد
استارتاپ فرانسوی Mistral با معرفی Shieldstral، یک مدل طبقهبندیکننده ایمنی چندوجهی با ۳ میلیارد پارامتر و متنباز ارائه کرده است که بر اساس متن منبع، در برخی معیارها عملکرد مدلهایی تا هفت برابر بزرگتر از خود را دارد و در ارزیابی ایمنی چندوجهی به سطح جدیدی از عملکرد رسیده است. این مدل تحت مجوز Apache 2.0 منتشر شده و میتواند روی یک GPU انویدیا با ۱۶ گیگابایت حافظه اجرا شود.
ایده اصلی Shieldstral تغییر نحوه تعریف تعدیل محتوا یا Content Moderation است. در بسیاری از مدلهای محافظ یا Guardrail، دستهبندیهای مشخصی از محتوای مضر در وزنهای مدل از پیش تعریف شدهاند. در نتیجه، اگر یک محصول به سیاست ایمنی متفاوتی نیاز داشته باشد، معمولاً باید مدل برای آن سیاست دوباره آموزش داده شود. ازسویدیگر، یک تعریف واحد از محتوای ناایمن برای همه محصولات وجود ندارد؛ محتوایی که ممکن است در یک ابزار پژوهشی امنیت سایبری قابلقبول باشد، ممکن است در یک پلتفرم سلامت روان نامناسب تلقی شود.
تعدیل محتوا بهعنوان پرسشوپاسخ
Shieldstral بهجای تثبیت سیاستهای ایمنی در وزنهای مدل، سیاست را هنگام استنتاج بهصورت یک پرسش به زبان طبیعی دریافت میکند. سپس مدل یک امتیاز ایمنی کالیبرهشده ارائه میدهد. بهاینترتیب، بدون آموزش مجدد میتوان مدل را با سیاستهای مختلف تطبیق داد و ارزیابی متن و تصویر را با یک رابط واحد انجام داد.
Shieldstral مسئله تعدیل محتوا را به یک عملیات پرسشوپاسخ دودویی تبدیل میکند. هر درخواست شامل سه بخش است:
- Instruct: زمینه ارزیابی، میزان سختگیری و در صورت نیاز، تعریف محتوای ناایمن.
- Query: یک پرسش بله/خیر، مانند «آیا این محتوا خشونت فیزیکی را ترویج میکند؟»
- Document: محتوایی که باید ارزیابی شود؛ از یک پرامپت یا پاسخ گرفته تا جفت پرامپت–پاسخ یا تصویر همراه با متن اختیاری.
مدل در زمان استنتاج تنها خروجیهای مربوط به «بله» و «خیر» را بررسی و با نرمالسازی Softmax، آنها را به یک امتیاز ایمنی پیوسته تبدیل میکند. این چارچوب وظایفی مانند طبقهبندی پرامپت، تعدیل پاسخ، تشخیص امتناع از پاسخ و شناسایی محتوای سمی را در یک مسئله واحد ادغام میکند.
بنچمارکها




ویژگیهای اصلی
Shieldstral بر اساس متن منبع، در چهار محور اصلی ارزیابی شده است: ایمنی متنی، تشخیص امتناع، سازگاری با سیاستها و تعدیل چندوجهی. از ویژگیهای مهم آن میتوان به انعطافپذیری سیاستها بدون آموزش مجدد، پشتیبانی از متن، تصویر و متن+تصویر، امتیاز ایمنی پیوسته بهجای یک برچسب گسسته، اندازه ۳ میلیارد پارامتری و اجرای آن روی یک GPU با ۱۶ گیگابایت حافظه اشاره کرد. وزنهای این مدل نیز تحت مجوز Apache 2.0 در هاگینگفیس در دسترس قرار گرفتهاند.
نحوه ساخت Shieldstral
تیم سازنده Mistral AI برای آموزش مدل با چهار مسئله اصلی مواجه بود.
نخست، دادههای ایمنی عمومی از نظر دستهبندیها، برچسبها و شیوههای حاشیهنویسی با یکدیگر متفاوتاند. این دادهها به قالب مشترک دستورالعمل–پرسش–محتوا تبدیل شدند و میزان سختگیری نیز متناسب با منبع تنظیم شد.
دوم، هدف آموزش مدل صرفاً حفظکردن برچسبهای ازپیشتعیینشده نبود، بلکه مدل باید میآموخت مرز دقیق سیاستهای مختلف را تشخیص دهد. برای این منظور، سیاستهای مشابه و بهراحتی قابلاشتباه طراحی شدند و متنهایی به شکل جفتهای متضاد تولید شدند تا هر متن یک سیاست را نقض کند اما سیاست مشابه دیگری را نقض نکند.
سوم، برای تقویت دادههای ایمنی تصویری، دادههای محدود تعدیل تصاویر با مجموعهدادههای عمومی تصاویر تکمیل شدند. همچنین جفتهای تصویر–پرسش با استفاده از یک رتبهبندیکننده مجدد بینایی–زبانی فیلتر شدند تا دادههای دارای برچسب نادرست و خطاهای ناشی از مدل کاهش یابد.
در نهایت، چند چکپوینت مکمل با استفاده از LoRA و روش SLERP ادغام شدند تا کالیبراسیون سیاستها، قابلیت تشخیص سیاستهای دقیقتر و توانایی پیروی از دستورالعملها در یک مدل واحد ترکیب شود.
Shieldstral بهعنوان گامی برای حرکت به سمت سیستمهای تعدیل محتوای سازگار با زمینه معرفی شده است؛ رویکردی که بهجای تحمیل یک نظام ثابت از دستهبندیهای ایمنی، امکان تعریف و تغییر سیاستها در زمان استفاده را فراهم میکند. طبق متن منبع، توسعهدهندگان در ادامه بر پوشش چندزبانه، عملکرد بهتر روی اسناد طولانیتر و گسترش ایمنی چندوجهی تمرکز خواهند کرد.