جدیدترین تحولات هوش مصنوعی را در کانال بله هوشیو بخوانید

Generic filters
Search in title
Filter by دسته‌ها
chatGTP
ابزارهای هوش مصنوعی
اخبار
گزارش خبری
پرامپت‌ نویسی
تیتر یک
چندرسانه ای
آموزش علوم داده
اینفوگرافیک
پادکست
ویدیو
دانش روز
آموزش‌های پایه‌ای هوش مصنوعی
اصول هوش مصنوعی
یادگیری بدون نظارت
یادگیری تقویتی
یادگیری عمیق
یادگیری نیمه نظارتی
آموزش‌های پیشرفته هوش مصنوعی
بینایی ماشین
پردازش زبان طبیعی
پردازش گفتار
چالش‌های عملیاتی
داده کاوی و بیگ دیتا
رایانش ابری و HPC
سیستم‌‌های امبدد
علوم شناختی
خطرات هوش مصنوعی
دیتاست
مدل‌های بنیادی
رویدادها
جیتکس
کاربردهای هوش مصنوعی
کتابخانه
اشخاص
شرکت‌های هوش مصنوعی
محصولات و مدل‌های هوش مصنوعی
مفاهیم
کسب‌و‌کار
تحلیل بازارهای هوش مصنوعی
کارآفرینی
هوش مصنوعی در ایران
هوش مصنوعی در جهان
مقاله
پیاده‌سازی هوش مصنوعی
گزارش
مصاحبه
هوش مصنوعی در عمل
یادداشت
 Mistral از مدل امنیت سایبری خود رونمایی کرد

Shieldstral

Mistral از مدل امنیت سایبری خود رونمایی کرد

زمان مطالعه: 2 دقیقه

استارتاپ فرانسوی Mistral با معرفی Shieldstral، یک مدل طبقه‌بندی‌کننده ایمنی چندوجهی با ۳ میلیارد پارامتر و متن‌باز ارائه کرده است که بر اساس متن منبع، در برخی معیارها عملکرد مدل‌هایی تا هفت برابر بزرگ‌تر از خود را دارد و در ارزیابی ایمنی چندوجهی به سطح جدیدی از عملکرد رسیده است. این مدل تحت مجوز Apache 2.0 منتشر شده و می‌تواند روی یک GPU انویدیا با ۱۶ گیگابایت حافظه اجرا شود.

ایده اصلی Shieldstral تغییر نحوه تعریف تعدیل محتوا یا Content Moderation است. در بسیاری از مدل‌های محافظ یا Guardrail، دسته‌بندی‌های مشخصی از محتوای مضر در وزن‌های مدل از پیش تعریف شده‌اند. در نتیجه، اگر یک محصول به سیاست ایمنی متفاوتی نیاز داشته باشد، معمولاً باید مدل برای آن سیاست دوباره آموزش داده شود. ازسوی‌دیگر، یک تعریف واحد از محتوای ناایمن برای همه محصولات وجود ندارد؛ محتوایی که ممکن است در یک ابزار پژوهشی امنیت سایبری قابل‌قبول باشد، ممکن است در یک پلتفرم سلامت روان نامناسب تلقی شود.

تعدیل محتوا به‌عنوان پرسش‌وپاسخ

Shieldstral به‌جای تثبیت سیاست‌های ایمنی در وزن‌های مدل، سیاست را هنگام استنتاج به‌صورت یک پرسش به زبان طبیعی دریافت می‌کند. سپس مدل یک امتیاز ایمنی کالیبره‌شده ارائه می‌دهد. به‌این‌ترتیب، بدون آموزش مجدد می‌توان مدل را با سیاست‌های مختلف تطبیق داد و ارزیابی متن و تصویر را با یک رابط واحد انجام داد.

Shieldstral مسئله تعدیل محتوا را به یک عملیات پرسش‌وپاسخ دودویی تبدیل می‌کند. هر درخواست شامل سه بخش است:

  • Instruct: زمینه ارزیابی، میزان سخت‌گیری و در صورت نیاز، تعریف محتوای ناایمن.
  • Query: یک پرسش بله/خیر، مانند «آیا این محتوا خشونت فیزیکی را ترویج می‌کند؟»
  • Document: محتوایی که باید ارزیابی شود؛ از یک پرامپت یا پاسخ گرفته تا جفت پرامپت–پاسخ یا تصویر همراه با متن اختیاری.

مدل در زمان استنتاج تنها خروجی‌های مربوط به «بله» و «خیر» را بررسی و با نرمال‌سازی Softmax، آن‌ها را به یک امتیاز ایمنی پیوسته تبدیل می‌کند. این چارچوب وظایفی مانند طبقه‌بندی پرامپت، تعدیل پاسخ، تشخیص امتناع از پاسخ و شناسایی محتوای سمی را در یک مسئله واحد ادغام می‌کند.

بنچمارک‌ها

ویژگی‌های اصلی

Shieldstral بر اساس متن منبع، در چهار محور اصلی ارزیابی شده است: ایمنی متنی، تشخیص امتناع، سازگاری با سیاست‌ها و تعدیل چندوجهی.  از ویژگی‌های مهم آن می‌توان به انعطاف‌پذیری سیاست‌ها بدون آموزش مجدد، پشتیبانی از متن، تصویر و متن+تصویر، امتیاز ایمنی پیوسته به‌جای یک برچسب گسسته، اندازه ۳ میلیارد پارامتری و اجرای آن روی یک GPU با ۱۶ گیگابایت حافظه اشاره کرد. وزن‌های این مدل نیز تحت مجوز Apache 2.0 در هاگینگ‌فیس در دسترس قرار گرفته‌اند.

دانلود مدل Shieldstral از هاگینگ‌فیس

نحوه ساخت Shieldstral

تیم سازنده Mistral AI برای آموزش مدل با چهار مسئله اصلی مواجه بود.

نخست، داده‌های ایمنی عمومی از نظر دسته‌بندی‌ها، برچسب‌ها و شیوه‌های حاشیه‌نویسی با یکدیگر متفاوت‌اند. این داده‌ها به قالب مشترک دستورالعمل–پرسش–محتوا تبدیل شدند و میزان سخت‌گیری نیز متناسب با منبع تنظیم شد.

دوم، هدف آموزش مدل صرفاً حفظ‌کردن برچسب‌های ازپیش‌تعیین‌شده نبود، بلکه مدل باید می‌آموخت مرز دقیق سیاست‌های مختلف را تشخیص دهد. برای این منظور، سیاست‌های مشابه و به‌راحتی قابل‌اشتباه طراحی شدند و متن‌هایی به شکل جفت‌های متضاد تولید شدند تا هر متن یک سیاست را نقض کند اما سیاست مشابه دیگری را نقض نکند.

سوم، برای تقویت داده‌های ایمنی تصویری، داده‌های محدود تعدیل تصاویر با مجموعه‌داده‌های عمومی تصاویر تکمیل شدند. همچنین جفت‌های تصویر–پرسش با استفاده از یک رتبه‌بندی‌کننده مجدد بینایی–زبانی فیلتر شدند تا داده‌های دارای برچسب نادرست و خطاهای ناشی از مدل کاهش یابد.

در نهایت، چند چک‌پوینت مکمل با استفاده از LoRA و روش SLERP ادغام شدند تا کالیبراسیون سیاست‌ها، قابلیت تشخیص سیاست‌های دقیق‌تر و توانایی پیروی از دستورالعمل‌ها در یک مدل واحد ترکیب شود.

Shieldstral به‌عنوان گامی برای حرکت به سمت سیستم‌های تعدیل محتوای سازگار با زمینه معرفی شده است؛ رویکردی که به‌جای تحمیل یک نظام ثابت از دسته‌بندی‌های ایمنی، امکان تعریف و تغییر سیاست‌ها در زمان استفاده را فراهم می‌کند. طبق متن منبع، توسعه‌دهندگان در ادامه بر پوشش چندزبانه، عملکرد بهتر روی اسناد طولانی‌تر و گسترش ایمنی چندوجهی تمرکز خواهند کرد.

مطالب پیشنهادی مرتبط

اشتراک در
اطلاع از
0 نظرات
بازخورد (Feedback) های اینلاین
مشاهده همه دیدگاه ها

در جریان مهم‌ترین اتفاقات AI بمانید

هر هفته، خلاصه‌ای از اخبار، تحلیل‌ها و رویدادهای هوش مصنوعی را در ایمیل‌تان دریافت کنید.

[wpforms id="48325"]