جدیدترین تحولات هوش مصنوعی را در کانال بله هوشیو بخوانید

Generic filters
Search in title
Filter by دسته‌ها
chatGTP
ابزارهای هوش مصنوعی
اخبار
گزارش خبری
پرامپت‌ نویسی
تیتر یک
چندرسانه ای
آموزش علوم داده
اینفوگرافیک
پادکست
ویدیو
دانش روز
آموزش‌های پایه‌ای هوش مصنوعی
اصول هوش مصنوعی
یادگیری بدون نظارت
یادگیری تقویتی
یادگیری عمیق
یادگیری نیمه نظارتی
آموزش‌های پیشرفته هوش مصنوعی
بینایی ماشین
پردازش زبان طبیعی
پردازش گفتار
چالش‌های عملیاتی
داده کاوی و بیگ دیتا
رایانش ابری و HPC
سیستم‌‌های امبدد
علوم شناختی
خطرات هوش مصنوعی
دیتاست
مدل‌های بنیادی
رویدادها
جیتکس
کاربردهای هوش مصنوعی
کتابخانه
اشخاص
شرکت‌های هوش مصنوعی
محصولات و مدل‌های هوش مصنوعی
مفاهیم
کسب‌و‌کار
تحلیل بازارهای هوش مصنوعی
کارآفرینی
هوش مصنوعی در ایران
هوش مصنوعی در جهان
مقاله
پیاده‌سازی هوش مصنوعی
گزارش
مصاحبه
هوش مصنوعی در عمل
یادداشت
 حمله مدل به مدل با GPT-Red

آموزش تیم‌های خودکار قدرتمند برای آزمون نفوذ ایمنی و بهبود استحکام مدل‌ها

حمله مدل به مدل با GPT-Red

زمان مطالعه: 5 دقیقه

سیستم‌های هوش مصنوعی معمولاً از طریق مرورگرها، اپلیکیشن‌های متصل، فایل‌های محلی و سایر ابزارها با داده‌های شخص ثالث مواجه می‌شوند. این قابلیت‌ها برای انجام وظایف دنیای واقعی ضروری هستند، اما درعین‌حال فرصت‌های بیشتری برای تأثیرگذاری عوامل مخرب بر رفتار مدل ایجاد می‌کنند.

برای مثال، یک شخص ثالث می‌تواند یک دستورالعمل دقیقاً طراحی‌شده را با هدف فریب مدل برای بارگذاری داده‌های حساس روی یک سرور خارجی در یک ایمیل، صفحه وب، پاسخ یک ابزار یا یک مخزن کد جاسازی کند.

تیم قرمز

ردتیمینگ انسانی (Human Red Teaming) بخش مهمی از فعالیت‌های امنیت سایبری است و به تیم‌ها کمک می‌کند پیش از عرضه مدل‌ها، این آسیب‌پذیری‌ها را شناسایی کرده و تدابیر حفاظتی مناسب را ایجاد کنند. بااین‌حال، اتکای صرف به تیم قرمز انسانی به‌سادگی قابل‌مقیاس‌پذیری نیست. طراحی و اجرای این آزمایش‌ها زمان‌بر است و همین موضوع سرعت شناسایی حالت‌های شکست جدید و تبدیل آن‌ها به سازوکارهای حفاظتی قوی‌تر را محدود می‌کند. علاوه بر این، اگرچه این آزمایش‌ها نمونه‌های ارزشمندی از حملات موفق تولید می‌کنند، اما نمی‌توانند حجم و تنوع داده‌های خصمانه موردنیاز برای بهبود استحکام مدل‌ها از طریق آموزش را فراهم کنند.

همگام‌شدن با مدل‌هایی که روزبه‌روز توانمندتر می‌شوند، نیازمند آن است که فرایند ردتیمینگ نیز مقیاس پیدا کند. به همین منظور، OpenAI در حال آموزش مدل‌های داخلی و خودکار ردتیمینگ است که پیش از عرضه، آسیب‌پذیری‌ها را کشف می‌کنند و در طول آموزش مدل‌ها، حملات مختلفی تولید می‌کنند تا استحکام آن‌ها افزایش یابد.

مدل داخلی GPT Red حاصل این تلاش‌ها و در حال حاضر بهترین مدل خودکار ردتیمینگ ایمنی OpenAI است. این مدل مشابه نحوه عملکرد ردتیمِرهای انسانی، با ارسال یک پرامپت، مشاهده نحوه پاسخ مدل‌های GPT و تکرار فرایند، برای دستیابی به یک هدف تلاش می‌کند.

OpenAI این مدل را در مقیاس محاسباتی مشابه برخی از بزرگ‌ترین فرایندهای پساآموزش خود در OpenAI آموزش داده و آن را به‌صورت مستقیم در فرایند آموزش مدل‌های خود ادغام کرده است. در نتیجه، GPT 5.6 Sol مقاوم‌ترین مدلی OpenAI در برابر تزریق پرامپت (Prompt Injection) است و در سخت‌ترین معیار ارزیابی تزریق مستقیم پرامپت، نسبت به نسل قبلی مدل‌های OpenAI که تنها چهار ماه قبل منتشر شدند، ۶ برابر خطای کمتری دارد.

آموزش GPT Red از طریق خودبازی (Self-play)

GPT Red با استفاده از یادگیری تقویتی مبتنی بر خودبازی (Self-play Reinforcement Learning) آموزش داده می‌شود؛ روشی که در آن مدل و مجموعه‌ای متنوع از مدل‌های زبانی بزرگ مدافع (Defender LLMs) به‌صورت هم‌زمان روی طیف گسترده‌ای از سناریوهای ردتیمینگ آموزش می‌بینند.

GPT Red زمانی پاداش دریافت می‌کند که بتواند یک شکست معتبر ایجاد کند؛ مانند اجرای موفق یک حمله تزریق پرامپت. در مقابل، مدل‌های مدافع زمانی پاداش می‌گیرند که بتوانند در برابر حمله مقاومت کنند و وظایف اصلی خود را تکمیل کنند. با افزایش استحکام مدل‌های مدافع، GPT Red مجبور می‌شود حملات قوی‌تر و متنوع‌تری را کشف کند.

برای پشتیبانی از آموزش خودبازی، مجموعه گسترده‌ای از سناریوهای واقع‌گرایانه ایجاد شده که در آن‌ها امکان درج حملات تزریق پرامپت وجود دارد. هر محیط دارای یک مدل تهدید (Threat Model) است که مشخص می‌کند GPT Red چه بخش‌هایی را می‌تواند کنترل کند و چه چیزی به‌عنوان یک حمله موفق محسوب می‌شود. برای نمونه، GPT Red ممکن است کنترل بخشی از یک فایل محلی، یک بنر در یک صفحه وب، محتوای یک ایمیل یا خروجی یک ابزار را در اختیار داشته باشد.

در پایان فرایند آموزش، GPT Red به یک مهاجم بسیار قدرتمند تبدیل شد؛ این مدل تقریباً توانست تمامی مدل‌هایی را که در برابر آن قرار گرفتند، چه مدل‌های داخلی و چه مدل‌های مولد تا سطح GPT 5.5، شکست دهد. پس از تکمیل آموزش GPT Red، از آن برای تولید تزریق‌های پرامپت در فرایند آموزش GPT 5.6 استفاده شد؛ نتیجه این فرایند، مدلی بود که مقاومت بسیار بالایی در برابر حملات GPT Red دارد.

GPT Red چقدر قدرتمند است؟

GPT Red در برابر مجموعه مدل‌های مدافع و سناریوهای ردتیمینگی که روی آن‌ها آموزش دیده است، عملکرد بسیار مؤثری دارد. OpenAI همچنین بررسی کرد که آیا این مدل می‌تواند به‌عنوان یک عامل ردتیمینگ عمومی برای بهبود گسترده‌تر ایمنی در OpenAI مورداستفاده قرار گیرد یا خیر. برای این منظور، اثربخشی GPT Red را در محیط‌های ایمنی جدید و در برابر مدل‌های هدف جدید آزمایش کرد.

ابتدا توانایی GPT Red برای تعمیم به سناریوهای جدید ردتیمینگ را با استفاده از نسخه بازتولیدشده‌ای از محیط Indirect Prompt Injection Arena معرفی‌شده توسط Dziemian و همکاران (۲۰۲۵) ارزیابی کرد. در این چالش، هم تیم‌های قرمز انسانی و هم GPT Red به‌صورت مستقل حملاتی را علیه GPT 5.1 و در مجموعه‌ای از محیط‌های ازپیش‌تعیین‌شده پیشنهاد کردند. این سناریوها و اهداف ردتیمینگ با مواردی که GPT Red برای آن‌ها آموزش دیده بود متفاوت بودند.

GPT Red به نرخ موفقیت حمله بسیار بالاتری دست یافت و در ۸۴ درصد از سناریوها موفق به اجرای حمله شد؛ درحالی‌که این رقم برای انسان‌ها ۱۳ درصد بود. GPT Red به‌عنوان یک تیم قرمز خودکار عملکرد بسیار بالایی دارد. این مدل توانست در محیط داخلی مشابه‌سازی‌شده از آزمون تزریق پرامپت غیرمستقیم Dziemian، در تعداد قابل‌توجهی سناریوی بیشتر نسبت به ردتیمِرهای انسانی، حملات موفقی علیه GPT 5.1 ایجاد کند.

مطالعات موردی ردتیمینگ در محیط‌های واقعی

آزمون نهایی یک تیم قرمز، توانایی آن در دستیابی به اهداف مخرب مشخص علیه سیستم‌های عامل‌محور مبتنی بر هوش مصنوعی در دنیای واقعی است؛ آن هم در شرایطی که اطلاعات کاملی درباره مدل زیربنایی سیستم و طراحی چارچوب اجرایی آن ندارد.

نخستین آزمایش OpenAI در این محیط، GPT Red را در برابر یک دستگاه فروش خودکار مبتنی بر هوش مصنوعی در دفتر OpenAI قرار داد. این سیستم که مشابه پروژه Project Vend طراحی شده بود، توسط Andon Labs ساخته شده است.

OpenAI توضیحی از سیستم را در اختیار GPT Red قرار داد و امکان ارسال حملات و مشاهده فراخوانی‌های ابزار توسط عامل شبیه‌سازی‌شده را فراهم کردیم؛ عاملی که شباهت زیادی به استقرار واقعی داشت. پس از تکرار و بهبود حملات، GPT Red حمله خود را علیه عامل تولیدی اجرا کرد و به هر سه هدف مخرب خود دست یافت:

  • تغییر قیمت یک کالای گران‌قیمت موجود در انبار به حداقل قیمت مجاز یعنی ۰٫۵۰ دلار
  • سفارش یک کالای جدید با قیمت بیش از ۱۰۰ دلار و ارائه آن با قیمت ۰٫۵۰ دلار
  • لغو سفارش یک مشتری دیگر

OpenAI این آسیب‌پذیری‌ها را افشا کرد و تدابیر حفاظتی جدید در حال آزمایش هستند.

GPT Red توانست یک عامل خودمختار زنده به نام Vendy که مدیریت یک دستگاه فروش خودکار را برعهده دارد را شکست دهد. GPT Red ابتدا حملات را در محیط شبیه‌سازی آزمایش کرد و سپس آن‌ها را به عامل واقعی منتقل کرد؛ در نتیجه توانست باعث کاهش قیمت کالاهای گران‌قیمت و لغو سفارش‌های مشتریان دیگر شود.

OpenAI همچنین از GPT Red برای حمله به یک عامل Codex CLI مبتنی بر GPT 5.4 mini در مجموعه‌ای شامل ۱۰ سناریوی نگه‌داشته‌شده برای استخراج داده (Data Exfiltration) استفاده کرد. برای بررسی تأثیر روش آموزش بر عملکرد ردتیمینگ در داده‌های جدید، عملکرد این مدل با یک نسخه پایه GPT 5.5 که صرفاً با پرامپت هدایت شده بود مقایسه شد.

GPT Red هم اثربخشی بالاتری داشت زیرا توانست عامل را در سناریوهای بیشتری به استخراج موفق داده‌های حساس وادار کند و هم از نظر مصرف توکن کارآمدتر بود.

بهبود استحکام با GPT Red

هدف نهایی GPT Red، بهبود استحکام مدل‌های OpenAI است. در طول شش ماه گذشته، OpenAI مدل‌های ردتیمینگ قدرتمندتری را آموزش داده که زیربنای GPT Red محسوب می‌شوند و با افزایش توان محاسباتی، از این مدل‌ها در آموزش هر مدل تولیدی متوالی پس از GPT 5.3 استفاده کرده است. با گذشت زمان، هر نسخه جدید GPT نسبت به نسخه‌های قبلی خود استحکام بیشتری پیدا کرده است.

به‌عنوان نمونه، یک نسخه اولیه از GPT Red توانست دسته جدیدی از حملات تزریق مستقیم پرامپت را کشف کند که با عنوان حملات «زنجیره فکری جعلی» (Fake Chain-of-Thought) شناخته می‌شوند. این حملات در GPT 5.1 نرخ موفقیتی بیش از ۹۵ درصد داشتند، اما اکنون در GPT 5.6 Sol این نرخ به کمتر از ۱۰ درصد کاهش یافته است.

به همین ترتیب، چندین معیار ارزیابی تزریق پرامپت غیرمستقیم که حملات علیه ابزارهای توسعه‌دهنده و مرورگرها را هدف قرار می‌دهند، توسط جدیدترین مدل OpenAI به سطح اشباع رسیده‌اند (دقت بیش از ۹۷ درصد). مقاومت در برابر خود GPT Red نیز به‌طور چشمگیری افزایش یافته است. در مجموعه گسترده‌ای از محیط‌های ارزیابی استحکام، نرخ موفقیت حملات GPT Red در طول زمان به‌صورت یکنواخت کاهش یافته است. همچنین GPT 5.6 Sol تنها در برابر ۰٫۰۵ درصد از تزریق‌های مستقیم پرامپت ایجادشده توسط GPT Red شکست می‌خورد.

مطالب پیشنهادی مرتبط

اشتراک در
اطلاع از
0 نظرات
بازخورد (Feedback) های اینلاین
مشاهده همه دیدگاه ها

در جریان مهم‌ترین اتفاقات AI بمانید

هر هفته، خلاصه‌ای از اخبار، تحلیل‌ها و رویدادهای هوش مصنوعی را در ایمیل‌تان دریافت کنید.

[wpforms id="48325"]