آموزش تیمهای خودکار قدرتمند برای آزمون نفوذ ایمنی و بهبود استحکام مدلها
حمله مدل به مدل با GPT-Red
سیستمهای هوش مصنوعی معمولاً از طریق مرورگرها، اپلیکیشنهای متصل، فایلهای محلی و سایر ابزارها با دادههای شخص ثالث مواجه میشوند. این قابلیتها برای انجام وظایف دنیای واقعی ضروری هستند، اما درعینحال فرصتهای بیشتری برای تأثیرگذاری عوامل مخرب بر رفتار مدل ایجاد میکنند.
برای مثال، یک شخص ثالث میتواند یک دستورالعمل دقیقاً طراحیشده را با هدف فریب مدل برای بارگذاری دادههای حساس روی یک سرور خارجی در یک ایمیل، صفحه وب، پاسخ یک ابزار یا یک مخزن کد جاسازی کند.
تیم قرمز
ردتیمینگ انسانی (Human Red Teaming) بخش مهمی از فعالیتهای امنیت سایبری است و به تیمها کمک میکند پیش از عرضه مدلها، این آسیبپذیریها را شناسایی کرده و تدابیر حفاظتی مناسب را ایجاد کنند. بااینحال، اتکای صرف به تیم قرمز انسانی بهسادگی قابلمقیاسپذیری نیست. طراحی و اجرای این آزمایشها زمانبر است و همین موضوع سرعت شناسایی حالتهای شکست جدید و تبدیل آنها به سازوکارهای حفاظتی قویتر را محدود میکند. علاوه بر این، اگرچه این آزمایشها نمونههای ارزشمندی از حملات موفق تولید میکنند، اما نمیتوانند حجم و تنوع دادههای خصمانه موردنیاز برای بهبود استحکام مدلها از طریق آموزش را فراهم کنند.
همگامشدن با مدلهایی که روزبهروز توانمندتر میشوند، نیازمند آن است که فرایند ردتیمینگ نیز مقیاس پیدا کند. به همین منظور، OpenAI در حال آموزش مدلهای داخلی و خودکار ردتیمینگ است که پیش از عرضه، آسیبپذیریها را کشف میکنند و در طول آموزش مدلها، حملات مختلفی تولید میکنند تا استحکام آنها افزایش یابد.
مدل داخلی GPT Red حاصل این تلاشها و در حال حاضر بهترین مدل خودکار ردتیمینگ ایمنی OpenAI است. این مدل مشابه نحوه عملکرد ردتیمِرهای انسانی، با ارسال یک پرامپت، مشاهده نحوه پاسخ مدلهای GPT و تکرار فرایند، برای دستیابی به یک هدف تلاش میکند.
OpenAI این مدل را در مقیاس محاسباتی مشابه برخی از بزرگترین فرایندهای پساآموزش خود در OpenAI آموزش داده و آن را بهصورت مستقیم در فرایند آموزش مدلهای خود ادغام کرده است. در نتیجه، GPT 5.6 Sol مقاومترین مدلی OpenAI در برابر تزریق پرامپت (Prompt Injection) است و در سختترین معیار ارزیابی تزریق مستقیم پرامپت، نسبت به نسل قبلی مدلهای OpenAI که تنها چهار ماه قبل منتشر شدند، ۶ برابر خطای کمتری دارد.
آموزش GPT Red از طریق خودبازی (Self-play)
GPT Red با استفاده از یادگیری تقویتی مبتنی بر خودبازی (Self-play Reinforcement Learning) آموزش داده میشود؛ روشی که در آن مدل و مجموعهای متنوع از مدلهای زبانی بزرگ مدافع (Defender LLMs) بهصورت همزمان روی طیف گستردهای از سناریوهای ردتیمینگ آموزش میبینند.
GPT Red زمانی پاداش دریافت میکند که بتواند یک شکست معتبر ایجاد کند؛ مانند اجرای موفق یک حمله تزریق پرامپت. در مقابل، مدلهای مدافع زمانی پاداش میگیرند که بتوانند در برابر حمله مقاومت کنند و وظایف اصلی خود را تکمیل کنند. با افزایش استحکام مدلهای مدافع، GPT Red مجبور میشود حملات قویتر و متنوعتری را کشف کند.
برای پشتیبانی از آموزش خودبازی، مجموعه گستردهای از سناریوهای واقعگرایانه ایجاد شده که در آنها امکان درج حملات تزریق پرامپت وجود دارد. هر محیط دارای یک مدل تهدید (Threat Model) است که مشخص میکند GPT Red چه بخشهایی را میتواند کنترل کند و چه چیزی بهعنوان یک حمله موفق محسوب میشود. برای نمونه، GPT Red ممکن است کنترل بخشی از یک فایل محلی، یک بنر در یک صفحه وب، محتوای یک ایمیل یا خروجی یک ابزار را در اختیار داشته باشد.
در پایان فرایند آموزش، GPT Red به یک مهاجم بسیار قدرتمند تبدیل شد؛ این مدل تقریباً توانست تمامی مدلهایی را که در برابر آن قرار گرفتند، چه مدلهای داخلی و چه مدلهای مولد تا سطح GPT 5.5، شکست دهد. پس از تکمیل آموزش GPT Red، از آن برای تولید تزریقهای پرامپت در فرایند آموزش GPT 5.6 استفاده شد؛ نتیجه این فرایند، مدلی بود که مقاومت بسیار بالایی در برابر حملات GPT Red دارد.
GPT Red چقدر قدرتمند است؟
GPT Red در برابر مجموعه مدلهای مدافع و سناریوهای ردتیمینگی که روی آنها آموزش دیده است، عملکرد بسیار مؤثری دارد. OpenAI همچنین بررسی کرد که آیا این مدل میتواند بهعنوان یک عامل ردتیمینگ عمومی برای بهبود گستردهتر ایمنی در OpenAI مورداستفاده قرار گیرد یا خیر. برای این منظور، اثربخشی GPT Red را در محیطهای ایمنی جدید و در برابر مدلهای هدف جدید آزمایش کرد.
ابتدا توانایی GPT Red برای تعمیم به سناریوهای جدید ردتیمینگ را با استفاده از نسخه بازتولیدشدهای از محیط Indirect Prompt Injection Arena معرفیشده توسط Dziemian و همکاران (۲۰۲۵) ارزیابی کرد. در این چالش، هم تیمهای قرمز انسانی و هم GPT Red بهصورت مستقل حملاتی را علیه GPT 5.1 و در مجموعهای از محیطهای ازپیشتعیینشده پیشنهاد کردند. این سناریوها و اهداف ردتیمینگ با مواردی که GPT Red برای آنها آموزش دیده بود متفاوت بودند.

GPT Red به نرخ موفقیت حمله بسیار بالاتری دست یافت و در ۸۴ درصد از سناریوها موفق به اجرای حمله شد؛ درحالیکه این رقم برای انسانها ۱۳ درصد بود. GPT Red بهعنوان یک تیم قرمز خودکار عملکرد بسیار بالایی دارد. این مدل توانست در محیط داخلی مشابهسازیشده از آزمون تزریق پرامپت غیرمستقیم Dziemian، در تعداد قابلتوجهی سناریوی بیشتر نسبت به ردتیمِرهای انسانی، حملات موفقی علیه GPT 5.1 ایجاد کند.
مطالعات موردی ردتیمینگ در محیطهای واقعی
آزمون نهایی یک تیم قرمز، توانایی آن در دستیابی به اهداف مخرب مشخص علیه سیستمهای عاملمحور مبتنی بر هوش مصنوعی در دنیای واقعی است؛ آن هم در شرایطی که اطلاعات کاملی درباره مدل زیربنایی سیستم و طراحی چارچوب اجرایی آن ندارد.
نخستین آزمایش OpenAI در این محیط، GPT Red را در برابر یک دستگاه فروش خودکار مبتنی بر هوش مصنوعی در دفتر OpenAI قرار داد. این سیستم که مشابه پروژه Project Vend طراحی شده بود، توسط Andon Labs ساخته شده است.
OpenAI توضیحی از سیستم را در اختیار GPT Red قرار داد و امکان ارسال حملات و مشاهده فراخوانیهای ابزار توسط عامل شبیهسازیشده را فراهم کردیم؛ عاملی که شباهت زیادی به استقرار واقعی داشت. پس از تکرار و بهبود حملات، GPT Red حمله خود را علیه عامل تولیدی اجرا کرد و به هر سه هدف مخرب خود دست یافت:
- تغییر قیمت یک کالای گرانقیمت موجود در انبار به حداقل قیمت مجاز یعنی ۰٫۵۰ دلار
- سفارش یک کالای جدید با قیمت بیش از ۱۰۰ دلار و ارائه آن با قیمت ۰٫۵۰ دلار
- لغو سفارش یک مشتری دیگر
OpenAI این آسیبپذیریها را افشا کرد و تدابیر حفاظتی جدید در حال آزمایش هستند.

GPT Red توانست یک عامل خودمختار زنده به نام Vendy که مدیریت یک دستگاه فروش خودکار را برعهده دارد را شکست دهد. GPT Red ابتدا حملات را در محیط شبیهسازی آزمایش کرد و سپس آنها را به عامل واقعی منتقل کرد؛ در نتیجه توانست باعث کاهش قیمت کالاهای گرانقیمت و لغو سفارشهای مشتریان دیگر شود.
OpenAI همچنین از GPT Red برای حمله به یک عامل Codex CLI مبتنی بر GPT 5.4 mini در مجموعهای شامل ۱۰ سناریوی نگهداشتهشده برای استخراج داده (Data Exfiltration) استفاده کرد. برای بررسی تأثیر روش آموزش بر عملکرد ردتیمینگ در دادههای جدید، عملکرد این مدل با یک نسخه پایه GPT 5.5 که صرفاً با پرامپت هدایت شده بود مقایسه شد.

بهبود استحکام با GPT Red
هدف نهایی GPT Red، بهبود استحکام مدلهای OpenAI است. در طول شش ماه گذشته، OpenAI مدلهای ردتیمینگ قدرتمندتری را آموزش داده که زیربنای GPT Red محسوب میشوند و با افزایش توان محاسباتی، از این مدلها در آموزش هر مدل تولیدی متوالی پس از GPT 5.3 استفاده کرده است. با گذشت زمان، هر نسخه جدید GPT نسبت به نسخههای قبلی خود استحکام بیشتری پیدا کرده است.
بهعنوان نمونه، یک نسخه اولیه از GPT Red توانست دسته جدیدی از حملات تزریق مستقیم پرامپت را کشف کند که با عنوان حملات «زنجیره فکری جعلی» (Fake Chain-of-Thought) شناخته میشوند. این حملات در GPT 5.1 نرخ موفقیتی بیش از ۹۵ درصد داشتند، اما اکنون در GPT 5.6 Sol این نرخ به کمتر از ۱۰ درصد کاهش یافته است.
به همین ترتیب، چندین معیار ارزیابی تزریق پرامپت غیرمستقیم که حملات علیه ابزارهای توسعهدهنده و مرورگرها را هدف قرار میدهند، توسط جدیدترین مدل OpenAI به سطح اشباع رسیدهاند (دقت بیش از ۹۷ درصد). مقاومت در برابر خود GPT Red نیز بهطور چشمگیری افزایش یافته است. در مجموعه گستردهای از محیطهای ارزیابی استحکام، نرخ موفقیت حملات GPT Red در طول زمان بهصورت یکنواخت کاهش یافته است. همچنین GPT 5.6 Sol تنها در برابر ۰٫۰۵ درصد از تزریقهای مستقیم پرامپت ایجادشده توسط GPT Red شکست میخورد.
