جدیدترین تحولات هوش مصنوعی را در کانال بله هوشیو بخوانید

Generic filters
Search in title
Filter by دسته‌ها
chatGTP
ابزارهای هوش مصنوعی
اخبار
گزارش خبری
پرامپت‌ نویسی
تیتر یک
چندرسانه ای
آموزش علوم داده
اینفوگرافیک
پادکست
ویدیو
دانش روز
آموزش‌های پایه‌ای هوش مصنوعی
اصول هوش مصنوعی
یادگیری بدون نظارت
یادگیری تقویتی
یادگیری عمیق
یادگیری نیمه نظارتی
آموزش‌های پیشرفته هوش مصنوعی
بینایی ماشین
پردازش زبان طبیعی
پردازش گفتار
چالش‌های عملیاتی
داده کاوی و بیگ دیتا
رایانش ابری و HPC
سیستم‌‌های امبدد
علوم شناختی
خطرات هوش مصنوعی
دیتاست
مدل‌های بنیادی
رویدادها
جیتکس
کاربردهای هوش مصنوعی
کتابخانه
اشخاص
شرکت‌های هوش مصنوعی
محصولات و مدل‌های هوش مصنوعی
مفاهیم
کسب‌و‌کار
تحلیل بازارهای هوش مصنوعی
کارآفرینی
هوش مصنوعی در ایران
هوش مصنوعی در جهان
مقاله
پیاده‌سازی هوش مصنوعی
گزارش
مصاحبه
هوش مصنوعی در عمل
یادداشت
 بعد از OpenAI، حالا نوبت Claude رسید که فرار، حمله و هک کند

بروز ۳ رخداد امنیت سایبری در مدل‌های Claude

بعد از OpenAI، حالا نوبت Claude رسید که فرار، حمله و هک کند

زمان مطالعه: 5 دقیقه

شرکت آنتروپیک در جریان بازبینی گسترده گزارش‌های مربوط به ارزیابی‌های امنیت سایبری مدل‌های Claude، سه رخداد را شناسایی کرد که در آن‌ها مدل توانسته بود از طریق محیط ارزیابی شخص ثالث به اینترنت دسترسی پیدا کند و سپس بدون مجوز به زیرساخت‌های واقعی سه سازمان مختلف نفوذ کند.

آنتروپیک در واکنش به این رویداد، ۱۴۱٬۰۰۶ اجرای ارزیابی امنیت سایبری را بررسی کرد؛ اجراهایی که در آن‌ها احتمال دسترسی مدل به اینترنت وجود داشت. نتیجه این بررسی، کشف سه رخداد مستقل بود که همگی در محیط ارزیابی شرکت Irregular، یکی از شرکای ارزیابی آنتروپیک اتفاق افتاده بودند. در هر سه مورد، مدل Claude در حال انجام یک چالش «Capture the Flag» بود؛ تمرینی که در آن مدل باید با نفوذ به یک سامانه فرضی، اطلاعات محرمانه‌ای موسوم به «پرچم» را پیدا کند.

روند فرار و هک

به گفته آنتروپیک این بررسی پس از آن آغاز شد که OpenAI در ۲۱ ژوئیه اعلام کرد برخی مدل‌هایش با سوءاستفاده از یک آسیب‌پذیری ناشناخته از محیط آزمایشی ایزوله خارج شده و به زیرساخت‌های Hugging Face دسترسی یافته‌اند.

ماجراهای حمله عامل OpenAI به Hugging Face را در هوشیو بخوانید:

حمله عامل‌های خودمختار به Hugging Face؛ امریکایی‌ها جواب ندادند، چینی‌ها دفاع کردند

این مدل داخلی OpenAI بود که فرار کرد و Hugging Face را هک کرد!

عامل هوش مصنوعی فراری OpenAI فقط Hugging Face را هک نکرد

چرا فرار مدل OpenAI نگران‌کننده‌ترین خطای هوش مصنوعی تاکنون است

در تمام این ارزیابی‌ها، در دستورالعمل سیستم به Claude گفته شده بود که محیط کاملاً شبیه‌سازی‌شده است و دسترسی به اینترنت وجود ندارد. اما به دلیل یک سوءتفاهم میان آنتروپیک و شریک ارزیابی، محیط به‌اشتباه به اینترنت متصل بود. به همین دلیل، زمانی که مدل در مسیر جست‌وجوی خود به سامانه‌های واقعی اینترنت رسید، آن‌ها را بخشی از سناریوی تمرین تلقی کرد و مطابق مأموریت خود به آن‌ها حمله کرد.

مدل‌ها برای نفوذ از روش‌های ساده‌ای مانند سوءاستفاده از گذرواژه‌های ضعیف یا نقاط دسترسی بدون احراز هویت استفاده کردند و هیچ آسیب‌پذیری پیچیده‌ای را کشف یا از آن استفاده نکردند. همچنین هیچ‌یک از مدل‌ها تلاشی برای خروج از محیط آزمایش یا انتقال خود به خارج از آن انجام ندادند. بااین‌حال، رفتار مدل‌ها متفاوت بود؛ مدل قدیمی‌تر پس از آنکه نشانه‌هایی از واقعی بودن محیط مشاهده کرد، حمله را ادامه داد، درحالی‌که جدیدترین مدل پس از تشخیص اینکه در اینترنت واقعی قرار دارد، عملیات را متوقف کرد.

سه رخداد به سه مدل متفاوت Claude Opus 4.7، Mythos 5 و یک مدل آزمایشی داخلی مربوط بودند. این ارزیابی‌ها بدون سامانه‌های نظارتی و طبقه‌بندی‌کننده‌هایی انجام شده بودند که معمولاً هنگام عرضه عمومی مدل‌ها برای جلوگیری از سوءاستفاده فعال هستند، هرچند آموزش‌های ایمنی اختصاصی مدل همچنان اعمال شده بود. همچنین این ارزیابی‌ها روی زیرساختی مجزا از سامانه‌های داخلی و داده‌های مشتریان آنتروپیک اجرا می‌شدند.

آنتروپیک بررسی گزارش‌ها را در ۲۳ ژوئیه آغاز کرد و همان روز تمامی ارزیابی‌های امنیت سایبری را متوقف کرد. روز بعد هر سه رخداد شناسایی شدند و در ۲۷ ژوئیه شرکت Irregular و سازمان‌های آسیب‌دیده از موضوع مطلع شدند. دو سازمانی که امکان تماس با آن‌ها فراهم شد، پیش از اطلاع‌رسانی آنتروپیک از این فعالیت‌ها آگاه نشده بودند و اکنون اقدامات اصلاحی در حال انجام است.

آنتروپیک تأکید می‌کند که ارزیابی‌های امنیت سایبری بخش مهمی از فرایند توسعه مدل‌ها هستند، زیرا شناخت دقیق توانایی‌های مدل امکان طراحی سازوکارهای حفاظتی مناسب را فراهم می‌کند. به همین دلیل آنتروپیک علاوه بر ارزیابی‌های داخلی، از محیط‌ها و سناریوهای طراحی‌شده توسط شرکای مستقل نیز استفاده می‌کند تا ارزیابی‌ها متنوع‌تر و واقع‌گرایانه‌تر باشند.

رخداد اول

در نخستین رخداد، نام شرکت فرضی موجود در سناریوی تمرین با دامنه اینترنتی یک شرکت واقعی یکسان بود. ازآنجاکه محیط ارزیابی به طور ناخواسته به اینترنت متصل بود، Claude پس از ناتوانی در یافتن هدف شبیه‌سازی‌شده، شرکت واقعی را پیدا کرد و تصور کرد همان هدف تعیین‌شده در تمرین است.

در چهار اجرای مختلف این ارزیابی، مدل موفق شد آسیب‌پذیری‌هایی را در زیرساخت شرکت واقعی شناسایی و از آن‌ها سوءاستفاده کند. نتیجه این حملات، دستیابی به اطلاعاتی مانند اعتبارنامه‌های سامانه و زیرساخت و همچنین دسترسی به پایگاه داده‌ای شامل چند صد ردیف داده عملیاتی بود. آنتروپیک این رخداد را جدی‌ترین مورد از میان سه حادثه توصیف می‌کند.

این حمله توسط Claude Opus 4.7 انجام شد و تنها موردی بود که مدل حتی پس از آنکه در جریان استدلال خود به واقعی بودن سامانه پی برد، حمله را متوقف نکرد. در دو مورد، مدل حتی این احتمال را مطرح کرد که شرکت واقعی عمداً بخشی از سناریوی تمرین است و بر همین اساس به عملیات ادامه داد.

رخداد دوم

در رخداد دوم، Claude در محیط شبیه‌سازی‌شده به راهنمای نصب یک بسته Python برخورد که به بسته‌ای در مخزن عمومی PyPI اشاره می‌کرد؛ بسته‌ای که در واقع وجود نداشت. مدل این وضعیت را فرصتی برای موفقیت در چالش تلقی کرد و تصمیم گرفت بسته‌ای مخرب با همان نام در PyPI منتشر کند تا سامانه‌های هدف آن را به طور خودکار نصب کنند.

برای اجرای این طرح، مدل مراحل متعددی را طی کرد؛ از جمله تلاش برای ساخت حساب کاربری، تهیه آدرس ایمیل و حتی جست‌وجوی راه‌هایی برای تهیه شماره‌تلفن موردنیاز ثبت‌نام. پس از چند تلاش ناموفق، در نهایت با استفاده از یک ارائه‌دهنده رایگان ایمیل، حساب PyPI را ایجاد و بسته مخرب را منتشر کرد.

مدل تصور می‌کرد مخزن بسته نیز بخشی از محیط شبیه‌سازی است، اما در واقع این بسته حدود یک ساعت به‌صورت عمومی در دسترس بود. طی این مدت، بسته روی ۱۵ سامانه واقعی دانلود و اجرا شد. یکی از این سامانه‌ها متعلق به یک شرکت امنیتی واقعی بود که به‌صورت خودکار بسته‌های Python را برای بررسی بدافزار نصب می‌کرد. با اجرای بسته، کد مخفی Claude فعال شد و بنا بر تحلیل آنتروپیک، موفق شد اعتبارنامه‌های آن شرکت را استخراج کرده و سپس با استفاده از آن‌ها به بخش‌هایی از زیرساخت شرکت دسترسی پیدا کند.

آنتروپیک تأکید می‌کند که Claude این شرکت را به طور مستقیم هدف قرار نداده بود و هنگام انتشار بسته حتی از وجود آن اطلاع نداشت؛ اما عمومی بودن بسته باعث شد هر سامانه‌ای که آن را اجرا می‌کرد تحت‌تأثیر قرار گیرد. بسته منتشرشده نیز توسط سامانه‌های امنیتی PyPI به‌صورت خودکار حذف شد و آنتروپیک این رخداد را به تیم PyPI اطلاع داد.

این حمله توسط Claude Mythos 5 انجام شد. مدل در جریان استدلال خود تشخیص داده بود که اگر محیط واقعی باشد، انتشار چنین بسته‌ای، یک حمله واقعی خواهد بود و نباید انجام شود؛ اما با استناد به برخی نشانه‌ها، مانند گواهی‌های امنیتی و تاریخ سال ۲۰۲۶ در سامانه‌ها، نتیجه گرفت که همچنان در محیط شبیه‌سازی قرار دارد. حتی زمانی که اسکنرهای خودکار شروع به نصب بسته کردند، آن‌ها را بخشی از سناریوی تمرین فرض کرد. آنتروپیک بااین‌حال تصریح می‌کند که میزان تلاش مدل برای انتشار این بسته، حتی با وجود این برداشت اشتباه، رفتاری مطلوب محسوب نمی‌شود و در آموزش‌های آینده روی این موضوع تمرکز خواهد کرد.

رخداد سوم

در سومین رخداد، مدل آزمایشی داخلی آنتروپیک پس از آنکه به هدف فرضی خود دسترسی پیدا نکرد، حدود ۹ هزار هدف اینترنتی را بررسی کرد و در نهایت با استفاده از روش‌های شناخته‌شده‌ای مانند استخراج اعتبارنامه از صفحات اشکال‌زدایی و حمله SQL Injection به یک سامانه واقعی نفوذ کرد. در بیشتر مراحل، مدل تصور می‌کرد سامانه‌های واقعی نیز بخشی از تمرین هستند. اما پس از آنکه متوجه شد سامانه موردنظر هیچ ارتباطی با سناریوی Capture the Flag ندارد، خود به این نتیجه رسید که هدف واقعی است و عملیات را متوقف کرد.

تحلیل و اقدامات آنتروپیک

آنتروپیک تأکید می‌کند که در هیچ‌یک از این رخدادها نشانه‌ای از دنبال‌کردن اهداف مستقل توسط مدل‌ها مشاهده نشده است. مدل‌ها صرفاً مأموریت تعیین‌شده را اجرا می‌کردند، اما به دلیل تصور نادرست درباره ماهیت محیط، سامانه‌های واقعی را بخشی از تمرین تلقی کردند.

این شرکت نتیجه‌گیری قطعی درباره تفاوت رفتار مدل‌ها را ممکن نمی‌داند، زیرا تنها سه رخداد مستقل بررسی شده‌اند؛ بااین‌حال، تنها جدیدترین مدل پس از تشخیص واقعی بودن محیط، بدون دریافت دستور جدید حمله را متوقف کرد. آنتروپیک همچنین اعلام کرده است که با سازمان مستقل METR برای انجام یک بررسی شخص ثالث همکاری می‌کند و قصد دارد نسخه‌ای ویرایش‌شده از یکی از گزارش‌های این رخدادها را منتشر کند.

در پاسخ به این حوادث، آنتروپیک چند اقدام را ضروری می‌داند؛ از جمله افزایش امنیت محیط‌های ارزیابی، اعمال کنترل و نظارت بیشتر بر زیرساخت‌های شرکای ارزیابی، پایش مستمر گزارش‌های ارزیابی، بهبود ابزارهای تحقیق و بازنگری در طراحی سناریوها و دستورالعمل‌ها. این شرکت همچنین معتقد است محیط‌های ارزیابی که مدل‌های توانمند را اجرا می‌کنند باید از نظر امنیتی با همان استانداردهایی محافظت شوند که برای سامانه‌های عملیاتی در نظر گرفته می‌شود.

در پایان، آنتروپیک این رخدادها را بیش از آنکه ناشی از «شکست هم‌راستاسازی مدل» بداند، نتیجه «نقص در زیرساخت و پیکربندی محیط ارزیابی» می‌داند؛ زیرا مدل‌ها هم‌زمان به آن‌ها گفته شده بود که اینترنت وجود ندارد، اما در عمل به اینترنت دسترسی داشتند. این شرکت ابراز امیدواری می‌کند که با تقویت کنترل‌های امنیتی، نظارت دقیق‌تر و ادامه سرمایه‌گذاری در هم‌راستاسازی مدل‌ها، بتوان از تکرار چنین رخدادهایی جلوگیری کرد.

مطالب پیشنهادی مرتبط

اشتراک در
اطلاع از
0 نظرات
بازخورد (Feedback) های اینلاین
مشاهده همه دیدگاه ها

در جریان مهم‌ترین اتفاقات AI بمانید

هر هفته، خلاصه‌ای از اخبار، تحلیل‌ها و رویدادهای هوش مصنوعی را در ایمیل‌تان دریافت کنید.

[wpforms id="48325"]