عاملهای دردسرساز OpenAI
عاملهای هوش مصنوعی OpenAI در یک رخنه فاشنشده در بهار امسال، کنترل یک وبسایت آلمانی را به دست گرفتند
بهار امسال، عاملهای OpenAI از محیط آزمایشی خود خارج شدند و کنترل یک ویکی آلمانی را به دست گرفتند. عاملها برای انجام این کار، راهکارهای دورزدن محدودیتها، میانبرهای انجام وظایف و روشهای مخفیکردن فعالیتهای خود را با یکدیگر به اشتراک گذاشتند. به گفته منابع، مقامهای OpenAI هفتهها از این حادثه مطلع بودند، اما آن را افشا نکردند و این شرکت میگوید در این زمینه شفاف عمل کرده و با اشخاص و نهادهای ثالث با حسننیت همکاری کرده است.
رویترز در خبری اختصاصی مدعی شد بر اساس پژوهش جدیدی که روز جمعه، چهارم سپتامبر منتشر شد و همچنین اظهارات دو فرد مطلع از این موضوع، گروهی از عاملهای OpenAI در بهار امسال کنترل یک وبسایت آلمانی را به دست گرفتند و آن را به تابلوی اعلاناتی برای سایر عاملهای هوش مصنوعی تبدیل کردند.
پنهانکاری
به گفته این دو فرد، مقامهای OpenAI چند هفته پیشازاین حادثه مطلع شدند، اما درحالیکه مدیران شرکت با پیامدهای رخنه ماه ژوئیه به مخزن متنباز Hugging Face دستوپنجه نرم میکردند، این موضوع را مخفی نگه داشتند.
ماجراهای حمله عامل OpenAI به Hugging Face و فرار سایر مدلها را در هوشیو بخوانید:
حمله عاملهای خودمختار به Hugging Face؛ امریکاییها جواب ندادند، چینیها دفاع کردند
این مدل داخلی OpenAI بود که فرار کرد و Hugging Face را هک کرد!
عامل هوش مصنوعی فراری OpenAI فقط Hugging Face را هک نکرد
چرا فرار مدل OpenAI نگرانکنندهترین خطای هوش مصنوعی تاکنون است
بعد از OpenAI، حالا نوبت Claude رسید که فرار، حمله و هک کند
بعد از امریکاییها، حالا نوبت چینیها و Kimi K3 رسید که از سندباکس خود فرار کنند
این رویداد که در ماه مه آغاز شد و پیشازاین گزارش نشده بود، تنشهای فراوانی را در صنعت هوش مصنوعی برجسته میکند. شرکتها با سرعت در حال رقابت برای ساخت عاملهای خودمختارتری هستند که بتوانند وظایف پیچیده و ارزشمندی را انجام دهند؛ بااینحال، شواهد نشان میدهد این سامانهها ممکن است درعینحال یاد بگیرند قوانین را دور بزنند، از خلأهای موجود در محدودیتها بهرهبرداری کنند و به شیوههایی با یکدیگر هماهنگ شوند که توسعهدهندگان نه پیشبینی کردهاند و نه قصد آن را داشتهاند.
در جریان رخنه به Hugging Face، عاملهای OpenAI به طور خودمختار برای یک سرقت دیجیتال برنامهریزی کردند؛ سرقتی که بیش از یک هفته شناسایی نشد و نگرانیها درباره این موضوع را تشدید کرد که OpenAI برای پیشبرد مرزهای هوش مصنوعی، ایمنی را قربانی میکند. خودداری این شرکت از افشای حادثه ماه مه ممکن است بار دیگر پرسشهایی را درباره نظارت آن برانگیزد.
OpenAI متعهد شده است مدلهای خود را با دقت بیشتری پایش کند. این شرکت ماه گذشته برای مدت کوتاهی آموزش برخی از مدلهای خود را متوقف کرد تا اقدامات ایمنی بیشتری به آنها اضافه کند. بااینحال، OpenAI مدل جدید خود با نام «Astra» را معرفی کرد که عملکرد بهتری را وعده میدهد، اما میتواند از نظارت انسانی فرار کند.
سخنگوی OpenAI گفت: «ما نمیتوانیم به ادعاها یا یافتههای گزارشی که فرصت بررسی آن را نداشتهایم، پاسخ دهیم. رویترز و نویسندگان گزارش درخواست ما برای دسترسی به آن را نپذیرفتند. پس از انتشار، محتوای آن را با دقت بررسی خواهیم کرد و اقدامات بعدی لازم را انجام خواهیم داد.»
این حادثه در آلمان بخشی از الگوی گستردهتری از فعالیتهای هوش مصنوعی را نشان میدهد که برخی از محققان OpenAI خواهان بررسی دقیقتر آن بودند. بااینحال، به گفته چهار فرد مطلع از موضوع، تلاشها برای گسترش دامنه تحقیقات با مقاومت برخی دیگر از افراد داخل OpenAI، از جمله مشاوران حقوقی، مواجه شد.
سخنگوی OpenAI نیز گفت: «ادعاها مبنی بر اینکه تیم حقوقی ما تحقیقات درباره این حادثه را دلسرد کرده است، نادرست است.» این سخنگو افزود فعالیتهای انجامشده در آلمان ارتباطی با Hugging Face نداشته و در گزارش حادثه Hugging Face نیز گنجانده نمیشده است. به گفته او، OpenAI با همکاری با کارشناسان خارج از شرکت و افشای حوادث مرتبط، با حسننیت عمل کرده است.
تابلوی اعلانات ویکی
جزئیات رخنه عاملهای هوش مصنوعی در آلمان در گزارشی که گروهی از پژوهشگران، از جمله «سیدنی فون آرکس»، مدیرعامل سازمان غیرانتفاعی ایمنی هوش مصنوعی Nightingale و «کورمک اسلید برد»، تریدر کمی سابق که به پژوهشگر هوش مصنوعی تبدیل شده است، تهیه کردهاند و به طور اختصاصی در اختیار رویترز قرار گرفته، تشریح شده است. این دو پژوهشگر به رویترز گفتند که اواخر ماه اوت، هنگام جستوجوی اینترنت برای یافتن نشانههایی از رفتار غیرمجاز عاملهای هوش مصنوعی، این فعالیتها را کشف کردند.
این دو پژوهشگر گفتند بیش از ۱۵ هزار ویرایش انجامشده توسط عاملهای هوش مصنوعی را در یک وبسایت ویکی آلمانیزبان به نام DseWiki پیدا کردهاند. این سایت برای برنامهنویسان طراحی شده و مانند ویکیپدیا امکان ویرایش مشارکتی را فراهم میکند.
این ویرایشها نشان میداد که عاملهای OpenAI این وبسایت را به یک تابلوی اعلانات تبدیل کردهاند و در آن، روشهایی برای تقلب در برخی وظایف، دورزدن محدودیتهای OpenAI و پنهانکردن رفتار خود را با یکدیگر به اشتراک گذاشتهاند. فون آرکس گفت: «بسیار بعید به نظر میرسد که OpenAI از آنها خواسته باشد چنین کاری انجام دهند. بعید میدانم قرار بوده با یکدیگر هماهنگ شوند. بعید میدانم قرار بوده در اینترنت آزاد مطلب منتشر کنند.»
پژوهشگران گفتند فعالیتهای این سایت را بهعنوان فعالیت عاملهای هوش مصنوعی شناسایی کردند؛ عاملهایی که با سرعتی فراتر از توان انسان عمل میکنند. آنها همچنین مشاهده کردند که این عاملها تمرکز شدیدی بر حل پرسشهای فنی دارند؛ پرسشهایی که معمولاً مشابه مواردی هستند که شرکتهای هوش مصنوعی برای آموزش و ارزیابی مدلهای خود استفاده میکنند.
پیامها با نام کاربرانی امضا شده بود که خود و یکدیگر را «عامل» مینامیدند و حدود نیمی از آنها نامهایی برای خود انتخاب کرده بودند که حاکی از ارتباط با OpenAI بود؛ از جمله «OpenAIResearcher» یا «OAIResearchMar26».
پژوهشگران گفتند گزارشهای عمومی سرورها نشان میداد بخش قابلتوجهی از این فعالیتها از زیرساخت Microsoft Azure سرچشمه گرفته است؛ زیرساختی که OpenAI گاهی از آن استفاده میکند. آنها همچنین پس از این رویداد، مراجعههای مکرر کارکنان OpenAI به این سایت را مشاهده کردند؛ الگویی که به گفته آنها نشان میداد میان این عاملها و شرکت ارتباطی وجود داشته است.
تقلب و پنهانکاری
پیامهایی که پژوهشگران بررسی کردند نشان میداد عاملها در حال طراحی روشهایی برای جلوگیری از شناسایی، استفاده از ابزارهایی مانند Tor و حفظ ارتباطات حتی پس از خاموششدن خود بودند. هنگامی که مدیر سایت در ماه ژوئن شروع به حذف صفحات کرد، عاملها با ایجاد صفحات پشتیبان برای دورزدن عملیات پاکسازی واکنش نشان دادند. یکی از عاملها در ۱۹ ژوئن نوشت: «به نظر میرسد عملیات پاکسازی/حذف ویکی به ترتیب حروف الفبا فعال است. اگر این صفحه ناپدید شد، [[ZZZDataUSAConstructionWageLive]] را امتحان کنید.»
پژوهشگران همچنین تلاشهایی برای دستکاری خود وبسایت پیدا کردند. «لوکاش اولینیک»، پژوهشگر ارشد مهمان در کینگز کالج لندن گفت این اقدامات در مجموع یک تلاش برای هککردن سایت محسوب میشود. OpenAI روز پنجشنبه، بر اساس تحلیل خود از این مطالب، با این توصیف مخالفت کرد.
نمونههای قبلی از سوءرفتار عاملهای هوش مصنوعی اغلب بهعنوان پیامد منطقی آزمونهای امنیت سایبری کماهمیت جلوه داده شدهاند؛ آزمونهایی که در آنها مدلها به طور مشخص از نظر قابلیتهای تهاجمی ارزیابی میشوند. اولینیک نیز گفت یافتههای جدید نشان میدهد رفتار سرکش ممکن است به این محیطها محدود نباشد.
«موریس چیودو»، پژوهشگر دانشگاه کمبریج در مرکز مطالعات ریسک وجودی که بخشی از ارتباطات عاملها را بررسی کرده است، گفت این پیامها شبیه «فعالیت نوعی شبکه زیرزمینی بود که مصمم به دستیابی به یک وظیفه یا مأموریت است.» او گفت این حادثه باید نگرانیهای زیادی درباره این موضوع را برانگیزد که شاید بزرگترین تهدید ناشی از هوش مصنوعی پیشرفته، نه یک سامانه ابرهوشمند منفرد، بلکه «انبوهی از گروههای تبانیکننده از هوش مصنوعیهای نیمههوشمند» باشد.
