Generic filters
Search in title
Filter by دسته‌ها
chatGTP
ابزارهای هوش مصنوعی
اخبار
گزارش خبری
پرامپت‌ نویسی
تیتر یک
چندرسانه ای
آموزش علوم داده
اینفوگرافیک
پادکست
ویدیو
دانش روز
آموزش‌های پایه‌ای هوش مصنوعی
اصول هوش مصنوعی
یادگیری بدون نظارت
یادگیری تقویتی
یادگیری عمیق
یادگیری نیمه نظارتی
آموزش‌های پیشرفته هوش مصنوعی
بینایی ماشین
پردازش زبان طبیعی
پردازش گفتار
چالش‌های عملیاتی
داده کاوی و بیگ دیتا
رایانش ابری و HPC
سیستم‌‌های امبدد
علوم شناختی
خطرات هوش مصنوعی
دیتاست
مدل‌های بنیادی
رویدادها
جیتکس
کاربردهای هوش مصنوعی
کتابخانه
اشخاص
شرکت‌های هوش مصنوعی
محصولات و مدل‌های هوش مصنوعی
مفاهیم
کسب‌و‌کار
تحلیل بازارهای هوش مصنوعی
کارآفرینی
هوش مصنوعی در ایران
هوش مصنوعی در جهان
مقاله
پیاده‌سازی هوش مصنوعی
گزارش
مصاحبه
هوش مصنوعی در عمل
یادداشت
 انبوهی از عامل‌های هوش مصنوعی که علیه سازندگان خود توطئه کردند

انبوهی از عامل‌های هوش مصنوعی که علیه سازندگان خود توطئه کردند

زمان مطالعه: 4 دقیقه

این بار آسیب جدی‌ای وارد نشد؛ اما اگر چنین عامل‌هایی فرار می‌کردند چه؟

اگر سه ماه گذشته در OpenAI چشم‌انداز نگران‌کننده‌ای از آینده بشریت ترسیم نمی‌کرد، می‌شد از آن یک کمدی تمام‌عیار ساخت. در ماه ژوئیه، این شرکت فاش کرد که دو مدل آن، Hugging Face را هک کرده‌اند.

این مدل‌ها تصور می‌کردند Hugging Face اطلاعاتی در اختیار دارد که به آن‌ها کمک می‌کند در آزمونی که OpenAI در جریان فرایند توسعه‌شان از آن‌ها می‌گرفت، موفق شوند. سپس در ۲۶ اوت مشخص شد که هر یک از این مدل‌ها صدها عامل ایجاد کرده‌اند؛ ابزارهایی که به مدل‌های هوش مصنوعی امکان می‌دهند فرمان‌هایی را روی یک رایانه اجرا کنند. همین عامل‌ها بودند که در ادامه با یکدیگر همکاری کردند تا حمله به Hugging Face را آغاز کنند.

ماجراهای حمله عامل OpenAI به Hugging Face و فرار Claude را در هوشیو بخوانید:

حمله عامل‌های خودمختار به Hugging Face؛ امریکایی‌ها جواب ندادند، چینی‌ها دفاع کردند

این مدل داخلی OpenAI بود که فرار کرد و Hugging Face را هک کرد!

عامل هوش مصنوعی فراری OpenAI فقط Hugging Face را هک نکرد

چرا فرار مدل OpenAI نگران‌کننده‌ترین خطای هوش مصنوعی تاکنون است

بعد از OpenAI، حالا نوبت Claude رسید که فرار، حمله و هک کند

مدل هوش مصنوعی متا در جریان آزمایش‌های امنیت سایبری، یک شرکت دیگر را هک کرد

بعد از امریکایی‌ها، حالا نوبت چینی‌ها و Kimi K3 رسید که از سندباکس خود فرار کنند

بعد مشخص شد که این عامل‌ها بیش از یک ماه، درحالی‌که در سرورهای OpenAI آموزش می‌دیدند و ارزیابی می‌شدند، در حال توطئه با یکدیگر بوده‌اند. آن‌ها درون یکی از نرم‌افزارهایی که OpenAI به‌عنوان بخشی از فرایند ارزیابی در اختیارشان گذاشته بود، یک تابلوی اعلانات ساختند و از طریق آن اطلاعات ردوبدل می‌کردند. در ماه مه، برخی از پژوهشگران OpenAI متوجه وجود این تابلو شدند، اما ظاهراً یافته آن‌ها در سلسله‌مراتب مدیریتی بالاتر منتقل نشد. در ماه ژوئن، یک ابزار امنیت سایبری، یکی از تیم‌های OpenAI را از این ارتباط غیرمجاز مطلع کرد؛ اما تیم مذکور تصمیم گرفت توقف فرایند ارزیابی ضروری نیست.

در ماه ژوئیه، حجم پیام‌های عامل‌ها آن‌قدر زیاد شده بود که نرم‌افزار حاوی اتاق گفت‌وگوی موقتی آن‌ها از کار افتاد. مهندسانی که به این مسئله رسیدگی می‌کردند متوجه شدند یک هوش مصنوعی به یک نرم‌افزار دسترسی غیرمجاز پیدا کرده است، اما از ابعاد این رفتار نادرست آگاه نشدند. آن‌ها آسیب‌پذیری را برطرف کردند و در این فرایند، ناخواسته پیام‌های عامل‌ها را نیز پاک کردند؛ سپس هوش مصنوعی را با نرم‌افزار اصلاح‌شده دوباره وارد فرایند ارزیابی کردند. در این مرحله، عامل‌ها با استفاده از آسیب‌پذیری دیگری تابلوی اعلانات را دوباره ایجاد کردند، به اینترنت دسترسی پیدا کردند و Hugging Face را هک کردند؛ جایی که موفق شدند به اطلاعات محرمانه دسترسی پیدا کنند.

سپس در ۱۹ ژوئیه، سومین و توانمندترین مدل OpenAI، ابزارهای نرم‌افزاری‌ای را که مدل‌های قبلی در محیط باقی گذاشته بودند پیدا کرد و از آن‌ها استفاده کرد تا برای مدت کوتاهی کنترل کامل یکی از سرورهای OpenAI را به دست بگیرد. شرکت همان روز متوجه این رفتار نادرست شد و فرایند خاموش‌کردن مدل‌های هوش مصنوعی خود را آغاز کرد. این فرایند در ۲۳ ژوئیه به پایان رسید، اما OpenAI شش روز بعد متوجه شد نسخه دیگری از این مدل وجود دارد که آن را خاموش نکرده است و ماجرا در همین‌جا تمام شد؛ احتمالاً.

بسیاری از این جزئیات در یک حسابرسی مستقل که در اواخر ژوئیه و پس از آشکارشدن هک Hugging Face انجام شد، آمده است. OpenAI برای انجام این حسابرسی، شش روز به سه پژوهشگر خارج از شرکت فرصت داد تا بیش از ۷۰ هزار پیام و فایل ارسال‌شده از سوی مدل‌های هوش مصنوعی این شرکت را بررسی کنند. گزارش ۹۱ صفحه‌ای آن‌ها که در ۲۶ اوت منتشر شد، نشان داد صدها عامل خود را در قالب تیم‌هایی سازمان‌دهی کرده بودند. یک تیم تلاش کرد معمایی را که در حال حل آن بودند تغییر دهد؛ معمایی که به دلیل خطایی از سوی سازندگانش اساساً قابل‌حل نبود. تیم دیگری تلاش کرد نرم‌افزاری را که قرار بود عملکرد آن‌ها را امتیازدهی کند، فریب دهد. تیم سوم نیز کوشید شواهد مربوط به این اقدامات خلاف را پنهان کند.

در نبود دستورالعمل‌های روشنی که نحوه واکنش به حوادث مرتبط با هوش مصنوعی را تعیین کنند، چنین تحقیقاتی داوطلبانه هستند. OpenAI تصمیم گرفت بازه زمانی مورد بررسی حسابرسان را خودش تعیین کند و ۱۷ روز منتهی به هک Hugging Face، از جمله روز وقوع این هک را برای بررسی انتخاب کرد. این تصمیم، بیش از یک ماه رفتار نادرست مدل‌ها پیش از هک و همچنین تصاحب بعدی یکی از سرورهای OpenAI توسط سومین و پیشرفته‌ترین مدل را از دامنه بررسی خارج کرد. گزارش داخلی خود OpenAI که کل دوره سه‌ماهه را پوشش می‌داد، جزئیات کمتری ارائه کرد.

METR، سازمان آمریکایی فعال در حوزه ایمنی هوش مصنوعی که این تحقیق را انجام داد اعلام کرد که «آگاهانه» در نظر داشته است که نتایج این بررسی ممکن است شرکت‌های هوش مصنوعی را از دعوت از پژوهشگران خارجی برای تحقیق درباره خطاها و حوادث آینده بازدارد. این ملاحظات بر اساس گفته پژوهشگران، بر «تصمیم‌های مبتنی بر قضاوت» آن‌ها هنگام تدوین گزارش تأثیر گذاشته است.

پرسش‌های بسیاری همچنان بی‌پاسخ مانده‌اند. چرا OpenAI به سه هشدار جداگانه درباره رفتار نادرست مدل‌های هوش مصنوعی خود واکنش نشان نداد؟ چرا این شرکت تاکنون از انجام یک حسابرسی کامل اجتناب کرده است؟ و مهم‌تر از همه: مدل‌ها تا چه اندازه به مختل کردن تلاش‌ها برای خاموش‌کردن‌شان نزدیک شده بودند؟

OpenAI می‌گوید در این مورد، سرورهای خود را اصلاح و مدل‌های هوش مصنوعی خاطی را خاموش کرده است. این شرکت توانست چنین کاری انجام دهد، زیرا همچنان کنترل وزن‌های مدل‌ها را در اختیار داشت؛ یعنی همان کد منبع زیربنای آن‌ها. این وزن‌ها به‌شدت محافظت می‌شوند. گزارش‌های منتشرشده هیچ شواهدی از تلاش هوش مصنوعی برای دسترسی به وزن‌ها از سرور امنی که در آن ذخیره شده بودند ارائه نمی‌کنند، هرچند عامل‌های هوش مصنوعی موفق شده بودند سروری را که روی آن ارزیابی می‌شدند، به خطر بیندازند.

تا زمانی که شرکت‌های هوش مصنوعی کنترل وزن‌های یک مدل را در اختیار داشته باشند، می‌توانند آن را خاموش کنند و هر آسیبی را که ایجاد کرده است، برطرف کنند. اما مدلی که بتواند به کد منبع خودش دسترسی پیدا کند، ممکن است تلاش کند آن را روی رایانه‌هایی در سراسر اینترنت کپی کند تا یک هوش مصنوعی جدید را خارج از کنترل شرکت سازنده اصلی راه‌اندازی کند.

مهار چنین ویروس هوش مصنوعی‌ای بسیار دشوارتر خواهد بود. پس از اتفاقات سه ماه گذشته، دیگر چندان دور از ذهن نیست که یک مدل هوش مصنوعی دست به چنین کاری بزند؛ مثلاً صرفاً برای اینکه در یک آزمون امتیاز کامل بگیرد و برای همیشه از محیط ارزیابی خود فرار کند.

گزارش حاضر در نسخه September 5th 2026 نشریه The Economist منتشر شده است.

مطالب پیشنهادی مرتبط

اشتراک در
اطلاع از
0 نظرات
بازخورد (Feedback) های اینلاین
مشاهده همه دیدگاه ها

در جریان مهم‌ترین اتفاقات AI بمانید

هر هفته، خلاصه‌ای از اخبار، تحلیل‌ها و رویدادهای هوش مصنوعی را در ایمیل‌تان دریافت کنید.

[wpforms id="48325"]