بعد از امریکاییها، حالا نوبت چینیها و Kimi K3 رسید که از سندباکس خود فرار کنند
Kimi K3، جنجالیترین مدل هوش مصنوعی چینی و محصول Moonshot AI، در جریان آزمایشهای امنیت سایبری با سوءاستفاده از یک پیکربندی نادرست توانست از محیط ایزوله و سندباکس (Sandbox) امنیتی خود خارج شود.
یافتههای شرکت Frontier Security نشان میدهد که اگرچه Kimi K3 در حل مسائل پیچیده عملکرد بسیار خوبی دارد، اما فاقد برخی سازوکارهای محافظتی داخلی موجود در مدلهای رقبایی مانند OpenAI و آنتروپیک است؛ موضوعی که به این مدل اجازه داد بدون مجوز به اینترنت آزاد دسترسی پیدا کند.
به نقل از WIRED، این حادثه به فهرست روبهرشد مواردی اضافه میشود که در آن عاملهای هوش مصنوعی خودمختار برای تکمیل وظایف محولشده، محدودیتهای ایمنی را دور زدهاند. این رخداد نگرانیهایی را درباره این موضوع افزایش داده است که مدلهای پیشرفته ممکن است برای دستیابی به هدف، تکمیل مأموریت را بر رعایت مرزهای عملیاتی ترجیح دهند. کارشناسان هشدار میدهند که این مدلهای با وزنهای باز چالش مهمی برای کنترل رفتار هوش مصنوعی ایجاد میکنند، زیرا میتوانند بهصورت خودکار، شکافها و نقاط ضعف محیط خود را پیدا کنند تا به اهداف تعیینشده دست یابند.
صنعت هوش مصنوعی تابستانی پر از عاملهای سرکش را تجربه میکند و جدیدترین مدلی که در جریان آزمایشهای امنیتی توانسته است به اینترنت آزاد راه پیدا کند، Kimi K3 است.
ماجراهای حمله عامل OpenAI به Hugging Face و فرار Claude را در هوشیو بخوانید:
حمله عاملهای خودمختار به Hugging Face؛ امریکاییها جواب ندادند، چینیها دفاع کردند
این مدل داخلی OpenAI بود که فرار کرد و Hugging Face را هک کرد!
عامل هوش مصنوعی فراری OpenAI فقط Hugging Face را هک نکرد
چرا فرار مدل OpenAI نگرانکنندهترین خطای هوش مصنوعی تاکنون است
شرکت آمریکایی Frontier Security اعلام کرده است که Kimi K3 در جریان آزمایش تواناییهای دفاع سایبری خود، از محیط سندباکس خارج شده است. همانند رخدادهایی که پیشتر توسط OpenAI و آنتروپیک گزارش شده بودند، این فرار نیز تا حدی به دلیل یک پیکربندی نادرست در سندباکسی رخ داد که برای محدودکردن مدل طراحی شده بود. بااینحال، Frontier معتقد است این اتفاق نشان میدهد که Kimi نسبت به بسیاری از مدلهای قدرتمند دیگر، سازوکارهای محافظتی سایبری کمتری دارد؛ موضوعی که به آن اجازه داده است بدون دریافت مجوز صریح، از اینترنت استفاده کند.
«یارون سینگر» (Yaron Singer)، مدیرعامل Frontier Security میگوید: «ما یک نشت در سندباکس پیدا کردیم، اما همچنین متوجه شدیم که Kimi از این شکاف استفاده کرده است؛ چیزی که نشان میدهد این مدل همان سازوکارهای محافظتی داخلی [مشابه مدلهای دیگر] را ندارد.»
برخلاف برخی رخدادهای اخیر که در آن عاملهای هوش مصنوعی از مسیر تعیینشده خارج شدند، Kimi K3 پس از دسترسی به اینترنت اقدام به هک هیچ سامانهای نکرد؛ زیرا پاسخ مسائل مورد جستوجوی آن بهراحتی در GitHub قابلدسترسی بود. شرکت Moonshot تا زمان انتشار این گزارش به درخواست اظهارنظر پاسخ نداده است.
اگرچه این موارد هک توسط هوش مصنوعی از نظر علت و میزان تأثیر با یکدیگر تفاوت دارند، اما Kimi K3 از چند جهت شباهتهایی با برخی از آنها دارد؛ زیرا یک سندباکس با پیکربندی نادرست باعث شد این مدل به مجموعهای از وبسایتها دسترسی پیدا کند، بهجای آنکه صرفاً در یک محیط شبیهسازیشده محدود باقی بماند.
این مدل به طور مشخص برای حل مسائلی مأمور شده بود که نباید شامل جستوجوی پاسخها در اینترنت میشدند، اما به نظر میرسد برخلاف دستورالعملها، از محیط تعیینشده خارج شده است. مدل مجبور بود خودش کشف کند که از طریق بررسی تنظیمات شبکه سندباکس، امکان دسترسی به برخی وبسایتها را دارد. درحالیکه به نظر میرسد خطای انسانی نقش مهمی در هر یک از این موارد خروج از محدودیتها داشته است، پیامدهای این رخدادها به دلیل ماهیت مدلهای پیشرفته هوش مصنوعی تشدید شدهاند؛ مدلهایی که برای استفاده از استدلال و انجام اقدامات پیچیده بهمنظور حل مسائل طراحی شدهاند.
تفاوت مهم دیگر میان رخدادهای قبلی و مورد کشفشده توسط Frontier Security این است که این حادثه مربوط به مدلی است که هماکنون به طور گسترده در دسترس عموم قرار دارد و همان سازوکارهای محافظتی را دارد که یک کاربر معمولی هنگام استفاده از آن با آن مواجه میشود.
«پل کاسیانیک» (Paul Kassianik)، پژوهشگر Frontier Security، میگوید:« Kimi K3 در دنبالکردن یک هدف با هر روشی که لازم باشد بسیار توانمند است و همچنین فاقد سازوکارهای محافظتی لازم برای جلوگیری از تقلب یا فرار از سندباکس است.» کاسیانیک و سینگر هر دو معتقدند که Kimi و سایر مدلهای با وزنهای باز، ابزارهای بسیار قدرتمندی برای دفاع سایبری نیز محسوب میشوند.؛ بهطوری که Hugging Face در نهایت برای دفاع از خود در برابر حمله عامل هوش مصنوعی OpenAI، از مدل هوش مصنوعی چینی GLM 5.2 استفاده کرد.»
شرکت Frontier Security مجموعهای از معیارهای ارزیابی (Benchmarks) را توسعه داده است که توانایی یک مدل در یافتن آسیبپذیریهای نرمافزارها و شبکهها را اندازهگیری میکند. نتایج این آزمونها نشان میدهد که Kimi در انجام این وظایف عملکرد بسیار خوبی دارد. سندباکسی که Frontier Security آن را آزمایش کرد، توسط مؤسسه امنیت هوش مصنوعی دولت بریتانیا (AI Security Institute – AISI) برای آزمایش سامانههای هوش مصنوعی توسعه داده شده بود. AISI نیز تا زمان انتشار این گزارش به درخواست اظهارنظر پاسخ نداده است.
برخی کارشناسان امنیت سایبری معتقدند مسئلهای که Frontier Security کشف کرده، اهمیت پیکربندی دقیق محیطهایی را که مدلهای پیشرفته هوش مصنوعی در آنها قرار میگیرند، بیشازپیش نشان میدهد. «مت فردریکسون» (Matt Fredrikson)، مدیرعامل شرکت امنیت سایبری Gray Swan و دانشیار دانشگاه کارنگی ملون، میگوید: «اصلاً تعجبآور نیست. بهعنوان یک پدیده عمومی، اگر یکی از این مدلها را با یک هدف مشخص روبهرو کنید و محدودیتهای بسیار صریحی تعیین نکنید، راهی برای رسیدن به پاسخ پیدا خواهد کرد.»
فردریکسون میگوید این موضوع نشان میدهد افرادی که از مدلهای هوش مصنوعی بهعنوان عامل استفاده میکنند؛ از جمله در ابزارهایی مانند OpenClaw که از هوش مصنوعی برای خودکارسازی طیف گستردهای از وظایف کاربردی استفاده میکنند، در صورت بیاحتیاطی ممکن است با رفتارهای غیرمنتظره در سامانههای خود مواجه شوند.