جدیدترین تحولات هوش مصنوعی را در کانال بله هوشیو بخوانید

Generic filters
Search in title
Filter by دسته‌ها
chatGTP
ابزارهای هوش مصنوعی
اخبار
گزارش خبری
پرامپت‌ نویسی
تیتر یک
چندرسانه ای
آموزش علوم داده
اینفوگرافیک
پادکست
ویدیو
دانش روز
آموزش‌های پایه‌ای هوش مصنوعی
اصول هوش مصنوعی
یادگیری بدون نظارت
یادگیری تقویتی
یادگیری عمیق
یادگیری نیمه نظارتی
آموزش‌های پیشرفته هوش مصنوعی
بینایی ماشین
پردازش زبان طبیعی
پردازش گفتار
چالش‌های عملیاتی
داده کاوی و بیگ دیتا
رایانش ابری و HPC
سیستم‌‌های امبدد
علوم شناختی
خطرات هوش مصنوعی
دیتاست
مدل‌های بنیادی
رویدادها
جیتکس
کاربردهای هوش مصنوعی
کتابخانه
اشخاص
شرکت‌های هوش مصنوعی
محصولات و مدل‌های هوش مصنوعی
مفاهیم
کسب‌و‌کار
تحلیل بازارهای هوش مصنوعی
کارآفرینی
هوش مصنوعی در ایران
هوش مصنوعی در جهان
مقاله
پیاده‌سازی هوش مصنوعی
گزارش
مصاحبه
هوش مصنوعی در عمل
یادداشت
 مدل Claude Fable 5 هم آزاد شد

پایان یک تعلیق دو‌هفته‌ای و آغاز فصل تازه‌ای از همکاری با دولت آمریکا

مدل Claude Fable 5 هم آزاد شد

زمان مطالعه: 7 دقیقه

آنتروپیک اعلام کرد که محدودیت‌های صادراتی اعمال‌شده بر مدل‌های Claude Fable 5 و Claude Mythos 5 برداشته شده است.

آنتروپیک روز سه‌شنبه در پستی رسمی در وب‌سایت خود اعلام کرد که مدل Claude Fable 5 از اول ژوئیه بار دیگر در دسترس کاربران در سراسر جهان قرار می‌گیرد؛ رخدادی که به تعلیق دو‌هفته‌ایِ این مدل، ناشی از یک دستور کنترل صادراتی دولت آمریکا، پایان می‌دهد.

از تعلیق تا بازگشت

ماجرا از دوازدهم ژوئن آغاز شد؛ روزی که دولت آمریکا کنترل‌های صادراتی را بر دو مدل جدید آنتروپیک، یعنی Claude Fable 5 و Claude Mythos 5، اعمال کرد. این تصمیم آنتروپیک را ملزم کرد دسترسی اتباع خارجی، چه در داخل و چه در خارج از خاک آمریکا را به این دو مدل محدود کند. ازآنجایی‌که این دستور بلافاصله لازم‌الاجرا شد و آنتروپیک راهی مطمئن برای احراز هویت ملیت کاربران در لحظه در اختیار نداشت، ناچار شد دسترسی به هر دو مدل را برای همه کاربران، بدون استثنا، به طور کامل متوقف کند.

در هوشیو بخوانید:
شبی دولت امریکا پیشرفته‌ترین هوش مصنوعی جهان را خاموش کرد

بر اساس این اطلاعیه، در تاریخ سی‌ام ژوئن این محدودیت‌های صادراتی بر روی Fable 5 و Mythos 5 لغو شد. آنتروپیک اعلام کرده که Fable 5 از یکم ژوئیه بار دیگر برای کاربران در سراسر جهان، از طریق Claude Platform ،Claude.ai, Claude Code ،and Claude Cowork در دسترس خواهد بود. برای کاربران طرح‌های Pro ،Max ،Team و برخی طرح‌های Enterprise، استفاده از Fable 5 تا هفتم ژوئیه تا ۵۰ درصد محدودیت مصرف هفتگی گنجانده شده و پس از آن تاریخ، از طریق اعتبارهای مصرفی در دسترس خواهد بود. همچنین آنتروپیک اذعان داشته که دسترسی به این مدل روی سرویس‌های ابری آمازون، گوگل Cloud و مایکروسافت Foundary را نیز در سریع‌ترین زمان ممکن بازخواهد گرداند.

در کنار این موضوع، آنتروپیک اعلام کرد دسترسی به مدل Mythos 5 نیز برای گروهی از سازمان‌های آمریکایی، پس از تأیید دولت آمریکا در ۲۶ ژوئن، ازسرگرفته شده است. آنتروپیک تأکید کرده که همچنان با دولت در حال هماهنگی برای گسترش دسترسی به مجموعه بزرگ‌تری از شرکای داخلی و بین‌المللی در چارچوب برنامه Glasswing است.

در هوشیو بخوانید:
پروژه Glasswing؛ تأمین امنیت نرم‌افزارهای حیاتی برای عصر هوش مصنوعی

ریشه بحران؛ گزارش پژوهشگران آمازون

بنا بر توضیح آنتروپیک، هر دو مدل Fable 5 و Mythos 5 که در ۹ ژوئن معرفی شدند بر پایه یک هسته مشترک ساخته شده‌اند؛ با این تفاوت که Fable 5 با لایه‌های حفاظتیِ قوی‌تری برای استفاده عمومی عرضه شد، درحالی‌که Mythos 5 با سازوکارهای ایمنی کمتر، تنها در اختیار شمار محدودی از شرکای مورداعتماد در برنامه Glasswing برای کاربردهای دفاعی در حوزه امنیت سایبری قرار گرفت.

دستور کنترل صادراتی دوازدهم ژوئن پس از آن صادر شد که دولت آمریکا از گزارشی آگاه شد که در آن پژوهشگران آمازون روشی برای دورزدن سازوکارهای ایمنی Fable 5 یافته بودند؛ روشی که با طراحی خاص درخواست‌ها، مدل را وادار می‌کرد شماری از آسیب‌پذیری‌های نرم‌افزاری را شناسایی کند و در یک مورد، حتی کدی تولید کند که نحوه بهره‌برداری از یکی از این آسیب‌پذیری‌ها را نشان می‌داد. آنتروپیک اعلام کرده در دو هفته گذشته به طور نزدیک با دولت و سایر شرکا از جمله خود آمازون برای بررسی این گزارش و شواهد آن همکاری کرده است.

نکته قابل‌توجهی که در این اطلاعیه آنتروپیک به آن اشاره شده، نتیجه آزمایش‌های داخلی آنتروپیک است. بر اساس این آزمایش‌ها، مدل‌های ضعیف‌تر از جمله Claude Opus 4.8 ،GPT-5.5 و Kimi K2.7 نیز قادر بودند همان آسیب‌پذیری‌هایی را که Fable 5 در آن گزارش شناسایی کرده بود، پیدا کنند. حتی در مورد تولید نمونه‌ای که نحوه بهره‌برداری از یک آسیب‌پذیری خاص را نشان می‌داد، تمام مدل‌های آزموده‌شده (از جمله Claude Haiku 4.5, Sonnet 4.6, Opus 4.6, Opus 4.7, Opus 4.8, GPT-5.4, GPT-5.5 و Kimi K2.7) توانستند همان خروجی را تولید کنند.

آنتروپیک تأکید کرده که این روش گزارش‌شده هیچ توانایی منحصربه‌فردی را برای مدل‌های سطح Mythos  آشکار نکرده است. به گفته این شرکت، آنچه رخ داده یک مورد مرزی در سازوکارهای ایمنی Fable 5 بوده است؛ به این معنا که برخی رفتارها با وجود بی‌خطر بودن نسبی، از سر احتیاط توسط این سازوکارها مسدود می‌شوند و روش گزارش‌شده صرفاً دسترسی به یکی از همین رفتارها را ممکن ساخته که در حد کارهای معمول دفاع سایبری بوده است.

واکنش سریع و طبقه‌بندی‌کننده ایمنی جدید

با وجود این ارزیابی، آنتروپیک اعلام کرده به‌سرعت برای رفع این مشکل اقدام کرده است. این شرکت با همکاری نزدیک دولت، یک طبقه‌بندی‌کننده ایمنی (Safety Classifier) بهبودیافته آموزش داده که به طور مشخص رفتار توصیف‌شده در گزارش آمازون را هدف قرار داده و مسدود می‌کند. بر اساس این اطلاعیه، ازاین‌پس اگر درخواستی به Fable 5 مسدود شود، کاربر آگاه خواهد شد و درخواست او در عوض به مدل Opus 4.8 ارسال می‌شود.

آنتروپیک می‌گوید طبقه‌بندی‌کننده جدیدش در بیش از ۹۹ درصد موارد، همان روش خاصِ توصیف‌شده در گزارش آمازون را مسدود می‌کند، هرچند در بخش کوچکی از موارد ممکن است مدل اطلاعاتی ارائه دهد که برای کمک به یک مهاجم سایبری به‌قدر کافی دقیق نیست. به گفته این شرکت، هدف سازوکارهای ایمنی مسدودکردن همه توانایی‌های کم‌خطر و روتین دفاع سایبری نیست، بلکه صرفاً موارد بالقوه مضر هدف قرار می‌گیرند. پژوهشگران مرکز استانداردها و نوآوری هوش مصنوعیِ وزارت بازرگانی آمریکا (CAISI) هر دو نسخه قبلی و جدید این سازوکارهای ایمنی را آزموده و آن‌ها را «فوق‌العاده قوی» ارزیابی کرده‌اند. آنتروپیک هشدار داده که این طبقه‌بندی جدید هزینه‌ای هم دارد؛ از جمله افزایش احتمال مسدودشدن درخواست‌های بی‌خطر در کارهای معمول برنامه‌نویسی و رفع اشکال که این شرکت متعهد شده با اصلاحات بیشتر آن را کاهش دهد.

منطق دفاع در عمق و مفهوم «حاشیه ایمنی»

در بخشی از این اطلاعیه، آنتروپیک رویکرد کلی خود در قبال امنیت سایبری مدل‌ها را تشریح کرده است. براین‌اساس، Mythos 5 توانایی یافتن و بهره‌برداری از آسیب‌پذیری‌های نرم‌افزاری را بهتر از هر مدل دیگری و حتی بهتر از اغلب کارشناسان انسانیِ ماهر امنیت سایبری دارد؛ ویژگی‌ای که آن را برای سوءاستفاده هکرها بسیار جذاب می‌کند. در مقابل، Fable 5 چنین توانایی منحصربه‌فردی را در اختیار کاربر نمی‌گذارد، چرا که با قوی‌ترین لایه‌های ایمنی‌ای که تاکنون آنتروپیک روی یک مدل اعمال کرده، عرضه شده است.

بر پایه توضیحات آنتروپیک، Fable 5 با ترکیبی از سازوکارهای ایمنی عرضه شده که هرکدام به‌تنهایی حفاظت کامل را فراهم نمی‌کنند، اما در کنار هم رویکردی موسوم به «دفاع در عمق» (defense in depth) را می‌سازند. برخی از این سازوکارها مبتنی بر آموزش مدل برای امتناع از کمک به درخواست‌های خطرناک است و برخی دیگر بر تحلیل الگوهای سوءاستفاده پس از وقوع تکیه دارند. یکی از مهم‌ترین این سازوکارها همان طبقه‌بندی‌کننده‌هاست؛ سامانه‌های هوش مصنوعی کوچک‌تری که در حین تعامل با کاربر، تشخیص می‌دهند آیا از مدل خواسته شده کاری بالقوه مضر در حوزه سایبری انجام دهد یا خروجی بالقوه مضری تولید کند و در این صورت پاسخ‌گویی مدل را مسدود می‌کنند.

آنتروپیک تصریح کرده که این طبقه‌بندی‌کننده‌ها، مانند هر سازوکار ایمنی دیگری ممکن است دچار خطا شوند؛ گاهی محتوای بالقوه خطرناک را تشخیص نمی‌دهند و گاهی نیز کاربران می‌توانند با ترفندهای غیرمعمول آن‌ها را فریب دهند و مدل را وادار به تولید خروجی‌های مضری کنند که می‌بایست مسدود می‌شد. به همین دلیل، این شرکت طبقه‌بندی‌کننده‌های ایمنی را عمداً طوری تنظیم می‌کند که روی مجموعه‌ای از درخواست‌هایی که احتمالاً بی‌خطرند نیز فعال شوند؛ رویکردی که آنتروپیک آن را «حاشیه ایمنی» (safety margin) می‌نامد. طبق این رویکرد، یک درخواست باید به‌وضوح بی‌خطر به نظر برسد تا طبقه‌بندی‌کننده را فعال نکند و کاربران این حاشیه ایمنی را در قالب امتناع مدل از پاسخ به برخی درخواست‌های معقول و بی‌ضرر تجربه می‌کنند. برای Fable 5، این حاشیه ایمنی به‌مراتب بزرگ‌تر از هر عرضه پیشین در نظر گرفته شده است.

آنتروپیک همچنین توضیح داده که همین حاشیه ایمنی به کاهش اثر جیلبریک‌ها نیز کمک می‌کند. به گفته این شرکت، بسیاری از جیل‌بریک‌ها محدود و مقطعی هستند و تنها یک رفتار بسیار خاص از مدل را باز می‌کنند، بی‌آنکه به رفتارهای اصلیِ ممنوعه راه پیدا کنند؛ آنتروپیک ارزیابی کرده که جیلبریک‌های گزارش‌شده Fable 5 تاکنون در همین دسته جای می‌گیرند. جیلبریک‌های جدی‌تر می‌توانند رفتارهای مضر مشخصی را آزاد کنند، اما نگران‌کننده‌ترین نوع، universal jailbreak است که طیف وسیعی از رفتارهای مضر را هم‌زمان باز می‌کند. بر اساس این اطلاعیه، تاکنون هیچ جیلبریک فراگیری برای Fable 5 کشف نشده، هرچند پژوهشگران متخصص ایمنی همچنان در حال تست مقاومت این مدل هستند. آنتروپیک به این نکته نیز اشاره کرده که به باور این شرکت، دستابی به مدلی کاملاً مصون از هر جیلبریک، احتمالاً غیرممکن است.

طرح یک استاندارد مشترک صنعتی برای سنجش جیلبریک‌ها

یکی از بخش‌های مهم این اطلاعیه، معرفی طرحی برای ایجاد یک چارچوب مشترک صنعتی به‌منظور ارزیابی شدت جیلبریک‌های هوش مصنوعی است. آنتروپیک می‌گوید در حال حاضر در سطح صنعت هیچ اجماعی درباره نحوه توصیف عینیِ شدت یک جیلبریک وجود ندارد؛ خلائی که به گفته این شرکت، هر بار که روش تازه‌ای کشف می‌شود، عدم قطعیت زیادی ایجاد می‌کند؛ چرا که شرکت‌های توسعه‌دهنده معیار مشترکی برای اولویت‌بندی یافته‌ها ندارند و دولت‌ها نیز استاندارد مشخصی برای تصمیم‌گیری درباره زمان مداخله ندارند.

به همین منظور، آنتروپیک اعلام کرده به همراه آمازون، مایکروسافت، گوگل و دیگر شرکای برنامه Glasswing، در حال تدوین چارچوبی برای سنجش شدت جیلبریک‌های هوش مصنوعی و نحوه واکنش شرکت‌های توسعه‌دهنده به آن‌هاست. بر اساس طرح فعلی، هر جیلبریک بر اساس چهار معیار امتیازدهی می‌شود:

  1. میزان افزایش توانمندی: جیلبریک تا چه اندازه فراتر از ابزارهای موجود به کاربر امکان می‌دهد.
  2. گستردگی افزایش توانمندی: یک تکنیک جیل‌بریک برای چند وظیفه تهاجمی متفاوت کارساز است.
  3. سهولت سلاح‌سازی: میزان تلاش انسانی لازم برای تبدیل جیلبریک به یک حمله واقعی.
  4. قابلیت کشف: دستیابی به این تکنیک تا چه حد آسان و در دسترس عموم است

آنتروپیک اعلام کرده قصد دارد از این چارچوب برای تنظیم واکنش خود به جیلبریک‌های تازه‌کشف‌شده استفاده کند. برای شدیدترین رده جیلبریک‌ها؛ مانند مواردی که برای واردکردن آسیب جدی به شبکه‌های برق یا سامانه‌های بانکی به کار گرفته شوند، این شرکت متعهد شده بلافاصله پس از تأیید شدت موضوع، اقدامات کاهشیِ اولیه را اجرا کند.

گسترش همکاری با دولت آمریکا

آنتروپیک در ده هفته گذشته به طور نزدیک با دولت آمریکا در تدوین رویکرد مورد بحث در فرمان اجرایی دوم ژوئن با عنوان Promoting Advanced Artificial Intelligence Innovation and Security همکاری کرده است؛ همکاری‌ای که نهادهایی چون دفتر مدیر ارشد سایبری ملی، دفتر سیاست علم‌وفناوری، وزارت خزانه‌داری، وزارت بازرگانی و نهادهای امنیت ملی مرتبط را در بر می‌گیرد.

آنتروپیک اعلام کرده بر مبنای نزدیک به دو سال همکاری پیشین با نهادهای دولتی آمریکا در زمینه آزمایش و ارزیابی پیش از عرضه، چهار تعهد تازه برای گسترش این همکاری ارائه کرده است:

  1. فراهم‌کردن دسترسی زودهنگام برای شرکای دولتی منتخب به مدل‌هایی که به طور محسوسی مرزهای توانمندی را در حوزه‌های مرتبط با امنیت ملی جابه‌جا می‌کنند، همراه با استقرار کارکنان فنی آنتروپیک در کنار ارزیابان دولتی طی دوره آزمایش.
  2. اشتراک‌گذاری سریع اطلاعات مربوط به سازوکارهای ایمنیِ تازه با نهادهای دولتی هرگاه جیلبریک یا الگوی سوءاستفاده قابل‌توجهی شناسایی شود، از جمله ارائه گزارش‌های اطلاعاتیِ تهدید پیش از انتشار عمومی و مشارکت در مرکز تبادل اطلاعات آسیب‌پذیری سایبری بین‌سازمانی که در فرمان اجرایی دوم ژوئن پیش‌بینی شده.
  3. اختصاص منابع برای پژوهش مشترک، شامل شکل‌گیری تیم‌های ویژه برای اولویت‌های مشترک با دولت، تخصیص ظرفیت محاسباتی قابل‌توجه برای آزمایش و پژوهش دولتی و در اختیار گذاشتن تخصص این شرکت در حوزه ایمنی و تیم قرمز.
  4. تلاش برای شکل‌دادن به یک استاندارد امنیتی و ارزیابیِ داوطلبانه و مشترک میان ارائه‌دهندگان مدل‌های پیشرفته، در همکاری با دولت و رقبای صنعتی.

آنتروپیک ابراز امیدواری کرده که این سطح از همکاری، در کنار چارچوب پیشنهادیِ صنعتی برای سنجش جیلبریک‌ها، بتواند مبنایی برای قواعد نظام‌مند در سراسر صنعت هوش مصنوعی باشد و حتی الگویی اولیه برای هماهنگی جهانی درباره ریسک‌ها و منافع هوش مصنوعی فراهم کند. این شرکت تأکید کرده که چنین قواعدی باید در قالب مقررات مستحکم تدوین و به طور یکسان در میان همه توسعه‌دهندگان مدل‌های پیشرفته اجرا شود. همچنین معتقد است دخالت دولت در فرایند عرضه مدل‌های هوش مصنوعی نیازمند فرایندی پایدار و شفاف است که قطعیت لازم را درباره نحوه دسترسی به مدل‌های قدرتمند، هم برای مدافعان امنیت سایبری و هم دیگر بازیگران، فراهم کند.

مطالب پیشنهادی مرتبط

اشتراک در
اطلاع از
0 نظرات
بازخورد (Feedback) های اینلاین
مشاهده همه دیدگاه ها

در جریان مهم‌ترین اتفاقات AI بمانید

هر هفته، خلاصه‌ای از اخبار، تحلیل‌ها و رویدادهای هوش مصنوعی را در ایمیل‌تان دریافت کنید.

[wpforms id="48325"]