پایان یک تعلیق دوهفتهای و آغاز فصل تازهای از همکاری با دولت آمریکا
مدل Claude Fable 5 هم آزاد شد
آنتروپیک اعلام کرد که محدودیتهای صادراتی اعمالشده بر مدلهای Claude Fable 5 و Claude Mythos 5 برداشته شده است.
آنتروپیک روز سهشنبه در پستی رسمی در وبسایت خود اعلام کرد که مدل Claude Fable 5 از اول ژوئیه بار دیگر در دسترس کاربران در سراسر جهان قرار میگیرد؛ رخدادی که به تعلیق دوهفتهایِ این مدل، ناشی از یک دستور کنترل صادراتی دولت آمریکا، پایان میدهد.
از تعلیق تا بازگشت
ماجرا از دوازدهم ژوئن آغاز شد؛ روزی که دولت آمریکا کنترلهای صادراتی را بر دو مدل جدید آنتروپیک، یعنی Claude Fable 5 و Claude Mythos 5، اعمال کرد. این تصمیم آنتروپیک را ملزم کرد دسترسی اتباع خارجی، چه در داخل و چه در خارج از خاک آمریکا را به این دو مدل محدود کند. ازآنجاییکه این دستور بلافاصله لازمالاجرا شد و آنتروپیک راهی مطمئن برای احراز هویت ملیت کاربران در لحظه در اختیار نداشت، ناچار شد دسترسی به هر دو مدل را برای همه کاربران، بدون استثنا، به طور کامل متوقف کند.
در هوشیو بخوانید:
شبی دولت امریکا پیشرفتهترین هوش مصنوعی جهان را خاموش کرد
بر اساس این اطلاعیه، در تاریخ سیام ژوئن این محدودیتهای صادراتی بر روی Fable 5 و Mythos 5 لغو شد. آنتروپیک اعلام کرده که Fable 5 از یکم ژوئیه بار دیگر برای کاربران در سراسر جهان، از طریق Claude Platform ،Claude.ai, Claude Code ،and Claude Cowork در دسترس خواهد بود. برای کاربران طرحهای Pro ،Max ،Team و برخی طرحهای Enterprise، استفاده از Fable 5 تا هفتم ژوئیه تا ۵۰ درصد محدودیت مصرف هفتگی گنجانده شده و پس از آن تاریخ، از طریق اعتبارهای مصرفی در دسترس خواهد بود. همچنین آنتروپیک اذعان داشته که دسترسی به این مدل روی سرویسهای ابری آمازون، گوگل Cloud و مایکروسافت Foundary را نیز در سریعترین زمان ممکن بازخواهد گرداند.
در کنار این موضوع، آنتروپیک اعلام کرد دسترسی به مدل Mythos 5 نیز برای گروهی از سازمانهای آمریکایی، پس از تأیید دولت آمریکا در ۲۶ ژوئن، ازسرگرفته شده است. آنتروپیک تأکید کرده که همچنان با دولت در حال هماهنگی برای گسترش دسترسی به مجموعه بزرگتری از شرکای داخلی و بینالمللی در چارچوب برنامه Glasswing است.
در هوشیو بخوانید:
پروژه Glasswing؛ تأمین امنیت نرمافزارهای حیاتی برای عصر هوش مصنوعی
ریشه بحران؛ گزارش پژوهشگران آمازون
بنا بر توضیح آنتروپیک، هر دو مدل Fable 5 و Mythos 5 که در ۹ ژوئن معرفی شدند بر پایه یک هسته مشترک ساخته شدهاند؛ با این تفاوت که Fable 5 با لایههای حفاظتیِ قویتری برای استفاده عمومی عرضه شد، درحالیکه Mythos 5 با سازوکارهای ایمنی کمتر، تنها در اختیار شمار محدودی از شرکای مورداعتماد در برنامه Glasswing برای کاربردهای دفاعی در حوزه امنیت سایبری قرار گرفت.
دستور کنترل صادراتی دوازدهم ژوئن پس از آن صادر شد که دولت آمریکا از گزارشی آگاه شد که در آن پژوهشگران آمازون روشی برای دورزدن سازوکارهای ایمنی Fable 5 یافته بودند؛ روشی که با طراحی خاص درخواستها، مدل را وادار میکرد شماری از آسیبپذیریهای نرمافزاری را شناسایی کند و در یک مورد، حتی کدی تولید کند که نحوه بهرهبرداری از یکی از این آسیبپذیریها را نشان میداد. آنتروپیک اعلام کرده در دو هفته گذشته به طور نزدیک با دولت و سایر شرکا از جمله خود آمازون برای بررسی این گزارش و شواهد آن همکاری کرده است.
نکته قابلتوجهی که در این اطلاعیه آنتروپیک به آن اشاره شده، نتیجه آزمایشهای داخلی آنتروپیک است. بر اساس این آزمایشها، مدلهای ضعیفتر از جمله Claude Opus 4.8 ،GPT-5.5 و Kimi K2.7 نیز قادر بودند همان آسیبپذیریهایی را که Fable 5 در آن گزارش شناسایی کرده بود، پیدا کنند. حتی در مورد تولید نمونهای که نحوه بهرهبرداری از یک آسیبپذیری خاص را نشان میداد، تمام مدلهای آزمودهشده (از جمله Claude Haiku 4.5, Sonnet 4.6, Opus 4.6, Opus 4.7, Opus 4.8, GPT-5.4, GPT-5.5 و Kimi K2.7) توانستند همان خروجی را تولید کنند.
آنتروپیک تأکید کرده که این روش گزارششده هیچ توانایی منحصربهفردی را برای مدلهای سطح Mythos آشکار نکرده است. به گفته این شرکت، آنچه رخ داده یک مورد مرزی در سازوکارهای ایمنی Fable 5 بوده است؛ به این معنا که برخی رفتارها با وجود بیخطر بودن نسبی، از سر احتیاط توسط این سازوکارها مسدود میشوند و روش گزارششده صرفاً دسترسی به یکی از همین رفتارها را ممکن ساخته که در حد کارهای معمول دفاع سایبری بوده است.
واکنش سریع و طبقهبندیکننده ایمنی جدید
با وجود این ارزیابی، آنتروپیک اعلام کرده بهسرعت برای رفع این مشکل اقدام کرده است. این شرکت با همکاری نزدیک دولت، یک طبقهبندیکننده ایمنی (Safety Classifier) بهبودیافته آموزش داده که به طور مشخص رفتار توصیفشده در گزارش آمازون را هدف قرار داده و مسدود میکند. بر اساس این اطلاعیه، ازاینپس اگر درخواستی به Fable 5 مسدود شود، کاربر آگاه خواهد شد و درخواست او در عوض به مدل Opus 4.8 ارسال میشود.
آنتروپیک میگوید طبقهبندیکننده جدیدش در بیش از ۹۹ درصد موارد، همان روش خاصِ توصیفشده در گزارش آمازون را مسدود میکند، هرچند در بخش کوچکی از موارد ممکن است مدل اطلاعاتی ارائه دهد که برای کمک به یک مهاجم سایبری بهقدر کافی دقیق نیست. به گفته این شرکت، هدف سازوکارهای ایمنی مسدودکردن همه تواناییهای کمخطر و روتین دفاع سایبری نیست، بلکه صرفاً موارد بالقوه مضر هدف قرار میگیرند. پژوهشگران مرکز استانداردها و نوآوری هوش مصنوعیِ وزارت بازرگانی آمریکا (CAISI) هر دو نسخه قبلی و جدید این سازوکارهای ایمنی را آزموده و آنها را «فوقالعاده قوی» ارزیابی کردهاند. آنتروپیک هشدار داده که این طبقهبندی جدید هزینهای هم دارد؛ از جمله افزایش احتمال مسدودشدن درخواستهای بیخطر در کارهای معمول برنامهنویسی و رفع اشکال که این شرکت متعهد شده با اصلاحات بیشتر آن را کاهش دهد.
منطق دفاع در عمق و مفهوم «حاشیه ایمنی»
در بخشی از این اطلاعیه، آنتروپیک رویکرد کلی خود در قبال امنیت سایبری مدلها را تشریح کرده است. برایناساس، Mythos 5 توانایی یافتن و بهرهبرداری از آسیبپذیریهای نرمافزاری را بهتر از هر مدل دیگری و حتی بهتر از اغلب کارشناسان انسانیِ ماهر امنیت سایبری دارد؛ ویژگیای که آن را برای سوءاستفاده هکرها بسیار جذاب میکند. در مقابل، Fable 5 چنین توانایی منحصربهفردی را در اختیار کاربر نمیگذارد، چرا که با قویترین لایههای ایمنیای که تاکنون آنتروپیک روی یک مدل اعمال کرده، عرضه شده است.
بر پایه توضیحات آنتروپیک، Fable 5 با ترکیبی از سازوکارهای ایمنی عرضه شده که هرکدام بهتنهایی حفاظت کامل را فراهم نمیکنند، اما در کنار هم رویکردی موسوم به «دفاع در عمق» (defense in depth) را میسازند. برخی از این سازوکارها مبتنی بر آموزش مدل برای امتناع از کمک به درخواستهای خطرناک است و برخی دیگر بر تحلیل الگوهای سوءاستفاده پس از وقوع تکیه دارند. یکی از مهمترین این سازوکارها همان طبقهبندیکنندههاست؛ سامانههای هوش مصنوعی کوچکتری که در حین تعامل با کاربر، تشخیص میدهند آیا از مدل خواسته شده کاری بالقوه مضر در حوزه سایبری انجام دهد یا خروجی بالقوه مضری تولید کند و در این صورت پاسخگویی مدل را مسدود میکنند.

آنتروپیک تصریح کرده که این طبقهبندیکنندهها، مانند هر سازوکار ایمنی دیگری ممکن است دچار خطا شوند؛ گاهی محتوای بالقوه خطرناک را تشخیص نمیدهند و گاهی نیز کاربران میتوانند با ترفندهای غیرمعمول آنها را فریب دهند و مدل را وادار به تولید خروجیهای مضری کنند که میبایست مسدود میشد. به همین دلیل، این شرکت طبقهبندیکنندههای ایمنی را عمداً طوری تنظیم میکند که روی مجموعهای از درخواستهایی که احتمالاً بیخطرند نیز فعال شوند؛ رویکردی که آنتروپیک آن را «حاشیه ایمنی» (safety margin) مینامد. طبق این رویکرد، یک درخواست باید بهوضوح بیخطر به نظر برسد تا طبقهبندیکننده را فعال نکند و کاربران این حاشیه ایمنی را در قالب امتناع مدل از پاسخ به برخی درخواستهای معقول و بیضرر تجربه میکنند. برای Fable 5، این حاشیه ایمنی بهمراتب بزرگتر از هر عرضه پیشین در نظر گرفته شده است.
آنتروپیک همچنین توضیح داده که همین حاشیه ایمنی به کاهش اثر جیلبریکها نیز کمک میکند. به گفته این شرکت، بسیاری از جیلبریکها محدود و مقطعی هستند و تنها یک رفتار بسیار خاص از مدل را باز میکنند، بیآنکه به رفتارهای اصلیِ ممنوعه راه پیدا کنند؛ آنتروپیک ارزیابی کرده که جیلبریکهای گزارششده Fable 5 تاکنون در همین دسته جای میگیرند. جیلبریکهای جدیتر میتوانند رفتارهای مضر مشخصی را آزاد کنند، اما نگرانکنندهترین نوع، universal jailbreak است که طیف وسیعی از رفتارهای مضر را همزمان باز میکند. بر اساس این اطلاعیه، تاکنون هیچ جیلبریک فراگیری برای Fable 5 کشف نشده، هرچند پژوهشگران متخصص ایمنی همچنان در حال تست مقاومت این مدل هستند. آنتروپیک به این نکته نیز اشاره کرده که به باور این شرکت، دستابی به مدلی کاملاً مصون از هر جیلبریک، احتمالاً غیرممکن است.

طرح یک استاندارد مشترک صنعتی برای سنجش جیلبریکها
یکی از بخشهای مهم این اطلاعیه، معرفی طرحی برای ایجاد یک چارچوب مشترک صنعتی بهمنظور ارزیابی شدت جیلبریکهای هوش مصنوعی است. آنتروپیک میگوید در حال حاضر در سطح صنعت هیچ اجماعی درباره نحوه توصیف عینیِ شدت یک جیلبریک وجود ندارد؛ خلائی که به گفته این شرکت، هر بار که روش تازهای کشف میشود، عدم قطعیت زیادی ایجاد میکند؛ چرا که شرکتهای توسعهدهنده معیار مشترکی برای اولویتبندی یافتهها ندارند و دولتها نیز استاندارد مشخصی برای تصمیمگیری درباره زمان مداخله ندارند.
به همین منظور، آنتروپیک اعلام کرده به همراه آمازون، مایکروسافت، گوگل و دیگر شرکای برنامه Glasswing، در حال تدوین چارچوبی برای سنجش شدت جیلبریکهای هوش مصنوعی و نحوه واکنش شرکتهای توسعهدهنده به آنهاست. بر اساس طرح فعلی، هر جیلبریک بر اساس چهار معیار امتیازدهی میشود:
- میزان افزایش توانمندی: جیلبریک تا چه اندازه فراتر از ابزارهای موجود به کاربر امکان میدهد.
- گستردگی افزایش توانمندی: یک تکنیک جیلبریک برای چند وظیفه تهاجمی متفاوت کارساز است.
- سهولت سلاحسازی: میزان تلاش انسانی لازم برای تبدیل جیلبریک به یک حمله واقعی.
- قابلیت کشف: دستیابی به این تکنیک تا چه حد آسان و در دسترس عموم است
آنتروپیک اعلام کرده قصد دارد از این چارچوب برای تنظیم واکنش خود به جیلبریکهای تازهکشفشده استفاده کند. برای شدیدترین رده جیلبریکها؛ مانند مواردی که برای واردکردن آسیب جدی به شبکههای برق یا سامانههای بانکی به کار گرفته شوند، این شرکت متعهد شده بلافاصله پس از تأیید شدت موضوع، اقدامات کاهشیِ اولیه را اجرا کند.
گسترش همکاری با دولت آمریکا
آنتروپیک در ده هفته گذشته به طور نزدیک با دولت آمریکا در تدوین رویکرد مورد بحث در فرمان اجرایی دوم ژوئن با عنوان Promoting Advanced Artificial Intelligence Innovation and Security همکاری کرده است؛ همکاریای که نهادهایی چون دفتر مدیر ارشد سایبری ملی، دفتر سیاست علموفناوری، وزارت خزانهداری، وزارت بازرگانی و نهادهای امنیت ملی مرتبط را در بر میگیرد.
آنتروپیک اعلام کرده بر مبنای نزدیک به دو سال همکاری پیشین با نهادهای دولتی آمریکا در زمینه آزمایش و ارزیابی پیش از عرضه، چهار تعهد تازه برای گسترش این همکاری ارائه کرده است:
- فراهمکردن دسترسی زودهنگام برای شرکای دولتی منتخب به مدلهایی که به طور محسوسی مرزهای توانمندی را در حوزههای مرتبط با امنیت ملی جابهجا میکنند، همراه با استقرار کارکنان فنی آنتروپیک در کنار ارزیابان دولتی طی دوره آزمایش.
- اشتراکگذاری سریع اطلاعات مربوط به سازوکارهای ایمنیِ تازه با نهادهای دولتی هرگاه جیلبریک یا الگوی سوءاستفاده قابلتوجهی شناسایی شود، از جمله ارائه گزارشهای اطلاعاتیِ تهدید پیش از انتشار عمومی و مشارکت در مرکز تبادل اطلاعات آسیبپذیری سایبری بینسازمانی که در فرمان اجرایی دوم ژوئن پیشبینی شده.
- اختصاص منابع برای پژوهش مشترک، شامل شکلگیری تیمهای ویژه برای اولویتهای مشترک با دولت، تخصیص ظرفیت محاسباتی قابلتوجه برای آزمایش و پژوهش دولتی و در اختیار گذاشتن تخصص این شرکت در حوزه ایمنی و تیم قرمز.
- تلاش برای شکلدادن به یک استاندارد امنیتی و ارزیابیِ داوطلبانه و مشترک میان ارائهدهندگان مدلهای پیشرفته، در همکاری با دولت و رقبای صنعتی.
آنتروپیک ابراز امیدواری کرده که این سطح از همکاری، در کنار چارچوب پیشنهادیِ صنعتی برای سنجش جیلبریکها، بتواند مبنایی برای قواعد نظاممند در سراسر صنعت هوش مصنوعی باشد و حتی الگویی اولیه برای هماهنگی جهانی درباره ریسکها و منافع هوش مصنوعی فراهم کند. این شرکت تأکید کرده که چنین قواعدی باید در قالب مقررات مستحکم تدوین و به طور یکسان در میان همه توسعهدهندگان مدلهای پیشرفته اجرا شود. همچنین معتقد است دخالت دولت در فرایند عرضه مدلهای هوش مصنوعی نیازمند فرایندی پایدار و شفاف است که قطعیت لازم را درباره نحوه دسترسی به مدلهای قدرتمند، هم برای مدافعان امنیت سایبری و هم دیگر بازیگران، فراهم کند.