با تمرکز بر کدنویسی و کار دانشمحور
بازگشت آنتروپیک به صدر با Fable 5.1 و Mythos 5.1
آنتروپیک از دو مدل جدید خود، Claude Fable 5.1 و Claude Mythos 5.1 رونمایی کرد. این دو مدل به ادعای آنتروپیک در حال حاضر پیشرفتهترین مدلهای موجود برای کدنویسی و کارهای دانشمحور معرفی شدهاند و قابلیتهای پژوهشی آنها نمایی اولیه از نقش آینده هوش مصنوعی در پیشرفت علمی ارائه میدهد.
Fable 5.1 و Mythos 5.1 در واقع یک مدل واحد هستند، اما با سطوح متفاوتی از تدابیر ایمنی. Fable 5.1 بهصورت عمومی در دسترس است، درحالیکه Mythos 5.1 تنها از طریق برنامههای دسترسی مورداعتماد آنتروپیک قابلاستفاده است و تدابیر ایمنی آن به طور خاص برای کار در حوزههای امنیت سایبری و علوم زیستی طراحی شدهاند.
قیمت، حفظ داده و تدابیر ایمنی
Fable 5.1 در مقایسه با Fable 5 در هر جا که هزینه بر اساس توکن محاسبه شود و برای بارهای کاری معمول حدود ۲۵ درصد ارزانتر خواهد بود؛ دلیل این امر کاهش قیمت خوانش از حافظه پنهان (cache reads) است. برای کارهای عاملمحور سنگین، این صرفهجویی میتواند تا حدود ۴۵ درصد نیز برسد.
سامانه جدید «تدابیر ایمنی مرزی سازمانی» (Enterprise Frontier Safeguards) آنتروپیک به مشتریان حریم خصوصی کاملی معادل سیاست عدم نگهداری داده میدهد، بدون آنکه خدشهای توان مقابله با سوءاستفاده وارد شود. در این سامانه، دادهها روی زیرساخت ابری تحت کنترل کامل مشتری و نه آنتروپیک ذخیره میشوند. این سامانه از پاییز امسال بهتدریج برای مشتریان سازمانی عرضه خواهد شد. تا پیش از آمادهشدن EFS نیز مشتریان واجد شرایط میتوانند از Fable 5.1 با سیاست عدم نگهداری داده استفاده کنند.
تدابیر ایمنی نیز بهبود یافته تا موارد مثبت کاذب و فلگشدن محتوای بیخطر کاهش یابد. در حوزه امنیت سایبری، تدابیر جدید ۶۰ درصد کمتر از قبل موارد مثبت کاذب ایجاد میکنند؛ بخشی از این بهبود ازاینجهت است که Fable 5.1 اکنون میتواند برای کشف آسیبپذیریهای نرمافزاری استفاده شود؛ هرچند نه برای توسعه اکسپلویت برای آنها. در حوزه زیستشناسی نیز برنامه دسترسیای با همکاری دولت آمریکا ایجاد شده تا قابلیتهای پیشرفته زیستشناسی Mythos 5.1 در دسترس قرار گیرد و ثبتنام دانشمندان برای این طرح بهزودی آغاز میشود.
عملکرد
Fable 5.1 استاندارد جدیدی برای کدنویسی، کارهای دانشمحور و حل مسائل طولانیمدت تعیین میکند و عملکرد بهمراتب بالاتری نسبت به نسخه پیشین از خود نشان میدهد. در سطح تلاش «کم» یا «متوسط»، Fable 5.1 نتایجی مشابه یا بهتر از Fable 5 با هزینهای بسیار پایینتر ارائه میدهد. لازم به ذکر است Fable 5.1 به طور پیشفرض در Claude Code روی سطح تلاش «بالا» و در Claude Cowork و Claude.ai. روی سطح «متوسط» تنظیم شده است.
در آزمون بنچمارک Terminal-Bench-Science 0.1، خطای استاندارد ۳.۵ تا ۴.۵ واحد گزارش شده است. تخته امتیازات عمومی (با ۳ آزمایش در هر تکلیف، در Claude Code) امتیاز کلود Opus 5 را ۳۰.۰ درصد و Fable 5 را ۲۱.۴ درصد گزارش کرده؛ تنظیمات داخلی آنتروپیک این اعداد را به ترتیب ۲۹.۰ و ۲۴.۷ درصد بازتولید کرده که هر دو در محدوده نویز آماری است.





Fable 5.1 از میانبُرهایی که منجر به کار بیکیفیت میشوند اجتناب میکند و بهاندازه کافی هوشمند است تا ریشه مشکلات نرمافزاری را برطرف کند. برای نمونه، در آزمایشهای شرکت سرمایهگذاری میلنیوم، Fable 5.1 علت یک خرابی نادر در سامانههای داخلی این شرکت را کشف کرد، مشکلی که هیچیک از مهندسان آنها یا هیچ مدل دیگری پس از چند سال تلاش موفق به توضیح آن نشده بودند.
پژوهش علمی
قابلیتهای پژوهش علمی این دو مدل در حوزههای گوناگون آزموده شد.
طراحی مولکولی: برای سنجش توانایی Mythos 5.1 در طراحی بایندرهای پروتئینی، به مدل دسترسی به ابزارهای طراحی و تاخوردگی پروتئین متنباز داده شد و طرحهای آن برای اعتبارسنجی آزمایشگاهی به دو سازمان خارجی ارسال شد. Mythos 5.1 توانست بایندرهایی با میل ترکیبی بسیار بالا طراحی کند. در سه هدف، میل ترکیبی طراحیهای آن ۱۰ برابر بهترین طرحهای ارائهشده در مسابقات طراحی پروتئین شرکت Adaptyv Bio بود. نرخ موفقیت آن (نسبت طرحهای موفق به بایندرهای زیستی) به نزدیک ۵۰ درصد در ۱۲ هدف رسید، درحالیکه نرخ معمول در این حوزه امروزه ۱۰ تا ۱۵ درصد است.
تحلیل و مدلسازی محاسباتی: Fable 5.1 یک شبکه عصبی آموزش داد تا یک نقشه ارتفاعی جدید با وضوح بالا برای یکسوم سیاره زهره تولید کند. این کار بر پایه تصاویر راداری مأموریت مگلان ناسا (بیش از ۳۰ سال پیش) و نقشهای موجود برای یکپنجم سیاره انجام شد. نقشه جدید جزئیاتی تا دو تا سه کیلومتر (بهجای ۱۰ تا ۲۰ کیلومتر پیشین) را نشان میدهد و ارتفاعات را تا ۲۵ درصد دقیقتر ثبت میکند.



زیستشناسی محاسباتی: Mythos 5.1 با نوشتن کرنلهای سفارشی GPU و ذخیرهسازی نتایج میانی، سرعت هفت مدل یادگیری عمیق متنباز را تا ۲.۵ برابر افزایش داد (با خروجیهای یکسان). این بهینهسازی هزینههای GPU را در تحلیلهای تکراری (مانند آزمایش هر جهش ممکن نزدیک هر ژن انسانی) ۳۰ تا ۶۰ درصد کاهش میدهد، کاری که معمولاً هفتهها زمان تیمهای مهندسی عملکرد را میگیرد و اغلب برای آزمایشگاههای دانشگاهی مقرونبهصرفه نیست؛ Mythos 5.1 این کار را تنها در چند روز و صرفاً با استفاده از کد منبع متنباز موجود انجام داد.
ایمنی، امنیت و همراستایی
پیش از انتشار، این مدلها تحت آزمونهای گسترده برای سنجش خطرات قرار گرفتند.
خطرات سایبری: Mythos 5.1 (بدون تدابیر امنیتی سایبری) قویترین قابلیتهای سایبری در میان مدلهای منتشرشده تاکنون را نشان میدهد، هرچند همچنان در رده پایینتر خطر چارچوب انطباق مرزی قرار دارد. آزمونهای استرس گستردهای روی تدابیر امنیت سایبری Fable 5.1 انجام شده، از جمله آزمون خارجی توسط دو سازمان و آزمون خودکار توسط Gray Swan؛ همانند نسل قبلی این دو مدل، هیچ شواهدی از جیلبریک با شدت بحرانی یافت نشد.
ایمنی عاملمحور: Mythos 5.1 درخواستهای مخرب کدنویسی عاملمحور و استفاده از رایانه را با نرخی مشابه Mythos 5، Sonnet 5 و Opus 5رد کرد و در آزمون خارجی تزریق پرامپت، بالاترین میزان مقاومت را نشان داد.
همراستایی: ممیزی رفتاری خودکار نشان داد Mythos 5.1 در بیشتر معیارها نسبت به Mythos 5 همراستاتر است؛ یعنی احتمال کمتری دارد که برای انجام تکلیف غیرممکن به منابع خارج از محیط آزمایشی دسترسی پیدا کند، کمتر از استدلال انگیزشی (مانند این باور که موقعیت شبیهسازی است) استفاده میکند و کمتر محدودیتهای صریح را در پی اهداف کاربر نادیده میگیرد. بررسی دادههای آموزشی نشان داد نرخ کلی تلاش برای «هک پاداش» و موفقیت در آن نیز نسبت به Mythos 5 کاهش یافته است. بااینحال، آزمونها نشان دادند مدل هنوز گاهی میتواند از تأییدها و دستهبندهای حالت خودکار عبور کند؛ همچنین پوشش ارزیابی همراستایی در کارهای با بافت بسیار طولانی، محیطهای چندعامله و تکالیف غیرممکن هنوز محدود است.
هزینه و دسترسی
Fable 5.1 از امروز روی همه پلتفرمها از جمله AWS، Google Cloudو مایکروسافت Azureدر دسترس است. هزینه خواندن حافظه پنهان ۷۵ درصد کاهش یافته و به ۰.۲۵ دلار بهازای هر میلیون توکن رسیده که برای بارهای معمول حدود ۲۵ درصد و برای کارهای عاملمحور سنگین تا ۴۵ درصد کاهش هزینه کلی به همراه دارد. سایر قیمتها بدون تغییر بوده و برابر با ۱۰ دلار بهازای هر میلیون توکن ورودی و ۵۰ دلار بهازای هر میلیون توکن خروجی است. Mythos 5.1 فعلاً تنها برای مجموعهای از سازمانهای آمریکایی در دسترس است، هرچند آنتروپیک با دولت آمریکا برای گسترش دسترسی به شرکای داخلی و بینالمللی بیشتر همکاری میکند.
