Generic filters
Search in title
Filter by دسته‌ها
chatGTP
ابزارهای هوش مصنوعی
اخبار
گزارش خبری
پرامپت‌ نویسی
تیتر یک
چندرسانه ای
آموزش علوم داده
اینفوگرافیک
پادکست
ویدیو
دانش روز
آموزش‌های پایه‌ای هوش مصنوعی
اصول هوش مصنوعی
یادگیری بدون نظارت
یادگیری تقویتی
یادگیری عمیق
یادگیری نیمه نظارتی
آموزش‌های پیشرفته هوش مصنوعی
بینایی ماشین
پردازش زبان طبیعی
پردازش گفتار
چالش‌های عملیاتی
داده کاوی و بیگ دیتا
رایانش ابری و HPC
سیستم‌‌های امبدد
علوم شناختی
خطرات هوش مصنوعی
دیتاست
مدل‌های بنیادی
رویدادها
جیتکس
کاربردهای هوش مصنوعی
کتابخانه
اشخاص
شرکت‌های هوش مصنوعی
محصولات و مدل‌های هوش مصنوعی
مفاهیم
کسب‌و‌کار
تحلیل بازارهای هوش مصنوعی
کارآفرینی
هوش مصنوعی در ایران
هوش مصنوعی در جهان
مقاله
پیاده‌سازی هوش مصنوعی
گزارش
مصاحبه
هوش مصنوعی در عمل
یادداشت
 بازگشت آنتروپیک به صدر با Fable 5.1 و Mythos 5.1

با تمرکز بر کدنویسی و کار دانش‌محور

بازگشت آنتروپیک به صدر با Fable 5.1 و Mythos 5.1

زمان مطالعه: 4 دقیقه

آنتروپیک از دو مدل جدید خود، Claude Fable 5.1 و Claude Mythos 5.1 رونمایی کرد. این دو مدل به ادعای آنتروپیک در حال حاضر پیشرفته‌ترین مدل‌های موجود برای کدنویسی و کارهای دانش‌محور معرفی شده‌اند و قابلیت‌های پژوهشی آن‌ها نمایی اولیه از نقش آینده هوش مصنوعی در پیشرفت علمی ارائه می‌دهد.

Fable 5.1 و Mythos 5.1 در واقع یک مدل واحد هستند، اما با سطوح متفاوتی از تدابیر ایمنی. Fable 5.1 به‌صورت عمومی در دسترس است، درحالی‌که Mythos 5.1 تنها از طریق برنامه‌های دسترسی مورد‌اعتماد آنتروپیک قابل‌استفاده است و تدابیر ایمنی آن به طور خاص برای کار در حوزه‌های امنیت سایبری و علوم زیستی طراحی شده‌اند.

قیمت، حفظ داده و تدابیر ایمنی

Fable 5.1 در مقایسه با Fable 5 در هر جا که هزینه بر اساس توکن محاسبه شود و برای بارهای کاری معمول حدود ۲۵ درصد ارزان‌تر خواهد بود؛ دلیل این امر کاهش قیمت خوانش از حافظه پنهان (cache reads) است. برای کارهای عامل‌محور سنگین، این صرفه‌جویی می‌تواند تا حدود ۴۵ درصد نیز برسد.

سامانه جدید «تدابیر ایمنی مرزی سازمانی» (Enterprise Frontier Safeguards) آنتروپیک به مشتریان حریم خصوصی کاملی معادل سیاست عدم نگهداری داده می‌دهد، بدون آنکه خدشه‌ای توان مقابله با سوءاستفاده وارد شود. در این سامانه، داده‌ها روی زیرساخت ابری تحت کنترل کامل مشتری و نه آنتروپیک ذخیره می‌شوند. این سامانه از پاییز امسال به‌تدریج برای مشتریان سازمانی عرضه خواهد شد. تا پیش از آماده‌شدن EFS نیز مشتریان واجد شرایط می‌توانند از Fable 5.1 با سیاست عدم نگهداری داده استفاده کنند.

تدابیر ایمنی نیز بهبود یافته تا موارد مثبت کاذب و فلگ‌شدن محتوای بی‌خطر کاهش یابد. در حوزه امنیت سایبری، تدابیر جدید ۶۰ درصد کمتر از قبل موارد مثبت کاذب ایجاد می‌کنند؛ بخشی از این بهبود ازاین‌جهت است که Fable 5.1 اکنون می‌تواند برای کشف آسیب‌پذیری‌های نرم‌افزاری استفاده شود؛ هرچند نه برای توسعه اکسپلویت برای آن‌ها. در حوزه زیست‌شناسی نیز برنامه دسترسی‌ای با همکاری دولت آمریکا ایجاد شده تا قابلیت‌های پیشرفته زیست‌شناسی Mythos 5.1 در دسترس قرار گیرد و ثبت‌نام دانشمندان برای این طرح به‌زودی آغاز می‌شود.

عملکرد

Fable 5.1 استاندارد جدیدی برای کدنویسی، کارهای دانش‌محور و حل مسائل طولانی‌مدت تعیین می‌کند و عملکرد به‌مراتب بالاتری نسبت به نسخه پیشین از خود نشان می‌دهد. در سطح تلاش «کم» یا «متوسط»، Fable 5.1 نتایجی مشابه یا بهتر از Fable 5 با هزینه‌ای بسیار پایین‌تر ارائه می‌دهد. لازم به ذکر است Fable 5.1 به طور پیش‌فرض در Claude Code روی سطح تلاش «بالا» و در Claude Cowork و Claude.ai. روی سطح «متوسط» تنظیم شده است.

در آزمون بنچمارک Terminal-Bench-Science 0.1، خطای استاندارد ۳.۵ تا ۴.۵ واحد گزارش شده است. تخته امتیازات عمومی (با ۳ آزمایش در هر تکلیف، در Claude Code) امتیاز کلود Opus 5 را ۳۰.۰ درصد و Fable 5 را ۲۱.۴ درصد گزارش کرده؛ تنظیمات داخلی آنتروپیک این اعداد را به ترتیب ۲۹.۰ و ۲۴.۷ درصد بازتولید کرده که هر دو در محدوده نویز آماری است.

Fable 5.1 از میان‌بُرهایی که منجر به کار بی‌کیفیت می‌شوند اجتناب می‌کند و به‌اندازه کافی هوشمند است تا ریشه مشکلات نرم‌افزاری را برطرف کند. برای نمونه، در آزمایش‌های شرکت سرمایه‌گذاری میلنیوم، Fable 5.1 علت یک خرابی نادر در سامانه‌های داخلی این شرکت را کشف کرد، مشکلی که هیچ‌یک از مهندسان آن‌ها یا هیچ مدل دیگری پس از چند سال تلاش موفق به توضیح آن نشده بودند.

پژوهش علمی

قابلیت‌های پژوهش علمی این دو مدل در حوزه‌های گوناگون آزموده شد.

طراحی مولکولی: برای سنجش توانایی Mythos 5.1 در طراحی بایندرهای پروتئینی، به مدل دسترسی به ابزارهای طراحی و تاخوردگی پروتئین متن‌باز داده شد و طرح‌های آن برای اعتبارسنجی آزمایشگاهی به دو سازمان خارجی ارسال شد. Mythos 5.1 توانست بایندرهایی با میل ترکیبی بسیار بالا طراحی کند. در سه هدف، میل ترکیبی طراحی‌های آن ۱۰ برابر بهترین طرح‌های ارائه‌شده در مسابقات طراحی پروتئین شرکت Adaptyv Bio بود. نرخ موفقیت آن (نسبت طرح‌های موفق به بایندرهای زیستی) به نزدیک ۵۰ درصد در ۱۲ هدف رسید، درحالی‌که نرخ معمول در این حوزه امروزه ۱۰ تا ۱۵ درصد است.

تحلیل و مدل‌سازی محاسباتی: Fable 5.1 یک شبکه عصبی آموزش داد تا یک نقشه ارتفاعی جدید با وضوح بالا برای یک‌سوم سیاره زهره تولید کند. این کار بر پایه تصاویر راداری مأموریت مگلان ناسا (بیش از ۳۰ سال پیش) و نقشه‌ای موجود برای یک‌پنجم سیاره انجام شد. نقشه جدید جزئیاتی تا دو تا سه کیلومتر (به‌جای ۱۰ تا ۲۰ کیلومتر پیشین) را نشان می‌دهد و ارتفاعات را تا ۲۵ درصد دقیق‌تر ثبت می‌کند.

زیست‌شناسی محاسباتی: Mythos 5.1 با نوشتن کرنل‌های سفارشی GPU و ذخیره‌سازی نتایج میانی، سرعت هفت مدل یادگیری عمیق متن‌باز را تا ۲.۵ برابر افزایش داد (با خروجی‌های یکسان). این بهینه‌سازی هزینه‌های GPU را در تحلیل‌های تکراری (مانند آزمایش هر جهش ممکن نزدیک هر ژن انسانی) ۳۰ تا ۶۰ درصد کاهش می‌دهد، کاری که معمولاً هفته‌ها زمان تیم‌های مهندسی عملکرد را می‌گیرد و اغلب برای آزمایشگاه‌های دانشگاهی مقرون‌به‌صرفه نیست؛ Mythos 5.1 این کار را تنها در چند روز و صرفاً با استفاده از کد منبع متن‌باز موجود انجام داد.

ایمنی، امنیت و هم‌راستایی

پیش از انتشار، این مدل‌ها تحت آزمون‌های گسترده برای سنجش خطرات قرار گرفتند.

خطرات سایبری: Mythos 5.1 (بدون تدابیر امنیتی سایبری) قوی‌ترین قابلیت‌های سایبری در میان مدل‌های منتشرشده تاکنون را نشان می‌دهد، هرچند همچنان در رده پایین‌تر خطر چارچوب انطباق مرزی قرار دارد. آزمون‌های استرس گسترده‌ای روی تدابیر امنیت سایبری Fable 5.1 انجام شده، از جمله آزمون خارجی توسط دو سازمان و آزمون خودکار توسط Gray Swan؛ همانند نسل قبلی این دو مدل، هیچ شواهدی از جیلبریک با شدت بحرانی یافت نشد.

ایمنی عامل‌محور: Mythos 5.1 درخواست‌های مخرب کدنویسی عامل‌محور و استفاده از رایانه را با نرخی مشابه Mythos 5،  Sonnet 5 و Opus 5رد کرد و در آزمون خارجی تزریق پرامپت، بالاترین میزان مقاومت را نشان داد.

هم‌راستایی: ممیزی رفتاری خودکار نشان داد Mythos 5.1 در بیشتر معیارها نسبت به Mythos 5 هم‌راستاتر است؛ یعنی احتمال کمتری دارد که برای انجام تکلیف غیرممکن به منابع خارج از محیط آزمایشی دسترسی پیدا کند، کمتر از استدلال انگیزشی (مانند این باور که موقعیت شبیه‌سازی است) استفاده می‌کند و کمتر محدودیت‌های صریح را در پی اهداف کاربر نادیده می‌گیرد. بررسی داده‌های آموزشی نشان داد نرخ کلی تلاش برای «هک پاداش» و موفقیت در آن نیز نسبت به Mythos 5 کاهش یافته است. بااین‌حال، آزمون‌ها نشان دادند مدل هنوز گاهی می‌تواند از تأییدها و دسته‌بندهای حالت خودکار عبور کند؛ همچنین پوشش ارزیابی هم‌راستایی در کارهای با بافت بسیار طولانی، محیط‌های چندعامله و تکالیف غیرممکن هنوز محدود است.

هزینه و دسترسی

Fable 5.1 از امروز روی همه پلتفرم‌ها از جمله AWS،  Google Cloudو مایکروسافت Azureدر دسترس است. هزینه خواندن حافظه پنهان ۷۵ درصد کاهش یافته و به ۰.۲۵ دلار به‌ازای هر میلیون توکن رسیده که برای بارهای معمول حدود ۲۵ درصد و برای کارهای عامل‌محور سنگین تا ۴۵ درصد کاهش هزینه کلی به همراه دارد. سایر قیمت‌ها بدون تغییر بوده و برابر با ۱۰ دلار به‌ازای هر میلیون توکن ورودی و ۵۰ دلار به‌ازای هر میلیون توکن خروجی است. Mythos 5.1 فعلاً تنها برای مجموعه‌ای از سازمان‌های آمریکایی در دسترس است، هرچند آنتروپیک با دولت آمریکا برای گسترش دسترسی به شرکای داخلی و بین‌المللی بیشتر همکاری می‌کند.

مطالب پیشنهادی مرتبط

اشتراک در
اطلاع از
0 نظرات
بازخورد (Feedback) های اینلاین
مشاهده همه دیدگاه ها

در جریان مهم‌ترین اتفاقات AI بمانید

هر هفته، خلاصه‌ای از اخبار، تحلیل‌ها و رویدادهای هوش مصنوعی را در ایمیل‌تان دریافت کنید.

[wpforms id="48325"]