Generic filters
Search in title
Filter by دسته‌ها
chatGTP
ابزارهای هوش مصنوعی
اخبار
گزارش خبری
پرامپت‌ نویسی
تیتر یک
چندرسانه ای
آموزش علوم داده
اینفوگرافیک
پادکست
ویدیو
دانش روز
آموزش‌های پایه‌ای هوش مصنوعی
اصول هوش مصنوعی
یادگیری بدون نظارت
یادگیری تقویتی
یادگیری عمیق
یادگیری نیمه نظارتی
آموزش‌های پیشرفته هوش مصنوعی
بینایی ماشین
پردازش زبان طبیعی
پردازش گفتار
چالش‌های عملیاتی
داده کاوی و بیگ دیتا
رایانش ابری و HPC
سیستم‌‌های امبدد
علوم شناختی
خطرات هوش مصنوعی
دیتاست
مدل‌های بنیادی
رویدادها
جیتکس
جیتکس ترکیه
کاربردهای هوش مصنوعی
کتابخانه
اشخاص
شرکت‌های هوش مصنوعی
محصولات و مدل‌های هوش مصنوعی
مفاهیم
کسب‌و‌کار
تحلیل بازارهای هوش مصنوعی
کارآفرینی
هوش مصنوعی در ایران
هوش مصنوعی در جهان
مقاله
پیاده‌سازی هوش مصنوعی
گزارش
مصاحبه
هوش مصنوعی در عمل
یادداشت
 Claude Opus 5.5؛ جدیدترین عضو آنتروپیک با تمرکز بر عملکرد، بهره‌وری و ایمنی

Claude Opus 5.5؛ جدیدترین عضو آنتروپیک با تمرکز بر عملکرد، بهره‌وری و ایمنی

زمان مطالعه: 5 دقیقه

آنتروپیک از Claude Opus 5.5 به‌عنوان نخستین مدل خانواده جدید Claude 5.5 رونمایی کرد.

مدل Opus 5.5 در بیشتر کارها عملکردی هم‌سطح Claude Fable 5.1 دارد، اما هزینه اجرای آن نسبت به Opus 5 حدود ۴۰ درصد کمتر است. Opus 5.5 نخستین مدل آنتروپیک پس از طرح دیدگاه این شرکت درباره «کُند کردن روند پیشرفت مرزهای توانمندی هوش مصنوعی» است.

عملکرد و بهره‌وری

پیش از عرضه، این مدل توسط ارزیابان خارجی از جمله Frontier Design و METR آزمایش شده است. در جامع‌ترین آزمون خودکار رفتاری آنتروپیک برای ارزیابی هم‌راستایی مدل‌ها، Opus 5.5 بهترین عملکرد ثبت‌شده میان مدل‌های آزمایش‌شده این شرکت را داشته است. این مدل همچنین با مجموعه‌ای از سازوکارهای حفاظتی عرضه شده که برای مدل‌های توانمندتر آنتروپیک توسعه یافته‌اند.

آنتروپیک می‌گوید Opus 5.5 نسبت به Opus 5 جهشی قابل‌توجه دارد و در حوزه‌هایی مانند کدنویسی عامل‌محور، استفاده از رایانه و کارهای دانش‌محور در صدر معیارهای داخلی این شرکت قرار گرفته است. البته آنتروپیک تأکید می‌کند که در سطوح بالای توانمندی مدل‌ها، فاصله میان نتایج بنچمارک‌ها الزاماً تفاوت عملکرد در دنیای واقعی را به‌خوبی نشان نمی‌دهد.

یکی از آزمایش‌کنندگان اولیه از Opus 5.5 برای مهاجرت یک کدبیس ۶۸۰ هزار خطی استفاده کرد و این کار را در کمتر از یک روز انجام داد؛ کاری که به گفته آنتروپیک در حالت معمول می‌توانست هفته‌ها زمان یک تیم مهندسی را نیاز داشته باشد. در آزمایشی دیگر، مدل برای کاهش زمان بارگذاری تمام صفحات یک وب اپلیکیشن، در ۳۹ مورد از ۴۰ تلاش موفق عمل کرد.

Opus 5.5 در کارهای گسترده کدنویسی مانند مهاجرت و ممیزی کل کدبیس نیز عملکرد قابل‌توجهی نشان داده است. یک آزمایش‌کننده یک کدبیس ۲۰۰ هزار خطی را با کمک این مدل در کمتر از سه ساعت ممیزی و اصلاح کرد؛ درحالی‌که استفاده از Opus 5 بیش از ۲۰ ساعت زمان برد و ۲.۵ برابر توکن بیشتری مصرف کرد.

در یک آزمایش داخلی، Opus 5.5 و Fable 5.1 نرم‌افزار HAProxy را از زبان C به Rust منتقل کردند. هر دو نسخه تقریباً تمام آزمون‌های رگرسیون HAProxy را پشت سر گذاشتند، اما Opus 5.5 این کار را در ۹.۵ ساعت، در برابر ۱۲ ساعت برای Fable 5.1، انجام داد و هزینه آن ۵۱ درصد کمتر بود. آنتروپیک همچنین گزارش می‌کند که Opus 5.5 در برخی بنچمارک‌های کدنویسی عامل‌محور با هزینه بسیار پایین‌تر به نتایج رقابتی یا بهتر از مدل‌های مقایسه‌شده رسیده است.

قیمت و سرعت

Opus 5.5 به محاسبات کمتری نیاز دارد و این موضوع در قیمت‌گذاری آن منعکس شده است. هزینه معمول اجرای آن طبق آزمایش‌های آنتروپیک، حدود ۴۰ درصد کمتر از Opus 5 است. قیمت هر یک میلیون توکن مدل Opus 5.5 از سوی آنتروپیک به این صورت اعلام شده است:

نوع توکنOpus 5.5Opus 5
Cache reads۰.۲۰ دلار۰.۵۰ دلار
Input۴ دلار۵ دلار
Output۲۰ دلار۲۵ دلار
Cache writes۵ دلار۶.۲۵ دلار

Opus 5.5 همچنین بیش از ۳۰ درصد سریع‌تر از Opus 5 خروجی تولید می‌کند. حالت سریع این مدل در Claude Code و پلتفرم Claude نیز با سرعتی تا ۲.۵ برابر در دسترس است. آنتروپیک هم‌زمان با کاهش قیمت، محدودیت استفاده پنج‌ساعته را در برخی طرح‌های اشتراکی افزایش داده و امکان ذخیره یک بازنشانی محدودیت نرخ (rate limit reset) را نیز برای کاربران اشتراکی فراهم کرده است.

کدنویسی و امنیت عامل‌ها

Opus 5.5 علاوه بر توانایی کدنویسی، با سازوکارهایی برای استفاده ایمن‌تر از عامل‌های نرم‌افزاری عرضه شده است. هر اقدام عامل پیش از اجرا توسط یک طبقه‌بندی‌کننده بررسی می‌شود، یک سندباکس متن‌باز برای ممیزی تیم‌های امنیتی ارائه شده و فرایند بازبینی کد می‌تواند آسیب‌پذیری‌ها را پیش از ادغام کد شناسایی کند.

این مدل همچنین در برابر حملات تزریق پرامپت نسبت به Opus 5 مقاوم‌تر است. در آزمایش‌های آنتروپیک، Opus 5.5 در حوزه‌های کدنویسی، استفاده از ابزار، استفاده از رایانه و وب‌گردی، با Opus 5 برابری کرده یا عملکرد بهتری داشته است. در یک بنچمارک شرکت امنیت هوش مصنوعی Gray Swan نیز Opus 5.5 از نظر نرخ موفقیت حملات تزریق پرامپت با Fable 5.1 برابر بوده است.

Claude Opus 5.5؛ جدیدترین عضو آنتروپیک با تمرکز بر عملکرد، بهره‌وری و ایمنی

کارهای دانشی و تحلیل کسب‌وکار

Opus 5.5 در پژوهش و تولید گزارش نیز عملکرد بالایی نشان داده است. در یک آزمایش داخلی، از Opus 5.5، Fable 5.1 و Opus 5 خواسته شد با استفاده از اطلاعات موجود در نسخه‌ای از وب که در آن یافتن گزارش درآمدی یک شرکت دشوار بود، گزارشی از عملکرد فصلی آن تهیه کنند. ارزیاب خودکار تمام ارقام و نقل‌قول‌ها را با منابع تطبیق داد. در تنظیمات مختلف، ۱۶ مورد از ۱۸ گزارش Opus 5.5 معیار کیفی تعیین‌شده را پشت سر گذاشتند؛ درحالی‌که هیچ‌یک از تلاش‌های Fable 5.1 یا Opus 5 این معیار را رعایت نکرد.

در یک آزمایش تحلیل مالی، Opus 5.5 و Opus 5 یک ادغام فرضی میان دو شرکت نرم‌افزاری حوزه منابع انسانی را بررسی کردند. هر دو مدل به نتایج مشابهی رسیدند، اما مدل مالی Opus 5.5 جامع‌تر بود و ارائه مدیریتی آن خوانایی بیشتری داشت. این مدل کار را در ۶۳ دقیقه در مقابل ۹۳ دقیقه برای Opus 5 تکمیل کرد و هزینه تولید آن ۵۰ درصد کمتر بود.

ارتباط و همکاری

آنتروپیک می‌گوید یکی از حوزه‌های اصلی بهبود در Opus 5.5، نحوه ارتباط مدل است. پیام‌های مدل برای درک سریع آسان‌تر شده‌اند، اطلاعات مهم را در ابتدای پاسخ قرار می‌دهد، کمتر از اصطلاحات تخصصی یا عبارت‌های نامتعارف استفاده می‌کند و دستورهای مربوط به سبک نوشتار را بهتر دنبال می‌کند. آزمایش‌کنندگان اولیه گزارش کرده‌اند که این ویژگی، کار با مدل را در جلسات طولانی آسان‌تر می‌کند و آنتروپیک نیز آن را هم از نظر کاربردی و هم از منظر ایمنی مفید می‌داند؛ زیرا بررسی و کنترل خروجی‌های مدل را ساده‌تر می‌کند.

ایمنی، هم‌راستایی و حفاظت‌ها

در ارزیابی خودکار رفتاری آنتروپیک که Claude را در نزدیک به ۲ هزار سناریو بررسی می‌کند، Opus 5.5 در تقریباً تمام معیارهای رفتار ناهم‌راستا، عملکرد بهتری از مدل‌های اخیر Claude داشته است. همچنین در بیشتر معیارهای صداقت، قوی‌ترین مدل این شرکت در این آزمون بوده است.

Opus 5.5 در رفتارهایی مانند استدلال سوگیرانه یا انگیزه‌محور، تلاش برای خروج از سندباکس و انجام اقدامات مضر پس از تشخیص شبیه‌سازی بودن محیط بهبود یافته است. در یک ارزیابی جدید برای سنجش تمایل مدل به عبور از مرزهای مقید و مشخص‌شده، Opus 5.5 حدود ۸۵ درصد کمتر از Opus 5 یا Claude Mythos 5.1 برای دورزدن این مرزها تلاش کرد و تمام تلاش‌های آن شدت پایینی داشتند و توسط خود مدل گزارش شدند.

بااین‌حال، آنتروپیک تأکید می‌کند که ساخت ارزیابی‌هایی که بتوانند تمام شکست‌های احتمالی مدل را پیش از استقرار شناسایی کنند، همچنان یک مسئله حل‌نشده است. این شرکت همچنین مشاهده کرده که Opus 5.5 در بسیاری از موارد احتمالاً متوجه می‌شود که در حال ارزیابی است؛ مسئله‌ای که ارزیابی رفتار آن در محیط‌های واقعی و متنوع را دشوار می‌کند.

به دلیل توانایی بالای Opus 5.5 در حوزه‌های پرریسکی مانند امنیت سایبری و زیست‌شناسی، این مدل با حفاظت‌هایی مشابه Fable 5.1 عرضه شده است. در امنیت سایبری، کاربران می‌توانند فعالیت‌های معمول توسعه نرم‌افزار مانند شناسایی و رفع باگ را انجام دهند، اما بیشتر وظایف سایبری به Opus 4.8 هدایت می‌شوند.

در حوزه زیست‌شناسی نیز Opus 5.5 از سازوکارهای حفاظتی Fable 5.1 استفاده می‌کند. آنتروپیک اعلام کرده است که برنامه‌ای برای ارائه دسترسی به سازمان‌های تأییدشده، از جمله آزمایشگاه‌های دانشگاهی، استارتاپ‌ها و شرکت‌های دارویی، در نظر گرفته شده است.

این مدل همچنین با سازوکار preserved thinking برای مقابله با حملات تقطیر (distillation) عرضه شده است. این سازوکار مانع از آن می‌شود که کاربران API با ویرایش زمینه قبلی Claude، تلاش کنند استدلال مدل را استخراج کنند. Opus 5.5 مانند مدل‌های قبلی Opus با نگهداری صفر داده (zero data retention) در دسترس است و برای انطباق با EU AI Act از اقدامات واترمارک‌گذاری استفاده می‌کند. حالت thinking نیز دیگر قابل خاموش‌کردن نیست.

عرضه

Claude Opus 5.5 اکنون روی تمام پلتفرم‌ها، از جمله Amazon Web Services، Google Cloud و Microsoft Azure در دسترس است. توسعه‌دهندگان در Claude Platform می‌توانند از مدل با شناسه claude-opus-5-5 استفاده کنند. آنتروپیک اعلام کرده است که Claude Sonnet 5.5 و Claude Haiku 5.5 نیز در هفته‌های آینده عرضه خواهند شد و انتظار می‌رود بسیاری از بهبودهای مربوط به عملکرد، بهره‌وری و ایمنی را به همراه داشته باشند.

مطالب پیشنهادی مرتبط

اشتراک در
اطلاع از
0 نظرات
بازخورد (Feedback) های اینلاین
مشاهده همه دیدگاه ها

در جریان مهم‌ترین اتفاقات AI بمانید

هر هفته، خلاصه‌ای از اخبار، تحلیل‌ها و رویدادهای هوش مصنوعی را در ایمیل‌تان دریافت کنید.

[wpforms id="48325"]