جدیدترین تحولات هوش مصنوعی را در کانال بله هوشیو بخوانید

Generic filters
Search in title
Filter by دسته‌ها
chatGTP
ابزارهای هوش مصنوعی
اخبار
گزارش خبری
پرامپت‌ نویسی
تیتر یک
چندرسانه ای
آموزش علوم داده
اینفوگرافیک
پادکست
ویدیو
دانش روز
آموزش‌های پایه‌ای هوش مصنوعی
اصول هوش مصنوعی
یادگیری بدون نظارت
یادگیری تقویتی
یادگیری عمیق
یادگیری نیمه نظارتی
آموزش‌های پیشرفته هوش مصنوعی
بینایی ماشین
پردازش زبان طبیعی
پردازش گفتار
چالش‌های عملیاتی
داده کاوی و بیگ دیتا
رایانش ابری و HPC
سیستم‌‌های امبدد
علوم شناختی
خطرات هوش مصنوعی
دیتاست
مدل‌های بنیادی
رویدادها
جیتکس
کاربردهای هوش مصنوعی
کتابخانه
اشخاص
شرکت‌های هوش مصنوعی
محصولات و مدل‌های هوش مصنوعی
مفاهیم
کسب‌و‌کار
تحلیل بازارهای هوش مصنوعی
کارآفرینی
هوش مصنوعی در ایران
هوش مصنوعی در جهان
مقاله
پیاده‌سازی هوش مصنوعی
گزارش
مصاحبه
هوش مصنوعی در عمل
یادداشت
 Claude Opus 5

جدیدترین عضو خانواده Claude معرفی شد

Claude Opus 5

زمان مطالعه: 6 دقیقه

آنتروپیک از جدیدترین مدل خود به نام Claude Opus 5 رونمایی کرد؛ مدلی با عملکردی نزدیک به Fable 5 ولی با هزینه نصف. Opus 5 برای استفاده روزمره طراحی شده و نسبت به سایر مدل‌ها بهره‌وری بیشتری دارد.

مدل Claude Opus 5 اکنون به‌عنوان مدل پیش‌فرض در اشتراک Claude Max و همچنین به‌عنوان قدرتمندترین مدل در Claude Pro ارائه می‌شود.

عملکرد و بهره‌وری اقتصادی

Claude Opus 5 نسبت به نسل پیشین خود، Opus 4.8، با همان هزینه، عملکردی به‌مراتب بهتر ارائه می‌دهد و در بیشتر بنچمارک‌ها عملکردی شانه‌به‌شانه Fable 5 و GPT-5.6 Sol از خود نشان می‌دهد.

نمودارهای این بخش نشان می‌دهند که عملکرد مدل با تغییر سطح تلاش (Effort Setting) چگونه تغییر می‌کند؛ قابلیتی که به کاربران اجازه می‌دهد بسته به نیاز خود، میان هوشمندی بیشتر یا کاهش مصرف توکن برای دستیابی به پاسخ‌های سریع‌تر و کم‌مصرف‌تر در میزان مصرف توکن تعادل برقرار کنند.

Opus 5 در وظایف ارزشمند مهندسی نرم‌افزار عملکردی درخشان دارد. برای مثال:

  • در Frontier-Bench v0.1، این مدل از تمامی مدل‌های دیگر پیشی گرفته و با هزینه‌ای کمتر برای هر وظیفه، عملکردی بیش از دوبرابر بهتر از Opus 4.8 ثبت کرده است.
  • در CursorBench 3.2، در بالاترین سطح تلاش (Max Effort)، عملکرد مدل تنها ۰٫۵ درصد کمتر از بالاترین امتیاز Fable 5 است، درحالی‌که هزینه انجام هر وظیفه نصف آن است. همچنین در سطوح High، XHigh و Max Effort، این مدل نسبت به تمامی رقبا، عملکرد بیشتری در ازای هزینه یکسان ارائه می‌دهد.

همین روند در وظایف دانشی و حل مسئله نیز مشاهده می‌شود. برای نمونه:

  • در ARC-AGI 3 که توانایی مدل در حل مسائل کاملاً جدید را می‌سنجد، امتیاز Opus 5 تقریباً سه برابر بیشتر از نزدیک‌ترین رقیب است.
  • در Zapier AutomationBench که توانایی مدل در انجام کامل وظایف تجاری از ابتدا تا انتها را ارزیابی می‌کند، نرخ موفقیت Opus 5 با همان هزینه برای هر وظیفه، حدود ۱.۵ برابر بهترین مدل بعدی است. حتی در کمترین سطح تلاش نیز این مدل از تمام رقبا وظایف بیشتری را با موفقیت به پایان می‌رساند.
  • در OSWorld 2.0 که یکی از معیارهای سنجش توانایی استفاده از رایانه است، Opus 5 در هر سطح تلاش از تمامی مدل‌های دیگر عملکرد بهتری دارد و حتی با صرف کمی بیش از یک‌سوم هزینه از بهترین نتیجه Fable 5 نیز فراتر می‌رود.

این مدل همچنین در چندین ارزیابی مرتبط دیگر نیز بهترین و مقرون‌به‌صرفه‌ترین مدل آنتروپیک محسوب می‌شود، از جمله:

پیشرفت در پژوهش‌های علمی

Opus 5 نسبت به Opus 4.8 پیشرفتی قابل‌توجه برای پژوهش‌های علمی محسوب می‌شود. این مدل در تمامی ارزیابی‌های علوم زیستی آنتروپیک، عملکرد بهتری از نسل قبل داشته است؛ ارزیابی‌هایی که حوزه‌هایی مانند زیست‌شناسی ساختاری، شیمی آلی و بیوانفورماتیک را پوشش می‌دهند.

بیشترین بهبودها در دو حوزه مشاهده شده است:

  • شیمی آلی؛ به‌ویژه در استنباط ساختار مولکول‌ها بر اساس داده‌های طیف‌سنجی که در معیار داخلی آنتروپیک، امتیاز مدل ۱۰٫۲ واحد درصد بالاتر از Opus 4.8 بوده است.
  • وظایف مرتبط با پروتئین‌ها؛ مانند پیش‌بینی تأثیر تغییرات توالی پروتئین بر عملکرد آن‌ها که در این بخش نیز Opus 5 ۷٫۷ واحد درصد عملکرد بهتری نسبت به نسل قبل ثبت کرده است.

همچنین Opus 5 قادر است خروجی‌های بصری به‌مراتب قدرتمندتری تولید کند. در نمونه Wind Tunnel، این مدل جریان هوا را بر روی اجسام آیرودینامیک (و حتی اجسام غیرآیرودینامیک) شبیه‌سازی و به‌صورت بصری نمایش داده است.

Wind Tunnel

کار با Claude Opus 5

Claude Opus 5 در راستی‌آزمایی نتایج خود و تکرار دقیق مراحل تا رسیدن به پاسخ صحیح بسیار توانمندتر شده است. در ارزیابی‌ها و همچنین آزمایش‌های دسترسی زودهنگام، آنتروپیک و کاربران این شرکت نمونه‌های متعددی از عاملیت (Agency) و دقت عمل این مدل مشاهده کرده‌اند.

برای مثال:

  • در یکی از وظایف Frontier-Bench، از مدل خواسته شد با استفاده از تصویر یک قطعه مکانیکی، کدی برای بازسازی آن به‌صورت یک مدل سه‌بعدی در FreeCAD بنویسد. بااین‌حال، به طور عمدی هیچ راه مستقیمی برای مشاهده تصویر در اختیار مدل قرار نگرفته بود. Opus 5 در پاسخ، خود یک خط‌لوله بینایی ماشین (Computer Vision Pipeline) طراحی کرد تا هندسه قطعه را از پیکسل‌های خام استخراج کند و سپس کل قطعه را بازسازی کرد. این مدل بارها موفق به انجام این کار شد، درحالی‌که هیچ‌یک از مدل‌های رقیب با همین شرایط، حتی پس از پنج تلاش، نتوانستند مسئله را حل کنند.
  • در مواجهه با یک باگ واقعی در یکی از پکیج منجیرهای متن‌باز، Opus 5 علت ریشه‌ای مشکل را شناسایی و یک حالت مرزی (Edge Case) را که از دید وصله ارائه‌شده توسط جامعه توسعه‌دهندگان پنهان مانده بود، اصلاح کرد. در مقابل، یک مدل رقیب تنها نشانه ظاهری مشکل را برطرف کرد و به‌اشتباه اعلام کرد که باگ رفع شده است.
  • یکی از مهندسان یک شرکت فعال در حوزه معاملات مالی با استفاده از Opus 5 توانست تنها در یک نشست کاری، سامانه دریافت داده‌های بازار را برای یک بازار بورس جدید توسعه دهد. مدل‌های قبلی، حتی با وجود دریافت برنامه‌های کاری مفصل از سوی مهندسان، قادر به انجام این وظیفه نبودند. ازآنجاکه هیچ داده زنده‌ای برای اعتبارسنجی وجود نداشت، Opus 5 حتی چارچوب آزمون اختصاصی خود را ایجاد کرد تا اطمینان حاصل کند کدهای نوشته‌شده، داده‌های بورس را به‌درستی تجزیه و پردازش می‌کند.

هم‌راستاسازی و ایمنی

در آزمایش‌های پیش از انتشار، ممیزی رفتاری خودکار آنتروپیک نشان داد که Opus 5 هم‌راستاترین مدل این شرکت تا به امروز است. بر اساس این ارزیابی:

  • این مدل بیش از Opus 4.8، Sonnet 5 و Fable 5 از خط‌مشیClaude  پیروی می‌کند.
  • کمترین میزان رفتارهای فریبکارانه را از خود نشان می‌دهد.
  • کمتر از سایر مدل‌ها در معرض فریب برای استفاده نادرست قرار می‌گیرد.
  • همچنین ایمن‌ترین مدل آنتروپیک از نظر پرهیز از انجام اقدامات مخاطره‌آمیزی است که ممکن است پیامدهای دشوار یا غیرقابل‌بازگشت داشته باشند.

در این ممیزی رفتاری، Opus 5 در شاخص رفتارهای کلی ناهم‌راستا (Overall Misaligned Behavior) امتیاز ۲٫۳ را کسب کرده که پایین‌ترین مقدار در میان مدل‌های اخیر آنتروپیک است.

Opus 5 مرز توانمندی‌های پرخطر و دارای کاربرد دوگانه را جابه‌جا نمی‌کند. بر اساس ارزیابی‌های سخت‌گیرانه‌ای که با همکاری شرکای دولتی و بخش خصوصی انجام شده، این مدل همچنان در پژوهش‌های زیست‌شناسی و امنیت سایبری تهاجمی از Mythos 5 ضعیف‌تر است. جزئیات بیشتر این ارزیابی‌ها در System Card مدل منتشر شده است.

همانند Opus 4.8، آنتروپیک به‌صورت عمدی Opus 5 را بر روی وظایف مرتبط با امنیت سایبری آموزش نداده است. بااین‌حال، به‌دلیل افزایش توانایی‌های عمومی مدل، عملکرد آن در این حوزه نیز به شکل قابل‌توجهی بهبود یافته و اکنون در شناسایی آسیب‌پذیری‌های امنیتی به Mythos 5 نزدیک شده است. با وجود این، این مدل همچنان در بهره‌برداری از آسیب‌پذیری‌ها (Exploitation)؛ یعنی تبدیل آسیب‌پذیری‌ها به تهدیدات واقعی سایبری فاصله قابل‌توجهی با Mythos 5 دارد.

این موضوع در عملکرد مدل در آزمون OSS-Fuzz نیز مشاهده می‌شود؛ معیاری که Anthropic برای ارزیابی توانایی مدل‌ها در شناسایی و سپس بهره‌برداری از آسیب‌پذیری‌ها بدون نیاز به راهنمایی گسترده انسانی طراحی کرده است. اگرچه Mythos 5 و Opus 5 در شناسایی آسیب‌پذیری‌ها عملکردی تقریباً مشابه دارند، اما Opus 5 در توسعه اکسپلویت‌ها فاصله قابل‌توجهی با Mythos 5 دارد.

سازوکارهای حفاظتی Opus 5

سازوکارهای حفاظتی Claude Opus 5 به‌گونه‌ای طراحی شده‌اند که امکان استفاده مفید از مدل را هم در امنیت سایبری و هم در زیست‌شناسی فراهم کنند. این سازوکارها عمدتاً مشابه تدابیر اعمال‌شده برای Opus 4.8 هستند، با این تفاوت که برای دامنه محدودی از وظایف سایبری، محدودیت‌های حفاظتی قوی‌تری در نظر گرفته شده است.

طبقه‌بندی‌کننده‌های امنیت سایبری در Opus 5 نسبت به Fable 5 محدودکنندگی کمتری دارند. این طبقه‌بندی‌کننده‌ها به مدل اجازه می‌دهند آسیب‌پذیری‌ها را در کد منبع شناسایی کند، اما موارد زیر را مسدود می‌کنند:

  • اسکن آسیب‌پذیری مبتنی بر فایل‌های باینری (Binary-Based Vulnerability Scanning)
  • آزمون نفوذ (Penetration Testing)
  • تولید اکسپلویت (Exploit Generation)

بر اساس آزمایش‌های آنتروپیک، انتظار می‌رود این طبقه‌بندی‌کننده‌ها نسبت به Fable 5 حدود ۸۵ درصد کمتر مداخله کنند. در Claude.ai، Claude Code و Claude Cowork، درخواست‌هایی که توسط این طبقه‌بندی‌کننده‌ها علامت‌گذاری شوند، به‌صورت پیش‌فرض به Opus 4.8 ارجاع داده می‌شوند. این قابلیت در API نیز قابل‌فعال‌سازی است.

همچنین برنامه تأیید امنیت سایبری (Cyber Verification Program) یا به‌اختصار CVP امکان انجام فعالیت‌هایی که ممکن است توسط این محدودیت‌ها متوقف شوند را برای کاربران واجد شرایط فراهم می‌کند. شرکت‌ها و پژوهشگرانی که عضو این برنامه هستند، به نسخه‌ای از Opus 5 با محدودیت‌های امنیتی کمتر دسترسی خواهند داشت.

ازآنجایی‌که Opus 5 تقریباً همان مجموعه تدابیر حفاظتی Opus 4.8 را دارد، اکنون توانمندترین مدل عمومی آنتروپیک برای پژوهش‌های علمی محسوب می‌شود. بااین‌حال، این مدل همچنان در پژوهش‌های خودکار و طولانی‌مدت محدودیت‌های مهمی دارد؛ حوزه‌ای که آنتروپیک معتقد است بیشترین خطرات بالقوه هوش مصنوعی در زیست‌شناسی در آن نهفته است. (در این نوع فعالیت‌ها، Mythos 5 همچنان مدل قدرتمندتری محسوب می‌شود.) هم‌زمان با عرضه Opus 5، درخواست‌های مرتبط با زیست‌شناسی که در Fable 5 مسدود می‌شوند، ازاین‌پس به‌جای Opus 4.8 به Opus 5 هدایت خواهند شد.

شروع استفاده

Claude Opus 5 از امروز در تمامی پلتفرم‌ها در دسترس است و با همان قیمت Opus 4.8 عرضه می‌شود:

  • ۵ دلار برای هر یک میلیون توکن ورودی
  • ۲۵ دلار برای هر یک میلیون توکن خروجی

توسعه‌دهندگان می‌توانند از طریق Claude API و با شناسه claude-opus-5 استفاده از این مدل را آغاز کنند.

همچنین Opus 5 در حالت Fast نیز ارائه شده است که حدود ۲٫۵ برابر سریع‌تر از حالت پیش‌فرض اجرا می‌شود. همانند Opus 4.8، استفاده از این حالت در Claude Platform با دوبرابر قیمت پایه انجام می‌شود و در Claude Code نیز از طریق اعتبار مصرفی در دسترس است.

هم‌زمان با عرضه Opus 5، دو قابلیت جدید نیز به‌صورت بتا معرفی شده‌اند:

  • تغییر ابزارها در میانه مکالمه در Claude Platform: توسعه‌دهندگان اکنون می‌توانند در طول یک گفت‌وگو، ابزارهای در دسترس Claude را بدون ازبین‌رفتن Prompt Cache تغییر دهند.
  • Fallback خودکار در API: کاربران می‌توانند تعیین کنند درخواست‌هایی که توسط طبقه‌بندی‌کننده‌های ایمنی در Opus 5 یا Fable 5 علامت‌گذاری می‌شوند، به طور خودکار به مدل دیگری هدایت شوند. با فعال‌بودن این قابلیت، درخواست‌های API به‌جای مسدودشدن، به‌صورت پیش‌فرض به بهترین مدل در دسترس ارجاع داده می‌شوند.

همانند نسل‌های پیشین خانواده Opus، استفاده عمومی از Opus 5 نیز هیچ الزام یا شرطی برای نگه‌داری داده‌ها (Data Retention) ندارد.

مطالب پیشنهادی مرتبط

اشتراک در
اطلاع از
0 نظرات
بازخورد (Feedback) های اینلاین
مشاهده همه دیدگاه ها

در جریان مهم‌ترین اتفاقات AI بمانید

هر هفته، خلاصه‌ای از اخبار، تحلیل‌ها و رویدادهای هوش مصنوعی را در ایمیل‌تان دریافت کنید.

[wpforms id="48325"]