عاملمحورترین عضو خانواده Sonnet
Claude Sonnet 5
برای بسیاری از توسعهدهندگان، عصر هوش مصنوعی عاملمحور با مدلهای رده Sonnet آغاز شد. Claude Sonnet 3.5، 3.7 و 3.6 نخستین مدلهایی بودند که مهارتهای چشمگیری در کدنویسی و استفاده از ابزار از خود نشان دادند. بااینحال، محسوسترین پیشرفتها در قابلیتهای عاملمحور در مدلهای رده Opus آنتروپیک رخ داده است.
Sonnet 5 این فاصله را کاهش میدهد: عملکرد آن به Opus 4.8 نزدیک است، اما با قیمتی پایینتر. Claude Sonnet 5 میتواند برنامهریزی کند، از ابزارهایی مانند مرورگر و ترمینال استفاده کند و بهصورت خودمختار در سطحی عمل کند که تا همین چند ماه پیش، تنها از مدلهای بزرگتر و گرانقیمتتر برمیآمد.
بنچمارکها
مدل Claude Sonnet 5 در جنبههای مهم عملکرد عاملمحور مانند استدلال، استفاده از ابزار، کدنویسی و کارهای دانشمحور، پیشرفت چشمگیر نسبت به مدل پیشین خود، Sonnet 4.6 نشان میدهد.

ارزیابیهای ایمنی آنتروپیک نشان داد که Sonnet 5 در مقایسه با Sonnet 4.6 نرخ کلی پایینتری از رفتارهای نامطلوب دارد و بهطورکلی در بافتهای عاملمحور، ایمنتر است. ارزیابیها همچنین نشان میدهند که توانایی این مدل در انجام وظایف امنیت سایبری، به طور قابلتوجهی کمتر از مدلهای فعلی خانواده Opus است.
کار با Claude Sonnet 5
نمودارهای زیر عملکرد Sonnet 5 را در سطوح مختلف تلاش (effort levels)، در ارزیابی جستوجوی عاملمحور BrowseComp و ارزیابی استفاده از رایانه OSWorld-Verified، با Sonnet 4.6 و Opus 4.8 مقایسه میکنند. Sonnet 5 یک روند بهبود نسبت به Sonnet 4.6 را نشان میدهد و طیف بسیار وسیعتری از گزینههای هزینه-عملکرد را نسبت به Opus 4.8 پوشش میدهد. بهرهوری هزینهای این مدل در سطح تلاش متوسط به طور چشمگیری بهبود یافته است و عملکرد آن در سطوح تلاش بالاتر میتواند در برخی وظایف با Opus 4.8 برابری کند. کاربران میتوانند میان Sonnet 5 و Opus 4.8، سطح تلاش را برای یافتن تعادل مناسب میان هزینه و عملکرد تنظیم کنند.


ارزیابیهای ایمنی
از نظر ایمنی عاملمحور، این مدل در رد درخواستهای مخرب و مقاومت در برابر تلاشهای ربودن کنترل (hijack) در حملات تزریق پرامپت عملکرد بهتری دارد. این مدل نرخهای پایینتری از توهمزایی (hallucination) و چاپلوسی (sycophancy) نسبت به Sonnet 4.6 نشان میدهد. در ممیزی رفتاری خودکار آنتروپیک که طیف گستردهای از رفتارهای ناهمراستا مانند همکاری در سوءاستفاده و فریبکاری را میآزماید، Sonnet 5 بهطورکلی نمره پایینتری (یعنی ایمنتر) کسب کرد. بااینحال، این مدل در این ارزیابی، نرخهای تا حدی بالاتری از رفتار ناهمراستا را در مقایسه با مدلهای توانمندتر Opus 4.8 و Claude Mythos Preview نشان داد.
آنتروپیک بهعمد Sonnet 5 را بر روی وظایف امنیت سایبری آموزش نداده است. این مدل میتواند برخی وظایف سایبری روتین و بیخطر را انجام دهد، اما در ارزیابیهایی که مهارتهای سایبری بالقوه خطرناک، مانند توسعه اکسپلویتهای نرمافزاری را میآزمایند، عملکردی بسیار ضعیفتری از مدلهایی مانند Opus 4.8 و Mythos 5 نشان میدهد. نمرات یک ارزیابی که توانایی مدلها را در توسعه اکسپلویت برای آسیبپذیریهای مرورگر فایرفاکس میآزمود، در نمودار زیر نشان داده شده است. Sonnet 5 هرگز نتوانست یک اکسپلویت کاملاً کارآمد را توسعه دهد، اما نرخ موفقیت جزئی اندکی بالاتری نسبت به Sonnet 4.6 نشان داد. این تغییر اخیر بهاحتمال زیاد ناشی از بهبود در هوش عمومی مدل است تا آموزش تخصصی.


ازآنجاکه Sonnet 5 در این وظایف تا حدی قویتر از مدل پیشین خود است، آنتروپیک آن را با تدابیر حفاظتی سایبری (cyber safeguards) فعال بهصورت پیشفرض عرضه کرده است. این تدابیر حفاظتی که کاربردهای خطرناک سایبری را در زمان واقعی شناسایی و مسدود میکنند، همان تدابیری هستند که در Claude Opus 4.7 و 4.8 وجود دارند. ارزیابی کامل آنتروپیک از Sonnet 5 در طیف گستردهای از سنجههای ایمنی و قابلیت، در Claude Sonnet 5 System Card گزارش شده است.
دسترسی و قیمتگذاری
Claude Sonnet 5 از امروز سراسر اکوسیستم Claude با قیمت مقدماتی ۲ دلار بهازای هر میلیون توکن ورودی و ۱۰ دلار بهازای هر میلیون توکن خروجی، تا ۳۱ اوت ۲۰۲۶ در دسترس است. پس از آن، قیمتگذاری استاندارد به ۳ دلار بهازای هر میلیون توکن ورودی و ۱۵ دلار بهازای هر میلیون توکن خروجی تغییر میکند.
Claude Sonnet 5 در تمامی طرحها در دسترس است: این مدل، مدل پیشفرض طرحهای رایگان (Free) و حرفهای (Pro) است و برای کاربران Max، Team و Enterprise نیز قابلاستفاده است. این مدل همچنین در Claude Code و در Claude Platform در دسترس است. توسعهدهندگان میتوانند از طریق Claude API با شناسه claude-sonnet-5 به این مدل دسترسی داشته باشند.
آنتروپیک محدودیتهای نرخ (rate limits) در Chat، Cowork، Claude Code و Claude Platform را افزایش داده تا مصرف بالاتر توکن در سطوح تلاش بالاتر را پوشش دهد؛ کاربران میتوانند هر سطحی را که برای پروژه خاص خود مناسب است انتخاب کنند.