چشمگیر در مهندسی نرمافزار
آنتروپیک جدیدترین مدل خود به نام Claude Opus 4.7 را منتشر کرد
به نقل از بلاگ آنتروپیک، مدل Opus 4.7 یک بهبود چشمگیر نسبت به Opus 4.6 در حوزه مهندسی نرمافزار پیشرفته محسوب میشود که دستاوردهای ویژهای در دشوارترین وظایف داشته است.
کاربران گزارش میدهند که با اطمینان خاطر میتوانند سختترین کارهای برنامهنویسی خود، ازآندست کارهایی که پیشتر نیازمند نظارت دقیق بود را به Opus 4.7 بسپارند. Opus 4.7 وظایف پیچیده و طولانیمدت را با دقت و انسجام مدیریت میکند، به دستورالعملها توجه دقیقی دارد و پیش از ارائه گزارش نهایی، راهکارهایی را برای راستیآزمایی خروجیهای خود ابداع میکند.
بنچمارکها
این مدل همچنین از قابلیت بینایی (Vision) بهمراتب بهتری برخوردار است و میتواند تصاویر را با وضوح بالاتری پردازش کند. هنگام انجام وظایف حرفهای، مدل سلیقه و خلاقیت بیشتری به خرج میدهد و رابطهای کاربری، اسلایدها و اسناد باکیفیتتری تولید میکند. اگرچه از نظر گستردگی قابلیتها نسبت به قدرتمندترین مدل آنتروپیک، یعنی Claude Mythos Preview، در سطح پایینتری قرار دارد، اما در طیف وسیعی از بنچمارکها نتایج بهتری نسبت به Opus 4.6 از خود نشان میدهد.

امنیت سایبری
آنتروپیک چندی پیش «پروژه Glasswing» را معرفی کردیم که بر خطرات و همچنین مزایای مدلهای هوش مصنوعی برای امنیت سایبری تأکید داشت. آنتروپیک اعلام کردیم که عرضه Claude Mythos Preview را محدود نگه خواهد داشت و تدابیر امنیتی سایبری جدید را ابتدا روی مدلهایی با توانمندی کمتر آزمایش خواهد کرد. Opus 4.7 نخستین مدل ازایندست است؛ اما تواناییهای سایبری آن بهاندازه Mythos Preview پیشرفته نیست. در واقع، در طول فرایند آموزش آن، آزمایشهایی را برای کاهش افتراقی (differentially reduce) این قابلیتها انجام شده است. Opus 4.7 با تدابیر امنیتی خاصی عرضه میشود که به طور خودکار درخواستهای حاوی سوءاستفادههای سایبری ممنوعه یا پرخطر را شناسایی و مسدود میکنند.
در هوشیو بخوانید:
هشدارهای داریو آمودی را نباید نادیده گرفت
Mythos، مدل هوش مصنوعی جدید Anthropic چقدر میتواند خطرناک باشد؟
آزمایش Claude Opus 4.7
در ادامه برخی از نکات برجسته و یادداشتهای حاصل از آزمایشهای اولیه ما روی Opus 4.7 آورده شده است:
پیروی از دستورالعملها (Instruction following)
مدل Opus 4.7 در پیروی از دستورالعملها به طرز چشمگیری بهتر عمل میکند. جالب اینجاست که این بدان معناست که پرامپتهای نوشته شده برای مدلهای قبلی، اکنون ممکن است نتایج غیرمنتظرهای به همراه داشته باشند. در شرایطی که مدلهای قبلی دستورالعملها را با اغماض تفسیر میکردند یا بخشهایی را به طور کامل نادیده میگرفتند، Opus 4.7 دستورالعملها را بهصورت کلمهبهکلمه (تحتاللفظی) اجرا میکند. کاربران باید پرامپتها و ابزارهای تنظیمگرانه خود را برایناساس بازتنظیم نمایند.
پردازش چندوجهی (Multimodal) بهبودیافته
مدل Opus 4.7 دارای درک بصری بهتری برای تصاویر با وضوح بالا است؛ این مدل میتواند تصاویری تا ابعاد ۲,۵۷۶ پیکسل در ضلع طولانیتر (حدود ۳.۷۵ مگاپیکسل) را دریافت کند که بیش از سه برابر قویتر از مدلهای قبلی Claude است. این امر، گستره وسیعی از کاربردهای چندوجهی که به جزئیات دقیق بصری وابستهاند را فراهم میآورد؛ مانند عاملهای استفادهکننده از کامپیوتر (computer-use agents) که اسکرینشاتهای متراکم را میخوانند، استخراج دادهها از نمودارهای پیچیده، و کارهایی که به ارجاعات دقیق در سطح پیکسل (pixel-perfect) نیاز دارند.
اقدام در دنیای واقعی.
علاوه بر کسب امتیازهای عالی در ارزیابی عاملهای مالی، آزمایشهای داخلی آنتروپیک نشان داد که Opus 4.7 یک تحلیلگر مالی بسیار کارآمدتر از Opus 4.6 است که تحلیلها و مدلهای دقیقتر، ارائههای حرفهایتر و یکپارچگی منسجمتری را در میان وظایف مختلف ایجاد میکند. Opus 4.7 همچنین در ارزیابی GDPval-AA که یک ارزیابی شخص ثالث (third-party) برای امور دانشمحور دارای ارزش اقتصادی در حوزههای مالی، حقوقی و سایر زمینههاست، عملکردی در سطح پیشرفته دارد.

حافظه
مدل Opus 4.7 در استفاده از حافظه مبتنی بر سیستم فایل (file system-based memory) بهتر عمل میکند. این مدل یادداشتهای مهم را در طول کارهای طولانی و چندجلسهای (multi-session) به خاطر میسپارد و از آنها برای پرداختن به وظایف جدیدی استفاده میکند که در نتیجه، به زمینه (context) اولیه کمتری نیاز خواهند داشت.
ایمنی و همراستایی (Safety and alignment)
بهطورکلی، Opus 4.7 مشخصات ایمنی مشابهی با Opus 4.6 دارد. ارزیابیها حاکی از نرخ پایین رفتارهای نگرانکننده مانند فریبکاری، چاپلوسی (sycophancy) و همکاری در سوءاستفاده است. در برخی معیارها، مانند صداقت و مقاومت در برابر حملات مخرب «تزریق پرامپت» (prompt injection)، Opus 4.7 یک پیشرفت نسبت به Opus 4.6 محسوب میشود و در موارد دیگر مانند تمایل به ارائه توصیههای بیش از حد دقیق برای کاهش آسیب در خصوص موارد تحت کنترل، Opus 4.7 اندکی ضعیفتر عمل میکند. ارزیابی همراستایی (alignment assessment) آنتروپیک نیز به این نتیجه رسید که این مدل «تا حد زیادی بهخوبی همراستا شده و قابلاعتماد است، اگرچه در رفتار خود بهصورت کامل ایدهآل نیست». توجه داشته باشید که طبق ارزیابیهای آنتروپیک، Mythos Preview همچنان همراستاترین مدلی است که تاکنون آموزش داده است.

در این ارزیابی، Opus 4.7 یک بهبود نسبی در مقایسه با Opus 4.6 و Sonnet 4.6 نشان میدهد، اما Mythos Preview همچنان پایینترین نرخ رفتارهای غیرهمراستا را به ثبت رسانده است.
نمودارهای زیر نیز نتایج ارزیابی برخی آزمایشها و بنچمارکها را نشان میدهند:





بهروزرسانیهای جدید
علاوه بر خود Claude Opus 4.7، ما بهروزرسانیهای زیر را نیز راهاندازی میکنیم:
کنترل تلاش (effort) بیشتر
مدل Opus 4.7 یک سطح تلاش جدید به نام xhigh را بین سطوح high و max معرفی میکند که به کاربران کنترل دقیقتری بر موازنه بین استدلال و تأخیر در مسائل دشوار ارائه میدهد. در Claude Code نیز سطح تلاش پیشفرض برای تمامی طرحها اشتراکی به xhigh افزایش داده شده است.
پلتفرم Claude (API)
علاوه بر پشتیبانی از تصاویر با وضوح بالاتر، بودجهبندی وظایف (task budgets) نیز در فاز بتای عمومی راهاندازی شده است که به توسعهدهندگان ابزاری برای هدایت هزینه توکنهای Claude ارائه میدهد تا مدل بتواند کارها را در علمیاتهای طولانیتر اولویتبندی کند.
Claude Code
دستور اسلش (slash command) جدید ultrareview یک جلسه بازبینی اختصاصی ایجاد میکند که تغییرات را بررسی کرده و باگها و مشکلات طراحی را که یک بازبین دقیق متوجه آنها میشد، نشانهگذاری میکند. به کاربران نسخههای Pro و Max در Claude Code سه عدد ultrareview رایگان برای آزمایش این قابلیت ارائه شده است. علاوه بر این، حالت خودکار (auto mode) نیز برای کاربران Max گسترش داده شده است. حالت خودکار یک گزینه مجوز (permissions) جدید است که در آن Claude از جانب کاربر تصمیمگیری میکند؛ این بدان معناست که میتوان وظایف طولانیتر را با وقفههای کمتری اجرا کرد و این فرایند نسبت به زمانی که کاربر تصمیم به نادیدهگرفتن تمامی مجوزها میگرفت، ریسک کمتری به همراه دارد.
مهاجرت از Opus 4.6 به Opus 4.7
مدل Opus 4.7 یک ارتقا مستقیم برای Opus 4.6 محسوب میشود، اما دو تغییر وجود دارد که برنامهریزی برای آنها حائز اهمیت است، زیرا بر میزان مصرف توکن تأثیر میگذارند. قیمتگذاری مشابه Opus 4.6 باقی میماند: ۵ دلار بهازای هر میلیون توکن ورودی و ۲۵ دلار بهازای هر میلیون توکن خروجی.
نخست، Opus 4.7 از یک توکنایز بهروزرسانیشده استفاده میکند که نحوه پردازش متن توسط مدل را بهبود میبخشد. تفاوت عمده این تغییر این است که یک ورودی یکسان میتواند به توکنهای بیشتری نگاشت شود؛ تقریباً ۱ تا ۱.۳۵ برابر بسته به نوع محتوا.
دوم، Opus 4.7 در سطوح تلاش بالاتر، تفکر بیشتری انجام میدهد که این امر در تنظیمات عاملمحور برای اقدامات پیاپی از اهمیت بالایی برخوردار است. این امر قابلیت اطمینان مدل را در مسائل دشوار ارتقا میبخشد، اما به این معناست که توکنهای خروجی بیشتری تولید میکند.
کاربران میتوانند مصرف توکن را به روشهای مختلفی کنترل کنند. استفاده از پارامتر سطح تلاش (effort parameter)، تنظیم بودجه وظایف یا پرامپت دادن به مدل برای خلاصهتر بودن از جلمه این اقدامات برای کنترل سطح مصرف توکن است. در آزمایشهای داخلی آنتروپیک نیز تأثیر خالص (net effect)، مطلوب ارزیابی شده است؛ همانطور که در تصویر زیر نشان داده شده است، مصرف توکن در تمام سطوح تلاش در یک ارزیابی برنامهنویسی داخلی آنتروپیک بهبود یافته است؛ اما آنتروپیک توصیه میکند این تفاوت را بر روی ترافیک واقعی اندازهگیری شود.

در این ارزیابی، مدل بهصورت مستقل از طریق یک پرامپت منفرد از سوی کاربر کار میکند و نتایج ممکن است نمایانگر دقیق مصرف توکن در برنامهنویسی تعاملی نباشند. برای اطلاعات بیشتر در خصوص تنظیم سطوح تلاش، به راهنمای مهاجرت مراجعه نمایید.
دسترسی
مدل Opus 4.7 در تمامی محصولات Claude و همچنین در API ما، پلتفرمهای Amazon Bedrock، سرویس Vertex AI متعلق به Google Cloud و Microsoft Foundry در دسترس است.