جدیدترین تحولات هوش مصنوعی را در کانال بله هوشیو بخوانید

Generic filters
Search in title
Filter by دسته‌ها
chatGTP
ابزارهای هوش مصنوعی
اخبار
گزارش خبری
پرامپت‌ نویسی
تیتر یک
چندرسانه ای
آموزش علوم داده
اینفوگرافیک
پادکست
ویدیو
دانش روز
آموزش‌های پایه‌ای هوش مصنوعی
اصول هوش مصنوعی
یادگیری بدون نظارت
یادگیری تقویتی
یادگیری عمیق
یادگیری نیمه نظارتی
آموزش‌های پیشرفته هوش مصنوعی
بینایی ماشین
پردازش زبان طبیعی
پردازش گفتار
چالش‌های عملیاتی
داده کاوی و بیگ دیتا
رایانش ابری و HPC
سیستم‌‌های امبدد
علوم شناختی
خطرات هوش مصنوعی
دیتاست
مدل‌های بنیادی
رویدادها
جیتکس
کاربردهای هوش مصنوعی
کتابخانه
اشخاص
شرکت‌های هوش مصنوعی
محصولات و مدل‌های هوش مصنوعی
مفاهیم
کسب‌و‌کار
تحلیل بازارهای هوش مصنوعی
کارآفرینی
هوش مصنوعی در ایران
هوش مصنوعی در جهان
مقاله
پیاده‌سازی هوش مصنوعی
گزارش
مصاحبه
هوش مصنوعی در عمل
یادداشت
 آنتروپیک جدیدترین مدل خود به نام Claude Opus 4.7 را منتشر کرد

چشمگیر در مهندسی نرم‌افزار

آنتروپیک جدیدترین مدل خود به نام Claude Opus 4.7 را منتشر کرد

زمان مطالعه: 5 دقیقه

به نقل از بلاگ آنتروپیک، مدل Opus 4.7 یک بهبود چشمگیر نسبت به Opus 4.6 در حوزه مهندسی نرم‌افزار پیشرفته محسوب می‌شود که دستاوردهای ویژه‌ای در دشوارترین وظایف داشته است.

کاربران گزارش می‌دهند که با اطمینان خاطر می‌توانند سخت‌ترین کارهای برنامه‌نویسی خود، ازآن‌دست کارهایی که پیش‌تر نیازمند نظارت دقیق بود را به Opus 4.7 بسپارند. Opus 4.7 وظایف پیچیده و طولانی‌مدت را با دقت و انسجام مدیریت می‌کند، به دستورالعمل‌ها توجه دقیقی دارد و پیش از ارائه گزارش نهایی، راهکارهایی را برای راستی‌آزمایی خروجی‌های خود ابداع می‌کند.

بنچمارک‌ها

این مدل همچنین از قابلیت بینایی (Vision) به‌مراتب بهتری برخوردار است و می‌تواند تصاویر را با وضوح بالاتری پردازش کند. هنگام انجام وظایف حرفه‌ای، مدل سلیقه و خلاقیت بیشتری به خرج می‌دهد و رابط‌های کاربری، اسلایدها و اسناد باکیفیت‌تری تولید می‌کند. اگرچه از نظر گستردگی قابلیت‌ها نسبت به قدرتمندترین مدل آنتروپیک، یعنی Claude Mythos Preview، در سطح پایین‌تری قرار دارد، اما در طیف وسیعی از بنچمارک‌ها نتایج بهتری نسبت به Opus 4.6 از خود نشان می‌دهد.

مقایسه امتیازکسب‌شده در بنچمارک‌های مختلف

امنیت سایبری

آنتروپیک چندی پیش «پروژه Glasswing» را معرفی کردیم که بر خطرات و همچنین مزایای مدل‌های هوش مصنوعی برای امنیت سایبری تأکید داشت. آنتروپیک اعلام کردیم که عرضه Claude Mythos Preview را محدود نگه خواهد داشت و تدابیر امنیتی سایبری جدید را ابتدا روی مدل‌هایی با توانمندی کمتر آزمایش خواهد کرد. Opus 4.7 نخستین مدل ازاین‌دست است؛ اما توانایی‌های سایبری آن به‌اندازه Mythos Preview پیشرفته نیست. در واقع، در طول فرایند آموزش آن، آزمایش‌هایی را برای کاهش افتراقی (differentially reduce) این قابلیت‌ها انجام شده است. Opus 4.7 با تدابیر امنیتی خاصی عرضه می‌شود که به طور خودکار درخواست‌های حاوی سوءاستفاده‌های سایبری ممنوعه یا پرخطر را شناسایی و مسدود می‌کنند.

در هوشیو بخوانید:
هشدارهای داریو آمودی را نباید نادیده گرفت
Mythos، مدل هوش مصنوعی جدید Anthropic چقدر می‌تواند خطرناک باشد؟

آزمایش Claude Opus 4.7

در ادامه برخی از نکات برجسته و یادداشت‌های حاصل از آزمایش‌های اولیه ما روی Opus 4.7 آورده شده است:

پیروی از دستورالعمل‌ها (Instruction following)

مدل Opus 4.7 در پیروی از دستورالعمل‌ها به طرز چشمگیری بهتر عمل می‌کند. جالب اینجاست که این بدان معناست که پرامپت‌های نوشته شده برای مدل‌های قبلی، اکنون ممکن است نتایج غیرمنتظره‌ای به همراه داشته باشند. در شرایطی که مدل‌های قبلی دستورالعمل‌ها را با اغماض تفسیر می‌کردند یا بخش‌هایی را به طور کامل نادیده می‌گرفتند، Opus 4.7 دستورالعمل‌ها را به‌صورت کلمه‌به‌کلمه (تحت‌اللفظی) اجرا می‌کند. کاربران باید پرامپت‌ها و ابزارهای تنظیم‌گرانه خود را براین‌اساس بازتنظیم نمایند.

پردازش چندوجهی (Multimodal) بهبودیافته

مدل Opus 4.7 دارای درک بصری بهتری برای تصاویر با وضوح بالا است؛ این مدل می‌تواند تصاویری تا ابعاد ۲,۵۷۶ پیکسل در ضلع طولانی‌تر (حدود ۳.۷۵ مگاپیکسل) را دریافت کند که بیش از سه برابر قوی‌تر از مدل‌های قبلی Claude است. این امر، گستره وسیعی از کاربردهای چندوجهی که به جزئیات دقیق بصری وابسته‌اند را فراهم می‌آورد؛ مانند عامل‌های استفاده‌کننده از کامپیوتر (computer-use agents) که اسکرین‌شات‌های متراکم را می‌خوانند، استخراج داده‌ها از نمودارهای پیچیده، و کارهایی که به ارجاعات دقیق در سطح پیکسل (pixel-perfect) نیاز دارند.

اقدام در دنیای واقعی.

علاوه بر کسب امتیازهای عالی در ارزیابی عامل‌های مالی، آزمایش‌های داخلی آنتروپیک نشان داد که Opus 4.7 یک تحلیلگر مالی بسیار کارآمدتر از Opus 4.6 است که تحلیل‌ها و مدل‌های دقیق‌تر، ارائه‌های حرفه‌ای‌تر و یکپارچگی منسجم‌تری را در میان وظایف مختلف ایجاد می‌کند. Opus 4.7 همچنین در ارزیابی GDPval-AA که یک ارزیابی شخص ثالث (third-party) برای امور دانش‌محور دارای ارزش اقتصادی در حوزه‌های مالی، حقوقی و سایر زمینه‌هاست، عملکردی در سطح پیشرفته دارد.

ارزیابی شاخص GDPval-AA

حافظه

مدل Opus 4.7 در استفاده از حافظه مبتنی بر سیستم فایل (file system-based memory) بهتر عمل می‌کند. این مدل یادداشت‌های مهم را در طول کارهای طولانی و چندجلسه‌ای (multi-session) به خاطر می‌سپارد و از آن‌ها برای پرداختن به وظایف جدیدی استفاده می‌کند که در نتیجه، به زمینه (context) اولیه کمتری نیاز خواهند داشت.

ایمنی و هم‌راستایی (Safety and alignment)

به‌طورکلی، Opus 4.7 مشخصات ایمنی مشابهی با Opus 4.6 دارد. ارزیابی‌ها حاکی از نرخ پایین رفتارهای نگران‌کننده مانند فریب‌کاری، چاپلوسی (sycophancy) و همکاری در سوءاستفاده است. در برخی معیارها، مانند صداقت و مقاومت در برابر حملات مخرب «تزریق پرامپت» (prompt injection)، Opus 4.7 یک پیشرفت نسبت به Opus 4.6 محسوب می‌شود و در موارد دیگر مانند تمایل به ارائه توصیه‌های بیش از حد دقیق برای کاهش آسیب در خصوص موارد تحت کنترل، Opus 4.7 اندکی ضعیف‌تر عمل می‌کند. ارزیابی هم‌راستایی (alignment assessment) آنتروپیک نیز به این نتیجه رسید که این مدل «تا حد زیادی به‌خوبی هم‌راستا شده و قابل‌اعتماد است، اگرچه در رفتار خود به‌صورت کامل ایده‌آل نیست». توجه داشته باشید که طبق ارزیابی‌های آنتروپیک، Mythos Preview همچنان هم‌راستاترین مدلی است که تاکنون آموزش داده است.

امتیاز کلی رفتار غیرهم‌راستا (misaligned) از ممیزی رفتاری خودکار آنتروپیک.
در این ارزیابی، Opus 4.7 یک بهبود نسبی در مقایسه با Opus 4.6 و Sonnet 4.6 نشان می‌دهد، اما Mythos Preview همچنان پایین‌ترین نرخ رفتارهای غیرهم‌راستا را به ثبت رسانده است.

نمودارهای زیر نیز نتایج ارزیابی برخی آزمایش‌ها و بنچمارک‌ها را نشان می‌دهند:

به‌روزرسانی‌های جدید

علاوه بر خود Claude Opus 4.7، ما به‌روزرسانی‌های زیر را نیز راه‌اندازی می‌کنیم:

کنترل تلاش (effort) بیشتر

مدل Opus 4.7 یک سطح تلاش جدید به نام xhigh را بین سطوح high و max معرفی می‌کند که به کاربران کنترل دقیق‌تری بر موازنه بین استدلال و تأخیر در مسائل دشوار ارائه می‌دهد. در Claude Code نیز سطح تلاش پیش‌فرض برای تمامی طرح‌ها اشتراکی به xhigh افزایش داده شده است.

پلتفرم Claude (API)

علاوه بر پشتیبانی از تصاویر با وضوح بالاتر، بودجه‌بندی وظایف (task budgets) نیز در فاز بتای عمومی راه‌اندازی شده است که به توسعه‌دهندگان ابزاری برای هدایت هزینه توکن‌های Claude ارائه می‌دهد تا مدل بتواند کارها را در علمیات‌های طولانی‌تر اولویت‌بندی کند.

Claude Code

دستور اسلش (slash command) جدید ultrareview یک جلسه بازبینی اختصاصی ایجاد می‌کند که تغییرات را بررسی کرده و باگ‌ها و مشکلات طراحی را که یک بازبین دقیق متوجه آن‌ها می‌شد، نشانه‌گذاری می‌کند. به کاربران نسخه‌های Pro و Max در Claude Code سه عدد ultrareview رایگان برای آزمایش این قابلیت ارائه شده است. علاوه بر این، حالت خودکار (auto mode) نیز برای کاربران Max گسترش داده شده است. حالت خودکار یک گزینه مجوز (permissions) جدید است که در آن Claude از جانب کاربر تصمیم‌گیری می‌کند؛ این بدان معناست که می‌توان وظایف طولانی‌تر را با وقفه‌های کمتری اجرا کرد و این فرایند نسبت به زمانی که کاربر تصمیم به نادیده‌گرفتن تمامی مجوزها می‌گرفت، ریسک کمتری به همراه دارد.

مهاجرت از Opus 4.6 به Opus 4.7

مدل Opus 4.7 یک ارتقا مستقیم برای Opus 4.6 محسوب می‌شود، اما دو تغییر وجود دارد که برنامه‌ریزی برای آن‌ها حائز اهمیت است، زیرا بر میزان مصرف توکن تأثیر می‌گذارند. قیمت‌گذاری مشابه Opus 4.6 باقی می‌ماند: ۵ دلار به‌ازای هر میلیون توکن ورودی و ۲۵ دلار به‌ازای هر میلیون توکن خروجی.

نخست، Opus 4.7 از یک توکنایز به‌روزرسانی‌شده استفاده می‌کند که نحوه پردازش متن توسط مدل را بهبود می‌بخشد. تفاوت عمده این تغییر این است که یک ورودی یکسان می‌تواند به توکن‌های بیشتری نگاشت شود؛ تقریباً ۱ تا ۱.۳۵ برابر بسته به نوع محتوا.

دوم، Opus 4.7 در سطوح تلاش بالاتر، تفکر بیشتری انجام می‌دهد که این امر در تنظیمات عامل‌محور برای اقدامات پیاپی از اهمیت بالایی برخوردار است. این امر قابلیت اطمینان مدل را در مسائل دشوار ارتقا می‌بخشد، اما به این معناست که توکن‌های خروجی بیشتری تولید می‌کند.

آنتروپیک یک راهنمای مهاجرت تهیه کرده که توصیه‌های بیشتری درباره ارتقا از Opus 4.6 به Opus 4.7 ارائه می‌دهد.

کاربران می‌توانند مصرف توکن را به روش‌های مختلفی کنترل کنند. استفاده از پارامتر سطح تلاش (effort parameter)، تنظیم بودجه وظایف یا پرامپت دادن به مدل برای خلاصه‌تر بودن از جلمه این اقدامات برای کنترل سطح مصرف توکن است. در آزمایش‌های داخلی آنتروپیک نیز تأثیر خالص (net effect)، مطلوب ارزیابی شده است؛ همان‌طور که در تصویر زیر نشان داده شده است، مصرف توکن در تمام سطوح تلاش در یک ارزیابی برنامه‌نویسی داخلی آنتروپیک بهبود یافته است؛ اما آنتروپیک توصیه می‌کند این تفاوت را بر روی ترافیک واقعی اندازه‌گیری شود.

امتیاز در یک ارزیابی برنامه‌نویسی عامل‌محور داخلی به‌عنوان تابعی از مصرف توکن در هر سطح تلاش.
در این ارزیابی، مدل به‌صورت مستقل از طریق یک پرامپت منفرد از سوی کاربر کار می‌کند و نتایج ممکن است نمایانگر دقیق مصرف توکن در برنامه‌نویسی تعاملی نباشند. برای اطلاعات بیشتر در خصوص تنظیم سطوح تلاش، به راهنمای مهاجرت مراجعه نمایید.

دسترسی

مدل Opus 4.7 در تمامی محصولات Claude و همچنین در API ما، پلتفرم‌های Amazon Bedrock، سرویس Vertex AI متعلق به Google Cloud و Microsoft Foundry در دسترس است.

مطالب پیشنهادی مرتبط

اشتراک در
اطلاع از
0 نظرات
بازخورد (Feedback) های اینلاین
مشاهده همه دیدگاه ها

در جریان مهم‌ترین اتفاقات AI بمانید

هر هفته، خلاصه‌ای از اخبار، تحلیل‌ها و رویدادهای هوش مصنوعی را در ایمیل‌تان دریافت کنید.

[wpforms id="48325"]