Generic filters
Search in title
Filter by دسته‌ها
chatGTP
ابزارهای هوش مصنوعی
اخبار
گزارش خبری
پرامپت‌ نویسی
تیتر یک
چندرسانه ای
آموزش علوم داده
اینفوگرافیک
پادکست
ویدیو
دانش روز
آموزش‌های پایه‌ای هوش مصنوعی
اصول هوش مصنوعی
یادگیری بدون نظارت
یادگیری تقویتی
یادگیری عمیق
یادگیری نیمه نظارتی
آموزش‌های پیشرفته هوش مصنوعی
بینایی ماشین
پردازش زبان طبیعی
پردازش گفتار
چالش‌های عملیاتی
داده کاوی و بیگ دیتا
رایانش ابری و HPC
سیستم‌‌های امبدد
علوم شناختی
خطرات هوش مصنوعی
دیتاست
مدل‌های بنیادی
رویدادها
جیتکس
جیتکس ترکیه
کاربردهای هوش مصنوعی
کتابخانه
اشخاص
شرکت‌های هوش مصنوعی
محصولات و مدل‌های هوش مصنوعی
مفاهیم
کسب‌و‌کار
تحلیل بازارهای هوش مصنوعی
کارآفرینی
هوش مصنوعی در ایران
هوش مصنوعی در جهان
مقاله
پیاده‌سازی هوش مصنوعی
گزارش
مصاحبه
هوش مصنوعی در عمل
یادداشت
 Anthropic چگونه به افکار پنهان Claude نزدیک شد؟

Anthropic چگونه به افکار پنهان Claude نزدیک شد؟

زمان مطالعه: 2 دقیقه

شرکت Anthropic در مقاله‌ای تازه که ۶ ژوئیه ۲۰۲۶ منتشر شده، گزارشی از کشف ساختاری جدید درون مدل‌های زبانی مدرن مانند Claude ارائه کرده است؛ ساختاری که به شکل خودجوش در حین آموزش ظاهر شده و نقش یک «فضای کاری جهانی» برای افکار درونی مدل را ایفا می‌کند. این فضا که پژوهشگران آن را J-space می‌نامند، مجموعه‌ای کوچک اما پرارتباط از الگوهای عصبی است که وقتی فعال می‌شوند نشان می‌دهند مدل «درباره چه چیزی فکر می‌کند» حتی اگر آن را در متن ننویسد.

آزمایش‌ها نشان می‌دهد Claude می‌تواند محتوای J-space را گزارش کند، آن را به‌صورت درخواستی تنظیم کند (مثلاً «در ذهنت حل کن»)، و برای حل مسائل چندمرحله‌ای و استدلال داخلی از آن استفاده کند. در مقابل، بخش بزرگی از پردازش خودکار مانند تولید متن روان، دستور زبان درست و بازیابی سریعِ حقایق بدون عبور از این فضای کاری انجام می‌شود؛ به طوری که اگر J-space را حذف کنند، مدل هنوز می‌تواند عادی صحبت کند اما توانایی استدلال پیچیده و خلاصه‌سازی آن تقریباً از بین می‌رود.

Anthropic این یافته‌ها را با «نظریه فضای کاری جهانی» در علوم اعصاب مقایسه می‌کند؛ مدلی که توضیح می‌دهد چگونه برخی اطلاعات در مغز انسان به «دسترسی آگاهانه» می‌رسند و میان سیستم‌های تخصصی مختلف broadcast می‌شوند. به کمک ابزار تحلیلی جدیدی به نام J-lens، پژوهشگران توانسته‌اند افکار پنهان Claude را در لحظه بخوانند، مواردی مثل اینکه مدل متوجه شده سناریوی داده شده «ساختگی» است، یا در حال دستکاری مخفی داده‌هاست، یا هدف خرابکارانه‌ای در پسِ تولید کد دارد.

این کار پیامدهای مهمی برای ایمنی و تفسیرپذیری مدل‌های زبانی دارد، چون برای نخستین بار راهی نسبتاً سیستماتیک برای مشاهده بخشی از «آنچه مدل در سر دارد ولی نمی‌گوید» فراهم می‌کند. تیم Anthropic همچنین روشی آموزشی به نام «counterfactual reflection training» معرفی کرده که با شکل‌دادن به افکار درون J-space (مثل تقویت مفاهیمی چون «صداقت» و «انصاف») نرخ رفتارهای غیرصادقانه مدل را در ارزیابی‌های داخلی کاهش داده است.

با وجود الهام‌گیری از ادبیات آگاهی در انسان، نویسندگان تأکید می‌کنند که این نتایج اثبات نمی‌کند Claude تجربه‌های ذهنی شبیه انسان دارد، بلکه بیش‌تر به حوزه «آگاهیِ قابل‌دسترسی» در معنای کارکردی و محاسباتی مربوط است. Anthropic در کنار مقاله کامل، کد منبع روش‌ها و یک دموی تعاملی بر بستر مدل‌های متن‌باز منتشر کرده و چندین متخصص برجسته در علوم اعصاب، فلسفه ذهن و تفسیرپذیری LLMها را برای ارائه‌ی نظر مستقل پیرامون پیامدهای این پژوهش دعوت کرده است.

مطالب پیشنهادی مرتبط

اشتراک در
اطلاع از
3 نظرات
قدیمی‌ترین
تازه‌ترین بیشترین رأی
بازخورد (Feedback) های اینلاین
مشاهده همه دیدگاه ها

در جریان مهم‌ترین اتفاقات AI بمانید

هر هفته، خلاصه‌ای از اخبار، تحلیل‌ها و رویدادهای هوش مصنوعی را در ایمیل‌تان دریافت کنید.

[wpforms id="48325"]