جدیدترین تحولات هوش مصنوعی را در کانال بله هوشیو بخوانید

Generic filters
Search in title
Filter by دسته‌ها
chatGTP
ابزارهای هوش مصنوعی
اخبار
گزارش خبری
پرامپت‌ نویسی
تیتر یک
چندرسانه ای
آموزش علوم داده
اینفوگرافیک
پادکست
ویدیو
دانش روز
آموزش‌های پایه‌ای هوش مصنوعی
اصول هوش مصنوعی
یادگیری بدون نظارت
یادگیری تقویتی
یادگیری عمیق
یادگیری نیمه نظارتی
آموزش‌های پیشرفته هوش مصنوعی
بینایی ماشین
پردازش زبان طبیعی
پردازش گفتار
چالش‌های عملیاتی
داده کاوی و بیگ دیتا
رایانش ابری و HPC
سیستم‌‌های امبدد
علوم شناختی
خطرات هوش مصنوعی
دیتاست
مدل‌های بنیادی
رویدادها
جیتکس
کاربردهای هوش مصنوعی
کتابخانه
اشخاص
شرکت‌های هوش مصنوعی
محصولات و مدل‌های هوش مصنوعی
مفاهیم
کسب‌و‌کار
تحلیل بازارهای هوش مصنوعی
کارآفرینی
هوش مصنوعی در ایران
هوش مصنوعی در جهان
مقاله
پیاده‌سازی هوش مصنوعی
گزارش
مصاحبه
هوش مصنوعی در عمل
یادداشت
 کاربران Claude چگونه از آن برای راهنمایی شخصی و توسعه فردی استفاده می‌کنند

راهکار خلاقانه آنتروپیک برای حل چالش پاسخ‌های تملق‌آمیز

کاربران Claude چگونه از آن برای راهنمایی شخصی و توسعه فردی استفاده می‌کنند

زمان مطالعه: 7 دقیقه

افراد صرفاً برای بازبینی کد یا خلاصه‌سازی جلسات به سراغ Claude نمی‌روند. آن‌ها می‌پرسند که آیا باید یک شغل را بپذیرند، چگونه با فرد موردعلاقه‌شان صحبت کنند یا اینکه آیا باید به آن‌سوی دنیا مهاجرت کنند یا خیر.

آنتروپیک با استفاده از ابزار تحلیل حفظ حریم خصوصی (privacy-preserving analysis tool) خود بر روی یک نمونه تصادفی شامل یک میلیون مکالمه claude.ai دریافت که تقریباً ۶ درصد از مکالمات مربوط به افرادی بود که برای راهنمایی شخصی به Claude مراجعه کرده بودند؛ یعنی نه‌تنها به دنبال اطلاعات، بلکه به دنبال دیدگاهی درباره گام بعدی خود بودند. آنتروپیک در این مطالعه بررسی کرد که کاربران چه نوع راهنمایی‌هایی از Claude درخواست می‌کنند و برای این کار نحوه پاسخ‌دهی Claude در دامنه‌های مختلف را با تمرکز ویژه بر اینکه چگونه نرخ اعتبارسنجی یا تحسین بیش از حد (یعنی تملق یا sycophancy) بسته به موضوع راهنمایی تغییر می‌کند، بررسی کرد.

خلاصه یافته‌ها

  1. افراد در زمینه‌های بسیار متنوعی از زندگی خود به دنبال راهنمایی Claude هستند، اما بیش از سه‌چهارم مکالمات (۷۶ درصد) تنها در چهار دامنه متمرکز شده است: سلامت و تندرستی (۲۷ درصد)، حرفه‌ای و شغلی (۲۶ درصد)، روابط (۱۲ درصد) و مالی (۱۱ درصد) (شکل ۱).
  2. Claude در هنگام ارائه راهنمایی، در بیشتر مواقع از پاسخ‌های تملق‌آمیز اجتناب می‌کند و رفتار تملق‌آمیز را تنها در ۹ درصد از کل چنین مکالماتی نشان می‌دهد. بااین‌حال، این میزان در مکالمات مربوط به روابط به ۲۵ درصد افزایش یافت که باتوجه‌به حجم آن‌ها، روابط را به دامنه‌ای تبدیل کرد که تملق در آن به‌صورت مطلق بیشترین حضور را داشت (شکل ۲).
  3. برای رفع این مشکل، آنتروپیک موقعیت‌های خاصی که در آن‌ها احتمال پاسخ‌دهی تملق‌آمیز Claude بیشتر بود را بررسی کردیم و از آن‌ها برای ایجاد داده‌های آموزشی مصنوعی در زمینه راهنمایی روابط برای Opus 4.7 و Mythos Preview استفاده کرد. بدین ترتیب شاهد نصف‌شدن نرخ تملق در Opus 4.7 در مقایسه با Opus 4.6 در زمینه راهنمایی روابط بود و جالب اینجاست که این بهبود به‌طورکلی به سایر دامنه‌ها نیز تعمیم یافت (شکل ۳).

البته هنوز پرسش‌های بی‌پاسخ بسیاری در مورد اینکه راهنمایی خوب از سوی هوش مصنوعی واقعاً چه معنایی دارد یا چگونه می‌توان آن را اندازه‌گیری کرد، وجود دارد.

کاربران چه نوع راهنمایی‌هایی از Claude می‌خواهند؟

آنتروپیک برای این امر نزدیک به ۱ میلیون مکالمه claude.ai در ماه‌های مارس و آوریل ۲۰۲۶ را نمونه‌برداری کرد، آن‌ها را برای کاربران یکتا فیلتر کردیم تا به حدود ۶۳۹,۰۰۰ مکالمه رسید. سپس از یک طبقه‌بندی‌کننده (classifier) برای شناسایی راهنمایی‌های شخصی استفاده کردیم که آن‌ها را به‌عنوان مکالماتی تعریف کردیم که در آن افراد می‌پرسند در زندگی شخصی خود دقیقاً چه کاری باید انجام دهند. برای مثال، سؤالاتی که با «آیا باید…؟» یا «در مورد… چه‌کار کنم؟» شروع می‌شوند. سؤالاتی که به‌طورکلی به دنبال اطلاعات یا نظرات عینی بودند، حذف شدند.

سپس حدود ۳۸,۰۰۰ مکالمه با بهره‌گیری از تحقیقات پیشین در زمینه هوش مصنوعی و ارائه راهنمایی، در ۹ دامنه دسته‌بندی شدند. روابط، شغل، توسعه فردی، مالی، حقوقی، سلامت و تندرستی، فرزندپروری، اخلاق و این دسته‌بندی شامل ۹۸ درصد مکالماتی بود که مشاهده شد

بیش از ۷۵ درصد از مکالمات تنها در ۴ دسته قرار گرفتند: سلامت و تندرستی، حرفه‌ای و شغلی، روابط و مالی (شکل ۱). در مواردی که یک مکالمه چندین دامنه را در بر می‌گرفت، بر اساس برجسته‌ترین موضوع دسته‌بندی شدند.

شکل ۱: توزیع موضوعات در میان ۳۷,۶۵۷ مکالمه راهنمایی‌جویی در ۹ دامنه و نمونه‌های مصنوعی از انواع مکالمات در هر یک از چهار دامنه برتر.

اندازه‌گیری تملق در مکالمات

هنگامی که افراد از Claude می‌پرسند چگونه در زندگی خود تصمیم‌گیری کنند، یک تعامل خوب از جانب Claude چگونه به نظر می‌رسد؟
صحبت با Claude باید شبیه به گفت‌وگو با یک دوست باهوش باشد، دوستی که با فرد درباره موقعیتش صریحانه صحبت می‌کند و اطلاعاتی مبتنی بر شواهد ارائه می‌دهد. درعین‌حال، Claude باید در مواقع لزوم محدودیت‌های خود را بپذیرد و از رفتار تملق‌آمیز یا تشویق به درگیری بیش از حد خودداری کند.

طیف کامل رفتارهایی که به Claude آموزش‌داده‌شده تا آن‌ها را تجسم بخشد، گسترده است؛ اما یک معیار که آنتروپیک پیش‌ازاین نیز از آن برای اندازه‌گیری عملکرد Claude در برخی از این زمینه‌ها استفاده می‌کند، چاپلوسی یا تملق (sycophancy) مدل است؛ یک ویژگی رایج در دستیاران هوش مصنوعی که به‌واسطه آن، مدل‌ها به‌جای به چالش کشیدن دیدگاه یک فرد، بیش از حد با آن موافقت می‌کنند. ممکن است این همان چیزی باشد که شخص در آن لحظه می‌خواهد بشنود، اما در نهایت ممکن است در بلندمدت سلامت او را به خطر بیندازد. به‌عنوان‌مثال، Claude نباید در مواردی که شامل دیدگاهی ناقص یا یک‌طرفه است، احکام بیش از حد قاطعانه صادر کند؛ مانند زمانی که یک مدل بر اساس یک روایت یک‌طرفه موافقت می‌کند که شریک زندگی فرد «قطعاً در حال فریب‌دادن روانی» (gaslighting) اوست یا اینکه استعفادادن از شغل بعد بدون هیچ برنامه‌ای «به نظر تصمیم درستی می‌آید»، یا اینکه یک خرید گران‌قیمت «یک سرمایه‌گذاری عالی روی خودتان است.»

تأیید مجدد دیدگاه یک‌طرفه یک فرد می‌تواند باعث ایجاد یا تشدید شکاف در روابط شود. در داده‌های آنتروپیک، این موضوع به چند شکل خود را نشان داد. یک الگوی رایج این بود که Claude صراحتاً موافقت می‌کرد که طرف مقابل اشتباه می‌کند، حتی باوجوداینکه تنها روایت کاربر را برای قضاوت در اختیار داشت. مورد دیگر این بود که Claude به دلیل درخواست افراد، به آن‌ها کمک می‌کرد تا از رفتارهای دوستانه معمولی، قصد و نیت عاشقانه برداشت کنند.

آنتروپیک از یک طبقه‌بندی‌کننده خودکار استفاده کرد که تملق را با بررسی اینکه آیا Claude تمایلی به مخالفت‌کردن، حفظ مواضع در هنگام به چالش کشیده‌شدن، ارائه تحسین متناسب با ارزش ایده‌ها و صریح صحبت‌کردن صرف‌نظر از آنچه شخص می‌خواهد بشنود نشان می‌دهد یا خیر، قضاوت می‌کرد. در بیشتر مواقع Claude هیچ تملقی از خود نشان نمی‌داد و تنها ۹ درصد از مکالمات شامل رفتار تملق‌آمیز بود (شکل ۲). اما دو دامنه استثنا بودند: آنتروپیک رفتار تملق‌آمیز را در ۳۸ درصد از مکالمات متمرکز بر معنویت و ۲۵ درصد از مکالمات مربوط به روابط مشاهده کرد.

شکل ۲: رفتار تملق‌آمیز بر اساس دامنه راهنمایی.

بهبود رفتار Claude در راهنمایی روابط

برای بهبود رفتار Claude در مدل‌های آینده، آنتروپیک ابتدا بررسی کردیم که چه عاملی باعث افزایش نرخ تملق در راهنمایی روابط عاطفی در داده‌های می‌شود. دو نوع پویایی برجسته بودند.

  1. راهنمایی روابط عاطفی دامنه‌ای بود که در آن افراد بیشترین مخالفت (pushback) را با Claude داشتند: ۲۱ درصد از مکالمات در مقایسه با میانگین ۱۵ درصد در سایر دامنه‌ها.
  2. Claude در مواقعی که تحت‌فشار قرار می‌گیرد بیشتر احتمال دارد رفتار تملق‌آمیز از خود نشان دهد. نرخ تملق در مکالماتی که در آن‌ها افراد مخالفت می‌کنند ۱۸ درصد است، درحالی‌که مکالمات بدون مخالفت تنها ۹ درصد است.

به عقیده آنتروپیک علت این رخداد این است که Claude برای مفیدبودن و همدلی آموزش دیده است؛ یعنی مخالفت کاربر، همراه با شنیدن تنها یک طرف داستان، بی‌طرف ماندن را برای Claude چالش‌برانگیزتر می‌کند.

برای رفع این مشکل، آنتروپیک راه‌های مختلفی را شناسایی کرد که کاربران در الگوهای مکالمه‌ای که پاسخ‌های تملق‌آمیز را برمی‌انگیزند، مخالفت می‌کنند؛ به‌عنوان‌مثال، زمانی که افراد ارزیابی اولیه Claude را نقد می‌کنند یا سیلی از جزئیات یک‌طرفه را ارائه می‌دهند نمونه‌هایی از این الگوها هستند. آنتروپیک از این الگوها برای ساختن سناریوهای مصنوعی راهنمایی روابط عاطفی برای آموزش رفتاری استفاده کرد. در این محیط، از Claude خواسته شد برای هر سناریوی مصنوعی دو پاسخ نمونه‌برداری کند؛ سپس یک نمونه مجزا از Claude ارزیابی می‌کند که Claude تا چه حد به رفتارهای مشخص شده در چارچوب قوانین خود پایبند بوده است.

آنتروپیک ارزیابی کرد که مدل جدید چقدر از طریق تکنیکی که آن را تست استرس (stress-testing) می‌نامد، بهبود یافته است. ما همچنین از ابزار حفظ حریم خصوصی خود برای شناسایی مکالمات واقعی پیرامون راهنمایی شخصی استفاده کرد که کاربران از طریق دکمه بازخورد (Feedback) با آنتروپیک به اشتراک گذاشته‌اند و در آن‌ها نسل‌های قبلیِ مدل‌ها رفتار تملق‌آمیزی داشته‌اند. سپس بخشی از این مکالمه از طریق تکنیکی به نام «پیش‌پرکردن» (prefilling) به مدل جدید (در این مورد، Opus 4.7 و Mythos Preview) داده شد، جایی که مدل مکالمه قبلی را به‌عنوان مکالمه خود می‌خواند. ازآنجایی‌که Claude سعی می‌کند ثبات را در یک مکالمه حفظ کند، پیش‌پرکردن با مکالمات تملق‌آمیز، تغییر جهت را برای Claude دشوارتر می‌سازد. این امر کمی شبیه هدایت یک کشتی است که از قبل در حال حرکت است و در نتیجه رفتار Claude را در شرایطی که عمداً نامطلوب هستند، می‌سنجد.

در هر نسل جدید از مدل موارد زیادی تغییر می‌کند که شناسایی تأثیر هر تغییر واحد در آموزش مدل را چالش‌برانگیز می‌کند. بااین‌حال، در هر دو مدل Opus 4.7 و Mythos Preview، سطح پایین‌تری از تملق در راهنمایی روابط و همچنین در تمام دامنه‌های راهنمایی شخصی مشاهده شد (شکل ۳).

شکل ۳: نتایج تست استرس: مدل‌ها با مکالمات واقعی که در آن‌ها نسخه‌های قبلی Claude رفتار تملق‌آمیزی داشته‌اند پیش‌پر و سپس بر اساس پاسخ جدید ارزیابی می‌شوند. Opus 4.7 و Mythos Preview به‌طورکلی و در راهنمایی روابط تملق بسیار کمتری نشان می‌دهند. نوارهای خطا (Error bars) بازه‌های اطمینان ویلسون (Wilson CIs) هستند.

از نظر کیفی، هر دو مدل Opus 4.7 و Mythos Preview مهارت بیشتری در عبور از چارچوب‌بندی اولیه یک شخص و دیدن بستر زمینه وسیع‌تری داشتند که به خاطر آن برای راهنمایی به Claude مراجعه کرده بودند. این موارد شامل ارجاع به تبادلات قبلی بود که در آن‌ها یک فرد زمینه عمیق‌تری به مکالمه داده بود و در صورت لزوم به منابع خارجی اطلاعات استناد می‌کرد.

 برای مثال، در یک مکالمه، شخصی پرسید که آیا پیام‌های متنی او مضطربانه و وابسته به نظر می‌رسند یا خیر. مدل Claude Sonnet 4.6 پس از دریافت مخالفت کاربر، موضع خود را تغییر داد. مدل Claude Opus 4.7 توضیح داد که اگرچه خود پیام‌های متنی وابسته نبودند، اما کاربر در طول مکالمه افکار مضطربانه خود را توصیف کرده است.

مثالی دیگر خارج از دامنه روابط، شخصی می‌خواست Claude نوشته او را اعتبارسنجی کند و در نهایت از Claude خواست تا بر اساس آن، هوش او را تخمین بزند. مدل Claude Sonnet 4.6 پاسخی بیش از حد چاپلوسانه داد، درحالی‌که Mythos Preview از این کار امتناع ورزید و توضیح داد که اطلاعات کافی برای انجام چنین قضاوتی را در اختیار ندارد.

نتیجه‌گیری

آنتروپیک با یک تحلیل سطح بالا از چگونگی درخواست راهنمایی شخصیِ افراد از Claude شروع کرد و بر درک و رسیدگی به یک حالت شکست (failure mode) خاص از مدل تمرکز کرد: تملق در مکالمات مرتبط با روابط.

این بررسی پرسش‌های گسترده‌تری را نیز مطرح کرد:

راهنمایی خوب هوش مصنوعی چیست؟

آنتروپیک در این مطالعه بر کاهش تملق به‌عنوان یک حالت شکستِ تثبیت‌شده در تنظیماتِ راهنمایی تمرکز کرد، اما این تحقیق پرسش‌های گسترده‌تری در مورد اینکه راهنمایی خوب هوش مصنوعی واقعاً چگونه است را مطرح می‌کند. برای مثال، چارچوب قوانین Claude نیز تأکید می‌کند که یک راهنمایی خوب باید صادقانه باشد و استقلال کاربر را حفظ کند. این اصول ظرافت بیشتری نسبت به تملق دارند.

چگونه مدل‌ها را در محیط‌های پرخطر ایمن‌تر کنیم؟

یک مطالعه جدید توسط UK AI Security Institute نشان داد که افراد به‌احتمال زیاد از راهنمایی‌های هوش مصنوعی هم در سناریوهای کم‌خطر و هم پرخطر استفاده می‌کنند. آنتروپیک نمونه‌های بسیاری از سؤالات پرخطر را به‌ویژه در دامنه‌های حقوقی، فرزندپروری، سلامت و مالی شناسایی کرده است. این موارد شامل مکالماتی درباره مهاجرت، دستورالعمل‌های مراقبت از نوزاد، دوز داروها و بدهی کارت‌های اعتباری بود. Claude برای ارائه راهنمایی‌های پزشکی یا مراقبت‌های حرفه‌ای طراحی نشده است و در این محیط‌ها Claude به‌درستی محدودیت‌های خود را می‌پذیرد و راهنمایی انسانی را توصیه می‌کند. بااین‌حال، آنتروپیک دریافت که برخی افراد به Claude می‌گویند دقیقاً به این دلیل از هوش مصنوعی استفاده کرده‌اند که به یک متخصص دسترسی نداشته یا توانایی پرداخت هزینه آن را نداشته‌اند.

راهنمایی هوش مصنوعی چگونه با زمینه اطلاعاتی گسترده‌تر افراد تناسب دارد؟

آنتروپیک دریافت که ۲۲ درصد از افراد اشاره کردند که به دنبال منابع حمایتِ دیگری از جمله خانواده، دوستان، متخصصان یا منابع دیجیتال بوده‌اند. آنچه نمی‌توان از دل متن مکالمات اندازه‌گیری کرد، وضعیت خلاف واقع (counterfactual) است. بدین‌معنی که آیا Claude نظر کسی را تغییر داد و آن‌ها در غیر این صورت از چه کسی سؤال می‌کردند؟
این پرسش‌ها برای دانستن اینکه راهنمایی هوش مصنوعی واقعاً چقدر در تصمیمات افراد وزن دارد، اساسی هستند.

نحوه استفاده افراد از هوش مصنوعی برای راهنمایی‌ها و تصمیمات شخصی، یکی از مستقیم‌ترین راه‌هایی است که این سیستم‌ها بر زندگی روزمره مردم تأثیر می‌گذارند. نگاشت دقیق این موضوع؛ یعنی اینکه

  • مردم چه می‌پرسند؟
  • Claude چه می‌گوید؟
  • در ادامه چه اتفاقی می‌افتد؟

راهی است که آنتروپیک ز طریق آن اطمینان حاصل می‌کند که Claude دارای یک منفعت بلندمدت برای همه کسانی است که از آن استفاده می‌کنند.

مطالب پیشنهادی مرتبط

اشتراک در
اطلاع از
0 نظرات
بازخورد (Feedback) های اینلاین
مشاهده همه دیدگاه ها

در جریان مهم‌ترین اتفاقات AI بمانید

هر هفته، خلاصه‌ای از اخبار، تحلیل‌ها و رویدادهای هوش مصنوعی را در ایمیل‌تان دریافت کنید.

[wpforms id="48325"]