Generic filters
Search in title
Filter by دسته‌ها
chatGTP
ابزارهای هوش مصنوعی
اخبار
گزارش خبری
پرامپت‌ نویسی
تیتر یک
چندرسانه ای
آموزش علوم داده
اینفوگرافیک
پادکست
ویدیو
دانش روز
آموزش‌های پایه‌ای هوش مصنوعی
اصول هوش مصنوعی
یادگیری بدون نظارت
یادگیری تقویتی
یادگیری عمیق
یادگیری نیمه نظارتی
آموزش‌های پیشرفته هوش مصنوعی
بینایی ماشین
پردازش زبان طبیعی
پردازش گفتار
چالش‌های عملیاتی
داده کاوی و بیگ دیتا
رایانش ابری و HPC
سیستم‌‌های امبدد
علوم شناختی
خطرات هوش مصنوعی
دیتاست
مدل‌های بنیادی
رویدادها
جیتکس
جیتکس ترکیه
کاربردهای هوش مصنوعی
کتابخانه
اشخاص
شرکت‌های هوش مصنوعی
محصولات و مدل‌های هوش مصنوعی
مفاهیم
کسب‌و‌کار
تحلیل بازارهای هوش مصنوعی
کارآفرینی
هوش مصنوعی در ایران
هوش مصنوعی در جهان
مقاله
پیاده‌سازی هوش مصنوعی
گزارش
مصاحبه
هوش مصنوعی در عمل
یادداشت
 تجربه تعامل یا جهان‌هایی که هوش مصنوعی می‌سازد

برای آن که سامانه‌های هوش مصنوعی مفیدتر شوند، باید محیط‌های پیرامون خود را بشناسند.

تجربه تعامل یا جهان‌هایی که هوش مصنوعی می‌سازد

زمان مطالعه: 5 دقیقه

مدل آزمایشی هوش مصنوعی Genie که گوگل در ژانویه ۲۰۲۶ معرفی کرد، دستاوردی فنی است که واقعاً حیرت‌انگیز به نظر می‌رسد.

کافی است یک پرامپت به ابزار Genie بدهید، مثلاً یک تصویر یا چند خط متن کوتاه تا برای شما جهانی تعاملی بسازد که بتوانید در آن کاوش کنید. اگر درخواست ساده‌ای تایپ کنید، خروجی یک شبیه‌سازی واقع‌گرایانه خواهد بود. اگر نقطه شروع، مثلاً یکی از نقاشی‌های «ژرژ سورا» باشد، می‌توانید در دل «یکشنبه در پارک» قدم بزنید؛ آن هم با همان سبک Pointillist دقیق و وفادار به اثر اصلی.

پروژه Genie

پروژه Genie ممکن است در نگاه اول شبیه یک بازی ویدئویی به نظر برسد، اما سازندگانش می‌گویند که اهمیت آن بسیار فراتر از این است. آن‌ها این سامانه را یک «مدل جهان» (World Model) می‌نامند؛ ابزاری بنیادی که به سیستم‌های هوش مصنوعی کمک می‌کند فضاهای فیزیکی پیچیده و پیش‌بینی‌ناپذیری را که قرار است در آن‌ها فعالیت کنند، درک کنند. به گفته گوگل، آینده‌ای که در آن ربات‌های انسان‌نما برای خرید مواد غذایی به فروشگاه می‌روند یا خودروهای خودران در جاده‌های روستایی حرکت می‌کنند، بدون چنین مدل‌هایی از جهان ممکن نخواهد بود.

تجربه تعامل یا جهان‌هایی که هوش مصنوعی می‌سازد

ایده «مدل جهان» به سال ۱۹۴۳ بازمی‌گردد؛ زمانی که «کنت کراک» روان‌شناس اسکاتلندی در کتابی پیشنهاد کرد که موجودات زنده در ذهن خود «مدلی کوچک از جهان» دارند تا پیش از انجام یک عمل در واقعیت، فرضیه‌هایشان را در آن آزمایش کنند. داشتن درکی حتی ابتدایی از نحوه کار جهان، پیش‌شرط برنامه‌ریزی برای تغییر آن است. بدون چنین مدلی، هر موجود زنده‌ای ناچار خواهد بود زندگی‌ای صرفاً واکنشی داشته باشد؛ یعنی دوری از درد، تلاش برای یافتن غذا و نه چندان بیشتر.

پیش از آنکه مدل‌های زبانی بزرگ توجه جهان را به خود معطوف کنند؛‌ تلاش برای دادن چنین قابلیتی به سامانه‌های هوش مصنوعی از دهه ۱۹۹۰ حوزه‌ای امیدوارکننده در پژوهش بود و اکنون این توجه دوباره به همان موضوع بازگشته است.

مولد ویدئو

امروزه سه رویکرد اصلی برای ساخت «مدل‌های جهان» دنبال می‌شود. نخستین نقطه شروع طبیعی، مولدهای ویدئویی مبتنی بر هوش مصنوعی هستند. تولید یک ویدئوی منسجم مستلزم شبیه‌سازی جهانی منسجم است؛ زیرا اگر قوانین واقعیت بین فریم‌ها تغییر کند، خروجی بی‌معنا خواهد شد. چنین مدل‌های ابتدایی می‌توانند جزئیاتی از جهان را که مستقیماً به آن‌ها داده نشده نیز استنتاج کنند. مثلاً اگر تصویری از یک هزارتو به آن‌ها بدهید، می‌توانند مسیر عبور از آن را ترسیم کنند؛ یا اگر عکس دستانی را ببینند که یک شیشه دربسته را نگه داشته‌اند، حرکات لازم برای باز کردن آن را به‌درستی مدل‌سازی می‌کنند.

پروژه Genie اوج این رویکرد به شمار می‌رود. کاربرد واقعی آن زمانی روشن می‌شود که تصور کنیم در کنار یک سامانه هوش مصنوعی دیگر مثلاً یک ربات فروشنده در فروشگاه قرار گیرد که در حال یادگیری نحوه کار در دنیای فیزیکی است. میلیاردها ساعت داده آموزشی که برای چنین کاری لازم است، در دنیای واقعی به‌مراتب سخت‌تر به دست می‌آید تا در یک محیط شبیه‌سازی‌شده و اگر این شبیه‌سازی‌ها به اندازه کافی دقیق باشند، سیستم می‌تواند با استفاده از همان داده‌ها خودش را آموزش دهد.

هوش فضایی

با این حال حتی واقع‌گرایانه‌ترین ویدئوها هم نمی‌توانند همه جزئیاتی را که یک انسان درک می‌کند ثبت کنند. مثلاً فریزر خرابِ پشت فروشگاه که باعث فاسد شدن ماهی تازه شده است در تصویر دیده نمی‌شود و البته بوی آن هم قابل‌ثبت نیست. حتی اشیایی که مستقیماً در میدان دید قرار ندارند نیز خارج از دسترس این مدل‌ها هستند. برای نمونه اگر محتویات یک راهروی فروشگاه تولید شود، راهروهای کناری تا زمانی که کاربر وارد آن‌ها نشود، اصلاً برای مدل وجود ندارند. همین موضوع شبیه‌سازی محیط‌های پیچیده یا حضور هم‌زمان چند کاربر در یک جهان را دشوار می‌کند.

به همین دلیل رویکرد دیگری تلاش می‌کند به جای شبیه‌سازی‌های دوبعدی، محیط‌های کامل سه‌بعدی بسازد. «فی‌فی لی» دانشمند علوم رایانه در دانشگاه استنفورد رویکردی را مطرح می‌کند که آن را «هوش فضایی» (Spatial Intelligence) می‌نامد. از نظر او، مدل‌های جهان باید سه ویژگی داشته باشند: تعاملی بودن، چندوجهی بودن (توانایی درک انواع ورودی‌ها) و سازگاری درونی. سیستم‌های مبتنی بر ویدئو دو شرط اول را دارند اما در مورد سوم دچار مشکل می‌شوند. برای مثال پروژه Genie حداکثر ۶۰ ثانیه اجرا می‌شود و پس از آن شبیه‌سازی‌هایش به‌تدریج از انسجام می‌افتند.

استارتاپ World Labs که توسط لی تأسیس شده، مدلی به نام Marble ساخته است که می‌تواند نسخه‌های دیجیتالی از جهان‌های سه‌بعدی ایجاد کند؛ جهان‌هایی که کامل و از نظر درونی سازگار هستند. در چنین محیطی چندین کاربر می‌توانند هم‌زمان حضور داشته باشند. علاوه بر این، فضاها هر بار که کاربر به اطراف نگاه می‌کند از نو ساخته نمی‌شوند؛ بلکه از همان ابتدا به طور کامل ساخته شده‌اند. World Labs این فناوری را به معماران پیشنهاد می‌کند تا بتوانند فضایی را تصور کرده و پیش از چاپ سه‌بعدی، آن را به‌صورت مجازی کاوش کنند.

پیش‌بینی مبتنی بر تعبیه مشترک

اما «یان لوکان» دانشمند ارشد پیشین هوش مصنوعی متا، معتقد است مدل‌های جهان می‌توانند به شکلی متفاوت و کمتر تحت‌اللفظی ساخته شوند. از دید او تمرکز بر فضاهای واقعی نوعی انحراف از مسئله اصلی است. بسیاری از سامانه‌های هوش مصنوعی باید در هزارتوهای مجازی مانند سیستم‌های منابع انسانی یا اسناد حقوقی حرکت کنند، نه فقط در فضاهای فیزیکی مانند فروشگاه‌ها. او باور دارد ایجاد توانایی مدل‌سازی سازگار با هر دو نوع محیط در هوش مصنوعی گامی مهم در پیشرفت و کاربردی‌سازی آن است. در این چارچوب، یک مدل زبانی بزرگ می‌تواند برای تعامل با این مدل جهان به کار گرفته شود تا در انجام وظایف چه در دنیای واقعی و چه در رایانه به سیستم کمک کند.

این رویکرد که معماری «پیش‌بینی مبتنی بر تعبیه مشترک» (Joint-Embed-ding Predictive Architecture) نام دارد به یک سامانه هوش مصنوعی اجازه می‌دهد ویژگی‌های پیچیده جهان واقعی را شبیه‌سازی کند. مدل‌های جهان کنونی عمدتاً بر آنچه در آستانه وقوع است تمرکز دارند، نه بر رویدادهایی که ممکن است در آینده دور رخ بدهند یا رخ ندهند. در مقابل، انسان‌ها دائماً آینده را پیش‌بینی می‌کنند؛ مثلاً پیش از خروج از خانه وضعیت هوا را می‌سنجند تا تصمیم بگیرند چتر بردارند یا نه. نکته مهم این است که چنین تصمیم‌هایی بدون تصورکردن تک‌تک ثانیه‌های روز گرفته می‌شوند و مدل‌های جهان فعلی چنین میان‌بری ندارند.

لوکان از سال ۲۰۲۲ در حال بررسی ظرفیت‌های سامانه JEPA است و در نوامبر ۲۰۲۵ شرکت متا را ترک کرد تا به‌طور تمام‌وقت روی این مسئله کار کند. استارتاپ او با نام Advanced Machine Intelligence قصد دارد این ایده‌ها را عملی کند و کار خود را با همکاری با استارتاپ سلامت دیجیتال Nabla آغاز کرده است. به گفته او هدفش ساخت سامانه‌ای است که با استفاده از مدل جهان خود بتواند تشخیص دهد «کدام توالی از اقدامات بهترین راه برای انجام کاری است که من به آن سپرده‌ام.»

راه‌های آینده

اما اگر همه این رویکردهای پیچیده در نهایت غیرضروری باشند چه؟ اگر سامانه‌های مولد کنونی از همین حالا بتوانند در دنیای واقعی کارهای مفیدی انجام دهند، شاید نوعی مدل جهان درونی از پیش در آن‌ها وجود داشته باشد. این دیدگاه «ایلیا سوتسکِور» یکی از بنیان‌گذاران OpenAI و بسیاری از همکاران سابق او در این آزمایشگاه است. او در سال ۲۰۲۳ گفت آموزش یک مدل زبانی بزرگ چیزی بیش از «یاد گرفتن یک مدل از جهان» نیست. فشرده‌سازی همه اطلاعات اینترنت در چندصد گیگابایت عدد فقط زمانی ممکن است که یک سیستم اصول بنیادین نهفته در آن اطلاعات را یاد بگیرد.

شواهدی وجود دارد که شاید این دیدگاه درست باشد. در سال ۲۰۲۳ نشان داده شد یک مدل زبانی که تنها بر فهرستی از حرکات بازی اتلو آموزش دیده بود، درون شبکه عصبی خود وضعیت صفحه بازی را بازنمایی کرده است؛ درحالی‌که هرگز صفحه بازی اتلو را ندیده و قوانین بازی نیز به آن آموزش داده نشده بود. این بازنمایی آن‌قدر دقیق بود که پژوهشگران توانستند بخش‌های مشخصی از شبکه عصبی را که رنگ مهره‌های خاص را ذخیره می‌کردند شناسایی کنند. در نتیجه توانستند با دستکاری‌های دقیق، برداشت مدل از بازی را تغییر دهند؛ این کاری سطحی بی‌سابقه از کنترل بر محاسبات یک مدل زبانی بود.

احتمالاً مدل‌های زبانی بزرگ‌تر مدل‌های جهان پیچیده‌تری در درون خود دارند؛ البته اگر پژوهشگران بتوانند آن‌ها را پیدا کنند. آزمایشگاه Anthropic در پژوهش درباره «تفسیرپذیری» مدل‌های Claude پیشگام بوده و خوشه‌هایی از نورون‌های مصنوعی را شناسایی کرده که به مفاهیمی از احساس گناه گرفته تا پل گلدن‌گیت مربوط می‌شوند. دستکاری این خوشه‌ها همانند مثال اتلو، رفتار بعدی مدل را نیز تغییر می‌دهد. این موضوع نشان می‌دهد این سامانه‌ها صرفاً کلمات را پشت سر هم نمی‌چینند؛ بلکه درکی نسبتاً منسجم از ویژگی‌های فیزیکی جهان دارند که برای پاسخ دادن به پرسش‌ها از آن استفاده می‌کنند. چیزی که به‌طرز مشکوکی شبیه همان مدل جهان درونی است.

البته همه با این نظر موافق نیستند. لی معتقد است مدل‌های زبانی بزرگ صرفاً «کلمه‌پردازانی در تاریکی» هستند. به گفته او توانایی استفاده از زبان برای توصیف جهان لزوماً به معنای درک واقعی و ریشه‌دار آن نیست. او این وضعیت را به دانشجویی تشبیه می‌کند که فقط درباره کشوری خارجی مطالعه کرده است؛ دانشی وجود دارد که صرفاً با خواندن کتاب‌ها به دست نمی‌آید. با این حال، هر کدام از این رویکردها که در نهایت موفق‌تر از آب درآید، یک چیز تقریباً قطعی است: هوش مصنوعی به‌زودی قدم به جهان واقعی خواهد گذاشت.

گزارش حاضر در نسخه February 28th 2026 نشریه The Economist منتشر شده است.

مطالب پیشنهادی مرتبط

اشتراک در
اطلاع از
0 نظرات
بازخورد (Feedback) های اینلاین
مشاهده همه دیدگاه ها

در جریان مهم‌ترین اتفاقات AI بمانید

هر هفته، خلاصه‌ای از اخبار، تحلیل‌ها و رویدادهای هوش مصنوعی را در ایمیل‌تان دریافت کنید.

[wpforms id="48325"]