جدیدترین تحولات هوش مصنوعی را در کانال بله هوشیو بخوانید

Generic filters
Search in title
Filter by دسته‌ها
chatGTP
ابزارهای هوش مصنوعی
اخبار
گزارش خبری
پرامپت‌ نویسی
تیتر یک
چندرسانه ای
آموزش علوم داده
اینفوگرافیک
پادکست
ویدیو
دانش روز
آموزش‌های پایه‌ای هوش مصنوعی
اصول هوش مصنوعی
یادگیری بدون نظارت
یادگیری تقویتی
یادگیری عمیق
یادگیری نیمه نظارتی
آموزش‌های پیشرفته هوش مصنوعی
بینایی ماشین
پردازش زبان طبیعی
پردازش گفتار
چالش‌های عملیاتی
داده کاوی و بیگ دیتا
رایانش ابری و HPC
سیستم‌‌های امبدد
علوم شناختی
خطرات هوش مصنوعی
دیتاست
مدل‌های بنیادی
رویدادها
جیتکس
کاربردهای هوش مصنوعی
کتابخانه
اشخاص
شرکت‌های هوش مصنوعی
محصولات و مدل‌های هوش مصنوعی
مفاهیم
کسب‌و‌کار
تحلیل بازارهای هوش مصنوعی
کارآفرینی
هوش مصنوعی در ایران
هوش مصنوعی در جهان
مقاله
پیاده‌سازی هوش مصنوعی
گزارش
مصاحبه
هوش مصنوعی در عمل
یادداشت
 متا با مدل Muse Image، تولد تصویر با هوش مصنوعی را به استوری اینستاگرام و چت واتس‌اپ می‌آورد

تولید تصویر در استوری اینستاگرام و چت واتس‌اپ

متا با مدل Muse Image، تولد تصویر با هوش مصنوعی را به استوری اینستاگرام و چت واتس‌اپ می‌آورد

زمان مطالعه: 4 دقیقه

متا از مدل مولد تصویر اختصاصی خود به نام Muse Image رونمایی کرد؛ نخستین مدل مولد تصویر این شرکت که توسط آزمایشگاه‌های ابرهوش متا (Meta Superintelligence Labs) توسعه یافته و اکنون در Meta AI در دسترس قرار گرفته است. Muse Image در نقش یک دستیار خلاق ظاهر می‌شود که زمینه کاربر را می‌شناسد و تبدیل ایده‌ها به تصاویر باکیفیت را آسان می‌کند.

این مدل همچنین زیربنای مجموعه‌ای از ابزارهای خلاقانه جدید در اپلیکیشن‌های متا است. کاربران می‌توانند از بیش از ۳۰ افکت جدید مبتنی بر هوش مصنوعی برای استوری‌های اینستاگرام استفاده کنند و همچنین در چت واتس‌اپ، با کمک Meta AI تصویر تولید کنند. این قابلیت در ابتدا در تعداد محدودی از کشورها عرضه می‌شود و به‌تدریج در کشورهای بیشتری در دسترس قرار خواهد گرفت.

واتس‌اپ و اینستاگرام

چه بخواهید از نقطه صفر شروع کنید و چه روی یک تصویر موجود کار کنید، کافی است خواسته خود را با زبانی ساده و محاوره‌ای توصیف کنید تا Meta AI به لطف Muse Image باقی مراحل را انجام دهد. این مدل همچنین متن را با کیفیت بالا و به‌صورت خوانا درون تصاویر رندر می‌کند. بنابراین می‌توانید از آن بخواهید یک راهنمای آموزشی یا یک اینفوگرافیک تخصصی درباره موضوعی مشخص تولید کند؛ در این صورت، متن نه‌تنها خوانا خواهد بود، بلکه از نظر سبک طراحی نیز با تصویر هماهنگ خواهد شد. همچنین Meta AI برای ساده‌سازی تجربه کاربری، پنلی از پیش‌تنظیم‌ها (Presets) شامل مجموعه‌ای از راهنماهای پیشنهادی را برای کمک به کاربران ارائه کرده است.

Muse Image صرفاً یک تصویر تولید نمی‌کند؛ بلکه ابتدا درباره درخواست فکر می‌کند. این مدل با کمک Muse Spark، در پشت‌صحنه چندین مرحله را طی می‌کند؛ از برنامه‌ریزی برای چیدمان تصویر گرفته تا جست‌وجوی اطلاعات به‌روز در وب و ترکیب هوشمندانه چندین مرجع تصویری به‌صورت هم‌زمان.

کاربران همچنین می‌توانند در اپلیکیشن Meta AI حساب‌های اینستاگرام را با استفاده از @ منشن کنند تا آن پروفایل‌ها مستقیماً در فرایند تولید تصویر وارد شود؛ کافی است نام کاربری موردنظر را منشن کنید تا Meta AI از تصاویر عمومی آن حساب برای ساخت تصویری آماده انتشار استفاده کند. درعین‌حال، کاربران کنترل کاملی بر این قابلیت دارند و می‌توانند از طریق یک تنظیم ساده، امکان استفاده از محتوای خود برای تولید تصاویر مبتنی بر هوش مصنوعی را در هر زمان غیرفعال کنند.

تولید عامل‌محور تصویر

برخلاف مدل‌هایی که مستقیماً پرامپت را به تصویر تبدیل می‌کنند، Muse Image به‌صورت یک عامل هوشمند عمل می‌کند. این مدل برای افزایش دقت، از ابزارهای جست‌وجو و کدنویسی استفاده می‌کند، خروجی‌های خود را به‌صورت خودکار بازبینی و اصلاح می‌کند و با افزایش توان محاسباتی در زمان استنتاج، عملکرد خود را بهبود می‌بخشد. همچنین، Muse Image با Muse Spark یکپارچه شده است؛ به‌گونه‌ای که این دو مدل می‌توانند ابزارهای مشترک را به کار بگیرند و به‌صورت هماهنگ برنامه‌ریزی کنند تا قابلیت‌های قدرتمندی در تولید عامل‌محور محتوای چندرسانه‌ای ارائه دهند.

استفاده از ابزارها

برای تقویت قابلیت‌های عامل‌محور Muse Image، دسترسی این مدل به مجموعه‌ای از ابزارها فراهم شده است.

کدنویسی در طول فرایند یادگیری تقویتی، Muse Image می‌آموزد کدی بنویسد و اجرا کند که نمودارها و کدهای QR دقیق تولید می‌کند و سپس با اتکا به این تصاویر رندرشده، دقت تصاویر نهایی خود را افزایش می‌دهد. افزون بر این، Muse Spark و Muse Image به‌گونه‌ای یکپارچه شده‌اند که با ترکیب قابلیت‌های کدنویسی و تولید مدیا، می‌توانند فایل‌های GIF متحرک، وب‌سایت‌های دارای تصاویر تعبیه‌شده و بازی‌های تعاملی بصری ایجاد کنند.

جست‌وجو Muse Image می‌آموزد با جست‌وجو در وب، از اطلاعات واقعی، به‌روز و همچنین منابع تصویری برای تولید تصویر استفاده کند. فعال‌سازی قابلیت جست‌وجو، دقت واقعی مدل را در درخواست‌های دانش‌محور بهبود می‌بخشد.

خوداصلاحی (Self-Refinement)

Muse Image می‌تواند در زنجیره استدلال (Chain of Thought) خود، خروجی‌هایش را ارزیابی کرده و آن‌ها را بهبود دهد. این رفتار خوداصلاحی می‌تواند به شکل‌های مختلفی بروز کند؛ گاهی تنها یک ویرایش جزئی روی پیش‌نویس فعلی تصویر انجام می‌دهد، زمانی که فقط یک جزئیات کوچک نادرست باشد؛ در موارد دیگر، اگر بخش‌های بزرگ‌تری از تصویر اشتباه باشند، تصویر را از ابتدا دوباره تولید می‌کند یا حتی راهبرد متفاوتی مانند استفاده از ابزارها را برای دستیابی به تصویری با دقت واقعی بیشتر در پیش می‌گیرد. این رفتار به‌صورت مستقیم طراحی نشده است؛ بلکه در جریان آموزش مبتنی بر یادگیری تقویتی، به طور طبیعی پدیدار شد، زیرا خوداصلاحی تصاویر باکیفیت‌تری تولید می‌کرد و در نتیجه پاداش بیشتری دریافت می‌کرد.

مقیاس‌پذیری توان محاسباتی در زمان استنتاج (Test-Time Compute Scaling)

همانند مدل‌های زبانی، عملکرد Muse Image نیز هرچه در زمان استنتاج فرصت بیشتری برای «فکرکردن» داشته باشد، بهتر می‌شود. با افزایش توان محاسباتی در زمان استنتاج، مدل استدلال بیشتری انجام می‌دهد، دفعات بیشتری از ابزارها استفاده می‌کند و مراحل خوداصلاحی بیشتری را برای ارتقای کیفیت خروجی طی می‌کند.

افزایش قدرت استدلال و در نتیجه افزایش توان محاسباتی در زمان استنتاج، Elo score مبتنی بر ترجیح کاربران را بهبود می‌بخشد و تقریباً از یک رابطه لگاریتمی-خطی (Log-Linear) پیروی می‌کند. نکته قابل‌توجه این است که این توان محاسباتی، دو نوع کاملاً متفاوت از پردازش را در بر می‌گیرد، توکن‌های متنی برای استدلال و توکن‌های بصری برای تولید تصویر. بااین‌حال، کیفیت نهایی تابعی از مجموع توان محاسباتی صرف‌شده در هر دو بخش است.

نتایج متا نشان می‌دهد که نحوه تخصیص هوشمندانه بودجه توکن‌ها، به همان اندازه افزایش توان محاسباتی در مقیاس‌پذیری مؤثر زمان استنتاج اهمیت دارد. روش Best-of-N (BoN) که در آن مدل چندین تصویر تولید می‌کند و بهترین آن‌ها را نگه می‌دارد، در مراحل اولیه کیفیت را افزایش می‌دهد؛ اما این بهبود به‌سرعت به نقطه اشباع می‌رسد. در مقابل، صرف همین میزان توان محاسباتی برای استدلال هدفمند، مقیاس‌پذیری بسیار بهتری دارد. همچنین، زمانی که استدلال و استفاده از ابزارها با یکدیگر ترکیب شوند، اثر آن‌ها تقویت می‌شود. ابزارها به مدل اجازه می‌دهند فراتر از دانسته‌های پیشین خود عمل کند؛ چه با جست‌وجوی منابعی که در اختیار ندارد و چه با نوشتن کد برای ثبت دقیق جزئیات، شکاف‌هایی را پر می‌کنند که صرفاً از طریق استدلال قابل‌جبران نیستند.

ویرایش تصویر

Muse Image تصاویر را با دقت بسیار بالا ویرایش می‌کند و دقیقاً همان تغییراتی را اعمال می‌کند که کاربر درخواست کرده است. همچنین، Muse Image انسجام تصویر را در چندین مرحله ویرایش حفظ می‌کند و از اصلاح تدریجی و ایده‌پردازی باز برای رسیدن به نتیجه مطلوب پشتیبانی می‌کند.

ترکیب چندین تصویر مرجع (Multi-Reference Image Composition)

Muse Image می‌تواند عناصر موجود در تعداد زیادی از تصاویر مرجع ورودی را در قالب یک درخواست با یکدیگر ترکیب کند؛ از جمله افراد، اشیا، پوشاک، سبک‌های هنری و محیط‌ها. همچنین، این مدل از ترکیب هم‌زمان متن و تصویر درون یک درخواست (Inline) برای ایجاد ترکیب‌های تصویری پیچیده پشتیبانی می‌کند.

بنچمارک‌ها

طبق رده‌بندی بنچمارک Arena Elo، مدل Muse Image در هر سه شاخص متن به تصور، ادیت تک تصویر و چندتصویره، پس از GPT Image 2 در رتبه دوم قرار دارد.

پیش‌نمایش Muse Video

هم‌زمان با معرفی Muse Image، نسخه اولیه‌ای از Muse Video نیز معرفی شده است. این مدل از نظر پایبندی به درخواست کاربر (Prompt Adherence)، کیفیت بصری و انسجام زمانی (Temporal Consistency) عملکردی رقابتی ارائه می‌دهد. درعین‌حال، تمرکز توسعه‌دهندگان بر بهبود حوزه‌هایی است که هنوز با محدودیت عملکرد مواجه هستند؛ از جمله همگام‌سازی صدا و تصویر و شبیه‌سازی دقیق حرکات سریع بر اساس قوانین فیزیکی. Muse Video به‌زودی در اختیار تولیدکنندگان محتوا و همچنین کاربران Meta AI قرار گیرد.

در رتبه‌بندی Arena نیز، Muse Video در حوزه تبدیل متن به ویدئو (Text-to-Video)، رتبه سوم را در اختیار دارد.

دسترسی

متا به‌زودی Muse Image را در کشورهای بیشتری و همچنین در سایر محیط‌هایی که کاربران از Meta AI استفاده می‌کنند، از جمله فیس‌بوک، مسنجر و بخش‌های بیشتری از اینستاگرام و واتس‌اپ عرضه خواهد کرد. همچنین طی هفته‌های آینده، تبلیغ‌دهندگان و آژانس‌های تبلیغاتی خواهند توانست از طریق Advantage+ Creative به قابلیت‌های Muse Image دسترسی پیدا کنند.

مطالب پیشنهادی مرتبط

اشتراک در
اطلاع از
0 نظرات
بازخورد (Feedback) های اینلاین
مشاهده همه دیدگاه ها

در جریان مهم‌ترین اتفاقات AI بمانید

هر هفته، خلاصه‌ای از اخبار، تحلیل‌ها و رویدادهای هوش مصنوعی را در ایمیل‌تان دریافت کنید.

[wpforms id="48325"]