تولید تصویر در استوری اینستاگرام و چت واتساپ
متا با مدل Muse Image، تولد تصویر با هوش مصنوعی را به استوری اینستاگرام و چت واتساپ میآورد
متا از مدل مولد تصویر اختصاصی خود به نام Muse Image رونمایی کرد؛ نخستین مدل مولد تصویر این شرکت که توسط آزمایشگاههای ابرهوش متا (Meta Superintelligence Labs) توسعه یافته و اکنون در Meta AI در دسترس قرار گرفته است. Muse Image در نقش یک دستیار خلاق ظاهر میشود که زمینه کاربر را میشناسد و تبدیل ایدهها به تصاویر باکیفیت را آسان میکند.
این مدل همچنین زیربنای مجموعهای از ابزارهای خلاقانه جدید در اپلیکیشنهای متا است. کاربران میتوانند از بیش از ۳۰ افکت جدید مبتنی بر هوش مصنوعی برای استوریهای اینستاگرام استفاده کنند و همچنین در چت واتساپ، با کمک Meta AI تصویر تولید کنند. این قابلیت در ابتدا در تعداد محدودی از کشورها عرضه میشود و بهتدریج در کشورهای بیشتری در دسترس قرار خواهد گرفت.
واتساپ و اینستاگرام
چه بخواهید از نقطه صفر شروع کنید و چه روی یک تصویر موجود کار کنید، کافی است خواسته خود را با زبانی ساده و محاورهای توصیف کنید تا Meta AI به لطف Muse Image باقی مراحل را انجام دهد. این مدل همچنین متن را با کیفیت بالا و بهصورت خوانا درون تصاویر رندر میکند. بنابراین میتوانید از آن بخواهید یک راهنمای آموزشی یا یک اینفوگرافیک تخصصی درباره موضوعی مشخص تولید کند؛ در این صورت، متن نهتنها خوانا خواهد بود، بلکه از نظر سبک طراحی نیز با تصویر هماهنگ خواهد شد. همچنین Meta AI برای سادهسازی تجربه کاربری، پنلی از پیشتنظیمها (Presets) شامل مجموعهای از راهنماهای پیشنهادی را برای کمک به کاربران ارائه کرده است.
Muse Image صرفاً یک تصویر تولید نمیکند؛ بلکه ابتدا درباره درخواست فکر میکند. این مدل با کمک Muse Spark، در پشتصحنه چندین مرحله را طی میکند؛ از برنامهریزی برای چیدمان تصویر گرفته تا جستوجوی اطلاعات بهروز در وب و ترکیب هوشمندانه چندین مرجع تصویری بهصورت همزمان.

کاربران همچنین میتوانند در اپلیکیشن Meta AI حسابهای اینستاگرام را با استفاده از @ منشن کنند تا آن پروفایلها مستقیماً در فرایند تولید تصویر وارد شود؛ کافی است نام کاربری موردنظر را منشن کنید تا Meta AI از تصاویر عمومی آن حساب برای ساخت تصویری آماده انتشار استفاده کند. درعینحال، کاربران کنترل کاملی بر این قابلیت دارند و میتوانند از طریق یک تنظیم ساده، امکان استفاده از محتوای خود برای تولید تصاویر مبتنی بر هوش مصنوعی را در هر زمان غیرفعال کنند.

تولید عاملمحور تصویر
برخلاف مدلهایی که مستقیماً پرامپت را به تصویر تبدیل میکنند، Muse Image بهصورت یک عامل هوشمند عمل میکند. این مدل برای افزایش دقت، از ابزارهای جستوجو و کدنویسی استفاده میکند، خروجیهای خود را بهصورت خودکار بازبینی و اصلاح میکند و با افزایش توان محاسباتی در زمان استنتاج، عملکرد خود را بهبود میبخشد. همچنین، Muse Image با Muse Spark یکپارچه شده است؛ بهگونهای که این دو مدل میتوانند ابزارهای مشترک را به کار بگیرند و بهصورت هماهنگ برنامهریزی کنند تا قابلیتهای قدرتمندی در تولید عاملمحور محتوای چندرسانهای ارائه دهند.
استفاده از ابزارها
برای تقویت قابلیتهای عاملمحور Muse Image، دسترسی این مدل به مجموعهای از ابزارها فراهم شده است.

کدنویسی در طول فرایند یادگیری تقویتی، Muse Image میآموزد کدی بنویسد و اجرا کند که نمودارها و کدهای QR دقیق تولید میکند و سپس با اتکا به این تصاویر رندرشده، دقت تصاویر نهایی خود را افزایش میدهد. افزون بر این، Muse Spark و Muse Image بهگونهای یکپارچه شدهاند که با ترکیب قابلیتهای کدنویسی و تولید مدیا، میتوانند فایلهای GIF متحرک، وبسایتهای دارای تصاویر تعبیهشده و بازیهای تعاملی بصری ایجاد کنند.

جستوجو Muse Image میآموزد با جستوجو در وب، از اطلاعات واقعی، بهروز و همچنین منابع تصویری برای تولید تصویر استفاده کند. فعالسازی قابلیت جستوجو، دقت واقعی مدل را در درخواستهای دانشمحور بهبود میبخشد.
خوداصلاحی (Self-Refinement)
Muse Image میتواند در زنجیره استدلال (Chain of Thought) خود، خروجیهایش را ارزیابی کرده و آنها را بهبود دهد. این رفتار خوداصلاحی میتواند به شکلهای مختلفی بروز کند؛ گاهی تنها یک ویرایش جزئی روی پیشنویس فعلی تصویر انجام میدهد، زمانی که فقط یک جزئیات کوچک نادرست باشد؛ در موارد دیگر، اگر بخشهای بزرگتری از تصویر اشتباه باشند، تصویر را از ابتدا دوباره تولید میکند یا حتی راهبرد متفاوتی مانند استفاده از ابزارها را برای دستیابی به تصویری با دقت واقعی بیشتر در پیش میگیرد. این رفتار بهصورت مستقیم طراحی نشده است؛ بلکه در جریان آموزش مبتنی بر یادگیری تقویتی، به طور طبیعی پدیدار شد، زیرا خوداصلاحی تصاویر باکیفیتتری تولید میکرد و در نتیجه پاداش بیشتری دریافت میکرد.

مقیاسپذیری توان محاسباتی در زمان استنتاج (Test-Time Compute Scaling)
همانند مدلهای زبانی، عملکرد Muse Image نیز هرچه در زمان استنتاج فرصت بیشتری برای «فکرکردن» داشته باشد، بهتر میشود. با افزایش توان محاسباتی در زمان استنتاج، مدل استدلال بیشتری انجام میدهد، دفعات بیشتری از ابزارها استفاده میکند و مراحل خوداصلاحی بیشتری را برای ارتقای کیفیت خروجی طی میکند.
افزایش قدرت استدلال و در نتیجه افزایش توان محاسباتی در زمان استنتاج، Elo score مبتنی بر ترجیح کاربران را بهبود میبخشد و تقریباً از یک رابطه لگاریتمی-خطی (Log-Linear) پیروی میکند. نکته قابلتوجه این است که این توان محاسباتی، دو نوع کاملاً متفاوت از پردازش را در بر میگیرد، توکنهای متنی برای استدلال و توکنهای بصری برای تولید تصویر. بااینحال، کیفیت نهایی تابعی از مجموع توان محاسباتی صرفشده در هر دو بخش است.
نتایج متا نشان میدهد که نحوه تخصیص هوشمندانه بودجه توکنها، به همان اندازه افزایش توان محاسباتی در مقیاسپذیری مؤثر زمان استنتاج اهمیت دارد. روش Best-of-N (BoN) که در آن مدل چندین تصویر تولید میکند و بهترین آنها را نگه میدارد، در مراحل اولیه کیفیت را افزایش میدهد؛ اما این بهبود بهسرعت به نقطه اشباع میرسد. در مقابل، صرف همین میزان توان محاسباتی برای استدلال هدفمند، مقیاسپذیری بسیار بهتری دارد. همچنین، زمانی که استدلال و استفاده از ابزارها با یکدیگر ترکیب شوند، اثر آنها تقویت میشود. ابزارها به مدل اجازه میدهند فراتر از دانستههای پیشین خود عمل کند؛ چه با جستوجوی منابعی که در اختیار ندارد و چه با نوشتن کد برای ثبت دقیق جزئیات، شکافهایی را پر میکنند که صرفاً از طریق استدلال قابلجبران نیستند.

ویرایش تصویر
Muse Image تصاویر را با دقت بسیار بالا ویرایش میکند و دقیقاً همان تغییراتی را اعمال میکند که کاربر درخواست کرده است. همچنین، Muse Image انسجام تصویر را در چندین مرحله ویرایش حفظ میکند و از اصلاح تدریجی و ایدهپردازی باز برای رسیدن به نتیجه مطلوب پشتیبانی میکند.
ترکیب چندین تصویر مرجع (Multi-Reference Image Composition)
Muse Image میتواند عناصر موجود در تعداد زیادی از تصاویر مرجع ورودی را در قالب یک درخواست با یکدیگر ترکیب کند؛ از جمله افراد، اشیا، پوشاک، سبکهای هنری و محیطها. همچنین، این مدل از ترکیب همزمان متن و تصویر درون یک درخواست (Inline) برای ایجاد ترکیبهای تصویری پیچیده پشتیبانی میکند.

بنچمارکها
طبق ردهبندی بنچمارک Arena Elo، مدل Muse Image در هر سه شاخص متن به تصور، ادیت تک تصویر و چندتصویره، پس از GPT Image 2 در رتبه دوم قرار دارد.



پیشنمایش Muse Video
همزمان با معرفی Muse Image، نسخه اولیهای از Muse Video نیز معرفی شده است. این مدل از نظر پایبندی به درخواست کاربر (Prompt Adherence)، کیفیت بصری و انسجام زمانی (Temporal Consistency) عملکردی رقابتی ارائه میدهد. درعینحال، تمرکز توسعهدهندگان بر بهبود حوزههایی است که هنوز با محدودیت عملکرد مواجه هستند؛ از جمله همگامسازی صدا و تصویر و شبیهسازی دقیق حرکات سریع بر اساس قوانین فیزیکی. Muse Video بهزودی در اختیار تولیدکنندگان محتوا و همچنین کاربران Meta AI قرار گیرد.

دسترسی
متا بهزودی Muse Image را در کشورهای بیشتری و همچنین در سایر محیطهایی که کاربران از Meta AI استفاده میکنند، از جمله فیسبوک، مسنجر و بخشهای بیشتری از اینستاگرام و واتساپ عرضه خواهد کرد. همچنین طی هفتههای آینده، تبلیغدهندگان و آژانسهای تبلیغاتی خواهند توانست از طریق Advantage+ Creative به قابلیتهای Muse Image دسترسی پیدا کنند.