Generic filters
Search in title
Filter by دسته‌ها
chatGTP
ابزارهای هوش مصنوعی
اخبار
گزارش خبری
پرامپت‌ نویسی
تیتر یک
چندرسانه ای
آموزش علوم داده
اینفوگرافیک
پادکست
ویدیو
دانش روز
آموزش‌های پایه‌ای هوش مصنوعی
اصول هوش مصنوعی
یادگیری بدون نظارت
یادگیری تقویتی
یادگیری عمیق
یادگیری نیمه نظارتی
آموزش‌های پیشرفته هوش مصنوعی
بینایی ماشین
پردازش زبان طبیعی
پردازش گفتار
چالش‌های عملیاتی
داده کاوی و بیگ دیتا
رایانش ابری و HPC
سیستم‌‌های امبدد
علوم شناختی
خطرات هوش مصنوعی
دیتاست
مدل‌های بنیادی
رویدادها
جیتکس
کاربردهای هوش مصنوعی
کتابخانه
اشخاص
شرکت‌های هوش مصنوعی
محصولات و مدل‌های هوش مصنوعی
مفاهیم
کسب‌و‌کار
تحلیل بازارهای هوش مصنوعی
کارآفرینی
هوش مصنوعی در ایران
هوش مصنوعی در جهان
مقاله
پیاده‌سازی هوش مصنوعی
گزارش
مصاحبه
هوش مصنوعی در عمل
یادداشت
 ChatGPT Images 2.5؛ سریع‌تر، ویرایش دقیق‌تر و کنترل بیشتر

ChatGPT Images 2.5

ChatGPT Images 2.5؛ سریع‌تر، ویرایش دقیق‌تر و کنترل بیشتر

زمان مطالعه: 3 دقیقه

با ادعای تولید بیش از ۳ میلیارد تصویر در هفته و کمپین ترند جهانی عکس دهه ۸۰؛ OpenAI از جدیدترین مدل مولد تصویر خود رونمایی کرد.

OpenAI با معرفی ChatGPT Images 2.5 نسل جدید مدل تولید تصویر خود را عرضه کرده است؛ مدلی که بر افزایش کیفیت جزئیات، سرعت تولید، دقت ویرایش و توانایی حفظ ویژگی‌های تصاویر مرجع تمرکز دارد. به ادعای OpenAI هر هفته بیش از ۳ میلیارد تصویر در ChatGPT Images و مدل‌های GPT Image در API تولید می‌شود و Images 2.5 برای گسترش قابلیت‌های این جریان‌های خلاقانه طراحی شده است.

یکی از مهم‌ترین پیشرفت‌های Images 2.5، وفاداری بیشتر به تصاویر مرجع است. مدل در تبدیل افراد، مکان‌ها و سوژه‌های موجود در تصاویر مرجع به محیط‌ها، سبک‌های بصری و ترکیب‌بندی‌های جدید عملکرد بهتری دارد. ویژگی‌های متمایز سوژه‌ها با احتمال بیشتری حفظ می‌شوند و نورپردازی و بافت‌ها طبیعی‌تر به نظر می‌رسند. این قابلیت برای جریان‌های کاری مبتنی بر API نیز اهمیت دارد، زیرا تولید نسخه‌های مختلف یک تصویر می‌تواند همچنان به تصویر اصلی وفادار بماند.

ویرایش دقیق‌تر محور مهم دیگر این نسخه است. Images 2.5 تلاش می‌کند تنها همان بخشی را که کاربر درخواست کرده تغییر دهد و سایر عناصر تصویر را دست‌نخورده نگه دارد؛ حتی زمانی که تصویر شامل سوژه‌ها و پس‌زمینه‌های پیچیده باشد. در API، این قابلیت امکان تغییر یک عنصر مشخص، مانند محصول، پس‌زمینه یا متن، را فراهم می‌کند، بدون اینکه سوژه، ترکیب‌بندی یا هویت بصری پیرامون آن تغییر کند.

ترند اخیر عکس دهه ۸۰ میلادی نیز بخشی از کمپین تبلیغاتی معرفی این مدل از سوی OpenAI است. برای تبدیل عکس خود به استایل دهه ۸۰ می‌توانید از پرامپت زیر استفاده کنید:

Using my uploaded photo, show me what I would have looked like around 1985. Preserve my identity, facial features, skin tone, age, and recognizable appearance. Reimagine my hair, clothing, accessories, and surroundings with bold, unmistakably mid-1980s styling—expressive silhouettes, statement accessories, layered details, distinctive colors, and textures. Make it feel like a genuine 1985 photograph with analog grain, faded color, direct flash, and subtle softness. Add a period-accurate 1980s red-orange date stamp in the lower corner. No modern objects or text.

این مدل همچنین در ویرایش‌های چندمرحله‌ای عملکرد باثبات‌تری دارد. در مکالمات طولانی‌تر ChatGPT، تغییرات قبلی با اطمینان بیشتری حفظ می‌شوند و هر ویرایش جدید بر مبنای کار قبلی انجام می‌شود، بدون اینکه کیفیت تصویر به‌مرور افت کند. این ویژگی برای جریان‌های تولیدی نیز اهمیت دارد، زیرا توسعه‌دهندگان می‌توانند تغییرات هدفمند را اعمال کنند، بدون آنکه مجبور باشند یک دارایی تصویری را از ابتدا بازسازی کنند.

از دیگر پیشرفت‌ها، توانایی بهتر مدل در درک دستورهای بصری پیچیده و تبدیل آن‌ها به خروجی منسجم است. تصاویر حاوی اطلاعات دنیای واقعی، محتوای دقیق‌تری ارائه می‌کنند و مدل می‌تواند چیدمان‌های پیچیده‌تر، از جمله تصاویر با پس‌زمینه شفاف، ایجاد کند. همچنین توانایی آن در بازتاب سبک‌های بصری بهبود یافته است؛ در نتیجه خروجی می‌تواند تطابق بیشتری با جهت‌گیری هنری موردنظر کاربر داشته باشد. این موضوع برای تولید مجموعه‌ای از دارایی‌های بصری با هویت برند مشخص، مفاهیم رابط کاربری و تصاویر ارائه‌های ساختاریافته اهمیت دارد.

در کنار مدل جدید، ChatGPT قابلیت‌های تازه‌ای برای کنترل فرایند خلاقانه ارائه می‌کند. یکی از آن‌ها Sketch است که به کاربر اجازه می‌دهد مستقیماً در ChatGPT طرحی ساده بکشد و از آن به‌عنوان راهنمای بصری برای تولید تصویر نهایی استفاده کند. کاربر می‌تواند طرح یک اتاق، فرم یک لباس یا حتی یک نقاشی ساده را ترسیم کند و سپس با توضیح سبک و جزئیات موردنظر، آن را به تصویری کامل تبدیل کند. برای استفاده از این قابلیت، کاربر می‌تواند عبارت @Sketch را در ChatGPT وارد کند یا از لینک یا دسترسی مستقیم آن استفاده کند.

قابلیت دیگر، Templates است که شروع فرایند تولید تصویر را ساده‌تر می‌کند. کاربران می‌توانند به‌جای آغاز از یک صفحه خالی، قالب‌هایی مانند «Poster» یا «Merch» را انتخاب کرده و اطلاعات، عناصر طراحی و سبک موردنظر خود را به آن اضافه کنند.

قالب‌های آماده GPT Image 2.5

OpenAI هم‌زمان دو مدل جدید را برای Images API معرفی کرده است. GPT Image 2.5 Flare همان پیشرفت‌های Images 2.5 در کیفیت، ویرایش و سرعت را به API می‌آورد و گزینه پیش‌فرض برای بیشتر کاربردهاست. این مدل نسبت به GPT Image 2 تصاویر باکیفیت‌تری تولید می‌کند و با ۵۰ درصد تأخیر کمتر همراه است. کاربردهای آن از محتوای سازندگان و شبکه‌های اجتماعی تا تجربه‌های محصول، جست‌وجوی بصری، نمونه‌سازی سریع و تولید در مقیاس بالا را شامل می‌شود.

GPT Image 2.5 Sunburst برای جریان‌های کاری حرفه‌ای‌تر طراحی شده است که به کنترل دقیق‌تر در ویرایش‌ها نیاز دارند؛ از جمله تولید محتوای کمپین‌های آماده انتشار و تصاویر محصول. این مدل زمان تولید طولانی‌تری دارد، اما سطح بیشتری از دقت را ارائه می‌کند.

OpenAI همچنین بر ایمنی این مدل تأکید کرده است. Images 2.5 بر سازوکارهای حفاظتی موجود تکیه دارد و برای جلوگیری از خروجی‌های مضر، پرامپت‌ها و تصاویر را بررسی می‌کند. همچنین استفاده از فراداده C2PA و واترمارک نامرئی برای کمک به شناسایی تصاویر تولیدشده با ابزارهای OpenAI ادامه دارد.

ChatGPT Images 2.5 برای کاربران ChatGPT، ChatGPT Work و Codex در دسکتاپ، موبایل و وب عرضه شده و دو مدل Flare و Sunburst نیز از طریق API در دسترس قرار گرفته‌اند.

مطالب پیشنهادی مرتبط

اشتراک در
اطلاع از
0 نظرات
بازخورد (Feedback) های اینلاین
مشاهده همه دیدگاه ها

در جریان مهم‌ترین اتفاقات AI بمانید

هر هفته، خلاصه‌ای از اخبار، تحلیل‌ها و رویدادهای هوش مصنوعی را در ایمیل‌تان دریافت کنید.

[wpforms id="48325"]