Generic filters
Search in title
Filter by دسته‌ها
chatGTP
ابزارهای هوش مصنوعی
اخبار
گزارش خبری
پرامپت‌ نویسی
تیتر یک
چندرسانه ای
آموزش علوم داده
اینفوگرافیک
پادکست
ویدیو
دانش روز
آموزش‌های پایه‌ای هوش مصنوعی
اصول هوش مصنوعی
یادگیری بدون نظارت
یادگیری تقویتی
یادگیری عمیق
یادگیری نیمه نظارتی
آموزش‌های پیشرفته هوش مصنوعی
بینایی ماشین
پردازش زبان طبیعی
پردازش گفتار
چالش‌های عملیاتی
داده کاوی و بیگ دیتا
رایانش ابری و HPC
سیستم‌‌های امبدد
علوم شناختی
خطرات هوش مصنوعی
دیتاست
مدل‌های بنیادی
رویدادها
جیتکس
جیتکس ترکیه
کاربردهای هوش مصنوعی
کتابخانه
اشخاص
شرکت‌های هوش مصنوعی
محصولات و مدل‌های هوش مصنوعی
مفاهیم
کسب‌و‌کار
تحلیل بازارهای هوش مصنوعی
کارآفرینی
هوش مصنوعی در ایران
هوش مصنوعی در جهان
مقاله
پیاده‌سازی هوش مصنوعی
گزارش
مصاحبه
هوش مصنوعی در عمل
یادداشت
 Nano Banana 2.1؛ بهینه‌سازی‌شده برای تولید اینفوگرافیک با هزینه نصف و کیفیت بالاتر

Nano Banana 2.1

Nano Banana 2.1؛ بهینه‌سازی‌شده برای تولید اینفوگرافیک با هزینه نصف و کیفیت بالاتر

زمان مطالعه: 4 دقیقه

مدل هوش مصنوعی مولد تصویر Nano Banana 2.1 جدیدترین عضو خانواده مدل‌های سری Gemini 3 است که با تمرکز بر روی تولید تصویر و ویرایش تعاملی با بهره‌وری بالا از سوی گوگل دیپ‌مایند (Google DeepMind) روانه بازار شده است.

مدل مولد تصویر Nano Banana 2.1 که بر پایه معماری قدرتمند Gemini 3.6 Flash توسعه یافته، آمده است تا سرعت و مقرون‌به‌صرفه بودن مدل‌های Flash را با کیفیت بصری خیره‌کننده‌ای ترکیب کند. در ادامه، بررسی کاملی بر ویژگی‌ها و قابلیت‌های این مدل خواهیم داشت.

معماری پایه و جایگاه مدل Nano Banana 2.1

مدل Nano Banana 2.1 یک مدل چندوجهی (Multimodal) با قابلیت استدلال بالا است که به‌عنوان نسخه جایگزین و ارتقایافته‌ی مدل Gemini 3.1 Flash Image (که پیش‌تر با نام Nano Banana 2 شناخته می‌شد) در دسترس قرار گرفته است. رسالت اصلی این مدل، حفظ سرعت فوق‌العاده و کارایی اقتصادی معماری Flash است، درحالی‌که در زمینه کیفیت بصری، وفاداری به پرامپت ثبات کاراکتر و رندر متون، عملکردی هم‌تراز یا حتی بهتر از مدل‌های سنگین‌تری مانند Gemini 3 Pro Image یا همان Nano Banana Pro ارائه می‌دهد.

  • ورودی‌ها و خروجی‌ها: این مدل انعطاف‌پذیری بالایی دارد و می‌تواند داده‌های متنی، تصویری، ویدئویی و فایل‌های PDF را به‌عنوان ورودی دریافت کند. در بخش خروجی، توانایی تولید تصویر (با خروجی تا ۴ هزار توکن) و متن (تا ۶۴ هزار توکن) را داراست.
  • پنجره زمینه (Context Window): معماری پایه این مدل از یک پنجره زمینه متنی و تصویری با ظرفیت پردازش چشمگیر تا ۱ میلیون توکن پشتیبانی می‌کند. بااین‌حال، در مستندات توسعه‌دهندگان (API)، محدودیت پردازش برای توکن‌های ورودی ۱۳۱,۰۷۲ توکن و برای توکن‌های خروجی ۳۲,۷۶۸ توکن قید شده است.

مهم‌ترین ویژگی‌ها و قابلیت‌های فنی

گوگل در این نسخه تمرکز خود را بر روی چالش‌های بنیادین تولید تصویر و ادغام ابزارهای هوش مصنوعی سازمانی گذاشته‌اند:

  • سطوح تفکر قابل‌تنظیم: یکی از برجسته‌ترین نوآوری‌های این نسخه، امکان کنترل میزان پردازش یا «تفکر» مدل پیش از تولید خروجی است. کاربران و مهندسان پرامپت می‌توانند این پارامتر را در سه سطح حداقل (Minimal)، متوسط (Medium که حالت پیش‌فرض است) و بالا (High) تنظیم کنند. این ویژگی اجازه می‌دهد تا بین سرعت پاسخ‌گویی و پیچیدگی استدلال تعادل ایجاد شود.
  • ترکیب پیشرفته چندین تصویر (Multi-image Fusion): حفظ ثبات بصری همیشه یکی از بزرگ‌ترین چالش‌ها در طراحی‌های گرافیکی و روایت‌های تصویری بوده است. Nano Banana 2.1 اکنون از ترکیب حداکثر ۱۴ تصویر مرجع پشتیبانی می‌کند. این سیستم خارق‌العاده می‌تواند ثبات چهره و ویژگی‌های ظاهری را برای حداکثر ۴ کاراکتر مختلف و وفاداری به جزئیات را برای حداکثر ۱۰ شیء در یک صحنه به طور هم‌زمان تضمین کند.
  • اتصال به اطلاعات واقعی (Grounding): مدل از طریق جستجوی وب گوگل و جستجوی تصاویر گوگل (Google Image Search) قادر به پردازش مبتنی بر Grounding است. این یعنی خروجی‌ها می‌توانند مستقیماً به اطلاعات لحظه‌ای متصل شوند و تصاویری از صحنه‌های دقیق و داده‌های روزمره دنیای واقعی تولید کنند.

رندر پیشرفته متن و اینفوگرافیک

یکی از نقاط قوت Nano Banana 2.1، توانایی آن در تولید متن‌های خوانا برای پوسترها و دیاگرام‌های پیچیده و چیدمان دقیق اینفوگرافیک‌ها است.

  • این مدل به طور ویژه برای تولید پوسترهای حاوی متن خوانا و دیاگرام‌های پیچیده و پرجزئیات بهینه‌سازی شده است.
  • رندر متون بومی‌سازی‌شده (Localized) در زبان‌های مختلف، از دیگر توانایی‌های کلیدی آن محسوب می‌شود.
  • کیفیت بصری و واقع‌گرایی تصاویر در رزولوشن‌های 1K (رزولوشن پیش‌فرض مدل)، 2K و 4K بهبود یافته است.
  • مشکلات آزاردهنده‌ی تکرار الگو و بافت (Tiling artifacts) در تولید تصاویر با نسبت‌های عریض و پانوراما (مانند ۱:۴، ۴:۱، ۱:۸ و ۸:۱) در رزولوشن‌های 2K و 4K برطرف شده است.

بنچمارک‌ها

بر اساس ارزیابی‌های انجام‌شده در اکتبر ۲۰۲۶، مدل Nano Banana 2.1 (در حالت روشن بودن ابزار Thinking) رکوردهای جدیدی را در بنچمارک‌های تبدیل متن به تصویر (T2I) و ویرایش به ثبت رسانده است:

  • ترجیح کلی (Overall Preference): این مدل توانست امتیاز Elo معادل ۱۰۵۰ را کسب کند، درحالی‌که مدل پیشین (Nano Banana 2) امتیاز ۹۹۰ و حتی نسخه بسیار پیشرفته پرو (Gemini 3 Pro Image) امتیاز ۹۳۵ را ثبت کرده بودند.
  • طراحی اینفوگرافیک: کسب امتیاز ۱۰۴۸ (در برابر امتیاز ۹۱۲ مدل پرو) که نشانگر قدرت آن در درک داده‌ها و تصویرسازی گرافیکی است.
  • ثبات چند-کاراکتری (Multi-Character Consistency): با ثبت امتیاز ۱۱۰۶ (در مقایسه با امتیاز ۱۰۱۱ در نسخه پرو)، این مدل جهشی بزرگ در حفظ انسجام صحنه‌های شلوغ با حضور چند انسان داشته است.
  • ویرایش پیشرفته: در زمینه‌هایی مانند تغییر استایل (Stylization) مدل توانست امتیاز ۱۰۶۲ و در ویرایش‌های مبتنی بر ماسک و خط‌خطی (Ink/Mask-based Editing) امتیاز ۱۰۴۹ را به دست آورد.

محدودیت‌ها و چالش‌های فعلی

با وجود تمامی این پیشرفت‌ها، مدل Nano Banana 2.1 به‌عنوان یک مدل پایه‌ای همچنان دارای محدودیت‌هایی است که طراحان باید آن‌ها را در نظر داشته باشند:

  • احتمال بروز پدیده توهم همچنان وجود دارد و گاهی ممکن است درخواست‌ها با کندی مقطعی یا توقف (Timeout) مواجه شوند.
  • در زمینه رندر متن، متون بسیار ریز (که در خروجی 1K معمولاً تار می‌شوند) و پردازش پاراگراف‌های متنی طولانی (در حد یک صفحه)، هنوز به کیفیت مطلوب و ایده‌آل نرسیده‌اند.
  • با وجود بهبودهای فراوان، ثبات کاراکتر بین تصویر اصلی ورودی و تصویر تولیدشده در خروجی همیشه ۱۰۰ درصد بی‌نقص نیست.
  • در ویرایش‌های بر پایه ماسک (Doodle-based editing)، گاهی مدل دستورالعمل‌ها را به‌صورت ناقص اجرا می‌کند و اثر خط‌خطی اولیه کاربر روی خروجی نهایی باقی می‌ماند.
  • در موارد نادری مشاهده شده که هنگام ویرایش تصویر، حالت و پوزیشن فیزیکی سوژه (Pose) از تصویر مرجع به طور ناخواسته به تصویر جدید منتقل و در آنجا قفل می‌شود.
  • گاهی مدل در درک موقعیت‌های فضایی هندسی و جهت‌ها (مانند تفاوت چپ و راست در تصویر) دچار سردرگمی می‌شود.
  • تاریخ پایه دانش (Knowledge Cutoff) این مدل در بسیاری از حوزه‌ها روی مارس ۲۰۲۶ تنظیم شده است، هرچند در برخی دامنه‌های علمی اطلاعات آن محدود به ژانویه ۲۰۲۵ است.

دسترسی، امنیت و چشم‌انداز آینده

از منظر ایمنی، Nano Banana 2.1 ارزیابی‌های مربوط به سیاست‌های ایمنی کودکان را با موفقیت گذرانده و آستانه‌های سخت‌گیرانه تعیین‌شده توسط گوگل را برآورده کرده است. در حوزه ارزیابی ایمنی مرزی، بررسی‌ها نشان داد که این مدل به هیچ‌یک از سطوح قابلیت‌های بحرانی (T/CCLs) دست نیافته است که این امر حکایت از امنیت بالای آن برای استقرار در سیستم‌های عمومی و سازمانی دارد.

برنامه‌نویسان و تولیدکنندگان محتوا می‌توانند از طریق شبکه‌ای از پلتفرم‌ها به این هوش مصنوعی دسترسی داشته باشند؛ از جمله Gemini App، Google AI Studio، Gemini API، سیستم هوش مصنوعی جستجوی گوگل (Search AI Mode)، Google Ads، پلتفرم Google Flow و Google Stitch. برای توسعه‌دهندگانی که نیازمند پردازش در مقیاس بالا هستند، این مدل از طریق Batch API در دسترس است، اما در حال حاضر گزینه‌های Flex Inference برای آن فعال نشده است.

آلبوم تصاویر تولیدشده با مدل مولد تصویر Nano Banana 2.1

مطالب پیشنهادی مرتبط

اشتراک در
اطلاع از
2 نظرات
قدیمی‌ترین
تازه‌ترین بیشترین رأی
بازخورد (Feedback) های اینلاین
مشاهده همه دیدگاه ها

در جریان مهم‌ترین اتفاقات AI بمانید

هر هفته، خلاصه‌ای از اخبار، تحلیل‌ها و رویدادهای هوش مصنوعی را در ایمیل‌تان دریافت کنید.

[wpforms id="48325"]