جدیدترین تحولات هوش مصنوعی را در کانال بله هوشیو بخوانید

Generic filters
Search in title
Filter by دسته‌ها
chatGTP
ابزارهای هوش مصنوعی
اخبار
گزارش خبری
پرامپت‌ نویسی
تیتر یک
چندرسانه ای
آموزش علوم داده
اینفوگرافیک
پادکست
ویدیو
دانش روز
آموزش‌های پایه‌ای هوش مصنوعی
اصول هوش مصنوعی
یادگیری بدون نظارت
یادگیری تقویتی
یادگیری عمیق
یادگیری نیمه نظارتی
آموزش‌های پیشرفته هوش مصنوعی
بینایی ماشین
پردازش زبان طبیعی
پردازش گفتار
چالش‌های عملیاتی
داده کاوی و بیگ دیتا
رایانش ابری و HPC
سیستم‌‌های امبدد
علوم شناختی
خطرات هوش مصنوعی
دیتاست
مدل‌های بنیادی
رویدادها
جیتکس
کاربردهای هوش مصنوعی
کتابخانه
اشخاص
شرکت‌های هوش مصنوعی
محصولات و مدل‌های هوش مصنوعی
مفاهیم
کسب‌و‌کار
تحلیل بازارهای هوش مصنوعی
کارآفرینی
هوش مصنوعی در ایران
هوش مصنوعی در جهان
مقاله
پیاده‌سازی هوش مصنوعی
گزارش
مصاحبه
هوش مصنوعی در عمل
یادداشت
 مدل‌های مولد تصویر و ویدئو Nano Banana 2 Lite و Gemini Omni Flash

مدل‌های مولد تصویر و ویدئو Nano Banana 2 Lite و Gemini Omni Flash

زمان مطالعه: 3 دقیقه

گوگل با معرفی Nano Banana 2 Lite، سریع‌ترین و مقرون‌به‌صرفه‌ترین مدل تصویرساز Gemini و Gemini Omni Flash برای تولید ویدئو باکیفیت و ویرایش تعاملی (Conversational Editing)، فرایند آزمایش و مقیاس‌پذیری ایده‌ها را تسهیل کرده است.

توسعه بر پایه رسانه‌های مولد اغلب پیرامون تکرار و اصلاح خلاقانه می‌چرخد. با این دو مدل جدید گوگل، توسعه‌دهندگان می‌توانند تجربیات چندرسانه‌ای جامعی بسازند که تولید سریع تصویر را به خلق و ویرایش ویدئو متصل می‌کند. خواه جریان کاری شما نیازمند تولید هزاران تصویر باشد یا ویرایش توالی‌های ویدئویی چندنوبتی (Multi-turn Video Sequences)، به کمک Nano Banana 2 Lite و Gemini Omni Flash می‌توانید فرایند توسعه را سریع‌تر پیش ببرید، بدون وقفه ایده‌ها را تکرار کنید و چشم‌انداز خلاقانه خود را به واقعیت تبدیل کنید.

Nano Banana 2 Lite: سریع‌ترین و مقرون‌به‌صرفه‌ترین مدل تصویرساز Gemini

مدل Nano Banana 2 Lite سریع‌ترین و مقرون‌به‌صرفه‌ترین مدل تصویرساز گوگل در خانواده Nano Banana تا به امروز است که برای توان عملیاتی بالا، سرعت و مقیاس‌پذیری بالا ساخته شده است. مدل Nano Banana 2 Lite با شناسه فنی gemini-3.1-flash-lite-image برای ایده‌پردازی سریع و خطوط لوله توسعه‌دهندگان با سرعت بالا (High-Velocity Developer Pipelines) طراحی شده است؛ یعنی در شرایطی که سرعت و هزینه محدودیت‌های اصلی به شمار می‌روند. این مدل، جایگزین پیشنهادی گوگل برای توسعه‌دهندگانی است که در حال حاضر از اولین نسخه Nano Banana با شناسه gemini-2.5-flash-image استفاده می‌کنند.

بنچمارک‌های Nano Banana 2 و Nano Banana 2 Lite در مقایسه با مدل‌های هوش مصنوعی مولد تصویر رقیب، جهت سنجش موازنه‌های بین کیفیت تولید/ویرایش (امتیازهای Elo)، تأخیر پردازش (Processing Latency) و هزینه به‌ازای هر تصویر با رزولوشن 1K.

نقاط قوت Nano Banana 2 Lite

  • تأخیر (Latency): این مدل خروجی‌های متن به تصویر را ظرف مدت ۴ ثانیه ارائه می‌دهد. این ویژگی آن را برای نمونه‌سازی تعاملی (Interactive Prototyping) و پیش‌نویس‌های بصری سریع ایده‌آل می‌کند.
  • مقرون‌به‌صرفه بودن: با قیمت ۰.۰۳۴ دلار به‌ازای هر ۱۰۰۰ تصویر، انتخابی مقرون‌به‌صرفه برای توسعه‌دهندگانی که بر پیش‌نویس اولیه، ایده‌پردازی، مدیریت بودجه‌های عملیاتی یا سناریوهای با پهنای باند کم تمرکز دارند.

با وجود اولویت‌دادن به‌سرعت، Nano Banana 2 Lite ویژگی‌هایی چون پیروی قابل‌اعتماد از پرامپت (Prompt Adherence)، ثبات قوی در حفظ ویژگی‌های کاراکتر (Character Consistency) و رندر خوانای متون درون تصویر را حفظ کرده است.

درک خانواده Nano Banana

  • مدل Nano Banana 2 Lite (با شناسه Gemini 3.1 Flash Lite Image): ساخته‌شده برای سرعت. بهینه‌سازی‌شده برای جریان‌های کاری با حجم بالا و نزدیک به زمان‌واقعی (Near-Real-Time) که در آن‌ها تأخیر فوق‌العاده کم (Ultra-Low Latency) حیاتی است.
  • مدل Nano Banana 2 (با شناسه Gemini 3.1 Flash Image): مدل همه‌فن‌حریف و اصلی کار. کیفیت بالایی را با تأخیر کمتر ارائه می‌دهد و بهترین تعادل را میان عملکرد و هزینه برقرار می‌کند.
  • مدل Nano Banana Pro (با شناسه Gemini 3 Pro Image): بهینه‌سازی‌شده برای سناریوهای پیچیده و حرفه‌ای. این مدل قوی‌ترین کنترل و استدلال پیشرفته را برای وظایفی فراهم می‌کند که در آن‌ها دقت بالا، مهم‌تر از سرعت است.
  • مدل Nano Banana (با شناسه Gemini 2.5 Flash Image): مدل قدیمی (Legacy) ما. توصیه می‌کنیم برای دستیابی به کیفیت بهتر، سرعت بالاتر و هزینه‌های کمتر، آن را به Nano Banana 2 Lite ارتقا دهید.

تجربه ویرایش و تولید ویدئو باکیفیت و مقرون‌به‌صرفه با Gemini Omni Flash

گوگل در رویداد Google I/O مدل Gemini Omni را معرفی کرد؛ مدلی که در آن استدلال چندوجهی Gemini با تولید و ویرایش ویدئو تلاقی می‌کند. اکنون نیز Gemini Omni Flash با شناسه فنی gemini-omni-flash-preview در اختیار توسعه‌دهندگان قرار می‌گیرد که از تولید ویدئو باکیفیت و ویرایش تعاملی بر پایه ترکیبی از ورودی‌های متن، تصویر و ویدئو پشتیبانی می‌کند. قیمت‌گذاری این مدل به‌صورت رقابتی و به میزان ۰.۱۰ دلار به‌ازای هر ثانیه خروجی ویدئو تعیین شده است که با قیمت مدل Veo 3.1 Fast برابری می‌کند.

نقاط قوت

  • ویرایش ویدئویی تعاملی (Conversational Video Editing): اصلاح و ویرایش ویدئوها با استفاده از زبان طبیعی.
  • ارجاع‌دهی چندوجهی (Multimodal Referencing): ترکیب ورودی‌هایی مانند تصاویر، متن و ویدئو برای حفظ کنترل و ثبات روی صحنه شما.
  • دانش دنیای واقعی: مدل Omni از دانش وسیع Gemini در زمینه‌هایی چون تاریخ، زیست‌شناسی و منطق روایی برای ساخت ویدئوهای متقاعدکننده بهره می‌گیرد.
  • همگام‌سازی متن و حرکت (Text and Action Synchronization): متصل‌کردن مستقیم متن و گرافیک به اکشن‌ها و حرکات ویدئو، صرفاً از طریق پرامپت‌نویسی ساده.

محدودیت‌ها

  • مدل Omni در حال حاضر ویدئوهای ۱۰ ثانیه‌ای تولید می‌کند و قابلیت پشتیبانی از مدت‌زمان‌های طولانی‌تر به‌زودی ارائه خواهد شد.
  • آپلود مراجع صوتی (Audio References) و قابلیت بسط صحنه (Scene Extension) هنوز در Gemini API برای این مدل پشتیبانی نمی‌شوند.
  • مراجع ویدئویی تا مدت‌زمان ۳ ثانیه توسط API schema پذیرفته می‌شوند، اما در حال حاضر به‌درستی توسط مدل پردازش نمی‌شوند.
  • حفظ ثبات ویژگی‌های کاراکتر (Character Consistency) هنگام تغییر صحنه یا حرکت‌های پنینگ دوربین دارای محدودیت‌هایی است.

دسترسی

مدل Nano Banana 2 Lite از امروز در Google AI Studio، Gemini API و پلتفرم Gemini Enterprise Agent در دسترس است. این مدل همچنین در سرویس‌های مصرف‌کننده گوگل از جمله حالت هوش مصنوعی در بخش جست‌وجو (AI Mode in Search)، اپلیکیشن Gemini و بسیاری از محصولات دیگر در حال عرضه است.

مدل باکیفیت و مقرون‌به‌صرفه Gemini Omni Flash برای تولید ویدئو و ویرایش تعاملی، اکنون برای اولین‌بار در Google AI Studio، Gemini API، پلتفرم Gemini Enterprise Agent، اپلیکیشن Gemini و Google Flow در دسترس قرار گرفته است.

مطالب پیشنهادی مرتبط

اشتراک در
اطلاع از
0 نظرات
بازخورد (Feedback) های اینلاین
مشاهده همه دیدگاه ها

در جریان مهم‌ترین اتفاقات AI بمانید

هر هفته، خلاصه‌ای از اخبار، تحلیل‌ها و رویدادهای هوش مصنوعی را در ایمیل‌تان دریافت کنید.

[wpforms id="48325"]