جدیدترین تحولات هوش مصنوعی را در کانال بله هوشیو بخوانید

Generic filters
Search in title
Filter by دسته‌ها
chatGTP
ابزارهای هوش مصنوعی
اخبار
گزارش خبری
پرامپت‌ نویسی
تیتر یک
چندرسانه ای
آموزش علوم داده
اینفوگرافیک
پادکست
ویدیو
دانش روز
آموزش‌های پایه‌ای هوش مصنوعی
اصول هوش مصنوعی
یادگیری بدون نظارت
یادگیری تقویتی
یادگیری عمیق
یادگیری نیمه نظارتی
آموزش‌های پیشرفته هوش مصنوعی
بینایی ماشین
پردازش زبان طبیعی
پردازش گفتار
چالش‌های عملیاتی
داده کاوی و بیگ دیتا
رایانش ابری و HPC
سیستم‌‌های امبدد
علوم شناختی
خطرات هوش مصنوعی
دیتاست
مدل‌های بنیادی
رویدادها
جیتکس
کاربردهای هوش مصنوعی
کتابخانه
اشخاص
شرکت‌های هوش مصنوعی
محصولات و مدل‌های هوش مصنوعی
مفاهیم
کسب‌و‌کار
تحلیل بازارهای هوش مصنوعی
کارآفرینی
هوش مصنوعی در ایران
هوش مصنوعی در جهان
مقاله
پیاده‌سازی هوش مصنوعی
گزارش
مصاحبه
هوش مصنوعی در عمل
یادداشت
 رونمایی گوگل از خانواده مدل‌های Gemini Omni

Gemini Omni Flash

رونمایی گوگل از خانواده مدل‌های Gemini Omni

زمان مطالعه: 3 دقیقه

Gemini Omni Flash، مدلی که می‌تواند هر چیزی را از هر نوع ورودی تولید کند و این کار را با ویدئو آغاز می‌کند.

سال گذشته، نانو بنانا (Nano Banana) هوش Gemini را به حوزه تولید و ویرایش تصویر آورد. از آن زمان، این ابزار به میلیون‌ها نفر کمک کرده است تا عکس‌های قدیمی را بازیابی کنند، از روی طرح‌های اولیه طراحی کنند و ایده‌ها را به روش‌هایی که پیش‌تر ممکن نبود، مصورسازی نمایند. گوگل از همان ابتدا Gemini را به‌گونه‌ای ساخته که از پایه به‌صورت بومی چندوجهی (Natively Multimodal) باشد و اکنون در حال برداشتن گام بعدی است.

در همین راستان گوگل، سری Gemini Omni را توسعه داد و منتشر کرد؛ جایی که توانایی استدلال Gemini با توانمندی در خلق‌کردن تلاقی پیدا می‌کند. Omni مدل جدید گوگل است که می‌تواند از هر نوع ورودی، هر چیزی را خلق کند و این کار با ویدئو شروع می‌کند. با Omni، می‌توانید تصاویر، صدا، ویدئو و متن را به‌عنوان ورودی ترکیب کرده و ویدئوهایی با کیفیت بالا و مبتنی بر دانشِ Gemini از دنیای واقعی تولید کنید. همچنین می‌توانید ویدئوهای خود را به‌سادگی از طریق مکالمه به زبان طبیعی ویرایش نمایید.

گوگل اولین مدل از خانواده Omni به نام Gemini Omni Flash برای اپلیکیشن Gemini، Google Flow و YouTube Shorts عرضه کرده است. به‌مرورزمان، از مدالیته‌های خروجی مانند تصویر و صدا نیز پشتیبانی خواهد کرد.

در ادامه به برخی از ویژگی‌هایی که Omni را متمایز می‌کند، اشاره شده است:

ویرایش ویدئوها از طریق مکالمه

Gemini Omni روشی آسان‌تر برای ویرایش ویدئو با استفاده از زبان طبیعی در اختیار شما قرار می‌دهد. هر دستور بر پایه دستور قبلی بنا می‌شود. شخصیت‌های شما ثابت می‌مانند، قوانین فیزیک پابرجا می‌مانند و صحنه آنچه را که پیش‌تر اتفاق افتاده است، به‌خاطر می‌سپارد.

  • تبدیل دنیای پیرامون خود. چیزهای خاصی را تغییر دهید، یا همه چیز را دگرگون کنید. ویدئوی شما به نقطه شروعی برای چیزی تبدیل می‌شود که هرگز خودتان قادر به فیلم‌برداری از آن نبودید.
  • بازآفرینی کنش (Action). ویدئویی که گرفته‌اید را در نظر بگیرید و فقط از Omni بخواهید اتفاقاتی که در حال رخ‌دادن است را تغییر دهد. کنش را ویرایش کنید، شخصیت‌ها یا اشیا جدیدی اضافه کنید، یا یک لحظه را به چیزی غیرمنتظره تبدیل نمایید.
  • بهبود ویدئوها در طی چند نوبت (Multiple turns). محیط، زاویه، سبک یا حتی جزئیات خاص را بدون ازدست‌دادن رشته صحنه اصلی خود تغییر دهید.

جان‌بخشی به ایده‌ها، مبتنی بر دانش Gemini از جهان

Gemini Omni فقط صحنه‌هایی را که واقعی به نظر می‌رسند تولید نمی‌کند، بلکه در مورد آنچه باید در ادامه اتفاق بیفتد استدلال می‌کند. این مدل یک درک شهودی از فیزیک را با دانش Gemini از تاریخ، علم و زمینه ترکیب کرده و فاصله میان واقع‌گرایی عکس‌گونه (Photorealism) و داستان‌سرایی معنادار را پر می‌کند.

  • خلق جلوه‌های بصری با فیزیک دقیق‌تر: Omni دارای درک شهودیِ بهبودیافته‌ای از نیروهایی مانند گرانش، انرژی جنبشی و دینامیک سیالات است که به شما اجازه می‌دهد صحنه‌های واقع‌گرایانه‌تری خلق کنید.
  • ترکیب دانش و خلاقیت: Omni از دانش Gemini بهره می‌برد تا زبان، تصاویر و معنا را به روش‌هایی که بسیار فراتر از تطبیق الگو است، به یکدیگر متصل کند.
  • بصری‌سازی ایده‌های پیچیده: Omni می‌تواند از طریق پرامپت‌های کوتاه، ویدئوهای توضیحی جذابی خلق کند و جلوه‌های بصری‌ای تولید کند که ایده‌های پیچیده‌تر را تجزیه‌وتحلیل می‌کنند.

خلق ویدئو از هر ترکیب ورودی

  • ارجاع به هر چیزی: Omni هر مرجعی از تصویر، متن، ویدئو یا صدا را به یک خروجی یکپارچه و منسجم تبدیل می‌کند. اگرچه در ابتدا برای بخش صدا فقط ارجاع‌های گفتاری (Voice references) پشتیبانی می‌شوند، به‌زودی سایر انواع ورودی‌های صوتی نیز عرضه خواهد کرد.
  • شروع از آنچه در اختیار دارید: با منابع ورودی، می‌توانید از تصاویر شخصیت‌ها، صحنه‌ها یا نقاشی‌ها استفاده کنید تا به روشی که دقیقاً با چشم‌انداز شما مطابقت دارد، به خلق محتوا بپردازید.
  • اعمال سبک‌ها، حرکت یا افکت‌ها: زبان بصری را با استفاده از ارجاع‌های ورودی تعریف کنید یا فقط آن را با زبان طبیعی توصیف نمایید. Omni ارجاع‌های ورودی را با هم ترکیب می‌کند تا یک کلیپ منسجم بسازد.

خلق ویدئو با آواتار دیجیتال شخصی شما

گوگل به توسعه مسئولانه هوش مصنوعی متعهد است و سیاست‌های روشنی برای محافظت از کاربران در برابر آسیب‌ها و حاکمیت بر استفاده از ابزارهای هوش مصنوعی خود دارد. برای شروع، شما می‌توانید با استفاده از آواتارها، ویدئوهایی با صدای خود ایجاد کنید؛ این قابلیت یک نسخه دیجیتال از شما می‌سازد تا بتوانید ویدئوهایی تولید کنید که ظاهر و صدای شما را داشته باشند. فراتر از ویژگی آواتار، در خصوص ویرایش ویدئوها برای تغییر صدا و گفتار، همچنان در حال کار برای آزمایش این موضوع و درک بهتر نحوه ارائه مسئولانه این قابلیت به کاربران است.

تمامی ویدئوهای تولید شده با Omni شامل واترمارک دیجیتال و نامحسوس گوگل به نام SynthID هستند. شما می‌توانید به‌سادگی از طریق اپلیکیشن Gemini، Gemini در مرورگر کروم و جست‌وجوی گوگل، تأیید کنید که ویدئوها با Gemini Omni تولید شده‌اند.

دسترسی

Gemini Omni Flash از امروز برای تمامی مشترکین Google AI Plus، Pro و Ultra به‌صورت جهانی از طریق اپلیکیشن Gemini و Google Flow در حال عرضه است. همچنین این مدل از همین هفته بدون هیچ هزینه‌ای برای کاربران در YouTube Shorts و اپلیکیشن YouTube Create در دسترس قرار می‌گیرد. در هفته‌های آینده، این مدل از طریق APIها برای توسعه‌دهندگان و مشتریان سازمانی نیز عرضه خواهد شد.

مطالب پیشنهادی مرتبط

اشتراک در
اطلاع از
0 نظرات
بازخورد (Feedback) های اینلاین
مشاهده همه دیدگاه ها

در جریان مهم‌ترین اتفاقات AI بمانید

هر هفته، خلاصه‌ای از اخبار، تحلیل‌ها و رویدادهای هوش مصنوعی را در ایمیل‌تان دریافت کنید.

[wpforms id="48325"]