Gemini Omni Flash
رونمایی گوگل از خانواده مدلهای Gemini Omni
Gemini Omni Flash، مدلی که میتواند هر چیزی را از هر نوع ورودی تولید کند و این کار را با ویدئو آغاز میکند.
سال گذشته، نانو بنانا (Nano Banana) هوش Gemini را به حوزه تولید و ویرایش تصویر آورد. از آن زمان، این ابزار به میلیونها نفر کمک کرده است تا عکسهای قدیمی را بازیابی کنند، از روی طرحهای اولیه طراحی کنند و ایدهها را به روشهایی که پیشتر ممکن نبود، مصورسازی نمایند. گوگل از همان ابتدا Gemini را بهگونهای ساخته که از پایه بهصورت بومی چندوجهی (Natively Multimodal) باشد و اکنون در حال برداشتن گام بعدی است.
در همین راستان گوگل، سری Gemini Omni را توسعه داد و منتشر کرد؛ جایی که توانایی استدلال Gemini با توانمندی در خلقکردن تلاقی پیدا میکند. Omni مدل جدید گوگل است که میتواند از هر نوع ورودی، هر چیزی را خلق کند و این کار با ویدئو شروع میکند. با Omni، میتوانید تصاویر، صدا، ویدئو و متن را بهعنوان ورودی ترکیب کرده و ویدئوهایی با کیفیت بالا و مبتنی بر دانشِ Gemini از دنیای واقعی تولید کنید. همچنین میتوانید ویدئوهای خود را بهسادگی از طریق مکالمه به زبان طبیعی ویرایش نمایید.
گوگل اولین مدل از خانواده Omni به نام Gemini Omni Flash برای اپلیکیشن Gemini، Google Flow و YouTube Shorts عرضه کرده است. بهمرورزمان، از مدالیتههای خروجی مانند تصویر و صدا نیز پشتیبانی خواهد کرد.
در ادامه به برخی از ویژگیهایی که Omni را متمایز میکند، اشاره شده است:
ویرایش ویدئوها از طریق مکالمه
Gemini Omni روشی آسانتر برای ویرایش ویدئو با استفاده از زبان طبیعی در اختیار شما قرار میدهد. هر دستور بر پایه دستور قبلی بنا میشود. شخصیتهای شما ثابت میمانند، قوانین فیزیک پابرجا میمانند و صحنه آنچه را که پیشتر اتفاق افتاده است، بهخاطر میسپارد.
- تبدیل دنیای پیرامون خود. چیزهای خاصی را تغییر دهید، یا همه چیز را دگرگون کنید. ویدئوی شما به نقطه شروعی برای چیزی تبدیل میشود که هرگز خودتان قادر به فیلمبرداری از آن نبودید.
- بازآفرینی کنش (Action). ویدئویی که گرفتهاید را در نظر بگیرید و فقط از Omni بخواهید اتفاقاتی که در حال رخدادن است را تغییر دهد. کنش را ویرایش کنید، شخصیتها یا اشیا جدیدی اضافه کنید، یا یک لحظه را به چیزی غیرمنتظره تبدیل نمایید.
- بهبود ویدئوها در طی چند نوبت (Multiple turns). محیط، زاویه، سبک یا حتی جزئیات خاص را بدون ازدستدادن رشته صحنه اصلی خود تغییر دهید.
جانبخشی به ایدهها، مبتنی بر دانش Gemini از جهان
Gemini Omni فقط صحنههایی را که واقعی به نظر میرسند تولید نمیکند، بلکه در مورد آنچه باید در ادامه اتفاق بیفتد استدلال میکند. این مدل یک درک شهودی از فیزیک را با دانش Gemini از تاریخ، علم و زمینه ترکیب کرده و فاصله میان واقعگرایی عکسگونه (Photorealism) و داستانسرایی معنادار را پر میکند.
- خلق جلوههای بصری با فیزیک دقیقتر: Omni دارای درک شهودیِ بهبودیافتهای از نیروهایی مانند گرانش، انرژی جنبشی و دینامیک سیالات است که به شما اجازه میدهد صحنههای واقعگرایانهتری خلق کنید.
- ترکیب دانش و خلاقیت: Omni از دانش Gemini بهره میبرد تا زبان، تصاویر و معنا را به روشهایی که بسیار فراتر از تطبیق الگو است، به یکدیگر متصل کند.
- بصریسازی ایدههای پیچیده: Omni میتواند از طریق پرامپتهای کوتاه، ویدئوهای توضیحی جذابی خلق کند و جلوههای بصریای تولید کند که ایدههای پیچیدهتر را تجزیهوتحلیل میکنند.
خلق ویدئو از هر ترکیب ورودی
- ارجاع به هر چیزی: Omni هر مرجعی از تصویر، متن، ویدئو یا صدا را به یک خروجی یکپارچه و منسجم تبدیل میکند. اگرچه در ابتدا برای بخش صدا فقط ارجاعهای گفتاری (Voice references) پشتیبانی میشوند، بهزودی سایر انواع ورودیهای صوتی نیز عرضه خواهد کرد.
- شروع از آنچه در اختیار دارید: با منابع ورودی، میتوانید از تصاویر شخصیتها، صحنهها یا نقاشیها استفاده کنید تا به روشی که دقیقاً با چشمانداز شما مطابقت دارد، به خلق محتوا بپردازید.
- اعمال سبکها، حرکت یا افکتها: زبان بصری را با استفاده از ارجاعهای ورودی تعریف کنید یا فقط آن را با زبان طبیعی توصیف نمایید. Omni ارجاعهای ورودی را با هم ترکیب میکند تا یک کلیپ منسجم بسازد.
خلق ویدئو با آواتار دیجیتال شخصی شما
گوگل به توسعه مسئولانه هوش مصنوعی متعهد است و سیاستهای روشنی برای محافظت از کاربران در برابر آسیبها و حاکمیت بر استفاده از ابزارهای هوش مصنوعی خود دارد. برای شروع، شما میتوانید با استفاده از آواتارها، ویدئوهایی با صدای خود ایجاد کنید؛ این قابلیت یک نسخه دیجیتال از شما میسازد تا بتوانید ویدئوهایی تولید کنید که ظاهر و صدای شما را داشته باشند. فراتر از ویژگی آواتار، در خصوص ویرایش ویدئوها برای تغییر صدا و گفتار، همچنان در حال کار برای آزمایش این موضوع و درک بهتر نحوه ارائه مسئولانه این قابلیت به کاربران است.
تمامی ویدئوهای تولید شده با Omni شامل واترمارک دیجیتال و نامحسوس گوگل به نام SynthID هستند. شما میتوانید بهسادگی از طریق اپلیکیشن Gemini، Gemini در مرورگر کروم و جستوجوی گوگل، تأیید کنید که ویدئوها با Gemini Omni تولید شدهاند.
دسترسی
Gemini Omni Flash از امروز برای تمامی مشترکین Google AI Plus، Pro و Ultra بهصورت جهانی از طریق اپلیکیشن Gemini و Google Flow در حال عرضه است. همچنین این مدل از همین هفته بدون هیچ هزینهای برای کاربران در YouTube Shorts و اپلیکیشن YouTube Create در دسترس قرار میگیرد. در هفتههای آینده، این مدل از طریق APIها برای توسعهدهندگان و مشتریان سازمانی نیز عرضه خواهد شد.