Generic filters
Search in title
Filter by دسته‌ها
chatGTP
ابزارهای هوش مصنوعی
اخبار
گزارش خبری
پرامپت‌ نویسی
تیتر یک
چندرسانه ای
آموزش علوم داده
اینفوگرافیک
پادکست
ویدیو
دانش روز
آموزش‌های پایه‌ای هوش مصنوعی
اصول هوش مصنوعی
یادگیری بدون نظارت
یادگیری تقویتی
یادگیری عمیق
یادگیری نیمه نظارتی
آموزش‌های پیشرفته هوش مصنوعی
بینایی ماشین
پردازش زبان طبیعی
پردازش گفتار
چالش‌های عملیاتی
داده کاوی و بیگ دیتا
رایانش ابری و HPC
سیستم‌‌های امبدد
علوم شناختی
خطرات هوش مصنوعی
دیتاست
مدل‌های بنیادی
رویدادها
جیتکس
جیتکس ترکیه
کاربردهای هوش مصنوعی
کتابخانه
اشخاص
شرکت‌های هوش مصنوعی
محصولات و مدل‌های هوش مصنوعی
مفاهیم
کسب‌و‌کار
تحلیل بازارهای هوش مصنوعی
کارآفرینی
هوش مصنوعی در ایران
هوش مصنوعی در جهان
مقاله
پیاده‌سازی هوش مصنوعی
گزارش
مصاحبه
هوش مصنوعی در عمل
یادداشت
 مدل مولد ویدئو FLUX 3؛ حرکت به‌سوی مدل‌های جهان واقعی

FLUX 3

مدل مولد ویدئو FLUX 3؛ حرکت به‌سوی مدل‌های جهان واقعی

زمان مطالعه: 4 دقیقه

استارتاپ Black Forest Labs از مدل جدید مولد ویدئو خود به نام FLUX 3 رونمایی کرد؛ یک مدل پایه چندوجهی که با هدف ایجاد درک جامع‌تری از جهان طراحی شده است.

FLUX 3 از تصاویر، ویدئوها و صدا در یک معماری یکپارچه یاد می‌گیرد. هیچ‌کدام از وجه‌های اطلاعاتی به‌تنهایی توصیف کاملی از جهان ارائه نمی‌دهد. هرکدام از آن‌ها یک تصویر از همان واقعیت زیربنایی هستند که توسط حسگرهای مختلف ثبت شده‌اند و هر یک در این فرایند بخشی از اطلاعات را از دست می‌دهد. تصاویر، ساختارهای فضایی و روابط میان اشیا را در یک لحظه مشخص ثبت می‌کنند. ویدئو بُعد زمان را بازمی‌گرداند و پویایی‌های زمانی و قوانین فیزیکی را آشکار می‌کند. صدا نیز روابط علّی میان پدیده‌های مکانیکی و ویژگی‌های صوتی را آشکار می‌کند؛ روابطی که تنها از طریق بینایی قابل‌تشخیص نیستند. زبان این ادراک‌ها را به اهداف، مفاهیم انتزاعی و دستورالعمل‌ها پیوند می‌دهد.

اگر یک مدل فقط از یکی از این وجه‌ها یاد بگیرد، در نهایت یک مدل خوب از همان وجه خاص به دست می‌آید؛ اما اگر از همه آن‌ها به‌صورت هم‌زمان یاد بگیرد، محدودیت‌ها و ارتباطات متقابل میان آن‌ها اطلاعات بیشتری ارائه می‌کنند؛ به‌طوری که صدا باید با برخورد هماهنگ باشد، حرکت باید از جرم و قوانین فیزیکی پیروی کند و آینده باید از گذشته ناشی شود. در این حالت، وجه‌های مختلف دیگر عناصر جداگانه نیستند؛ بلکه به شواهدی درباره یک واقعیت زیربنایی واحد تبدیل می‌شوند.

FLUX 3 نخستین مدل این آزمایشگاه است که کاملاً بر اساس این اصل ساخته شده است؛ مدلی که قادر است در محیط‌های فیزیکی و دیجیتال ادراک، پیش‌بینی و عمل کند.

FLUX 3 بر پایه رویکرد Self-Flow ساخته شده است؛ رویکردی که Black Forest Labs برای هم‌ترازی کارآمد تولید و درک چندوجهی درون یک معماری زیربنایی مشترک توسعه داده است. بر اساس این رویکرد، منابع محاسباتی و داده‌های آموزشی به طور قابل‌توجهی افزایش داده شده تا FLUX 3 را به‌صورت هم‌زمان روی ویدئو، تصویر و صدا آموزش ببیند.

در نتیجه، FLUX 3 قادر است وجه‌های مختلف اطلاعاتی را با یکدیگر ترکیب کند و تصاویر و ویدئو به همراه صدا را به‌صورت مشترک تولید کند؛ هم از طریق دستورهای متنی ساده و هم با ارائه ورودی‌های مرجع مانند تصاویر و ویدئوها.

FLUX 3 می‌تواند ویدئوهای بسیار متنوعی همراه با صدا، تا طول ۲۰ ثانیه را در یک فرایند تولید واحد ایجاد کند.

قابلیت‌های اصلی آن شامل موارد زیر است (تمام خروجی‌ها دارای تولید بومی صدا هستند):

  • تولید ویدئو از متن (Text-to-Video Generation).
  • تولید ویدئو از تصویر (Image-to-Video Generation)؛ چه با ادامه‌دادن از یک فریم آغازین («متحرک‌سازی») و چه با استفاده از تصاویر به‌عنوان مرجع بصری.
  • تولید ویدئو از ویدئو (Video-to-Video Generation) بر اساس یک کلیپ مرجع؛ به‌گونه‌ای که عناصر اصلی ویدئوی اولیه برای مثال همان شخصیت به یک صحنه یا زمینه جدید منتقل شوند.
  • ادامه تولیدی ویدئو و صدا بر اساس ویدئو و صدای ورودی.
  • تولید ویدئو از فریم‌های کلیدی (Keyframe-to-Video Generation) برای ایجاد گذارهای کنترل‌شده میان لحظات مشخص.
  • گفت‌وگوی چندزبانه.
  • طیف گسترده‌ای از سبک‌های بصری و نسبت‌های تصویر مختلف که بسیار فراتر از خروجی‌های سینمایی مرسوم هستند.
  • زنجیره‌سازی عامل‌محور (Agentic Chaining) از کلیپ‌های مجزا برای ساخت سکانس‌های طولانی‌تر و چندنما.
  • تنوع بالای سبک؛ FLUX 3  به‌راحتی طیف گسترده‌ای از سبک‌ها، از تصاویر دوربین‌های دستی آماتوری تا انیمیشن و تولیدات سینمایی را مدیریت می‌کند.
  • تولید تایپوگرافی و طراحی‌های متحرک.

در ارزیابی‌های اولیه، FLUX 3 در مقایسه‌های انجام‌شده در برابر مدل‌های زیر ترجیح داده شد:

  • Grok Imagine Video در حداکثر ۶۹ درصد مقایسه‌ها،
  • Kling v3 Pro در ۶۰ درصد،
  • Happy Horse v1 در ۵۹ درصد،
  • Happy Horse 1.1 در ۵۷ درصد،
  • Seedance 2.0 و Gemini Omni Flash در ۵۲ درصد.

همچنین FLUX 3 در ۷۷ درصد مقایسه‌ها نسبت به Runway Gen-4.5 و در ۹۳ درصد مقایسه‌ها نسبت به Luma Ray 3.2 ترجیح داده شد.

باوجوداینکه FLUX 3 هنوز در مرحله توسعه قرار دارد، این مدل هم‌اکنون در ثبت حالات چهره انسان، ارتباط‌دادن صداها با رویدادهای فیزیکی و قابلیت‌های چندزبانه عملکرد قابل‌توجهی دارد. علاوه بر این، این قابلیت‌ها می‌توانند با یکدیگر ترکیب شوند تا سکانس‌هایی چنددقیقه‌ای ایجاد شود؛ سکانس‌هایی که در آن‌ها مراجع بصری کمک می‌کنند شخصیت‌ها در تمام صحنه‌ها پایدار و سازگار باقی بمانند.

مدل FLUX 3 Video اکنون از طریق برنامه دسترسی اولیه در دسترس است.

همچنین FLUX 3 می‌تواند تصاویر را در طیف گسترده‌ای از سبک‌ها، نسبت‌های تصویر و وضوح‌ها تولید و ویرایش کند. در ارزیابی‌های اولیه که در طول مرحله آموزش میانی (Midtraining) انجام شد، FLUX 3 هم‌اکنون نسبت به نسخه‌های قبلی FLUX بهبود قابل‌توجهی نشان می‌دهد؛ به‌ویژه در توانایی پردازش دستورهای پیچیده و تولید متن. این مدل طیف گسترده‌ای از سبک‌های خروجی را تولید می‌کند و قادر است متن‌هایی با دقت بالا را به زبان‌های مختلف نمایش دهد. مانند ارزیابی‌های ویدئویی، این نتایج نیز مقدماتی هستند و انتظار داریم پیش از انتشار نهایی، بهبودهای بیشتری ایجاد شود. ما در هفته‌های آینده مرحله دسترسی اولیه برای FLUX 3 Image را آغاز خواهیم کرد.

درک جهان توسط FLUX 3 به پیش‌بینی اقدام‌ها نیز گسترش پیدا می‌کند. برای دستیابی به این قابلیت، دو مسیر دنبال شده است:

  • نخست، ادغام قابلیت پیش‌بینی اقدام به‌صورت بومی در خود FLUX 3؛ مسیری که ادامه و توسعه کارهای اولیه این آزمایشگاه در Self-Flow است.
  • دوم، استفاده از مبناهای ویدئویی آموزش‌دیده مدل به‌عنوان یک پایه آگاه از پویایی‌های جهان (Dynamics-aware Foundation) که می‌توان مدل‌های تخصصی عمل را با استفاده از داده‌های محدود و اختصاصی هر وظیفه، روی آن فاین‌تیون کرد.

در هفته‌ها و ماه‌های آینده، قابلیت‌های زیر پس از گذراندن یک مرحله دسترسی اولیه ارائه خواهد شد.  تمامی این قابلیت‌ها بر پایه یک مدل زیربنایی یکسان از Flow Matching چندوجهی ساخته شده‌اند.

این قابلیت‌ها و مدل‌ها شامل موارد زیر هستند:

  • تولید و ویرایش ویدئو و صدا از طریق APIها و دسترسی خصوصی به وزن‌های مدل (FLUX 3 Video).
  • تولید و ویرایش تصویر از طریق APIها و دسترسی خصوصی به وزن‌های مدل (FLUX 3 Image).
  • دسترسی آزاد به وزن‌های یک مبنای چندوجهی برای تولید محتوا (ویدئو، صدا و تصویر) و پیش‌بینی عمل (FLUX 3 Dev).

مطالب پیشنهادی مرتبط

اشتراک در
اطلاع از
0 نظرات
بازخورد (Feedback) های اینلاین
مشاهده همه دیدگاه ها

در جریان مهم‌ترین اتفاقات AI بمانید

هر هفته، خلاصه‌ای از اخبار، تحلیل‌ها و رویدادهای هوش مصنوعی را در ایمیل‌تان دریافت کنید.

[wpforms id="48325"]