
Black Forest Labs روز پنجشنبه FLUX 3 را منتشر کرد و برای اولین بار، مدل اصلی این شرکت به جای تصاویر ثابت، ویدئو تولید میکند. این آزمایشگاه هوش مصنوعی آلمانی، که به خاطر خط تولید ژنراتورهای تصویر FLUX شناخته میشود، سیستم جدید را بر روی تصاویر، ویدئو و صدا به طور همزمان، در یک سیستم مشترک آموزش داد.
این همان چیزی است که به عنوان چندوجهی (multimodality) شناخته میشود: یک مدل انواع مختلفی از اطلاعات را به طور همزمان یاد میگیرد، به جای ابزارهای جداگانه که در کنار هم قرار گرفتهاند.
بخش ویدئو ویژگی اصلی است. FLUX 3 کلیپهایی تا ۲۰ ثانیه تولید میکند، با صدایی که همراه با تصویر تولید میشود و با آنچه در صفحه نمایش اتفاق میافتد – دیالوگ، جلوههای صوتی، نویز محیط – همگامسازی شده است. در ارزیابیهای اولیه، داوران انسانی خروجی FLUX 3 را در ۷۷% از مقایسههای رودررو به Runway Gen-4.5 و در ۹۳% به Luma Ray 3.2 ترجیح دادند. به نظر میرسد که این مدل کمی بهتر از Gemini Omni و Seedance عمل میکند و در ۵۲% از ارزیابیها این مدلها را شکست میدهد.
البته، این یک آزمون ترجیحی است، نه یک معیار امتیازدهی ثابت: ارزیابها به سادگی دو کلیپ را تماشا میکنند و یکی را که متقاعدکنندهتر به نظر میرسد و صدا میدهد انتخاب میکنند، و BFL تعداد دفعاتی که FLUX 3 برنده میشود را محاسبه میکند.
علاوه بر این، به نظر میرسد این مدل در زمینه تصاویر ثابت نیز بسیار ماهر است، که ادامه دهنده میراث آن است. BFL چند تصویر را به اشتراک گذاشت و FLUX 3 بسیار همهکاره و قادر به تولید طیف وسیعی از سبکها فراتر از واقعگرایی فوتوگرافی به نظر میرسد.
BFL این را فراتر از یک ابزار محتوا میداند. رابین رومباخ، همبنیانگذار و مدیرعامل، گفت: "مدلی که فقط تصاویر را یاد میگیرد، فقط میتواند تصاویر را تولید کند." شرط این شرکت این است که یادگیری پیشبینی ویدئو به معنای یادگیری فیزیک زیربنایی آن – وزن، تماس، زمانبندی – است، که دقیقاً همان چیزی است که یک ماشین برای حرکت در دنیای فیزیکی به آن نیاز دارد.
این شرط نامی دارد: FLUX-mimic. این مدل که با همکاری mimic robotics مستقر در زوریخ ساخته شده است، موتور پیشبینی ویدئوی FLUX 3 را میگیرد و یک "دیکدر" سبکوزن – یک جزء کوچک افزودنی که حس درونی مدل از نحوه حرکت اشیا را به حرکات واقعی ربات ترجمه میکند – به آن اضافه میکند. شرکت خودروسازی آئودی در حال حاضر آن را برای کارهایی مانند نصب نوارهای درزگیر انعطافپذیر درب آزمایش میکند، کاری که اتوماسیونهای معمولی در انجام آن مشکل داشتهاند.
استفان-دانیل گراورت، همبنیانگذار mimic، گفت: "آئودی نشاندهنده نوع شریک تولیدی است که ما FLUX-mimic را برای آن ساختیم." کریستوف اشنایدر از آئودی گفت که رباتها اکنون "کارهای پیچیده دستکاری اجسام نرم" را حل میکنند که ماشینهای قدیمیتر قادر به انجام آن نبودند. BFL میگوید که کل سیستم در حدود ۱۰۱ میلیثانیه واکنش نشان میدهد که تقریباً در حد رفلکسهای بینایی انسان است.
ظهور FLUX به طور ناگهانی اتفاق نیفتاد. Black Forest Labs که در آگوست ۲۰۲۴ توسط محققان با تجربهای که در ساخت مدلهای اصلی Stable Diffusion در Stability AI کمک کرده بودند، تأسیس شد، مدلهای Flux را راهاندازی کرد که MidJourney را شکست دادند و از Stable Diffusion 3 ناکافی خود Stability برتری یافتند.
مدلهای متنباز Flux Dev و Schnell عنوان "بهترین ژنراتور تصویر متنباز" را به دست آوردند، عنوانی که هنرمندان هوش مصنوعی انتظار داشتند Stable Diffusion 3.5، نسخه بازنگری شده Stability، در نهایت آن را پس بگیرد.
هرگز این اتفاق نیفتاد. FLUX 1.1 Pro در اکتبر همان سال در رقابت تصویرسازی Artificial Analysis به اوج رسید. هرچند آن نسخه متنباز نبود.
BFL در نوامبر ۲۰۲۵ FLUX.2 را منتشر کرد اما آنقدر محبوب نشد. تاج متنباز که توسط Flux اصلی حفظ شده بود، تا اواخر ۲۰۲۵ و با آمدن Z-Image Turbo از علیبابا از دست رفت، که کیفیت آن را در کارتهای گرافیک پایینرده مصرفکننده همسان کرد. یکی از کاربران CivitAI در آن زمان نوشت: "این همان چیزی بود که SD3 قرار بود باشد."
FLUX 3 بازگشت BFL است و هنوز به طور کامل متنباز نیست. ویدئو و اکشن در حال حاضر از طریق APIها و شرکای منتخب، از جمله mimic robotics، در دسترسی اولیه قرار دارند، و تولید تصویر "در هفتههای آینده" طبق اعلام BFL عرضه میشود. نسخه Dev با وزن باز (open-weight)، تنها سطحی که BFL قصد دارد برای استفاده محلی منتشر کند، تا اواخر ۲۰۲۶ عرضه نخواهد شد.