صفحه اصلیمرکز اخبار LBank
بلک فارست لبز از FLUX 3 AI رونمایی می‌کند: تصاویر ثابت را کنار گذاشته و به ویدئو — و دست‌های رباتیک — روی می‌آورد
black-forest-labs-flux-3-image-video-robot-hands
بلک فارست لبز از FLUX 3 AI رونمایی می‌کند: تصاویر ثابت را کنار گذاشته و به ویدئو — و دست‌های رباتیک — روی می‌آورد
FLUX 3 اولین مدل ویدیویی آزمایشگاه هوش مصنوعی آلمانی است و همین سیستم در حال حاضر به ربات‌ها آموزش می‌دهد تا در خط مونتاژ آئودی کار کنند.
2026-07-23 منبع:decrypt.co

به طور خلاصه

  • Black Forest Labs نسخه اولیه FLUX 3 را منتشر کرده است، اولین مدل تولیدکننده ویدئوی این شرکت که کلیپ‌هایی تا ۲۰ ثانیه با صدای همگام‌سازی شده تولید می‌کند.
  • همین زیربنا به FLUX-mimic، یک مدل رباتیک که با mimic robotics ساخته شده و آئودی در خط تولید خود آن را آزمایش می‌کند، قدرت می‌دهد.
  • تنها نسخه "Dev" با وزن باز (open-weight) برای اواخر سال ۲۰۲۶ برنامه‌ریزی شده است؛ فعلاً ویدئو و اکشن از طریق APIها و دسترسی شرکا قابل استفاده هستند و بخش تصویر نیز در هفته‌های آینده عرضه می‌شود.

Black Forest Labs روز پنجشنبه FLUX 3 را منتشر کرد و برای اولین بار، مدل اصلی این شرکت به جای تصاویر ثابت، ویدئو تولید می‌کند. این آزمایشگاه هوش مصنوعی آلمانی، که به خاطر خط تولید ژنراتورهای تصویر FLUX شناخته می‌شود، سیستم جدید را بر روی تصاویر، ویدئو و صدا به طور همزمان، در یک سیستم مشترک آموزش داد.

این همان چیزی است که به عنوان چندوجهی (multimodality) شناخته می‌شود: یک مدل انواع مختلفی از اطلاعات را به طور همزمان یاد می‌گیرد، به جای ابزارهای جداگانه که در کنار هم قرار گرفته‌اند.

بخش ویدئو ویژگی اصلی است. FLUX 3 کلیپ‌هایی تا ۲۰ ثانیه تولید می‌کند، با صدایی که همراه با تصویر تولید می‌شود و با آنچه در صفحه نمایش اتفاق می‌افتد – دیالوگ، جلوه‌های صوتی، نویز محیط – همگام‌سازی شده است. در ارزیابی‌های اولیه، داوران انسانی خروجی FLUX 3 را در ۷۷% از مقایسه‌های رودررو به Runway Gen-4.5 و در ۹۳% به Luma Ray 3.2 ترجیح دادند. به نظر می‌رسد که این مدل کمی بهتر از Gemini Omni و Seedance عمل می‌کند و در ۵۲% از ارزیابی‌ها این مدل‌ها را شکست می‌دهد.

البته، این یک آزمون ترجیحی است، نه یک معیار امتیازدهی ثابت: ارزیاب‌ها به سادگی دو کلیپ را تماشا می‌کنند و یکی را که متقاعدکننده‌تر به نظر می‌رسد و صدا می‌دهد انتخاب می‌کنند، و BFL تعداد دفعاتی که FLUX 3 برنده می‌شود را محاسبه می‌کند.

علاوه بر این، به نظر می‌رسد این مدل در زمینه تصاویر ثابت نیز بسیار ماهر است، که ادامه دهنده میراث آن است. BFL چند تصویر را به اشتراک گذاشت و FLUX 3 بسیار همه‌کاره و قادر به تولید طیف وسیعی از سبک‌ها فراتر از واقع‌گرایی فوتوگرافی به نظر می‌رسد.

BFL این را فراتر از یک ابزار محتوا می‌داند. رابین رومباخ، هم‌بنیانگذار و مدیرعامل، گفت: "مدلی که فقط تصاویر را یاد می‌گیرد، فقط می‌تواند تصاویر را تولید کند." شرط این شرکت این است که یادگیری پیش‌بینی ویدئو به معنای یادگیری فیزیک زیربنایی آن – وزن، تماس، زمان‌بندی – است، که دقیقاً همان چیزی است که یک ماشین برای حرکت در دنیای فیزیکی به آن نیاز دارد.

این شرط نامی دارد: FLUX-mimic. این مدل که با همکاری mimic robotics مستقر در زوریخ ساخته شده است، موتور پیش‌بینی ویدئوی FLUX 3 را می‌گیرد و یک "دیکدر" سبک‌وزن – یک جزء کوچک افزودنی که حس درونی مدل از نحوه حرکت اشیا را به حرکات واقعی ربات ترجمه می‌کند – به آن اضافه می‌کند. شرکت خودروسازی آئودی در حال حاضر آن را برای کارهایی مانند نصب نوارهای درزگیر انعطاف‌پذیر درب آزمایش می‌کند، کاری که اتوماسیون‌های معمولی در انجام آن مشکل داشته‌اند.

استفان-دانیل گراورت، هم‌بنیانگذار mimic، گفت: "آئودی نشان‌دهنده نوع شریک تولیدی است که ما FLUX-mimic را برای آن ساختیم." کریستوف اشنایدر از آئودی گفت که ربات‌ها اکنون "کارهای پیچیده دستکاری اجسام نرم" را حل می‌کنند که ماشین‌های قدیمی‌تر قادر به انجام آن نبودند. BFL می‌گوید که کل سیستم در حدود ۱۰۱ میلی‌ثانیه واکنش نشان می‌دهد که تقریباً در حد رفلکس‌های بینایی انسان است.

ظهور FLUX به طور ناگهانی اتفاق نیفتاد. Black Forest Labs که در آگوست ۲۰۲۴ توسط محققان با تجربه‌ای که در ساخت مدل‌های اصلی Stable Diffusion در Stability AI کمک کرده بودند، تأسیس شد، مدل‌های Flux را راه‌اندازی کرد که MidJourney را شکست دادند و از Stable Diffusion 3 ناکافی خود Stability برتری یافتند.

مدل‌های متن‌باز Flux Dev و Schnell عنوان "بهترین ژنراتور تصویر متن‌باز" را به دست آوردند، عنوانی که هنرمندان هوش مصنوعی انتظار داشتند Stable Diffusion 3.5، نسخه بازنگری شده Stability، در نهایت آن را پس بگیرد.

هرگز این اتفاق نیفتاد. FLUX 1.1 Pro در اکتبر همان سال در رقابت تصویرسازی Artificial Analysis به اوج رسید. هرچند آن نسخه متن‌باز نبود.

BFL در نوامبر ۲۰۲۵ FLUX.2 را منتشر کرد اما آنقدر محبوب نشد. تاج متن‌باز که توسط Flux اصلی حفظ شده بود، تا اواخر ۲۰۲۵ و با آمدن Z-Image Turbo از علی‌بابا از دست رفت، که کیفیت آن را در کارت‌های گرافیک پایین‌رده مصرف‌کننده همسان کرد. یکی از کاربران CivitAI در آن زمان نوشت: "این همان چیزی بود که SD3 قرار بود باشد."

FLUX 3 بازگشت BFL است و هنوز به طور کامل متن‌باز نیست. ویدئو و اکشن در حال حاضر از طریق APIها و شرکای منتخب، از جمله mimic robotics، در دسترسی اولیه قرار دارند، و تولید تصویر "در هفته‌های آینده" طبق اعلام BFL عرضه می‌شود. نسخه Dev با وزن باز (open-weight)، تنها سطحی که BFL قصد دارد برای استفاده محلی منتشر کند، تا اواخر ۲۰۲۶ عرضه نخواهد شد.

رمزارز های محبوب
همین حالا ثبت‌نام کنید، هیچ به‌روزرسانی‌ای را از دست ندهید!