
Black Forest Labs 於週四發布了 FLUX 3,這是該公司旗艦模型首次能夠生成影片,而非僅僅是靜態圖像。這家以 FLUX 系列圖像生成器聞名的德國 AI 實驗室,透過一個共享系統,一次性地對新系統進行了圖像、影片和音訊的訓練。
這就是所謂的「多模態」(multimodality):一個模型同時學習多種資訊類型,而非將多個獨立工具並排放置。
影片功能是其主要特色。FLUX 3 可生成長達 20 秒的片段,並同步產生與螢幕內容(對話、音效、環境噪音)相符的音訊。在早期評估中,人類評審在 77% 的一對一比較中偏好 FLUX 3 的輸出而非 Runway Gen-4.5,在 93% 的比較中偏好 FLUX 3 而非 Luma Ray 3.2。它似乎略優於 Gemini Omni 和 Seedance,在 52% 的評估中擊敗了這些模型。
當然,這是一個偏好測試,而非固定的評分標準:評估者只是觀看兩個片段並選擇看起來和聽起來更具說服力的一個,而 BFL 則統計 FLUX 3 勝出的次數。
除此之外,該模型在靜態圖像方面也表現出色,延續了其一貫的優勢。BFL 分享了一些圖像,FLUX 3 似乎非常多功能,能夠生成超越寫實主義的各種風格。
BFL 將此定位為不僅僅是一個內容工具。「一個只學習圖像的模型只能生成圖像。」共同創辦人兼執行長 Robin Rombach 表示。該公司的預測是,學習預測影片也意味著學習其底層的物理原理——重量、接觸、時機——這正是機器在實體世界中移動所需要的。
這項預測有其名稱:FLUX-mimic。它與總部位於蘇黎世的 mimic robotics 共同開發,採用 FLUX 3 的影片預測引擎,並增加了一個輕量級的「解碼器」——一個小型附加組件,將模型對物體移動的內在感知轉化為實際的機器人動作。汽車製造商 Audi 已經在測試它處理諸如安裝彈性車門密封條等任務,這些是傳統自動化難以處理的工作。
mimic 共同創辦人 Stephan-Daniel Gravert 表示:「Audi 代表了我們為 FLUX-mimic 打造的製造業合作夥伴類型。」Audi 的 Christoph Schneider 說,這些機器人現在能夠「解決舊有機器無法處理的複雜軟體操作工作」。BFL 表示,整個系統的反應時間約為 101 毫秒,接近人類的視覺反射速度。
FLUX 的崛起並非憑空而來。Black Forest Labs 由一群資深研究員於 2024 年 8 月創立,他們曾協助 Stability AI 開發原始的 Stable Diffusion 模型。該公司推出的 Flux 模型擊敗了 MidJourney,並超越了 Stability 旗下表現平平的 Stable Diffusion 3。
開源的 Flux Dev 和 Schnell 模型奪得了「最佳開源圖像生成器」的稱號,而 AI 藝術家原本期望 Stability 捲土重來的 Stable Diffusion 3.5 能夠最終奪回此頭銜。
但它從未實現。FLUX 1.1 Pro 在同年十月登上了 Artificial Analysis 圖像競技場的榜首。不過,那個版本並非開源。
BFL 於 2025 年 11 月發布了 FLUX.2,但它並不像前作那麼受歡迎。原始 Flux 所擁有的開源桂冠,直到 2025 年底才被阿里巴巴的 Z-Image Turbo 奪走,後者在低階消費級顯示卡上達到了相似的品質。當時一位 CivitAI 用戶寫道:「這才是 SD3 應該有的樣子。」
FLUX 3 是 BFL 的回歸之作,但它尚未完全開源。根據 BFL 的說法,影片 (Video) 和動作 (Action) 功能目前正透過 API 和精選合作夥伴(其中包含 mimic robotics)進行搶先體驗,圖像生成 (Image generation) 功能將在「未來數週內」推出。開源權重的開發者 (Dev) 版本,也是 BFL 唯一計畫發布供本地使用的版本,預計要到 2026 年稍晚才會推出。