首頁LBank 新聞中心
黑森林實驗室發表 FLUX 3 AI:捨棄靜態圖像轉向影片 — 更搭載機器人手臂
black-forest-labs-flux-3-image-video-robot-hands
黑森林實驗室發表 FLUX 3 AI:捨棄靜態圖像轉向影片 — 更搭載機器人手臂
FLUX 3 是德國人工智慧實驗室的首款影片模型,而且這套系統已經在訓練機器人,使其能夠在奧迪的組裝線上作業。
2026-07-23 來源:decrypt.co

簡述

  • Black Forest Labs 已推出 FLUX 3 的搶先體驗版,這是其首個可生成影片的模型,能產生長達 20 秒並帶有同步音訊的片段。
  • 相同的核心技術驅動著 FLUX-mimic,這是一個與 mimic robotics 合作開發的機器人模型,Audi 已經在其生產線上進行測試。
  • 僅有開源權重的「開發者」(Dev) 版本計畫於 2026 年稍晚推出;影片 (Video) 和動作 (Action) 功能目前僅透過 API 和合作夥伴取得,圖像 (Image) 功能將於未來數週內推出。

Black Forest Labs 於週四發布了 FLUX 3,這是該公司旗艦模型首次能夠生成影片,而非僅僅是靜態圖像。這家以 FLUX 系列圖像生成器聞名的德國 AI 實驗室,透過一個共享系統,一次性地對新系統進行了圖像、影片和音訊的訓練。

這就是所謂的「多模態」(multimodality):一個模型同時學習多種資訊類型,而非將多個獨立工具並排放置。

影片功能是其主要特色。FLUX 3 可生成長達 20 秒的片段,並同步產生與螢幕內容(對話、音效、環境噪音)相符的音訊。在早期評估中,人類評審在 77% 的一對一比較中偏好 FLUX 3 的輸出而非 Runway Gen-4.5,在 93% 的比較中偏好 FLUX 3 而非 Luma Ray 3.2。它似乎略優於 Gemini Omni 和 Seedance,在 52% 的評估中擊敗了這些模型。

當然,這是一個偏好測試,而非固定的評分標準:評估者只是觀看兩個片段並選擇看起來和聽起來更具說服力的一個,而 BFL 則統計 FLUX 3 勝出的次數。

除此之外,該模型在靜態圖像方面也表現出色,延續了其一貫的優勢。BFL 分享了一些圖像,FLUX 3 似乎非常多功能,能夠生成超越寫實主義的各種風格。

BFL 將此定位為不僅僅是一個內容工具。「一個只學習圖像的模型只能生成圖像。」共同創辦人兼執行長 Robin Rombach 表示。該公司的預測是,學習預測影片也意味著學習其底層的物理原理——重量、接觸、時機——這正是機器在實體世界中移動所需要的。

這項預測有其名稱:FLUX-mimic。它與總部位於蘇黎世的 mimic robotics 共同開發,採用 FLUX 3 的影片預測引擎,並增加了一個輕量級的「解碼器」——一個小型附加組件,將模型對物體移動的內在感知轉化為實際的機器人動作。汽車製造商 Audi 已經在測試它處理諸如安裝彈性車門密封條等任務,這些是傳統自動化難以處理的工作。

mimic 共同創辦人 Stephan-Daniel Gravert 表示:「Audi 代表了我們為 FLUX-mimic 打造的製造業合作夥伴類型。」Audi 的 Christoph Schneider 說,這些機器人現在能夠「解決舊有機器無法處理的複雜軟體操作工作」。BFL 表示,整個系統的反應時間約為 101 毫秒,接近人類的視覺反射速度。

FLUX 的崛起並非憑空而來。Black Forest Labs 由一群資深研究員於 2024 年 8 月創立,他們曾協助 Stability AI 開發原始的 Stable Diffusion 模型。該公司推出的 Flux 模型擊敗了 MidJourney,並超越了 Stability 旗下表現平平的 Stable Diffusion 3。

開源的 Flux Dev 和 Schnell 模型奪得了「最佳開源圖像生成器」的稱號,而 AI 藝術家原本期望 Stability 捲土重來的 Stable Diffusion 3.5 能夠最終奪回此頭銜。

但它從未實現。FLUX 1.1 Pro 在同年十月登上了 Artificial Analysis 圖像競技場的榜首。不過,那個版本並非開源。

BFL 於 2025 年 11 月發布了 FLUX.2,但它並不像前作那麼受歡迎。原始 Flux 所擁有的開源桂冠,直到 2025 年底才被阿里巴巴的 Z-Image Turbo 奪走,後者在低階消費級顯示卡上達到了相似的品質。當時一位 CivitAI 用戶寫道:「這才是 SD3 應該有的樣子。」

FLUX 3 是 BFL 的回歸之作,但它尚未完全開源。根據 BFL 的說法,影片 (Video) 和動作 (Action) 功能目前正透過 API 和精選合作夥伴(其中包含 mimic robotics)進行搶先體驗,圖像生成 (Image generation) 功能將在「未來數週內」推出。開源權重的開發者 (Dev) 版本,也是 BFL 唯一計畫發布供本地使用的版本,預計要到 2026 年稍晚才會推出。