首頁LBank 新聞中心
阿里巴巴新版通義千問圖像3 AI:追求實用,不只美觀
alibaba-qwen-image-3-ai-useful-not-just-pretty
阿里巴巴新版通義千問圖像3 AI:追求實用,不只美觀
Qwen Image 3.0 能一次性生成密集的報紙和資訊圖表網格,並將文字渲染至最小10像素。其不足之處在於:缺乏基準測試,且未提供開放權重。
2026-07-22 來源:decrypt.co

摘要

  • 阿里巴巴通義團隊於7月21日發布的Qwen-Image-3.0,可接受4,500個token的指令。
  • 這使得複雜的版面設計,如報紙、分鏡圖和密集的資訊圖表網格,能夠一次性生成。
  • 與前一代不同,此次發布未提供開放模型權重、基準測試或技術報告;目前可於chat.qwen.ai使用,API定價尚未公布。

阿里巴巴通義團隊週二推出了Qwen Image 3.0,其宣傳重點與輸出畫面的美觀程度無關。它關乎輸出成果是否真的能在工作中派上用場。

大多數AI圖像工具——Reve、Nano Banana、Seedream——都專為特定領域而設計,例如:創意、真實感、編輯能力等等。Qwen Image 3.0則走向了不同的方向。通義團隊在官方公告中寫道:「Qwen-Image-3.0不僅追求『美觀』,更追求『實用』,使其成為一款真正可部署的生產力工具。」

核心特色是這家中國巨頭阿里巴巴所稱的「豐富內容」。該模型可接受多達4,500個token,這是前一代處理能力的4.5倍。token是AI讀取的文字單位;可以將一個token想像成大約一個單詞或單詞的一部分,因此4,500個token就是數頁詳細指令。

這足以在單一提示中描述九個獨立的資訊圖表面板,並將其作為一張完整的圖像生成。

阿里巴巴在其部落格中寫道:「上方整張圖片是由Qwen-Image-3.0一次性生成,而非由多張圖片拼湊而成。」演示中的每個面板都包含其自身的圖表、公式、標題和小字文本——一次性渲染,而非後製組裝。

這是唯一能夠在沒有重大錯誤的情況下達成此目標的模型。

第二部分是該公司所稱的「真實細節」。根據阿里巴巴的說法,該模型「支援精確渲染小至10像素的文字,生動重現毛孔和髮絲等微觀細節,呈現栩栩如生的描繪。」十像素屬於小字印刷——就像你在藥品免責聲明上看到的那種。該模型還能在完整的學術論文模擬中,準確處理LaTeX(研究人員用來撰寫複雜數學方程式的符號系統)。

在我們常規的測試中,我們會給模型幾句話,並評估它們如何處理這些內容。根據阿里巴巴的官方部落格,Qwen Image 3.0能夠生成下方圖片。

我們使用該模型最快的配置測試了這項功能。Qwen Image 3.0能夠重現《Decrypt》上的一整篇文章。執行效果確實令人印象深刻,但結果並非完美無瑕。

Qwen Image 3.0的第三個支柱是「深度知識」。根據通義團隊的說法,該模型「支援12種語言的原生渲染,模擬網頁、遊戲和直播等主流介面,並汲取豐富的世界知識。」它還能連接網路獲取即時數據,這意味著要求其為特定城市和日期生成天氣預報視覺效果時,會返回準確的圖形,而非隨意猜測。

例如,阿里巴巴分享了一張葉子上的昆蟲照片。該模型能夠根據其對圖片的理解生成相關文本。

阿里巴巴正向需要大量可供生產使用的視覺素材的設計工作室、內容團隊、電子商務營運商和教育工作者推廣。

然而,值得注意的是,在阿里巴巴自家的Qwen-Image-Bench評估中——這是一個衡量18個模型的圖像品質、美學和現實世界保真度的基準測試——前一代旗艦產品Qwen Image 2.0 Pro排名第五。OpenAI的GPT Image 2位居榜首。新模型可能表現更好,但此次發布沒有提供衡量方法來證實這一點,因為它沒有附帶基準測試表、可下載權重或技術報告。

Qwen Image 1.0是根據Apache 2.0許可證以開放權重發布的,並附帶了同日的技術報告。而這次沒有。作為阿里巴巴近期AI推動的一部分,這裡的證據完全是該公司選擇發布的精選範例圖片。API試用版可在chat.qwen.ai上使用。定價尚未公布。