Qwen-Image-3.0 能夠單次渲染多面板資訊圖表,生成小至十像素的清晰文字,並支援十二種語言。然而,AI 生成的學術論文和報紙頁面作為靜態圖像的實用性,仍有待觀察。

阿里巴巴的 Qwen 團隊發布了其圖像生成器的第三個版本 Qwen-Image-3.0。該團隊表示,第一版側重於「精確度」,第二版則針對「精確度、多樣性、完整性、美觀性和真實性」。這次,Qwen 將其目標總結為一個詞:「真實」。這個模型旨在處理報紙版面、分鏡圖和考卷等實際工作,而不僅僅是生成吸引人的圖像。

更長的提示詞讓模型能單次建立複雜的版面。Qwen-Image-3.0 接受最長達 4,500 個 token 的提示詞。團隊表示,這讓模型有足夠的空間一次性創建密集的版面,而不是從多個圖像中組裝。

一個示範將九個獨立的資訊圖表打包成 3x3 的網格,每個圖表都有自己的文字、公式和插圖。這些面板涵蓋了隧道附近的跟車安全距離、垂直線、關於情感與理性的儒家教誨,以及拋射物從旋轉圓柱體脫離的速度。其他面板則解釋了肝吸蟲的生命週期、右側胸痛、72 階群的 Sylow 定理、銀行內部控制,以及動植物細胞中的 DNA。

團隊還展示了模型如何處理巢狀介面。一個例子從一個包含 Qwen Chat 螢幕的 VSCode 視窗開始。該螢幕內部是一個 WeChat 對話,其中包含一張解釋如何製作手沖咖啡的海報。

十像素文字和 LaTeX 公式提升了渲染精確度。Qwen 表示,該模型可以生成小至十像素的清晰文字。其範例包括一張充滿文字的鯨鯊資訊圖表,以及一篇虛構代數幾何論文的完整頁面。該論文包含多行 LaTeX 方程式,帶有下標、上標、括號、分數、求和與乘積符號。其他示範還展示了模擬報紙頁面和類似教師筆記的紅色手寫評論。

Qwen-Image-3.0 也致力於在肖像和物體中實現照片級的細節,包括可見的毛孔、皮膚紋理和單根頭髮。在另一個編輯示範中,該模型修復了一幅受損的傳統水墨畫《雙鷹圖》。它填補了缺失區域,同時與原始筆觸和墨色深淺保持一致。

語言支援和使用者介面模型擴大了該模型的應用範圍。Qwen 將第三個重點領域描述為「深度知識」。該模型原生支援十二種語言,包括日語、韓語和西班牙語。發布的範例還展示了它能重現網站、遊戲和直播的介面。在一個編輯示範中,該模型將一張昆蟲照片轉換成完整的識別圖板,包含分類學、物理特徵標籤、放大細節視圖和比例尺。

根據 Qwen 的說法,該模型還能抓取即時網路數據,並用它來生成杭州的天氣預報等內容。另一個例子則將中國水墨畫家齊白石和文森特·梵谷一同置於一個模擬的直播工作室中。

阿里巴巴在今年五月才發布了其前身 Qwen-Image-2.0。當時的技術報告主要關注訓練和推論效率的提升,包括一個更快的變體,每張圖像只需四個步驟而非四十個。在阿里巴巴自家的競技平台測試中,Qwen-Image-2.0 僅次於 OpenAI 的 GPT-Image-2 和 Google 的 Nano Banana Pro。

目前,Qwen-Image-3.0 似乎僅透過邀請制的 API 存取提供。該模型預計很快將出現在 Qwen Chat 等第一方應用程式中。與最初的 Qwen-Image 不同,該模型的權重不太可能以開源許可證發布。

這項技術令人印象深刻,但某些應用場景的實用性仍有疑問。一些示範的實際價值尚不明確。研究人員通常使用 LaTeX 編寫和排版論文,而不是將其渲染為圖像,因此 AI 生成的帶有公式的頁面可能更適合用於模型或視覺草稿,而非最終論文。

類似的問題也適用於報紙頁面和複雜的資訊圖表。現代圖像模型可以編輯單個文字元素,但可搜尋和可編輯的格式在生產工作中仍提供更大的靈活性。儘管如此,這些範例展示了文字渲染技術的進步程度,並可能指向超出此處示範的有用應用。