Qwen-Image-3.0是千問團隊於2026年7月21日發布的第三代圖像生成基礎模型,主打高密度視覺內容:最高4.5K Token提示、約10px小字、12種語言、20多種字體,以及報紙、試卷、資訊圖、複雜UI和多格分鏡等版面。
它最適合扮演視覺初稿引擎。模型可以把長規格轉成接近成品的點陣圖片,不能自動保證文字、數據、公式與知識正確,也不會因為畫面像PPT或App,就產生可編輯的簡報元件與前端程式碼。
重點快讀
- 4.5K Token是提示輸入上限,不是圖中可正確呈現的字數。
- 官方展示包含報紙、試卷、知識圖解、UI、畫中畫與電影分鏡。
- 約10px文字屬渲染能力展示,正式內容仍要OCR與人工校對。
- 12種語言和20多種字體提高跨語言版面能力,繁體中文需獨立測試。
- 生成結果通常是圖片,不是可編輯PPT、HTML、Figma或結構化PDF。
- 截至2026年7月22日,官方尚未完整公布第三代權重、API價格、模型卡與授權。
Qwen-Image三代的演進方向
| 世代 | 主要方向 | 代表能力 |
|---|---|---|
| Qwen-Image | 文字與精確編輯 | 中英文渲染、生成與圖像編輯 |
| Qwen-Image-2.0 | 生成/編輯統一 | 最高1K Token、2K影像、PPT與資訊圖 |
| Qwen-Image-3.0 | 高密度視覺文件 | 4.5K Token、10px小字、多語言、複雜UI與分鏡 |
初代官方權重為20B、Apache 2.0;第三代目前不能直接沿用這些數字。沒有正式模型卡前,不應假設參數量、架構與授權完全相同。
4.5K Token能描述什麼?
- 整體畫布比例、網格與留白。
- 每個區塊的標題、內文和圖表。
- 人物、場景、服裝、動作和台詞。
- UI元件、導航、狀態與畫中畫層級。
- 色彩、字體、材質和視覺風格。
- 多格分鏡中的鏡位、景別和連續動作。
- 資訊圖的圖例、數據與來源位置。
長提示讓使用者能把完整Design Brief交給模型。提示愈長,也愈需要結構化;把數千Token寫成連續散文,模型仍可能混淆區塊。
視覺文件提示結構
document:
type: nine-panel educational infographic
language: Traditional Chinese
canvas: 3840x2160
grid: 3x3
global_style:
- clean editorial layout
- high contrast typography
panels:
- id: P01
title: 稀疏注意力
body: 80字內
visual: KV block selection diagram
- id: P02
title: 長上下文
body: 80字內
visual: context scaling chart
prohibited:
- Simplified Chinese
- invented statistics
- unreadable decorative fonts每個Panel使用ID、文字限制與Visual Responsibility,能降低不同區塊互相污染。數據、公式與正式內容先由人完成,再交給模型排版。
文字與10px小字怎麼驗收?
- 保存模型應生成的原始文字。
- 以最高解析度輸出。
- 使用OCR取得實際圖片文字。
- 逐字比較差異與遺漏。
- 人工檢查字形、標點、上下標與行序。
- 重要內容在Figma、Illustrator或排版工具重建。
OCR通過也不代表版面可用。文字可能過小、對比不足、斷行錯誤或落在不合理位置。正式發布需要同時檢查內容正確率和閱讀性。
繁體中文測試
- 台灣常用字與簡繁差異。
- 全形標點、引號、破折號與省略號。
- 中英混排和數字單位。
- 直排、橫排與書名號。
- 人名、地名、品牌和技術名詞。
- 字型授權與是否真的使用指定Font。
模型宣稱支援中文,不代表繁體字和台灣語序完全穩定。應建立自己的30至50組文字測試,模型更新後重新生成比較。
資訊圖與知識圖解
Qwen-Image-3.0能把公式、圖表、文字和插圖放進同一張畫布,適合時間線、人物關係、技術架構、教育教材與研究海報。畫面看起來專業,不代表知識可靠。
| 內容 | 驗證方式 |
|---|---|
| 數字 | 和原始資料表逐項比對 |
| 圖表 | 重新用程式或試算表繪製 |
| 公式 | 由專業人員和LaTeX原文核對 |
| 人物關係 | 檢查方向、時間與身份 |
| 醫學/法律 | 由合格專業人員核准 |
| 引用 | 保留來源與URL,不由模型虛構 |
試卷與教材
- 模型負責版面、插圖和題型草稿。
- 題目、答案和配分由教師提供。
- 公式和圖形另外驗證。
- 生成圖片不作為唯一可編輯檔案。
- 保留無答案學生版與教師版。
- 檢查年級、課綱和難度。
視覺模型可能把解題內容畫得很像正確答案,卻在符號、條件和單位上出錯。教育素材必須先有可信內容,再使用圖像生成加速視覺化。
UI與產品原型
Qwen-Image-3.0可模擬網站、App、直播、遊戲和IDE介面,適合在產品初期快速討論資訊架構和視覺方向。
- 把畫面視為Concept,不是可執行產品。
- 列出元件、狀態、互動和Responsive需求。
- 在Figma建立真正Component和Auto Layout。
- 由工程師重建HTML、CSS和應用程式。
- 檢查Accessibility、Contrast和觸控區域。
- 避免把模型生成的假數據帶進正式Demo。
電影與短劇分鏡
4.5K Token足以描述多個鏡頭的角色、場景、景別、動作、台詞和畫面方向。模型可以一次生成九宮格或Storyboard Sheet,適合前期溝通。
scene_id: S03
continuity:
character: maya_v01
wardrobe: rain_wet
location: rooftop_night_v04
shots:
- id: SH020
size: wide
action: Maya enters from screen right
- id: SH021
size: medium close-up
action: Maya raises the recorder
- id: SH022
size: insert
action: recorder display shows 00:14:32分鏡生成後要拆回獨立Shot,核對角色、服裝、道具、軸線、視線和場景。九宮格中一個角色看起來相似,不代表能直接作為影片首尾幀。
角色資產和Shot Manifest方法可閱讀AI角色一致性怎麼做?。
可編輯重建流程
- 模型產生視覺初稿。
- 設計師選定構圖和層級。
- 提取文字、圖片和圖表內容。
- 在Figma、PPT或HTML重建結構。
- 替換正式字型、Logo、數據和圖片。
- 執行品牌、內容和Accessibility檢查。
- 保存生成原稿與可編輯正式稿。
生成圖片的價值是縮短方向探索,不是成為唯一Source File。需要多語言、持續更新和跨尺寸時,可編輯重建尤其重要。
即時知識和Qwen-Image-Agent
Qwen團隊也提出Qwen-Image-Agent,透過Plan、Reason、Search、Memory與Feedback補足使用者提示缺少的Context。這代表即時天氣、價格、新聞和特定資料,通常要先由Agent取得,再交給圖像模型排版。
基礎圖像模型不應自行被視為即時資料來源。工具取得資料後要保留Source、Timestamp與原始值,圖像生成完成後再驗證。
目前仍缺少哪些正式資訊?
- 第三代模型參數與完整架構。
- 公開權重與模型卡。
- 授權條款。
- API Model ID、價格和Rate Limit。
- 固定輸出解析度與生成速度。
- 可重現Benchmark和第三方評測。
- 本地部署硬體與量化方案。
初代Qwen-Image已提供Apache 2.0權重,不能因此推論第三代已開放。文章應隨官方模型卡與API出現再更新。
正式製作驗收
- 文字OCR和人工逐字校對。
- 數據、公式和引用回到原始來源。
- 繁體中文和多語言分開檢查。
- 角色、服裝、道具和鏡頭Continuity。
- 品牌、肖像、商標和字型授權。
- 點陣稿重建為可編輯正式檔。
- 保存Model、Prompt、Source和版本。
常見問題
Qwen-Image-3.0已經開源了嗎?
截至2026年7月22日,官方發布了產品與能力公告,但尚未找到第三代完整權重、模型卡和授權頁。初代開源不代表第三代已可下載。
4.5K Token等於4,500個中文字嗎?
不能直接換算。Token由語言、標點和分詞決定;它代表Prompt容量,不代表圖中能準確放入相同字數。
生成PPT或UI可以直接編輯嗎?
通常不能。生成結果是圖片,正式專案要在PPT、Figma或程式碼中重建元件。
官方資料
Qwen-Image-3.0把圖像生成推向視覺文件製作。長提示和小字能力能大幅縮短初稿時間;真正進入正式工作,仍要把圖片拆回文字、資料、元件、Shot與可追溯來源。

發表迴響