Qwen是阿里巴巴建立的大型模型家族,不能只理解成一個聊天產品。它同時包含專有API旗艦、開放權重文字模型、視覺語言、Coding、Audio、Omni與Agent相關模型,讓開發者能在雲端服務和自行部署之間選擇。
Qwen生態真正改變模型選擇的地方,是把能力、授權、模型尺寸、硬體、推論框架和中文/多語言需求放進同一個選型空間。官方Qwen3曾一次釋出兩個MoE與六個Dense模型,採Apache 2.0;後續Qwen3.6也持續提供Agentic Coding與多模態開放權重模型。
重點快讀
- Qwen是一個模型家族,不是單一Model ID。
- 生態同時包含專有API模型與開放權重模型。
- Qwen3公開兩個MoE與六個Dense模型,採Apache 2.0。
- Qwen3同時支援Thinking與Non-thinking工作模式。
- 官方推薦vLLM、SGLang,以及Ollama、LM Studio、MLX和llama.cpp等本地工具。
- Qwen3.7-Max屬專有API旗艦,不能和開放權重系列混寫。
- 不同世代、尺寸與專用模型的授權需逐一查看Model Card。
- 企業選型要比較品質、VRAM、成本、資料政策與維護責任。
Qwen生態的兩條主線
| 路線 | 例子 | 適合 | 責任 |
|---|---|---|---|
| 託管API | Qwen3.7-Max、Qwen3.7-Plus | 快速上線、旗艦能力 | Quota、資料政策、供應商依賴 |
| 開放權重 | Qwen3、Qwen3.6開放模型 | 本地、私有Cloud、微調 | 硬體、授權、安全、更新 |
雲端API和開放權重不是高低版本。API適合不想維護Serving的團隊;開放權重則適合需要資料邊界、模型控制、低延遲或大規模固定工作負載的組織。
Qwen3開放權重家族
Qwen於2025年4月28日公布Qwen3,官方一次釋出兩個MoE與六個Dense模型,並以Apache 2.0提供權重。
| 類型 | 模型 | 總參數/啟用參數 | Context |
|---|---|---|---|
| MoE | Qwen3-235B-A22B | 235B/22B | 128K |
| MoE | Qwen3-30B-A3B | 30B/3B | 128K |
| Dense | Qwen3-32B/14B/8B | 完整啟用 | 128K |
| Dense | Qwen3-4B/1.7B/0.6B | 完整啟用 | 32K |
MoE模型保有較大總容量,但每個Token只啟用部分Expert;Dense模型部署較直接,所有參數都參與每次前向。實際速度取決於GPU、Expert Parallel、Kernel和Batch,不只看啟用參數。
Thinking與Non-thinking
Qwen3把複雜推理與快速回應放進同一系列設計。Thinking模式適合數學、Coding和多步規劃;Non-thinking適合摘要、分類、抽取和低延遲任務。
- 不要讓所有Request固定使用最高推理。
- 以Task Difficulty和失敗訊號升級。
- 分別量測Latency、Token與Accepted Task Rate。
- 簡單任務保留Non-thinking基線。
- 高風險結果仍需外部Verifier。
推理層級的路由方法可閱讀Reasoning Effort怎麼分流?。
Dense和MoE怎麼選?
| 面向 | Dense | MoE |
|---|---|---|
| 部署 | 較簡單 | 需要Expert Routing與通訊 |
| 記憶體 | 全部權重常駐 | 總權重更大 |
| 每Token Compute | 所有參數 | 部分Expert |
| 單機 | 較容易 | 大模型常需多GPU |
| Scale-out | TP/PP | 另需EP與All-to-all |
MoE並不自動代表更省。若Expert分布不均、Network慢或Batch太小,All-to-all和權重讀取可能抵消啟用參數優勢。
Qwen3.6開放模型
2026年Qwen持續推出Qwen3.6開放權重模型。例如Qwen3.6-35B-A3B使用35B總參數、3B啟用參數,強調Agentic Coding和多模態;Qwen3.6-27B則是較容易部署的Dense模型。
- 35B-A3B適合研究小啟用MoE的效率。
- 27B Dense適合不想承擔Expert Routing複雜度的團隊。
- 兩者都應用自己的Coding和多模態資料評估。
- 模型卡、License與Checkpoint Revision需固定。
- 不要用新模型官方榜單替代私有Task Set。
Qwen-VL、Coder、Audio與Omni
| 系列 | 主要用途 |
|---|---|
| Qwen-VL | 圖片、文件、視覺定位與文字理解 |
| Qwen-Coder | 程式碼生成、理解、修復與Agentic Coding |
| Qwen-Audio/ASR | 語音辨識、音訊理解與對齊 |
| Qwen-Omni | 文字、圖片、音訊與影片統一處理 |
| Qwen-Image | 影像生成、文字渲染與視覺文件 |
模型家族越大,越不能只寫「使用Qwen」。系統要保存完整Model ID、Processor、Chat Template與輸入模態,否則版本更新後難以重現。
Apache 2.0代表什麼?
Qwen3官方釋出的八個開放權重模型使用Apache 2.0,通常允許商業使用、修改與再分發,但仍需保留License、Copyright和Notice,並遵守專利與商標條款。
- 確認特定Repository標示的License。
- 保存原始NOTICE和修改紀錄。
- 模型名稱和商標不等於授權。
- 資料、第三方Component和輸出權利另行處理。
- 不同Qwen世代或專用模型可能使用不同條款。
「Qwen是Apache 2.0」是過度概括。準確說法應是「這個具體Checkpoint的模型卡標示Apache 2.0」。
開放權重不等於完整開源
| 資產 | 是否通常可取得 |
|---|---|
| Checkpoint權重 | 開放模型可下載 |
| 推論程式與範例 | 多數公開 |
| 完整預訓練資料 | 通常不公開 |
| 資料清理與全部配方 | 只公開部分 |
| 訓練基礎設施 | 通常不完整公開 |
| 專有API旗艦 | 不提供權重 |
開放權重提供部署與微調能力,也把安全、監控、更新和法規責任轉移給使用者。
推論框架怎麼選?
| 工具 | 適合 |
|---|---|
| vLLM | 高吞吐OpenAI相容Serving |
| SGLang | Prefix Cache、結構化生成與Agent工作負載 |
| llama.cpp | CPU/GPU混合、GGUF與邊緣部署 |
| MLX | Apple Silicon本地推論 |
| Ollama/LM Studio | 個人桌面與快速測試 |
| KTransformers | 大模型CPU/GPU異質推論探索 |
官方Qwen3頁推薦多種部署工具,但「工具支援Qwen」不代表所有VL、MoE、Thinking和量化組合都已最佳化。正式上線需查當前Support Matrix。
本地部署先算VRAM
weight_memory ≈ parameters × bytes_per_weight
plus:
KV cache
runtime workspace
activation
quantization metadata
vision encoder
batch and concurrency- BF16約2 Bytes/Parameter。
- 8-bit約1 Byte,另有Scale。
- 4-bit約0.5 Byte,另有Metadata。
- MoE總權重仍需分布或載入。
- 長Context的KV可能超過權重節省。
本地部署完整選型可閱讀本地AI怎麼部署?。
量化與品質
- 先建立BF16/FP16基線。
- 測AWQ、GPTQ、GGUF或Runtime原生格式。
- 長Context、Coding和Tool Calling分開驗收。
- 多模態模型要測Vision Processor。
- 低資源語言和精確數字特別注意。
- 記錄模型、量化、Runtime與Kernel版本。
量化不是只讓模型放得下,也會改變Latency、Throughput和錯誤分布。選擇應看每個有效任務成本。
中文與多語言怎麼測?
- 繁體中文與簡體中文分開。
- 台灣詞彙、法律和商務格式。
- 中英混合、程式碼與專有名詞。
- 長文件引用和版本衝突。
- 日韓與東南亞語言任務。
- 拒答、Safety和Sensitive Data。
中文Benchmark不等於台灣Production品質。企業要使用自己的Email、合約、產品文件和Tool Schema建立Golden Set。
資料治理
| API路線 | 本地路線 |
|---|---|
| 查資料保留、訓練用途與Region | 自行負責權限、Log和Secrets |
| 供應商更新模型 | 自行管理Checkpoint和Security Patch |
| Quota和服務可用性 | 硬體、電力和容量 |
| 較少維運 | 更高控制與客製 |
Hybrid架構常用API處理高難度Burst,本地模型處理固定、大量和敏感任務。Router需要保存品質、成本和資料邊界。
企業選型流程
- 列出Task Inventory。
- 定義品質、Latency、Cost和Risk門檻。
- 選擇3至5個具體Model ID。
- 固定Prompt、Tools和Context。
- 測原始與量化版本。
- 比較API和本地總成本。
- 執行Security與Data Review。
- 建立Primary、Fallback和Rollback。
- 每次Checkpoint更新重新Eval。
通用模型選型方法可閱讀大語言模型怎麼選?。
常見問題
Qwen全部都是開放權重嗎?
不是。Qwen同時有開放權重系列和專有API旗艦,例如Qwen3.7-Max目前屬API模型。
Qwen全部使用Apache 2.0嗎?
不能一概而論。Qwen3官方釋出的八個模型使用Apache 2.0,其他世代與專用模型需查看各自Model Card。
台灣團隊適合本地部署Qwen嗎?
適合需要繁中客製、敏感資料與固定大量任務的團隊,但需具備硬體、Serving、資安與模型更新能力。
官方資料
Qwen生態的核心競爭力,是同時提供API旗艦、開放權重、不同模型尺寸和多模態專用系列。真正的採用價值不由品牌熱度決定,而由具體Checkpoint、授權、硬體、資料政策和私有Eval共同決定。

發表迴響