截至2026年7月22日,官方已披露參數規模最大的現代通用模型之一,是Moonshot AI的Kimi K3:總參數2.8兆、896個專家、每個Token選擇16個專家,並提供最高100萬Token上下文。參數榜的真正價值,不在決定哪個模型最聰明,而在看懂完整模型多大、每次推理實際動用多少容量,以及它能否被下載、部署與長期維護。
兆級模型普遍使用Mixture of Experts。總參數代表完整專家庫與儲存規模;啟用參數更接近單一Token需要執行的模型計算。MoE降低每Token運算,不會讓沒有被選中的專家權重從記憶體與分散式系統中消失。
重點快讀
- Kimi K3以2.8T總參數成為目前規模最大的公開披露通用模型之一。
- DeepSeek V4 Pro與LongCat 2.0皆為1.6T,單Token約啟用49B與48B。
- MiMo V2.5 Pro為1.02T/42B,Intern-S1-Pro為1T/22B,Ring-1T為1T/50B。
- 總參數、啟用參數、Context Window、發布狀態與授權必須分開比較。
- MoE處理模型容量;稀疏、線性或滑動視窗注意力處理長序列成本。
- GPT、Claude與Gemini未公布可直接比較的總參數,因此不應用傳聞補入排名。
排行榜採用什麼口徑?
- 只採開發公司、官方技術報告或正式模型卡公布的參數。
- 同一基礎模型的Instruct、Thinking與後訓練版本合併為模型家族。
- 以主模型總參數排序,額外MTP、視覺編碼器是否計入另行註明。
- 未公布精確數字的模型只寫「超過1T」,不自行估算。
- 權重可下載、API限定、預覽與預定發布必須分開。
- 排名只代表規模,不代表能力、速度或成本排名。
2026年官方披露的兆級與大型MoE模型
| 模型家族 | 總參數 | 啟用參數 | Context | 主要架構 | 狀態 |
|---|---|---|---|---|---|
| Kimi K3 | 2.8T | 未公布;16/896專家 | 最高1M | MoE、KDA、Attention Residuals | 產品與API上線;官方稱已開源,完整權重預定2026年7月27日開放 |
| Llama 4 Behemoth | 接近2T | 288B | 依官方預覽 | 16專家、多模態MoE | 教師模型預覽,未提供公開Checkpoint |
| DeepSeek V4 Pro | 1.6T | 49B | 1M | MoE、DeepSeek Sparse Attention | API與開放權重 |
| LongCat 2.0 | 1.6T | 約48B | 1M | MoE、LongCat Sparse Attention | 開放權重 |
| Qwen3-Max | 超過1T | 未公布 | 依官方服務 | MoE、Agent與長上下文 | API產品,精確參數未披露 |
| MiMo V2.5 Pro | 1.02T | 42B | 最高1M | 6:1滑動視窗/全域注意力、3層MTP | FP8開放權重 |
| Kimi K2家族 | 1T | 32B | 依版本 | 8/384路由專家、MLA | 開放權重 |
| Intern-S1-Pro | 1T | 22B | 依模型卡 | 8/512專家、科學多模態 | Apache 2.0開放權重 |
| Ling/Ring-1T | 1T | 約50B | 最高128K | MoE、MTP、RLVR | MIT開放權重 |
| DeepSeek V3家族 | 671B主模型 | 37B | 依版本 | DeepSeekMoE、MLA、MTP | 開放權重 |
Qwen3-Max只公布「超過1兆」,因此不能精確決定它和1.02T MiMo V2.5 Pro的前後順序。Llama 4 Behemoth則是已披露但沒有公開Checkpoint的教師模型。這兩種情況都說明,負責任的排行榜需要保留不確定性。
總參數和啟用參數差在哪?
Dense模型通常讓大多數權重參與每個Token運算。MoE模型把前饋網路拆成許多專家,再由Router選擇少數專家。完整專家庫提高容量,單次推理只執行一部分。
| 模型 | 總參數 | 啟用參數 | 約略比例 |
|---|---|---|---|
| DeepSeek V4 Pro | 1.6T | 49B | 3.1% |
| LongCat 2.0 | 1.6T | 48B | 3.0% |
| MiMo V2.5 Pro | 1.02T | 42B | 4.1% |
| Kimi K2 | 1T | 32B | 3.2% |
| Intern-S1-Pro | 1T | 22B | 2.2% |
| Ring-1T | 1T | 50B | 5.0% |
| DeepSeek V3 | 671B | 37B | 5.5% |
| Llama 4 Behemoth | 接近2T | 288B | 約14.4% |
這個比例不能直接等同FLOPs與Latency。注意力、Embedding、共享層、Router、跨節點通訊、Batch與輸出長度仍會影響成本。Kimi K3官方只公布16/896專家,尚未提供完整啟用參數,因此不能直接用2.8T乘以16/896得到結論。
MoE和稀疏注意力不是同一件事
| 技術 | 主要處理 | 例子 |
|---|---|---|
| MoE | 每個Token啟用哪些前饋專家 | Kimi K3、DeepSeek V4、LongCat 2.0 |
| 稀疏注意力 | 哪些Token關係需要精確計算 | DeepSeek Sparse Attention、LongCat Sparse Attention |
| 線性注意力 | 以狀態或線性形式壓低長序列成本 | Kimi Delta Attention |
| 滑動視窗 | 限制局部注意力範圍,間隔加入全域層 | MiMo V2.5 Pro |
兆級模型同時需要兩種稀疏化:MoE控制模型容量的運算量,稀疏或線性注意力控制100萬Token上下文的Prefill與KV Cache。
參數愈多,模型一定愈強嗎?
- 資料品質與訓練Token。
- 專家是否得到平衡訓練。
- Router是否選到正確專家。
- 後訓練、工具使用與Agent資料。
- Reasoning Effort與測試時計算。
- Context Builder、Tools與Agent Harness。
- 量化、推論框架與服務穩定度。
- 人工驗收和錯誤回復。
參數榜適合回答容量、部署體積與稀疏程度,不能回答哪一個模型最適合企業Repository、研究、客服或內容工作。正式選型仍要使用相同Task、Harness、工具與驗收條件。
兆級模型可以在一般工作站執行嗎?
| 規模 | BF16理論權重 | FP8/INT8 | 4-bit |
|---|---|---|---|
| 1T | 約2TB | 約1TB | 約500GB |
| 1.6T | 約3.2TB | 約1.6TB | 約800GB |
| 2.8T | 約5.6TB | 約2.8TB | 約1.4TB |
這些只是權重,尚未加入KV Cache、Runtime、通訊Buffer、Vision Encoder與安全餘裕。Intern-S1-Pro官方FP8部署指南仍要求至少兩個八卡H200節點。MoE降低運算,不會把兆級權重變成單張RTX 5090可承載的模型。
企業應該看哪些指標?
- Accepted Task Rate與首次通過率。
- Input、Cached、Reasoning與Output Token。
- TTFT、完整Latency與工具呼叫次數。
- 長任務中斷、Resume與錯誤回復。
- 資料是否能送往該Provider。
- 權重、授權、區域與服務可用性。
- Cost per Accepted Task。
- 更換模型時需要重寫多少Harness。
Kimi K3本身的架構、API與部署限制,可閱讀Kimi K3是什麼?;模型接入Hermes的Provider與1M設定,可閱讀Kimi K3怎麼接Hermes Agent?。
常見問題
目前參數最多的AI模型是哪一個?
截至2026年7月22日,Kimi K3以2.8兆總參數,屬於目前官方披露規模最大的現代通用模型。完整權重是否按官方規劃於7月27日開放,仍需在實際下載頁上驗證。
為什麼GPT、Claude與Gemini不在榜單?
它們沒有公布目前旗艦模型可直接比較的總參數與啟用參數。使用外部估算會把不同口徑與傳聞混入排行榜。
MoE啟用3%代表成本只剩3%嗎?
不是。非專家層、注意力、Router、記憶體讀取、通訊與Serving仍會產生成本,啟用參數比例只能理解稀疏程度。
主要資料來源
- Kimi Code:Kimi K3發布與架構
- DeepSeek V4 Preview官方公告
- LongCat 2.0官方公告
- MiMo V2.5 Pro官方模型卡
- Intern-S1-Pro官方模型卡
- Ring-1T官方模型卡
2026年的參數競賽已從增加Dense權重,轉向MoE、長上下文注意力、低精度訓練與分散式推論共同設計。參數仍能說明容量與硬體門檻,真正的產品價值則要回到任務品質、延遲、成本與可治理性。

發表迴響