首頁 > 科技與 AI > 2026 AI模型參數排行榜:總參數、啟用參數、MoE與發布狀態

延伸主題

2026 AI模型參數排行榜:總參數、啟用參數、MoE與發布狀態

2026年AI模型參數已進入兆級。本文依官方模型卡整理Kimi K3…

Kimi K3 2.8 兆參數模型規模比較專題封面

截至2026年7月22日,官方已披露參數規模最大的現代通用模型之一,是Moonshot AI的Kimi K3:總參數2.8兆、896個專家、每個Token選擇16個專家,並提供最高100萬Token上下文。參數榜的真正價值,不在決定哪個模型最聰明,而在看懂完整模型多大、每次推理實際動用多少容量,以及它能否被下載、部署與長期維護。

兆級模型普遍使用Mixture of Experts。總參數代表完整專家庫與儲存規模;啟用參數更接近單一Token需要執行的模型計算。MoE降低每Token運算,不會讓沒有被選中的專家權重從記憶體與分散式系統中消失。

重點快讀

  • Kimi K3以2.8T總參數成為目前規模最大的公開披露通用模型之一。
  • DeepSeek V4 Pro與LongCat 2.0皆為1.6T,單Token約啟用49B與48B。
  • MiMo V2.5 Pro為1.02T/42B,Intern-S1-Pro為1T/22B,Ring-1T為1T/50B。
  • 總參數、啟用參數、Context Window、發布狀態與授權必須分開比較。
  • MoE處理模型容量;稀疏、線性或滑動視窗注意力處理長序列成本。
  • GPT、Claude與Gemini未公布可直接比較的總參數,因此不應用傳聞補入排名。

排行榜採用什麼口徑?

  1. 只採開發公司、官方技術報告或正式模型卡公布的參數。
  2. 同一基礎模型的Instruct、Thinking與後訓練版本合併為模型家族。
  3. 以主模型總參數排序,額外MTP、視覺編碼器是否計入另行註明。
  4. 未公布精確數字的模型只寫「超過1T」,不自行估算。
  5. 權重可下載、API限定、預覽與預定發布必須分開。
  6. 排名只代表規模,不代表能力、速度或成本排名。

2026年官方披露的兆級與大型MoE模型

模型家族總參數啟用參數Context主要架構狀態
Kimi K32.8T未公布;16/896專家最高1MMoE、KDA、Attention Residuals產品與API上線;官方稱已開源,完整權重預定2026年7月27日開放
Llama 4 Behemoth接近2T288B依官方預覽16專家、多模態MoE教師模型預覽,未提供公開Checkpoint
DeepSeek V4 Pro1.6T49B1MMoE、DeepSeek Sparse AttentionAPI與開放權重
LongCat 2.01.6T約48B1MMoE、LongCat Sparse Attention開放權重
Qwen3-Max超過1T未公布依官方服務MoE、Agent與長上下文API產品,精確參數未披露
MiMo V2.5 Pro1.02T42B最高1M6:1滑動視窗/全域注意力、3層MTPFP8開放權重
Kimi K2家族1T32B依版本8/384路由專家、MLA開放權重
Intern-S1-Pro1T22B依模型卡8/512專家、科學多模態Apache 2.0開放權重
Ling/Ring-1T1T約50B最高128KMoE、MTP、RLVRMIT開放權重
DeepSeek V3家族671B主模型37B依版本DeepSeekMoE、MLA、MTP開放權重

Qwen3-Max只公布「超過1兆」,因此不能精確決定它和1.02T MiMo V2.5 Pro的前後順序。Llama 4 Behemoth則是已披露但沒有公開Checkpoint的教師模型。這兩種情況都說明,負責任的排行榜需要保留不確定性。

總參數和啟用參數差在哪?

Dense模型通常讓大多數權重參與每個Token運算。MoE模型把前饋網路拆成許多專家,再由Router選擇少數專家。完整專家庫提高容量,單次推理只執行一部分。

模型總參數啟用參數約略比例
DeepSeek V4 Pro1.6T49B3.1%
LongCat 2.01.6T48B3.0%
MiMo V2.5 Pro1.02T42B4.1%
Kimi K21T32B3.2%
Intern-S1-Pro1T22B2.2%
Ring-1T1T50B5.0%
DeepSeek V3671B37B5.5%
Llama 4 Behemoth接近2T288B約14.4%

這個比例不能直接等同FLOPs與Latency。注意力、Embedding、共享層、Router、跨節點通訊、Batch與輸出長度仍會影響成本。Kimi K3官方只公布16/896專家,尚未提供完整啟用參數,因此不能直接用2.8T乘以16/896得到結論。

MoE和稀疏注意力不是同一件事

技術主要處理例子
MoE每個Token啟用哪些前饋專家Kimi K3、DeepSeek V4、LongCat 2.0
稀疏注意力哪些Token關係需要精確計算DeepSeek Sparse Attention、LongCat Sparse Attention
線性注意力以狀態或線性形式壓低長序列成本Kimi Delta Attention
滑動視窗限制局部注意力範圍,間隔加入全域層MiMo V2.5 Pro

兆級模型同時需要兩種稀疏化:MoE控制模型容量的運算量,稀疏或線性注意力控制100萬Token上下文的Prefill與KV Cache。

參數愈多,模型一定愈強嗎?

  • 資料品質與訓練Token。
  • 專家是否得到平衡訓練。
  • Router是否選到正確專家。
  • 後訓練、工具使用與Agent資料。
  • Reasoning Effort與測試時計算。
  • Context Builder、Tools與Agent Harness。
  • 量化、推論框架與服務穩定度。
  • 人工驗收和錯誤回復。

參數榜適合回答容量、部署體積與稀疏程度,不能回答哪一個模型最適合企業Repository、研究、客服或內容工作。正式選型仍要使用相同Task、Harness、工具與驗收條件。

兆級模型可以在一般工作站執行嗎?

規模BF16理論權重FP8/INT84-bit
1T約2TB約1TB約500GB
1.6T約3.2TB約1.6TB約800GB
2.8T約5.6TB約2.8TB約1.4TB

這些只是權重,尚未加入KV Cache、Runtime、通訊Buffer、Vision Encoder與安全餘裕。Intern-S1-Pro官方FP8部署指南仍要求至少兩個八卡H200節點。MoE降低運算,不會把兆級權重變成單張RTX 5090可承載的模型。

企業應該看哪些指標?

  • Accepted Task Rate與首次通過率。
  • Input、Cached、Reasoning與Output Token。
  • TTFT、完整Latency與工具呼叫次數。
  • 長任務中斷、Resume與錯誤回復。
  • 資料是否能送往該Provider。
  • 權重、授權、區域與服務可用性。
  • Cost per Accepted Task。
  • 更換模型時需要重寫多少Harness。

Kimi K3本身的架構、API與部署限制,可閱讀Kimi K3是什麼?;模型接入Hermes的Provider與1M設定,可閱讀Kimi K3怎麼接Hermes Agent?

常見問題

目前參數最多的AI模型是哪一個?

截至2026年7月22日,Kimi K3以2.8兆總參數,屬於目前官方披露規模最大的現代通用模型。完整權重是否按官方規劃於7月27日開放,仍需在實際下載頁上驗證。

為什麼GPT、Claude與Gemini不在榜單?

它們沒有公布目前旗艦模型可直接比較的總參數與啟用參數。使用外部估算會把不同口徑與傳聞混入排行榜。

MoE啟用3%代表成本只剩3%嗎?

不是。非專家層、注意力、Router、記憶體讀取、通訊與Serving仍會產生成本,啟用參數比例只能理解稀疏程度。

主要資料來源

2026年的參數競賽已從增加Dense權重,轉向MoE、長上下文注意力、低精度訓練與分散式推論共同設計。參數仍能說明容量與硬體門檻,真正的產品價值則要回到任務品質、延遲、成本與可治理性。

作者與編輯責任

本文署名作者:

YOLO LAB 的文章由署名作者或編輯團隊完成。主編 Dex 負責編輯制度、重要事實查核原則、AI 協作規範與重大更正;文章中的分析與判斷以公開來源、作品內容及可驗證資料為依據。

文章若有需要補充或修正的資料,可透過聯絡頁提供原始來源、日期與具體段落,編輯團隊會依出版政策檢查。

發表迴響

探索更多來自 YOLO LAB 的內容

立即訂閱即可持續閱讀,還能取得所有封存文章。

繼續閱讀