Kimi K3是Moonshot AI在2026年7月推出的旗艦模型,擁有2.8兆總參數、100萬Token上下文、原生圖片與影片理解能力,主要面向長時間軟體開發、AI Agent、研究與知識工作。它採用Kimi Delta Attention、Attention Residuals與高度稀疏的Mixture of Experts架構,每次推理啟動896個專家中的16個。
截至2026年7月17日,Kimi K3已可透過Kimi.com、Kimi Work、Kimi Code及Kimi API使用;完整模型權重預定於7月27日前釋出,技術報告也仍待後續公布。現階段最實際的使用方式是官方API,而非自行下載權重部署。
重點快讀
- Kimi K3共有2.8兆參數,是Moonshot AI目前規模最大的旗艦模型。
- 模型提供100萬Token上下文,約為Kimi K2.6的四倍。
- MoE每次啟動16個專家,但完整模型共有896個專家,部署仍需容納完整權重。
- K3原生支援文字、圖片與影片理解,也能使用終端工具、Function Calling及結構化輸出。
- K3永遠啟用推理模式,發布初期只提供max等級的reasoning_effort。
- 官方API已上線,完整權重截至7月17日尚未公開下載。
- 官方建議以64張以上加速器組成的Supernode部署,單張消費級顯示卡無法承載完整模型。
Kimi K3的2.8兆參數代表什麼?
2.8兆是Kimi K3的總參數規模,並不代表每次生成一個Token時,所有參數都會同時參與計算。
Kimi K3採用Mixture of Experts架構,共有896個專家,每次推理只啟動其中16個。這種設計能在擴大模型總容量的同時,控制單次推理所需的計算量。Moonshot AI把這套架構稱為Stable LatentMoE,並表示K3相較K2取得約2.5倍的整體擴展效率。這些效率數字來自官方內部評估,仍需等待完整技術報告與第三方重現。
MoE的稀疏啟動不會消除完整權重的儲存需求。推理系統仍需保存或分散放置896個專家的參數,再由路由系統決定每個Token要送往哪些專家。
這也是Kimi K3規模很大,API價格卻未按2.8兆全參數等比例增加的原因之一。
KDA與Attention Residuals在解決什麼?
Kimi Delta Attention
Kimi Delta Attention簡稱KDA,是一種混合線性注意力架構。傳統完整注意力的計算與記憶體需求會隨序列長度快速增加,當上下文延伸到數十萬或100萬Token時,成本尤其明顯。
KDA透過線性注意力降低長序列處理成本,並搭配全域注意力保留需要精確關聯的部分。Moonshot AI先前公開的Kimi Linear研究採用3比1的KDA與全域注意力比例,顯示這條技術路線同時追求長上下文效率與資訊品質。
Attention Residuals
一般Transformer會把前一層輸出持續累加到後續層。模型變得非常深之後,資訊可能在長距離傳遞中被稀釋或混合。
Attention Residuals讓模型依據當前需求,選擇性讀取不同深度的表示。它的目的,是改善超大型模型在深度方向上的資訊流動,使重要資訊不必依靠逐層累加才能傳到後面。
KDA處理序列長度,Attention Residuals處理模型深度。兩者共同支撐Kimi K3的100萬上下文與2.8兆參數規模。
100萬Token上下文可以拿來做什麼?
100萬Token上下文讓Kimi K3能一次處理大型程式碼庫、長篇研究資料、多份文件、工具執行紀錄與較長的Agent工作歷史。官方把K3定位於長週期Coding與端到端知識工作,也展示了GPU核心優化、編譯器開發、科學研究及互動式報告等案例。
- 分析跨越數百個檔案的大型Repository。
- 同時閱讀多份規格、研究論文與會議紀錄。
- 保留長時間Agent執行過程中的決策與工具結果。
- 分析長影片、螢幕錄影或大量圖片。
- 建立需要反覆查閱同一份知識庫的工作階段。
上下文容量是上限,不代表每次請求都應塞滿100萬Token。輸入越長,首Token延遲、推理時間與費用通常也會增加。Kimi API會自動嘗試快取沒有變動的長前綴,因此多輪工作應維持知識庫與系統提示的順序,避免不必要的內容重排。
Kimi K3可以本地部署嗎?
截至2026年7月17日,完整權重尚未公開,因此目前無法透過官方權重自行部署。Moonshot AI表示完整模型權重預定於7月27日前發布,技術報告與更多架構資訊也會同步公布。
即使權重發布,單張RTX 5090或一般桌上型工作站仍無法執行完整Kimi K3。
以2.8兆參數和4-bit權重做理論估算,模型權重本身約需要1.4TB儲存空間,尚未計算路由、KV Cache、執行框架及視覺模組。Moonshot AI也明確建議使用包含64張以上加速器的Supernode部署。
MoE讓每個Token只使用部分專家,可以降低計算負擔;完整專家權重仍需要分散在多張加速器中。對個人與一般企業來說,官方API或推理合作夥伴會比自行架設實際。
權重發布後仍需確認三件事:
- 模型授權是否允許商業使用與衍生模型。
- vLLM、SGLang等推理框架何時完整支援KDA與前綴快取。
- 官方是否同步提供量化權重、硬體需求與分散式部署範例。
在這些資料公開前,「開源」應理解為官方已宣布模型開放方向,完整自架條件仍在形成。
Kimi K3 API怎麼呼叫?
Kimi API相容OpenAI Chat Completions格式。開發者可以沿用OpenAI Python SDK,將base_url改成Moonshot AI端點,再把模型名稱設為kimi-k3。
import osfrom openai import OpenAIclient = OpenAI( api_key=os.environ["MOONSHOT_API_KEY"], base_url="https://api.moonshot.ai/v1",)response = client.chat.completions.create( model="kimi-k3", reasoning_effort="max", messages=[ { "role": "user", "content": "分析這個專案的架構與主要技術風險。", } ],)print(response.choices[0].message.content)K3與K2系列有一個重要參數差異。K2.6使用thinking物件控制思考模式,透過OpenAI SDK時通常放在extra_body;K3永遠啟用推理,改用頂層reasoning_effort欄位。發布初期只支援max,其他推理強度仍待後續開放。
多輪對話不能只保存content
Kimi K3在多輪對話、工具呼叫與推理工作流中,要求開發者把API回傳的完整Assistant Message放回下一次請求。
- reasoning_content
- tool_calls
- Tool Call ID
- Partial Mode狀態
- 其他模型需要延續的欄位
若程式只保存message.content,工具呼叫鏈、推理狀態或下一輪上下文可能不完整。
assistant_message = response.choices[0].messagemessages.append(assistant_message)串流輸出也會分開傳回reasoning_content與最終content。使用者介面可以分別處理兩種Delta,但業務程式不應把推理內容誤當成最終答案或JSON輸出。
Kimi K3支援哪些Agent功能?
Kimi K3 API支援自訂Function Calling、tool_choice、動態載入工具、結構化輸出及官方工具。
強制先呼叫工具
第一次請求可設定tool_choice=”required”,模型至少會選擇一個工具。工具執行完成後,程式必須把完整Assistant Message與對應的Tool Result一併放回對話,再呼叫模型取得最終答案。
動態載入工具
當Agent擁有數十或數百個工具時,把所有Schema放進每次請求會增加Token成本,也可能降低工具選擇準確度。
K3允許在對話中的System Message動態宣告工具。工具從該訊息的位置開始生效,後續請求則要保留這段訊息。這適合大型MCP環境或依任務逐步載入Skills的Agent。
結構化輸出
K3支援json_schema與strict: true。資料抽取、工作流狀態、任務規劃與API輸出可以限制成固定結構。程式應解析最終message.content,不要解析reasoning_content。
Partial Mode
Partial Mode可以先提供一段Assistant文字前綴,再讓模型從前綴後繼續生成。這適合固定格式、受控開頭或需要續寫特定結構的工作。
Kimi K3支援圖片與影片嗎?
Kimi K3具有原生視覺能力,可處理文字、圖片與影片。官方展示案例包括讀取程式執行畫面、依照Screenshot修正前端、建立3D遊戲、處理CAD,以及分析和剪輯影片。
- 圖片內容必須使用物件陣列格式,不能把整段內容序列化成字串。
- 公開圖片網址目前不屬於支援格式,需傳入Base64 Data URL,或先上傳檔案後使用ms://<file-id>。
影片要先透過Files API上傳,purpose設為video,再將檔案ID放入video_url。完成後應刪除不再使用的檔案,避免媒體庫持續累積。
Kimi K3的API價格是多少?
Moonshot AI公布的Kimi K3發布價格,以每100萬Token計算:
| 類型 | 價格 |
|---|---|
| 快取命中輸入 | 0.30美元 |
| 未命中快取輸入 | 3.00美元 |
| 輸出 | 15.00美元 |
官方表示,Coding工作負載的API快取命中率可超過90%,但這項數字來自Moonshot AI自身平台資料,實際結果會受到提示結構、工作階段設計與前綴是否穩定影響。
100萬Token上下文若全部屬於未命中快取輸入,單次輸入費用約3美元,尚未加入輸出費用。大量Agent工作流更需要控制輸出長度,因為K3的輸出單價明顯高於快取輸入。
Kimi API另有帳戶層級的RPM、TPM與並發限制。新帳戶需要先儲值才能開始使用,限制依累計儲值級別調整。
Kimi K3能接Hermes Agent或OpenClaw嗎?
Kimi API採用OpenAI相容介面,因此具備接入Hermes Agent、OpenClaw及其他OpenAI-compatible Agent框架的基礎條件。一般整合需要設定:
- Provider:Moonshot AI或Kimi
- Base URL:https://api.moonshot.ai/v1
- API Key:MOONSHOT_API_KEY
- Model:kimi-k3
目前官方Hermes Agent頁面仍以Kimi K2.6為範例,OpenClaw頁面仍以Kimi K2.5為範例。這代表文件與框架內建選項可能尚未同步K3。使用前應先從模型列表確認kimi-k3是否可見,再檢查框架是否會保留完整Assistant Message及K3的reasoning_effort欄位。
若框架只允許K2系列的thinking參數,直接替換模型名稱可能出現參數錯誤。較穩定的做法,是使用可自訂OpenAI-compatible Provider的設定,明確指定Kimi端點與模型參數。
Kimi K3適合哪些工作?
- 大型程式碼庫分析與重構。
- 長時間Coding Agent工作。
- 依照Screenshot反覆修正前端或遊戲。
- 多文件研究、資料分析及互動式報告。
- 影片理解、素材分類與剪輯規劃。
- 具有大量Skills或MCP工具的Agent。
- 需要100萬Token上下文的知識工作。
一般聊天、短文生成與簡單分類工作未必需要K3。K2.6等較小模型的輸出價格更低,延遲也可能較容易控制。模型選擇應以任務長度、工具需求、上下文規模及可接受成本決定。
官方Benchmark應該怎麼看?
Moonshot AI公布的測試顯示,Kimi K3在部分Coding、Agent、工具使用與視覺任務上達到前沿水準。官方也明確表示,K3的整體表現仍落後最強的封閉模型。
- 部分項目屬於Moonshot AI內部Benchmark。
- 不同模型可能使用Kimi Code、Claude Code或Codex等不同Agent Harness。
- 所有K3成績都使用max推理強度,成本與執行時間可能高於一般模式。
K3是否適合正式環境,仍應使用自己的程式碼、工具、文件與驗收標準測試。公開排行榜可以提供初步方向,無法取代實際工作流評估。
Kimi K3目前有哪些限制?
- 完整權重尚未公開,無法立即自行部署。
- 技術報告尚未發布,訓練資料與更多架構細節仍待確認。
- reasoning_effort目前只提供max。
- 公開圖片URL不能直接作為視覺輸入。
- 官方Web Search仍在更新,近期不建議直接用於生產工作流。
- Hermes Agent與OpenClaw官方教學仍以K2系列為主。
- 超大模型的本地部署門檻遠高於一般企業工作站。
- 官方Benchmark包含內部測試與不同Agent Harness,解讀時要保留比較條件。
這些限制不影響K3作為API模型使用,但會影響自架、成本控制及既有Agent框架的遷移方式。
發布48小時後:Kimi K3真的進入Frontier了嗎?
截至2026年7月18日,較準確的判斷是:Kimi K3已經進入開放模型的第一梯隊,並在前端生成等特定任務達到Frontier水準,但整體能力仍未穩定超越最強封閉模型。Moonshot AI官方也承認,K3與最強專有模型之間仍存在使用體驗差距。
這項判斷必須拆開不同測試。Frontend Code Arena、Artificial Analysis Intelligence Index與Coding Agent Index測量的是不同能力,不能把其中一個第一名直接解讀成所有程式工作都已超越Claude或GPT。
Frontend Code Arena第一名代表什麼?
Arena在K3發布當日公布的Frontend Code Arena結果中,Kimi K3以1679分排名第一,並在七個前端子領域中的六項取得最高分,只有Gaming落後Claude Fable 5。相較Kimi K2.6原本約第18名的位置,這是明顯跨代提升。
Frontend Code Arena主要反映使用者對網頁介面、視覺完成度、互動效果與前端程式輸出的偏好。它能證明K3在Screenshot理解、UI生成與視覺型程式任務上具備競爭力,卻無法直接回答大型後端重構、長期維護、測試覆蓋或複雜Repository除錯是否同樣領先。
獨立測評顯示:整體接近Frontier,但沒有全面奪冠
Artificial Analysis在發布後的初步測試中,給Kimi K3的Intelligence Index為57,整體約位於第三名附近,落後Claude Fable 5 max的60與GPT-5.6 Sol max的59,但領先Claude Opus 4.8等模型。Coding Agent Index同樣約為57,排名接近第五。
這組結果支持「幾乎Frontier」的說法。K3的通用推理、Coding Agent與前端能力已經足以進入封閉模型比較區間,但目前沒有證據顯示它在所有任務上都比Fable 5或GPT-5.6 Sol更強。
| 評測 | Kimi K3表現 | 可以說明 | 不能直接推論 |
|---|---|---|---|
| Frontend Code Arena | 1679分、排名第一 | UI、前端與視覺程式生成很強 | 所有軟體工程任務都第一 |
| Intelligence Index | 57、約第三名 | 通用能力接近頂級封閉模型 | 整體已超越Fable與Sol |
| Coding Agent Index | 57、約第五名 | Agentic Coding具備第一梯隊競爭力 | 在任何Harness都能維持相同排名 |
榜單很強,為什麼實測仍有人覺得慢?
Kimi K3發布初期預設使用max thinking effort。這會增加模型在複雜任務上的推理時間,也可能產生更多推理與輸出Token。部分開發者因此回報,K3雖然最後結果很好,但等待時間、Token消耗與API過載讓互動體感不如榜單直接。
延遲問題還受到發布初期流量影響。Day-1與Day-2的API容量、排隊與第三方路由Fallback都可能改變結果。這些回報具有參考價值,但目前樣本仍偏小,不能直接視為穩定的長期服務品質。
更重要的是Harness。Claude Code、Codex與Kimi Code會用不同的系統提示、工具格式、上下文管理和錯誤恢復策略。同一個模型若放進沒有調校過的Harness,表現可能接近較低一級模型。企業評估時應同時測試模型與執行框架,而不是只替換API名稱。
Kimi K3真的比較便宜嗎?
Kimi K3官方API定價為每100萬Token輸入3美元、輸出15美元,快取命中輸入為0.30美元。以公開價格比較,它對長前綴、重複Repository與Agent循環具有明顯成本優勢,部分獨立測試也顯示單項任務成本低於Claude Fable 5。
便宜不等於每個任務的最終成本都低。K3預設思考時間較長,若輸出大量推理Token、反覆重跑或因API不穩定中斷,有效成本可能上升。與K2系列相比,K3本身的單價也提高,因此它適合用在真正需要更強能力的工作,而非全面取代較小模型。
現在能稱為開源模型嗎?
截至2026年7月18日,Kimi K3已經在Kimi產品、Kimi Work、Kimi Code與API上線,但完整可下載權重仍預定於7月27日前發布。現階段可以確認的是Open Weights承諾,不能說權重已經公開,也不能假設現在就能在本地Fine-tune。
真正會改變評價的時間點是7月27日。屆時需要確認權重是否準時上線、授權條款、模型卡、量化版本、KDA推理框架支援,以及社群能否在多機環境重現官方表現。只要其中任何一項延遲,「第二個DeepSeek時刻」的敘事都需要重新調整。
Kimi Code CLI能取代Claude Code嗎?
Kimi Code CLI採MIT授權開源,產品定位明確對準Claude Code與Codex CLI。它提供終端工作流、程式碼修改與Agent執行入口,對希望避免被單一模型或單一供應商鎖定的開發者具有吸引力。
短期內,CLI是否免費並不是唯一標準。Claude Code與Codex已累積更完整的Harness、工具相容性、權限控制與失敗恢復經驗。Kimi Code的優勢是低門檻與模型原生整合;它能否取代既有工具,仍取決於大型Repository中的穩定性、Diff品質、測試執行與長任務翻車率。
Kimi K3是否迫使Anthropic把Fable留在Max?
2026年7月18日,Anthropic宣布Fable 5將自7月20日起正式納入Max與Team Premium方案,額度為各方案Limit的50%。這個時間點與Kimi K3、GPT-5.6 Sol及Codex競爭加劇重疊,因此社群普遍把兩件事連在一起。
目前只能確認時間上的關聯,不能證明直接因果。Anthropic官方理由仍是早期需求難以預測,容量到位後才能把Fable存取標準化。Kimi K3是否促使其加快決策,屬於合理市場推論,不是已被官方證實的事實。
對台灣開發者與本地部署者的實際意義
台灣個人開發者目前最實際的使用方式仍是Kimi API或Kimi Code。2.8兆參數即使量化,也不是單張RTX 5090或一般Mac Studio能完整承載的模型。7月27日權重公開後,本地社群更可能先從多機推理、遠端叢集、量化研究與蒸餾模型受益。
企業採用時可把K3放進Router,而非立即全面遷移。前端生成、Screenshot-to-Code與長上下文研究可以優先路由到K3;需要成熟工具鏈、低延遲或高穩定性的任務,則保留Claude Code、Codex或其他模型。模型可替換的工作流,會比押注單一排行榜冠軍更耐用。
接下來要觀察的五件事
- 7月27日完整權重是否準時發布,授權是否允許商業使用與衍生模型。
- vLLM、SGLang與社群推理框架能否快速支援KDA、AttnRes與高度稀疏MoE。
- Kimi Code在大型Repository與一週以上實戰中的失敗率。
- API延遲、容量與低/高thinking effort模式何時穩定上線。
- 下一輪Claude、GPT或其他中國開放模型發布後,K3的價格與排名能否維持。
本輪更新來源
常見問題
Kimi K3已經開源了嗎?
Moonshot AI已將Kimi K3定位為開放模型,完整權重預定於2026年7月27日前發布。截至2026年7月17日,Kimi K3服務與API已上線,完整權重與技術報告仍待公開。
Kimi K3有多少參數?
Kimi K3共有2.8兆參數,採用Mixture of Experts架構。模型包含896個專家,每次推理啟動其中16個。總參數代表模型完整容量,不等同每個Token實際啟動的參數量。
Kimi K3支援多少上下文?
Kimi K3支援100萬Token上下文,可用於大型程式碼庫、長文件、多輪Agent紀錄、圖片及影片工作流。長上下文仍會增加延遲與成本,穩定前綴可利用自動快取降低重複輸入費用。
Kimi K3可以跑在RTX 5090嗎?
完整Kimi K3無法放入單張RTX 5090。以4-bit權重理論估算,模型權重約1.4TB,官方部署建議也以64張以上加速器的Supernode為基礎。一般桌機適合透過API使用,或等待社群後續是否推出更小的蒸餾版本。
Kimi K3和Kimi K2.6有什麼主要差異?
K3從K2.6的256K上下文提升到1M,總規模增至2.8兆參數,並導入KDA、Attention Residuals與更稀疏的MoE。API方面,K2.6使用thinking控制思考模式;K3固定啟用推理,改用reasoning_effort。
Kimi K3可以使用OpenAI SDK嗎?
可以。Kimi API相容OpenAI Chat Completions介面,開發者可以沿用OpenAI Python或Node.js SDK,只需替換API Key、Base URL與模型名稱。部分K3專屬欄位仍需確認所用SDK或框架是否完整傳遞。
收尾
Kimi K3目前最具辨識度的能力,是把2.8兆參數、100萬Token上下文、原生視覺及長時間Agent執行放進同一個模型。它適合處理大型程式碼庫、跨文件研究、工具鏈及持續數小時的工程工作,也把開放模型的規模推到新的硬體層級。
目前最實際的採用路線是官方API。完整權重、授權、推理框架與硬體部署方案仍待7月27日前後進一步確認。K3能否建立長期開放生態,將取決於權重發布後的可部署性、社群支援及第三方測試,而不只取決於2.8兆這個數字。
延伸閱讀
- Mooncake架構解析:Kimi如何用KV Cache Pooling擴展長文本推理
- Kimi vs Claude解析:AI Agent策略、蜂群工作流與專家小隊比較
- 大語言模型怎麼選?比較GLM、Kimi、MiniMax類工具前的五個問題
- 開源AI Agent怎麼評估?從模型架構、工具能力到成本理解選擇
發表迴響