首頁 > 科技與 AI > SK Telecom A.X K2 是什麼?6880 億參數、SGA 架構與韓國主權 AI 產業布局解析

延伸主題

SK Telecom A.X K2 是什麼?6880 億參數、SGA 架構與韓國主權 AI 產業布局解析

SK Telecom 正式公開 6880 億參數的 A.X K2。這...

SK Telecom A.X K2模型圖片

SK Telecom A.X K2 是什麼?6880 億參數、SGA 架構與韓國主權 AI 產業布局解析

先講結論:SK Telecom A.X K2 的理解重點,是把 6880 億參數、SGA 架構與韓國主權 AI 產業布局放在同一個技術與政策脈絡中。

A.X K2 是什麼? 本文整理 SK Telecom A.X K2 的參數規模、SGA 架構與主權 AI 產業定位。

6880 億參數代表什麼? 參數數字可作為模型規模線索,但不能單獨代表能力、效率、成本或實際部署效果。

SGA 架構如何理解? 先依文章對架構的定義閱讀,再分辨模型設計、訓練方法與產品部署層次。

什麼是主權 AI? 主權 AI 通常涉及資料、算力、模型、語言與治理能力;具體範圍需依官方方案界定。

韓國產業布局扮演什麼角色? 文章把模型放進韓國 AI 產業、基礎設施與政策自主性的脈絡,而不只看單一 benchmark。

如何比較其他模型? 應同時看資料、任務、評測方法、成本與部署條件,避免只用參數量排名。

資料會更新嗎? 模型版本、規格、政策與合作夥伴可能變動;以 SK Telecom 與官方文件最新資料為準。

這篇文章適合誰? 適合想快速理解 A.X K2、SGA 與主權 AI 產業意義的讀者。

核心結論? A.X K2 不只是更大的模型,也是一個把技術能力與國家級 AI 自主性連在一起的案例。

<

p class=”wp-block-paragraph”>SK Telecom 於 2026 年 7 月 29 日公開 A.X K2,一款總參數達 6880 億、每個 token 啟用約 330 億參數的 Mixture-of-Experts 大型語言模型。A.X K2 採用 Sparse Gated Attention、原生 FP8 訓練與最高 256K 長上下文,主要強項集中在韓文理解、數學與科學推理、長文本處理及工具使用。

A.X K2 的產業價值來自 SK Telecom 正在建立的完整 AI 體系:模型公開、企業服務、製造驗證、國防模型、藥物研發、語音技術,以及與韓國 AI 晶片公司 Rebellions 的推論基礎設施合作。這使它成為觀察韓國主權 AI 戰略的重要案例。

  • A.X K2 擁有 6880 億總參數、330 億啟用參數,每個 token 只啟用部分專家模型,降低超大型模型的推論成本。來源:Hugging Face 模型卡
  • SK Telecom 表示,A.X K2 在 14 項韓國與國際基準測試的平均成績,較 A.X K1 提升 32.2 個百分點;長文本理解與代理相關項目提升約 83.9 個百分點來源:SK Telecom
  • 新增的 Sparse Gated Attention,縮寫 SGA,會從長上下文中挑選較相關的 token 進行注意力運算,以改善長文本推論效率。
  • A.X K2 主模型是文字模型。視覺、語音理解及語音生成由另外公開或預告的衍生模型負責。
  • 主模型採 Apache 2.0 開放權重,但完整 FP8 權重約需 647 GiB 儲存空間,實際部署建議準備至少約 800 GiB 的總 GPU 記憶體。

文章實體化:SK Telecom A.X K2 是什麼?6880 億參數、SGA 架構與韓國主權 AI 產業布局解析

SK Telecom A.X K2 是什麼這篇補回模型、參數、架構、媒體能力與產業位置,讓技術名詞能對應到實際使用與部署脈絡。

  • SK Telecom A.X K2 是什麼:本文的主要人物、團體、作品、模型或歷史事件實體
  • 6880 億參數:文章中需要對照的具體節點
  • SGA 架構與韓國主權 AI 產業布局解析:文章中需要對照的具體節點
  • 模型、架構、媒體能力與部署:把技術放回產品與產業流程

本文以「SK Telecom A.X K2 是什麼?6880 億參數、SGA 架構與韓國主權 AI 產業布局解析」為主線,補回人物、組織、作品、歷史、技術、場景與它們之間的關係,讓讀者能從具名實體一路追到文本、實際流程、文化語境與影響。

從 A.X K1 到 A.X K2 的模型增補

A.X K2 是 A.X K1 的後繼模型。上一代 A.X K1 擁有 5190 億總參數,A.X K2 將規模提高至 6880 億,但每個 token 啟用的參數仍維持約 330 億。SK Telecom 增加了模型內部的專家數量,從 A.X K1 的 192 個 routed experts 擴充至 256 個,每次選擇其中 8 個,再搭配一個 shared expert 執行運算。

這種設計稱為 Mixture-of-Experts,簡稱 MoE。模型可以擁有較大的知識容量,又不需要在每次生成文字時載入全部參數進行計算。對企業部署而言,啟用參數、記憶體需求、通訊成本與推論框架支援,往往比總參數數字更直接影響使用成本。

A.X K2 主要規格

項目 A.X K2 規格
模型類型 Decoder-only Transformer、Mixture-of-Experts
總參數 688B,約 6880 億
每 token 啟用參數 33B,約 330 億
專家數量 256 個 routed experts、1 個 shared expert
每 token 啟用專家 8 個 routed experts、1 個 shared expert
模型層數 61 層
上下文長度 原生訓練至 128K,透過 YaRN 延伸至 256K
訓練精度 原生 MXFP8
支援語言 英文、韓文、中文、日文、西班牙文
主模型模態 文字
授權 Apache License 2.0

模型卡顯示,A.X K2 使用約 8.2 兆 token 進行預訓練,其中英文及韓文占比最高,另外包含程式碼、學術論文、STEM、問答資料、書籍與合成資料。

Sparse Gated Attention 的長文本處理方式

A.X K2 使用的正式名稱是 Sparse Gated Attention,並非 Sparse Gate Attention。這套架構包含稀疏注意力選擇器與針對不同 attention head 的輸出閘門。

當模型處理長文件時,輕量化 indexer 會對候選資訊進行評分,每個 query 選出最多 2048 個較相關的 token,再交由 Multi-head Latent Attention 執行運算。模型不必讓每個 token 與完整上下文中的所有 token 互相計算,因此上下文越長,稀疏注意力帶來的效率價值越明顯。

A.X K2 同時加入 Gated Norm,在 RMSNorm 後使用輸入相關的 gate 控制 activation。其目的在於抑制異常放大的 hidden-state 數值,改善大型模型訓練穩定度,並降低 FP8、FP4 等低精度部署受到極端數值影響的機率。

Think-Fusion 讓同一模型切換回答模式

A.X K2 支援 thinking 與 non-thinking 兩種模式。使用者可以針對複雜數學、程式設計或多步驟問題開啟 thinking mode,也可以在即時客服、文字整理及低延遲服務中使用 non-thinking mode。

兩種模式來自 SK Telecom 稱為 Think-Fusion 的訓練方式。模型在監督式微調階段,同時接觸同一問題的思考版與直接回答版,再透過多階段強化學習建立模式控制能力。

這種設定讓企業不必為了快速回答與深度推理分別維護兩套完整模型,但實際成本仍取決於輸出長度、推論硬體、batch size 與服務框架。

A.X K2 的效能提升與比較範圍

SK Telecom 表示,A.X K2 在 14 項韓國與國際基準測試中的平均成績,比 A.X K1 提高 32.2 個百分點。其中長文本理解與 AI agent 相關評測合計改善約 83.9 個百分點。公司並將模型與 Qwen3.5-397B-A17B、DeepSeek-V4-Flash、GLM-5.1、Kimi-K2.6 等近期開放模型比較,宣稱整體表現位於相近區間。

官方模型卡列出的成績包括:

  • AIME26:97.1
  • KMMLU-Pro:80.5
  • CLIcK:91.6
  • LiveCodeBench v6:84.0
  • τ²-Bench Telecom:98.0
  • 256K RULER:86.6
  • RULER 全長度平均:94.6

A.X K2 在數學、韓文知識與電信服務代理測試上具有明顯競爭力,但 BrowseComp 成績只有 9.3,低於多個對照模型。SK Telecom 也在模型卡中說明,A.X K2 的長週期代理能力仍屬中等,部署前應針對實際工具使用流程重新評測。

基準測試可以確認模型的能力方向,無法直接代表企業現場的可靠度。資料權限、工具錯誤、幻覺、延遲、推論成本與安全規則,仍需在應用層處理。

開放權重不代表一般電腦可以直接執行

A.X K2 主模型以 Apache 2.0 授權公開,可用於研究與商業用途,也可以進一步微調或部署在自有基礎設施。模型已整合至 Hugging Face Transformers,並提供 SK Telecom 維護的 vLLM 分支。

完整 FP8 權重約占 647 GiB,載入後約占 656 GiB。SK Telecom 建議部署環境至少準備約 800 GiB 的總 GPU 記憶體,官方驗證使用四張各有 275 GiB 記憶體的 B300。改用 80 GB GPU 時,可能需要 12 張以上才能保留足夠的 KV cache 與 activation 空間。

單張 RTX 4090 或 RTX 5090 無法載入完整 A.X K2。缺少相容 FP8 環境時,Transformers 可能將權重解量化為 BF16,所需記憶體會進一步增加至約 1.4 TB。

因此,A.X K2 的開放策略主要服務研究機構、雲端平台、資料中心與大型企業。中小型團隊較可能使用 API、量化版本或 SK Telecom 後續提供的輕量模型。

製造業:KG Steel 與 KONEC 將進行現場驗證

SK Telecom 計畫把 A.X K2 導入 KG Steel 與汽車零件公司 KONEC 的製造 AI agent。KG Steel 的驗證場域位於唐津工廠冷軋產線,KONEC 則聚焦鑄造及加工流程。

兩項計畫預定在 2026 年下半年部署示範版本並進行現場驗證,目前較準確的描述是「規劃實證」,尚不能視為已完成大規模正式上線。

製造 AI agent 的核心用途包括查詢設備手冊、分析過往異常報告、整理維修紀錄及協助現場人員調取製程知識。長上下文能力可以讓模型同時處理多份規格、紀錄與操作文件,但輸出仍需連接企業資料庫、權限系統及可追溯的引用機制。

國防:目前成果主要建立在 A.X K1

SK Telecom 已與韓國國防部合作,開發三款以 A.X K1 為基礎的量化模型。量化技術可以降低記憶體使用量並提高處理速度,讓模型較容易部署在具有資料主權與網路隔離要求的國防環境。

韓國國防部與 SK Telecom 計畫把這些模型應用於陸軍、海軍、空軍及海軍陸戰隊所屬單位。A.X K2 則列入後續國防專用模型的輕量化與領域訓練方向。

因此,A.X K2 已成為國防合作的技術基礎之一,但目前公開完成的三款量化模型仍以 A.X K1 為底座。

生技:SK Biopharmaceuticals 將 AI 用於藥物早期研究

SK Telecom 正與 SK Biopharmaceuticals 合作,把 AI 應用於難治型癌症標靶藥物的初期研究。依照 SK Telecom 公開資料,原本通常需要一至兩年的早期研究階段,縮短至約五個月。

這項數字來自企業公布的合作成果,較適合用來觀察研究流程效率,不能直接解讀為候選藥物已完成臨床驗證。藥物發現後仍需經過毒理、臨床試驗、法規審查與量產評估。

企業辦公與日常服務已開始導入

A.X K2 已被應用於 SK Telecom 的企業 AI 服務 A.Biz,用來製作電子報、蒐集與分析資料及生成報告。SK hynix 的內部 AI 工具也取得 A.X K2 輕量模型,用於文件撰寫與資訊整理。

在消費者服務方面,A.X K2 輕量版本已被整合至 A. 電話的 AI 建議功能,根據通話內容整理行程與待辦事項;A. Note 的內容整理流程也使用部分相關技術。

這些應用比參數競賽更能檢驗模型是否具有商業價值。模型必須在延遲、成本、資料保護與回答穩定度之間維持可接受的平衡,才能長期進入企業工作流程。

A.X K2 的多模態能力

A.X K2 主模型只接受文字輸入。圖片與語音能力來自另外開發的衍生模型,不應把整個系列的能力都視為主模型原生功能。

A.X K2 VL Light-Preview

A.X K2 VL Light-Preview 可以同時理解圖片與文字。SK Telecom 提出的應用包括:

  • 報告與操作手冊解析
  • 收據、論文及掃描文件辨識
  • 法律文件風險分析
  • 工業現場影像與管線判讀

目前名稱中的 Preview 也代表模型仍處於早期公開階段,實際產業可靠度需要依照文件類型與現場影像重新驗證。

A.X K2 ALM

A.X K2 Audio Language Model 由 SK Telecom 開發,建立在 A.X K2 Light 底座之上,支援串流語音理解與語音生成。模型卡顯示其主要語言為韓文,完整權重目前仍標示為即將公開,授權條款也與主模型的 Apache 2.0 不同。

A.X K2 Raon-Speech

A.X K2 Raon-Speech 由 Krafton 獨立開發,總參數約 210 億、每次啟用約 30 億。它支援韓文與英文語音辨識、語音生成、語音問答及工具呼叫。

Krafton 公開的綜合評估顯示,Raon-Speech 在 300 億參數以下公開語音語言模型中,韓文綜合成績排名第一,英文排名第三。其權重採 CC BY-NC 4.0,只適合非商業研究與原型測試,不能直接套用主模型的商業授權條件。

Rebellions 補上韓國主權 AI 的晶片環節

韓國 AI 晶片公司 Rebellions 已使用單一 RebelServer,成功執行 SK Telecom 的 A.X K1,並展示可同時處理多位使用者請求的 AI agent 服務。這次展示使用的是 A.X K1,並非剛公開的 A.X K2。來源:Rebellions

這項合作的重要性在於模型與推論晶片可以由韓國企業共同掌握。Rebellions 負責 NPU、伺服器與 MoE 推論軟體,SK Telecom 提供模型、服務及資料中心場景,形成從模型到推論硬體的整合路徑。

A.X K2 的完整模型目前仍需要極大的記憶體容量。Rebellions 能否在國產 NPU 上有效支援 A.X K2,將是後續檢驗韓國主權 AI 是否能從示範走向規模化服務的關鍵指標。

韓國建立主權 AI 的背景

主權 AI 的核心目標,是讓一個國家或產業能掌握模型權重、訓練資料、運算基礎設施、服務部署與治理規則。

韓國的推進方式已經形成清楚分工:

  • SK Telecom 負責大型基礎模型與服務
  • Krafton 發展遊戲與語音模型
  • Rebellions 建立國產 NPU 與推論伺服器
  • KG Steel、KONEC 提供製造驗證場域
  • 韓國國防部負責高安全性應用
  • SK Biopharmaceuticals 驗證生技研發流程
  • 大學與研究單位提供數學、模型架構及資料研究

這套架構的目標是降低關鍵產業對單一海外模型、雲端平台與 GPU 供應鏈的集中依賴,同時保留韓文語言、產業資料及安全規則的控制權。

A.X K2 對台灣產業的參考意義

A.X K2 對台灣最具參考價值的部分,是模型、晶片、場域與服務同步推進的方式。

1. 在地模型需要明確的產業場域

大型模型公開後,需要進入製造、電信、醫療、政府或企業辦公流程,才能取得真實錯誤資料與使用者回饋。只比較基準測試,無法建立長期部署能力。

2. 完整模型與輕量模型要同步規劃

A.X K2 需要資料中心等級硬體,但 SK Telecom 同時準備量化模型、企業輕量模型及衍生模型。台灣團隊若要建立在地模型,也需要先定義雲端、高安全性機房、邊緣裝置與一般企業各自適合的模型尺寸。

3. 推論基礎設施會決定實際成本

訓練出模型只是第一階段。模型上線後,每天的推論量、耗電、記憶體、網路傳輸與維護成本,才會決定服務能否擴張。韓國把 Rebellions 納入模型計畫,反映推論晶片已成為主權 AI 的核心環節。

4. 開放程度需要逐一檢查

A.X K2 主模型使用 Apache 2.0,A.X K2 ALM 使用另一套研究授權,Raon-Speech 則採 CC BY-NC 4.0。開放權重、開源程式碼、商業可用與研究用途是不同概念,企業導入前必須逐一確認。

SK Telecom 下一步將擴展至兆級參數

SK Telecom 已表明,A.X K2 後繼模型將朝兆級參數發展。公司希望藉由增加模型容量、改進稀疏架構及持續推出輕量版本,縮小與全球頂級模型之間的差距。

模型規模仍只是其中一項變數。A.X K2 能否建立長期競爭力,還要觀察韓文與產業資料品質、實際推論成本、國產 NPU 適配程度、代理任務成功率,以及製造與國防驗證是否能轉化為正式部署。

常見問題

A.X K2 是什麼?

A.X K2 是 SK Telecom 開發的韓國大型語言模型,擁有 6880 億總參數及約 330 億啟用參數。模型採用 MoE、Sparse Gated Attention、原生 FP8 與最高 256K 上下文,主要強項為韓文、數學、科學推理與長文本處理。

A.X K2 可以免費下載嗎?

A.X K2 主模型已在 Hugging Face 公開,權重採 Apache 2.0 授權,可用於研究與商業用途。不過完整權重約占 647 GiB,實際推論建議準備至少約 800 GiB 的總 GPU 記憶體,部署成本仍然很高。

RTX 5090 可以執行完整 A.X K2 嗎?

單張 RTX 5090 無法載入完整 A.X K2。官方資料顯示,FP8 模型載入後約需 656 GiB,還要保留 KV cache 與 activation 空間。個人使用者較適合等待量化或輕量版本,或透過未來的 API 服務使用。

A.X K2 支援圖片和語音嗎?

A.X K2 主模型是文字模型,不直接接受圖片、語音或影片。圖片理解由 A.X K2 VL Light-Preview 負責,語音理解及生成則由 A.X K2 ALM 與 Krafton 開發的 A.X K2 Raon-Speech 提供。

A.X K2 比 DeepSeek 或 Qwen 更強嗎?

SK Telecom 的測試顯示,A.X K2 與近期 DeepSeek、Qwen、GLM、Kimi 模型位於相近區間,並在部分數學、韓文與電信代理測試領先。不同模型在程式設計、搜尋代理、成本與語言上的結果不同,無法用單一排名概括。

A.X K2 為什麼被稱為韓國主權 AI?

A.X K2 由韓國企業與研究機構開發,並規劃導入製造、國防、生技及公共服務。SK Telecom 也與 Rebellions 合作國產 NPU 推論,目標是掌握模型、資料、服務與硬體,降低關鍵 AI 能力對海外供應商的集中依賴。

結論

A.X K2 展示了韓國主權 AI 計畫的執行規模:6880 億參數模型、韓文與數學能力、工業實證、國防合作、語音衍生模型,以及國產 NPU 推論。

它仍有明確限制。完整模型需要資料中心等級硬體,長週期代理能力尚未領先所有對手,製造與國防應用也有部分處於規劃或驗證階段。主模型與各衍生模型的授權條件亦不完全相同。

後續最值得觀察的是三件事:A.X K2 能否真正進入生產環境、Rebellions 是否能有效支援更大型的 K2 系列,以及兆級後繼模型能否在效能提升的同時控制推論成本。這些結果將決定 A.X K2 會成為韓國 AI 生態系的共同底座,或停留在政府計畫與企業展示階段。

資料來源與查證範圍

本文主要依據 SK Telecom 於 2026 年 7 月 29 日發布的官方新聞稿A.X K2 Hugging Face 模型卡、A.X K2 ALM 與 Raon-Speech 模型卡,以及 Rebellions 公開的 A.X K1 NPU 部署資料。產業影響與台灣借鏡段落屬於編輯分析。

以 SK Telecom 新聞室核對 A.X K2 公告

SK Telecom 新聞室的官方公告將 A.X K2 列為 688B 規模的模型,並說明與多個輕量模型一同公開的脈絡。這提供本文一個可直接追溯的一手入口,讀者可回到公司公告核對原始措辭與後續說明。

SK Telecom A.X K2 官方新聞室公告圖片
圖片來源:SK Telecom 官方新聞室 A.X K2 公告 圖片來源:SK Telecom 官方新聞室

資料來源與延伸閱讀

把「SK Telecom A.X K2 是什麼?6880 億參數、SGA 架構與韓國主權 AI 產業布局解析」拆成可驗證的系統問題

這篇文章的主題不只是一個名詞或產品名稱,而是一套由資料、流程、資源與限制共同組成的系統。讀完主要敘述後,可以把焦點往前推一步:系統邊界在哪裡、關鍵機制如何運作、指標改善是否伴隨新的成本,以及哪些說法仍需要原始資料核對。

分析面向 要追問什麼 可查找的證據
系統邊界 本文的主題由哪些元件、角色與外部條件共同構成? 架構圖、供應鏈、時間線與官方規格
運作機制 結果是由哪個流程、模型、設計或制度選擇造成? 流程步驟、參數、介面、測試與案例
指標與代價 效率、速度或規模提升後,哪種成本或風險被轉移? 功耗、延遲、可靠性、價格、勞動與環境資料
可驗證性 哪些結論可以重現,哪些仍只是公司說法或推測? 原始文件、版本、第三方測試與反例

用這四個問題閱讀,能把技術敘事從「看起來很強」轉成可比較的證據鏈,也能看見一個系統真正改變的是什麼。

作者與編輯責任

本文署名作者:

|YOLO LAB 主編

YOLO LAB 的文章由署名作者或編輯團隊完成。主編 Dex 負責編輯制度、重要事實查核原則、AI 協作規範與重大更正;文章中的分析與判斷以公開來源、作品內容及可驗證資料為依據。

文章若有需要補充或修正的資料,可透過聯絡頁提供原始來源、日期與具體段落,編輯團隊會依出版政策檢查。

KEEP READING

接著讀什麼?

從同一主題繼續閱讀,或回到 YOLO LAB 的完整文章索引,找到下一個值得投入時間的問題。

發表迴響

探索更多來自 YOLO LAB 的內容

立即訂閱即可持續閱讀,還能取得所有封存文章。

繼續閱讀