首頁 > 科技與 AI > Step 3.7 Flash 是什麼?198B/11B、256K Context、API價格與本機部署

延伸主題

Step 3.7 Flash 是什麼?198B/11B、256K Context、API價格與本機部署

Step 3.7 Flash 是 StepFun 的198B稀疏Mo...

Computer Use Agent Screenshot、DOM、Action與人工確認安全流程分析圖

Step 3.7 Flash 是什麼?198B/11B、256K Context、API價格與本機部署

Step 3.7 Flash 是 StepFun 在 2026 年 5 月推出的多模態 Agent 模型,官方 API Model ID 為 step-3.7-flash。它使用 198B 稀疏 Mixture-of-Experts 架構,每個 Token 約啟用 11B 參數,提供 256K Context、圖片理解、Tool Calling,以及 low、medium、high 三種推理層級。

它最值得注意的地方在效率:StepFun 希望用相對小的 active parameters 承接 Coding、Search、Visual Agent、Computer Use 與長時間工具流程,而不必讓每一個 Token 都付出接近 200B dense model 的計算成本。

Step 3.7 Flash 規格快速看

項目 Step 3.7 Flash
開發公司 StepFun/階躍星辰
發布日期 2026 年 5 月 29 日
API Model ID step-3.7-flash
模型架構 Sparse MoE Vision-Language Model
官方架構參數 198B
Language Backbone 196B
Vision Encoder 1.8B
Active Parameters 約 11B/Token
Context Window 256K
Reasoning low/medium/high
圖片輸入 支援
Tool Calling 支援
Agent 核心定位
權重 公開
License Apache 2.0
部署 vLLM/SGLang/Transformers/llama.cpp/NVIDIA NIM

StepFun 同時宣稱模型在合適的 serving 環境可以達到最高約 400 output tokens/second。這是供應商公布的性能數字,實際速度仍會受到 GPU、量化、Context、Batch、Provider 與 Reasoning Level 影響。

為什麼有些地方寫 198B,有些地方寫 201B?

兩個數字來自不同統計口徑。

StepFun 官方模型說明使用:

196B Language Backbone + 1.8B Vision Encoder ≈ 198B

描述模型架構。

Hugging Face 的 Safetensors metadata 則目前顯示約 201B parameters。

因此要做模型架構比較時,使用 StepFun 公開的 198B 較一致;估算下載、顯存或完整 checkpoint 時,應直接查看準備使用的實際模型檔案與量化版本。

另外一個更重要的數字是 11B active parameters

Step 3.7 Flash 是 MoE,每個 Token 並不需要啟用全部 198B 參數。這也是它可以維持 Flash 定位的核心。

Step 3.7 Flash 和 Step 3.5 Flash 差在哪?

Step 3.7 Flash 延續 Step 3.5 Flash 的稀疏 MoE 思路,但增加原生 Vision Encoder,並把訓練重點推向真實 Agent。

最大的變化可以分成四項。

1. 從文字模型變成原生多模態

Step 3.7 Flash 可以直接讀圖片、UI、Chart、Document 與其他視覺資訊。

因此它可以先「看」畫面,再寫程式或呼叫工具。

2. Search 能力更重要

StepFun 把 Web Search、Visual Search、Evidence Filtering 與多輪搜尋列為核心能力。

這讓模型比較適合 Research Agent,而不只依賴模型權重內部記憶。

3. Tool Use 與長程 Agent 經過額外強化

StepFun 的官方測試中,Step 3.7 Flash 在 ClawEval-1.1、Toolathlon、Coding 與 Search 類 benchmark 相較 3.5 有明顯提升。

這些仍是官方評測,正式部署應用自己的 Harness 再驗證。

4. 加入 GUI/Phone Use

Step 3.7 Flash 可以結合視覺與行動,在手機 GUI 或網頁畫面上辨識介面、執行操作,再重新觀察結果。

這也是原本這篇「Computer Use Agent」內容值得留下來的部分,但應作為 Step 3.7 Flash 的能力,而不是讓整個頁面變成泛用 Computer Use 指南。

Step 3.7 Flash API 要填什麼?

官方 Model ID:

step-3.7-flash

StepFun Global Platform 的 OpenAI-compatible base URL:

https://api.stepfun.ai/v1

中國平台則使用:

https://api.stepfun.com/v1

API Key 必須和對應 Region 的 Base URL 配對,否則官方文件指出可能會因授權不符被拒絕。

因此正式系統最好把:

provider
model_id
base_url
region

四個欄位分開保存,不要只有「Step 3.7 Flash」這個顯示名稱。

Step 3.7 Flash API 價格多少?

截至 2026 年 8 月 24 日,StepFun 官方模型卡列出的美元價格為:

每百萬 Tokens 價格
Input,Cache Miss US$0.20
Input,Cache Hit US$0.04
Output US$1.15

Cache Hit 的 Input 價格只有一般輸入的五分之一,因此長時間 Agent 如果會重複帶入 System Prompt、Tool Schema、Repository 摘要或固定 Context,Cache 命中率會直接影響總成本。

對 Agent 工作,更適合比較:

Cost per Accepted Task

而不是單純比較每百萬 Token。

一個便宜模型如果需要更多搜尋、重試或人工修改,最終工作成本仍可能更高。

low、medium、high Reasoning Level 怎麼選?

Step 3.7 Flash 提供三個 Reasoning Level:

low

medium

high

它們的目的是讓同一個模型在延遲、成本與推理深度之間切換。

low

適合:

  • 分類;
  • 資料抽取;
  • 短問答;
  • 固定格式轉換;
  • 單一步驟工具操作。

medium

適合:

  • 一般 Coding;
  • 文件分析;
  • 多步驟搜尋;
  • Tool Calling;
  • 一般 Agent 工作。

high

適合:

  • 困難 Coding;
  • 複雜 Research;
  • 多來源衝突;
  • 長時間 Agent;
  • 高錯誤成本任務。

更合理的策略仍然是找出每種工作「能穩定通過驗收的最低 Reasoning Level」。

如果 medium 已經可以穩定完成工作,high 增加的 Token 與延遲就未必值得。

Step 3.7 Flash 可以做 Computer Use 嗎?

可以,而且這是 Step 3.7 Flash 相較純文字 Flash 模型很重要的能力。

StepFun 官方展示了 Phone-use/GUI Operation,模型可以根據畫面理解目前狀態,再進行操作。

官方 Android Daily 評測列出的 Step 3.7 Flash 成績為 61.87%。

但「模型可以理解 GUI」和「可以安全讓它操作正式系統」仍是兩回事。

正式 Computer Use Agent 至少還需要外部 Harness 控制:

Observe

Model proposes action

Policy

Human confirmation when required

Execute

Read back

Verify

付款、寄信、公開發布、刪除、權限變更與正式環境部署,不能只因模型辨識出正確按鈕就直接執行。

Advisor Mode 是什麼?

StepFun 還為 Step 3.7 Flash 設計 Advisor Mode。

核心邏輯是:

Step 3.7 Flash 繼續擔任 Executor,只在少數真正困難的節點向更大型模型詢問。

例如:

  • 一開始的複雜 Plan;
  • 重複失敗後的 Recovery;
  • 高難度架構判斷。

這種模式的目的,是避免整個 Agent Workflow 都使用昂貴 Frontier Model。

StepFun 官方在 SWE-Bench Verified 的內部測試中表示,Advisor Mode 可以用較低的單任務成本接近 Claude Opus 4.6 的 Coding 表現。

這屬於 StepFun 官方測試結果,實際成本仍取決於 Advisor、Harness、Tool Calls 與失敗率。

Step 3.7 Flash 是開源模型嗎?

StepFun 已公開模型權重,Hugging Face repository 使用 Apache 2.0 License

官方目前提供:

  • BF16;
  • FP8;
  • NVFP4;
  • GGUF。

推論框架則包括:

  • vLLM;
  • SGLang;
  • Transformers;
  • llama.cpp;
  • NVIDIA NIM。

因此它具備相當完整的自架路徑。

Step 3.7 Flash 可以在 Mac 上跑嗎?

可以,但需要非常大的統一記憶體,而且應使用量化版本。

StepFun 官方 llama.cpp 文件目前列出:

GGUF 大小
Q4_K_S 約 111.5GB
IQ4_XS 約 104.99GB
Q3_K_L 約 102.5GB
Multimodal Projector 約 3.97GB
Runtime Overhead 約 7GB

官方最低要求約:

120GB unified memory/VRAM

建議:

128GB unified memory

所以 128GB Mac Studio 或特定 128GB 以上 MacBook Pro 的確進入「可以嘗試完整量化模型」的範圍。

64GB 機器則不足以依官方這組完整 llama.cpp 配置直接載入。

需要注意,這裡指的是 Q3/Q4 量化模型。

BF16 完整權重的記憶體需求遠高於 128GB。

vLLM 與 SGLang 怎麼部署?

大型 GPU Server 可以直接使用 StepFun 提供的 vLLM/SGLang 路徑。

官方 BF16/FP8 範例使用:

Tensor Parallel = 8

並開啟 Expert Parallel、Reasoning Parser、Tool Call Parser 與 speculative decoding。

NVFP4 路徑則可以下降到 TP4/EP4,但正式範例同時限制 max-model-len,因此不能看到 FP4 就直接推論「所有 256K Context 都能在較少 GPU 上使用」。

模型量化、Context、KV Cache 與 concurrency 必須一起算。

Step 3.7 Flash Benchmark 怎麼看?

StepFun 官方公布的代表性結果包括:

Benchmark Step 3.7 Flash
ClawEval-1.1 67.1
Toolathlon 49.5
SWE-Bench Pro 56.3
SWE-Bench Verified 76.5
Terminal-Bench 2.1 59.6
BrowseComp 75.8
DeepSearchQA F1 92.8
V* with Python 95.29
Android Daily 61.87

這些結果適合判斷模型的訓練方向:Coding、Search、Vision、GUI 與 Tool Use 都是 Step 3.7 Flash 的重點。

但官方比較表同時混有供應商官方成績與 StepFun 自行重測的競品成績,所以不應直接把整張表轉成「全球模型排名」。

真正的採用決策仍應使用同一套 Harness 重跑候選模型。

哪些工作最適合 Step 3.7 Flash?

最值得測試的是:

  • Coding Agent;
  • Search/Research Agent;
  • 視覺資料分析;
  • GUI/Computer Use;
  • 大型文件;
  • 多工具 Workflow;
  • 高吞吐 Agent Worker;
  • 需要同時控制能力與成本的 Agent Pipeline。

如果工作只需要短文字分類或固定格式轉換,模型能力可能過剩,可以再往更小的模型分流。

常見問題

Step 3.7 Flash 的 Model ID 是什麼?

官方 API 使用 step-3.7-flash

Step 3.7 Flash 有多少參數?

StepFun 模型卡使用 198B 架構口徑:196B Language Backbone 加 1.8B Vision Encoder,每 Token 約啟用 11B。

為什麼 Hugging Face 顯示 201B?

Hub 的 Safetensors metadata 與官方架構統計方式不同。比較模型架構時可使用官方 198B;部署容量則應直接查看實際 checkpoint。

Step 3.7 Flash Context 多大?

256K Tokens。

Step 3.7 Flash 支援圖片嗎?

支援。它是 Vision-Language Model,可直接接受圖片與文字輸入。

Step 3.7 Flash API 多少錢?

目前官方模型卡為 Input Cache Miss US$0.20/MTok、Cache Hit US$0.04/MTok、Output US$1.15/MTok。

Step 3.7 Flash 可以用 Ollama 或 llama.cpp 嗎?

官方提供 GGUF 與 llama.cpp 路徑;Hugging Face 也提供量化版本供相容工具使用。

64GB Mac 可以完整跑 Step 3.7 Flash 嗎?

依 StepFun 官方目前 GGUF 配置,不足。官方最低約 120GB unified memory/VRAM,建議 128GB。

Step 3.7 Flash 是什麼授權?

Apache 2.0。

Step 3.7 Flash 的定位相當清楚:它用約 11B active parameters 承接一個接近 200B 級模型的容量,再把圖片、搜尋、Coding、GUI 與 Tool Use 組合進同一個 Agent 模型。對需要大量 Agent 工作、又無法讓每一個請求都使用最昂貴 Frontier Model 的團隊,這種「Flash 級成本+完整 Agent 能力」才是它最值得測試的地方。

資料來源:StepFun Step 3.7 Flash 官方發布頁、StepFun 官方 Hugging Face Model Card、StepFun Open Platform 與官方部署文件。

作者與編輯責任

本文署名作者:

|YOLO LAB 主編

YOLO LAB 的文章由署名作者或編輯團隊完成。主編 Dex 負責編輯制度、重要事實查核原則、AI 協作規範與重大更正;文章中的分析與判斷以公開來源、作品內容及可驗證資料為依據。

文章若有需要補充或修正的資料,可透過聯絡頁提供原始來源、日期與具體段落,編輯團隊會依出版政策檢查。

KEEP READING

接著讀什麼?

從同一主題繼續閱讀,或回到 YOLO LAB 的完整文章索引,找到下一個值得投入時間的問題。

發表迴響

探索更多來自 YOLO LAB 的內容

立即訂閱即可持續閱讀,還能取得所有封存文章。

繼續閱讀