Step 3.7 Flash 是什麼?198B/11B、256K Context、API價格與本機部署
Step 3.7 Flash 是 StepFun 在 2026 年 5 月推出的多模態 Agent 模型,官方 API Model ID 為 step-3.7-flash。它使用 198B 稀疏 Mixture-of-Experts 架構,每個 Token 約啟用 11B 參數,提供 256K Context、圖片理解、Tool Calling,以及 low、medium、high 三種推理層級。
它最值得注意的地方在效率:StepFun 希望用相對小的 active parameters 承接 Coding、Search、Visual Agent、Computer Use 與長時間工具流程,而不必讓每一個 Token 都付出接近 200B dense model 的計算成本。
Step 3.7 Flash 規格快速看
| 項目 | Step 3.7 Flash |
|---|---|
| 開發公司 | StepFun/階躍星辰 |
| 發布日期 | 2026 年 5 月 29 日 |
| API Model ID | step-3.7-flash |
| 模型架構 | Sparse MoE Vision-Language Model |
| 官方架構參數 | 198B |
| Language Backbone | 196B |
| Vision Encoder | 1.8B |
| Active Parameters | 約 11B/Token |
| Context Window | 256K |
| Reasoning | low/medium/high |
| 圖片輸入 | 支援 |
| Tool Calling | 支援 |
| Agent | 核心定位 |
| 權重 | 公開 |
| License | Apache 2.0 |
| 部署 | vLLM/SGLang/Transformers/llama.cpp/NVIDIA NIM |
StepFun 同時宣稱模型在合適的 serving 環境可以達到最高約 400 output tokens/second。這是供應商公布的性能數字,實際速度仍會受到 GPU、量化、Context、Batch、Provider 與 Reasoning Level 影響。
為什麼有些地方寫 198B,有些地方寫 201B?
兩個數字來自不同統計口徑。
StepFun 官方模型說明使用:
196B Language Backbone + 1.8B Vision Encoder ≈ 198B
描述模型架構。
Hugging Face 的 Safetensors metadata 則目前顯示約 201B parameters。
因此要做模型架構比較時,使用 StepFun 公開的 198B 較一致;估算下載、顯存或完整 checkpoint 時,應直接查看準備使用的實際模型檔案與量化版本。
另外一個更重要的數字是 11B active parameters。
Step 3.7 Flash 是 MoE,每個 Token 並不需要啟用全部 198B 參數。這也是它可以維持 Flash 定位的核心。
Step 3.7 Flash 和 Step 3.5 Flash 差在哪?
Step 3.7 Flash 延續 Step 3.5 Flash 的稀疏 MoE 思路,但增加原生 Vision Encoder,並把訓練重點推向真實 Agent。
最大的變化可以分成四項。
1. 從文字模型變成原生多模態
Step 3.7 Flash 可以直接讀圖片、UI、Chart、Document 與其他視覺資訊。
因此它可以先「看」畫面,再寫程式或呼叫工具。
2. Search 能力更重要
StepFun 把 Web Search、Visual Search、Evidence Filtering 與多輪搜尋列為核心能力。
這讓模型比較適合 Research Agent,而不只依賴模型權重內部記憶。
3. Tool Use 與長程 Agent 經過額外強化
StepFun 的官方測試中,Step 3.7 Flash 在 ClawEval-1.1、Toolathlon、Coding 與 Search 類 benchmark 相較 3.5 有明顯提升。
這些仍是官方評測,正式部署應用自己的 Harness 再驗證。
4. 加入 GUI/Phone Use
Step 3.7 Flash 可以結合視覺與行動,在手機 GUI 或網頁畫面上辨識介面、執行操作,再重新觀察結果。
這也是原本這篇「Computer Use Agent」內容值得留下來的部分,但應作為 Step 3.7 Flash 的能力,而不是讓整個頁面變成泛用 Computer Use 指南。
Step 3.7 Flash API 要填什麼?
官方 Model ID:
step-3.7-flash
StepFun Global Platform 的 OpenAI-compatible base URL:
https://api.stepfun.ai/v1
中國平台則使用:
https://api.stepfun.com/v1
API Key 必須和對應 Region 的 Base URL 配對,否則官方文件指出可能會因授權不符被拒絕。
因此正式系統最好把:
provider
model_id
base_url
region
四個欄位分開保存,不要只有「Step 3.7 Flash」這個顯示名稱。
Step 3.7 Flash API 價格多少?
截至 2026 年 8 月 24 日,StepFun 官方模型卡列出的美元價格為:
| 每百萬 Tokens | 價格 |
|---|---|
| Input,Cache Miss | US$0.20 |
| Input,Cache Hit | US$0.04 |
| Output | US$1.15 |
Cache Hit 的 Input 價格只有一般輸入的五分之一,因此長時間 Agent 如果會重複帶入 System Prompt、Tool Schema、Repository 摘要或固定 Context,Cache 命中率會直接影響總成本。
對 Agent 工作,更適合比較:
Cost per Accepted Task
而不是單純比較每百萬 Token。
一個便宜模型如果需要更多搜尋、重試或人工修改,最終工作成本仍可能更高。
low、medium、high Reasoning Level 怎麼選?
Step 3.7 Flash 提供三個 Reasoning Level:
low
medium
high
它們的目的是讓同一個模型在延遲、成本與推理深度之間切換。
low
適合:
- 分類;
- 資料抽取;
- 短問答;
- 固定格式轉換;
- 單一步驟工具操作。
medium
適合:
- 一般 Coding;
- 文件分析;
- 多步驟搜尋;
- Tool Calling;
- 一般 Agent 工作。
high
適合:
- 困難 Coding;
- 複雜 Research;
- 多來源衝突;
- 長時間 Agent;
- 高錯誤成本任務。
更合理的策略仍然是找出每種工作「能穩定通過驗收的最低 Reasoning Level」。
如果 medium 已經可以穩定完成工作,high 增加的 Token 與延遲就未必值得。
Step 3.7 Flash 可以做 Computer Use 嗎?
可以,而且這是 Step 3.7 Flash 相較純文字 Flash 模型很重要的能力。
StepFun 官方展示了 Phone-use/GUI Operation,模型可以根據畫面理解目前狀態,再進行操作。
官方 Android Daily 評測列出的 Step 3.7 Flash 成績為 61.87%。
但「模型可以理解 GUI」和「可以安全讓它操作正式系統」仍是兩回事。
正式 Computer Use Agent 至少還需要外部 Harness 控制:
Observe
↓
Model proposes action
↓
Policy
↓
Human confirmation when required
↓
Execute
↓
Read back
↓
Verify
付款、寄信、公開發布、刪除、權限變更與正式環境部署,不能只因模型辨識出正確按鈕就直接執行。
Advisor Mode 是什麼?
StepFun 還為 Step 3.7 Flash 設計 Advisor Mode。
核心邏輯是:
Step 3.7 Flash 繼續擔任 Executor,只在少數真正困難的節點向更大型模型詢問。
例如:
- 一開始的複雜 Plan;
- 重複失敗後的 Recovery;
- 高難度架構判斷。
這種模式的目的,是避免整個 Agent Workflow 都使用昂貴 Frontier Model。
StepFun 官方在 SWE-Bench Verified 的內部測試中表示,Advisor Mode 可以用較低的單任務成本接近 Claude Opus 4.6 的 Coding 表現。
這屬於 StepFun 官方測試結果,實際成本仍取決於 Advisor、Harness、Tool Calls 與失敗率。
Step 3.7 Flash 是開源模型嗎?
StepFun 已公開模型權重,Hugging Face repository 使用 Apache 2.0 License。
官方目前提供:
- BF16;
- FP8;
- NVFP4;
- GGUF。
推論框架則包括:
- vLLM;
- SGLang;
- Transformers;
- llama.cpp;
- NVIDIA NIM。
因此它具備相當完整的自架路徑。
Step 3.7 Flash 可以在 Mac 上跑嗎?
可以,但需要非常大的統一記憶體,而且應使用量化版本。
StepFun 官方 llama.cpp 文件目前列出:
| GGUF | 大小 |
|---|---|
| Q4_K_S | 約 111.5GB |
| IQ4_XS | 約 104.99GB |
| Q3_K_L | 約 102.5GB |
| Multimodal Projector | 約 3.97GB |
| Runtime Overhead | 約 7GB |
官方最低要求約:
120GB unified memory/VRAM
建議:
128GB unified memory
所以 128GB Mac Studio 或特定 128GB 以上 MacBook Pro 的確進入「可以嘗試完整量化模型」的範圍。
64GB 機器則不足以依官方這組完整 llama.cpp 配置直接載入。
需要注意,這裡指的是 Q3/Q4 量化模型。
BF16 完整權重的記憶體需求遠高於 128GB。
vLLM 與 SGLang 怎麼部署?
大型 GPU Server 可以直接使用 StepFun 提供的 vLLM/SGLang 路徑。
官方 BF16/FP8 範例使用:
Tensor Parallel = 8
並開啟 Expert Parallel、Reasoning Parser、Tool Call Parser 與 speculative decoding。
NVFP4 路徑則可以下降到 TP4/EP4,但正式範例同時限制 max-model-len,因此不能看到 FP4 就直接推論「所有 256K Context 都能在較少 GPU 上使用」。
模型量化、Context、KV Cache 與 concurrency 必須一起算。
Step 3.7 Flash Benchmark 怎麼看?
StepFun 官方公布的代表性結果包括:
| Benchmark | Step 3.7 Flash |
|---|---|
| ClawEval-1.1 | 67.1 |
| Toolathlon | 49.5 |
| SWE-Bench Pro | 56.3 |
| SWE-Bench Verified | 76.5 |
| Terminal-Bench 2.1 | 59.6 |
| BrowseComp | 75.8 |
| DeepSearchQA F1 | 92.8 |
| V* with Python | 95.29 |
| Android Daily | 61.87 |
這些結果適合判斷模型的訓練方向:Coding、Search、Vision、GUI 與 Tool Use 都是 Step 3.7 Flash 的重點。
但官方比較表同時混有供應商官方成績與 StepFun 自行重測的競品成績,所以不應直接把整張表轉成「全球模型排名」。
真正的採用決策仍應使用同一套 Harness 重跑候選模型。
哪些工作最適合 Step 3.7 Flash?
最值得測試的是:
- Coding Agent;
- Search/Research Agent;
- 視覺資料分析;
- GUI/Computer Use;
- 大型文件;
- 多工具 Workflow;
- 高吞吐 Agent Worker;
- 需要同時控制能力與成本的 Agent Pipeline。
如果工作只需要短文字分類或固定格式轉換,模型能力可能過剩,可以再往更小的模型分流。
常見問題
Step 3.7 Flash 的 Model ID 是什麼?
官方 API 使用 step-3.7-flash。
Step 3.7 Flash 有多少參數?
StepFun 模型卡使用 198B 架構口徑:196B Language Backbone 加 1.8B Vision Encoder,每 Token 約啟用 11B。
為什麼 Hugging Face 顯示 201B?
Hub 的 Safetensors metadata 與官方架構統計方式不同。比較模型架構時可使用官方 198B;部署容量則應直接查看實際 checkpoint。
Step 3.7 Flash Context 多大?
256K Tokens。
Step 3.7 Flash 支援圖片嗎?
支援。它是 Vision-Language Model,可直接接受圖片與文字輸入。
Step 3.7 Flash API 多少錢?
目前官方模型卡為 Input Cache Miss US$0.20/MTok、Cache Hit US$0.04/MTok、Output US$1.15/MTok。
Step 3.7 Flash 可以用 Ollama 或 llama.cpp 嗎?
官方提供 GGUF 與 llama.cpp 路徑;Hugging Face 也提供量化版本供相容工具使用。
64GB Mac 可以完整跑 Step 3.7 Flash 嗎?
依 StepFun 官方目前 GGUF 配置,不足。官方最低約 120GB unified memory/VRAM,建議 128GB。
Step 3.7 Flash 是什麼授權?
Apache 2.0。
Step 3.7 Flash 的定位相當清楚:它用約 11B active parameters 承接一個接近 200B 級模型的容量,再把圖片、搜尋、Coding、GUI 與 Tool Use 組合進同一個 Agent 模型。對需要大量 Agent 工作、又無法讓每一個請求都使用最昂貴 Frontier Model 的團隊,這種「Flash 級成本+完整 Agent 能力」才是它最值得測試的地方。
資料來源:StepFun Step 3.7 Flash 官方發布頁、StepFun 官方 Hugging Face Model Card、StepFun Open Platform 與官方部署文件。
KEEP READING
接著讀什麼?
從同一主題繼續閱讀,或回到 YOLO LAB 的完整文章索引,找到下一個值得投入時間的問題。


發表迴響