首頁 > 科技與 AI > Inference.net $0+ usage 是免費 Token 嗎?Gemma 3 27B 條件式學生 Agent 導流

延伸主題

Inference.net $0+ usage 是免費 Token 嗎?Gemma 3 27B 條件式學生 Agent 導流

Inference.net $0+ usage、monthly cr...

Inference.net $0+ usage、direct Gemma 3 27B、Gateway credits、model price 與學生 Agent 的 YOLO LAB 原創封面

Inference.net 是第 48 個值得查核的學生 AI Agent API 候選,但目前不能直接列為「固定免費 token」。官方 pricing 頁把 Pay as you go plan 寫成 $0+ usage,並列出每月 1M Gateway requests、1M tracing spans、1 seat、14 天資料保留和 30 requests per minute;同一頁也說每個 plan 有 monthly credits,可用於 fine-tuning、evals、gateway routing 和 observability。這些是平台與 Gateway 的免費/低門檻條件,不等於官方已承諾每月固定的 inference token 數。

Inference.net $0+ usage、direct Gemma 3 27B、Gateway credits、model price 與學生 Agent 的 YOLO LAB 原創封面
YOLO LAB 原創編輯封面:以 Inference.net direct Gemma 3 27B、$0+ usage、Gateway/tracing credits、model price 與學生 Agent 人工停止線呈現導流入口;非 Inference.net 或 Google 官方宣傳圖。

官方 API Quickstart 說 Inference.net API 是 OpenAI-compatible,學生可以用一個 Inference API key 呼叫平台上託管的 open-source model;若透過 Catalyst 代理 OpenAI、Anthropic、Groq 或其他服務,仍要提供下游 provider key。這兩條路的付款責任、資料流、secret 數量和免費資格完全不同,不能因為 endpoint 相同就合併計算。

本篇的放行結論是:Inference.net 可以作為主要 agent 的「條件式低成本/可能有免費 usage」候選,但狀態先設為 CONDITIONAL,不能宣稱免費 token ready。學生只有在本人帳戶 dashboard 能讀回 actual inference credits、model pricing、request cost、billing status、rate limit 和 data policy 後,才可做一次低量 synthetic canary;沒有這些 read-back 就停在本機 stub,不把不確定性當成免費。

本系列只整理合法公開的免費或低成本入口,不捕獲私人 API key、不使用別人的帳戶、不輪換身份、不開啟自動付款、不把 provider key 貼到 prompt,也不把搜尋結果中的 marketing credits 當成永久條款。主要 agent 的基本資料與人工接手原則可延伸閱讀 AI agent 使用 FAQ

當日敲門模型:Google Gemma 3 27B(direct open-source candidate)

Inference.net 官方 API Quickstart 當日以 google/gemma-3-27b-instruct/bf-16 示範 direct open-source model;官方模型頁列 Gemma 3 27B、128K context。它適合作為第一個 direct path 敲門候選,因為不需要下游 provider key,但不代表 inference token 免費;學生仍要從本人帳戶 read-back model price、actual inference credits、request cost、billing status、retention 與 rate limit。

若當日帳戶只顯示 Gateway/tracing credits,或模型價格與 direct inference cost 無法讀回,狀態維持 CONDITIONAL,不做 live canary。第一個 canary 只送短 synthetic text、低 max tokens、單一 direct model;Catalyst、OpenAI/Anthropic proxy、custom deployment 和 GPU path 另做審查,不用同一條「免費」預算。

Inference.net 的產品邊界

官方文件把平台分成 tracing、gateway、datasets、evaluate、train、deploy 和 inference API。Tracing 會捕捉 LLM call、tool call 與 agent step;Gateway 會路由 LLM traffic、記錄 usage/cost、建立資料集與執行評估;Inference API 則以一個 API key 呼叫 open-source、popular closed-source 或 custom model。學生首先要選定自己真正使用的產品,否則容易把 tracing span、gateway request、模型 token 和平台 credits 混成一個數字。

如果目標是學生主要 agent 的文字燃料,優先研究 direct API 呼叫 open-source model;如果目標是觀察 agent 流程,才研究 Gateway 的 tracing 與 cost dashboard。Gateway 的 1M included requests 是請求觀測層的配額,不應直接換算成 1M 次免費模型生成,更不能換算成固定 output token。文章後面的 adapter 會把兩者分成不同的 ledger。

$0+ usage 與目前可確認的免費項目

截至 2026-08-24,官方 pricing 頁的 Pay as you go 欄位是 $0+ usage,包含 1M Gateway requests、1M tracing spans、14 天 data retention、1 seat 與 30 req/min。這表示可以從零成本或小額用量開始評估平台,但頁面沒有給出一個可直接引用的「每月免費 inference dollars」或「每月免費 inference tokens」數字。計畫書必須把未公布的部分寫成 UNKNOWN,不能用 1M Gateway requests 代替。

官方 pricing 頁也寫明,每個 plan 有 monthly credits,可用於 fine-tuning、evals、gateway routing 與 observability;Growth plan 另列 $50 one-time opening credit,但它不是 Pay as you go Free user 的同一條件。學生不應因為看見 Growth 的 $50 就假設自己的免費帳戶也有 $50,更不應在沒有付款授權時升級或啟動 auto-charge。

某些官方文章或活動頁可能出現一次性 promotional credits;這些內容若沒有同步反映在現行 pricing、dashboard 和 Terms,就只能當候選線索,不能當主要 agent 的長期燃料預算。每次課堂開始前,帳戶持有人要讀回當日 plan、credits、model price、request cost、expiry 和付款設定,保存數字與時間,而不是保存 credential。

對學生來說,最容易發生的誤判是把「零起始價格」當成「零成本模型」。$0+ usage 可以代表帳戶在沒有實際使用時不先收固定月費,也可以代表平台提供一組可消耗的 monthly credits;它沒有回答每個 model 的 input/output token 價格、免費 credits 是否能抵扣 direct inference、credits 何時重置、剩餘 credits 是否 rollover,或超過後是否需要購買。這些問題必須逐一從同一個帳戶的 pricing、dashboard 和 response ledger 回讀,任何一項沒有答案都保留條件式狀態。

課程預算也要避免共享帳戶造成的責任不清。若老師示範、學生實驗、失敗重試和 agent tool loop 都使用同一個帳戶,學生看到的剩餘 credits 不能代表自己的消耗;若多個 app 共用同一把 key,發生外洩時也難以定位哪一個 app 需要撤銷。較好的教學方式是每個實驗用獨立 task id 與環境標籤,限制每日工作量,課堂結束後讀回 usage,並由人工決定是否繼續,而不是用更多請求把帳本補齊。

Inference request 與 Gateway request 不可混算

Gateway request 是一個被 Gateway 接收、路由或觀測的請求;inference token 是下游模型實際處理的 input/output 單位;tracing span 是一段可觀測的操作紀錄。一次 agent 工作可能只有一個使用者請求,卻產生多個模型回合、工具回合、retry 和 spans。反過來,一個 request 也可能因為 streaming、batch 或 provider routing 產生不同成本。

學生 ledger 應至少分成四欄:platform requests、model input/output tokens、gateway/tracing spans 和 monetary cost。若 API response 沒有回傳 token 或 cost,就記成 USAGE_UNKNOWN;若 dashboard 只顯示 Gateway request,就只能宣稱 Gateway 使用量已讀回,不能宣稱模型燃料免費。這個分界是本篇把 Inference.net 標成條件式候選的主要原因。

帳務快照要和模型快照一起保存,否則下月價格或 provider 變更後,舊報告就無法重現。快照只放日期、數字、欄位名稱和來源連結,不放 email、key 或完整對話;這樣可以在不暴露秘密的情況下重新檢查免費資格,並保留清楚的人工決策記錄。

function validateInferenceBudget(state, now = Date.now()) {
  if (state.plan !== 'payg-free-candidate') {
    throw new Error('Inference.net plan must be read back from the account');
  }
  if (!Number.isFinite(state.gatewayRequestsRemaining) || state.gatewayRequestsRemaining < 0) {
    throw new Error('Gateway request balance is unknown');
  }
  if (!Number.isFinite(state.inferenceCreditsRemaining)) {
    throw new Error('Inference credits are not published or not readable');
  }
  if (!state.model || !Number.isFinite(state.inputPrice) || !Number.isFinite(state.outputPrice)) {
    throw new Error('Model pricing read-back is incomplete');
  }
  if (state.autoTopup === true || state.customProviderKey === true) {
    throw new Error('Paid or custom-provider path is not allowed for this free canary');
  }
  if (state.checkedAt + state.maxReadbackAgeMs < now) {
    throw new Error('Inference.net budget read-back is stale');
  }
  return true;
}

這段是主要 agent 的本地 guard,不是 Inference.net 的官方帳戶 schema。它刻意要求 actual inference credits 與 input/output price 同時存在;只知道 plan 顯示 $0+ usage 或 Gateway request 尚餘,就不能通過免費燃料閘門。custom provider key、auto top-up、過期 dashboard 和沒有價格的 model 都回到人工審查,並留下原因。

建立 API key 前的身份與付款邊界

官方 Quickstart 的流程是建立帳戶、在 dashboard 的 API Keys 建立 key 或使用預設 key,再把它放進 INFERENCE_API_KEY 環境變數。這只表示 API 的身份入口,不表示免費,也不表示 key 可以分享。每個學生或每個受控 app 應有自己的最小 scope、owner、撤銷方式與用途;secret 不進前端、Git、課程簡報、issue、prompt 或錯誤訊息。

未經明確付款授權,主要 agent 不得建立 key 後自動綁卡、升級 Growth、購買 credits 或開啟 top-up。遇到付款頁、credit card、billing required、balance negative、cost unknown 或 plan 轉換,狀態應為 PAYMENT_REVIEW。停止不是失敗,而是避免學生把「可建立 API key」誤認為「有一把免費 token」。

每把 key 都要有用途和生命週期:建立日期、使用的 app、允許的 model path、可接受的資料類型、最大請求速率、撤銷人和期末清理日期。若學生在本機測試,key 只進入本機受控環境變數;若是課堂後端,key 由老師或管理者保存,學生只收到受限的功能,不收到原始 key。發現 key 出現在 log、截圖或聊天時,立即撤銷並檢查 usage,不等待事件自行消失。

Direct open-source model 與 Catalyst proxy

Direct API 路徑只需要 Inference API key,官方 Quickstart 說可以呼叫平台託管的 open-source model;這是學生先研究的路徑。Catalyst proxy 則可以把 OpenAI、Anthropic、Groq 等外部 provider 接進來,並在 header 傳下游 provider key。後者增加資料與 credential 的流動,也把費用責任移到外部帳戶,不應被包裝成 Inference.net 免費模型。

Adapter 要把 direct_open_sourcecatalyst_proxycustom_model 三個 scope 分開。direct path 只允許通過 model allowlist 的平台模型;Catalyst path 必須另外確認 provider、下游 key、資料 policy、billing 和 retry;custom model path 需要 team slug、deployment、GPU/storage 和自己的計費 read-back。不能只換 base URL 就讓三種路徑共享免費預算。

資料流的差異要在介面上顯示。Direct path 至少會把 prompt、response、model 和 API key 送到 Inference.net;Catalyst path 會再把請求交給指定的外部 provider,並可能帶著下游 provider key;Gateway/tracing 可能留下 task id、environment、latency、工具回合和資料集 metadata。學生介面不能只顯示「成功」,還要顯示本次路徑、可能的處理方、retention 設定、是否啟用 tracing、是否使用了外部 provider,以及遇到 credits 不足時的停止方式。

如果課程只要比較模型品質,應先用本機 stub 產生固定 response,再做一次極小的公開資料 canary;如果課程要學成本觀測,才額外開啟 Gateway 或 tracing,並把觀測層費用與模型推論費用分開。不要為了取得一個漂亮的 latency chart 就把私人 prompt、學生姓名或工具結果送進第三方服務。最小資料、最小 scope 和最短保存期,才是免費方案可以持續使用的基本條件,也方便日後撤回資料。

async function callInferenceDirect(model, messages, config = {}) {
  const selectedModel = String(model || 'google/gemma-3-27b-instruct/bf-16');
  if (config.path !== 'direct_open_source') {
    throw new Error('Only the direct open-source path is allowed');
  }
  if (!config.allowedModels || !config.allowedModels.includes(selectedModel)) {
    throw new Error('Inference.net model is outside the allowlist');
  }
  const controller = new AbortController();
  const timeout = setTimeout(() => controller.abort(), config.timeoutMs || 60000);
  try {
    const response = await fetch('https://api.inference.net/v1/chat/completions', {
      method: 'POST',
      headers: {
        'Authorization': `Bearer ${config.apiKey}`,
        'Content-Type': 'application/json'
      },
      body: JSON.stringify({
        model: selectedModel,
        messages,
        stream: false,
        max_tokens: config.maxTokens || 256
      }),
      signal: controller.signal
    });
    const body = await response.json();
    if (!response.ok) throw new Error(`Inference.net ${response.status}: ${body.error || 'request failed'}`);
    return { body, status: response.status };
  } finally {
    clearTimeout(timeout);
  }
}

這個範例只示範 adapter guard 和 response handling,不代表本輪已發 live request。實作時 config.apiKey 必須由後端 secret store 注入,不能由模型、學生 prompt 或瀏覽器輸入;若資料分類不是公開或去識別化,就在 fetch 前拒絕。response 也要另行記錄 model、provider、usage、request id、費用和是否使用 credits。

Free 30 RPM 與隊列控制

官方 Rate Limits 文件目前列 Generation Free tier 30 RPM,Paid 250 RPM;Gateway general limit 則是每個 API key 或 IP 每秒 100 requests。這些是速率限制,不是 token 額度,也不是承諾模型每分鐘一定能完成 30 個回應。學生 agent 要設定比官方上限更低的本地隊列,例如一次只處理一個短任務,並把 batch、retry、tool loop 和多學生共用帳戶的請求全部算進同一個窗口。

遇到 429 可以在明確的 Retry-After 或服務文件允許時做有限退避;遇到 401/403 是 key 或權限問題,402/billing/credits 是付款問題,404/model unavailable 是模型路徑問題,5xx 是服務或上游問題。不同錯誤不能全都重試,尤其不能用自動 failover 或第二個帳戶來規避額度與付款。

async function boundedInferenceRetry(call, limits = {}) {
  const maxRetries = limits.maxRetries || 2;
  let delayMs = limits.initialDelayMs || 1000;
  for (let attempt = 0; attempt <= maxRetries; attempt += 1) {
    const result = await call();
    if (result.status >= 200 && result.status < 300) return result;
    const retryable = result.status === 429 || result.status >= 500;
    if (!retryable || attempt === maxRetries) return result;
    await new Promise(resolve => setTimeout(resolve, delayMs));
    delayMs = Math.min(delayMs * 2, 8000);
  }
  throw new Error('Inference.net retry loop ended unexpectedly');
}

本地 retry 必須和 ledger 綁在一起:同一次 job 的 retry 次數、request id、status、是否產生 output、是否可能計費都要保存。若回應 body 已經產生但網路在最後中斷,不要盲目重送可能重複扣費;先由人工查看 dashboard 或 request status。重試的目的只是處理短暫服務錯誤,不是把免費額度變成無限額度。

Usage、cost 與模型目錄 read-back

Inference.net 的 model catalog、API response 與 dashboard 是不同的真相來源。Catalog 告訴你模型路徑與能力;response 告訴你這次是否成功、輸出與可能的 usage;dashboard 才可能告訴你帳戶 credits、request cost、plan、retention 和 billing 狀態。主 agent 不應從模型名稱猜價格,也不應從 Gateway span 數猜 token 數。

學生的去識別化 ledger 可保存日期、task id、model、path、input/output token、request id、status、latency、estimated cost、actual cost read-back、credits before/after、RPM bucket、資料分類和人工驗收。不要保存 API key、完整 private prompt、完整 customer response、billing email 或 dashboard screenshot。當 actual cost 尚未回讀,估算值只能標成 provisional。

ledger 還要保存「拒絕原因」,例如沒有 inference credit、沒有 model price、資料分類不是 public/synthetic、path 是 Catalyst、RPM 接近上限、payment required 或 response 沒有 usage。拒絕事件不是無用資料,它可以告訴老師學生到底是在學模型、學 rate limit、學帳務,還是在無意中消耗資源。把成功與拒絕放在同一張去識別化表中,才能估算真正的課程成本和人工處理量。

資料保留、Gateway tracing 與學生資料

Inference.net Data Retention 文件目前說 request data 預設不用於 model training,secrets 類敏感值會在可能時移除,平台資料傳輸中與靜態時加密;同時要求使用者按 workflow 的 operational need 設定 retention。Pricing 頁對 Pay as you go plan 列 14 天 retention。這些說明不等於可以送出秘密或個資,因為資料可能還會經過 provider、Gateway、工具、SDK log、瀏覽器與學生自己的儲存層。

Privacy Policy 說服務可能收集帳戶資料、支付資料、上傳的 User Content、裝置與使用資料,也說明服務供應商與客戶流程的資料處理。學生初始只送公開內容、虛構資料、短 synthetic text 或已取得同意的去識別化內容;不送 secrets、PII、病歷、客戶對話、未公開研究、學生個資或公司程式碼。若課程需要 tracing,先確認哪些 prompt、tool result 和 metadata 會被保存。

Terms、未成年學生與帳戶責任

Inference.net Terms 目前要求使用者能形成具有法律效力的合約;未成年使用者一般禁止,除非家長或法定監護人閱讀、批准並同意承擔條款。這不是 agent 可以自行判斷的技術欄位,學校、家長與帳戶持有人要按地區和課程情境確認。未確認資格、付款責任或組織授權時,停在本機 stub,不建立帳戶或 API key。

帳戶與 key 也不能共用。若由老師建立課程帳戶,應清楚定義 owner、學生可見範圍、credits 預算、撤銷流程和期末清理;若每位學生自有帳戶,就由本人承擔自己的 usage、資料與條款。主要 agent 不得自動建立多帳戶、使用別人的 API key 或利用 retry、IP、proxy、failover 逃避 rate limit。

學生主要 agent 三階段流程

第一階段是 offline contract:用 stub 模擬 plan、Gateway request、inference credits、model price、429、401、402、404、500、timeout、actual cost unknown 和 auto-top-up;確認 adapter 會在帳務資料不完整時停止。這階段不需要 Inference.net 帳戶,也不會送出 prompt。

第二階段是本人帳戶 read-back:帳戶持有人手動查看 plan、pricing、credits、model catalog、retention、rate limit、API key scope 和 payment settings,保存查核日期與去識別化數字。只有 direct open-source path、公開或 synthetic data、短 output、單一請求和人工 stop 才能通過低量 canary。

第二階段的 canary 不應追求把免費額度用到最後一滴。每個案例先設定最大輸入、最大輸出、最多一次重試和最多一個工具回合;完成後立即讀回 response、usage、cost、credits before/after 與實際路徑。若 credits 變化無法解釋,先停止新請求,保留 request id 和查核時間,再由帳戶持有人查看 dashboard。沒有 billing read-back 的成功回應,只能算功能 smoke,不能算免費燃料驗收。

第三階段才是 bounded agent:每個 job 限定模型、token、工具回合、總時間、RPM、retry 和資料分類;每次完成都寫入 cost/usage ledger。若 actual inference credit 不明、plan 改變、provider unavailable、billing 出現、retention 不合適或 output 未完整,就回到人工。成功一次只證明一次 read-back contract,不能宣稱可長期免費。

負面驗收要至少包含六種情境:把 Gateway request 餘額誤當 inference credit、把 Growth opening credit 誤當 Free plan、把 Catalyst 外部 key 誤當 direct model、把 30 RPM 誤當 token quota、把 14 天 retention 誤當永久不保存,以及把 $0+ usage 誤當每月固定免費金額。每種情境都應讓 adapter 拒絕、顯示原因並要求人工確認。若測試只覆蓋成功回應,主要 agent 仍可能在最危險的帳務邊界自動繼續。

學生最後交付的不是一把 API key,而是一份可重跑的 evidence packet:查核日期、plan 名稱、免費項目、inference price 是否可讀、模型與路徑、資料分類、rate limit、credits before/after、實際 provider、錯誤與人工決策。key 只留在本人或課程管理者的秘密管理工具,報告只放環境變數名稱、範例欄位和去識別化數字。這樣下一次條款或價格變更時,可以重新驗收而不必重新收集秘密。

function classifyInferenceState(input) {
  if (input.paymentRequired || input.autoTopup) return 'PAYMENT_REVIEW';
  if (input.inferenceCreditsUnknown || input.priceUnknown) return 'LOCAL_ONLY';
  if (input.dataClass !== 'public' && input.dataClass !== 'synthetic') return 'HUMAN_REVIEW';
  if (input.rpmUsed >= 25 || input.toolRounds > 2 || input.outputTokens > 512) return 'STOP';
  if (input.path !== 'direct_open_source') return 'PROVIDER_REVIEW';
  return 'CANARY_ALLOWED';
}

這個分類器把「免費」拆成帳務、資料、路徑、速率、工具和輸出幾個獨立條件。它不會自己讀取 Inference.net,也不應被當成平台的官方 quota;真正的值要由使用者授權的 dashboard/API read-back 提供。任何欄位缺失都採保守狀態,避免主要 agent 把不確定性當成免費額度。

本篇的 Inference.net 燃料決策

Inference.net 的優點是 OpenAI-compatible API、可直接呼叫託管的 open-source models、Free 30 RPM、1M Gateway requests、1M tracing spans、14 天 retention,以及把 agent tracing、cost 與 eval 放在同一平台。它的限制是現行 pricing 頁沒有公布固定免費 inference token/美元額度,Gateway request 不能換算成模型 token,API key 需要帳戶,Catalyst proxy 還會牽涉下游 provider key,資料會經過平台與可能的外部服務。

因此本篇把 Inference.net 列為 CONDITIONAL,不是 FREE_TOKEN_READY。只有當本人帳戶能回讀實際 inference credits、模型 input/output price、request cost、payment state、rate limit 和 retention,且資料分類與條款都獲得批准,才可做一次低量 synthetic canary。沒有這些條件,就選 Ollama local-only、本機 stub 或系列中已完成查核的其他 provider。

主要 agent 的 fallback 順序應該是可解釋的:先停在 Inference.net 的人工審查,再回到本機 stub 或 Ollama local-only;若要改用其他雲端 provider,必須重新檢查帳戶 owner、免費額度、資料 policy、model license、rate limit 和付款設定。Fallback 不能只看哪個 endpoint 還能回話,因為可用不代表免費、合法、資料安全或適合學生長期學習。

這個結論也讓系列索引保持誠實:Inference.net 有清楚的免費平台項目和低門檻 API,但免費 inference token 的數字目前不足以做固定承諾。因此它可以保留在「待本人帳戶 read-back」清單,不能排在 Ollama、Puter 或明確列出免費 credits 的 provider 前面。下一輪仍要重新查官方 pricing,而不是沿用本篇的 snapshot。

截至 2026-08-25,本篇完成 Inference.net pricing、API quickstart、model catalog、rate limits、data retention、privacy 與 terms 官方查核,以及本機 HTML 草稿驗收;沒有建立 Inference.net 帳戶、建立 API key、發 live request、啟動 Catalyst、提供下游 provider key、付款、開啟 top-up 或傳送外部資料。工作區沒有授權 Inference.net 帳戶,因此不代收、不建立、不分享任何 key、prompt、response 或 billing 資料。

Inference.net 官方查核入口

下一篇會重新查找另一個仍可驗證的免費或條件式 API 候選;Inference.net 的 $0+ usage、Gateway request 和 monthly credits 不會被延伸成固定免費 token,也不會因為本篇完成就自動註冊、建立 API key、啟動付款、使用 Catalyst 或傳送資料。安全停機。

作者與編輯責任

本文署名作者:

|YOLO LAB 主編

YOLO LAB 的文章由署名作者或編輯團隊完成。主編 Dex 負責編輯制度、重要事實查核原則、AI 協作規範與重大更正;文章中的分析與判斷以公開來源、作品內容及可驗證資料為依據。

文章若有需要補充或修正的資料,可透過聯絡頁提供原始來源、日期與具體段落,編輯團隊會依出版政策檢查。

KEEP READING

接著讀什麼?

從同一主題繼續閱讀,或回到 YOLO LAB 的完整文章索引,找到下一個值得投入時間的問題。

發表迴響

探索更多來自 YOLO LAB 的內容

立即訂閱即可持續閱讀,還能取得所有封存文章。

繼續閱讀