首頁 > 科技與 AI > TranslateGemma是什麼?4B/12B/27B、55語言與本地部署

延伸主題

TranslateGemma是什麼?4B/12B/27B、55語言與本地部署

TranslateGemma是Google基於Gemma 3建立的開…

TranslateGemma是什麼?4B/12B/27B、55語言與本地部署

TranslateGemma是Google Translate團隊基於Gemma 3建立的開放翻譯模型家族,提供4B、12B與27B三種命名規模,面向55種語言的文字翻譯,並保留Gemma多模態能力,可處理包含文字的圖片翻譯。較小模型適合Laptop、Desktop與Edge,較大模型則提供較高翻譯品質與更高硬體需求。

TranslateGemma的價值不在取代所有商業翻譯API,而是讓團隊能在自己的硬體、Cloud與資料邊界內執行翻譯,建立Glossary、Translation Memory、Domain Eval與人工覆核。模型權重受Google Gemma Terms約束,使用前仍需確認License與可接受用途。

重點快讀

  • TranslateGemma基於Gemma 3模型家族。
  • 提供4B、12B與27B三種型號。
  • 官方模型卡列出55種語言翻譯能力。
  • 4B適合消費級硬體與邊緣部署。
  • 12B提供品質、速度與記憶體的中間選擇。
  • 27B品質通常最高,也需要更大VRAM或多GPU。
  • 支援文字翻譯與含文字圖片的視覺翻譯評測。
  • 官方主要使用Transformers;其他Runtime相容性要逐版確認。
  • BLEU或單一分數不足,應搭配COMET、MetricX、MQM與人工Review。

三種模型怎麼選?

模型適合主要取捨
TranslateGemma 4BLaptop、單張消費GPU、Edge與高吞吐複雜語境和低資源語言可能較弱
TranslateGemma 12B工作站、企業內部服務與品質優先批次需要較大GPU,但成本仍可控制
TranslateGemma 27B最高品質、複雜文本與研究評測VRAM、延遲和Serving成本最高

模型名稱中的4B、12B與27B是產品規模標示,Hugging Face介面顯示的完整參數數可能因Embedding與架構計算略有差異。比較部署時應以實際Checkpoint大小與Runtime Memory為準。

55種語言代表什麼?

官方模型卡以WMT24++的55語言集合評估TranslateGemma。支援語言不代表每個方向品質相同:高資源英語、中文、西班牙文、德文與日文等通常有較多資料,低資源語言、方言、混合語言和專業領域仍需單獨測試。

  • Source Language與Target Language方向分開測。
  • 同一語言的Formal、Casual與Dialect分開。
  • 測Code-switching與專有名詞。
  • 測數字、日期、單位和Currency。
  • 測Right-to-left與Unicode。
  • 低資源語言加入母語Reviewer。

「支援55語言」是模型覆蓋範圍,不是每一語言對都達到相同商用品質。

文字與圖片翻譯

輸入任務注意
純文字句子、段落、文件與對話翻譯保留段落、標記與術語
含文字圖片招牌、海報、UI、截圖與文件片段OCR、版面和視覺語境
混合圖文圖片內容加文字說明確認模型是否翻譯所有可見文字

官方Vistra評測使用包含單一文字區域的圖片。複雜多欄版面、手寫、低解析度、藝術字與多文字區圖片仍需要Document AI或OCR前處理,再交給模型翻譯。

官方Benchmark怎麼看?

評測指標方向
WMT24++ 55語言MetricX、COMET廣泛語言品質
WMT25 10語言MQM人工錯誤類型與嚴重度
Vistra 4語言MetricX圖片文字翻譯

官方模型卡顯示,模型規模增加時MetricX通常下降、COMET上升,代表大型版本整體品質較高。這些分數是特定Benchmark平均,不應直接替代自己的Domain資料。

BLEU、COMET、MetricX與MQM差在哪?

指標優勢限制
BLEU快速、可重現、歷史廣泛偏表面N-gram,對改寫不友善
COMET學習式語意品質評估自身模型可能有偏差
MetricXGoogle研究中的學習式Metric需要理解版本和分數方向
MQM人工標記錯誤類型與嚴重度昂貴且需要專業Reviewer

正式翻譯應同時使用自動Metric與人工MQM抽查,特別是術語、遺漏、添加、語氣和數字錯誤。

使用Transformers載入

from transformers import AutoProcessor, AutoModelForImageTextToText

model_id = "google/translategemma-4b-it"
processor = AutoProcessor.from_pretrained(model_id)
model = AutoModelForImageTextToText.from_pretrained(
    model_id,
    device_map="auto",
    torch_dtype="auto",
)

messages = [{
    "role": "user",
    "content": [{
        "type": "text",
        "text": "Translate from English to Traditional Chinese: The warranty expires next month."
    }]
}]

實際Class、Chat Template與Generation方法會隨Transformers版本更新,應以官方Model Card當前範例為準。部署前鎖定Transformers、Torch、CUDA與Checkpoint Revision。

本地VRAM怎麼估?

模型BF16/FP16權重約值4-bit權重約值
4B約8至12GB加Runtime約3至6GB加Runtime
12B約24至30GB加Runtime約8至12GB加Runtime
27B約54至65GB加Runtime約18至25GB加Runtime

表格是容量估算,不是保證。圖片輸入、Context、KV Cache、Batch、Runtime Workspace和Quantization Metadata都會增加顯存。Apple Silicon則受統一記憶體與Runtime支援影響。

量化怎麼選?

  • 先建立原始BF16/FP16品質基線。
  • 4-bit適合個人本機與高併發。
  • 術語、數字與低資源語言可能對量化較敏感。
  • Vision Encoder或部分Layer可能保留高精度。
  • 社群GGUF、MLX或其他轉換不是Google官方Checkpoint。
  • 重新量測COMET、MQM和實際延遲。

只看模型能否載入不足以決定量化品質。翻譯的錯誤常很流暢,需要和原文逐句核對。

vLLM、llama.cpp與MLX

TranslateGemma官方模型卡主要提供Transformers路徑。vLLM、llama.cpp、MLX與GGUF相容性會隨Model Architecture和社群轉換更新:

  • 確認Multimodal Processor是否支援。
  • 確認Chat Template一致。
  • 確認Vision Input和文字Input路徑。
  • 確認Quantization格式。
  • 使用官方Checkpoint做Output對照。
  • 不支援時保留Transformers Fallback。

Prompt怎麼寫?

Task: Translate from Korean to Traditional Chinese for Taiwan readers.

Requirements:
- Preserve product names and model numbers.
- Use the provided glossary.
- Keep uncertainty and modal verbs.
- Do not add explanations not present in the source.
- Preserve paragraph breaks and placeholders.
- Return translation plus flagged terminology.
  • 明確Source與Target Language。
  • 指定地區語境,如台灣繁體中文。
  • 提供文本類型和讀者。
  • 提供Glossary和禁止翻譯項目。
  • 要求保留格式、Placeholder與數字。
  • 缺少資訊時標記,不自行補全。

Glossary與Translation Memory

資產用途
Glossary固定產品、法律、技術與人物譯名
Translation Memory重用已核准句段
Style Guide標點、數字、語氣與地區用字
Do-not-translate List品牌、Code、Placeholder與命令
Review History保存人工修改理由

模型不應每次重新決定關鍵術語。先由Translation Memory找Exact或Fuzzy Match,再讓TranslateGemma處理新內容,最後把核准結果回寫。

品質測試集

  • 產品UI和短字串。
  • 技術文件與程式碼註解。
  • 法律、條款與Modal Verb。
  • 客服情緒與禮貌程度。
  • 字幕長度與角色語氣。
  • 姓名、地名、日期和數字。
  • 低資源語言與混合語言。
  • 圖片中的多區文字。

人工MQM怎麼做?

  • Accuracy:誤譯、遺漏、添加。
  • Terminology:術語不一致。
  • Fluency:文法、拼字與自然度。
  • Style:語氣、地區和品牌規範。
  • Locale Convention:日期、數字、標點。
  • Severity:Minor、Major、Critical。

高風險內容的Critical Error應直接阻止發布,而不是和大量Minor Error平均成看似可接受分數。

Production工作流

  1. 偵測語言和文件類型。
  2. 套用Glossary與Do-not-translate。
  3. 查詢Translation Memory。
  4. 由TranslateGemma產生新譯文。
  5. 執行格式、數字和Placeholder檢查。
  6. 以COMET或內部Metric初篩。
  7. 高風險與低信心進人工MQM。
  8. 保存原文、譯文、模型與Reviewer。
  9. 核准結果回寫Translation Memory。

適合與不適合

較適合必須加強人工流程
內部文件與草稿法律合約
產品初版在地化醫療與藥物
大量內容預翻譯財務公開資訊
字幕與社群候選安全與高影響指令
私有資料本地處理文學最終出版

模型品質評估的一般原則仍是:流暢不等於忠實,可覆核性比單次速度更重要。

常見問題

TranslateGemma可以商用嗎?

模型受Google Gemma Terms約束。使用者需要閱讀當前條款、Prohibited Use與分發要求,不能只依「開放權重」名稱判斷。

4B模型適合MacBook嗎?

較適合,但需要相容Runtime與足夠統一記憶體。4-bit量化可降低容量,仍要測速度和翻譯品質。

27B一定比12B好嗎?

官方平均Benchmark通常較高,但特定語言、Domain和Latency需求可能讓12B更合適。應使用自己的測試集比較。

官方資料

TranslateGemma讓55語言翻譯能力能部署在Laptop、工作站和私有Cloud。模型大小決定品質與成本上限,Glossary、Translation Memory、MQM和人工責任則決定它能否成為可信的正式翻譯流程。

作者與編輯責任

本文署名作者:

YOLO LAB 的文章由署名作者或編輯團隊完成。主編 Dex 負責編輯制度、重要事實查核原則、AI 協作規範與重大更正;文章中的分析與判斷以公開來源、作品內容及可驗證資料為依據。

文章若有需要補充或修正的資料,可透過聯絡頁提供原始來源、日期與具體段落,編輯團隊會依出版政策檢查。

發表迴響

探索更多來自 YOLO LAB 的內容

立即訂閱即可持續閱讀,還能取得所有封存文章。

繼續閱讀