TranslateGemma是Google Translate團隊基於Gemma 3建立的開放翻譯模型家族,提供4B、12B與27B三種命名規模,面向55種語言的文字翻譯,並保留Gemma多模態能力,可處理包含文字的圖片翻譯。較小模型適合Laptop、Desktop與Edge,較大模型則提供較高翻譯品質與更高硬體需求。
TranslateGemma的價值不在取代所有商業翻譯API,而是讓團隊能在自己的硬體、Cloud與資料邊界內執行翻譯,建立Glossary、Translation Memory、Domain Eval與人工覆核。模型權重受Google Gemma Terms約束,使用前仍需確認License與可接受用途。
重點快讀
- TranslateGemma基於Gemma 3模型家族。
- 提供4B、12B與27B三種型號。
- 官方模型卡列出55種語言翻譯能力。
- 4B適合消費級硬體與邊緣部署。
- 12B提供品質、速度與記憶體的中間選擇。
- 27B品質通常最高,也需要更大VRAM或多GPU。
- 支援文字翻譯與含文字圖片的視覺翻譯評測。
- 官方主要使用Transformers;其他Runtime相容性要逐版確認。
- BLEU或單一分數不足,應搭配COMET、MetricX、MQM與人工Review。
三種模型怎麼選?
| 模型 | 適合 | 主要取捨 |
|---|---|---|
| TranslateGemma 4B | Laptop、單張消費GPU、Edge與高吞吐 | 複雜語境和低資源語言可能較弱 |
| TranslateGemma 12B | 工作站、企業內部服務與品質優先批次 | 需要較大GPU,但成本仍可控制 |
| TranslateGemma 27B | 最高品質、複雜文本與研究評測 | VRAM、延遲和Serving成本最高 |
模型名稱中的4B、12B與27B是產品規模標示,Hugging Face介面顯示的完整參數數可能因Embedding與架構計算略有差異。比較部署時應以實際Checkpoint大小與Runtime Memory為準。
55種語言代表什麼?
官方模型卡以WMT24++的55語言集合評估TranslateGemma。支援語言不代表每個方向品質相同:高資源英語、中文、西班牙文、德文與日文等通常有較多資料,低資源語言、方言、混合語言和專業領域仍需單獨測試。
- Source Language與Target Language方向分開測。
- 同一語言的Formal、Casual與Dialect分開。
- 測Code-switching與專有名詞。
- 測數字、日期、單位和Currency。
- 測Right-to-left與Unicode。
- 低資源語言加入母語Reviewer。
「支援55語言」是模型覆蓋範圍,不是每一語言對都達到相同商用品質。
文字與圖片翻譯
| 輸入 | 任務 | 注意 |
|---|---|---|
| 純文字 | 句子、段落、文件與對話翻譯 | 保留段落、標記與術語 |
| 含文字圖片 | 招牌、海報、UI、截圖與文件片段 | OCR、版面和視覺語境 |
| 混合圖文 | 圖片內容加文字說明 | 確認模型是否翻譯所有可見文字 |
官方Vistra評測使用包含單一文字區域的圖片。複雜多欄版面、手寫、低解析度、藝術字與多文字區圖片仍需要Document AI或OCR前處理,再交給模型翻譯。
官方Benchmark怎麼看?
| 評測 | 指標 | 方向 |
|---|---|---|
| WMT24++ 55語言 | MetricX、COMET | 廣泛語言品質 |
| WMT25 10語言 | MQM | 人工錯誤類型與嚴重度 |
| Vistra 4語言 | MetricX | 圖片文字翻譯 |
官方模型卡顯示,模型規模增加時MetricX通常下降、COMET上升,代表大型版本整體品質較高。這些分數是特定Benchmark平均,不應直接替代自己的Domain資料。
BLEU、COMET、MetricX與MQM差在哪?
| 指標 | 優勢 | 限制 |
|---|---|---|
| BLEU | 快速、可重現、歷史廣泛 | 偏表面N-gram,對改寫不友善 |
| COMET | 學習式語意品質評估 | 自身模型可能有偏差 |
| MetricX | Google研究中的學習式Metric | 需要理解版本和分數方向 |
| MQM | 人工標記錯誤類型與嚴重度 | 昂貴且需要專業Reviewer |
正式翻譯應同時使用自動Metric與人工MQM抽查,特別是術語、遺漏、添加、語氣和數字錯誤。
使用Transformers載入
from transformers import AutoProcessor, AutoModelForImageTextToText
model_id = "google/translategemma-4b-it"
processor = AutoProcessor.from_pretrained(model_id)
model = AutoModelForImageTextToText.from_pretrained(
model_id,
device_map="auto",
torch_dtype="auto",
)
messages = [{
"role": "user",
"content": [{
"type": "text",
"text": "Translate from English to Traditional Chinese: The warranty expires next month."
}]
}]實際Class、Chat Template與Generation方法會隨Transformers版本更新,應以官方Model Card當前範例為準。部署前鎖定Transformers、Torch、CUDA與Checkpoint Revision。
本地VRAM怎麼估?
| 模型 | BF16/FP16權重約值 | 4-bit權重約值 |
|---|---|---|
| 4B | 約8至12GB加Runtime | 約3至6GB加Runtime |
| 12B | 約24至30GB加Runtime | 約8至12GB加Runtime |
| 27B | 約54至65GB加Runtime | 約18至25GB加Runtime |
表格是容量估算,不是保證。圖片輸入、Context、KV Cache、Batch、Runtime Workspace和Quantization Metadata都會增加顯存。Apple Silicon則受統一記憶體與Runtime支援影響。
量化怎麼選?
- 先建立原始BF16/FP16品質基線。
- 4-bit適合個人本機與高併發。
- 術語、數字與低資源語言可能對量化較敏感。
- Vision Encoder或部分Layer可能保留高精度。
- 社群GGUF、MLX或其他轉換不是Google官方Checkpoint。
- 重新量測COMET、MQM和實際延遲。
只看模型能否載入不足以決定量化品質。翻譯的錯誤常很流暢,需要和原文逐句核對。
vLLM、llama.cpp與MLX
TranslateGemma官方模型卡主要提供Transformers路徑。vLLM、llama.cpp、MLX與GGUF相容性會隨Model Architecture和社群轉換更新:
- 確認Multimodal Processor是否支援。
- 確認Chat Template一致。
- 確認Vision Input和文字Input路徑。
- 確認Quantization格式。
- 使用官方Checkpoint做Output對照。
- 不支援時保留Transformers Fallback。
Prompt怎麼寫?
Task: Translate from Korean to Traditional Chinese for Taiwan readers.
Requirements:
- Preserve product names and model numbers.
- Use the provided glossary.
- Keep uncertainty and modal verbs.
- Do not add explanations not present in the source.
- Preserve paragraph breaks and placeholders.
- Return translation plus flagged terminology.- 明確Source與Target Language。
- 指定地區語境,如台灣繁體中文。
- 提供文本類型和讀者。
- 提供Glossary和禁止翻譯項目。
- 要求保留格式、Placeholder與數字。
- 缺少資訊時標記,不自行補全。
Glossary與Translation Memory
| 資產 | 用途 |
|---|---|
| Glossary | 固定產品、法律、技術與人物譯名 |
| Translation Memory | 重用已核准句段 |
| Style Guide | 標點、數字、語氣與地區用字 |
| Do-not-translate List | 品牌、Code、Placeholder與命令 |
| Review History | 保存人工修改理由 |
模型不應每次重新決定關鍵術語。先由Translation Memory找Exact或Fuzzy Match,再讓TranslateGemma處理新內容,最後把核准結果回寫。
品質測試集
- 產品UI和短字串。
- 技術文件與程式碼註解。
- 法律、條款與Modal Verb。
- 客服情緒與禮貌程度。
- 字幕長度與角色語氣。
- 姓名、地名、日期和數字。
- 低資源語言與混合語言。
- 圖片中的多區文字。
人工MQM怎麼做?
- Accuracy:誤譯、遺漏、添加。
- Terminology:術語不一致。
- Fluency:文法、拼字與自然度。
- Style:語氣、地區和品牌規範。
- Locale Convention:日期、數字、標點。
- Severity:Minor、Major、Critical。
高風險內容的Critical Error應直接阻止發布,而不是和大量Minor Error平均成看似可接受分數。
Production工作流
- 偵測語言和文件類型。
- 套用Glossary與Do-not-translate。
- 查詢Translation Memory。
- 由TranslateGemma產生新譯文。
- 執行格式、數字和Placeholder檢查。
- 以COMET或內部Metric初篩。
- 高風險與低信心進人工MQM。
- 保存原文、譯文、模型與Reviewer。
- 核准結果回寫Translation Memory。
適合與不適合
| 較適合 | 必須加強人工流程 |
|---|---|
| 內部文件與草稿 | 法律合約 |
| 產品初版在地化 | 醫療與藥物 |
| 大量內容預翻譯 | 財務公開資訊 |
| 字幕與社群候選 | 安全與高影響指令 |
| 私有資料本地處理 | 文學最終出版 |
模型品質評估的一般原則仍是:流暢不等於忠實,可覆核性比單次速度更重要。
常見問題
TranslateGemma可以商用嗎?
模型受Google Gemma Terms約束。使用者需要閱讀當前條款、Prohibited Use與分發要求,不能只依「開放權重」名稱判斷。
4B模型適合MacBook嗎?
較適合,但需要相容Runtime與足夠統一記憶體。4-bit量化可降低容量,仍要測速度和翻譯品質。
27B一定比12B好嗎?
官方平均Benchmark通常較高,但特定語言、Domain和Latency需求可能讓12B更合適。應使用自己的測試集比較。
官方資料
TranslateGemma讓55語言翻譯能力能部署在Laptop、工作站和私有Cloud。模型大小決定品質與成本上限,Glossary、Translation Memory、MQM和人工責任則決定它能否成為可信的正式翻譯流程。

發表迴響