機器翻譯失真,通常不只是單字翻錯,而是語氣、稱謂、指涉、文化資訊和不確定性在轉換過程中被壓縮。譯文可以很流暢,卻把婉拒改成承諾、把推測改成確定,或把人物關係翻成不符合情境的語氣。
失真來源可能是訓練資料不足、Pivot Translation、多語言共享表示、翻譯腔資料、長文件脈絡缺失,或評測只獎勵表面相似。可靠翻譯需要模型、Glossary、Translation Memory、自動指標和人工MQM共同工作。
重點快讀
- Direct Translation直接處理語言對;Pivot Translation經過中間語言或表示。
- Zero-shot讓多語言模型處理未直接見過的語言方向。
- Low-resource Language因平行語料不足更容易出錯。
- Translationese是譯文常見的非自然語言特徵,也會污染評測。
- BLEU偏表面N-gram,COMET和MetricX更偏語意,但仍可能有偏差。
- MQM由人工標註錯誤類型和嚴重度。
- Back Translation能發現部分偏移,不能證明翻譯正確。
- 正式流程應保存術語、版本、Reviewer和修改理由。
翻譯失真最常發生在哪裡?
| 失真類型 | 例子 |
|---|---|
| 語氣 | 可能、建議、婉拒被翻成肯定 |
| 稱謂 | 敬語、親屬和職稱被平坦化 |
| 指涉 | 代名詞指向錯誤人物 |
| 省略 | 主詞或條件在目標語言被錯補 |
| 文化 | 成語、雙關和地方語用被直譯 |
| 術語 | 同一產品或法律概念多種譯名 |
| 數字 | 日期、單位、貨幣和小數錯誤 |
最危險的譯文不一定讀起來很差。流暢但改變條件的句子,反而更容易被直接採用。
Direct和Pivot Translation
direct:
Korean → Traditional Chinese
pivot:
Korean → English representation → Traditional ChinesePivot Translation在缺少直接平行語料時,借助資料較多的中間語言。每一段轉換都可能改變語氣、詞義和結構,因此錯誤會沿著鏈條傳播。
- 中間語言沒有對應敬語。
- 模糊指涉在第一段被強制具體化。
- 文化概念被換成近似英文詞。
- 第二段只能翻譯已失真的中間結果。
現代多語言模型未必真的先產生一段英文文字,但共享表示仍可能受到高資源語言分布影響。
Zero-shot Translation是什麼?
Google在2016年的多語言NMT研究,使用同一模型處理多種語言,並在輸入前加入目標語言Token。模型能在沒有直接看過某一語言對的情況下,利用共享表示進行Zero-shot Translation。
- 降低為每個語言對建立獨立模型的需求。
- 讓低資源方向借用其他語言知識。
- 品質仍受語言相似度和資料分布影響。
- 可能產生錯語言輸出或高資源語言偏置。
- 不能把Zero-shot寫成無資料也能高品質翻譯。
Low-resource Language為什麼更難?
- 可取得數位文字和雙語資料較少。
- 拼字、方言和書寫標準可能不統一。
- 專業術語缺少高品質對照。
- 評測集和母語Reviewer不足。
- 模型容易依賴高資源語言捷徑。
低資源不代表語言價值較低,而是技術資料和投資分布不均。正式內容應讓母語使用者參與翻譯、評測和術語決策。
Translationese是什麼?
Translationese指翻譯文本常出現的非自然特徵,例如句型更接近來源語言、詞彙變得中性、結構過度明確或缺少目標語言原生節奏。它不一定是錯誤,但可能讓資料分布和評測失真。
- 測試集若由翻譯文本構成,可能比原生文本更容易。
- 模型可能學會翻譯腔而非自然目標語言。
- Reverse-created Test Data會影響Human-parity宣稱。
- 自動分數提高,不代表母語讀者更滿意。
相關研究建議在機器翻譯評測中明確標示原生文本和翻譯文本來源,避免測試集偏差。
Error Propagation
source ambiguity
→ wrong entity resolution
→ wrong tense or modality
→ fluent target sentence
→ human accepts without checking翻譯鏈條中的早期判斷會限制後續選擇。多段摘要、翻譯和改寫串接時,每一階段都可能進一步壓縮資訊。
- 盡量由原文直接翻到目標語言。
- 保留原始段落和句子ID。
- 不要只把上一階段的摘要交給下一模型。
- 關鍵條件建立自動檢查。
- 高風險內容逐句人工對照。
BLEU、COMET、MetricX和MQM
| 方法 | 優勢 | 限制 |
|---|---|---|
| BLEU | 快速、歷史廣泛、可重現 | 偏表面N-gram和單一Reference |
| COMET | 利用來源、譯文和Reference預測人類評分 | 評測模型本身會有偏差 |
| MetricX | 學習式多語言品質指標 | 版本和分數方向需確認 |
| MQM | 人工標記錯誤類型與嚴重度 | 成本高、需訓練Reviewer |
COMET研究顯示,使用跨語言預訓練模型和人類評分資料,可以比傳統表面指標更接近人類判斷。它仍只是代理指標,不能取代高風險人工Review。
MQM怎麼標錯誤?
- Accuracy:誤譯、遺漏、添加。
- Terminology:術語錯誤或不一致。
- Fluency:文法、拼字和自然度。
- Style:語氣、品牌和受眾不符。
- Locale:日期、數字、標點和地區習慣。
- Severity:Minor、Major、Critical。
Critical Error不應被大量小錯誤平均掉。法律條款中的否定、醫療劑量和產品安全指令,只要一處重大錯誤就應阻止發布。
Back Translation有什麼用?
Back Translation把目標譯文再翻回來源語言,可快速發現人名、數字、否定和條件是否明顯偏移,也能用於產生Synthetic Training Data。
- 相同模型可能把錯誤重新合理化。
- 語氣損失未必在回譯中顯現。
- 兩段翻譯會增加新的誤差。
- 適合做Smoke Test,不是最終證明。
Glossary和Translation Memory
| 資產 | 用途 |
|---|---|
| Glossary | 固定人名、產品、法律和技術譯名 |
| Translation Memory | 重用已核准句段 |
| Style Guide | 語氣、標點、數字和地區規範 |
| Do-not-translate | 品牌、Code、Placeholder和命令 |
| Review History | 保存人工修改和原因 |
模型不應每次重新決定關鍵詞。高頻和高風險術語應由組織建立Canonical Translation。
長文件如何保持一致?
- 先建立Document-level Brief和術語。
- 保存人物、產品和地點實體表。
- 按章節翻譯但共享Context。
- 不要讓每段使用不同Prompt和模型版本。
- 最後執行全文件一致性掃描。
- 逐條核對數字、標題和Cross-reference。
長Context可以提供更多脈絡,也可能加入無關資料。需要明確的Context Builder和版本控制。
一套Production翻譯流程
- 識別來源語言、目標語言和地區。
- 建立Glossary、Style Guide和Do-not-translate。
- 先查Translation Memory。
- 由模型產生新譯文。
- 執行Placeholder、數字、日期和格式檢查。
- 使用COMET或其他指標初篩。
- 高風險內容進MQM人工Review。
- 保存原文、譯文、模型和Reviewer。
- 核准結果回寫Translation Memory。
具體開放翻譯模型與本地部署可閱讀TranslateGemma是什麼?。
常見問題
所有機器翻譯都會經過英文嗎?
不一定。現代系統可能直接翻譯、使用共享多語言表示或其他路徑。資料不足時,高資源語言仍可能影響結果。
Zero-shot代表不用資料嗎?
不代表。模型依賴其他語言的訓練資料和共享表示,只是沒有直接使用該語言對的平行資料。
COMET高分就能直接發布嗎?
不能。自動Metric無法完全捕捉領域、法律、語氣和低資源語言錯誤,仍需人工抽查。
原始資料
- Google Multilingual NMT與Zero-shot
- COMET Machine Translation Evaluation
- Translationese in Machine Translation Evaluation
機器翻譯的可信度,不能只看句子是否順。Pivot、共享表示和Translationese會改變語意與評測,Glossary、MQM和人工責任則把翻譯重新接回原文、用途和讀者。

發表迴響