Skip to content

这课重点其实很简单:Machine Translation = 在“流畅”和“忠实”之间找最优译文。整节课只是从历史、语言差异、规则方法一路铺垫到统计机器翻译的核心公式。

Lecture 9 你只需要抓住 4 个重点

1. 翻译为什么难?

不是查字典这么简单。因为语言差异发生在多个层次:

词义层面: “bass” 可能是鱼,也可能是乐器;“brother” 翻成中文可能是“哥哥”或“弟弟”。

句法层面: 英语是 SVO:

日语更接近 SOV,逐词翻译会变成:

所以机器翻译的困难不是“找对应单词”,而是:


2. 翻译目标:Fluency + Faithfulness

这是全课最核心概念。

一个好翻译必须同时满足:

标准含义对应中文
Faithfulness忠实原文意思
Fluency目标语言自然通顺
Elegance表达得体优雅

课件用 “the Lord is my shepherd” 举例: “the Lord will look after me” 很流畅,但不够忠实; “the Lord is for me like somebody who looks after animals with cotton-like hair” 比较忠实,但不流畅。

所以翻译不是单目标,而是 trade-off:

其中:

符号含义
source sentence,源语言句子
target translation,目标语言译文
最优译文

3. 统计机器翻译的核心公式

课件把目标语言设为 English:

源语言/外语设为:

机器翻译要找:

意思是:

给定 foreign sentence ,找最可能的 English translation

用 Bayes theorem:

因为 固定,所以:

这是全课最重要公式。

其中:

是 language model,衡量译文是否流畅。

是 translation model,衡量译文是否忠实于原文。

所以:


4. Alignment 是统计翻译的核心隐藏变量

为了估计:

我们需要知道源语言词和目标语言词怎么对应。

这叫 word alignment。

例如法语:

英语:

可能有:

课件用 alignment matrix 表示这种对应关系。

重点是:alignment 可以是一对一、一对多、多对一,甚至有些词对应 NULL。


IBM Model 1 到底在干什么?

IBM Model 1 是最简单的统计机器翻译模型。它的想法是:

给定英文句子 ,生成外语句子

生成过程:

  1. 生成 foreign sentence 的长度
  2. 生成 alignment
  3. 根据 alignment,从 English words 逐个生成 foreign words

也就是说:

它不是直接翻译,而是建模:

再把所有 alignment 加起来:

这和前面的 HMM / PCFG 思想完全一致:

模型观测隐变量要做什么
HMMwordsPOS tagssum/max hidden states
PCFGsentenceparse treesum/max parse trees
IBM Model 1bilingual sentencesalignmentsum/max alignments

所以 Lecture 9 不是孤立的,它还是“latent variable model”这条主线。


IBM Model 1 的核心缺陷

Model 1 很重要,但非常粗糙。课件列了三个主要问题。

第一,它是 bag-of-words。它认为所有 alignment 位置一样可能,不管词离得多远。所以它不懂语序。

第二,它做 independent word translation。每个词怎么翻译只看词对,不看上下文。所以 bank 在 “money bank” 和 “river bank” 中可能混淆。

第三,它只能很好处理简单的 one-to-many,对真正的 many-to-many、idiom、phrase translation 很弱。

所以 IBM Model 1 的价值不是效果强,而是它建立了统计机器翻译的基本框架:


你复习时只背这张图

text
Machine Translation

├── 为什么难?
│   ├── 词义不同:bass, brother
│   ├── 语序不同:SVO vs SOV
│   └── 短语/文化/上下文不同

├── 评价目标
│   ├── Fluency: P(E)
│   └── Faithfulness: P(F|E)

├── 核心公式
│   └── E* = argmax_E P(F|E)P(E)

├── 隐变量
│   └── Alignment A

└── IBM Model 1
    ├── 给定 E 生成 F
    ├── 枚举/求和 alignments
    └── 缺陷:不懂语序、不懂上下文、不懂短语

最后一句话总结

Lecture 9 的重点不是 LLM,也不是 Rosetta Stone,而是这条主线:

机器翻译可以被形式化为:在所有候选译文中,选择既流畅 又忠实 的译文;alignment 是连接两种语言词语的隐藏结构,IBM Model 1 是最早把这个问题概率化的经典模型。

Static academic notes built with VitePress and KaTeX.