Theme
这课重点其实很简单:Machine Translation = 在“流畅”和“忠实”之间找最优译文。整节课只是从历史、语言差异、规则方法一路铺垫到统计机器翻译的核心公式。
Lecture 9 你只需要抓住 4 个重点
1. 翻译为什么难?
不是查字典这么简单。因为语言差异发生在多个层次:
词义层面: “bass” 可能是鱼,也可能是乐器;“brother” 翻成中文可能是“哥哥”或“弟弟”。
句法层面: 英语是 SVO:
日语更接近 SOV,逐词翻译会变成:
所以机器翻译的困难不是“找对应单词”,而是:
2. 翻译目标:Fluency + Faithfulness
这是全课最核心概念。
一个好翻译必须同时满足:
| 标准 | 含义 | 对应中文 |
|---|---|---|
| Faithfulness | 忠实原文意思 | 信 |
| Fluency | 目标语言自然通顺 | 达 |
| Elegance | 表达得体优雅 | 雅 |
课件用 “the Lord is my shepherd” 举例: “the Lord will look after me” 很流畅,但不够忠实; “the Lord is for me like somebody who looks after animals with cotton-like hair” 比较忠实,但不流畅。
所以翻译不是单目标,而是 trade-off:
其中:
| 符号 | 含义 |
|---|---|
| source sentence,源语言句子 | |
| target translation,目标语言译文 | |
| 最优译文 |
3. 统计机器翻译的核心公式
课件把目标语言设为 English:
源语言/外语设为:
机器翻译要找:
意思是:
给定 foreign sentence ,找最可能的 English translation 。
用 Bayes theorem:
因为 固定,所以:
这是全课最重要公式。
其中:
是 language model,衡量译文是否流畅。
是 translation model,衡量译文是否忠实于原文。
所以:
4. Alignment 是统计翻译的核心隐藏变量
为了估计:
我们需要知道源语言词和目标语言词怎么对应。
这叫 word alignment。
例如法语:
英语:
可能有:
课件用 alignment matrix 表示这种对应关系。
重点是:alignment 可以是一对一、一对多、多对一,甚至有些词对应 NULL。
IBM Model 1 到底在干什么?
IBM Model 1 是最简单的统计机器翻译模型。它的想法是:
给定英文句子 ,生成外语句子 。
生成过程:
- 生成 foreign sentence 的长度
- 生成 alignment
- 根据 alignment,从 English words 逐个生成 foreign words
也就是说:
它不是直接翻译,而是建模:
再把所有 alignment 加起来:
这和前面的 HMM / PCFG 思想完全一致:
| 模型 | 观测 | 隐变量 | 要做什么 |
|---|---|---|---|
| HMM | words | POS tags | sum/max hidden states |
| PCFG | sentence | parse tree | sum/max parse trees |
| IBM Model 1 | bilingual sentences | alignment | sum/max alignments |
所以 Lecture 9 不是孤立的,它还是“latent variable model”这条主线。
IBM Model 1 的核心缺陷
Model 1 很重要,但非常粗糙。课件列了三个主要问题。
第一,它是 bag-of-words。它认为所有 alignment 位置一样可能,不管词离得多远。所以它不懂语序。
第二,它做 independent word translation。每个词怎么翻译只看词对,不看上下文。所以 bank 在 “money bank” 和 “river bank” 中可能混淆。
第三,它只能很好处理简单的 one-to-many,对真正的 many-to-many、idiom、phrase translation 很弱。
所以 IBM Model 1 的价值不是效果强,而是它建立了统计机器翻译的基本框架:
你复习时只背这张图
text
Machine Translation
│
├── 为什么难?
│ ├── 词义不同:bass, brother
│ ├── 语序不同:SVO vs SOV
│ └── 短语/文化/上下文不同
│
├── 评价目标
│ ├── Fluency: P(E)
│ └── Faithfulness: P(F|E)
│
├── 核心公式
│ └── E* = argmax_E P(F|E)P(E)
│
├── 隐变量
│ └── Alignment A
│
└── IBM Model 1
├── 给定 E 生成 F
├── 枚举/求和 alignments
└── 缺陷:不懂语序、不懂上下文、不懂短语最后一句话总结
Lecture 9 的重点不是 LLM,也不是 Rosetta Stone,而是这条主线:
机器翻译可以被形式化为:在所有候选译文中,选择既流畅 又忠实 的译文;alignment 是连接两种语言词语的隐藏结构,IBM Model 1 是最早把这个问题概率化的经典模型。