【解读者导读】把这两文放读是本站清单的刻意安排:Sutskever等人的seq2seq(下称LSTM文)证明了"一个LSTM编码、另一个LSTM解码"能直接翻译并逼近SMT;Bahdanau等人的注意力文(下称RNNsearch文)则从LSTM文引用的同一组证据出发——Cho等人报告的"长句性能崩塌"——诊断出病根是固定长度向量瓶颈,并用软对齐开出处方。LSTM文用"反转源句序"这个训练技巧绕开了长句问题;RNNsearch文用架构级创新根治了它。两条路线在同一年、同一份数据集(WMT'14英法)上正面相遇:LSTM文的表1甚至直接列了RNNsearch的28.45分作为对照。
| 摘要短语(意译) | 对应论文章节 | 本页章节 |
|---|---|---|
| "多层LSTM把输入序列映射为定维向量,另一深层LSTM从该向量解码目标序列" | §2 模型 | 第2章 |
| "WMT'14英法任务全测试集BLEU 34.8,OOV词受罚" | §3.6 结果 | 第4章 |
| "LSTM在长句上没有困难" | §3.7 | 第4章 |
| "短语式SMT基线为33.3;用LSTM重排其1000个候选升至36.5" | §3.6 表2 | 第4章 |
| "反转所有源句词序显著提升性能,因其引入大量短期依赖" | §3.3 | 第3章 |
| 摘要短语(意译) | 对应论文章节 | 本页章节 |
|---|---|---|
| "现有神经机器翻译多属编解码家族,把源句压入定长向量" | §2 背景 | 第5章 |
| "我们猜想定长向量是性能瓶颈,提出让模型自动(软)搜索源句相关部分" | §3 核心方法 | 第6章 |
| "英法翻译上与最先进短语系统相当" | §5.1 | 第7章 |
| "定性分析显示模型找到的软对齐符合直觉" | §5.2 | 第7章 |
| # | 贡献 | 预评 |
|---|---|---|
| L1 | LSTM文:纯神经网络直译首次在大规模MT任务上明显超过短语式SMT基线(33.00 vs 33.30接近、34.81超过) | 强实验支撑 |
| L2 | LSTM文:反转源句词序大幅提升性能(困惑度5.8→4.7,BLEU 25.9→30.6) | 有消融 |
| L3 | LSTM文:句子向量表示按语义聚类、对语态变换不敏感 | 仅PCA可视化 |
| A1 | RNNsearch文:定长向量是长句崩塌的根源(架构性诊断) | 有对比实验支撑 |
| A2 | RNNsearch文:软对齐机制使RNNsearch-50在50词以上句子无性能衰减 | 主实验+曲线 |
| A3 | RNNsearch文:学到的对齐与语言学直觉一致 | 定性案例展示 |
必读主线:第2章 → 第3章 → 第5章 → 第6章 → 第7章。可跳读:第4章的工程细节(8卡并行、beam表),跳过的代价是无法完成综合考核的数字总对账题。建议顺序:先读LSTM文建立范式,带着"定长向量够不够"的疑问进入RNNsearch文。
来源:论文§1–§2。
学完本章你应能:写出条件概率分解公式并说明v的角色;说出模型与朴素方案的三个差异及各自理由;解释<EOS>为什么是变长输出的关键。
DNN强大但只能处理固定维度的输入输出。翻译、语音、问答天然是变长到变长的映射——这就是要治的病。更早的尝试(Kalchbrenner & Blunsom用CNN编码,丢失词序;Cho et al.只用于重排候选)各有残缺。
| 符号 | 它是什么 | 直觉 |
|---|---|---|
| x₁…xT | 输入词序列(反向读入!) | 原料 |
| v | 输入LSTM最后隐状态,8000维实数向量 | "整句话被压缩成的记忆胶囊" |
| yt | 输出词,softmax于80k词汇表 | 逐词吐出的译文 |
| <EOS> | 句末符,两端都有 | 让模型能定义"任意长度序列"上的分布 |
三个关键设计【实验支持】:①编码/解码用两个独立LSTM——参数更多而计算代价可忽略,且天然支持多语言对共享;②用4层深LSTM——每加深一层困惑度约降10%;③反转源句——见第3章。张量形状流:词one-hot(160k或80k) → 嵌入1000维 → 每层1000单元×4层 → 顶层隐状态拼接出8000维的v(4层×1000×双向?不——是两个4层LSTM各贡献4000维状态,共8000维,【解读者按"384M参数、8000维状态"推算】)。
论文给出:总参数384M,其中64M为"纯递归连接"(编码器32M+解码器32M)。【解读者对账】每个LSTM层含4个门的权重:层间输入侧4×1000×1000=4M+递归侧4M=8M;单侧4层=32M;两侧合计恰为64M ✓。再看词相关参数:输入嵌入160k×1000≈160M+输出嵌入80k×1000≈80M+输出投影1000×80k≈80M=320M;320M+64M=384M ✓ 与论文总数严丝合缝。这次对账说明:所谓384M里,83%的钱花在词表矩阵上,真正"LSTM本体"只有六分之一——大词汇表才是当年的显存大户。
误读1:"解码器就是语言模型。" 差别在于条件里有v:它是"以整句含义为开头条件的语言模型"。类比:给同一位译者塞一张小抄(v),他写出的译文才连贯。类比失效处:小抄是固定容量的——这正是RNNsearch文攻击的点。
误读2:"8000维状态=8000维嵌入。" v是4层×1000维状态的组合表示,不是某个单一嵌入层的输出。
一句话记住本章:seq2seq = 编码器把句子酿成一颗"记忆胶囊",解码器是吃了这颗胶囊的语言模型。
来源:论文§3.3(数字均出自原文)。
学完本章你应能:复述反转技巧的四组数字;用"最小时间滞后"解释其机理;举出该技巧可能失效的语言对。
【实验支持】反转源句后:测试困惑度 5.8 → 4.7;解码翻译BLEU 25.9 → 30.6。提升近5个BLEU点,来自一次零成本的数据变换——这是全文最反直觉的结果,作者自承没有完整解释。
作者假说:把"a b c"反转成"c b a"后,c紧邻译文的α,b fairly close to β……源句开头与译文开头在时间轴上贴近,最小时间 lag 大幅缩短,SGD更容易在输入输出之间"建立通信"。注意作者强调:平均距离不变,缩短的是最早那几步的距离——梯度不必穿过整句话才能碰到第一个有用的信号。【解读者推断】这在今天的话语体系里就是"改善梯度的信用分配路径",与后续研究中"训练初期信号可达性决定成败"的观察一致。
作者推测标准RNN在非反转任务上训不动、但在反转后应可训练(未实验验证)。【解读者观点】这类"改问题表述而非改模型"的思路,是本文比具体数字更值得继承的遗产。
来源:论文§3.1–3.6(全部数字出自原文)。
WMT'14英法,选用的干净子集:1200万句对,法语348M词、英语304M词;源词汇表160k、目标80k,OOV统一替换UNK。训练:SGD无动量,学习率0.7,5个epoch后每半个epoch减半,共7.5个epoch;batch=128;参数初始化U[−0.08, 0.08];梯度范数超5时缩放至5。并行化:单GPU约1700词/秒太慢 → 8-GPU机器(4块GPU各跑一层LSTM+4块GPU分摊softmax,每块负责一个1000×20000矩阵乘),达6300词/秒,训练约十天。
| 方法 | 测试BLEU (ntst14) |
|---|---|
| Bahdanau et al.(RNNsearch-50*) | 28.45 |
| SMT基线 | 33.30 |
| 单个正向LSTM,beam 12 | 26.17 |
| 单个反转LSTM,beam 12 | 30.59 |
| 5个反转LSTM集成,beam 1 | 33.00 |
| 2个反转LSTM集成,beam 12 | 33.27 |
| 5个反转LSTM集成,beam 2 | 34.50 |
| 5个反转LSTM集成,beam 12 | 34.81 |
重排(rescoring)路线:SMT基线33.30 → 单正向35.61 → 单反转35.85 → 5反转集成36.5(此前最好公开成绩37.0);1000-best列表的神谕重排上限约45。
【实验支持】按句长排序评估:35词以内无退化,最长句仅有轻微下降——这与Cho等人和RNNsearch文引用的"长句崩塌"形成有趣反差,作者的归因正是反转技巧改善了记忆利用。PCA可视化:句向量按词序聚类(bag-of-words难以捕捉),主动/被动语态互换的句子位置接近。
来源:论文§1–§2.1。
学完本章你应能:写出基本编解码框架的两个方程;引用Cho et al.的证据说明长句崩塌;说出"压缩进定长向量"为何随句长恶化。
基本框架:编码器 ht=f(xt, ht−1),上下文 c=q({h₁,…,hTx})(常取c=hTx);解码器 p(y)=∏p(yt|{y₁..yt−1}, c)。病灶:【论文声称+Cho et al.实证】无论源句多长都要压进同一个固定维度的c,句长超过训练分布时信息必然溢出,性能急剧下降。直觉类比:让一个人听完整段话、只许记在一张便签上、然后凭便签翻译全文——句子越长便签越不够写。类比失效处:真实瓶颈不是"纸太小"这么均匀,而是RNN隐状态天然偏袒近期输入,句首信息被系统性稀释——是"偏心"而不只是"容量"。
一句话记住本章:LSTM文的成功掩盖了一个架构级赌注——"一句话值得一个向量";RNNsearch文公开质疑这个赌注。
来源:论文§3(全部公式出自原文)。
学完本章你应能:默写e、α、c三级公式链;解释为什么用si−1而不是si算能量;手算注意力模块的计算复杂度增量。
| 符号 | 形状 | 直觉 |
|---|---|---|
| hj=[h⃗j; h⃖j] | 2000维(两个1000维BiRNN方向拼接) | 第j个源词的"带上下文的注释",既知过去又知未来 |
| eij | 标量 | 译文第i位与源句第j位的匹配打分 |
| αij | 概率分布(对j softmax) | 此刻的目光落在哪里的"软"指针 |
| ci | 2000维 | 期望注释——按注视强度加权平均 |
| va, Wa, Ua | n′维/n′×n/n′×2n,n′=1000 | 一个小MLP打分器,与全网联合训练 |
三个关键洞察:①对齐不再是潜在变量而是可直接求导的软权重——传统SMT要对齐模型单独训练,这里梯度自由流过;②αij可解读为yi对齐xj的概率,ci即对齐分布下的期望注释;③用si−1(生成yi之前的状态)打分,保证目光决策先于落笔——因果顺序正确。
缓解:定长瓶颈消失,信息分布在整条注释序列上按需取用。新增:每句每步要对Tx个位置各跑一次打分MLP,复杂度O(Tx×Ty)——作者明言这在15–40词的翻译场景"缺点不严重",但对其他任务可能是硬伤(他们特意与Graves 2013的单调高斯核对齐对比:那种方法便宜却不能远程重排)。优化细节【实验支持】:Uahj与i无关,可预计算摊销成本。欠债:二次复杂度与"每步全览"的浪费——这笔债直到Transformer时代用多头/稀疏化等方式偿还了一半,至今仍在偿还。
【解读者按附录A尺寸计算】打分MLP参数:Wa(1000×1000)+Ua(1000×2000)+va(1000) ≈ 3M参数,相对全模型是零头;但计算次数是Tx×Ty级别的额外tanh——花小钱买来了长句鲁棒性,性价比极高。
误读1:"注意力=可解释性。" α热图"与直觉一致"是定性观察【A3仅为案例展示】,不能当作因果解释证据——后世研究已多次警示注意力权重≠归因。
误读2:"BiRNN是为了更强表达。" 它是为注意力服务的:注释hj必须包含前后文,否则"看一眼h_j"拿不到足够信息——双向化是软对齐成立的前提组件。
误读3:"RNNsearch完全取代了LSTM文的技巧。" 两文正交:一个改训练数据分布,一个改信息通路;后来的GNMT两者都用。
一句话记住本章:注意力 = 每写一个词之前,先用一个小网络给源句每个位置打分、softmax成目光分布、按分布调取加权笔记。
来源:论文§4–§5、附录A/B(全部数字出自原文)。
WMT'14英法:原始850M词(Europarl 61M+news commentary 5.5M+UN 421M+爬取90M+272.5M),经数据选择降为348M词;双语文本各取30k高频词短表,其余映射UNK;开发集=news-test2012+2013,测试集=news-test2014(3003句)。模型命名:RNNencdec-30/50(基础编解码,限30/50词)、RNNsearch-30/50(本文模型)。规模:隐藏n=1000、嵌入m=620、maxout层l=500、对齐n′=1000;GRU门控单元+maxout深输出。训练:minibatch 80句、Adadelta(ε=10⁻⁶、ρ=0.95)、梯度范数裁剪至≤1、按长度排序组batch减少填充浪费、每模型约5天(RNNsearch-50*加练至252小时)。
| 模型 | 全部句子 | 无UNK子集∘ |
|---|---|---|
| RNNencdec-30 | 13.93 | 24.19 |
| RNNsearch-30 | 21.50 | 31.44 |
| RNNencdec-50 | 17.82 | 26.71 |
| RNNsearch-50 | 26.75 | 34.16 |
| RNNsearch-50* | 28.45 | 36.15 |
| Moses(短语式SMT) | 33.30 | 35.63 |
【实验支持】三个层次的结论:①所有配对下RNNsearch>RNNencdec(21.50 vs 13.93;26.75 vs 17.82);②无UNK子集上RNNsearch-50*的36.15超过Moses的35.63,而Moses额外用了418M词单语语料;③长句曲线上RNNencdecl随句长骤降,RNNsearch-50在50词以上仍无衰减。
①非单调重排:[European Economic Area]→[zone économique européenne],模型先把zone跳回对齐Area,再逐词回看补齐整个短语——硬对齐做不到的"跳跃+回扫"。②软对齐消歧:[the man]→[l'homme],法语冠词缩合取决于后面名词的性数,硬对齐会把the孤立地映射错,软窗口同时看到man才能选对l'。
【解读者观点】三年后Attention Is All You Need把RNNsearch的软对齐推广为唯一的信息通路、并用LSTM文的多层堆叠与大规模数据配方,同时抛弃了两者的递归骨架——两篇2014年的论文分别贡献了Transformer的"灵魂"(注意力)与"身体"(深栈序列建模)。今天大模型的上下文窗口,本质上就是那张α热图的工业化后代。动手练习建议:①手算T_x=T_y=60时的注意力打分次数并与RNNcell调用次数比较;②实现一个玩具版加性注意力并可视化α矩阵;③把LSTM文的"按长度组batch省2倍"复现为实验测量。