2 认识Transformer架构
学习目标
- 了解Transformer模型的作用.
- 了解Transformer总体架构图中各个组成部分的名称.
1 Transformer模型的作用
- 基于seq2seq架构的transformer模型可以完成NLP领域研究的典型任务, 如机器翻译, 文本生成等. 同时又可以构建预训练语言模型,用于不同任务的迁移学习.
- 在接下来的架构分析中, 我们将假设使用Transformer模型架构处理从一种语言文本到另一种语言文本的翻译工作, 因此很多命名方式遵循NLP中的规则. 比如: Embeddding层将称作文本嵌入层, Embedding层产生的张量称为词嵌入张量, 它的最后一维将称作词向量等.
2 Transformer总体架构图

一个编码器会有n个编码器层组成,每个编码器会有两个子层组成.
2.1 Transformer总体架构
2.2 输入部分包含
- 源文本嵌入层及其位置编码器
- 目标文本嵌入层及其位置编码器

2.3 输出部分包含