视频字幕
Transformer 是一种革命性的深度学习模型,由 Google 在 2017 年提出。它彻底改变了自然语言处理领域,成为现代 AI 模型如 ChatGPT、BERT 等的基础架构。在 Transformer 出现之前,自然语言处理主要依赖循环神经网络(RNN)。但 RNN 存在两个主要问题:一是处理长序列时容易出现梯度消失,导致模型难以学习长期依赖关系;二是由于其顺序处理的特性,难以并行化训练,训练速度慢。Transformer 的核心思想是完全基于注意力机制。它摒弃了传统的循环和卷积结构,使得模型可以并行处理序列中的所有元素,大大提高了训练效率。同时,注意力机制能够更好地捕捉序列中元素间的长距离依赖关系。自注意力机制是 Transformer 的关键组件。在处理序列中的某个元素时,模型会通过查询、键和值向量来计算该元素与序列中其他元素的相关性。这样,模型就能在处理每个元素时关注到整个序列的信息,从而捕捉全局依赖关系。为了进一步增强模型的表达能力,Transformer 采用了多头注意力机制。它并行计算多个注意力头,每个头从不同的表示子空间中学习信息。最后将所有头的输出拼接起来,通过一个线性变换得到最终结果。由于 Transformer 摒弃了循环结构,它无法像 RNN 那样通过时间步来感知序列顺序。因此,Transformer 引入了位置编码机制,将序列中每个元素的位置信息编码成向量,并与词嵌入相加,使模型能够利用序列顺序信息。Transformer 采用了经典的编码器-解码器结构。编码器负责处理输入序列,将其转换为一系列隐藏表示;解码器则根据编码器的输出和已生成的部分输出序列,逐步生成最终的输出序列。这种结构在机器翻译等序列到序列任务中表现优异。在 Transformer 的每个编码器和解码器层中,注意力机制后面都会跟着一个前馈神经网络。这个网络对序列中每个位置的表示进行相同的非线性变换,进一步增强模型的表达能力。为了训练更深的网络,Transformer 在每个子层(注意力层和前馈网络层)后都使用了残差连接和层归一化。残差连接将输入直接加到输出上,有助于梯度流动;层归一化则对每个样本的特征进行归一化,提高训练稳定性。Transformer 模型在自然语言处理领域有着广泛的应用。它被用于机器翻译、文本摘要、问答系统、文本生成等各种任务。基于 Transformer 的预训练模型如 BERT、GPT 系列更是推动了整个 AI 领域的发展。