ARTICLE DETAIL

资讯详情

深耕网站建设、视觉设计与SEO优化的一线实战洞察。

Transformer核心组件功能对照表

Transformer核心组件功能对照表

Transformer核心组件功能对照表

模块名称所属位置核心功能关键作用
Input Embedding输入侧前置将离散的输入词(如英文单词)映射为固定维度的向量。把人类可理解的文字转化为模型能处理的数值化语义表示。
Output Embedding输出侧前置将已生成的目标词(如已翻译的中文词)映射为向量,通常与Input Embedding共享权重。保证输入、输出的语义空间一致,减少参数数量,提升语义对齐效果。
Positional Encoding输入/输出侧前置通过三角函数或可学习参数,为词向量加入位置信息。弥补Transformer无循环结构的缺陷,让模型捕捉序列的顺序依赖(如“我吃饭”和“饭吃我”的区别)。
Multi-Head Attention(自注意力)编码器内部第一层并行计算多个注意力头,让每个位置关注输入序列的所有位置。捕捉输入序列内部的全局语义依赖(如长句中“主语”和“宾语”的关联)。
Add & Norm编码器/解码器子层后先做残差连接(子层输入+子层输出),再做层归一化。缓解梯度消失问题,稳定训练过程,加速模型收敛。
Feed Forward编码器/解码器内部第二层对每个位置的向量做独立的非线性变换(通常是两层全连接+ReLU)。增强模型的特征表达能力,捕捉更复杂的语义模式。
Masked Multi-Head Attention(掩码自注意力)解码器内部第一层与自注意力类似,但会遮挡未来位置的信息(生成第3个词时,只能看前2个词)。保证生成的自回归性,避免模型“偷看”未来信息,符合人类逐词生成的逻辑。
Encoder-Decoder Attention(编解码注意力)解码器内部第二层以编码器输出为Key/Value,解码器当前状态为Query,计算注意力。实现输入与输出的语义对齐(如翻译时“英文单词”与“中文单词”的对应),让生成的内容更贴合输入语义。
Linear(线性层)输出层将解码器的输出向量映射到整个目标词表的维度。将特征向量转化为词表概率分布的对数形式。
Softmax输出层将线性层的输出转为0-1之间的概率分布。得到每个词的生成概率,选择概率最高的词作为下一个生成结果。

返回列表