vanilla transformer
时间: 2023-11-03 16:00:02 浏览: 424
transformer
Vanilla Transformer是一种基于Transformer架构的模型。与原始的Transformer相比,Vanilla Transformer只使用了Transformer中解码器部分的结构,即带有mask的attention层和前馈神经网络层。它在网络深度上做了一些改进,导致在训练过程中更难收敛。
Vanilla Transformer的训练过程中,作者采用了一些小trick来帮助模型更好地收敛。其中一种trick是使用了三种辅助Loss,这些辅助Loss在训练过程中起到了正则化的作用。
阅读全文