反向传播
反向传播是训练神经网络的核心算法。它通过链式法则计算损失函数对每个参数的梯度。
def backward(loss, parameters):
grads = {}
grad = 1.0
for layer in reversed(layers):
grad = layer.backward(grad)
return grads
激活函数
ReLU 因其简单高效成为默认选择,但 GELU 和 Swish 在深层网络中表现更好。
正则化
Dropout 和 Batch Normalization 是防止过拟合的两大法宝。现代架构(如 Transformer)还引入了 Layer Normalization。
理解这些基础概念有助于深入 Transformer 架构详解。