反向传播

反向传播是训练神经网络的核心算法。它通过链式法则计算损失函数对每个参数的梯度。

def backward(loss, parameters):
    grads = {}
    grad = 1.0
    for layer in reversed(layers):
        grad = layer.backward(grad)
    return grads

激活函数

ReLU 因其简单高效成为默认选择,但 GELU 和 Swish 在深层网络中表现更好。

正则化

Dropout 和 Batch Normalization 是防止过拟合的两大法宝。现代架构(如 Transformer)还引入了 Layer Normalization。

理解这些基础概念有助于深入 Transformer 架构详解