GPU 选型

训练大模型首先面临的是硬件选择:

GPU显存适用场景
A100 80GB80GB主流训练卡
H100 80GB80GB新一代主力
L40S 48GB48GB微调推理

集群网络

多机多卡训练时,网络带宽是主要瓶颈。InfiniBand 提供 400GB/s 带宽,但对于小团队,RoCE v2 也是可行的替代方案。

存储方案

训练数据动辄 TB 级别,需要高性能分布式存储。Lustre、WekaFS 是主流选择。

大模型预训练技术概览 详细介绍了训练策略。