GPU 选型
训练大模型首先面临的是硬件选择:
| GPU | 显存 | 适用场景 |
|---|---|---|
| A100 80GB | 80GB | 主流训练卡 |
| H100 80GB | 80GB | 新一代主力 |
| L40S 48GB | 48GB | 微调推理 |
集群网络
多机多卡训练时,网络带宽是主要瓶颈。InfiniBand 提供 400GB/s 带宽,但对于小团队,RoCE v2 也是可行的替代方案。
存储方案
训练数据动辄 TB 级别,需要高性能分布式存储。Lustre、WekaFS 是主流选择。
大模型预训练技术概览 详细介绍了训练策略。
训练大模型首先面临的是硬件选择:
| GPU | 显存 | 适用场景 |
|---|---|---|
| A100 80GB | 80GB | 主流训练卡 |
| H100 80GB | 80GB | 新一代主力 |
| L40S 48GB | 48GB | 微调推理 |
多机多卡训练时,网络带宽是主要瓶颈。InfiniBand 提供 400GB/s 带宽,但对于小团队,RoCE v2 也是可行的替代方案。
训练数据动辄 TB 级别,需要高性能分布式存储。Lustre、WekaFS 是主流选择。
大模型预训练技术概览 详细介绍了训练策略。