预训练数据

大规模预训练数据的质量直接决定模型性能。常见数据源包括 Common Crawl、Wikipedia、书籍和代码仓库。

并行训练策略

数据并行

每个 GPU 持有完整模型副本,处理不同的数据批次。

模型并行

将模型切分到多个 GPU 上:

  • 张量并行:将单个层的参数切分
  • 流水线并行:将不同层分配到不同设备

ZeRO 优化

DeepSpeed 的 ZeRO 将优化器状态、梯度和参数分片,大幅降低显存占用。

预训练完成后,通过 RLHF 原理与实践 进行对齐,让模型更好地遵循人类指令。