预训练数据
大规模预训练数据的质量直接决定模型性能。常见数据源包括 Common Crawl、Wikipedia、书籍和代码仓库。
并行训练策略
数据并行
每个 GPU 持有完整模型副本,处理不同的数据批次。
模型并行
将模型切分到多个 GPU 上:
- 张量并行:将单个层的参数切分
- 流水线并行:将不同层分配到不同设备
ZeRO 优化
DeepSpeed 的 ZeRO 将优化器状态、梯度和参数分片,大幅降低显存占用。
预训练完成后,通过 RLHF 原理与实践 进行对齐,让模型更好地遵循人类指令。
大规模预训练数据的质量直接决定模型性能。常见数据源包括 Common Crawl、Wikipedia、书籍和代码仓库。
每个 GPU 持有完整模型副本,处理不同的数据批次。
将模型切分到多个 GPU 上:
DeepSpeed 的 ZeRO 将优化器状态、梯度和参数分片,大幅降低显存占用。
预训练完成后,通过 RLHF 原理与实践 进行对齐,让模型更好地遵循人类指令。