教程2026年7月17日LLM 训练基础设施指南GPU 选型 训练大模型首先面临的是硬件选择: GPU 显存 适用场景 A100 80GB 80GB 主流训练卡 H100 80GB 80GB 新一代主力 L40S 48GB 48GB 微调推理 集群网络 多机多卡训练时,网络带宽是主要瓶颈...LLM分布式训练基础设施
学习笔记精选2026年7月8日大模型预训练技术概览预训练数据 大规模预训练数据的质量直接决定模型性能。常见数据源包括 Common Crawl、Wikipedia、书籍和代码仓库。 并行训练策略 数据并行 每个 GPU 持有完整模型副本,处理不同的数据批次。 模型并行 将模型切分到多个 G...LLM预训练分布式训练