LLM 训练基础设施指南
GPU 选型 训练大模型首先面临的是硬件选择: GPU 显存 适用场景 A100 80GB 80GB 主流训练卡 H100 80GB 80GB 新一代主力 L40S 48GB 48GB 微调推理 集群网络 多机多卡训练时,网络带宽是主要瓶颈...
GPU 选型 训练大模型首先面临的是硬件选择: GPU 显存 适用场景 A100 80GB 80GB 主流训练卡 H100 80GB 80GB 新一代主力 L40S 48GB 48GB 微调推理 集群网络 多机多卡训练时,网络带宽是主要瓶颈...
模型规模竞赛降温 2024 年,业界从"越大越好"转向"更聪明地训练"。小型模型通过更好的数据和训练策略开始超越更大的模型。 MoE 架构成为主流 从 Mixtral 到 GPT4(传闻),MoE 混合专家模型解析 中介绍的 MoE 架构在...
什么是 Transformer Transformer 是 Google 在 2017 年提出的神经网络架构,彻底改变了 NLP 领域。它完全基于注意力机制,摒弃了传统的 RNN 和 CNN 结构。 SelfAttention 机制 Sel...
预训练数据 大规模预训练数据的质量直接决定模型性能。常见数据源包括 Common Crawl、Wikipedia、书籍和代码仓库。 并行训练策略 数据并行 每个 GPU 持有完整模型副本,处理不同的数据批次。 模型并行 将模型切分到多个 G...
RLHF 的三阶段 第一阶段:监督微调(SFT) 收集人类标注的高质量指令回答对,在基座模型上微调。 第二阶段:训练奖励模型 让人类标注者对多个回答进行偏好排序,训练一个奖励模型来预测人类偏好。 第三阶段:PPO 强化学习 使用 PPO 算...
MoE 核心思想 MoE 将 FFN 层替换为多个"专家"子网络,每个 token 通过路由机制只激活部分专家。 路由机制 TopK 路由是最常见的策略——每个 token 选择得分最高的 K 个专家: python def routerx...
闭源阵营 OpenAI 的 GPT4、Anthropic 的 Claude 代表了闭源路线的顶尖水平。优势在于质量可控、商业化清晰。 开源阵营 Meta 的 Llama 系列、Mistral、Qwen 等开源模型正在快速追赶。开源促进了社区...