欢迎来到道一AGI
关于这个网站 道一AGI 是我个人的人工智能学习笔记与知识管理体系。 在这里,我会记录关于以下主题的学习心得: 大语言模型(LLM):Transformer 架构、预训练、微调、提示工程 AI Agent:智能体设计、工具调用、多智能体协作...
关于这个网站 道一AGI 是我个人的人工智能学习笔记与知识管理体系。 在这里,我会记录关于以下主题的学习心得: 大语言模型(LLM):Transformer 架构、预训练、微调、提示工程 AI Agent:智能体设计、工具调用、多智能体协作...
为什么需要位置编码 Transformer 并行处理整个序列,不像 RNN 那样逐步读取。这种并行性带来了效率,但也丢失了序列的顺序信息。位置编码正是为了解决这个问题。 Transformer 架构概览./positionalencodin...
什么是 Transformer Transformer 是 Google 在 2017 年提出的神经网络架构,彻底改变了 NLP 领域。它完全基于注意力机制,摒弃了传统的 RNN 和 CNN 结构。 SelfAttention 机制 Sel...
注意力的直觉理解 注意力机制模仿了人类的注意力——当我们看一幅画时,不会平均地关注每个像素,而是聚焦在某些关键区域。 缩放点积注意力 $$ \text{Attention}Q, K, V = \text{softmax}\left\frac...
预训练数据 大规模预训练数据的质量直接决定模型性能。常见数据源包括 Common Crawl、Wikipedia、书籍和代码仓库。 并行训练策略 数据并行 每个 GPU 持有完整模型副本,处理不同的数据批次。 模型并行 将模型切分到多个 G...
RLHF 的三阶段 第一阶段:监督微调(SFT) 收集人类标注的高质量指令回答对,在基座模型上微调。 第二阶段:训练奖励模型 让人类标注者对多个回答进行偏好排序,训练一个奖励模型来预测人类偏好。 第三阶段:PPO 强化学习 使用 PPO 算...
MoE 核心思想 MoE 将 FFN 层替换为多个"专家"子网络,每个 token 通过路由机制只激活部分专家。 路由机制 TopK 路由是最常见的策略——每个 token 选择得分最高的 K 个专家: python def routerx...
反向传播 反向传播是训练神经网络的核心算法。它通过链式法则计算损失函数对每个参数的梯度。 python def backwardloss, parameters: grads = {} grad = 1.0 for layer in rev...