道一AGI道一AGI
首页知识图谱标签关于
中/EN

学习笔记

8 篇
学习笔记精选2026年7月18日

欢迎来到道一AGI

关于这个网站 道一AGI 是我个人的人工智能学习笔记与知识管理体系。 在这里,我会记录关于以下主题的学习心得: 大语言模型(LLM):Transformer 架构、预训练、微调、提示工程 AI Agent:智能体设计、工具调用、多智能体协作...

AGI人工智能
学习笔记2026年7月16日

理解 Transformer 中的位置编码

为什么需要位置编码 Transformer 并行处理整个序列,不像 RNN 那样逐步读取。这种并行性带来了效率,但也丢失了序列的顺序信息。位置编码正是为了解决这个问题。 Transformer 架构概览./positionalencodin...

Transformer位置编码深度学习
Transformer 架构详解
学习笔记精选2026年7月10日

Transformer 架构详解

什么是 Transformer Transformer 是 Google 在 2017 年提出的神经网络架构,彻底改变了 NLP 领域。它完全基于注意力机制,摒弃了传统的 RNN 和 CNN 结构。 SelfAttention 机制 Sel...

TransformerLLM深度学习
学习笔记2026年7月9日

注意力机制深入理解

注意力的直觉理解 注意力机制模仿了人类的注意力——当我们看一幅画时,不会平均地关注每个像素,而是聚焦在某些关键区域。 缩放点积注意力 $$ \text{Attention}Q, K, V = \text{softmax}\left\frac...

Transformer注意力机制深度学习
学习笔记精选2026年7月8日

大模型预训练技术概览

预训练数据 大规模预训练数据的质量直接决定模型性能。常见数据源包括 Common Crawl、Wikipedia、书籍和代码仓库。 并行训练策略 数据并行 每个 GPU 持有完整模型副本,处理不同的数据批次。 模型并行 将模型切分到多个 G...

LLM预训练分布式训练
学习笔记精选2026年7月7日

RLHF 原理与实践

RLHF 的三阶段 第一阶段:监督微调(SFT) 收集人类标注的高质量指令回答对,在基座模型上微调。 第二阶段:训练奖励模型 让人类标注者对多个回答进行偏好排序,训练一个奖励模型来预测人类偏好。 第三阶段:PPO 强化学习 使用 PPO 算...

RLHF对齐LLM
学习笔记2026年7月6日

MoE 混合专家模型解析

MoE 核心思想 MoE 将 FFN 层替换为多个"专家"子网络,每个 token 通过路由机制只激活部分专家。 路由机制 TopK 路由是最常见的策略——每个 token 选择得分最高的 K 个专家: python def routerx...

MoELLM模型架构
神经网络基础回顾
学习笔记精选2026年7月5日

神经网络基础回顾

反向传播 反向传播是训练神经网络的核心算法。它通过链式法则计算损失函数对每个参数的梯度。 python def backwardloss, parameters: grads = {} grad = 1.0 for layer in rev...

深度学习神经网络基础

© 2026 道一AGI

陕ICP备2026018237号-1