模型规模竞赛降温

2024 年,业界从”越大越好”转向”更聪明地训练”。小型模型通过更好的数据和训练策略开始超越更大的模型。

MoE 架构成为主流

从 Mixtral 到 GPT-4(传闻),MoE 混合专家模型解析 中介绍的 MoE 架构在 2024 年得到广泛采用。

多模态融合加速

GPT-4V、Gemini、Claude 3 都支持了视觉理解。多模态不再是”加分项”而是”标配”。

对齐与安全

RLHF 原理与实践 介绍的对齐技术在 2024 年依然是研究热点。Constitutional AI 和 Direct Preference Optimization (DPO) 开始替代传统 RLHF。

对于想系统学习 LLM 的读者,建议从 Transformer 架构详解 开始。