Skip to content

大语言模型

一、基础数学

(一)向量

(二)矩阵

(三)线性变换

(四)梯度

(五)概率与信息

二、神经网络

(一)神经元结构

(二)神经网络与训练

(三)损失函数

(四)Softmax

(五)梯度下降与优化器

(六)反向传播

三、自然语言处理

(一)语言的概率游戏:N-gram 模型

(二)词向量

(三)前馈神经网络语言模型

(四)RNN 循环神经网络

(五)LSTM 长短期记忆网络

四、大语言模型

(一)注意力机制

(二)多头注意力

(三)Transformer 架构

(四)Tokenizer 分词器

(五)编码器、解码器与大语言模型

(六)残差连接与层归一化

(七)预训练、监督微调、强化学习

(八)KV 缓存、稀疏注意力与 FlashAttention

(九)MoE 混合专家架构

(十)模型蒸馏

(十一)从 N-gram 模型到 Transformer 模型

(十二)研究前沿