Skip to content
Wangshangxue
Main Navigation
Home
数学
计算机
人工智能
Appearance
Menu
Return to top
文档结构图
大语言模型
一、基础数学
(一)向量
(二)矩阵
(三)线性变换
(四)梯度
(五)概率与信息
二、神经网络
(一)神经元结构
(二)神经网络与训练
(三)损失函数
(四)Softmax
(五)梯度下降与优化器
(六)反向传播
三、自然语言处理
(一)语言的概率游戏:N-gram 模型
(二)词向量
(三)前馈神经网络语言模型
(四)RNN 循环神经网络
(五)LSTM 长短期记忆网络
四、大语言模型
(一)注意力机制
(二)多头注意力
(三)Transformer 架构
(四)Tokenizer 分词器
(五)编码器、解码器与大语言模型
(六)残差连接与层归一化
(七)预训练、监督微调、强化学习
(八)KV 缓存、稀疏注意力与 FlashAttention
(九)MoE 混合专家架构
(十)模型蒸馏
(十一)从 N-gram 模型到 Transformer 模型
(十二)研究前沿