课程大纲
01
梯度消失与权重初始化
网络越深越难训?亲眼看梯度逐层消失或爆炸,Xavier 与 He 初始化如何力挽狂澜。
02
优化器:从 SGD 到 Adam
四种优化器在损失曲面上赛跑 — 动量冲过震荡,自适应学习率各走各的步长。
03
Dropout 与 BatchNorm
随机"关掉"一半神经元反而更强?深度网络两大训练神器的直观演示。
04
实战:手写数字识别
在浏览器里真实训练一个神经网络 — 损失曲线、混淆矩阵,再亲手画个数字考考它。
05
自编码器与表征学习
把数据压进 1 维"瓶颈"再还原 — 非线性降维与 PCA 直线投影的直观对决。
06
注意力机制入门
Query、Key、Value 各是什么?注意力热力图看清模型"看"向哪里,一窥 Transformer。
07
Transformer 入门
Positional Encoding · Multi-Head Attention · Encoder — 现代大模型的基石架构。