课程大纲
01
梯度消失与权重初始化
网络越深越难训?亲眼看梯度逐层消失或爆炸,Xavier 与 He 初始化如何力挽狂澜。
02
优化器:从 SGD 到 Adam
四种优化器在损失曲面上赛跑 — 动量冲过震荡,自适应学习率各走各的步长。
03
Dropout 与 BatchNorm
随机"关掉"一半神经元反而更强?深度网络两大训练神器的直观演示。
04
实战:手写数字识别
在浏览器里真实训练一个神经网络 — 损失曲线、混淆矩阵,再亲手画个数字考考它。
05
自编码器与表征学习
把数据压进 1 维"瓶颈"再还原 — 非线性降维与 PCA 直线投影的直观对决。
06
注意力机制入门
Query、Key、Value 各是什么?注意力热力图看清模型"看"向哪里,一窥 Transformer。
07
Transformer 入门
位置编码 · 多头注意力 · 编码器 — 现代大模型的基石架构。
08
循环神经网络 RNN
同一个网络反复使用、隐状态跨步传递——序列建模的起点,也是梯度消失催生 attention 的根源。
09
残差网络 ResNet
网络越深反而越难训?给梯度一条恒等捷径,∂y/∂x 的 +1 项让百层网络也能训——深网训练闭环。
10
视觉 Transformer ViT
不卷积、不池化——图像切 patch 当单词,Transformer 直接看图:全局注意力热力图 + 冻结嵌入分类头。