从零开始理解 机器学习 → 深度学习 → 强化学习 — 每一步都有可交互的浏览器可视化。不是看公式、不是读教材,是动手调参数、看动画、培养直觉。
从一条直线起步:14步搭起机器学习的完整直觉 — 回归、分类、模型评估、无监督学习,以及神经网络的初体验。
机器学习的"Hello World" — 一条直线、一堆点,梯度下降让直线自己找到最佳位置。
同样的梯度下降,给模型更多"原材料"(x², x³...)就能拟合曲线。算法不变,输入升级。
ReLU、Sigmoid、Tanh — 认识这些把直线"掰弯"的基本单元。用 ReLU 拼出任意曲线。
从"预测数值"到"判断类别" — Sigmoid 输出概率,交叉熵衡量好坏,决策边界可视化。
XOR 问题 — 单层无解,两层就行了。亲眼看到隐藏层的"空间变换"和反向传播的链式法则。
模型越复杂越好吗?欠拟合 → 刚好 → 过拟合三栏对比,L2 正则化让模型学会"克制"。
不止两类怎么办?螺旋三分类 + Softmax + 混淆矩阵,多类问题的完整可视化管线。
训练/验证/测试划分、ROC 曲线、AUC、PR 曲线、学习曲线 — 系统性地回答"模型到底好不好"。
没有标签也能学习?质心迭代、Voronoi 划分、肘部法则 — 首个无监督学习算法。
告别梯度下降。信息增益、递归划分、树结构可视化 — 完全不同的 ML 范式。
高维数据如何可视化?主成分分析、方差解释、投影重建 — 数据压缩的几何直觉。
MLP 之后自然的结构升级。卷积核滑动、特征图、池化 — 亲眼看到网络"看"到了什么。
找最大间隔分类线 — 硬间隔→软间隔→RBF核,支持向量决定了模型。
多棵树投票更准:Bootstrap + 随机特征 + OOB 误差,集成学习直观演示。
把神经网络推向深处:为什么深网络难训练、优化器如何进化、正则化神器,到手写数字实战与注意力机制。
网络越深越难训?亲眼看梯度逐层消失或爆炸,Xavier 与 He 初始化如何力挽狂澜。
四种优化器在损失曲面上赛跑 — 动量冲过震荡,自适应学习率各走各的步长。
随机"关掉"一半神经元反而更强?深度网络两大训练神器的直观演示。
在浏览器里真实训练一个神经网络 — 损失曲线、混淆矩阵,再亲手画个数字考考它。
把数据压进 1 维"瓶颈"再还原 — 非线性降维与 PCA 直线投影的直观对决。
Query、Key、Value 各是什么?注意力热力图看清模型"看"向哪里,一窥 Transformer。
Positional Encoding · Multi-Head Attention · Encoder — 现代大模型的基石架构。
在与环境的交互中学习决策:从多臂老虎机到深度 Q 网络,覆盖 Sutton & Barto 第2-6章的核心算法。
探索 vs 利用的核心困境。ε-greedy、UCB、梯度老虎机,实时调参看学习曲线。
从单状态到多状态的第一步:3×3 迷你网格,理解 V(s)、Q(s,a) 和策略箭头。
从单状态到多状态:GridWorld 上的策略评估、策略迭代、价值迭代 — 值函数热力图直观可见。
不知道环境模型也能学习?从完整 episode 的经验中估计值函数,首次访问 vs 每次访问 MC。
RL 最著名的算法:Cliff Walking 上 SARSA vs Q-Learning 的经典对比,在策略与离策略的直观差异。
当状态空间太大装不进表格:神经网络近似 Q 函数,经验回放 + 目标网络,RL 与 ML 的交汇点。
不学 Q 值,直接学策略:REINFORCE → Baseline → Actor-Critic,CartPole 上对比三种方法。
ML 14 步 + DL 7 章 + RL 7 章 · 从零基础到深度学习与强化学习的完整路径
你从线性回归一路走到Transformer与策略梯度,建立了 ML → DL → RL 的完整直觉。