从零开始理解机器学习 — 每一步都有可交互的浏览器可视化。 不是看公式、不是读教材,是动手调参数、看动画、培养直觉。
机器学习的"Hello World" — 一条直线、一堆点,梯度下降让直线自己找到最佳位置。
同样的梯度下降,给模型更多"原材料"(x², x³...)就能拟合曲线。算法不变,输入升级。
ReLU、Sigmoid、Tanh — 认识这些把直线"掰弯"的基本单元。用 ReLU 拼出任意曲线。
从"预测数值"到"判断类别" — Sigmoid 输出概率,交叉熵衡量好坏,决策边界可视化。
XOR 问题 — 单层无解,两层就行了。亲眼看到隐藏层的"空间变换"和反向传播的链式法则。
模型越复杂越好吗?欠拟合 → 刚好 → 过拟合三栏对比,L2 正则化让模型学会"克制"。
不止两类怎么办?螺旋三分类 + Softmax + 混淆矩阵,多类问题的完整可视化管线。
训练/验证/测试划分、ROC 曲线、AUC、PR 曲线、学习曲线 — 系统性地回答"模型到底好不好"。
没有标签也能学习?质心迭代、Voronoi 划分、肘部法则 — 首个无监督学习算法。
告别梯度下降。信息增益、递归划分、树结构可视化 — 完全不同的 ML 范式。
高维数据如何可视化?主成分分析、方差解释、投影重建 — 数据压缩的几何直觉。
MLP 之后自然的结构升级。卷积核滑动、特征图、池化 — 亲眼看到网络"看"到了什么。
探索 vs 利用的核心困境。ε-greedy、UCB、梯度老虎机,实时调参看学习曲线。
从单状态到多状态:GridWorld 上的策略评估、策略迭代、价值迭代 — 值函数热力图直观可见。
不知道环境模型也能学习?从完整 episode 的经验中估计值函数,首次访问 vs 每次访问 MC。
RL 最著名的算法:Cliff Walking 上 SARSA vs Q-Learning 的经典对比,在策略与离策略的直观差异。
当状态空间太大装不进表格:神经网络近似 Q 函数,经验回放 + 目标网络,RL 与 ML 的交汇点。
ML 从零开始 · 12 步构建完整机器学习直觉 | RL 4 章覆盖 Sutton & Barto Ch3-6 | RL: An Introduction, 2nd ed. (2020)
你已从线性回归一路走到多分类 Softmax,建立了完整的监督学习直觉。更多章节正在计划中。