课程大纲
01
多臂老虎机
探索 vs 利用的核心困境。ε-greedy、UCB、梯度老虎机,实时调参看学习曲线。
02
从老虎机到 GridWorld
从单状态到多状态的第一步:3×3 迷你网格,理解 V(s)、Q(s,a) 和策略箭头。
03
有限 MDP + 动态规划
从单状态到多状态:GridWorld 上的策略评估、策略迭代、价值迭代 — 值函数热力图直观可见。
04
蒙特卡洛方法
不知道环境模型也能学习?从完整 episode 的经验中估计值函数,首次访问 vs 每次访问 MC。
05
时序差分学习
RL 最著名的算法:Cliff Walking 上 SARSA vs Q-Learning 的经典对比,在策略与离策略的直观差异。
06
深度 Q 网络入门
当状态空间太大装不进表格:神经网络近似 Q 函数,经验回放 + 目标网络,RL 与 ML 的交汇点。
07
策略梯度
不学 Q 值,直接学策略:REINFORCE → Baseline → Actor-Critic,CartPole 上对比三种方法。