13 章系统课程 · 从零开始
开始学习
强化学习 Reinforcement Learning
不知道什么是强化学习也没关系 —— 第 0 章从训练一只小狗讲起。之后步步递进:值函数、时序差分、DQN、策略梯度、PPO,直到拆解 ChatGPT 背后的 RLHF。
13
章节
30
预计学时
入门 → 高级
难度
课程大纲
阶段 0 · 入门
不知道 RL 是什么?从这里开始 —— 一只小狗、一个机器人、五个关键词,零公式起步。
阶段 1 · 表格型方法
状态少到能写进表格:老虎机、网格世界、MDP、动态规划、蒙特卡洛、时序差分 —— 一切的根基。
阶段 2 · 深度价值型
表格装不下了,请神经网络出场:用网络逼近 Q 函数,稳住训练的两件套。
进阶
07
DQN 进阶:Double / Dueling / Prioritized
DQN 三件套:Double 抑过估计、优先回放提效率、Dueling 共享状态价值,CartPole 同场对比各自贡献。
阶段 3 · 策略优化型
不学 Q 值、直接优化策略:REINFORCE → Actor-Critic → PPO → RLHF → 收官实战。