开始学习
13 章系统课程 · 从零开始

强化学习 Reinforcement Learning

不知道什么是强化学习也没关系 —— 第 0 章从训练一只小狗讲起。之后步步递进:值函数、时序差分、DQN、策略梯度、PPO,直到拆解 ChatGPT 背后的 RLHF。

13 章节
30 预计学时
入门 → 高级 难度
开始学习
强化学习课程插画:智能体与环境交互示意

课程大纲

阶段 0 · 入门

不知道 RL 是什么?从这里开始 —— 一只小狗、一个机器人、五个关键词,零公式起步。

阶段 1 · 表格型方法

状态少到能写进表格:老虎机、网格世界、MDP、动态规划、蒙特卡洛、时序差分 —— 一切的根基。

阶段 2 · 深度价值型

表格装不下了,请神经网络出场:用网络逼近 Q 函数,稳住训练的两件套。

阶段 3 · 策略优化型

不学 Q 值、直接优化策略:REINFORCE → Actor-Critic → PPO → RLHF → 收官实战。

高级
11

RLHF:人类反馈对齐

把"哪个回答更好"的偏好对喂给奖励模型,再用 PPO 优化策略去迎合它——ChatGPT 对齐的秘密,以及奖励模型有偏时的 reward hacking。

  1. 11.1 语言模型为什么需要对齐
  2. 11.2 奖励模型:把偏好对变成打分
  3. 11.3 KL 约束:别离参考模型太远
  4. 11.4 逐 token 奖励:PPO 原样登场
  5. 11.5 RLHF 关键超参
  6. 11.6 三阶段核心循环走读