RL ML Learning Lab
00 / 13
零基础起步 · 无需先修

什么是强化学习?What is Reinforcement Learning?

从「训练一只小狗」说起:没有标准答案、只有奖励和惩罚 —— 这就是强化学习的世界。

1 小时
阅读 + 实操
1 个
交互演示
入门
难度

训练你的扫地机器人 · 交互演示

步数0
命中 ⚡0
距 ⚡ 距离--
机器人刚移动了一步 —— 请给它反馈
速度 4步/秒

机器人的「大脑」:四个方向的偏好(策略)

上 ↑
25%
右 →
25%
下 ↓
25%
左 ←
25%

绿色越长 = 机器人越爱走这个方向。奖励 ↑ 概率升,惩罚 ↓ 概率降 —— 不用写一行代码,你就在「训练」一个智能体。

0.1 欢迎:这门课讲什么、适合谁

如果你刚点开「强化学习」时心里想的是「是不是要很多数学」—— 放心,这门课假设你从零开始:不知道什么是强化学习没关系,第 0 章就从「训练一只小狗」讲起。整门课 13 步,每一步都先给你一个能上手玩的演示,再讲清楚背后的道理。你需要的只是:会点按钮、愿意试错 —— 这恰好也是强化学习本身的精神。

下一步预告:先用一句话说清强化学习是什么,再把它和你熟悉的监督学习对比 —— 你会发现它是一种完全不同的学习范式。

📌 发生了什么

  • 强化学习 = 试错学习:靠奖励信号调整行为,没有标准答案
  • 五个关键词:智能体、环境、状态、动作、奖励
  • 监督学习学「照着做」,强化学习学「试出最好的做法」
  • 奖励是方向盘:奖励给错了,智能体就学歪了

⚠️ 常见陷阱

  • 以为强化学习 = 深度学习。不是:RL 是学习范式(怎么学),深度学习是工具(用什么学),两者可以组合(如 DQN)
  • 以为奖励越多越好。奖励是「目标定义」:只惩罚错误而不奖励正确,智能体会学会原地不动
  • 忘了试错需要探索。永远只走已知最好路线的智能体,可能永远发现不了更好的路线

本章小结

  • 强化学习:智能体通过与环境交互、最大化累计奖励来学习行为
  • 与监督学习的区别:无标签、序列决策、反馈延迟且只有好坏了而无对错之分
  • 核心循环:状态 → 动作 → 奖励 → 新状态,循环往复
  • 课程路线:引言 → 表格型方法 → 深度价值型 → 策略优化型

0.2 什么是强化学习:从训练小狗说起(What is RL?)

想象你在教一只小狗握手。你没有给它一本《握手教程》,也不可能把每次伸爪的角度都标注成「正确答案」。你做的只是:它做对了,给零食;做错了,不给。几次之后,小狗自己「悟」出了握手的动作。

这就是强化学习的全部精髓:没有人告诉你正确答案,你只能通过试错,观察每次尝试带来的奖励或惩罚,逐渐把行为调整到「奖励最多」的样子。上面的扫地机器人演示就是数字版的小狗:机器人每次移动(尝试),你按 👍/👎(奖励/惩罚),它的偏好概率随之变化(学习)。

点「▶ 自动训练」还能看到一个「程序化老师」如何只靠「离电池更近就奖励」这一条简单规则,让机器人无师自通地学会奔向 ⚡。注意:老师从没告诉过机器人「该怎么走」,它只给分数 —— 路线是机器人自己试出来的。

0.3 强化学习和监督学习有什么不同(RL vs Supervised Learning)

机器学习的三大范式里,你最可能先接触监督学习(有标签)和无监督学习(无标签找结构)。强化学习是第三条路,和它们都不一样:

维度 监督学习 强化学习
反馈形式 每题都有标准答案(标签) 只有奖励分数,没有对错答案
决策方式 一次预测,独立打分 一串决策,前面的选择影响后面的局面
数据来源 人工标注好的静态数据集 智能体自己交互「攒」出来的经验
试错成本 答错了改一下就好 错一步可能满盘皆输,还要边错边学

💡 一句话:监督学习是「照着标准答案学」,强化学习是「在没有答案的世界里试出最好的活法」。

0.4 五个关键词:智能体、环境、状态、动作、奖励(Core Vocabulary)

整个强化学习世界只由五个词构成,从今天起它们会出现在每一章里:

  • 智能体(Agent):学习者/决策者 —— 演示里的机器人 🤖
  • 环境(Environment):智能体身处的外部世界 —— 那块 6×6 网格
  • 状态(State):环境的当前样貌 —— 机器人此刻在哪个格子
  • 动作(Action):智能体能做的事 —— 上/右/下/左
  • 奖励(Reward):环境对动作的即时打分 —— 你的 👍/👎 按钮

智能体

观察状态,选动作,学习策略

动作 a

环境

接收动作,返回新状态和奖励

奖励 r + 新状态 s
循环往复,直到任务结束

智能体的唯一目标:让整个过程的累计奖励最大 —— 不是某一步拿高分,而是长期总分第一:

其中 γ(读作 gamma,折扣因子)衡量「未来的奖励现在值多少」—— 这个小参数会在第 2~3 章正式登场,这里只需知道:它决定智能体是「近视」还是「远视」。

0.5 强化学习在今天:从游戏 AI 到 ChatGPT(Applications)

强化学习不是教科书里的古董,它正在驱动你每天听到的那些 AI 新闻:

领域 代表 强化学习的角色
游戏 AlphaGo、Atari 游戏超级玩家 从胜负奖励中自学出超越人类的策略
机器人 机械臂抓取、四足机器人行走 在仿真中试错数百万次,再迁移到真实机器
大模型 ChatGPT / InstructGPT 的 RLHF 用人类偏好当奖励,让模型对齐人的意图
推荐与调度 推荐系统、数据中心冷却、交通控制 在长期收益(留存/能耗)上做序列决策优化

💡 本课程第 11 章会亲手拆解 RLHF —— ChatGPT 对齐技术的核心,正是强化学习。

0.6 课程地图:13 步学习路径(Course Map)

接下来的 12 步按「先简单后复杂、先直觉后公式」排列,每一步只引入一个新思想:

  • 阶段 1 · 表格型方法(第 1~5 章):状态少到能写进表格 —— 多臂老虎机 → GridWorld → MDP 与动态规划 → 蒙特卡洛 → 时序差分。一切的根基。
  • 阶段 2 · 深度价值型(第 6~7 章):状态太多装不进表格,请神经网络出场 —— DQN 及其三件套改进。
  • 阶段 3 · 策略优化型(第 8~12 章):不学价值、直接优化策略 —— 策略梯度 → Actor-Critic → PPO → RLHF → 迷宫寻宝收官实战。
  • 先修建议:本阶段无需任何先修;进入第 6 章(DQN)前建议先学 DL 轨道的「MLP 神经网络入门」,页面会自动提示先修衔接。
  • 学习方法:每个演示都亲手调一次参数再看结论 —— 在这个网站里,「玩」就是学习的一部分。

📚 参考文献与延伸阅读

📝 课后练习

检验你的理解——答对为止