什么是强化学习?What is Reinforcement Learning?
从「训练一只小狗」说起:没有标准答案、只有奖励和惩罚 —— 这就是强化学习的世界。
训练你的扫地机器人 · 交互演示
机器人的「大脑」:四个方向的偏好(策略)
绿色越长 = 机器人越爱走这个方向。奖励 ↑ 概率升,惩罚 ↓ 概率降 —— 不用写一行代码,你就在「训练」一个智能体。
0.1 欢迎:这门课讲什么、适合谁
如果你刚点开「强化学习」时心里想的是「是不是要很多数学」—— 放心,这门课假设你从零开始:不知道什么是强化学习没关系,第 0 章就从「训练一只小狗」讲起。整门课 13 步,每一步都先给你一个能上手玩的演示,再讲清楚背后的道理。你需要的只是:会点按钮、愿意试错 —— 这恰好也是强化学习本身的精神。
下一步预告:先用一句话说清强化学习是什么,再把它和你熟悉的监督学习对比 —— 你会发现它是一种完全不同的学习范式。
📌 发生了什么
- 强化学习 = 试错学习:靠奖励信号调整行为,没有标准答案
- 五个关键词:智能体、环境、状态、动作、奖励
- 监督学习学「照着做」,强化学习学「试出最好的做法」
- 奖励是方向盘:奖励给错了,智能体就学歪了
⚠️ 常见陷阱
- 以为强化学习 = 深度学习。不是:RL 是学习范式(怎么学),深度学习是工具(用什么学),两者可以组合(如 DQN)
- 以为奖励越多越好。奖励是「目标定义」:只惩罚错误而不奖励正确,智能体会学会原地不动
- 忘了试错需要探索。永远只走已知最好路线的智能体,可能永远发现不了更好的路线
✅ 本章小结
- 强化学习:智能体通过与环境交互、最大化累计奖励来学习行为
- 与监督学习的区别:无标签、序列决策、反馈延迟且只有好坏了而无对错之分
- 核心循环:状态 → 动作 → 奖励 → 新状态,循环往复
- 课程路线:引言 → 表格型方法 → 深度价值型 → 策略优化型
0.2 什么是强化学习:从训练小狗说起(What is RL?)
想象你在教一只小狗握手。你没有给它一本《握手教程》,也不可能把每次伸爪的角度都标注成「正确答案」。你做的只是:它做对了,给零食;做错了,不给。几次之后,小狗自己「悟」出了握手的动作。
这就是强化学习的全部精髓:没有人告诉你正确答案,你只能通过试错,观察每次尝试带来的奖励或惩罚,逐渐把行为调整到「奖励最多」的样子。上面的扫地机器人演示就是数字版的小狗:机器人每次移动(尝试),你按 👍/👎(奖励/惩罚),它的偏好概率随之变化(学习)。
点「▶ 自动训练」还能看到一个「程序化老师」如何只靠「离电池更近就奖励」这一条简单规则,让机器人无师自通地学会奔向 ⚡。注意:老师从没告诉过机器人「该怎么走」,它只给分数 —— 路线是机器人自己试出来的。
0.3 强化学习和监督学习有什么不同(RL vs Supervised Learning)
机器学习的三大范式里,你最可能先接触监督学习(有标签)和无监督学习(无标签找结构)。强化学习是第三条路,和它们都不一样:
| 维度 | 监督学习 | 强化学习 |
|---|---|---|
| 反馈形式 | 每题都有标准答案(标签) | 只有奖励分数,没有对错答案 |
| 决策方式 | 一次预测,独立打分 | 一串决策,前面的选择影响后面的局面 |
| 数据来源 | 人工标注好的静态数据集 | 智能体自己交互「攒」出来的经验 |
| 试错成本 | 答错了改一下就好 | 错一步可能满盘皆输,还要边错边学 |
💡 一句话:监督学习是「照着标准答案学」,强化学习是「在没有答案的世界里试出最好的活法」。
0.4 五个关键词:智能体、环境、状态、动作、奖励(Core Vocabulary)
整个强化学习世界只由五个词构成,从今天起它们会出现在每一章里:
- 智能体(Agent):学习者/决策者 —— 演示里的机器人 🤖
- 环境(Environment):智能体身处的外部世界 —— 那块 6×6 网格
- 状态(State):环境的当前样貌 —— 机器人此刻在哪个格子
- 动作(Action):智能体能做的事 —— 上/右/下/左
- 奖励(Reward):环境对动作的即时打分 —— 你的 👍/👎 按钮
智能体
观察状态,选动作,学习策略
环境
接收动作,返回新状态和奖励
智能体的唯一目标:让整个过程的累计奖励最大 —— 不是某一步拿高分,而是长期总分第一:
其中 γ(读作 gamma,折扣因子)衡量「未来的奖励现在值多少」—— 这个小参数会在第 2~3 章正式登场,这里只需知道:它决定智能体是「近视」还是「远视」。
0.5 强化学习在今天:从游戏 AI 到 ChatGPT(Applications)
强化学习不是教科书里的古董,它正在驱动你每天听到的那些 AI 新闻:
| 领域 | 代表 | 强化学习的角色 |
|---|---|---|
| 游戏 | AlphaGo、Atari 游戏超级玩家 | 从胜负奖励中自学出超越人类的策略 |
| 机器人 | 机械臂抓取、四足机器人行走 | 在仿真中试错数百万次,再迁移到真实机器 |
| 大模型 | ChatGPT / InstructGPT 的 RLHF | 用人类偏好当奖励,让模型对齐人的意图 |
| 推荐与调度 | 推荐系统、数据中心冷却、交通控制 | 在长期收益(留存/能耗)上做序列决策优化 |
💡 本课程第 11 章会亲手拆解 RLHF —— ChatGPT 对齐技术的核心,正是强化学习。
0.6 课程地图:13 步学习路径(Course Map)
接下来的 12 步按「先简单后复杂、先直觉后公式」排列,每一步只引入一个新思想:
- 阶段 1 · 表格型方法(第 1~5 章):状态少到能写进表格 —— 多臂老虎机 → GridWorld → MDP 与动态规划 → 蒙特卡洛 → 时序差分。一切的根基。
- 阶段 2 · 深度价值型(第 6~7 章):状态太多装不进表格,请神经网络出场 —— DQN 及其三件套改进。
- 阶段 3 · 策略优化型(第 8~12 章):不学价值、直接优化策略 —— 策略梯度 → Actor-Critic → PPO → RLHF → 迷宫寻宝收官实战。
- 先修建议:本阶段无需任何先修;进入第 6 章(DQN)前建议先学 DL 轨道的「MLP 神经网络入门」,页面会自动提示先修衔接。
- 学习方法:每个演示都亲手调一次参数再看结论 —— 在这个网站里,「玩」就是学习的一部分。
📚 参考文献与延伸阅读
- Sutton & Barto, Reinforcement Learning: An Introduction (2nd ed.), §1 The Problem — 强化学习标准教科书的开篇,本章概念的总源头
- OpenAI Spinning Up: Key Concepts in RL — 智能体/环境循环的清晰图解
- Hugging Face Deep RL Course: Unit 0 — 面向初学者的强化学习应用总览
📝 课后练习
检验你的理解——答对为止