开始学习
7 章系统课程

强化学习 Reinforcement Learning

从交互中学习最优策略,掌握 MDP、值函数、时序差分与策略梯度方法。

7 章节
16 预计学时
高级 难度
开始学习
强化学习课程插画:智能体与环境交互示意