DQN: 深度 Q 网络入门

当状态空间太大装不进表格 — 用神经网络近似 Q 函数,RL 与 ML 的交汇点

CartPole 实时画面

探索策略

超参数

(减少量纲差异)

统计

Episode: 0
步数 (当前): 0
最近奖励: --
最佳奖励: --
平均奖励 (最近10): --
缓冲区: 0
从表格到神经网络
Ch15 用表格存 Q 值(48 格 x 4 动作 = 192 个数字)。
但 CartPole 有 4 个连续状态变量,表格装不下。
DQN:用神经网络(4→16→2)输入状态,输出 Q 值。
经验回放:把过往经验存起来,随机采样训练,打破数据相关性。
目标网络:用旧网络算 target,稳定训练。
训练需要时间,耐心看奖励从 ~10 涨到 ~200。

💡 键盘快捷键:← → 切换章节