超参数
统计
Episode: 0
步数 (当前): 0
最近奖励: --
最佳奖励: --
平均奖励 (最近10): --
缓冲区: 0
从表格到神经网络
Ch15 用表格存 Q 值(48 格 x 4 动作 = 192 个数字)。
但 CartPole 有 4 个连续状态变量,表格装不下。
DQN:用神经网络(4→16→2)输入状态,输出 Q 值。
经验回放:把过往经验存起来,随机采样训练,打破数据相关性。
目标网络:用旧网络算 target,稳定训练。
训练需要时间,耐心看奖励从 ~10 涨到 ~200。
Ch15 用表格存 Q 值(48 格 x 4 动作 = 192 个数字)。
但 CartPole 有 4 个连续状态变量,表格装不下。
DQN:用神经网络(4→16→2)输入状态,输出 Q 值。
经验回放:把过往经验存起来,随机采样训练,打破数据相关性。
目标网络:用旧网络算 target,稳定训练。
训练需要时间,耐心看奖励从 ~10 涨到 ~200。