Ch7: 策略梯度
不学 Q 值,直接学策略 — REINFORCE → Baseline → Actor-Critic
CartPole — 动作概率 π(a|s)
← 左推
0.50
右推 →
0.50
模式
参数
统计
Episode: 0
步数: 0
最近奖励: --
最佳: --
REINFORCE:跑完一局,用总回报 G 加权梯度。方差大但正确。
+Baseline:同时学 V(s),优势 A=G-V 替代 G。方差降低。
Actor-Critic:不等 episode 结束,每步用 TD 误差更新。
+Baseline:同时学 V(s),优势 A=G-V 替代 G。方差降低。
Actor-Critic:不等 episode 结束,每步用 TD 误差更新。
💡 键盘快捷键:← → 切换章节