Ch7: 策略梯度

不学 Q 值,直接学策略 — REINFORCE → Baseline → Actor-Critic

CartPole — 动作概率 π(a|s)

← 左推
0.50
右推 →
0.50

模式

参数

统计

Episode: 0
步数: 0
最近奖励: --
最佳: --
REINFORCE:跑完一局,用总回报 G 加权梯度。方差大但正确。
+Baseline:同时学 V(s),优势 A=G-V 替代 G。方差降低。
Actor-Critic:不等 episode 结束,每步用 TD 误差更新。

💡 键盘快捷键:← → 切换章节