SARSA(在策略)— 安全路径
Q-Learning(离策略)— 最优路径
参数
统计
Episode: 0
SARSA 最近奖励: --
Q-Learning 最近奖励: --
关键区别
SARSA:更新用实际选择的下一动作 a'(含探索), 所以它"知道"自己的探索可能掉悬崖,走安全但稍远的路。
Q-Learning:更新用 max Q(s',a')(假设最优行为), 它"以为"自己总能走最优,所以贴着悬崖走最近但危险的路。
这就是 在策略 (on-policy) vs 离策略 (off-policy) 的差异。
SARSA:更新用实际选择的下一动作 a'(含探索), 所以它"知道"自己的探索可能掉悬崖,走安全但稍远的路。
Q-Learning:更新用 max Q(s',a')(假设最优行为), 它"以为"自己总能走最优,所以贴着悬崖走最近但危险的路。
这就是 在策略 (on-policy) vs 离策略 (off-policy) 的差异。