第14步:蒙特卡洛方法

不知道环境模型也能学习 — 从"玩一局"的经验中估计状态价值
MC 模式
参数
统计
Episode 数: 0
RMSE vs 真值: --
最近回报: --
MC vs DP 的区别
Ch13 的 动态规划需要知道完整的环境模型(转移概率), 而 蒙特卡洛只需要"玩一局游戏",从实际结果反推价值。
首次访问:只在第一次遇到该状态时记录回报。
每次访问:每次遇到都记录(更多样本,但有偏)。
黄色格子 = 最近 episode 走过的路径。