Step 3: 从老虎机到 GridWorld
从一个状态到一个网格 — 状态值 V(s)、动作值 Q(s,a)、策略 π 的直观入门
当前选中的格子
状态: (0,0)
状态值 V: --
各动作的 Q 值
💡 点击左侧格子查看 Q 值
算法
迭代步数: 0
max ΔV: --
老虎机只有一个状态,GridWorld 有多个
Ch2 的多臂老虎机:站在一个位置,选臂拉。
这里:9 个格子,每个格子有 4 个动作(上下左右)。
V(s) = 从格子 s 出发,按最优策略走到底,总共能得多少分。
Q(s,a) = 在格子 s 做动作 a,然后按最优走,总共能得多少分。
策略 π = 每个格子的箭头,指向最优方向。
值迭代每次都问:"如果我知道隔壁格子的价值,我该往哪走?"
下一步 → Step 4: 有限 MDP + 动态规划(更大的网格 + 更多算法)
Ch2 的多臂老虎机:站在一个位置,选臂拉。
这里:9 个格子,每个格子有 4 个动作(上下左右)。
V(s) = 从格子 s 出发,按最优策略走到底,总共能得多少分。
Q(s,a) = 在格子 s 做动作 a,然后按最优走,总共能得多少分。
策略 π = 每个格子的箭头,指向最优方向。
值迭代每次都问:"如果我知道隔壁格子的价值,我该往哪走?"
下一步 → Step 4: 有限 MDP + 动态规划(更大的网格 + 更多算法)
💡 键盘快捷键:← → 切换章节