第13步:有限MDP + 动态规划

从"单臂选择"到"序列决策" — 在 GridWorld 上看值函数和策略的演化
值函数 V(s): | 终点
算法模式
参数
运行状态
迭代次数: 0
最大 Δ: --
策略是否稳定: --
预设场景

点击网格格子可切换状态类型

策略评估:给定一个策略(初始随机),反复用贝尔曼期望方程更新每个状态的值,直到值函数收敛。

策略迭代:评估当前策略 → 用贪心方式改进策略 → 再评估 → 再改进,交替进行直到策略不再变化。

值迭代:跳过完整策略评估,每次直接取最大 Q 值更新 V(s),一步到位。收敛更快但中间值不精确。