值函数 V(s):
低
高
|
终点
算法模式
参数
运行状态
迭代次数: 0
最大 Δ: --
策略是否稳定: --
预设场景
点击网格格子可切换状态类型
策略评估:给定一个策略(初始随机),反复用贝尔曼期望方程更新每个状态的值,直到值函数收敛。
策略迭代:评估当前策略 → 用贪心方式改进策略 → 再评估 → 再改进,交替进行直到策略不再变化。
值迭代:跳过完整策略评估,每次直接取最大 Q 值更新 V(s),一步到位。收敛更快但中间值不精确。
策略迭代:评估当前策略 → 用贪心方式改进策略 → 再评估 → 再改进,交替进行直到策略不再变化。
值迭代:跳过完整策略评估,每次直接取最大 Q 值更新 V(s),一步到位。收敛更快但中间值不精确。