核心思想
Monte Carlo(MC)方法不需要环境模型,而是直接使用完整回合产生的实际回报作为学习目标:
对状态 的多次回报取平均,可以估计:
MC 方法必须等到回合结束后才能得到 ,因此天然适合具有终止状态的回合式任务。
首次访问与每次访问
同一状态可能在一条轨迹中出现多次:
- 首次访问 MC:每个回合只使用状态第一次出现后的回报。
- 每次访问 MC:使用状态每一次出现后的回报。
两种方法在常见条件下都能收敛到真实值函数。增量均值更新为:
当 时,该更新等价于样本均值;使用固定步长则更适合非平稳环境。
Monte Carlo 控制
仅估计 不足以在未知模型下改进策略,因为无法比较不同动作。MC 控制通常直接学习动作值:
然后对 构造 -greedy 策略。这样既保留探索,又逐渐偏向高价值动作。
同策略学习
同策略 MC 使用同一个策略采样并优化。典型循环是:
- 使用当前 -soft 策略生成完整回合。
- 用回合回报更新访问过的 。
- 令策略对更新后的 保持 -greedy。
只要每个状态动作对持续得到访问,并适当减小探索率,策略就可以趋近最优。
异策略学习
异策略方法使用行为策略 产生数据,却评估或优化目标策略 。二者的轨迹分布不同,需要使用重要性采样比率修正:
普通重要性采样直接平均 ,无偏但方差可能很大。加权重要性采样使用归一化权重:
它通常方差更低,但在有限样本下会引入偏差。
优势与限制
优势
- 不需要知道转移概率和奖励模型。
- 目标是真实回报,不依赖当前值函数的自举估计。
- 每条轨迹可以独立采样,容易并行。
限制
- 必须等到回合结束,无法立即更新。
- 长轨迹的回报方差较大。
- 很难直接用于没有自然终点的持续任务。
- 异策略重要性采样可能产生极端权重。
与动态规划和 TD 的关系
动态规划使用完整的模型期望,MC 使用完整的采样回报,Temporal-Difference Learning 则使用一步或多步采样并从当前估计自举。三者的主要差异可以理解为:学习目标中使用多少真实奖励,以及是否使用已有值函数估计。