马尔科夫决策MDP

MDP(Markov Decision Process) 是强化学习中描述“如何做决策”的数学模型。

1. 五个核心元素

元素 含义
S 状态(当前环境情况)
A 动作(可以采取的行为)
P 状态转移概率(动作后状态如何变化)
R 奖励(动作带来的收益)
γ 折扣因子(未来收益的重要程度)

2. 工作流程

当前状态 S
    ↓
选择动作 A
    ↓
环境变化
    ↓
获得奖励 R
    ↓
进入新状态 S'

3. 核心思想

当前决策只依赖当前状态不依赖历史。

例如:

机器人导航:

  • 状态:当前位置
  • 动作:向前/向左/向右
  • 奖励:靠近目标 +1,撞墙 -10
  • 目标:找到最高收益路径

4. 关键概念

概念 作用
策略 Policy 决定采取什么动作
价值函数 Value 判断状态好坏
Q函数 判断某动作价值
Bellman方程 计算未来价值

MDP 描述“状态 → 动作 → 奖励 → 新状态”的决策过程,强化学习通过学习找到最优策略。