马尔科夫决策MDP
MDP(Markov Decision Process) 是强化学习中描述“如何做决策”的数学模型。
1. 五个核心元素
| 元素 | 含义 |
|---|---|
| S | 状态(当前环境情况) |
| A | 动作(可以采取的行为) |
| P | 状态转移概率(动作后状态如何变化) |
| R | 奖励(动作带来的收益) |
| γ | 折扣因子(未来收益的重要程度) |
2. 工作流程
当前状态 S
↓
选择动作 A
↓
环境变化
↓
获得奖励 R
↓
进入新状态 S'
3. 核心思想
当前决策只依赖当前状态不依赖历史。
例如:
机器人导航:
- 状态:当前位置
- 动作:向前/向左/向右
- 奖励:靠近目标 +1,撞墙 -10
- 目标:找到最高收益路径
4. 关键概念
| 概念 | 作用 |
|---|---|
| 策略 Policy | 决定采取什么动作 |
| 价值函数 Value | 判断状态好坏 |
| Q函数 | 判断某动作价值 |
| Bellman方程 | 计算未来价值 |
MDP 描述“状态 → 动作 → 奖励 → 新状态”的决策过程,强化学习通过学习找到最优策略。