强化学习入门:策略、奖励与长期价值
区分即时奖励和长期价值,用一个机器人充电例子理解交互学习。
强化学习入门:策略、奖励与长期价值
这篇短文根据《Reinforcement Learning: An Introduction》第一章阅读摘记重新整理,保留概念,不转载教材段落。书目信息见 MIT Press。
从交互中学习决策
强化学习中的智能体通过行动影响环境,再利用反馈改善决策。它关注一连串行动的长期效果;训练数据通常不能直接为每个状态提供标准答案。
在一个教学例子中,送货机器人电量下降时可以继续配送,也可以返回充电。配送可能立即获得奖励,但过度消耗电量会导致之后的任务失败。这个例子说明,只追求当前一步的奖励可能损害整体目标。
四个概念的分工
| 概念 | 回答的问题 |
|---|---|
| 策略 Policy | 在当前状态下怎么行动? |
| 奖励 Reward | 这一步收到什么反馈? |
| 价值函数 Value function | 沿某策略继续行动,预期还能获得多少回报? |
| 环境模型 Model | 执行动作后,状态和奖励会怎样变化? |
环境模型是可选组件。策略决定行为,价值估计帮助评价行为,奖励则定义优化目标。它们的关系可结合 Hugging Face 的强化学习框架课程理解。
奖励和价值的区别
一种常见的折扣回报定义是:
\[G_t=\sum_{k=0}^{\infty}\gamma^k R_{t+k+1},\qquad 0\le\gamma<1\]状态价值是在指定策略下对未来回报的期望。有限回合也可以采用不折扣的回报,但要明确终止条件。
在上述机器人例子中,回充电站的即时奖励可以很小,却可能使之后完成更多配送成为可能。价值函数要表达的是这种后续影响。
阅读时保留的两个问题
第一,奖励是否准确表达了真正想要的行为?若只按配送数量计分,却完全忽略失败和能耗,学到的策略可能偏离目的。
第二,智能体如何在探索与利用之间选择?总是尝试新动作会浪费资源,总是选择当前看起来最好的动作又可能错过更好的策略。具体算法解决这个问题的方式不同。
This post is licensed under CC BY 4.0 by the author.