Post

强化学习入门:策略、奖励与长期价值

区分即时奖励和长期价值,用一个机器人充电例子理解交互学习。

强化学习入门:策略、奖励与长期价值

这篇短文根据《Reinforcement Learning: An Introduction》第一章阅读摘记重新整理,保留概念,不转载教材段落。书目信息见 MIT Press。

从交互中学习决策

强化学习中的智能体通过行动影响环境,再利用反馈改善决策。它关注一连串行动的长期效果;训练数据通常不能直接为每个状态提供标准答案。

在一个教学例子中,送货机器人电量下降时可以继续配送,也可以返回充电。配送可能立即获得奖励,但过度消耗电量会导致之后的任务失败。这个例子说明,只追求当前一步的奖励可能损害整体目标。

四个概念的分工

概念回答的问题
策略 Policy在当前状态下怎么行动?
奖励 Reward这一步收到什么反馈?
价值函数 Value function沿某策略继续行动,预期还能获得多少回报?
环境模型 Model执行动作后,状态和奖励会怎样变化?

环境模型是可选组件。策略决定行为,价值估计帮助评价行为,奖励则定义优化目标。它们的关系可结合 Hugging Face 的强化学习框架课程理解。

奖励和价值的区别

一种常见的折扣回报定义是:

\[G_t=\sum_{k=0}^{\infty}\gamma^k R_{t+k+1},\qquad 0\le\gamma<1\]

状态价值是在指定策略下对未来回报的期望。有限回合也可以采用不折扣的回报,但要明确终止条件。

在上述机器人例子中,回充电站的即时奖励可以很小,却可能使之后完成更多配送成为可能。价值函数要表达的是这种后续影响。

阅读时保留的两个问题

第一,奖励是否准确表达了真正想要的行为?若只按配送数量计分,却完全忽略失败和能耗,学到的策略可能偏离目的。

第二,智能体如何在探索与利用之间选择?总是尝试新动作会浪费资源,总是选择当前看起来最好的动作又可能错过更好的策略。具体算法解决这个问题的方式不同。

This post is licensed under CC BY 4.0 by the author.