RL 01: Basic Concepts¶
第一部分:什么是强化学习¶
强化学习(Reinforcement Learning, RL)研究的是:智能体如何通过与环境不断交互、试错,并根据获得的奖励或惩罚改进自己的行为,最终让整个过程中的累积奖励最大。 它关注的不是“某一步有没有标准答案”,而是“经过一系列行动后,最终结果是否足够好”。
1. 强化学习的基本过程¶
强化学习可以概括为一个持续循环:
- 智能体观察当前环境;
- 根据当前策略选择一个动作;
- 环境因动作发生变化,并返回奖励或惩罚;
- 智能体利用反馈更新策略;
- 重复交互,逐渐提高长期累积奖励。
这里最重要的思想是:智能体需要自己探索“在什么情况下采取什么动作更好”,奖励信号只负责评价结果。
2. 强化学习适合解决的问题¶
强化学习问题通常具有三个重要特征。
2.1 反馈是评价性的,而不是指导性的¶
强化学习得到的反馈通常只说明当前结果“好不好”,不会直接给出正确动作。
在超级玛丽中,金币、死亡和通关奖励都是对一系列决策的评价,但游戏不会告诉玩家某一时刻应该向左、向右还是跳跃。最优行为需要智能体通过探索和尝试自己发现。
这也是强化学习与监督学习最根本的区别之一:
| 对比项 | 监督学习 | 强化学习 |
|---|---|---|
| 监督信号 | 数据中包含标准答案或标签 | 环境只返回奖励或惩罚 |
| 学习目标 | 学习输入到正确答案的映射 | 学习能够获得最大长期奖励的策略 |
| 决策形式 | 通常针对单个样本做一次预测 | 通常需要连续做出一系列决策 |
| 数据来源 | 预先收集并标注的数据集 | 智能体与环境交互产生的经验 |
例如,在猫狗分类任务中,训练数据会明确告诉模型每张图片是猫还是狗;而在强化学习中,智能体通常不知道某一步的标准答案,只能根据最终反馈反推哪些行为更有效。
2.2 需要进行序列决策¶
强化学习通常不是只做一次决定,而是连续做出一系列相互影响的决定。
在超级玛丽中,每一步选择向左、向右或跳跃,不仅会改变当前画面,也会改变后续可能到达的状态。开局选择一条危险的捷径,可能导致之后遇到更多敌人;当前动作的影响会沿着时间传递到未来。
这些决策拥有共同目标:让整局游戏获得的累积奖励最大。因此,智能体不能只追求眼前收益,还要考虑动作对未来状态和长期结果的影响。
只有一步的决策问题也可以使用强化学习,但前提是反馈仍然是评价性的,需要智能体通过尝试寻找更优行为。
2.3 奖励可能延迟出现¶
在序列决策中,一个动作的效果不一定立即显现。
例如,在围棋中,开局的一步棋可能没有吃掉任何棋子,即时奖励为零,却可能在两百手之后成为获胜的关键。最终获胜后,还需要判断此前每一步分别对结果产生了多大贡献。
如何把延迟出现的结果合理归因到之前的动作,是强化学习中的重要难题,通常称为信用分配(Credit Assignment)问题。
3. 强化学习的典型应用¶
3.1 游戏与棋类¶
AlphaGo 通过学习和搜索击败了顶尖围棋选手。它不仅学习人类棋谱,还能通过自我对弈探索新的策略。著名的第 37 手曾违背当时许多棋手的直觉,却展示了机器通过探索发现非传统解法的可能性。
游戏和棋类具有清晰的规则、动作空间和胜负反馈,是研究强化学习的重要环境。
3.2 自动驾驶¶
真实交通环境包含大量突发情况和车辆之间的动态博弈,很难依靠固定规则穷举所有场景。强化学习可以让驾驶策略在仿真环境中反复试错,学习如何在安全、效率和交通规则之间权衡。
3.3 大语言模型¶
基于人类反馈的强化学习(Reinforcement Learning from Human Feedback, RLHF)可以把人类的偏好转化为奖励信号,用于进一步优化语言模型,使其回答更符合人类需求、价值偏好和安全要求。
3.4 具身智能与机器人¶
传统机器人控制通常需要工程师建立复杂的运动学和动力学模型。强化学习可以让机器人在物理仿真环境中进行大量训练,自主探索行走和保持平衡的策略,再将学到的策略部署到真实机器人上。
通过这种方式,机器人能够学习应对楼梯、碎石等复杂地形,并在受到外力干扰时及时调整姿态、恢复平衡。
4. 小结¶
强化学习的核心可以归纳为四点:
- 智能体通过与环境交互来学习,而不是直接获得每一步的标准答案;
- 环境使用奖励或惩罚评价智能体的行为;
- 当前动作会影响未来状态,因此需要考虑长期结果;
- 学习目标是找到一个策略,使整个决策过程中的累积奖励最大。
简单来说,强化学习就是让智能体在不断试错中回答两个问题:当前应该采取什么动作,以及怎样做才能让长期结果更好。
第二部分:引入基础概念¶
-
Agent、环境、状态、动作、奖励 谁做决策谁就是agent 除了智能体都属于环境 智能体从环境中获取的信息
-
马尔可夫决策过程(Markov Decision Process, MDP)
-
价值函数
- 贝尔曼方程