跳转至

RL 01: Basic Concepts

第一部分:什么是强化学习

强化学习(Reinforcement Learning, RL)研究的是:智能体如何通过与环境不断交互、试错,并根据获得的奖励或惩罚改进自己的行为,最终让整个过程中的累积奖励最大。 它关注的不是“某一步有没有标准答案”,而是“经过一系列行动后,最终结果是否足够好”。

1. 强化学习的基本过程

强化学习可以概括为一个持续循环:

  1. 智能体观察当前环境;
  2. 根据当前策略选择一个动作;
  3. 环境因动作发生变化,并返回奖励或惩罚;
  4. 智能体利用反馈更新策略;
  5. 重复交互,逐渐提高长期累积奖励。

这里最重要的思想是:智能体需要自己探索“在什么情况下采取什么动作更好”,奖励信号只负责评价结果。

2. 强化学习适合解决的问题

强化学习问题通常具有三个重要特征。

2.1 反馈是评价性的,而不是指导性的

强化学习得到的反馈通常只说明当前结果“好不好”,不会直接给出正确动作。

在超级玛丽中,金币、死亡和通关奖励都是对一系列决策的评价,但游戏不会告诉玩家某一时刻应该向左、向右还是跳跃。最优行为需要智能体通过探索和尝试自己发现。

这也是强化学习与监督学习最根本的区别之一:

对比项 监督学习 强化学习
监督信号 数据中包含标准答案或标签 环境只返回奖励或惩罚
学习目标 学习输入到正确答案的映射 学习能够获得最大长期奖励的策略
决策形式 通常针对单个样本做一次预测 通常需要连续做出一系列决策
数据来源 预先收集并标注的数据集 智能体与环境交互产生的经验

例如,在猫狗分类任务中,训练数据会明确告诉模型每张图片是猫还是狗;而在强化学习中,智能体通常不知道某一步的标准答案,只能根据最终反馈反推哪些行为更有效。

2.2 需要进行序列决策

强化学习通常不是只做一次决定,而是连续做出一系列相互影响的决定。

在超级玛丽中,每一步选择向左、向右或跳跃,不仅会改变当前画面,也会改变后续可能到达的状态。开局选择一条危险的捷径,可能导致之后遇到更多敌人;当前动作的影响会沿着时间传递到未来。

这些决策拥有共同目标:让整局游戏获得的累积奖励最大。因此,智能体不能只追求眼前收益,还要考虑动作对未来状态和长期结果的影响。

只有一步的决策问题也可以使用强化学习,但前提是反馈仍然是评价性的,需要智能体通过尝试寻找更优行为。

2.3 奖励可能延迟出现

在序列决策中,一个动作的效果不一定立即显现。

例如,在围棋中,开局的一步棋可能没有吃掉任何棋子,即时奖励为零,却可能在两百手之后成为获胜的关键。最终获胜后,还需要判断此前每一步分别对结果产生了多大贡献。

如何把延迟出现的结果合理归因到之前的动作,是强化学习中的重要难题,通常称为信用分配(Credit Assignment)问题。

3. 强化学习的典型应用

3.1 游戏与棋类

AlphaGo 通过学习和搜索击败了顶尖围棋选手。它不仅学习人类棋谱,还能通过自我对弈探索新的策略。著名的第 37 手曾违背当时许多棋手的直觉,却展示了机器通过探索发现非传统解法的可能性。

游戏和棋类具有清晰的规则、动作空间和胜负反馈,是研究强化学习的重要环境。

3.2 自动驾驶

真实交通环境包含大量突发情况和车辆之间的动态博弈,很难依靠固定规则穷举所有场景。强化学习可以让驾驶策略在仿真环境中反复试错,学习如何在安全、效率和交通规则之间权衡。

3.3 大语言模型

基于人类反馈的强化学习(Reinforcement Learning from Human Feedback, RLHF)可以把人类的偏好转化为奖励信号,用于进一步优化语言模型,使其回答更符合人类需求、价值偏好和安全要求。

3.4 具身智能与机器人

传统机器人控制通常需要工程师建立复杂的运动学和动力学模型。强化学习可以让机器人在物理仿真环境中进行大量训练,自主探索行走和保持平衡的策略,再将学到的策略部署到真实机器人上。

通过这种方式,机器人能够学习应对楼梯、碎石等复杂地形,并在受到外力干扰时及时调整姿态、恢复平衡。

4. 小结

强化学习的核心可以归纳为四点:

  • 智能体通过与环境交互来学习,而不是直接获得每一步的标准答案;
  • 环境使用奖励或惩罚评价智能体的行为;
  • 当前动作会影响未来状态,因此需要考虑长期结果;
  • 学习目标是找到一个策略,使整个决策过程中的累积奖励最大。

简单来说,强化学习就是让智能体在不断试错中回答两个问题:当前应该采取什么动作,以及怎样做才能让长期结果更好。

第二部分:引入基础概念

  1. Agent、环境、状态、动作、奖励 谁做决策谁就是agent 除了智能体都属于环境 智能体从环境中获取的信息

  2. 马尔可夫决策过程(Markov Decision Process, MDP)

  3. 价值函数

  4. 贝尔曼方程