智能体是如何从奖励中学会决策的
强化学习和监督学习最大的不同在于:没有人事先告诉智能体”正确答案”,它只能靠自己在环境里试错,根据奖励信号慢慢摸索出最优策略。这套”从奖励中学会决策”的机制,是游戏 AI、机器人控制乃至大模型对齐(RLHF)的共同底座。
决策框架:马尔可夫决策过程
强化学习的问题通常被建模为马尔可夫决策过程(MDP):
- 状态 S:环境当前的局面,如棋盘布局、机器人关节角度
- 动作 A:智能体在当前状态下能做的选择
- 奖励 R:执行动作后环境给出的即时反馈
- 策略 π:从状态到动作的映射,也就是智能体最终要学的东西
“马尔可夫”假设下一步只与当前状态有关,与历史无关。目标不是眼前奖励最大,而是长期累计奖励最大——这就带来了取舍:有时要牺牲短期利益(弃子抢攻)。
价值函数与 Q-learning
怎么衡量”长期利益”?引入价值函数:
- 状态价值 V(s):从状态 s 出发,按当前策略走到底能拿多少累计奖励
- 动作价值 Q(s, a):在状态 s 执行动作 a 之后再按策略走的累计奖励
Q-learning 的思想很朴素:维护一张 Q 表(或用一个网络近似 Q 函数),每次交互后用”实际拿到的奖励 + 对未来的估计”去修正 Q 值,迭代收敛后,每个状态选 Q 值最大的动作即可。深度 Q 网络(DQN)用神经网络代替 Q 表,让这套方法能处理 Atari 游戏这类高维状态。
策略梯度:直接学策略
Q-learning 学的是”价值”,再间接导出策略;策略梯度方法直接对策略参数求导:
- 采样一批完整轨迹(状态-动作-奖励序列)
- 好动作(累计奖励高)增加其出现概率,坏动作降低概率
- 沿梯度方向更新策略网络
Actor-Critic 架构把两者结合:Actor 出动作,Critic 估价值做指导,训练更稳定,是 PPO 等现代算法的基础。
探索与利用的矛盾
智能体面临一个永恒权衡:
- 利用(Exploit):选当前认为最好的动作,稳拿已知奖励
- 探索(Explore):尝试没试过的动作,可能发现更好的策略
只利用会陷入局部最优,只探索则效率低下。ε-greedy(以小概率随机行动)等机制就是为平衡二者而生。
从 AlphaGo 到 RLHF
AlphaGo 用策略网络 + 价值网络 + 蒙特卡洛树搜索击败人类冠军;而今天大模型的 RLHF 本质是同一套框架:状态是提示词与已生成文本,动作是生成下一个 token,奖励来自人类偏好训练的奖励模型。强化学习从”教机器玩游戏”走到了”教模型符合人类价值观”,框架未变,变的是状态与奖励的定义。
本博客所有文章除特别声明外,均采用 CC BY-NC-SA 4.0 许可协议。转载请注明来源 非鱼小站!
评论
WalineDisqus







