# 强化学习基础

## 元数据

- 书名：百面机器学习：算法工程师带你去面试
- 作者：葫芦娃
- 章节：第 11 章 强化学习
- 页码线索：258-272
- 目标岗位：AI PM / LLM 产品 / 算法工程师面试
- 优先级：P0
- 标签：reinforcement-learning, rlhf, agent

## 面试问题

强化学习中的状态、动作、奖励、策略、价值分别是什么？

## 30 秒回答

强化学习研究智能体在环境中通过试错学习策略，以最大化长期累计奖励。核心难点是延迟奖励、探索与利用、样本效率和安全约束。

## 展开要点

- 状态描述环境，动作改变环境，奖励反馈好坏。
- 策略决定在状态下选择什么动作，价值评估长期收益。
- 价值迭代和策略迭代是经典求解思路。
- 深度强化学习用神经网络近似价值或策略。

## 高频追问

- 探索和利用如何平衡？
- 策略梯度与传统监督学习有什么不同？
- 强化学习为什么难上线？

## 项目映射

- 游戏 AI、推荐长期收益、机器人控制、广告竞价。
- LLM 对齐中的 RLHF 可借这张卡解释奖励模型和策略优化。

## AI PM 迁移

AI PM 要警惕把所有多步决策都叫 RL；上线前要看安全、样本成本和奖励设计。

## 备注

本卡为面试复习用的概念重构和答题框架，不保存原书正文。
