# 强化学习推荐

## 元数据

- 书名：深度学习推荐系统
- 作者：王喆
- 章节：第3章 深度学习在推荐系统中的应用
- 页码线索：92-98
- 目标岗位：AI PM / 推荐系统产品 / 算法工程师面试
- 优先级：P0
- 标签：reinforcement-learning, long-term-value, exploration

## 面试问题

强化学习为什么会被用于推荐系统？

## 30 秒回答

传统推荐多优化单次点击或转化，强化学习尝试优化长期收益，处理推荐动作对用户后续状态的影响，以及探索与利用的平衡。

## 展开要点

- 推荐是连续决策：当前推荐会影响未来兴趣和留存。
- RL 可把用户反馈看作奖励，学习长期策略。
- 难点是样本效率、离线评估、线上安全和奖励设计。
- 工业落地通常需要谨慎控制探索范围。

## 高频追问

- 推荐系统中状态、动作、奖励分别是什么？
- 为什么不能只优化点击？
- RL 推荐上线有哪些风险？

## 项目映射

- 学习推荐中优化长期学习完成率，而不是单张卡点击。
- AI 助手下一步行动推荐：解释、练习、追问或复盘。

## AI PM 迁移

Agent 产品同样是序列决策，不能只看单步成功，要看长期任务完成和用户信任。

## 备注

本卡为面试复习用的主题重构和答题框架，不保存原书正文。
