# 探索与利用

## 元数据

- 书名：深度学习推荐系统
- 作者：王喆
- 章节：第5章 多角度审视推荐系统
- 页码线索：165-174
- 目标岗位：AI PM / 推荐系统产品 / 算法工程师面试
- 优先级：P0
- 标签：exploration, bandit, long-term-value

## 面试问题

推荐系统中探索与利用如何平衡？

## 30 秒回答

利用是推荐已知高收益内容，探索是尝试不确定但可能有价值的内容。平衡二者可以缓解信息茧房、冷启动和局部最优，但探索要控制用户体验风险。

## 展开要点

- 传统方法包括 epsilon-greedy、UCB、Thompson Sampling 等。
- 个性化探索根据用户风险承受和兴趣范围调节探索比例。
- 基于模型的方法估计不确定性和长期价值。
- 探索需要护栏：低质内容、合规和商业风险不能随意探索。

## 高频追问

- 为什么推荐系统不能只利用？
- 探索流量如何分配？
- 探索效果如何评估？

## 项目映射

- 学习系统给用户推荐一点相邻新主题，避免只刷熟悉内容。
- 内容平台扶持新内容时平衡用户满意和生态健康。

## AI PM 迁移

Agent/AI 助手也需要探索新策略，但必须在可回滚和可监控范围内。

## 备注

本卡为面试复习用的主题重构和答题框架，不保存原书正文。
