# 推荐模型上线部署

## 元数据

- 书名：深度学习推荐系统
- 作者：王喆
- 章节：第6章 工程实现
- 页码线索：202-206
- 目标岗位：AI PM / 推荐系统产品 / 算法工程师面试
- 优先级：P0
- 标签：model-serving, deployment, latency

## 面试问题

深度推荐模型有哪些常见上线方式？

## 30 秒回答

上线方式包括预存推荐结果或 embedding、自研在线模型服务、预训练 embedding 加轻量模型、PMML 转换、TensorFlow Serving 等。选择取决于延迟、成本、实时性和迭代效率。

## 展开要点

- 预存结果简单低延迟，但个性化和实时性有限。
- 在线服务灵活但成本和稳定性要求高。
- 预训练 embedding + 轻量模型是效果和成本折中。
- 部署方案必须和业务 SLA、模型复杂度、团队能力匹配。

## 高频追问

- 什么时候预存推荐结果？
- 模型服务延迟高怎么办？
- 线上模型和离线模型不一致怎么排查？

## 项目映射

- AI 学习推荐可先每日离线生成，再逐步加入实时排序。
- LLM 功能可用缓存、模型路由、异步任务降低成本。

## AI PM 迁移

AI PM 做方案时要问：实时调用模型是否值得？能否缓存、预计算或降级？

## 备注

本卡为面试复习用的主题重构和答题框架，不保存原书正文。
