# 离线训练与分布式训练

## 元数据

- 书名：深度学习推荐系统
- 作者：王喆
- 章节：第6章 工程实现
- 页码线索：183-201
- 目标岗位：AI PM / 推荐系统产品 / 算法工程师面试
- 优先级：P1
- 标签：distributed-training, parameter-server, tensorflow

## 面试问题

推荐模型为什么需要分布式训练？

## 30 秒回答

推荐系统数据量、特征规模和 embedding 参数量巨大，单机训练难以承载。Spark MLlib、Parameter Server、TensorFlow 等方案在数据并行、模型并行和一致性之间做权衡。

## 展开要点

- Spark 适合大规模数据处理和部分传统模型训练。
- Parameter Server 适合大规模稀疏参数和 embedding 更新。
- TensorFlow 等深度框架支持计算图和分布式训练。
- 一致性、吞吐、收敛速度和工程复杂度需要平衡。

## 高频追问

- Parameter Server 的核心思想是什么？
- 同步和异步训练有什么取舍？
- 为什么 embedding 参数量会很大？

## 项目映射

- 讲清楚为什么工业推荐不是 notebook 训练一个模型那么简单。
- AI PM 可用它理解大模型训练/微调的工程约束。

## AI PM 迁移

大规模 AI 产品的瓶颈常在数据和系统，不只是算法想法。

## 备注

本卡为面试复习用的主题重构和答题框架，不保存原书正文。
