# Word2Vec 与主题模型

## 元数据

- 书名：百面机器学习：算法工程师带你去面试
- 作者：葫芦娃
- 章节：第 1 章 特征工程
- 页码线索：013
- 目标岗位：AI PM / LLM 产品 / 算法工程师面试
- 优先级：P1
- 标签：word2vec, topic-model, embedding

## 面试问题

Word2Vec 如何工作？它和 LDA 有什么区别？

## 30 秒回答

Word2Vec 通过上下文预测学习词的稠密向量，关注词在相似上下文中的分布关系；LDA 是生成式主题模型，关注文档、主题、词之间的概率结构。

## 展开要点

- CBOW 用上下文预测中心词，Skip-gram 用中心词预测上下文。
- Word2Vec 的结果是词向量，常用于相似度、召回和下游特征。
- LDA 的结果是文档-主题和主题-词分布，更适合主题解释。
- 二者都利用共现信息，但建模目标和可解释性不同。

## 高频追问

- CBOW 和 Skip-gram 的差别是什么？
- 为什么负采样能加速训练？
- 什么时候选主题模型而不是 embedding？

## 项目映射

- 用 LDA 做内容库主题盘点，用 embedding 做语义召回。
- 在搜索或推荐里比较主题标签和向量召回的差异。

## AI PM 迁移

AI PM 在设计知识库时要区分“可解释的主题组织”和“语义相近的召回能力”。

## 备注

本卡为面试复习用的概念重构和答题框架，不保存原书正文。
