[
  {
    "number": 1,
    "chapter": "第1章 互联网的增长引擎",
    "page_hint": "1-11",
    "title": "推荐系统为什么是增长引擎",
    "interview_question": "为什么推荐系统能成为互联网产品的增长引擎？",
    "short_answer": "推荐系统同时解决用户侧的信息过载和公司侧的增长目标：帮助用户更快找到感兴趣内容，同时提升观看时长、点击、转化、留存或收入。",
    "key_points": [
      "用户侧目标是高效匹配兴趣、降低发现成本。",
      "公司侧目标取决于业务模型：观看时长、CTR、CVR、GMV、留存等。",
      "推荐不是单一模型，而是数据、召回、排序、重排、评估和工程系统的整体闭环。",
      "增长指标必须和用户体验平衡，否则容易走向标题党、过度推荐或短期优化。"
    ],
    "follow_ups": [
      "YouTube 为什么可以优化观看时长？",
      "电商推荐和内容推荐的目标有什么不同？",
      "推荐系统会带来哪些负反馈或长期风险？"
    ],
    "project_mapping": [
      "用短视频、课程、电商或招聘内容推荐说明用户目标与商业目标的统一。",
      "为 AI 面试素材库设计个性化推荐目标：学习效率、卡片采纳率、复习留存。"
    ],
    "aipm_transfer": "AI PM 可以把推荐系统看作个性化 AI 产品的底层思想：用用户行为和上下文持续优化下一步内容或动作。",
    "tags": [
      "growth",
      "recsys",
      "product-metric"
    ],
    "priority": "P0"
  },
  {
    "number": 2,
    "chapter": "第1章 互联网的增长引擎",
    "page_hint": "5-9",
    "title": "推荐系统逻辑架构",
    "interview_question": "一个推荐系统通常由哪些模块构成？",
    "short_answer": "典型推荐系统由数据层、特征层、召回层、排序层、重排/策略层、服务层和评估反馈层构成。每层解决不同规模和目标的问题。",
    "key_points": [
      "数据层收集用户、物品、上下文、行为和反馈。",
      "召回层从海量候选中快速筛出小集合，强调覆盖和效率。",
      "排序层对候选进行精细打分，强调准确性和目标拟合。",
      "策略层处理多样性、新鲜度、业务规则、探索和安全约束。",
      "评估层通过离线指标、A/B 测试和日志回流驱动迭代。"
    ],
    "follow_ups": [
      "召回层和排序层为什么要分开？",
      "推荐系统的数据部分包括哪些内容？",
      "策略层为什么不能完全交给模型？"
    ],
    "project_mapping": [
      "画出一个内容推荐系统的端到端链路。",
      "把 RAG 系统类比为：召回文档、排序证据、生成答案、评估反馈。"
    ],
    "aipm_transfer": "AI Agent/LLM 产品也常需要分层架构：候选工具召回、工具排序、执行策略、结果评估。",
    "tags": [
      "architecture",
      "recall",
      "ranking"
    ],
    "priority": "P0"
  },
  {
    "number": 3,
    "chapter": "第2章 前深度学习时代",
    "page_hint": "14-20",
    "title": "协同过滤 UserCF 与 ItemCF",
    "interview_question": "UserCF 和 ItemCF 有什么区别，分别适合什么场景？",
    "short_answer": "UserCF 基于相似用户推荐物品，ItemCF 基于相似物品推荐给用户。UserCF 更关注人群相似，ItemCF 更稳定、可解释、适合物品关系相对稳定的场景。",
    "key_points": [
      "协同过滤利用用户行为矩阵，不依赖复杂内容特征。",
      "UserCF 在用户量大且兴趣变化快时计算和更新成本较高。",
      "ItemCF 物品相似度更稳定，常适合电商、视频、音乐等场景。",
      "协同过滤有冷启动、稀疏性、热门偏置和可扩展性问题。"
    ],
    "follow_ups": [
      "如何计算用户相似度或物品相似度？",
      "为什么 ItemCF 在工业界更常见？",
      "协同过滤如何处理新用户和新物品？"
    ],
    "project_mapping": [
      "用“看过 A 的人也看过 B”说明 ItemCF。",
      "用学习素材库做“读过 RAG 卡的人也读 Agent 卡”的相似推荐。"
    ],
    "aipm_transfer": "协同过滤对应 AI 产品里的行为相似性推荐：不理解内容语义，也能从共同行为中发现关联。",
    "tags": [
      "collaborative-filtering",
      "usercf",
      "itemcf"
    ],
    "priority": "P0"
  },
  {
    "number": 4,
    "chapter": "第2章 前深度学习时代",
    "page_hint": "21-27",
    "title": "矩阵分解",
    "interview_question": "矩阵分解相比协同过滤解决了什么问题？",
    "short_answer": "矩阵分解把稀疏的用户-物品行为矩阵分解为低维用户向量和物品向量，用隐向量表达兴趣和物品属性，提升泛化能力并缓解稀疏问题。",
    "key_points": [
      "用户和物品被映射到同一个低维隐空间。",
      "预测分数通常由用户向量和物品向量的内积得到。",
      "可以加入用户偏置、物品偏置和全局偏置。",
      "局限是难以自然融合上下文、序列、内容和复杂特征交叉。"
    ],
    "follow_ups": [
      "矩阵分解和 embedding 有什么关系？",
      "为什么要加入 bias 项？",
      "矩阵分解如何处理隐式反馈？"
    ],
    "project_mapping": [
      "用用户-岗位匹配或用户-课程匹配说明隐向量推荐。",
      "解释为什么 embedding 召回本质上延续了矩阵分解思想。"
    ],
    "aipm_transfer": "矩阵分解帮助 AI PM 理解 embedding 空间：相似不来自规则，而来自行为或语义共现学习。",
    "tags": [
      "matrix-factorization",
      "embedding",
      "matching"
    ],
    "priority": "P0"
  },
  {
    "number": 5,
    "chapter": "第2章 前深度学习时代",
    "page_hint": "27-33",
    "title": "逻辑回归推荐模型",
    "interview_question": "逻辑回归为什么曾是推荐/广告系统的重要 baseline？",
    "short_answer": "逻辑回归简单、稳定、可解释、易部署，能融合多种人工特征并输出概率，因此长期是 CTR/CVR 预估的强 baseline。",
    "key_points": [
      "LR 能融合用户、物品、上下文和交叉特征。",
      "输出概率方便做排序和业务校准。",
      "优点是训练和服务成本低，解释性较好。",
      "局限是表达能力依赖人工特征，难以自动学习高阶非线性交叉。"
    ],
    "follow_ups": [
      "LR 如何用于 CTR 预估？",
      "LR 的特征工程为什么重要？",
      "什么时候不要上深度模型？"
    ],
    "project_mapping": [
      "用 LR 做候选需求优先级或用户流失预测 baseline。",
      "AI 功能上线前用简单模型/规则做可解释基线。"
    ],
    "aipm_transfer": "AI PM 不应默认复杂模型；先建立稳定 baseline，才能判断深度模型或 LLM 是否真的带来增量。",
    "tags": [
      "logistic-regression",
      "baseline",
      "ctr"
    ],
    "priority": "P0"
  },
  {
    "number": 6,
    "chapter": "第2章 前深度学习时代",
    "page_hint": "33-39",
    "title": "FM 与 FFM 特征交叉",
    "interview_question": "FM 为什么适合推荐和广告场景？",
    "short_answer": "FM 用隐向量建模特征之间的二阶交叉，在高维稀疏场景下比直接交叉更可泛化。FFM 进一步引入 field 概念，让同一特征面对不同特征域时使用不同隐向量。",
    "key_points": [
      "推荐/广告特征通常高维、稀疏、类别多。",
      "直接 one-hot 交叉参数爆炸，FM 用隐向量降低复杂度。",
      "FM 自动建模二阶交叉，是从人工交叉到表示学习的过渡。",
      "FFM 表达力更强，但参数量和训练成本更高。"
    ],
    "follow_ups": [
      "FM 和矩阵分解有什么关系？",
      "FFM 中 field 的意义是什么？",
      "FM 的局限是什么？"
    ],
    "project_mapping": [
      "广告 CTR：用户年龄 x 广告类目 x 场景。",
      "AI 学习推荐：候选人背景 x JD 类型 x 知识卡主题。"
    ],
    "aipm_transfer": "FM 思想对应 AI PM 的结构化上下文交叉：用户、任务、内容、场景之间的组合决定结果。",
    "tags": [
      "fm",
      "ffm",
      "feature-cross"
    ],
    "priority": "P0"
  },
  {
    "number": 7,
    "chapter": "第2章 前深度学习时代",
    "page_hint": "40-43",
    "title": "GBDT+LR",
    "interview_question": "GBDT+LR 为什么是经典组合模型？",
    "short_answer": "GBDT 负责自动发现非线性特征组合，把树路径转成离散特征；LR 负责在线性框架下稳定学习权重并输出概率。它把特征工程模型化，是深度推荐前的重要工业方案。",
    "key_points": [
      "GBDT 的叶子节点可看作自动组合特征。",
      "LR 接收这些稀疏特征后完成概率预估。",
      "模型兼具非线性表达和线上部署稳定性。",
      "局限是端到端能力弱，特征和模型分段优化。"
    ],
    "follow_ups": [
      "GBDT 如何做特征转换？",
      "GBDT+LR 与 Wide&Deep 有什么思想联系？",
      "它为什么在 Facebook 广告中有代表性？"
    ],
    "project_mapping": [
      "用树模型自动发现用户行为组合，再用 LR 做预测。",
      "AI PM 可用这张卡讲“传统 ML 到深度学习”的演进。"
    ],
    "aipm_transfer": "GBDT+LR 提醒我们：很多 AI 系统不是单模型，而是多个模型和规则模块组合。",
    "tags": [
      "gbdt",
      "lr",
      "feature-engineering"
    ],
    "priority": "P0"
  },
  {
    "number": 8,
    "chapter": "第2章 前深度学习时代",
    "page_hint": "44-47",
    "title": "LS-PLM 与分片建模",
    "interview_question": "LS-PLM 这类分片模型解决什么问题？",
    "short_answer": "LS-PLM 通过多个局部模型和门控/分片思想处理不同数据区域的差异，让模型能表达更复杂的非线性关系，同时保持一定可解释性和工程可控性。",
    "key_points": [
      "单一全局线性模型难以拟合复杂用户行为。",
      "分片模型把样本空间拆成多个局部区域。",
      "每个局部模型学习不同模式，整体通过权重融合。",
      "从深度学习视角看，它和 MoE/门控思想有相通之处。"
    ],
    "follow_ups": [
      "分片过多会有什么风险？",
      "LS-PLM 和深度模型的联系是什么？",
      "为什么阿里曾在广告场景使用这类模型？"
    ],
    "project_mapping": [
      "不同人群/场景分别建模：新客、老客、高价值用户。",
      "LLM 产品可用模型路由类比：不同任务走不同专家模型。"
    ],
    "aipm_transfer": "AI PM 可以把它理解为“人群/场景分治”：不一定一个模型解决所有任务。",
    "tags": [
      "ls-plm",
      "moe",
      "segmentation"
    ],
    "priority": "P1"
  },
  {
    "number": 9,
    "chapter": "第3章 深度学习在推荐系统中的应用",
    "page_hint": "50-52",
    "title": "深度推荐模型演进图",
    "interview_question": "深度学习给推荐系统带来的核心变化是什么？",
    "short_answer": "深度学习让推荐模型从依赖人工特征工程，转向通过 embedding、非线性网络、注意力、序列建模和多目标结构自动学习复杂关系。",
    "key_points": [
      "Embedding 层把高维稀疏特征变成稠密表示。",
      "多层网络增强非线性表达和高阶特征交叉。",
      "注意力和序列模型让用户兴趣表达更细粒度。",
      "深度模型也带来训练成本、线上延迟、可解释性和数据饥饿问题。"
    ],
    "follow_ups": [
      "深度模型一定比传统模型好吗？",
      "为什么推荐系统天然适合 embedding？",
      "模型复杂度如何和线上服务成本平衡？"
    ],
    "project_mapping": [
      "从 LR/FM baseline 升级到 DeepFM 或 DIN 的路线。",
      "AI PM 可准备一个“复杂模型是否值得上线”的取舍案例。"
    ],
    "aipm_transfer": "深度推荐的经验可以迁移到 LLM 产品：模型能力提升必须和数据、架构、评估、成本一起考虑。",
    "tags": [
      "deep-learning",
      "model-evolution",
      "recsys"
    ],
    "priority": "P0"
  },
  {
    "number": 10,
    "chapter": "第3章 深度学习在推荐系统中的应用",
    "page_hint": "53-58",
    "title": "AutoRec",
    "interview_question": "AutoRec 的基本思想是什么？",
    "short_answer": "AutoRec 用自编码器重构用户-物品评分向量，通过隐藏层学习用户或物品的低维表示，是把神经网络用于协同过滤的一种早期方式。",
    "key_points": [
      "输入可以是用户评分向量或物品评分向量。",
      "目标是重构已知评分，并预测未知评分。",
      "相比矩阵分解，AutoRec 引入非线性表达。",
      "局限是依赖评分矩阵，难融合复杂上下文和工业特征。"
    ],
    "follow_ups": [
      "AutoRec 和矩阵分解有什么联系？",
      "自编码器为什么能学表示？",
      "为什么 AutoRec 工业影响不如后续模型？"
    ],
    "project_mapping": [
      "用内容评分/收藏矩阵做个性化素材推荐。",
      "作为“神经协同过滤”的入门例子。"
    ],
    "aipm_transfer": "这张卡适合理解模型演进：深度学习不是一上来就取代系统，而是逐步替换传统模块。",
    "tags": [
      "autorec",
      "autoencoder",
      "collaborative-filtering"
    ],
    "priority": "P1"
  },
  {
    "number": 11,
    "chapter": "第3章 深度学习在推荐系统中的应用",
    "page_hint": "58-62",
    "title": "Deep Crossing",
    "interview_question": "Deep Crossing 对推荐模型有什么启发？",
    "short_answer": "Deep Crossing 用 embedding、残差网络和多层非线性结构完成特征表达与交叉，代表了推荐模型从人工交叉向端到端深度结构演进。",
    "key_points": [
      "Embedding 层处理稀疏类别特征。",
      "Stacking 层拼接多类特征。",
      "Residual 层提升深层网络训练稳定性。",
      "Scoring 层输出最终预测分数。"
    ],
    "follow_ups": [
      "为什么需要残差结构？",
      "Deep Crossing 如何替代人工特征交叉？",
      "这类模型的线上成本如何控制？"
    ],
    "project_mapping": [
      "把用户、物品、上下文特征输入深度排序模型。",
      "AI PM 可用它解释“端到端不等于没有工程约束”。"
    ],
    "aipm_transfer": "Deep Crossing 的模块化思路可迁移到 AI 产品：输入表示、特征融合、推理打分、输出决策。",
    "tags": [
      "deep-crossing",
      "feature-cross",
      "resnet"
    ],
    "priority": "P1"
  },
  {
    "number": 12,
    "chapter": "第3章 深度学习在推荐系统中的应用",
    "page_hint": "63-67",
    "title": "NeuralCF",
    "interview_question": "NeuralCF 如何把协同过滤和深度学习结合？",
    "short_answer": "NeuralCF 用神经网络替代矩阵分解中的简单内积，让用户向量和物品向量通过非线性网络交互，增强匹配函数的表达能力。",
    "key_points": [
      "矩阵分解的内积是固定、简单的匹配函数。",
      "NeuralCF 学习更灵活的用户-物品交互。",
      "可结合 GMF 和 MLP 两类结构。",
      "局限是仍较依赖 ID 类协同行为，冷启动和特征融合仍需扩展。"
    ],
    "follow_ups": [
      "为什么内积表达能力有限？",
      "NeuralCF 和双塔召回有什么区别？",
      "如何处理新用户？"
    ],
    "project_mapping": [
      "学习用户和职位/课程/内容的匹配函数。",
      "把简单相似度升级为可训练匹配网络。"
    ],
    "aipm_transfer": "AI PM 可用它理解：匹配不仅是向量相似，还可以学习更复杂的交互函数。",
    "tags": [
      "neuralcf",
      "matching",
      "collaborative-filtering"
    ],
    "priority": "P1"
  },
  {
    "number": 13,
    "chapter": "第3章 深度学习在推荐系统中的应用",
    "page_hint": "67-70",
    "title": "PNN Product Layer",
    "interview_question": "PNN 为什么要引入 Product 层？",
    "short_answer": "PNN 用 Product 层显式建模 embedding 特征之间的交叉关系，在深度网络中保留类似 FM 的二阶交叉能力。",
    "key_points": [
      "普通 DNN 拼接 embedding 后未必充分表达特征交叉。",
      "Product 层可以做内积、外积等特征交互。",
      "适合强调用户、物品、上下文之间组合关系的 CTR 场景。",
      "表达力增强也会带来参数量和计算成本上升。"
    ],
    "follow_ups": [
      "PNN 和 DeepFM 有什么共同点？",
      "内积和外积 Product 有什么区别？",
      "显式交叉与隐式交叉如何取舍？"
    ],
    "project_mapping": [
      "候选人背景 x JD x 学习阶段的交叉建模。",
      "AI 产品中的用户任务 x 工具 x 场景匹配。"
    ],
    "aipm_transfer": "特征交叉提醒 AI PM：用户价值往往来自上下文组合，而不是单个特征。",
    "tags": [
      "pnn",
      "product-layer",
      "feature-cross"
    ],
    "priority": "P1"
  },
  {
    "number": 14,
    "chapter": "第3章 深度学习在推荐系统中的应用",
    "page_hint": "70-76",
    "title": "Wide&Deep",
    "interview_question": "Wide&Deep 中的记忆能力和泛化能力分别指什么？",
    "short_answer": "Wide 部分记忆历史中出现过的强规则和特征组合，Deep 部分通过 embedding 和深层网络泛化到未见过的组合。二者结合兼顾准确记忆和泛化推荐。",
    "key_points": [
      "Wide 适合记住高频、强相关、可解释的交叉特征。",
      "Deep 适合从稀疏特征中学习低维表示和非线性模式。",
      "适用于既要利用历史规则，又要发现新组合的场景。",
      "工程上需要管理 wide 特征、deep 特征和联合训练。"
    ],
    "follow_ups": [
      "为什么只用 Deep 可能不够？",
      "Wide&Deep 和 GBDT+LR 的思想联系是什么？",
      "什么场景需要记忆能力？"
    ],
    "project_mapping": [
      "电商推荐：记住用户买过品牌，同时泛化到相似品类。",
      "AI 学习推荐：记住已掌握主题，同时泛化到相邻能力卡。"
    ],
    "aipm_transfer": "LLM 个性化也要兼顾记忆和泛化：既利用明确偏好，又推荐新但相关的内容。",
    "tags": [
      "wide-and-deep",
      "memorization",
      "generalization"
    ],
    "priority": "P0"
  },
  {
    "number": 15,
    "chapter": "第3章 深度学习在推荐系统中的应用",
    "page_hint": "77-83",
    "title": "FNN DeepFM NFM",
    "interview_question": "FNN、DeepFM、NFM 如何把 FM 和深度学习结合？",
    "short_answer": "FNN 用 FM 预训练 embedding，DeepFM 用 FM 替代 Wide 部分同时学习低阶和高阶特征，NFM 则把 FM 的二阶交叉神经网络化。",
    "key_points": [
      "这些模型的共同目标是保留 FM 的交叉能力，同时增强深度表达。",
      "FNN 强调预训练初始化。",
      "DeepFM 端到端结合 FM 和 DNN。",
      "NFM 用神经网络处理二阶交叉后的表示。"
    ],
    "follow_ups": [
      "DeepFM 相比 Wide&Deep 有什么改进？",
      "为什么 FM 适合作为 deep 模型组件？",
      "端到端训练的好处和风险是什么？"
    ],
    "project_mapping": [
      "结构化高维稀疏特征排序任务。",
      "讲一个从 FM baseline 升级到 DeepFM 的模型演进。"
    ],
    "aipm_transfer": "AI PM 可以用这张卡理解“继承成熟模块 + 深度化改造”的产品技术演进方式。",
    "tags": [
      "deepfm",
      "fnn",
      "nfm",
      "fm"
    ],
    "priority": "P0"
  },
  {
    "number": 16,
    "chapter": "第3章 深度学习在推荐系统中的应用",
    "page_hint": "83-88",
    "title": "注意力机制与 DIN",
    "interview_question": "DIN 为什么要把注意力机制引入推荐系统？",
    "short_answer": "DIN 认为用户兴趣不是一个固定向量，而应针对当前候选物品激活相关历史行为。注意力机制让模型根据候选 item 动态选择最相关的用户兴趣。",
    "key_points": [
      "传统用户向量可能把多种兴趣混在一起。",
      "DIN 针对候选广告/物品对历史行为做 attention。",
      "模型能表达“用户对不同候选物品的兴趣不同”。",
      "注意力也提供一定解释性：哪些历史行为影响当前推荐。"
    ],
    "follow_ups": [
      "DIN 的改进动机是什么？",
      "注意力权重能否直接当解释？",
      "DIN 和普通 embedding pooling 有什么区别？"
    ],
    "project_mapping": [
      "用户既看技术书又看产品书，推荐 AI PM 卡时激活相关历史。",
      "电商中根据候选品类激活用户对应兴趣。"
    ],
    "aipm_transfer": "AI PM 可把 DIN 类比为上下文相关记忆：模型应根据当前任务选择相关历史，而不是塞入全部记忆。",
    "tags": [
      "attention",
      "din",
      "user-interest"
    ],
    "priority": "P0"
  },
  {
    "number": 17,
    "chapter": "第3章 深度学习在推荐系统中的应用",
    "page_hint": "88-92",
    "title": "DIEN 与用户兴趣演化",
    "interview_question": "DIEN 相比 DIN 进一步解决了什么问题？",
    "short_answer": "DIEN 不只关注当前候选激活哪段历史，还建模用户兴趣如何随时间演化。它用序列模型抽取兴趣并刻画兴趣进化，更适合行为序列丰富的场景。",
    "key_points": [
      "用户兴趣会随时间变化，静态兴趣表达不够。",
      "兴趣抽取层从行为序列中学习兴趣表示。",
      "兴趣进化层刻画兴趣随候选目标的变化。",
      "序列建模提升表达力，但也增加训练和服务复杂度。"
    ],
    "follow_ups": [
      "DIN 和 DIEN 的主要区别是什么？",
      "为什么推荐系统需要序列模型？",
      "长序列建模有什么工程挑战？"
    ],
    "project_mapping": [
      "学习路径推荐：从基础 ML 到 RAG/Agent 的兴趣演化。",
      "内容推荐中近期兴趣和长期兴趣的权衡。"
    ],
    "aipm_transfer": "LLM 个性化也要区分长期偏好和当前任务，避免用过时历史干扰当前回答。",
    "tags": [
      "dien",
      "sequence",
      "interest-evolution"
    ],
    "priority": "P0"
  },
  {
    "number": 18,
    "chapter": "第3章 深度学习在推荐系统中的应用",
    "page_hint": "92-98",
    "title": "强化学习推荐",
    "interview_question": "强化学习为什么会被用于推荐系统？",
    "short_answer": "传统推荐多优化单次点击或转化，强化学习尝试优化长期收益，处理推荐动作对用户后续状态的影响，以及探索与利用的平衡。",
    "key_points": [
      "推荐是连续决策：当前推荐会影响未来兴趣和留存。",
      "RL 可把用户反馈看作奖励，学习长期策略。",
      "难点是样本效率、离线评估、线上安全和奖励设计。",
      "工业落地通常需要谨慎控制探索范围。"
    ],
    "follow_ups": [
      "推荐系统中状态、动作、奖励分别是什么？",
      "为什么不能只优化点击？",
      "RL 推荐上线有哪些风险？"
    ],
    "project_mapping": [
      "学习推荐中优化长期学习完成率，而不是单张卡点击。",
      "AI 助手下一步行动推荐：解释、练习、追问或复盘。"
    ],
    "aipm_transfer": "Agent 产品同样是序列决策，不能只看单步成功，要看长期任务完成和用户信任。",
    "tags": [
      "reinforcement-learning",
      "long-term-value",
      "exploration"
    ],
    "priority": "P0"
  },
  {
    "number": 19,
    "chapter": "第4章 Embedding 技术",
    "page_hint": "102-109",
    "title": "Embedding 是深度推荐核心操作",
    "interview_question": "为什么 Embedding 对深度推荐系统如此重要？",
    "short_answer": "Embedding 把高维稀疏 ID、类别、文本或图节点映射为低维稠密向量，使相似用户、物品和上下文能在统一空间中计算、召回和输入深度模型。",
    "key_points": [
      "推荐系统大量特征是稀疏 ID 和类别特征。",
      "Embedding 降低维度并承载语义/行为相似性。",
      "Embedding 可用于召回、排序、冷启动和可视化分析。",
      "向量质量取决于训练目标、数据分布和负样本设计。"
    ],
    "follow_ups": [
      "Embedding 和 one-hot 有什么区别？",
      "Embedding 维度如何选择？",
      "如何评估 embedding 好坏？"
    ],
    "project_mapping": [
      "职位、知识卡、用户画像都可向量化用于匹配。",
      "RAG 的文档 embedding 与推荐 item embedding 可类比。"
    ],
    "aipm_transfer": "AI PM 必须理解 embedding 是语义检索和个性化推荐的共同底座，但相似不等于正确。",
    "tags": [
      "embedding",
      "vector",
      "representation"
    ],
    "priority": "P0"
  },
  {
    "number": 20,
    "chapter": "第4章 Embedding 技术",
    "page_hint": "105-112",
    "title": "Word2vec 与 Item2vec",
    "interview_question": "Item2vec 如何把 Word2vec 推广到推荐系统？",
    "short_answer": "Item2vec 把用户行为序列类比为句子，把物品类比为词，通过共现上下文学习物品向量，从而用于相似物品召回和推荐。",
    "key_points": [
      "用户一次会话或行为序列可看作 item sentence。",
      "共现关系表达物品之间的行为相似性。",
      "训练后可用向量近邻找相似物品。",
      "局限是容易受热门物品、序列构造和上下文窗口影响。"
    ],
    "follow_ups": [
      "Item2vec 和 ItemCF 有什么区别？",
      "行为序列如何构造？",
      "负采样有什么作用？"
    ],
    "project_mapping": [
      "读过某类面试卡的人还会读哪些卡。",
      "电商“搭配购买”或内容“连续观看”推荐。"
    ],
    "aipm_transfer": "Item2vec 是 RAG/推荐之间的桥：都从共现或上下文中学习向量，用于快速召回。",
    "tags": [
      "item2vec",
      "word2vec",
      "recall"
    ],
    "priority": "P0"
  },
  {
    "number": 21,
    "chapter": "第4章 Embedding 技术",
    "page_hint": "112-118",
    "title": "Graph Embedding",
    "interview_question": "Graph Embedding 在推荐系统中解决什么问题？",
    "short_answer": "Graph Embedding 把用户、物品、属性和行为构成的图结构映射为向量，能利用更丰富的连接关系，捕捉同质性、结构性和多跳关联。",
    "key_points": [
      "DeepWalk 用随机游走生成节点序列，再类比 Word2vec 训练。",
      "Node2vec 在 BFS/DFS 风格之间权衡同质性和结构性。",
      "EGES 等方法融合多种 side information。",
      "图嵌入适合复杂关系网络，但构图和实时更新很关键。"
    ],
    "follow_ups": [
      "DeepWalk 和 Node2vec 有什么区别？",
      "推荐系统里的图节点和边怎么定义？",
      "Graph Embedding 如何处理冷启动？"
    ],
    "project_mapping": [
      "用户-知识卡-技能-岗位构图，推荐下一张学习卡。",
      "企业知识库中人、文档、项目、主题构成知识图谱。"
    ],
    "aipm_transfer": "AI PM 可用图思维组织个性化学习和知识推荐：不只是文本相似，还有关系相似。",
    "tags": [
      "graph-embedding",
      "deepwalk",
      "node2vec"
    ],
    "priority": "P0"
  },
  {
    "number": 22,
    "chapter": "第4章 Embedding 技术",
    "page_hint": "118-125",
    "title": "Embedding 召回与近邻搜索",
    "interview_question": "为什么 embedding 召回需要近邻搜索技术？",
    "short_answer": "线上推荐需要在海量物品向量中快速找出与用户向量相近的候选，暴力计算成本过高，因此需要 ANN、局部敏感哈希等近似最近邻搜索方法。",
    "key_points": [
      "Embedding 召回把推荐问题转化为向量近邻检索。",
      "近似搜索在召回质量和延迟之间做权衡。",
      "局部敏感哈希通过哈希桶减少候选搜索范围。",
      "工业系统还要考虑索引更新、过滤、权限和多路融合。"
    ],
    "follow_ups": [
      "ANN 为什么是近似而不是精确？",
      "召回延迟和召回率如何平衡？",
      "多桶策略有什么作用？"
    ],
    "project_mapping": [
      "RAG 向量库召回与推荐 embedding 召回的相似点。",
      "知识卡推荐中先向量召回，再排序。"
    ],
    "aipm_transfer": "AI PM 需要知道向量检索是工程系统：召回质量、延迟、成本和更新频率同时决定体验。",
    "tags": [
      "ann",
      "lsh",
      "vector-search"
    ],
    "priority": "P0"
  },
  {
    "number": 23,
    "chapter": "第5章 多角度审视推荐系统",
    "page_hint": "129-137",
    "title": "推荐系统特征工程",
    "interview_question": "推荐系统特征工程应该遵循什么原则？",
    "short_answer": "推荐特征工程要围绕用户、物品、上下文、交叉行为和业务目标构建，既要表达偏好，也要表达场景和约束。特征设计离不开业务理解。",
    "key_points": [
      "常用特征包括用户画像、物品属性、上下文、历史行为、统计特征和交叉特征。",
      "数值、类别、序列、文本、图像等特征要用不同处理方法。",
      "特征必须稳定、可获得、低泄漏、线上线下一致。",
      "业务理解决定哪些行为值得进入模型。"
    ],
    "follow_ups": [
      "推荐系统有哪些常用特征？",
      "如何避免特征穿越？",
      "为什么说特征工程与业务理解有关？"
    ],
    "project_mapping": [
      "为 AI 面试素材推荐设计用户、岗位、书籍、卡片、行为特征。",
      "为企业知识库推荐设计角色、权限、文档、任务上下文特征。"
    ],
    "aipm_transfer": "LLM 产品的上下文工程就是一种特征工程：给模型什么信息，决定它能做出什么判断。",
    "tags": [
      "feature-engineering",
      "business-understanding"
    ],
    "priority": "P0"
  },
  {
    "number": 24,
    "chapter": "第5章 多角度审视推荐系统",
    "page_hint": "137-140",
    "title": "召回层与多路召回",
    "interview_question": "召回层和排序层的功能差异是什么？为什么要多路召回？",
    "short_answer": "召回层负责从海量物品中快速找出可能相关的候选，排序层负责精细打分。多路召回用不同策略覆盖不同兴趣和场景，避免单一路径漏掉候选。",
    "key_points": [
      "召回强调效率和覆盖，排序强调准确和目标拟合。",
      "常见召回包括热门、协同过滤、内容、embedding、规则、运营召回。",
      "多路召回需要去重、配额、融合和后续排序。",
      "召回不足时，排序再强也无候选可排。"
    ],
    "follow_ups": [
      "多路召回结果如何融合？",
      "召回层如何评估？",
      "召回太多会有什么问题？"
    ],
    "project_mapping": [
      "学习卡推荐：按技能图谱、相似用户、最近阅读、岗位目标多路召回。",
      "RAG：BM25、向量、标签、权限、人工精选多路召回。"
    ],
    "aipm_transfer": "RAG 的很多问题本质是召回问题：没召回正确证据，生成层无法补救。",
    "tags": [
      "recall",
      "multi-channel",
      "ranking"
    ],
    "priority": "P0"
  },
  {
    "number": 25,
    "chapter": "第5章 多角度审视推荐系统",
    "page_hint": "140-148",
    "title": "推荐系统实时性",
    "interview_question": "推荐系统为什么强调实时性？",
    "short_answer": "实时性让推荐系统快速响应用户最新兴趣、物品状态和场景变化。实时性包括特征实时、模型实时、召回索引实时和策略实时，但每一层都要和成本权衡。",
    "key_points": [
      "用户短期兴趣可能比长期画像更能预测下一次行为。",
      "物品库存、价格、热度、内容状态会快速变化。",
      "特征实时性、模型实时性和服务实时性是不同问题。",
      "木桶效应：最慢或最旧的一环会限制整体效果。"
    ],
    "follow_ups": [
      "实时特征和离线特征如何结合？",
      "模型需要实时训练吗？",
      "实时性带来哪些工程成本？"
    ],
    "project_mapping": [
      "短视频/电商根据最近点击即时调整推荐。",
      "AI 学习系统根据刚答错的题即时推荐补充卡。"
    ],
    "aipm_transfer": "AI PM 在个性化产品中要区分长期记忆和短期上下文，二者更新频率不同。",
    "tags": [
      "real-time",
      "feature",
      "serving"
    ],
    "priority": "P0"
  },
  {
    "number": 26,
    "chapter": "第5章 多角度审视推荐系统",
    "page_hint": "148-153",
    "title": "优化目标设定",
    "interview_question": "推荐系统如何合理设定优化目标？",
    "short_answer": "优化目标必须和业务场景统一，既不能只追技术指标，也不能只看短期点击。目标要能代表用户价值和商业价值，并与其他团队形成清晰接口。",
    "key_points": [
      "视频可关注观看时长，电商可关注转化/GMV，新闻可关注点击与留存。",
      "点击率高不等于用户满意，可能诱导标题党。",
      "目标应包含主指标和护栏指标。",
      "目标设定是产品、算法、运营、商业团队的接口工作。"
    ],
    "follow_ups": [
      "为什么 YouTube 用观看时长作为目标？",
      "推荐系统如何避免短期优化？",
      "多目标如何权衡？"
    ],
    "project_mapping": [
      "为 AI 面试素材库设定：有效复习时长、卡片完成率、模拟面试提升，而不是只看点击。",
      "为 RAG 设定答案有用率、引用正确率、人工兜底率。"
    ],
    "aipm_transfer": "AI 产品最危险的是优化错目标：调用量、生成次数不等于任务成功。",
    "tags": [
      "objective",
      "metrics",
      "product"
    ],
    "priority": "P0"
  },
  {
    "number": 27,
    "chapter": "第5章 多角度审视推荐系统",
    "page_hint": "153-158",
    "title": "没有推荐银弹",
    "interview_question": "为什么说推荐系统中比模型结构更重要的是业务理解？",
    "short_answer": "推荐问题没有通用银弹。模型结构只有在捕捉到具体场景里的用户行为规律时才有价值。优秀算法设计来自对用户行为、业务目标和数据机制的观察。",
    "key_points": [
      "拿着新模型找场景容易变成撞大运。",
      "问题驱动要求先定义清楚行为规律和技术需求。",
      "DIN 等模型的价值来自对用户兴趣激活机制的洞察。",
      "算法工程师不能只是调参炼丹，也要理解产品和用户。"
    ],
    "follow_ups": [
      "如何判断一个新模型是否适合你的业务？",
      "为什么论文 SOTA 不一定线上有效？",
      "你如何做问题驱动的模型设计？"
    ],
    "project_mapping": [
      "从用户行为观察出发提出模型改进，而不是先追新模型。",
      "AI PM 在引入 Agent 前先定义它解决的真实流程瓶颈。"
    ],
    "aipm_transfer": "LLM 产品同理：不是所有问题都要上 Agent、RAG 或微调，先定义真实问题。",
    "tags": [
      "problem-driven",
      "model-selection",
      "business"
    ],
    "priority": "P0"
  },
  {
    "number": 28,
    "chapter": "第5章 多角度审视推荐系统",
    "page_hint": "159-164",
    "title": "冷启动",
    "interview_question": "推荐系统如何解决冷启动问题？",
    "short_answer": "冷启动来自缺少用户或物品行为数据。可用规则、内容特征、热门策略、主动学习、迁移学习、探索机制和引导用户提供偏好来缓解。",
    "key_points": [
      "新用户冷启动可通过注册信息、兴趣选择、上下文和热门内容启动。",
      "新物品冷启动可利用内容、类目、作者、价格、文本/图像 embedding。",
      "主动学习通过少量问题快速获取偏好。",
      "探索与利用机制帮助新内容获得曝光。"
    ],
    "follow_ups": [
      "新用户和新物品冷启动有什么不同？",
      "如何设计用户兴趣选择流程？",
      "冷启动如何评估？"
    ],
    "project_mapping": [
      "新用户进入 AI 学习系统时先问目标岗位、经验、薄弱点。",
      "新知识卡用主题、来源、难度和 embedding 初始化推荐。"
    ],
    "aipm_transfer": "AI 个性化产品启动时不能等待大量行为，必须通过显式偏好和内容理解建立初始画像。",
    "tags": [
      "cold-start",
      "active-learning",
      "personalization"
    ],
    "priority": "P0"
  },
  {
    "number": 29,
    "chapter": "第5章 多角度审视推荐系统",
    "page_hint": "165-174",
    "title": "探索与利用",
    "interview_question": "推荐系统中探索与利用如何平衡？",
    "short_answer": "利用是推荐已知高收益内容，探索是尝试不确定但可能有价值的内容。平衡二者可以缓解信息茧房、冷启动和局部最优，但探索要控制用户体验风险。",
    "key_points": [
      "传统方法包括 epsilon-greedy、UCB、Thompson Sampling 等。",
      "个性化探索根据用户风险承受和兴趣范围调节探索比例。",
      "基于模型的方法估计不确定性和长期价值。",
      "探索需要护栏：低质内容、合规和商业风险不能随意探索。"
    ],
    "follow_ups": [
      "为什么推荐系统不能只利用？",
      "探索流量如何分配？",
      "探索效果如何评估？"
    ],
    "project_mapping": [
      "学习系统给用户推荐一点相邻新主题，避免只刷熟悉内容。",
      "内容平台扶持新内容时平衡用户满意和生态健康。"
    ],
    "aipm_transfer": "Agent/AI 助手也需要探索新策略，但必须在可回滚和可监控范围内。",
    "tags": [
      "exploration",
      "bandit",
      "long-term-value"
    ],
    "priority": "P0"
  },
  {
    "number": 30,
    "chapter": "第6章 工程实现",
    "page_hint": "177-181",
    "title": "推荐系统数据流",
    "interview_question": "推荐系统的数据架构为什么要区分批处理和流计算？",
    "short_answer": "批处理适合大规模离线统计和训练，流计算适合实时行为反馈和状态更新。工业推荐常通过 Lambda 或 Kappa 架构整合离线与实时数据。",
    "key_points": [
      "批处理吞吐高，适合全量特征、样本生成、离线训练。",
      "流计算延迟低，适合实时特征、实时反馈和在线监控。",
      "Lambda 同时维护批处理和流处理路径，复杂但稳健。",
      "Kappa 更强调统一流式架构，降低双路径一致性问题。"
    ],
    "follow_ups": [
      "Lambda 和 Kappa 架构有什么区别？",
      "实时特征如何保证一致性？",
      "数据延迟会如何影响推荐效果？"
    ],
    "project_mapping": [
      "用户刚点击某主题后即时更新推荐候选。",
      "LLM 产品日志回流用于 prompt、知识库和评估集更新。"
    ],
    "aipm_transfer": "AI PM 不一定设计数据架构，但要知道个性化和评估都依赖高质量日志和反馈流。",
    "tags": [
      "data-architecture",
      "streaming",
      "batch"
    ],
    "priority": "P0"
  },
  {
    "number": 31,
    "chapter": "第6章 工程实现",
    "page_hint": "183-201",
    "title": "离线训练与分布式训练",
    "interview_question": "推荐模型为什么需要分布式训练？",
    "short_answer": "推荐系统数据量、特征规模和 embedding 参数量巨大，单机训练难以承载。Spark MLlib、Parameter Server、TensorFlow 等方案在数据并行、模型并行和一致性之间做权衡。",
    "key_points": [
      "Spark 适合大规模数据处理和部分传统模型训练。",
      "Parameter Server 适合大规模稀疏参数和 embedding 更新。",
      "TensorFlow 等深度框架支持计算图和分布式训练。",
      "一致性、吞吐、收敛速度和工程复杂度需要平衡。"
    ],
    "follow_ups": [
      "Parameter Server 的核心思想是什么？",
      "同步和异步训练有什么取舍？",
      "为什么 embedding 参数量会很大？"
    ],
    "project_mapping": [
      "讲清楚为什么工业推荐不是 notebook 训练一个模型那么简单。",
      "AI PM 可用它理解大模型训练/微调的工程约束。"
    ],
    "aipm_transfer": "大规模 AI 产品的瓶颈常在数据和系统，不只是算法想法。",
    "tags": [
      "distributed-training",
      "parameter-server",
      "tensorflow"
    ],
    "priority": "P1"
  },
  {
    "number": 32,
    "chapter": "第6章 工程实现",
    "page_hint": "202-206",
    "title": "推荐模型上线部署",
    "interview_question": "深度推荐模型有哪些常见上线方式？",
    "short_answer": "上线方式包括预存推荐结果或 embedding、自研在线模型服务、预训练 embedding 加轻量模型、PMML 转换、TensorFlow Serving 等。选择取决于延迟、成本、实时性和迭代效率。",
    "key_points": [
      "预存结果简单低延迟，但个性化和实时性有限。",
      "在线服务灵活但成本和稳定性要求高。",
      "预训练 embedding + 轻量模型是效果和成本折中。",
      "部署方案必须和业务 SLA、模型复杂度、团队能力匹配。"
    ],
    "follow_ups": [
      "什么时候预存推荐结果？",
      "模型服务延迟高怎么办？",
      "线上模型和离线模型不一致怎么排查？"
    ],
    "project_mapping": [
      "AI 学习推荐可先每日离线生成，再逐步加入实时排序。",
      "LLM 功能可用缓存、模型路由、异步任务降低成本。"
    ],
    "aipm_transfer": "AI PM 做方案时要问：实时调用模型是否值得？能否缓存、预计算或降级？",
    "tags": [
      "model-serving",
      "deployment",
      "latency"
    ],
    "priority": "P0"
  },
  {
    "number": 33,
    "chapter": "第6章 工程实现",
    "page_hint": "207-211",
    "title": "工程与理论的权衡",
    "interview_question": "推荐系统工程中有哪些典型取舍？",
    "short_answer": "工业推荐不是追求理论最优，而是在效果、延迟、成本、研发周期、硬件环境、稳定性和可维护性之间做系统性权衡。",
    "key_points": [
      "Redis/存储容量会限制 embedding 或结果预存方式。",
      "研发周期会影响是否选择成熟方案还是自研。",
      "硬件环境会影响模型结构和推理复杂度。",
      "局部模型提升必须服务整体系统收益。"
    ],
    "follow_ups": [
      "效果提升 1% 但成本翻倍要不要上？",
      "工程约束和算法理想冲突怎么办？",
      "如何评估一个模型改进是否值得上线？"
    ],
    "project_mapping": [
      "用一次“复杂模型不上线”的案例展示成熟判断。",
      "AI 产品中 GPT-5/小模型/缓存/规则的成本取舍。"
    ],
    "aipm_transfer": "AI PM 的核心能力之一就是把模型能力翻译成可上线、可负担、可维护的产品方案。",
    "tags": [
      "tradeoff",
      "engineering",
      "cost"
    ],
    "priority": "P0"
  },
  {
    "number": 34,
    "chapter": "第7章 推荐系统评估",
    "page_hint": "213-221",
    "title": "离线评估指标",
    "interview_question": "推荐系统有哪些常用离线评估指标？如何选择？",
    "short_answer": "离线指标包括准确率、召回率、Precision/Recall、ROC/AUC、MAP、NDCG 等。选择指标要匹配推荐场景、列表位置、用户行为和业务目标。",
    "key_points": [
      "Top-K 推荐需要关注位置和序列质量。",
      "P-R 和 ROC 适合分类/排序评估，但解释角度不同。",
      "MAP/NDCG 等指标更直接评估推荐列表。",
      "离线指标只能初筛，不能替代线上实验。"
    ],
    "follow_ups": [
      "AUC 高为什么线上可能不好？",
      "NDCG 为什么考虑位置？",
      "如何评估多样性和新颖性？"
    ],
    "project_mapping": [
      "评估知识卡推荐：点击、完成、收藏、后续答题提升。",
      "RAG 评估：召回率、证据排序、答案正确、有用率。"
    ],
    "aipm_transfer": "AI PM 要为每类 AI 功能选择任务级评估，而不是迷信一个总分。",
    "tags": [
      "offline-evaluation",
      "auc",
      "map",
      "ndcg"
    ],
    "priority": "P0"
  },
  {
    "number": 35,
    "chapter": "第7章 推荐系统评估",
    "page_hint": "222-224",
    "title": "Replay 动态离线评估",
    "interview_question": "Replay 评估为什么比普通离线评估更接近线上？",
    "short_answer": "Replay 试图按照历史真实请求顺序重放用户行为，动态模拟推荐系统在当时状态下的决策和反馈，比静态切分更接近线上环境。",
    "key_points": [
      "普通离线评估容易忽略时间顺序和反馈闭环。",
      "Replay 保留用户行为流和系统状态变化。",
      "适合评估推荐策略在时间维度上的表现。",
      "局限是仍受历史曝光偏差和反事实问题影响。"
    ],
    "follow_ups": [
      "Replay 和 A/B 测试有什么区别？",
      "历史日志偏差如何影响评估？",
      "为什么推荐评估有反事实难题？"
    ],
    "project_mapping": [
      "用历史学习日志重放卡片推荐策略。",
      "LLM 产品可重放历史问题评估新 RAG 策略。"
    ],
    "aipm_transfer": "AI 评估要尽量模拟真实使用流，而不是只在静态样例上打分。",
    "tags": [
      "replay",
      "offline-evaluation",
      "simulation"
    ],
    "priority": "P1"
  },
  {
    "number": 36,
    "chapter": "第7章 推荐系统评估",
    "page_hint": "225-228",
    "title": "A/B 测试与线上指标",
    "interview_question": "推荐系统为什么必须做 A/B 测试？",
    "short_answer": "离线评估无法完全代表真实用户行为和业务结果，A/B 测试通过随机分桶在线比较策略效果，是验证推荐系统改动是否真正有效的关键方法。",
    "key_points": [
      "分桶要随机、稳定、互斥，避免污染。",
      "线上指标要包含主指标和护栏指标。",
      "推荐系统要看短期收益和长期留存/生态影响。",
      "实验要关注统计显著性和样本量。"
    ],
    "follow_ups": [
      "A/B 分桶有哪些原则？",
      "线上评估指标如何设计？",
      "实验结果和离线结果相反怎么办？"
    ],
    "project_mapping": [
      "推荐卡片排序改动上线，用完成率和留存做实验。",
      "AI 对话答案策略用有用率、追问率、人工兜底率做 A/B。"
    ],
    "aipm_transfer": "AI PM 要能设计线上实验，否则无法证明模型或 prompt 改动有真实价值。",
    "tags": [
      "ab-test",
      "online-evaluation",
      "metrics"
    ],
    "priority": "P0"
  },
  {
    "number": 37,
    "chapter": "第7章 推荐系统评估",
    "page_hint": "229-234",
    "title": "Interleaving 快速线上评估",
    "interview_question": "Interleaving 相比传统 A/B 测试有什么优势？",
    "short_answer": "Interleaving 将两个排序结果交织展示给同一用户，通过用户点击偏好更灵敏地比较排序策略，常用于搜索/推荐排序的快速在线评估。",
    "key_points": [
      "传统 A/B 需要较大流量和较长周期。",
      "Interleaving 让两个策略面对更相似的用户上下文。",
      "适合比较排序结果，不适合所有产品改动。",
      "实现要处理展示归因、公平交织和位置偏差。"
    ],
    "follow_ups": [
      "Interleaving 如何实现？",
      "它为什么更灵敏？",
      "它有哪些局限？"
    ],
    "project_mapping": [
      "比较两个知识卡排序策略谁更能带来点击/完成。",
      "比较两个 RAG 检索排序器的用户选择偏好。"
    ],
    "aipm_transfer": "AI 产品里的排序、检索、候选答案选择可以借鉴 Interleaving 做快速偏好比较。",
    "tags": [
      "interleaving",
      "ranking-evaluation",
      "online-test"
    ],
    "priority": "P1"
  },
  {
    "number": 38,
    "chapter": "第8章 前沿实践",
    "page_hint": "237-247",
    "title": "Facebook DLRM 与 GBDT+LR",
    "interview_question": "Facebook 推荐系统实践给我们什么启发？",
    "short_answer": "Facebook 的实践体现了从 GBDT+LR 到 DLRM 的工业演进：稀疏特征、embedding、特征交互、实时数据流、降采样校正和并行训练共同构成效果。",
    "key_points": [
      "GBDT+LR 代表传统强 baseline 和特征工程模型化。",
      "DLRM 强调稀疏 embedding 与 dense 特征交互。",
      "降采样和校正处理超大规模负样本问题。",
      "工程架构和模型结构同样重要。"
    ],
    "follow_ups": [
      "CTR 预估为什么要做负采样校正？",
      "DLRM 的核心结构是什么？",
      "为什么稀疏特征是推荐工程重点？"
    ],
    "project_mapping": [
      "广告 CTR 或信息流点击预估系统设计。",
      "AI 产品中大量稀疏用户行为如何进入模型。"
    ],
    "aipm_transfer": "前沿案例告诉 AI PM：产品效果来自模型、数据流和工程系统共同优化。",
    "tags": [
      "facebook",
      "dlrm",
      "ctr"
    ],
    "priority": "P1"
  },
  {
    "number": 39,
    "chapter": "第8章 前沿实践",
    "page_hint": "247-259",
    "title": "Airbnb Embedding 实时搜索推荐",
    "interview_question": "Airbnb 如何用 Embedding 改进搜索推荐？",
    "short_answer": "Airbnb 将房源、用户和搜索词 embedding 融入实时搜索排序，结合短期兴趣、长期兴趣和特征工程提升住宿搜索推荐效果。",
    "key_points": [
      "短期兴趣来自当前 session 行为。",
      "长期兴趣来自用户历史行为和偏好。",
      "搜索词 embedding 帮助理解 query 与房源匹配。",
      "实时排序融合 embedding 特征和业务特征。"
    ],
    "follow_ups": [
      "短期兴趣和长期兴趣如何权衡？",
      "搜索推荐和普通推荐有什么不同？",
      "Embedding 如何作为排序特征？"
    ],
    "project_mapping": [
      "职位搜索/课程搜索中同时利用 query、用户历史和 item embedding。",
      "AI 素材库搜索：当前 JD query + 历史复习偏好。"
    ],
    "aipm_transfer": "AI PM 做搜索/RAG 产品时要同时理解查询意图、用户长期背景和当前任务上下文。",
    "tags": [
      "airbnb",
      "search",
      "embedding"
    ],
    "priority": "P0"
  },
  {
    "number": 40,
    "chapter": "第8章 前沿实践",
    "page_hint": "260-268",
    "title": "YouTube 双阶段推荐",
    "interview_question": "YouTube 推荐系统为什么采用候选生成和排序两阶段？",
    "short_answer": "YouTube 面对海量视频，需要先用候选生成模型快速召回几百个候选，再用排序模型精细预测观看时长等目标。两阶段架构兼顾规模、效率和精度。",
    "key_points": [
      "候选生成解决从百万/亿级内容到小候选集的问题。",
      "排序模型使用更丰富特征进行精细打分。",
      "训练样本处理和线上服务方式会影响模型目标一致性。",
      "对新视频偏好的处理体现探索和新鲜度管理。"
    ],
    "follow_ups": [
      "候选生成和排序模型训练目标是否一样？",
      "YouTube 为什么关注观看时长？",
      "如何处理新视频？"
    ],
    "project_mapping": [
      "AI 学习素材库：先召回候选卡，再按目标岗位和薄弱点排序。",
      "内容产品推荐系统设计题可以直接套两阶段框架。"
    ],
    "aipm_transfer": "两阶段推荐和 RAG 很像：先召回候选知识，再精排并生成用户可消费结果。",
    "tags": [
      "youtube",
      "candidate-generation",
      "ranking"
    ],
    "priority": "P0"
  },
  {
    "number": 41,
    "chapter": "第8章 前沿实践",
    "page_hint": "268-276",
    "title": "阿里巴巴推荐模型演进",
    "interview_question": "阿里推荐模型从 DIN 到 DIEN 等演进背后的主线是什么？",
    "short_answer": "阿里模型演进主线是问题驱动：围绕电商用户行为和兴趣建模，从注意力激活兴趣，到序列兴趣演化，再到更长行为、多目标和系统架构协同。",
    "key_points": [
      "DIN 关注候选商品对历史兴趣的激活。",
      "DIEN 关注兴趣随时间演化。",
      "更复杂模型需要模型服务和系统架构配套。",
      "工业演进不是论文堆叠，而是围绕业务数据特点设计。"
    ],
    "follow_ups": [
      "DIN/DIEN 为什么适合电商？",
      "模型演进如何与工程架构协同？",
      "如何判断下一代模型该解决什么问题？"
    ],
    "project_mapping": [
      "讲一个从业务行为观察到模型结构改进的案例。",
      "AI PM 可类比：从单轮问答到长期记忆、任务序列和工具链。"
    ],
    "aipm_transfer": "AI 产品模型演进应从用户任务和失败模式出发，而不是简单追最新模型名词。",
    "tags": [
      "alibaba",
      "din",
      "dien",
      "model-evolution"
    ],
    "priority": "P0"
  },
  {
    "number": 42,
    "chapter": "第9章 知识框架",
    "page_hint": "279-285",
    "title": "推荐工程师的四项能力",
    "interview_question": "优秀推荐工程师需要哪些核心能力？",
    "short_answer": "推荐工程师需要算法能力、工程能力、业务理解能力和数据分析/实验能力。推荐系统是强业务、强数据、强工程的综合领域。",
    "key_points": [
      "算法能力：理解模型、特征、召回、排序和优化目标。",
      "工程能力：数据流、训练、服务、延迟和系统稳定性。",
      "业务能力：理解用户行为、商业目标和场景约束。",
      "实验能力：离线评估、A/B 测试、归因和复盘。"
    ],
    "follow_ups": [
      "推荐工程师和普通算法工程师有什么不同？",
      "能力的深度和广度如何平衡？",
      "AI PM 需要掌握到什么程度？"
    ],
    "project_mapping": [
      "把自己的 AI PM 能力映射到算法、工程、业务、实验四格。",
      "为一个推荐系统项目分配 PM、算法、工程、数据职责。"
    ],
    "aipm_transfer": "AI PM 不必成为推荐工程师，但要能和这些角色对话，理解每项能力对应的产品风险。",
    "tags": [
      "career",
      "recsys-engineer",
      "aipm"
    ],
    "priority": "P0"
  },
  {
    "number": 43,
    "chapter": "全书综合",
    "page_hint": "全书",
    "title": "推荐系统面试系统设计框架",
    "interview_question": "如果面试问“设计一个推荐系统”，应该如何回答？",
    "short_answer": "先明确业务目标和场景，再拆用户/物品/行为数据，设计召回、排序、策略、评估和工程架构，最后讨论冷启动、实时性、探索、多目标和成本。",
    "key_points": [
      "Step 1：业务目标和主指标/护栏指标。",
      "Step 2：数据来源、特征和日志闭环。",
      "Step 3：多路召回、精排、重排和策略层。",
      "Step 4：离线评估、A/B、监控和迭代。",
      "Step 5：冷启动、实时性、探索与利用、工程成本。"
    ],
    "follow_ups": [
      "如何设计短视频推荐？",
      "如何设计电商猜你喜欢？",
      "如何设计 AI 学习内容推荐？"
    ],
    "project_mapping": [
      "直接作为系统设计面试答题框架。",
      "改造成 RAG/Agent 候选工具推荐系统设计。"
    ],
    "aipm_transfer": "AI PM 可用推荐系统框架回答个性化 AI 产品：谁、推荐什么、为什么、怎么评估、怎么避免坏结果。",
    "tags": [
      "system-design",
      "interview",
      "framework"
    ],
    "priority": "P0"
  },
  {
    "number": 44,
    "chapter": "全书综合",
    "page_hint": "全书",
    "title": "推荐系统对 AI PM 的价值",
    "interview_question": "AI PM 为什么要学习推荐系统？",
    "short_answer": "推荐系统是个性化、行为建模、实验评估、实时反馈和工程权衡的成熟样板。AI PM 学推荐系统，不是为了背模型，而是学习如何把用户行为转化为持续优化的智能产品。",
    "key_points": [
      "个性化 AI 需要用户画像、兴趣建模和上下文理解。",
      "RAG 与推荐共享召回、排序、embedding 和评估问题。",
      "Agent 任务编排也需要候选工具/动作选择。",
      "推荐系统的 A/B、Replay、Interleaving 能启发 AI eval。",
      "成本、延迟、实时性和多目标是 AI 产品共同约束。"
    ],
    "follow_ups": [
      "推荐系统和 RAG 有哪些相似点？",
      "LLM 产品如何做个性化？",
      "如何避免 AI 推荐造成信息茧房或错误强化？"
    ],
    "project_mapping": [
      "把面试素材库做成个性化学习推荐系统。",
      "为企业 AI 助手推荐下一步操作、文档、专家或工具。"
    ],
    "aipm_transfer": "这本书可作为 AI PM 的“个性化系统课”：从模型思维升级到产品-数据-工程-评估闭环。",
    "tags": [
      "aipm",
      "personalization",
      "study-plan"
    ],
    "priority": "P0"
  }
]
