[
  {
    "number": 1,
    "chapter": "第一部分 系统1，系统2 / 第1章",
    "page_hint": "MOBI 章节",
    "title": "系统1与系统2",
    "interview_question": "如何用系统1和系统2解释用户决策？",
    "short_answer": "系统1快速、自动、凭印象运行；系统2缓慢、费力、负责计算、抑制和校验。很多产品决策不是用户充分理性选择，而是系统1先给出印象，系统2再在少数关键时刻介入。",
    "key_points": [
      "系统1擅长模式识别、情绪反应、直觉判断，但容易受语境和偏见影响。",
      "系统2擅长推理、计算、比较和规则执行，但注意力成本高，常常偷懒。",
      "产品体验不能假设用户每一步都在深思熟虑，要为默认、反馈和误操作设计护栏。"
    ],
    "follow_ups": [
      "系统1一定是不可靠吗？",
      "什么时候应该激活用户的系统2？",
      "这个模型和双流程决策有什么关系？"
    ],
    "project_mapping": [
      "解释为什么复杂设置页转化低：用户没有足够系统2资源理解选项。",
      "把 AI 面试工具的默认推荐、确认弹窗和复盘报告分别映射到系统1/系统2。"
    ],
    "aipm_transfer": "AI PM 设计 Agent 工作流时，要知道用户常用直觉授权模型行动，关键高风险动作必须让系统2介入确认。",
    "tags": [
      "system-1",
      "system-2",
      "decision-design"
    ],
    "priority": "P0"
  },
  {
    "number": 2,
    "chapter": "第一部分 / 第2章",
    "page_hint": "MOBI 章节",
    "title": "注意力是一种稀缺资源",
    "interview_question": "为什么产品设计要把注意力当作成本？",
    "short_answer": "系统2依赖注意力，任何需要用户比较、计算、记忆或抑制冲动的任务都会消耗认知资源。好的产品把高价值判断留给用户，把低价值负担交给系统。",
    "key_points": [
      "注意力被分散时，复杂推理质量会明显下降。",
      "同一页面的信息密度、视觉层级和操作数量都会影响决策质量。",
      "用户不是不愿意思考，而是不愿意为不重要的问题思考。"
    ],
    "follow_ups": [
      "如何判断一个流程是否认知负担过高？",
      "为什么 onboarding 不宜一次讲完所有功能？",
      "注意力成本和转化率有什么关系？"
    ],
    "project_mapping": [
      "为简历优化工具设计分步表单，把一次性输入拆成可保存的小任务。",
      "用埋点观察用户在哪些步骤停留、返回或放弃。"
    ],
    "aipm_transfer": "LLM 产品要把复杂推理封装成中间过程，只把选择、审批和解释暴露给用户。",
    "tags": [
      "attention",
      "cognitive-load",
      "ux"
    ],
    "priority": "P0"
  },
  {
    "number": 3,
    "chapter": "第一部分 / 第3章",
    "page_hint": "MOBI 章节",
    "title": "惰性系统2与认知反射",
    "interview_question": "为什么聪明人也会犯简单判断错误？",
    "short_answer": "系统2有能力纠错，但经常因为懒惰、疲劳或自信而接受系统1的第一反应。很多错误不是能力不足，而是没有触发校验。",
    "key_points": [
      "直觉答案越顺滑，越容易绕过系统2检查。",
      "压力、时间限制和低动机会让人更依赖快速反应。",
      "校验机制可以外化为清单、反例提问、二次确认或同行评审。"
    ],
    "follow_ups": [
      "如何在团队决策里减少拍脑袋？",
      "为什么 checklist 能提高复杂任务质量？",
      "面试中如何展示你能主动纠偏？"
    ],
    "project_mapping": [
      "把 PRD 评审设计成风险清单：目标、假设、反例、指标、上线条件。",
      "在 AI 生成结论后要求模型列出不确定性和可证伪点。"
    ],
    "aipm_transfer": "Agent 不应该只给答案，还应该在高风险场景自动生成反例、边界条件和置信度。",
    "tags": [
      "lazy-system-2",
      "checklist",
      "review"
    ],
    "priority": "P0"
  },
  {
    "number": 4,
    "chapter": "第一部分 / 第4章",
    "page_hint": "MOBI 章节",
    "title": "联想一致性",
    "interview_question": "联想机制如何影响用户对产品的第一印象？",
    "short_answer": "系统1会自动把当前线索组织成一个连贯故事，颜色、措辞、价格、品牌和前一屏内容都会改变用户对同一信息的理解。",
    "key_points": [
      "人会倾向于把分散线索解释成一致叙事。",
      "语境会改变同一个功能、价格或风险提示的感受。",
      "品牌信任、视觉质感和文案语气会放大或削弱功能判断。"
    ],
    "follow_ups": [
      "联想一致性和品牌定位有什么关系？",
      "为什么同样的 AI 功能在不同入口下接受度不同？",
      "如何避免文案误导用户？"
    ],
    "project_mapping": [
      "对比“自动改简历”和“生成修改建议”两个入口对用户信任的影响。",
      "为付费页设计强调安全、可控、可撤回的语境。"
    ],
    "aipm_transfer": "AI PM 要管理模型能力带来的联想：越像自动决策，越要补充可控性和解释。",
    "tags": [
      "association",
      "framing",
      "trust"
    ],
    "priority": "P1"
  },
  {
    "number": 5,
    "chapter": "第一部分 / 第5章",
    "page_hint": "MOBI 章节",
    "title": "认知放松与真实感",
    "interview_question": "为什么顺畅的信息更容易让人相信？",
    "short_answer": "易读、熟悉、重复、情绪正向的信息会带来认知放松，用户更容易把这种顺畅感误认为可信、简单或正确。",
    "key_points": [
      "视觉清晰、语言简单和重复曝光都会提高接受度。",
      "认知放松有助于转化，但也可能制造虚假确定感。",
      "关键风险信息不能只追求顺滑，还要保证可理解和可追溯。"
    ],
    "follow_ups": [
      "认知放松和错觉性真实有什么关系？",
      "为什么复杂条款需要结构化展示？",
      "如何平衡易用性与真实风险？"
    ],
    "project_mapping": [
      "把 AI 结果页拆成结论、证据、限制、下一步，而不是只给流畅总结。",
      "对价格、隐私和自动执行权限做显著展示。"
    ],
    "aipm_transfer": "LLM 输出天然流畅，AI PM 需要额外设计证据、来源和不确定性，防止用户把流畅当准确。",
    "tags": [
      "cognitive-ease",
      "trust",
      "llm-output"
    ],
    "priority": "P0"
  },
  {
    "number": 6,
    "chapter": "第一部分 / 第6-7章",
    "page_hint": "MOBI 章节",
    "title": "眼见即为事实 WYSIATI",
    "interview_question": "WYSIATI 对产品和面试有什么启发？",
    "short_answer": "人们倾向于基于眼前可见信息形成完整判断，忽略没有出现的信息。产品、数据分析和面试表达都要主动补齐缺失变量。",
    "key_points": [
      "系统1会快速构造连贯故事，不会自然提醒你缺了哪些证据。",
      "单一案例、漂亮 demo 或短期数据很容易被过度解释。",
      "好的判断要问：我没有看到什么？样本是否代表整体？是否有替代解释？"
    ],
    "follow_ups": [
      "WYSIATI 和过度自信有什么关系？",
      "如何避免只看 dashboard 上已有指标？",
      "面试项目复盘怎么讲数据局限？"
    ],
    "project_mapping": [
      "在增长实验复盘里补充样本量、置信区间、分群和反事实。",
      "为 Agent 评测补“未覆盖任务类型”和失败案例库。"
    ],
    "aipm_transfer": "AI PM 面对模型评测时尤其要警惕只看成功样例，必须建立失败集、对照组和覆盖率视角。",
    "tags": [
      "wysiati",
      "evidence",
      "evaluation"
    ],
    "priority": "P0"
  },
  {
    "number": 7,
    "chapter": "第一部分 / 第8章",
    "page_hint": "MOBI 章节",
    "title": "判断是把复杂问题变简单",
    "interview_question": "用户为什么会用替代问题来做判断？",
    "short_answer": "当目标问题难以回答时，系统1会替换成一个更容易的问题。例如不回答“这个产品长期有价值吗”，而回答“这个 demo 看起来酷吗”。",
    "key_points": [
      "替代问题让决策更快，但可能偏离真正目标。",
      "情绪、熟悉度、最近案例和视觉冲击常被当作价值判断的代理变量。",
      "产品指标要尽量把目标问题外化，减少错误代理。"
    ],
    "follow_ups": [
      "替代问题和启发式有什么关系？",
      "如何识别团队正在优化错误代理指标？",
      "AI 产品里最常见的替代问题是什么？"
    ],
    "project_mapping": [
      "把“生成内容好不好”拆成正确性、可执行性、采纳率、后续效果。",
      "面试中说明你如何从漂亮指标追问到真实业务结果。"
    ],
    "aipm_transfer": "LLM 评测不能只用主观好感或流畅度替代任务成功率，要把真实任务完成定义清楚。",
    "tags": [
      "judgment",
      "proxy-metric",
      "heuristic"
    ],
    "priority": "P0"
  },
  {
    "number": 8,
    "chapter": "第一部分 / 第9章",
    "page_hint": "MOBI 章节",
    "title": "情感启发式",
    "interview_question": "情感如何影响风险与收益判断？",
    "short_answer": "当人们喜欢某个方案时，会倾向于同时认为它收益高、风险低、成本小；当不喜欢时则相反。情感常把多维判断压缩成单一好恶。",
    "key_points": [
      "喜欢会降低风险感知，不喜欢会放大风险感知。",
      "团队讨论中，对人、品牌或技术路线的态度会污染事实判断。",
      "要把收益、成本、风险、可逆性分别评估，而不是合成一句感觉。"
    ],
    "follow_ups": [
      "如何在评审中拆开情感和事实？",
      "为什么明星技术方案容易被高估？",
      "怎样设计反方角色？"
    ],
    "project_mapping": [
      "在选型表中分列准确率、成本、延迟、可维护性、合规风险。",
      "让 AI 工具对每个方案生成支持理由和反对理由。"
    ],
    "aipm_transfer": "AI PM 容易被新模型、新范式吸引；要用结构化评估压住情感启发式。",
    "tags": [
      "affect-heuristic",
      "risk",
      "tradeoff"
    ],
    "priority": "P0"
  },
  {
    "number": 9,
    "chapter": "第二部分 / 第10章",
    "page_hint": "MOBI 章节",
    "title": "小数定律",
    "interview_question": "为什么小样本会误导产品判断？",
    "short_answer": "人们容易相信小样本也能代表总体，于是把少量用户反馈、短期实验波动或个案成功当成稳定规律。",
    "key_points": [
      "小样本更容易出现极端结果。",
      "直觉会低估随机波动，过早解释噪声。",
      "决策前要看样本量、抽样方式、分群一致性和重复验证。"
    ],
    "follow_ups": [
      "A/B 测试为什么不能太早停？",
      "用户访谈和量化数据怎样互补？",
      "如何避免从一个客户推全市场？"
    ],
    "project_mapping": [
      "把面试素材库的早期用户反馈标注为探索性证据，而不是结论。",
      "为 prompt 改动建立固定测试集和多轮重复。"
    ],
    "aipm_transfer": "AI PM 做 eval 时要重视样本覆盖，不要用几个手挑 case 判断模型能力。",
    "tags": [
      "small-sample",
      "ab-test",
      "evaluation"
    ],
    "priority": "P0"
  },
  {
    "number": 10,
    "chapter": "第二部分 / 第11章",
    "page_hint": "MOBI 章节",
    "title": "锚定效应",
    "interview_question": "锚定效应如何影响定价、谈判和评估？",
    "short_answer": "先出现的数字、选项或参照物会成为后续判断的锚。即使锚明显随意，人们的调整也常常不足。",
    "key_points": [
      "锚可以来自价格、目标、默认值、上轮结果或竞品叙事。",
      "锚定既可能来自系统2的不足调整，也可能来自系统1的联想暗示。",
      "应对锚定要先独立估计，再看外部参照。"
    ],
    "follow_ups": [
      "如何用锚定解释 SaaS 价格页？",
      "目标设定会怎样锚定团队判断？",
      "面试谈薪如何避免被第一口价牵着走？"
    ],
    "project_mapping": [
      "定价页把推荐套餐放在中间，用高价企业版形成参照。",
      "项目排期先看历史同类项目，而不是只看老板期望日期。"
    ],
    "aipm_transfer": "Agent 给计划时如果先给过短工期，会锚定用户预期；AI PM 应要求模型展示乐观、基准、悲观三档估计。",
    "tags": [
      "anchoring",
      "pricing",
      "planning"
    ],
    "priority": "P0"
  },
  {
    "number": 11,
    "chapter": "第二部分 / 第12章",
    "page_hint": "MOBI 章节",
    "title": "可得性启发",
    "interview_question": "为什么最近发生的事会被高估？",
    "short_answer": "越容易被想起的事件，越容易被判断为常见或重要。媒体曝光、个人经历和生动案例都会改变风险感知。",
    "key_points": [
      "可得性不是频率本身，而是回忆难易度。",
      "近期事故、极端案例和身边故事会放大风险或机会判断。",
      "产品决策要把案例直觉和真实基准率分开。"
    ],
    "follow_ups": [
      "如何用数据校正可得性偏见？",
      "为什么客服声音可能被过度放大？",
      "舆情如何影响产品优先级？"
    ],
    "project_mapping": [
      "把高声量用户反馈和全量行为数据并列展示。",
      "复盘线上事故时区分发生概率、影响范围和恢复能力。"
    ],
    "aipm_transfer": "AI PM 不能只根据最近一次模型翻车决定路线，要建立稳定错误分类和长期趋势。",
    "tags": [
      "availability",
      "risk",
      "feedback"
    ],
    "priority": "P0"
  },
  {
    "number": 12,
    "chapter": "第二部分 / 第13章",
    "page_hint": "MOBI 章节",
    "title": "可得性级联与风险政策",
    "interview_question": "公共风险为什么会被情绪和传播放大？",
    "short_answer": "当一个风险故事容易传播并被反复提及，社会关注会反过来强化它的重要性，形成可得性级联。风险治理需要事实、情绪和沟通一起设计。",
    "key_points": [
      "风险感知受生动性、媒体频率和群体情绪影响。",
      "团队里也会出现内部级联：一个失败案例被反复引用，压倒统计证据。",
      "风险政策要预先定义分级、阈值、响应和复盘机制。"
    ],
    "follow_ups": [
      "舆情风险和真实风险如何区分？",
      "产品安全事件应该怎样沟通？",
      "为什么风险治理不能只靠数据表？"
    ],
    "project_mapping": [
      "为 AI 简历建议设置敏感内容分级和人工升级流程。",
      "在发布说明中同时解释收益、限制和用户可控手段。"
    ],
    "aipm_transfer": "AI 产品的错误很容易被截图传播，PM 要预先设计风险沟通和可恢复机制。",
    "tags": [
      "availability-cascade",
      "risk-policy",
      "communication"
    ],
    "priority": "P1"
  },
  {
    "number": 13,
    "chapter": "第二部分 / 第14章",
    "page_hint": "MOBI 章节",
    "title": "典型性与基础比率",
    "interview_question": "为什么典型故事会压过基础概率？",
    "short_answer": "人们喜欢用相似性判断概率，看到一个人或案例像某类对象，就容易忽略基础比率和样本结构。",
    "key_points": [
      "典型性有助于快速分类，但不等于概率。",
      "低基础率事件即使描述很像，也未必更可能发生。",
      "面试和招聘中尤其要警惕用刻板画像替代证据。"
    ],
    "follow_ups": [
      "基础比率在商业判断里是什么？",
      "用户画像和刻板印象有什么区别？",
      "如何避免看起来像成功案例就复制？"
    ],
    "project_mapping": [
      "评估候选人时先定义岗位成功基准，再看个人故事。",
      "为用户分群加入真实转化率，不只看画像标签。"
    ],
    "aipm_transfer": "AI PM 做用户画像生成时，要避免模型把“像某类人”的描述当成可靠预测。",
    "tags": [
      "base-rate",
      "representativeness",
      "segmentation"
    ],
    "priority": "P0"
  },
  {
    "number": 14,
    "chapter": "第二部分 / 第15章",
    "page_hint": "MOBI 章节",
    "title": "合取谬误",
    "interview_question": "琳达问题说明了什么判断错误？",
    "short_answer": "当一个描述很有代表性时，人们会判断“具体且丰富的联合事件”比“更宽泛事件”更可能发生，违反概率逻辑。",
    "key_points": [
      "故事越连贯，不代表概率越高。",
      "细节会提高可信感，却会降低联合事件的真实概率。",
      "面试表达要会区分叙事说服力和概率合理性。"
    ],
    "follow_ups": [
      "为什么越具体的预测越要谨慎？",
      "路线图承诺中哪里容易出现合取谬误？",
      "如何审查 AI 生成的因果故事？"
    ],
    "project_mapping": [
      "对市场判断做概率拆解：目标用户、触达、激活、留存分别估计。",
      "让模型把一个复杂结论拆成多个必要条件和失败点。"
    ],
    "aipm_transfer": "LLM 很擅长生成连贯故事，AI PM 要防止故事细节掩盖概率乘法。",
    "tags": [
      "conjunction-fallacy",
      "probability",
      "story"
    ],
    "priority": "P1"
  },
  {
    "number": 15,
    "chapter": "第二部分 / 第16章",
    "page_hint": "MOBI 章节",
    "title": "因果故事压过统计信息",
    "interview_question": "为什么个体案例比统计数据更能说服人？",
    "short_answer": "系统1偏好因果故事，抽象统计信息如果不能嵌入具体机制，就很难改变直觉判断。",
    "key_points": [
      "基础率是冷信息，个体案例更容易触发因果解释。",
      "培训、汇报和产品教育要把统计结论转化成可想象的场景。",
      "但个案只是帮助理解，不应取代整体数据。"
    ],
    "follow_ups": [
      "如何让数据报告更有说服力？",
      "为什么用户故事和 dashboard 都需要？",
      "怎样避免被单个案例带偏？"
    ],
    "project_mapping": [
      "汇报模型错误时同时展示整体错误率和典型失败案例。",
      "用用户旅程解释留存下降背后的机制。"
    ],
    "aipm_transfer": "AI PM 做评测报告要把数据、样例和机制连起来，不能只给分数或只讲故事。",
    "tags": [
      "causal-story",
      "statistics",
      "reporting"
    ],
    "priority": "P0"
  },
  {
    "number": 16,
    "chapter": "第二部分 / 第17章",
    "page_hint": "MOBI 章节",
    "title": "回归平均值",
    "interview_question": "为什么极端表现后常常会回落？",
    "short_answer": "表现由能力和运气共同决定，极端好或坏的结果往往包含运气成分，下一次更可能向平均水平回归。",
    "key_points": [
      "把随机波动解释成管理动作会导致错误奖惩。",
      "实验指标突然变好或变差，都要检查样本、季节性和回归效应。",
      "连续观察比单点结论更可靠。"
    ],
    "follow_ups": [
      "为什么明星员工下一次可能没那么亮眼？",
      "如何避免把一次实验胜利神化？",
      "回归平均值和因果误判有什么关系？"
    ],
    "project_mapping": [
      "复盘模型版本时看多批测试集，而不是只看一次榜单结果。",
      "销售或运营激励要区分过程质量和偶然结果。"
    ],
    "aipm_transfer": "AI eval 中的单次分数波动很常见，PM 要看置信区间和多轮均值。",
    "tags": [
      "regression-to-mean",
      "metrics",
      "causality"
    ],
    "priority": "P0"
  },
  {
    "number": 17,
    "chapter": "第二部分 / 第18章",
    "page_hint": "MOBI 章节",
    "title": "校正直觉预测",
    "interview_question": "怎样让直觉预测更可靠？",
    "short_answer": "先确定基础水平，再根据证据强度做有限调整。不要直接从印象跳到极端预测。",
    "key_points": [
      "预测应从基准率出发，而不是从故事出发。",
      "证据质量越弱，调整越小。",
      "要把预测和愿望、好恶、单个特征区分开。"
    ],
    "follow_ups": [
      "招聘面试中如何做结构化评分？",
      "项目 ROI 预测如何避免过度乐观？",
      "为什么要先看同类项目历史？"
    ],
    "project_mapping": [
      "候选人评估先设定岗位胜任基准，再按证据加减分。",
      "上线前预测采用历史功能留存作为 base case。"
    ],
    "aipm_transfer": "让 Agent 预测效果时，应强制它引用基准数据和调整理由，而不是只给主观判断。",
    "tags": [
      "prediction",
      "base-rate",
      "calibration"
    ],
    "priority": "P0"
  },
  {
    "number": 18,
    "chapter": "第三部分 / 第19章",
    "page_hint": "MOBI 章节",
    "title": "理解错觉与后见之明",
    "interview_question": "为什么事后看起来一切都很明显？",
    "short_answer": "人们会把复杂、不确定的过程压缩成连贯故事，结果一旦发生，就觉得早该预见。这会伤害复盘质量。",
    "key_points": [
      "后见之明会高估过去信息的清晰度。",
      "结果偏见会让人用成败评价当时决策质量。",
      "好复盘要恢复事前信息状态，记录当时假设和不确定性。"
    ],
    "follow_ups": [
      "复盘为什么不能只问谁对谁错？",
      "如何区分坏决策和坏结果？",
      "面试中怎么讲失败项目更高级？"
    ],
    "project_mapping": [
      "建立决策日志：目标、备选方案、证据、风险、预期指标。",
      "事故复盘按时间线还原当时可见信息。"
    ],
    "aipm_transfer": "AI PM 要保留模型选型和 prompt 变更的决策记录，避免事后用结果重写历史。",
    "tags": [
      "hindsight",
      "decision-log",
      "retrospective"
    ],
    "priority": "P0"
  },
  {
    "number": 19,
    "chapter": "第三部分 / 第20章",
    "page_hint": "MOBI 章节",
    "title": "有效性错觉",
    "interview_question": "为什么专家预测常常过度自信？",
    "short_answer": "只要故事连贯、判断过程熟悉，人们就会产生强烈的有效性感，即使环境本身噪声很大、反馈不足，预测也未必可靠。",
    "key_points": [
      "信心更多来自叙事连贯性，不一定来自预测准确性。",
      "高噪声环境中，主观专业感可能无法转化为稳定预测。",
      "要用历史命中率和校准曲线检验预测能力。"
    ],
    "follow_ups": [
      "什么时候专家直觉不可靠？",
      "如何评价行业顾问或大模型给出的预测？",
      "为什么要记录预测而不是只听结论？"
    ],
    "project_mapping": [
      "对需求优先级预测建立命中率复盘。",
      "让模型输出概率，并在后续验证校准情况。"
    ],
    "aipm_transfer": "LLM 的语气会制造有效性错觉，产品必须把置信、证据和可验证下一步呈现出来。",
    "tags": [
      "illusion-of-validity",
      "forecasting",
      "confidence"
    ],
    "priority": "P0"
  },
  {
    "number": 20,
    "chapter": "第三部分 / 第21章",
    "page_hint": "MOBI 章节",
    "title": "公式优于自由判断",
    "interview_question": "为什么简单模型有时胜过专家直觉？",
    "short_answer": "在可量化、重复性高的判断任务中，稳定规则常常比人类临场判断更可靠，因为它减少噪声、情绪和不一致标准。",
    "key_points": [
      "人类判断容易受当天状态、顺序和无关线索影响。",
      "简单模型的优势来自一致性，不一定来自复杂性。",
      "专家价值更适合用来选择变量、定义规则和处理例外。"
    ],
    "follow_ups": [
      "招聘打分为什么要结构化？",
      "什么时候不该完全依赖模型？",
      "公式判断和人类判断如何结合？"
    ],
    "project_mapping": [
      "设计候选人筛选评分卡：硬条件、项目匹配、沟通证据、风险项。",
      "对用户反馈优先级用影响范围、紧急度、战略价值打分。"
    ],
    "aipm_transfer": "AI PM 可用 LLM 协助信息提取，但最终排序规则应透明、可复核、可调参。",
    "tags": [
      "algorithmic-judgment",
      "scoring",
      "structured-decision"
    ],
    "priority": "P0"
  },
  {
    "number": 21,
    "chapter": "第三部分 / 第22章",
    "page_hint": "MOBI 章节",
    "title": "可信专家直觉的条件",
    "interview_question": "什么时候可以相信专家直觉？",
    "short_answer": "专家直觉可靠需要两个条件：环境有足够稳定的规律，且专家获得过大量、及时、清晰的反馈。缺一不可。",
    "key_points": [
      "棋手、医生在部分场景中能形成有效模式识别。",
      "长期预测、战略判断和高度变化市场往往反馈稀疏且噪声大。",
      "要区分熟练技能的直觉和解释性很强的自信叙事。"
    ],
    "follow_ups": [
      "产品经理的直觉哪些可靠，哪些不可靠？",
      "AI 评测专家的经验边界在哪里？",
      "如何判断一个领域是否适合机器学习？"
    ],
    "project_mapping": [
      "客服质检、简历结构识别这类高重复任务适合沉淀规则和模型。",
      "新市场战略更需要实验和外部数据，而不是只靠专家拍板。"
    ],
    "aipm_transfer": "选择 Agent 自动化场景时，看任务是否有稳定规律和可反馈闭环。",
    "tags": [
      "expert-intuition",
      "feedback",
      "automation"
    ],
    "priority": "P0"
  },
  {
    "number": 22,
    "chapter": "第三部分 / 第23章",
    "page_hint": "MOBI 章节",
    "title": "外部视角与规划谬误",
    "interview_question": "为什么项目计划总是过于乐观？",
    "short_answer": "团队常用内部视角想象自己的计划路径，忽略同类项目的历史分布，于是低估时间、成本和风险。",
    "key_points": [
      "内部视角聚焦当前项目的独特故事。",
      "外部视角先看参照类项目的真实结果。",
      "规划时要先找 base rate，再讨论本项目为何会更好或更差。"
    ],
    "follow_ups": [
      "如何用外部视角做排期？",
      "为什么 OKR 常被高估？",
      "面试怎么讲你管理不确定性？"
    ],
    "project_mapping": [
      "上线计划先统计过去 10 个相似功能的平均周期和延期原因。",
      "给 AI 项目加入数据质量、评测、合规和灰度缓冲。"
    ],
    "aipm_transfer": "AI 项目尤其容易被 demo 锚定，PM 要用外部视角把工程化、评估和运营成本补进去。",
    "tags": [
      "outside-view",
      "planning-fallacy",
      "project-management"
    ],
    "priority": "P0"
  },
  {
    "number": 23,
    "chapter": "第三部分 / 第24章",
    "page_hint": "MOBI 章节",
    "title": "乐观偏见与预演失败",
    "interview_question": "乐观主义为什么既有价值又危险？",
    "short_answer": "乐观能推动创业和创新，但也会导致忽视基础率、低估竞争和执行风险。预演失败能在不打击行动力的情况下暴露风险。",
    "key_points": [
      "乐观偏见有助于启动高不确定项目。",
      "危险在于把愿望当预测，把计划当现实。",
      "premortem 可以让团队先假设失败，再倒推原因。"
    ],
    "follow_ups": [
      "如何在团队里做 premortem？",
      "乐观和鲁莽怎么区分？",
      "为什么创业项目需要风险清单？"
    ],
    "project_mapping": [
      "在发布 AI 功能前列出 10 个可能失败原因：质量、成本、延迟、误用、合规、冷启动等。",
      "面试中展示你既能推进，也能管理风险。"
    ],
    "aipm_transfer": "AI PM 要保护探索性，同时建立失败预案、灰度策略和停机标准。",
    "tags": [
      "optimism-bias",
      "premortem",
      "risk"
    ],
    "priority": "P0"
  },
  {
    "number": 24,
    "chapter": "第四部分 / 第25章",
    "page_hint": "MOBI 章节",
    "title": "参照点而非绝对财富",
    "interview_question": "为什么同样结果在不同背景下感受不同？",
    "short_answer": "人们评价结果通常不是看绝对状态，而是相对参照点的变化。产品体验中的升级、降级、补偿和涨价都受参照点影响。",
    "key_points": [
      "参照点可以是现状、预期、承诺、历史价格或竞品。",
      "同样的优惠或损失，在不同参照点下感受完全不同。",
      "管理预期就是管理未来满意度的参照点。"
    ],
    "follow_ups": [
      "为什么免费额度调整会引发强烈反应？",
      "SaaS 涨价如何降低损失感？",
      "参照点和用户满意度有什么关系？"
    ],
    "project_mapping": [
      "把套餐变更解释为新增价值与迁移保护，而不是单纯涨价。",
      "对 AI 积分消耗提供历史用量和剩余额度参照。"
    ],
    "aipm_transfer": "AI 产品定价和限额设计要重视用户已形成的默认预期。",
    "tags": [
      "reference-point",
      "pricing",
      "expectation"
    ],
    "priority": "P0"
  },
  {
    "number": 25,
    "chapter": "第四部分 / 第26章",
    "page_hint": "MOBI 章节",
    "title": "前景理论",
    "interview_question": "前景理论对产品决策有什么意义？",
    "short_answer": "前景理论强调人们围绕参照点评价得失，损失影响大于收益，且对概率的主观权重并不线性。这比完全理性的期望效用更贴近日常选择。",
    "key_points": [
      "价值函数通常对损失更陡峭。",
      "边际感受递减：同样金额在不同基线上影响不同。",
      "小概率事件会被过度权重，高概率事件也可能被情绪化处理。"
    ],
    "follow_ups": [
      "前景理论和损失厌恶是什么关系？",
      "为什么用户更害怕失去已有权益？",
      "如何用它解释保险和抽奖？"
    ],
    "project_mapping": [
      "会员权益页突出“避免错过”和“保留权益”的影响，但避免恐吓式文案。",
      "AI 自动化开关默认关闭高风险动作，降低潜在损失感。"
    ],
    "aipm_transfer": "AI PM 设计授权、付费、召回和补偿时，要围绕得失感而不是名义价值设计。",
    "tags": [
      "prospect-theory",
      "loss-aversion",
      "behavioral-economics"
    ],
    "priority": "P0"
  },
  {
    "number": 26,
    "chapter": "第四部分 / 第27章",
    "page_hint": "MOBI 章节",
    "title": "禀赋效应",
    "interview_question": "为什么拥有之后就更不愿放弃？",
    "short_answer": "一旦用户把某个权益、数据、配置或成果视为自己的，放弃它会被感受为损失，因此要求的补偿往往高于获得前愿意支付的价格。",
    "key_points": [
      "拥有感会改变参照点。",
      "迁移、降级、删除和配额回收都会触发损失厌恶。",
      "给用户控制感、备份和过渡期能降低抵触。"
    ],
    "follow_ups": [
      "为什么试用期结束容易流失或投诉？",
      "如何设计数据迁移和降级？",
      "禀赋效应和留存有什么关系？"
    ],
    "project_mapping": [
      "让用户在试用期内生成自己的简历版本和学习记录，增强拥有感。",
      "取消订阅时保留只读访问或导出能力。"
    ],
    "aipm_transfer": "AI 生成资产一旦成为用户作品，产品要尊重可导出、可恢复和可追踪。",
    "tags": [
      "endowment-effect",
      "retention",
      "ownership"
    ],
    "priority": "P1"
  },
  {
    "number": 27,
    "chapter": "第四部分 / 第28章",
    "page_hint": "MOBI 章节",
    "title": "公平性与交易参照点",
    "interview_question": "为什么合理涨价也会被认为不公平？",
    "short_answer": "人们会用既有价格、成本、关系和情境形成公平参照点。企业如果只从供需出发，而忽视用户的公平感，会伤害信任。",
    "key_points": [
      "公平判断不等同于经济理性最大化。",
      "利用短期稀缺牟利容易被用户惩罚。",
      "解释成本变化、提供过渡和差异化选择能缓和公平冲突。"
    ],
    "follow_ups": [
      "平台抽佣调整为什么敏感？",
      "AI 工具涨价时应该怎么沟通？",
      "公平感和长期品牌有什么关系？"
    ],
    "project_mapping": [
      "对老用户提供 grandfather plan 或迁移优惠。",
      "在成本上涨时解释模型成本、能力提升和可选套餐。"
    ],
    "aipm_transfer": "AI PM 要把算力成本、用户感知价值和公平叙事一起纳入商业化设计。",
    "tags": [
      "fairness",
      "pricing",
      "trust"
    ],
    "priority": "P1"
  },
  {
    "number": 28,
    "chapter": "第四部分 / 第29章",
    "page_hint": "MOBI 章节",
    "title": "概率权重四重模式",
    "interview_question": "人们为什么既买彩票又买保险？",
    "short_answer": "小概率收益会被高估，所以人们愿意买彩票；小概率损失也会被高估，所以人们愿意买保险。不同概率和得失区间会产生不同风险态度。",
    "key_points": [
      "小概率事件常被赋予过高决策权重。",
      "高概率收益下人们偏保守，高概率损失下可能赌一把。",
      "风险沟通要区分真实概率和主观权重。"
    ],
    "follow_ups": [
      "四重模式如何解释营销活动？",
      "为什么低概率高损失需要明确提示？",
      "如何避免滥用用户恐惧？"
    ],
    "project_mapping": [
      "抽奖活动用小概率大奖拉动参与，但要透明披露规则。",
      "安全功能强调低概率高损失风险，同时给出实际可控措施。"
    ],
    "aipm_transfer": "AI 安全提示要既不过度吓人，也不淡化高损失场景。",
    "tags": [
      "probability-weighting",
      "risk",
      "insurance"
    ],
    "priority": "P1"
  },
  {
    "number": 29,
    "chapter": "第四部分 / 第30章",
    "page_hint": "MOBI 章节",
    "title": "罕见事件的过度关注",
    "interview_question": "为什么极端案例会支配决策？",
    "short_answer": "罕见事件如果生动、可想象、被反复提及，就会获得过高权重。反过来，无法想象的罕见风险也可能被忽视。",
    "key_points": [
      "情绪强度和可想象性会影响决策权重。",
      "单个极端案例可能压过常态体验。",
      "风险管理要同时处理高频小损失和低频大损失。"
    ],
    "follow_ups": [
      "如何向老板解释一次事故不等于整体失败？",
      "产品安全为什么要做情景演练？",
      "罕见事件和可得性有什么区别？"
    ],
    "project_mapping": [
      "AI 产品建立红队样例库，但也保留全量通过率和发生频率。",
      "客服升级机制区分舆情级、财务级、合规级风险。"
    ],
    "aipm_transfer": "模型幻觉的爆款截图会放大风险感，PM 要用频率、影响和防护一起沟通。",
    "tags": [
      "rare-events",
      "risk-communication",
      "safety"
    ],
    "priority": "P1"
  },
  {
    "number": 30,
    "chapter": "第四部分 / 第31章",
    "page_hint": "MOBI 章节",
    "title": "宽框架与风险政策",
    "interview_question": "为什么要用宽框架看一组决策？",
    "short_answer": "单独看每个选择会放大损失厌恶，使团队过于保守；把一组相似决策放在宽框架里，可以接受局部风险，追求长期正期望。",
    "key_points": [
      "窄框架让每次损失都变得刺眼。",
      "宽框架关注长期组合结果。",
      "风险政策是提前定义哪些风险值得系统性承担。"
    ],
    "follow_ups": [
      "增长实验为什么需要 portfolio 思维？",
      "如何避免每次失败都否定探索？",
      "风险政策和 OKR 怎么结合？"
    ],
    "project_mapping": [
      "把 20 个 prompt 实验作为组合看待，而不是逐个追责。",
      "定义探索预算、失败阈值和学习产出指标。"
    ],
    "aipm_transfer": "AI PM 做模型、prompt、工具链实验时，要用组合视角管理探索收益。",
    "tags": [
      "broad-framing",
      "risk-policy",
      "experimentation"
    ],
    "priority": "P0"
  },
  {
    "number": 31,
    "chapter": "第四部分 / 第32章",
    "page_hint": "MOBI 章节",
    "title": "心理账户",
    "interview_question": "心理账户如何影响用户选择？",
    "short_answer": "人们会把钱、时间、积分、损失放入不同心理账户，导致同样价值在不同账户中被不同对待。",
    "key_points": [
      "沉没成本会让人继续投入不值得的项目。",
      "不同预算账户会影响用户付费和使用频率。",
      "产品可以利用心理账户帮助用户规划，但不应制造误导。"
    ],
    "follow_ups": [
      "为什么积分比现金更容易被花掉？",
      "沉没成本如何影响项目继续投入？",
      "心理账户和订阅续费有什么关系？"
    ],
    "project_mapping": [
      "把 AI 使用额度拆成学习、生成、深度评估，帮助用户理解消耗。",
      "项目复盘时把已投入成本和未来收益分开看。"
    ],
    "aipm_transfer": "AI PM 要防止团队因为已经投入某模型或架构而继续追加错误成本。",
    "tags": [
      "mental-accounting",
      "sunk-cost",
      "pricing"
    ],
    "priority": "P1"
  },
  {
    "number": 32,
    "chapter": "第四部分 / 第33章",
    "page_hint": "MOBI 章节",
    "title": "联合评估与单独评估",
    "interview_question": "为什么同一选项单看和对比看会得出不同评价？",
    "short_answer": "单独评估时，人们容易被显著但不重要的特征影响；联合评估能让可比维度更清晰，但也可能忽视使用时的真实体验。",
    "key_points": [
      "联合评估适合比较可量化属性。",
      "单独评估更接近用户实际使用感受。",
      "不同评估模式会改变偏好，测试设计要匹配真实场景。"
    ],
    "follow_ups": [
      "竞品对比表有什么局限？",
      "为什么用户调研和真实行为会不一致？",
      "如何设计模型评测对比？"
    ],
    "project_mapping": [
      "模型 A/B 既做盲测对比，也看真实任务完成后的满意度。",
      "功能优先级既看横向评分，也看用户旅程中的痛点强度。"
    ],
    "aipm_transfer": "AI eval 要区分 leaderboard 式联合评估和真实工作流中的单独使用体验。",
    "tags": [
      "joint-evaluation",
      "preference",
      "testing"
    ],
    "priority": "P1"
  },
  {
    "number": 33,
    "chapter": "第四部分 / 第34章",
    "page_hint": "MOBI 章节",
    "title": "框架效应",
    "interview_question": "框架效应如何改变同一事实的选择？",
    "short_answer": "同样的结果用获得、损失、生存率、死亡率、保留、失去等不同方式表达，会显著改变用户选择。",
    "key_points": [
      "框架改变参照点和情绪反应。",
      "用户并不总是把等价表述转换成同一逻辑形式。",
      "负责任的框架设计要帮助理解，而不是操纵。"
    ],
    "follow_ups": [
      "如何判断文案是在解释还是操纵？",
      "医疗、金融、AI 风险提示为什么要谨慎？",
      "框架效应和增长转化有什么边界？"
    ],
    "project_mapping": [
      "把“节省 2 小时”和“少花 30% 时间”做实验，但确保含义一致清楚。",
      "AI 自动执行前同时呈现收益和可能损失。"
    ],
    "aipm_transfer": "AI PM 做权限、风险、价格文案时，要用透明框架提升理解，而不是诱导授权。",
    "tags": [
      "framing-effect",
      "copywriting",
      "ethics"
    ],
    "priority": "P0"
  },
  {
    "number": 34,
    "chapter": "第五部分 / 第35章",
    "page_hint": "MOBI 章节",
    "title": "体验效用与决策效用",
    "interview_question": "为什么用户选择的东西不一定让自己满意？",
    "short_answer": "决策效用是选择时预期的价值，体验效用是经历过程中的真实感受。二者不一致时，用户会买了、用了，却不一定持续满意。",
    "key_points": [
      "选择前的想象会受峰值、品牌和叙事影响。",
      "体验中的摩擦、等待、失败恢复会决定真实满意度。",
      "产品不能只优化购买转化，还要优化使用中的体验效用。"
    ],
    "follow_ups": [
      "为什么高转化功能未必高留存？",
      "如何测量体验效用？",
      "决策效用和 NPS 有什么关系？"
    ],
    "project_mapping": [
      "对 AI 工具同时看购买率、首轮成功率、任务完成率和复用率。",
      "把用户承诺和真实交付体验对齐。"
    ],
    "aipm_transfer": "AI 产品很容易用炫酷 demo 提高决策效用，但留存取决于真实任务体验。",
    "tags": [
      "experienced-utility",
      "decision-utility",
      "retention"
    ],
    "priority": "P0"
  },
  {
    "number": 35,
    "chapter": "第五部分 / 第36章",
    "page_hint": "MOBI 章节",
    "title": "记忆自我与峰终定律",
    "interview_question": "为什么体验的结尾会强烈影响用户记忆？",
    "short_answer": "记忆自我并不平均记录每一刻，而是特别受高峰和结尾影响。过程时长的重要性常被低估。",
    "key_points": [
      "峰终定律解释了为什么收尾体验、结果页和失败恢复很关键。",
      "痛苦较长但结尾改善的体验，记忆可能反而更好。",
      "产品旅程要设计正向峰值和清楚的结束反馈。"
    ],
    "follow_ups": [
      "为什么客服结尾话术影响满意度？",
      "onboarding 的 aha moment 应放在哪里？",
      "峰终定律有什么伦理边界？"
    ],
    "project_mapping": [
      "面试模拟结束后生成清晰进步点和下一步计划。",
      "失败任务给可恢复路径，而不是冷冰冰报错。"
    ],
    "aipm_transfer": "Agent 工作流要重视任务结束态：摘要、证据、可编辑产物、下一步建议决定记忆质量。",
    "tags": [
      "peak-end-rule",
      "remembering-self",
      "journey-design"
    ],
    "priority": "P0"
  },
  {
    "number": 36,
    "chapter": "第五部分 / 第37章",
    "page_hint": "MOBI 章节",
    "title": "幸福评估的测量",
    "interview_question": "评价生活满意度和体验幸福有什么区别？",
    "short_answer": "生活满意度是回顾性评价，体验幸福是当下感受。不同测量方式会得到不同结论，产品研究也要区分整体评价和过程体验。",
    "key_points": [
      "回顾性评价容易受目标、身份和最近事件影响。",
      "过程体验更接近日常使用中的情绪和摩擦。",
      "问卷指标要明确问的是总体判断还是某段体验。"
    ],
    "follow_ups": [
      "NPS 和即时满意度为什么可能不一致？",
      "用户说喜欢但不用，怎么解释？",
      "如何设计满意度调研？"
    ],
    "project_mapping": [
      "同时收集任务后满意度、周活复用和长期推荐意愿。",
      "把用户访谈问题拆成具体场景，而不是泛问喜不喜欢。"
    ],
    "aipm_transfer": "AI PM 做用户研究时，要区分用户对 AI 的总体态度和某次任务体验。",
    "tags": [
      "well-being",
      "user-research",
      "measurement"
    ],
    "priority": "P1"
  },
  {
    "number": 37,
    "chapter": "第五部分 / 第38章",
    "page_hint": "MOBI 章节",
    "title": "聚焦错觉",
    "interview_question": "为什么被问到的因素会被高估？",
    "short_answer": "当注意力聚焦在某个因素上，人们会夸大它对整体幸福或满意度的影响。产品调研也会因为提问方式制造重要性错觉。",
    "key_points": [
      "被显性提问的因素会暂时占据心理舞台。",
      "用户声称重要的功能，不一定在真实选择中权重最高。",
      "调研要结合行为数据、开放问题和排序任务。"
    ],
    "follow_ups": [
      "为什么用户要的功能上线后没人用？",
      "需求访谈怎么避免诱导？",
      "聚焦错觉和路线图有什么关系？"
    ],
    "project_mapping": [
      "不要只问“你需要 AI 自动投递吗”，要观察求职流程的真实阻塞点。",
      "用 conjoint、行为日志和访谈交叉验证需求权重。"
    ],
    "aipm_transfer": "AI PM 容易把“AI 能做什么”当中心，真正要聚焦用户任务和约束。",
    "tags": [
      "focusing-illusion",
      "user-research",
      "roadmap"
    ],
    "priority": "P0"
  },
  {
    "number": 38,
    "chapter": "附录A",
    "page_hint": "MOBI 章节",
    "title": "启发法与偏见总表",
    "interview_question": "面试中如何系统化讲启发法与偏见？",
    "short_answer": "可以按判断来源拆：可得性来自回忆难易度，典型性来自相似性，锚定来自初始参照，情感启发来自好恶压缩。每一种都能对应产品决策风险。",
    "key_points": [
      "先定义偏见，再讲触发条件。",
      "再给产品或团队决策例子。",
      "最后给治理方法：数据、结构化流程、反例、实验、外部视角。"
    ],
    "follow_ups": [
      "这些偏见是缺陷还是适应性工具？",
      "如何避免把行为经济学讲成玄学？",
      "能否用一个产品例子串起来？"
    ],
    "project_mapping": [
      "用 AI 求职产品串联：定价锚定、案例可得性、岗位画像典型性、结果页框架效应。",
      "做一页“认知偏见 -> 产品风险 -> 设计对策”的面试图谱。"
    ],
    "aipm_transfer": "AI PM 可以把偏见库变成评审 checklist，用于 prompt、评测、定价、授权和用户研究。",
    "tags": [
      "heuristics",
      "bias-map",
      "interview-framework"
    ],
    "priority": "P0"
  },
  {
    "number": 39,
    "chapter": "附录B",
    "page_hint": "MOBI 章节",
    "title": "选择、价值与框架",
    "interview_question": "如何把本书第四部分用于商业化设计？",
    "short_answer": "商业化设计本质上是在管理参照点、得失感、概率权重和框架。定价、试用、续费、权益、补偿都可以用这套语言分析。",
    "key_points": [
      "先识别用户当前参照点。",
      "再判断变化被感知为获得还是损失。",
      "最后设计透明、可控、可比较的选择框架。"
    ],
    "follow_ups": [
      "如何避免过度利用损失厌恶？",
      "什么时候免费试用会适得其反？",
      "用户权益调整怎样沟通？"
    ],
    "project_mapping": [
      "AI 面试产品用基础版、专业版、专家版建立清楚价值阶梯。",
      "取消订阅不抹掉历史资产，减少损失厌恶带来的反感。"
    ],
    "aipm_transfer": "AI PM 既要理解行为杠杆，也要守住透明和用户长期信任。",
    "tags": [
      "commercialization",
      "pricing",
      "choice-architecture"
    ],
    "priority": "P1"
  },
  {
    "number": 40,
    "chapter": "全书整合",
    "page_hint": "MOBI 章节",
    "title": "产品决策去偏清单",
    "interview_question": "如何把《思考，快与慢》变成团队决策工具？",
    "short_answer": "把关键偏见转成决策前检查：是否只看可见信息、是否小样本、是否被锚定、是否忽略基础率、是否只用内部视角、是否用结果评价过程。",
    "key_points": [
      "每个重大决策都记录假设、证据、反证、参照类和指标。",
      "引入外部视角、premortem 和结构化评分。",
      "用实验和复盘纠正直觉，而不是羞辱直觉。"
    ],
    "follow_ups": [
      "决策 checklist 会不会降低效率？",
      "哪些决策值得走完整流程？",
      "如何在快节奏团队落地？"
    ],
    "project_mapping": [
      "为 PRD 增加“认知风险”段落：锚定、样本、框架、外部视角、失败预演。",
      "把上线复盘和决策日志连接起来。"
    ],
    "aipm_transfer": "Agent 可以成为团队的决策审计员，自动提示偏见风险和缺失证据。",
    "tags": [
      "decision-checklist",
      "product-process",
      "debiasing"
    ],
    "priority": "P0"
  },
  {
    "number": 41,
    "chapter": "全书整合",
    "page_hint": "MOBI 章节",
    "title": "AI PM 面试讲法",
    "interview_question": "面试中怎样讲这本书对 AI 产品的价值？",
    "short_answer": "不要只背偏见名词，要讲它如何改变 AI 产品设计：默认值、解释、评测、授权、商业化、用户研究和团队决策。",
    "key_points": [
      "用一个 AI 产品案例贯穿：用户输入、模型输出、信任建立、风险确认、结果复盘。",
      "每个认知机制都落到一个设计动作。",
      "强调你能把心理学变成产品约束和评估指标。"
    ],
    "follow_ups": [
      "你最常用本书哪个概念？",
      "如何避免 AI 产品中的过度信任？",
      "你会怎样设计一个去偏的 Agent？"
    ],
    "project_mapping": [
      "准备一个 2 分钟案例：LLM 输出流畅导致用户过信任，因此加入证据、置信度和二次确认。",
      "准备一个商业化案例：参照点和损失厌恶如何影响订阅设计。"
    ],
    "aipm_transfer": "这本书可作为 AI PM 的“判断与决策系统课”，帮助你从功能视角升级到行为设计视角。",
    "tags": [
      "ai-pm",
      "interview",
      "behavioral-design"
    ],
    "priority": "P0"
  },
  {
    "number": 42,
    "chapter": "全书整合",
    "page_hint": "MOBI 章节",
    "title": "从认知偏见到 AI Eval",
    "interview_question": "《思考，快与慢》怎样指导 AI 评测？",
    "short_answer": "AI 评测本身也会受认知偏见影响：挑成功样例是可得性，过早看小样本是小数定律，被首个模型分数锚定是锚定效应，被流畅输出迷惑是认知放松。",
    "key_points": [
      "评测集要覆盖真实任务分布和高风险边界。",
      "评审要盲测、多人一致性和结构化 rubric。",
      "复盘要记录版本、prompt、样本、失败类型和改动假设。"
    ],
    "follow_ups": [
      "如何设计一个低偏见的 LLM 评测流程？",
      "人工评审为什么也需要校准？",
      "流畅性和正确性如何分开评分？"
    ],
    "project_mapping": [
      "建立黄金测试集、红队集和线上抽样集三层 eval。",
      "让评审先独立打分，再看模型名和生成过程。"
    ],
    "aipm_transfer": "AI PM 做 eval 时要像行为科学家一样管理评测者、样本和展示方式的偏差。",
    "tags": [
      "ai-eval",
      "bias",
      "rubric"
    ],
    "priority": "P0"
  }
]
