# 采样与样本不均衡

## 元数据

- 书名：百面机器学习：算法工程师带你去面试
- 作者：葫芦娃
- 章节：第 8 章 采样
- 页码线索：172-194
- 目标岗位：AI PM / LLM 产品 / 算法工程师面试
- 优先级：P0
- 标签：sampling, imbalance, evaluation

## 面试问题

采样在机器学习中有什么作用？样本不均衡怎么处理？

## 30 秒回答

采样用于估计分布、构造训练集、降低计算成本和处理不均衡。样本不均衡可通过重采样、类别权重、阈值调整、难例挖掘和合适指标来处理。

## 展开要点

- 欠采样降低多数类规模，但可能丢信息。
- 过采样增加少数类权重，但可能过拟合。
- SMOTE 等方法合成少数类样本，但要防止产生不真实样本。
- 不均衡问题的核心不是样本比例，而是错误成本和决策阈值。

## 高频追问

- 什么时候用欠采样，什么时候用过采样？
- 训练分布和线上真实分布不同会怎样？
- 采样会如何影响概率校准？

## 项目映射

- 欺诈检测、投诉预测、低频高价值用户识别。
- LLM 安全 eval 中高风险样本要主动过采样。

## AI PM 迁移

AI PM 要推动建设长尾/高风险评估集，不能只靠自然流量随机抽样。

## 备注

本卡为面试复习用的概念重构和答题框架，不保存原书正文。
