# 聚类：KMeans、GMM 与评估

## 元数据

- 书名：百面机器学习：算法工程师带你去面试
- 作者：葫芦娃
- 章节：第 5 章 非监督学习
- 页码线索：092-111
- 目标岗位：AI PM / LLM 产品 / 算法工程师面试
- 优先级：P0
- 标签：clustering, kmeans, gmm

## 面试问题

KMeans 的优缺点是什么？如何评估聚类算法？

## 30 秒回答

KMeans 简单高效，但依赖 K 值、初始中心和欧氏距离假设，适合近似球形簇。GMM 能表达软分配和不同协方差结构，聚类评估要结合内部指标、稳定性和业务解释。

## 展开要点

- KMeans 步骤：分配样本到最近中心，再更新中心。
- 缺点：对异常值敏感，不适合非凸形状。
- GMM 用概率混合模型描述样本生成过程。
- 无监督评估不能只看数学指标，还要看业务可解释性。

## 高频追问

- K 如何选择？
- KMeans 为什么会收敛？
- 聚类结果如何命名和应用？

## 项目映射

- 用户分群、内容聚类、问题聚类、badcase 聚类。
- LLM 日志分析可用聚类发现失败模式。

## AI PM 迁移

AI PM 很常用聚类做需求洞察和 badcase 归因，但要避免把聚类标签过度解释。

## 备注

本卡为面试复习用的概念重构和答题框架，不保存原书正文。
