# 类别型特征编码

## 元数据

- 书名：百面机器学习：算法工程师带你去面试
- 作者：葫芦娃
- 章节：第 1 章 特征工程
- 页码线索：004
- 目标岗位：AI PM / LLM 产品 / 算法工程师面试
- 优先级：P0
- 标签：feature-engineering, categorical

## 面试问题

类别型特征应该如何处理？

## 30 秒回答

类别特征要根据类别之间是否有序、取值规模和模型类型选择编码方式。有序类别可用序号编码，无序低基数类别常用 one-hot，高基数类别需要考虑哈希、二进制编码、目标编码或 embedding。

## 展开要点

- 序号编码会引入大小关系，只适合天然有序类别。
- one-hot 简单可靠，但高基数时维度膨胀。
- 高基数 ID 特征常与 embedding、哈希或特征选择结合。
- 目标编码要严防 label leakage，需要交叉验证式编码。

## 高频追问

- 为什么血型不应该直接编码成 1、2、3、4？
- 高基数类别特征会带来什么问题？
- 类别编码如何应对线上未见过的新值？

## 项目映射

- 推荐系统中的 user_id/item_id 如何表示？
- 广告定向中的地域、设备、兴趣标签如何编码？

## AI PM 迁移

AI 产品里大量配置、渠道、权限、意图都是类别特征；PM 要关心可解释性、冷启动和新类别兜底。

## 备注

本卡为面试复习用的概念重构和答题框架，不保存原书正文。
