# 文本表示模型

## 元数据

- 书名：百面机器学习：算法工程师带你去面试
- 作者：葫芦娃
- 章节：第 1 章 特征工程
- 页码线索：011
- 目标岗位：AI PM / LLM 产品 / 算法工程师面试
- 优先级：P0
- 标签：text, embedding, RAG

## 面试问题

有哪些文本表示模型？它们各有什么优缺点？

## 30 秒回答

文本可从稀疏词袋、TF-IDF、主题模型、词向量到深度表示逐步升级。传统方法简单可解释，深度表示语义能力更强，但训练和评估复杂度更高。

## 展开要点

- 词袋忽略词序，适合简单分类和检索基线。
- TF-IDF 降低高频通用词权重，常用于搜索和文本分类。
- 主题模型适合发现文档集合的潜在主题。
- 词嵌入和深度模型能表达语义相似性和上下文关系。

## 高频追问

- TF-IDF 为什么仍然有价值？
- 词袋模型的主要缺陷是什么？
- embedding 相似是否等于语义正确？

## 项目映射

- 企业知识库检索可用 BM25 + embedding hybrid search。
- 客服意图识别可以先用 TF-IDF/传统模型做基线。

## AI PM 迁移

这张卡可以直接迁移到 RAG：关键词检索、向量检索、主题聚类本质上是不同文本表示的产品取舍。

## 备注

本卡为面试复习用的概念重构和答题框架，不保存原书正文。
