# MLP、激活函数与训练技巧

## 元数据

- 书名：百面机器学习：算法工程师带你去面试
- 作者：葫芦娃
- 章节：第 9 章 前向神经网络
- 页码线索：200-220
- 目标岗位：AI PM / LLM 产品 / 算法工程师面试
- 优先级：P0
- 标签：neural-network, training, activation

## 面试问题

神经网络为什么不能把参数全部初始化为 0？激活函数如何影响训练？

## 30 秒回答

全零初始化会让同层神经元学习到相同参数，无法打破对称性。激活函数决定非线性表达和梯度传播，sigmoid/tanh 易饱和，ReLU 系列缓解梯度消失但也有死亡 ReLU 等问题。

## 展开要点

- 多层感知机通过隐藏层组合表达非线性函数。
- 反向传播用链式法则计算各层梯度。
- 交叉熵通常比平方误差更适合分类。
- Dropout、BatchNorm、合理初始化和学习率都影响训练稳定性。

## 高频追问

- ReLU 的优点和局限是什么？
- BatchNorm 为什么有用？
- Dropout 为什么能抑制过拟合？

## 项目映射

- 从训练不收敛、过拟合、梯度消失三个角度讲排查。
- LLM fine-tuning 也要关注学习率、batch、loss 曲线。

## AI PM 迁移

AI PM 不需要手推梯度，但要会听懂训练失败、过拟合和稳定性问题。

## 备注

本卡为面试复习用的概念重构和答题框架，不保存原书正文。
