# 从认知偏见到 AI Eval

## 元数据

- 书名：思考，快与慢
- 作者：丹尼尔·卡尼曼
- 章节：全书整合
- 定位：AI PM / 产品经理 / 策略与增长面试
- 优先级：P0
- 标签：ai-eval, bias, rubric

## 面试问题

《思考，快与慢》怎样指导 AI 评测？

## 30 秒回答

AI 评测本身也会受认知偏见影响：挑成功样例是可得性，过早看小样本是小数定律，被首个模型分数锚定是锚定效应，被流畅输出迷惑是认知放松。

## 展开要点

- 评测集要覆盖真实任务分布和高风险边界。
- 评审要盲测、多人一致性和结构化 rubric。
- 复盘要记录版本、prompt、样本、失败类型和改动假设。

## 高频追问

- 如何设计一个低偏见的 LLM 评测流程？
- 人工评审为什么也需要校准？
- 流畅性和正确性如何分开评分？

## 项目映射

- 建立黄金测试集、红队集和线上抽样集三层 eval。
- 让评审先独立打分，再看模型名和生成过程。

## AI PM 迁移

AI PM 做 eval 时要像行为科学家一样管理评测者、样本和展示方式的偏差。

## 备注

本卡为面试复习用的主题重构和答题框架，不保存原书正文。
