评估 AI 功能¶
AI 功能评估要同时回答两个问题:
- 模型输出是否可靠;
- 这个功能是否让用户和业务变好。
1. 建立场景样本集¶
不要只用随机问题测试。样本集应覆盖:
- 正常高频任务;
- 模糊表达;
- 边界条件;
- 高风险问题;
- 真实用户历史问题;
- 竞品或旧流程表现较好的问题。
每条样本至少记录:用户输入、理想结果、不可接受错误、所属场景、风险等级。
2. 分离离线评估和线上评估¶
离线评估用于判断是否能进入灰度:
- 准确性;
- 完整性;
- 忠实度;
- 安全性;
- 引用或证据匹配。
线上评估用于判断是否创造价值:
- 任务完成率;
- 采纳率;
- 编辑率;
- 复访率;
- 人工接管率;
- 单次任务成本。
3. 做失败归因¶
每个错误都要定位到链路阶段:
| 失败位置 | 典型表现 | 处理方向 |
|---|---|---|
| 数据 | 知识缺失、版本过旧 | 补数据、加更新机制 |
| 检索 | 找不到正确内容 | 改切分、召回、路由、重排 |
| 上下文 | 找到了但拼接混乱 | 去重、摘要、结构化证据 |
| 生成 | 有证据但答错 | 改 prompt、约束输出、声明级校验 |
| 交互 | 用户不知道如何修正 | 增加编辑、追问、反馈、确认 |
| 业务 | 模型好但价值弱 | 重新定义场景和目标用户 |
4. 设计对照组¶
至少比较三类基线:
- 无 AI 的原流程;
- 简单规则或模板;
- AI 功能的上一版本。
如果是面试表达,可以说明你会同时看定量指标和定性访谈,避免只用单一分数决定是否上线。
5. 给出产品决策¶
评估报告最后必须落到决策:
- 上线;
- 小流量灰度;
- 限定场景开放;
- 增加人工审核;
- 回滚或暂缓。
只给分数、不做决策,不是 AI PM 的完整评估。