跳转至

评估 AI 功能

AI 功能评估要同时回答两个问题:

  1. 模型输出是否可靠;
  2. 这个功能是否让用户和业务变好。

1. 建立场景样本集

不要只用随机问题测试。样本集应覆盖:

  • 正常高频任务;
  • 模糊表达;
  • 边界条件;
  • 高风险问题;
  • 真实用户历史问题;
  • 竞品或旧流程表现较好的问题。

每条样本至少记录:用户输入、理想结果、不可接受错误、所属场景、风险等级。

2. 分离离线评估和线上评估

离线评估用于判断是否能进入灰度:

  • 准确性;
  • 完整性;
  • 忠实度;
  • 安全性;
  • 引用或证据匹配。

线上评估用于判断是否创造价值:

  • 任务完成率;
  • 采纳率;
  • 编辑率;
  • 复访率;
  • 人工接管率;
  • 单次任务成本。

3. 做失败归因

每个错误都要定位到链路阶段:

失败位置 典型表现 处理方向
数据 知识缺失、版本过旧 补数据、加更新机制
检索 找不到正确内容 改切分、召回、路由、重排
上下文 找到了但拼接混乱 去重、摘要、结构化证据
生成 有证据但答错 改 prompt、约束输出、声明级校验
交互 用户不知道如何修正 增加编辑、追问、反馈、确认
业务 模型好但价值弱 重新定义场景和目标用户

4. 设计对照组

至少比较三类基线:

  • 无 AI 的原流程;
  • 简单规则或模板;
  • AI 功能的上一版本。

如果是面试表达,可以说明你会同时看定量指标和定性访谈,避免只用单一分数决定是否上线。

5. 给出产品决策

评估报告最后必须落到决策:

  • 上线;
  • 小流量灰度;
  • 限定场景开放;
  • 增加人工审核;
  • 回滚或暂缓。

只给分数、不做决策,不是 AI PM 的完整评估。