评估 RAG 系统¶
不要只评最终回答。RAG 是一条多阶段链路,每一层都需要独立指标。
建立评估集¶
每条样本至少包含:
- 用户问题及真实表达变体;
- 应命中的来源和证据片段;
- 可接受答案要点;
- 不应回答或需要澄清的条件;
- 查询类型、难度和权限标签。
检索评估¶
- Recall@K:需要的证据有多少进入前 K;
- Precision@K:前 K 中有多少真正相关;
- MRR:第一个相关结果排得多靠前;
- NDCG@K:多个相关等级下的排序质量;
- 路由正确率、过滤正确率与去重效果。
生成评估¶
- 答案正确性与完整性;
- 每个关键声明是否得到上下文支持;
- 引用是否真的指向支持该声明的内容;
- 是否遵守“证据不足则说明不知道”;
- 多轮问题重写后是否保留原意。
常用维度可以拆成忠实度、答案相关性、上下文相关性和上下文召回。它们分别检查“有没有编”“有没有答到点上”“给模型的材料是否相关”和“需要的证据是否被找回”。
系统评估¶
- TTFT、总延迟、P95/P99;
- QPS、并发下的错误率;
- 单查询模型与检索成本;
- 数据规模增长后的质量和延迟;
- 用户完成任务的成功率。
评估结果应按查询类型分层。平均分可能掩盖多跳问题、表格问题或长尾实体上的严重失败。