跳转至

评估 RAG 系统

不要只评最终回答。RAG 是一条多阶段链路,每一层都需要独立指标。

建立评估集

每条样本至少包含:

  • 用户问题及真实表达变体;
  • 应命中的来源和证据片段;
  • 可接受答案要点;
  • 不应回答或需要澄清的条件;
  • 查询类型、难度和权限标签。

检索评估

  • Recall@K:需要的证据有多少进入前 K;
  • Precision@K:前 K 中有多少真正相关;
  • MRR:第一个相关结果排得多靠前;
  • NDCG@K:多个相关等级下的排序质量;
  • 路由正确率、过滤正确率与去重效果。

生成评估

  • 答案正确性与完整性;
  • 每个关键声明是否得到上下文支持;
  • 引用是否真的指向支持该声明的内容;
  • 是否遵守“证据不足则说明不知道”;
  • 多轮问题重写后是否保留原意。

常用维度可以拆成忠实度、答案相关性、上下文相关性和上下文召回。它们分别检查“有没有编”“有没有答到点上”“给模型的材料是否相关”和“需要的证据是否被找回”。

系统评估

  • TTFT、总延迟、P95/P99;
  • QPS、并发下的错误率;
  • 单查询模型与检索成本;
  • 数据规模增长后的质量和延迟;
  • 用户完成任务的成功率。

评估结果应按查询类型分层。平均分可能掩盖多跳问题、表格问题或长尾实体上的严重失败。