ARTICLE / 2 MIN READ
RAG 评测体系:同时衡量召回、引用和最终回答
建立可重复的 RAG 评测集,拆解检索和生成误差,避免只看一个模糊的满意度分数。
RAG 回答错了,可能是文档没有召回、召回了错误片段、上下文排序不对,也可能是模型忽略了正确证据。评测要把这些阶段拆开,否则修复方向只能靠猜。
构造带证据的样本
每个问题记录期望答案、必需证据、允许引用范围、不可引用范围和拒答条件。样本覆盖单跳、多跳、无答案、冲突版本、长文档和权限过滤,按业务意图分层统计。
检索指标和生成指标分开
检索看 Recall@K、MRR、nDCG、引用覆盖和权限误召回;生成看事实一致性、答案完整性、引用正确性、格式合规和拒答准确。模型评分可以初筛,但关键样本需要人工复核并记录分歧。
做线上回放
把真实请求脱敏后采样保存 query、候选片段、最终回答和用户反馈,重跑新切片或新排序策略。对比命中率、延迟、上下文 token 和成本,避免离线指标变好却让线上响应变慢。
上线门禁
检索召回下降、跨租户误召回或关键问题引用缺失时阻断发布。切换索引时保留旧版本,允许按租户回滚,直到新索引经过持续观察窗口。
参考资料:pgvector 向量检索实现。
GITHUB DISCUSSION
评论与回复
评论保存在 GitHub Discussions,登录 GitHub 后即可参与,发布和回复都在本页完成。
评论区进入视口后自动加载。