RAG 召回质量怎么测:先准备问题集,再调参数

用可重复的问题集评估知识库检索,避免仅凭几个演示问题判断效果。

关键词
LALondAI 内容团队发布日期 2026-09-17
5 分钟阅读模型教程
LA
RAG 召回质量怎么测:先准备问题集,再调参数
RAG实操方法与验收标准LondAI 内容团队

用可重复的问题集评估知识库检索,避免仅凭几个演示问题判断效果。

先看清 RAG 的问题边界

回答错误可能来自资料缺失、切分不当、召回失败或生成阶段。没有标注问题集时,调整 top-k 和提示词只是不断试错。

落地方法与执行顺序

从真实业务收集典型问题,为每题标注应命中的文档片段和不可回答边界。先独立评估召回,再评估最终答案,分别记录命中率与引用准确性。

常见误区与安全边界

不要只用能够在文档中原文搜索到的问题评估 RAG。真实用户会换说法、遗漏关键词或提出不可回答问题,问题集必须覆盖这些困难情况。

验收标准与复盘依据

参数调整后运行同一问题集,比较改善和退化。新增资料或更换 embedding 模型也必须回归,避免局部示例变好而整体质量下降。