RAG召回评估知识库
RAG 召回质量怎么测:先准备问题集,再调参数
用可重复的问题集评估知识库检索,避免仅凭几个演示问题判断效果。
关键词RAG召回评估知识库问题集
LA
RAG 召回质量怎么测:先准备问题集,再调参数
RAG实操方法与验收标准LondAI 内容团队
用可重复的问题集评估知识库检索,避免仅凭几个演示问题判断效果。
先看清 RAG 的问题边界
回答错误可能来自资料缺失、切分不当、召回失败或生成阶段。没有标注问题集时,调整 top-k 和提示词只是不断试错。
落地方法与执行顺序
从真实业务收集典型问题,为每题标注应命中的文档片段和不可回答边界。先独立评估召回,再评估最终答案,分别记录命中率与引用准确性。
常见误区与安全边界
不要只用能够在文档中原文搜索到的问题评估 RAG。真实用户会换说法、遗漏关键词或提出不可回答问题,问题集必须覆盖这些困难情况。
验收标准与复盘依据
参数调整后运行同一问题集,比较改善和退化。新增资料或更换 embedding 模型也必须回归,避免局部示例变好而整体质量下降。