什么是 上下文召回率(Context Recall)?

上下文召回率(Context Recall)是一种 RAG 评估指标,用于衡量检索到的上下文是否包含回答用户问题所需的证据。

工作原理

上下文召回率关注检索系统是否找到了必要证据。如果所需来源片段从未进入模型,RAG 答案就无法可靠地事实锚定。低上下文召回率可能来自糟糕分块、弱嵌入、缺失元数据、过滤过严、top-k 不足,或查询需要改写。它应与上下文精确率一起评估,因为盲目提高召回可能让模型看到大量无关上下文。

主要特点

  • 衡量证据覆盖,而不是证据纯净度
  • 识别必要事实是否出现在检索上下文中
  • 与惩罚无关分块的上下文精确率互补
  • 对 top-k、查询改写、分块、过滤和检索模型选择敏感
  • 当 RAG 答案不完整或缺乏依据时,是关键诊断指标

常见用途

  1. 检查 gold evidence 是否出现在 top-k 检索结果中
  2. 诊断模型根本没看到正确来源导致的 RAG 失败
  3. 比较稠密、稀疏和混合检索的召回率
  4. 在不丢失必要证据的前提下调优 top-k 和元数据过滤
  5. 为高价值问题建立检索回归测试

示例

loading...
Loading code...

常见问题

上下文召回率低说明什么?

这说明检索阶段没有包含有依据回答所需的证据,因此生成模型可能猜测或回答不完整。

提高 top-k 能改善上下文召回率吗?

经常可以,但也可能加入无关分块而降低上下文精确率。通常还需要重排和更好的检索策略。

上下文召回率和答案召回率有什么区别?

上下文召回率评估检索证据覆盖,答案召回率评估最终答案是否包含期望信息。

哪些方法可以提升上下文召回率?

更好的分块、混合检索、查询改写、元数据修复、嵌入模型选择和谨慎调优过滤条件都可能有帮助。

相关工具

相关术语

相关文章

生产级 RAG 评估:指标、测试集与发布门禁

构建能够定位检索、生成和端到端问题的生产级 RAG 评估体系。本文系统讲解测试集与业务切片设计、上下文精确率和召回率、答案忠实度、引用支持、LLM 裁判校准、在线抽样与版本化发布门禁,并给出权限越界、关键案例、延迟和成本的确定性检查方法,帮助团队把评估结果转化为可执行改进,适合知识库问答、企业搜索和 Agent 检索链路的持续质量治理。

2026-07-28

RAG 幻觉治理实战:五层证据控制、拒答与发布门禁

本文从生产系统视角讲解 RAG 幻觉治理:先建立带版本、权限和有效期的证据契约,再分别控制检索覆盖、重排充分性、冲突上下文、间接提示注入、声明级引用和答案忠实度,最后通过校准后的发布、部分回答、拒答与人工升级策略处理证据不足。文中提供可运行的 Python 发布门禁、故障测试矩阵和观测字段,帮助企业知识库、AI 搜索与客服团队避免把相似度、低温度、来源编号或单一 LLM Judge 误当成事实保证。

2026-04-03

Lost in the Middle:长上下文可靠性评测与缓解

深入理解 Lost in the Middle:区分上下文容量、检索成功与有效证据利用,使用位置、长度、干扰项、多证据、低词汇重叠和负控评测长上下文 LLM。本文结合 RULER、NoLiMa 与 LongBench v2,给出可复现的位置扫描程序、引用与授权检查、发布身份和生产门禁,并说明如何验证 RAG、上下文压缩、摘要与证据重排策略,适合构建长文档问答、代码库分析和企业知识系统的开发团队。

2026-04-07