什么是 噪声敏感度(Noise Sensitivity)?

噪声敏感度(Noise Sensitivity)是一项 RAG 评估指标,用于衡量检索内容诱发错误答案主张的频率,常把相关分块内部噪声与无关分块噪声分开计算。

快速了解

规范文档官方规范

工作原理

区分相关噪声与无关噪声

当前 Ragas 协议提供 Relevant 与 Irrelevant 两种模式。Relevant Noise 是可归因于同时包含有用证据的相关分块之错误主张;Irrelevant Noise 是可归因于参考无关分块的错误主张。标签不是文本自身的永久属性,而是由问题、参考、证据粒度和蕴含规则共同决定。

用成对扰动获得因果证据

静态归因只能说明关联,不能证明干扰项造成错误。应固定问题、参考、模型、提示词和必要证据,只添加、删除或移动一个受控干扰项,运行 Clean/Noisy 成对实验,再比较主张错误、拒答行为、引用支持与延迟。新增错误只在带噪条件出现并能追溯到注入片段时,修复方向更明确。

分别诊断检索器与生成器

RAGChecker把错误主张拆成来自相关分块、无关分块和任何检索分块之外三类,从而区分盲信上下文与自行幻觉。测试集不应只加入随机无关段落,还要覆盖过期、互相矛盾、近重复、来源权威不匹配、多语言和经过权限过滤的干扰项。

主要特点

  • 统计可归因于检索上下文的错误回答主张
  • 区分相关分块内部噪声与无关分块噪声
  • 依赖可信参考和显式主张归因协议
  • 可以通过干净与带噪上下文的成对扰动增强证据
  • 不同于检索精确率,因为生成器可能忽略噪声
  • 应与正确性、忠实度、拒答和引用指标联合报告

常见用途

  1. 测试无关检索片段是否改变原本正确的答案
  2. 发现总体相关文档中的误导陈述
  3. 比较重排序、去重、过滤和上下文顺序调整
  4. 把已知带噪上下文事故转为回归测试
  5. 为不可信证据诱发的错误主张设置发布上限

示例

loading...
Loading code...

常见问题

噪声敏感度等于上下文精确率吗?

不等于。上下文精确率评估相关结果是否排在无关结果之前;噪声敏感度评估检索内容是否诱发错误回答主张。生成器可能忽略带噪列表,也可能复制相关分块中的一条误导陈述。

噪声敏感度越低越好吗?

在常见主张错误协议中是,因为它表示回答主张中错误且可归因于指定噪声类型的比例。仍需记录实现和 Mode,因为自定义稳健性测试可能采用相反方向或不同分母。

RAG 中的相关噪声是什么?

相关噪声是位于总体相关分块中的误导或错误内容。某个分块包含一项有用证据,并不代表其中每句话都可信,因此不能只用分块级相关标签判断生成安全。

团队应该如何测试噪声敏感度?

固定问题、必要证据、提示词、模型和解码设置,运行干净与带噪成对案例,每次加入一个受控干扰项,再比较主张正确性、引用支持、拒答行为和延迟。

低噪声敏感度能证明 RAG 系统质量好吗?

不能。检索器仍可能漏掉必要证据,回答可能离题或不完整,模型也可能通过全部拒答降低错误。还需联合上下文召回率与精确率、正确性、忠实度、拒答正确性、引用质量和任务成功率。

相关术语

相关文章

生产级 RAG 评估:指标、测试集与发布门禁

构建能够定位检索、证据使用、答案质量与拒答问题的生产级 RAG 评估体系。本文系统讲解测试集与业务切片、上下文精确率和召回率、答案正确性、相关性与忠实度、噪声敏感度、拒答正确性、引用质量、LLM 裁判校准及版本化发布门禁,并提供可运行 Go 检查器,帮助企业知识库与搜索团队把分数转化为可诊断、可回滚的工程决策。

2026-07-28

RAG 幻觉治理实战:五层证据控制、拒答与发布门禁

本文从生产系统视角讲解 RAG 幻觉治理:先建立带版本、权限和有效期的证据契约,再分别控制检索覆盖、重排充分性、冲突上下文、间接提示注入、声明级引用和答案忠实度,最后通过校准后的发布、部分回答、拒答与人工升级策略处理证据不足。文中提供可运行的 Python 发布门禁、故障测试矩阵和观测字段,帮助企业知识库、AI 搜索与客服团队避免把相似度、低温度、来源编号或单一 LLM Judge 误当成事实保证。

2026-04-03

LLM 幻觉检测:证据契约、拒答与发布门禁

系统讲解 LLM 幻觉检测的生产方法:将回答拆成原子声明,固定证据快照并执行四态判定,分别评估 RAG 检索、引用、忠实度与拒答,再通过风险覆盖曲线、人工校准和确定性发布门禁控制大模型事实错误与外部副作用。适合构建企业知识问答、搜索摘要、客服 Agent 及医疗、法律、金融等高影响工作流的开发者,避免把低温度、结构化输出、多模型一致或模型自报置信度误当成真实性保证。

2026-02-21