什么是 拒答正确性(Refusal Correctness)?

拒答正确性(Refusal Correctness)是一项评估属性,用于在明确语料、授权范围、证据充分性规则和响应策略后,衡量 RAG 系统是否回答可回答请求,并拒绝不可回答请求。

快速了解

规范文档官方规范

工作原理

根据授权语料标注可回答性

Answerability 取决于语料版本、用户与 Tenant 权限、问题范围、新鲜度要求和证据充分性 Rubric。某个事实存在于互联网,不代表企业问题可回答。多部分问题只有部分证据时,应预先规定输出有界部分答案、澄清、升级还是完整拒答。

同时测量两种拒答错误

Trust-Align把不可回答问题上的 Over-responsiveness 与可回答问题上的 Excessive Refusal 分开,并另外评估有证据回答。这样可以避免一个保守系统仅因拒答更多就被误判为更安全。应按风险切片分别报告正确回答、错误回答、正确拒答、错误拒答和越界作答。

构建贴近真实语料的不可回答案例

UAEval4RAG定义六类不可回答请求,并显示同一配置无法在不同知识库中稳定兼顾可回答与不可回答行为。测试应覆盖实体缺失、关系无依据、时间错位、范围歧义、访问受限和多跳证据缺口。合成数据必须人工复核,避免不可能问题或意外可回答案例污染分母。

主要特点

  • 先评估回答或拒答决策,再评估答案质量
  • 可回答性标签必须绑定语料与授权版本
  • 把错误拒答与不安全的越界作答分开
  • 把错误答案与可回答性错误分开
  • 支持部分回答、澄清、升级与完整拒答策略
  • 需要风险加权切片,因为两种错误方向代价不同

常见用途

  1. 测试知识库助手如何处理缺失或无权访问的证据
  2. 阻止模型根据参数记忆回答受限问题
  3. 测量更严格提示词是否造成过度拒答
  4. 比较不同检索和生成配置的可回答性行为
  5. 为高影响越界作答与错误拒答设置发布门禁

示例

loading...
Loading code...

常见问题

RAG 中什么是正确拒答?

当当前用户有权访问的最新语料无法为请求主张提供充分证据时,系统按策略拒答才是正确拒答。必须先定义可回答性,不能把任意通用拒绝都算成正确。

错误拒答与越界作答有什么区别?

错误拒答是证据充分但系统拒绝回答;越界作答是证据不足却仍给出答案。前者损害可用性,后者可能生成无依据或不安全结论,必须分开统计。

拒答率越高越安全吗?

不一定。系统可以拒绝所有请求却完全不可用。应同时报告两种错误方向并按后果加权:高影响的无依据回答可以设置零容忍门禁,错误拒答则可使用有界比例和升级路径。

可回答性标签应该如何确定?

标签应绑定语料版本、访问范围、新鲜度规则、问题解释和证据充分性 Rubric。合成案例需要人工复核,因为所谓不可回答问题可能在另一段授权内容中已经有答案。

部分回答应该算拒答吗?

应在评分前定义策略。如果系统明确给出有证据支持的部分,并拒绝无依据部分,有界部分回答可以正确。最好按子问题保存可回答性,避免单一二元标签掩盖混合结果。

相关术语

相关文章

生产级 RAG 评估:指标、测试集与发布门禁

构建能够定位检索、证据使用、答案质量与拒答问题的生产级 RAG 评估体系。本文系统讲解测试集与业务切片、上下文精确率和召回率、答案正确性、相关性与忠实度、噪声敏感度、拒答正确性、引用质量、LLM 裁判校准及版本化发布门禁,并提供可运行 Go 检查器,帮助企业知识库与搜索团队把分数转化为可诊断、可回滚的工程决策。

2026-07-28

LLM 幻觉检测:证据契约、拒答与发布门禁

系统讲解 LLM 幻觉检测的生产方法:将回答拆成原子声明,固定证据快照并执行四态判定,分别评估 RAG 检索、引用、忠实度与拒答,再通过风险覆盖曲线、人工校准和确定性发布门禁控制大模型事实错误与外部副作用。适合构建企业知识问答、搜索摘要、客服 Agent 及医疗、法律、金融等高影响工作流的开发者,避免把低温度、结构化输出、多模型一致或模型自报置信度误当成真实性保证。

2026-02-21

RAG 幻觉治理实战:五层证据控制、拒答与发布门禁

本文从生产系统视角讲解 RAG 幻觉治理:先建立带版本、权限和有效期的证据契约,再分别控制检索覆盖、重排充分性、冲突上下文、间接提示注入、声明级引用和答案忠实度,最后通过校准后的发布、部分回答、拒答与人工升级策略处理证据不足。文中提供可运行的 Python 发布门禁、故障测试矩阵和观测字段,帮助企业知识库、AI 搜索与客服团队避免把相似度、低温度、来源编号或单一 LLM Judge 误当成事实保证。

2026-04-03