什么是 答案忠实度?

答案忠实度是一项 RAG 评估属性,用于衡量生成答案中的事实主张是否得到模型收到的检索上下文支持。

快速了解

创建时间2023 年由 RAGAS 框架系统化用于 RAG 评估
规范文档官方规范

工作原理

答案忠实度专门定位生成器的一类失败:回答加入了无法从已有证据推出的主张。常见评估器会把答案拆成原子主张,逐条检查检索上下文能否支持,再计算受支持主张的比例。分数会受到主张拆分、裁判模型、证据粒度和模糊表达处理方式影响,因此阈值应使用人工标签校准。忠实度不等于事实正确性:回答可能忠实复述错误来源,也可能依靠模型记忆答对事实,却没有忠实使用给定证据。测试集和发布门禁见<a href="https://qubittool.com/zh/blog/rag-evaluation-production-guide">生产级 RAG 评估指南</a>。

主要特点

  • 根据检索证据评估生成主张,而不是依赖模型自报置信度
  • 把生成阶段的落地失败与检索覆盖、答案相关性分开
  • 可通过人工标注、自然语言推断或 LLM 裁判估算
  • 结果取决于主张拆分质量与裁判校准
  • 不能证明来源真实、答案完整或业务结论正确

常见用途

  1. 检测 RAG 回答中的无证据主张
  2. 在固定检索结果上比较提示词、模型和引用策略
  3. 为企业知识助手设置有证据支撑的发布门禁
  4. 抽样审查生产回答中的幻觉
  5. 判断问题来自检索阶段还是生成阶段

示例

loading...
Loading code...

常见问题

答案忠实度等于事实正确性吗?

不等于。忠实度检查回答是否依据给定上下文;正确性则要根据外部参考答案或真实世界判断内容是否为真。

忠实度高的答案仍可能错误吗?

可能。如果检索来源过时或错误,回答可能忠实复述错误信息,因此还要独立评估来源质量。

答案忠实度如何计算?

典型方法先提取原子主张,再逐条检查检索段落是否支持,最后用受支持主张数除以主张总数。可靠阈值需要人工校准。

回答带引用就代表忠实吗?

不代表。引用可能存在但并不支持相邻主张。评估应检查主张与证据的蕴含关系,而不是只统计引用数量。

答案忠实度应与哪些指标一起使用?

用上下文精确率和召回率评估检索,用答案相关性或任务成功率评估实用性,再独立监控来源质量、延迟和成本。

相关工具

相关术语

相关文章

生产级 RAG 评估:指标、测试集与发布门禁

构建能够定位检索、生成和端到端问题的生产级 RAG 评估体系。本文系统讲解测试集与业务切片设计、上下文精确率和召回率、答案忠实度、引用支持、LLM 裁判校准、在线抽样与版本化发布门禁,并给出权限越界、关键案例、延迟和成本的确定性检查方法,帮助团队把评估结果转化为可执行改进,适合知识库问答、企业搜索和 Agent 检索链路的持续质量治理。

2026-07-28

RAG 幻觉治理实战:五层证据控制、拒答与发布门禁

本文从生产系统视角讲解 RAG 幻觉治理:先建立带版本、权限和有效期的证据契约,再分别控制检索覆盖、重排充分性、冲突上下文、间接提示注入、声明级引用和答案忠实度,最后通过校准后的发布、部分回答、拒答与人工升级策略处理证据不足。文中提供可运行的 Python 发布门禁、故障测试矩阵和观测字段,帮助企业知识库、AI 搜索与客服团队避免把相似度、低温度、来源编号或单一 LLM Judge 误当成事实保证。

2026-04-03

LLM 幻觉检测:证据契约、拒答与发布门禁

系统讲解 LLM 幻觉检测的生产方法:将回答拆成原子声明,固定证据快照并执行四态判定,分别评估 RAG 检索、引用、忠实度与拒答,再通过风险覆盖曲线、人工校准和确定性发布门禁控制大模型事实错误与外部副作用。适合构建企业知识问答、搜索摘要、客服 Agent 及医疗、法律、金融等高影响工作流的开发者,避免把低温度、结构化输出、多模型一致或模型自报置信度误当成真实性保证。

2026-02-21