什么是 答案忠实度?

答案忠实度是一项 RAG 评估属性,用于衡量生成答案中的事实主张是否得到模型收到的检索上下文支持。

快速了解

创建时间2023 年由 RAGAS 框架系统化用于 RAG 评估
规范文档官方规范

工作原理

答案忠实度专门定位生成器的一类失败:回答加入了无法从已有证据推出的主张。常见评估器会把答案拆成原子主张,逐条检查检索上下文能否支持,再计算受支持主张的比例。分数会受到主张拆分、裁判模型、证据粒度和模糊表达处理方式影响,因此阈值应使用人工标签校准。忠实度不等于事实正确性:回答可能忠实复述错误来源,也可能依靠模型记忆答对事实,却没有忠实使用给定证据。测试集和发布门禁见<a href="https://qubittool.com/zh/blog/rag-evaluation-production-guide">生产级 RAG 评估指南</a>。

主要特点

  • 根据检索证据评估生成主张,而不是依赖模型自报置信度
  • 把生成阶段的落地失败与检索覆盖、答案相关性分开
  • 可通过人工标注、自然语言推断或 LLM 裁判估算
  • 结果取决于主张拆分质量与裁判校准
  • 不能证明来源真实、答案完整或业务结论正确

常见用途

  1. 检测 RAG 回答中的无证据主张
  2. 在固定检索结果上比较提示词、模型和引用策略
  3. 为企业知识助手设置有证据支撑的发布门禁
  4. 抽样审查生产回答中的幻觉
  5. 判断问题来自检索阶段还是生成阶段

示例

loading...
Loading code...

常见问题

答案忠实度等于事实正确性吗?

不等于。忠实度检查回答是否依据给定上下文;正确性则要根据外部参考答案或真实世界判断内容是否为真。

忠实度高的答案仍可能错误吗?

可能。如果检索来源过时或错误,回答可能忠实复述错误信息,因此还要独立评估来源质量。

答案忠实度如何计算?

典型方法先提取原子主张,再逐条检查检索段落是否支持,最后用受支持主张数除以主张总数。可靠阈值需要人工校准。

回答带引用就代表忠实吗?

不代表。引用可能存在但并不支持相邻主张。评估应检查主张与证据的蕴含关系,而不是只统计引用数量。

答案忠实度应与哪些指标一起使用?

用上下文精确率和召回率评估检索,用答案相关性或任务成功率评估实用性,再独立监控来源质量、延迟和成本。

相关工具

相关术语

相关文章