什么是 答案正确性(Answer Correctness)?

答案正确性(Answer Correctness)是一项评估属性,用于衡量生成答案中的事实主张或任务结果是否符合预先声明的可信参考、可执行判定器或经过裁决的标准答案。

快速了解

规范文档官方规范

工作原理

选择与任务匹配的判定器

代码、计算、数据库状态或结构化业务规则存在确定性结果时,应优先使用可执行判定器。开放事实问答则使用版本化参考答案或主张集合,并保留可接受替代表达、单位、限定条件与有效期。单一参考措辞不是事实边界:语义等价内容应匹配,矛盾和无依据新增仍要分别记录。

让分母和实现身份可以审计

当前 Ragas Factual Correctness 协议会提取回答与参考主张,再报告 Precision、Recall 或 F1;RAGChecker也使用主张级蕴含,把整体准确性与检索器、生成器故障拆开。两种实现不能直接互换,必须记录主张提取器、匹配规则、裁判、聚合模式、空答案策略和参考版本。

根据错误类型定位链路

False Positive 可能来自模型参数记忆、带噪检索片段、歧义问题或过期参考;False Negative 可能来自漏检索、生成遗漏、过度拒答,或者参考答案要求了无关细节。保留主张级标签与来源 ID,才能把分数变化转化为具体的检索、生成、数据或评估器修复。

主要特点

  • 比较生成主张或任务结果与预先声明的判定器
  • 把错误新增主张与遗漏必要主张分开
  • 可以报告 Precision、Recall、F1、Exact Match 或任务专属成功率
  • 依赖参考质量、主张粒度和评估器版本
  • 不能证明回答使用了模型实际收到的上下文
  • 只有保留业务切片与不确定性时才适合发布决策

常见用途

  1. 根据版本化参考主张集评估事实问答
  2. 用可执行判定器检查计算、代码、SQL 或结构化输出
  3. 区分回答中的错误新增与必要事实遗漏
  4. 在同一批问题和参考版本上比较 RAG 发布候选
  5. 为高影响事实任务建立分切片发布门禁

示例

loading...
Loading code...

常见问题

答案正确性等于答案忠实度吗?

不等于。正确性比较回答与可信参考或判定器;忠实度检查回答主张能否由给定上下文推出。回答可能忠实遵循错误来源,也可能虽然答对却忽略了指定证据。

答案正确性如何计算?

常见协议会从回答和参考中提取原子主张,匹配语义等价项,再根据 True Positive、False Positive 与 False Negative 计算 Precision、Recall 或 F1。其他任务也可以使用 Exact Match、执行结果或明确 Rubric。

答案正确性应该使用 Precision、Recall 还是 F1?

应根据错误代价选择。Precision 更关注避免错误新增,Recall 更关注覆盖必要事实,F1 平衡二者。最好同时报告分项,因为相同 F1 可能隐藏完全不同的遗漏与编造风险。

LLM 裁判能可靠测量答案正确性吗?

它可以估计主张的语义一致性,但结果受拆分规则、Rubric、提示词、模型和参考质量影响。应使用代表性人工标签校准,固定评估器版本,并在任务允许时优先使用确定性判定器。

参考答案不完整或过期时怎么办?

应先把案例标为无效或修订参考,再用于发布决策。保留来源版本与有效期,允许经过记录的等价答案,并审查分歧,不能把与某个参考字符串不同的所有内容都当成错误。

相关术语

相关文章

生产级 RAG 评估:指标、测试集与发布门禁

构建能够定位检索、证据使用、答案质量与拒答问题的生产级 RAG 评估体系。本文系统讲解测试集与业务切片、上下文精确率和召回率、答案正确性、相关性与忠实度、噪声敏感度、拒答正确性、引用质量、LLM 裁判校准及版本化发布门禁,并提供可运行 Go 检查器,帮助企业知识库与搜索团队把分数转化为可诊断、可回滚的工程决策。

2026-07-28

LLM 幻觉检测:证据契约、拒答与发布门禁

系统讲解 LLM 幻觉检测的生产方法:将回答拆成原子声明,固定证据快照并执行四态判定,分别评估 RAG 检索、引用、忠实度与拒答,再通过风险覆盖曲线、人工校准和确定性发布门禁控制大模型事实错误与外部副作用。适合构建企业知识问答、搜索摘要、客服 Agent 及医疗、法律、金融等高影响工作流的开发者,避免把低温度、结构化输出、多模型一致或模型自报置信度误当成真实性保证。

2026-02-21

RAG 幻觉治理实战:五层证据控制、拒答与发布门禁

本文从生产系统视角讲解 RAG 幻觉治理:先建立带版本、权限和有效期的证据契约,再分别控制检索覆盖、重排充分性、冲突上下文、间接提示注入、声明级引用和答案忠实度,最后通过校准后的发布、部分回答、拒答与人工升级策略处理证据不足。文中提供可运行的 Python 发布门禁、故障测试矩阵和观测字段,帮助企业知识库、AI 搜索与客服团队避免把相似度、低温度、来源编号或单一 LLM Judge 误当成事实保证。

2026-04-03