什么是 答案正确性(Answer Correctness)?
答案正确性(Answer Correctness)是一项评估属性,用于衡量生成答案中的事实主张或任务结果是否符合预先声明的可信参考、可执行判定器或经过裁决的标准答案。
快速了解
| 规范文档 | 官方规范 |
|---|
工作原理
选择与任务匹配的判定器
代码、计算、数据库状态或结构化业务规则存在确定性结果时,应优先使用可执行判定器。开放事实问答则使用版本化参考答案或主张集合,并保留可接受替代表达、单位、限定条件与有效期。单一参考措辞不是事实边界:语义等价内容应匹配,矛盾和无依据新增仍要分别记录。
让分母和实现身份可以审计
当前 Ragas Factual Correctness 协议会提取回答与参考主张,再报告 Precision、Recall 或 F1;RAGChecker也使用主张级蕴含,把整体准确性与检索器、生成器故障拆开。两种实现不能直接互换,必须记录主张提取器、匹配规则、裁判、聚合模式、空答案策略和参考版本。
根据错误类型定位链路
False Positive 可能来自模型参数记忆、带噪检索片段、歧义问题或过期参考;False Negative 可能来自漏检索、生成遗漏、过度拒答,或者参考答案要求了无关细节。保留主张级标签与来源 ID,才能把分数变化转化为具体的检索、生成、数据或评估器修复。
主要特点
- 比较生成主张或任务结果与预先声明的判定器
- 把错误新增主张与遗漏必要主张分开
- 可以报告 Precision、Recall、F1、Exact Match 或任务专属成功率
- 依赖参考质量、主张粒度和评估器版本
- 不能证明回答使用了模型实际收到的上下文
- 只有保留业务切片与不确定性时才适合发布决策
常见用途
- 根据版本化参考主张集评估事实问答
- 用可执行判定器检查计算、代码、SQL 或结构化输出
- 区分回答中的错误新增与必要事实遗漏
- 在同一批问题和参考版本上比较 RAG 发布候选
- 为高影响事实任务建立分切片发布门禁
示例
Loading code...常见问题
答案正确性等于答案忠实度吗?
不等于。正确性比较回答与可信参考或判定器;忠实度检查回答主张能否由给定上下文推出。回答可能忠实遵循错误来源,也可能虽然答对却忽略了指定证据。
答案正确性如何计算?
常见协议会从回答和参考中提取原子主张,匹配语义等价项,再根据 True Positive、False Positive 与 False Negative 计算 Precision、Recall 或 F1。其他任务也可以使用 Exact Match、执行结果或明确 Rubric。
答案正确性应该使用 Precision、Recall 还是 F1?
应根据错误代价选择。Precision 更关注避免错误新增,Recall 更关注覆盖必要事实,F1 平衡二者。最好同时报告分项,因为相同 F1 可能隐藏完全不同的遗漏与编造风险。
LLM 裁判能可靠测量答案正确性吗?
它可以估计主张的语义一致性,但结果受拆分规则、Rubric、提示词、模型和参考质量影响。应使用代表性人工标签校准,固定评估器版本,并在任务允许时优先使用确定性判定器。
参考答案不完整或过期时怎么办?
应先把案例标为无效或修订参考,再用于发布决策。保留来源版本与有效期,允许经过记录的等价答案,并审查分歧,不能把与某个参考字符串不同的所有内容都当成错误。