什么是 答案相关性(Answer Relevance)?
答案相关性(Answer Relevance)是一项评估属性,用于衡量生成回答是否直接且充分地回应用户问题、搜索意图和必要要点,同时避免被无关内容主导。
快速了解
| 规范文档 | 官方规范 |
|---|
工作原理
拆分意图、覆盖度与干扰
可操作 Rubric 应先列出用户需要的决策与必要子问题,再标注回答覆盖了哪些要点,并单独记录无关主张。问题包含多个要求时,完整性决定是否漏答;回答绕圈或把结论埋得很深时,直接性会下降。除非任务明确要求,文风、长度和关键词重合都只是较弱代理。
理解不同协议的分数
当前 Ragas Response Relevancy会从回答反向生成问题,并计算其与用户输入的 Embedding 平均相似度;ARES则把答案相关性作为独立分类任务,使用域内人工验证集与统计区间校准。两者可能给出不同排序,必须分别验证。
与正确性和拒答联合判断
答案相关性应与答案正确性、忠实度、引用质量和拒答正确性一起阅读。当前用户有权访问的证据不足时,拒答可能是最相关的行为;反之,表面直接的回答也可能属于不安全的越界作答。保留逐案例标签和问题切片,避免聚合分数掩盖多问题、歧义或不可回答失败。下方 Go 示例是用于覆盖度与干扰项的透明应用规则,并非 Ragas 或 ARES 算法。
主要特点
- 衡量回答与用户问题及目标结果的对齐程度
- 把必要要点覆盖与无关内容惩罚分开
- 不能证明事实正确、证据充分或操作已获授权
- 可通过 Rubric、反向问题相似度或训练后裁判估计
- 依赖查询意图、语言、评估器与聚合协议
- 应保留多问题和不可回答案例的逐项失败记录
常见用途
- 发现语言流畅但没有回答问题的响应
- 按同一任务规则比较简洁与冗长 RAG 回答
- 检查多部分问题中的每个必要字段是否被覆盖
- 为特定领域与语言校准相关性裁判
- 监控提示词或模型变更是否增加回避式或离题输出
示例
Loading code...常见问题
答案相关性等于答案正确性吗?
不等于。相关性判断回答是否覆盖问题和必要要点;正确性判断主张是否符合可信参考或判定器。错误回答可以很直接,正确段落也可能没有解决用户真正提出的任务。
答案相关性如何测量?
常见方法包括人工或 LLM Rubric、必要要点覆盖,以及反向问题相似度。Ragas 从回答生成问题并与原始输入比较 Embedding;ARES 则使用经过域内人工标签校准的学习型裁判。
回答越长,答案相关性越高吗?
不一定。只有满足必要要点的补充内容才有价值;无关主张会降低直接性,并引入新的正确性或忠实度风险。应分别评估覆盖和干扰,而不是奖励回答长度。
拒答应该算作不相关回答吗?
必须先标注可回答性。证据不足或请求不被允许时,拒答可以是正确且相关的响应;对证据充分的问题拒答则属于错误拒答,应在另一指标中单独统计。
不同框架的答案相关性分数可以直接比较吗?
只有问题集、语言、必要要点、裁判或 Embedding 模型、提示词、聚合方式和空回答策略一致时才可比较。同名指标可能隐藏不同算法,因此必须记录完整指标身份。