什么是 LLM-as-Judge?
LLM-as-Judge 是一种概率型评估方法:由大语言模型依据已声明的 Rubric 和有界证据,对一个或多个候选输出进行判断。它的 Verdict 是需要人工校准和错误分析的测量结果,不是 Ground Truth,也不能作为授权依据。
快速了解
| 全称 | 大语言模型评委(Large Language Model as Judge) |
|---|---|
| 创建时间 | 该概念在 2023 年随着加州大学伯克利分校的论文《Judging LLM-as-a-Judge》而广泛流行 |
工作原理
当 Exact Match、ROUGE、BLEU、执行测试或 Schema 检查无法完整表达目标质量时,LLM-as-Judge 可用于评估开放式输出。Pointwise 模式评估单个候选,Pairwise 模式比较候选,参考或证据引导模式则把声明与获批证据或预期结构进行核对。生产实现应把任务集、切片定义、Rubric、Judge 模型、Judge Prompt、Parser、证据策略、采样策略、推理参数和运行环境版本化为一个 Judge Contract,再用人工审核控制集测量分类错误、复核覆盖率、换序一致性,以及各风险和任务切片的样本支持度。该方法会受到位置、冗长、风格、身份、参考锚定、自我偏好、Prompt Injection、Rubric 选项顺序和多标准顺序影响。随机化、换序测试、结构化输出和多个 Judge 能暴露或降低部分故障,但都不能建立真值;在适用范围内,确定性 Oracle 和人工 Oracle 仍是权威依据。
主要特点
- 依据版本化 Rubric 和有界证据评估一个明确构念
- 支持 Pointwise、Pairwise 和参考或证据引导协议
- 输出经过 Schema 校验的 pass、fail、review 或 evaluation-error,而不是无边界理由
- 需要人工审核控制集,并分别记录人工之间和 Judge 与人工之间的分歧
- 报告误通过、误拒绝、复核覆盖、换序一致性和切片支持度,而不是一个通用准确率
- Judge 模型、Prompt、Rubric、Parser、证据格式或任务分布变化时必须重新校准
常见用途
- 开放式生成任务的 Prompt 和模型回归测试
- 评估 RAG 的证据支持、答案正确性和安全拒答
- 在受控 A/B 实验中对两个候选进行 Pairwise 比较
- 将生产采样输出分流为通过、失败或人工复核
- 在单独提供工具结果和轨迹证据时评估 Agent
- 仅在通过人工控制集验证的协议内生成合成偏好标签
示例
Loading code...常见问题
LLM-as-Judge 与人工评估相比有多准确?
不存在可迁移的通用准确率。论文报告的一致率只属于其 Judge 模型、Prompt、任务集、标签分布和人工协议。应在目标任务的人工审核控制集上测量候选 Judge,并报告分类错误、复核覆盖率、切片支持度与不确定性。
Pairwise Judge 一定比 Pointwise Judge 更可靠吗?
不一定。Pairwise 能简化相对选择,但不测量绝对质量,仍会受候选顺序、平局、Judge 身份和 Rubric 设计影响。应根据评估构念选择模式,并在目标工作负载上验证。
Pairwise 换序结果应该如何合并?
两轮都要先把 LEFT 或 RIGHT 映射回不可变候选 ID。只有候选 A 在两个展示顺序中都获胜,才能判定 A 稳定胜出;如果两轮都是同一展示位置获胜,实际赢家 ID 不同,属于位置敏感,应进入复核。
多个 LLM Judge 能消除评估偏差吗?
不能。多个 Judge 可能共享训练数据、偏好、Rubric 缺陷和系统性盲点。应保留分歧,让每种协议都与人工控制集比较,并把无支持或高影响案例升级复核,而不是把投票平均成表面确定性。
什么变化会触发 LLM Judge 重新校准?
Judge 模型或版本、Judge Prompt、Rubric、Parser、证据格式、推理参数、候选生成策略或生产任务分布变化时都应重新校准。某种语言、风险等级或任务上的批准不会自动迁移到其他切片。