LLM-as-a-Judge(意为“大型语言模型作为评估器”,亦称基于大型语言模型的评估)是自然语言处理中的一种技术,即用大型语言模型(LLM)依据预先设定的标准,评估一段文本输出(通常由另一个模型生成)的质量、相关性或正确性。它被用作人工标注以及 BLEU、ROUGE 等基于参考、只衡量词面重叠而非语义的指标的一种可扩展、低成本替代方案。 该方法不再仅依赖人类标注者,而是利用大型语言模型的通用语言能力来充当自动评估器。 评估器通常返回一个数值分数或结论,并在许多实现中还为其输出的回复给出自然语言解释。 所报告的评估器与人类的一致程度堪比两名人类评分者之间的一致, 一种常见模式是用更强的模型评估较弱模型的输出,例如用 GPT-4 为一个 130 亿参数的 LLaMA 模型打分。 JudgeLM 则用 GPT-4 产生的判断数据进行训练, 而 Prometheus 系列模型则被训练为依据明确的量规为回答打分,并据报告,在同时提供参考答案与量规时其性能可接近 GPT-4。
评判不必依赖单一的纯文本模型。可以把来自不同模型家族的多个评估器组成一个评审团,使其投票相互抵消各自的偏差,如“LLM 评估器评审团”(panel of LLM evaluators),该方法也被视为缓解偏差的一种手段。 更小的、基于编码器的分类器可以直接输出标签、而不生成一段结论,这被认为能降低成本与延迟,如 JurEE,一个由小型专用编码器模型组成、专为评估而建的模型集成。 该方法还被扩展到多模态评估器,以评估文本连同图像或视频,包括 MLLM-as-a-Judge 基准、开源的 Prometheus-Vision 以及各种“视觉语言模型作为评估器”的方法。
可靠性
LLM 评估器的可靠性,是指其判断与人类判断相符、并保持稳定、无偏、可复现的程度。LLM 评估器表现出一系列系统性偏差、校准问题以及易受操纵的弱点,这些都使其难以作为人类评估的替代。 冗长(长度)偏差是指不论质量高低都偏好更长回答的倾向。当把回答改写得更长却不增加任何新信息时,像 Claude 和 GPT-3.5 这样的模型仍有超过 90% 的时候偏好更长的版本。 自我偏好(自我增强)偏差是指评估器更高地评价自己的模型输出、或同一模型家族输出的倾向,有时被称为“LLM 自恋”。 有观察发现 GPT-4 和 Claude 会给自己的输出更高评价,但这一早期证据被认为过于有限、不足以确证该效应; 评估器还倾向于偏袒格式规整或听起来权威的回答,
校准与可复现性
评估器的校准(即其自陈置信度与实际准确率之间的吻合程度)一直受到质疑。有研究报告称,GPT-4o 和 DeepSeek-R1 等模型作为评估器时往往过度自信; 校准通常以期望校准误差或布里尔分数来衡量。
与人类判断的一致性
LLM 评估器与人类评分者的一致性因任务而差异很大。一项覆盖 20 类自然语言处理任务的大规模研究得出结论:LLM 评估器尚不足够可靠,不能系统性地取代人类标注者。 在有可核验答案的任务上,差距可能很大:在 JudgeBench(评估器须从两个回答中选出更好者、且其中一个客观上正确的基准)上,包括 GPT-4o 在内的评估器仅略高于随机水平。 表面上很高的一致性也可能具有误导性,因为评估器可能出于错误的理由而与人类评分者一致,即依赖表面线索而非既定标准。 相比原始的百分比一致率,更推荐使用如科恩kappa系数这类经机遇校正的度量。 成对比较往往比逐点评分给出更可靠的结果, 没有任何单一手段能消除偏差,综述建议 LLM 评估器应作为人类评估的补充而非替代,尤其是在高风险场景中。
另一类基准则评估评估器本身。在把一个客观正确的回答与一个错误回答配对的 JudgeBench 上,许多强评估器识别出正确答案的比例仅略高于随机。 而基于 AI 反馈的强化学习(RLAIF)——基于人类反馈的强化学习的一种变体——用模型生成的偏好取代人类偏好标注。
除评估与训练外,LLM 评估器还支撑若干面向生产的用途。在安全审核中,模型依据一套安全风险分类法对提示或回答进行分类,如 Llama Guard 系列。 在检索增强生成中,无参考的评估器检查生成的答案是否被检索到的上下文所支持,如 RAGAS 框架。 评估器还被用于评判智能体的行动轨迹, 以及为生产监控给记录下来的模型流量打分。
与相关方法的比较
与更早的、基于参考的 n 元语法指标(如 BLEU 和 ROUGE,它们依赖与参考文本之间透明的、基于规则的重叠)相比,LLM 评估器能捕捉更深层的语义一致,但这是经由模型不透明的内部推理实现的,以可解释性换取对语义的敏感。 人类评估仍是检验评估器的基准标准,综述也普遍建议 LLM 评估器应作为其补充而非替代。
参见
- 人工智能对齐
- BLEU
- 生成式人工智能
- 大型语言模型
- 基于人类反馈的强化学习
参考文献
外部链接
- [https://github.com/CSHaitao/Awesome-LLMs-as-Judges Awesome-LLMs-as-Judges] —— LLM-as-a-judge 研究的精选文献汇编。
- [https://huggingface.co/spaces/OpenEvals/evaluation-guidebook Hugging Face 大语言模型评估指南] —— 一份关于评估语言模型的教学指南。
评论 (0)