本文为个人技术笔记,整理自对近两年(2024–2026)Rubric-based Evaluation(基于评分细则的评估方法)相关论文的调研。主要参考 RUC-NLPIR/Rubrics_Survey(《The Rules of the Game: A Survey of Rubrics for Large Language Models》)及文中列出的原始论文,具体出处见文末 References。

大语言模型(LLM)的能力边界正在从"回答问题"扩展到推理、工具调用、Agent 交互、深度研究等高度开放式的任务。在这些场景下,一个响应"好不好"往往没有唯一客观答案,用一个标量分数(1-5 分、pairwise 胜负)去概括它,正变得越来越力不从心:分数背后到底是哪里好、哪里不好?两个评委给出同样的 3 分,评判依据可能完全不同。这种"评估黑箱化"问题,催生了近两年 LLM 研究中一条愈发重要的方法论主线——Rubric(评分细则)。本文尝试系统梳理这条主线:它要解决什么问题、如何被构建、如何被用作训练奖励、又如何被用于评估基准与个性化对齐。

一、任务定义:LLM 评估到底在算什么

通用评估的形式化

抛开具体实现,“评估"这件事的本质是学习(或设计)一个打分函数。给定任务上下文 $x$(指令、问题、对话历史等)和模型给出的响应 $\hat{y}$,以及可选的参考答案 $y^*$,评估函数的目标是输出一个衡量响应质量的分数(常被归一化到 $[0,1]$ 区间):

$$ S = \Phi(\hat{y};\ x,\ y^*) \in \mathbb{R} $$

根据 $y^*$ 是否存在,评估范式可以分为两类:

  • Reference-based(有参考):$y^*$ 存在,$\Phi$ 通过比较 $\hat{y}$ 与 $y^*$ 的相似度打分,典型代表是 ROUGE、BLEU、BERTScore 等自动指标;
  • Reference-free(无参考):$y^*$ 不存在或不唯一(如开放式创作、Agent 决策),$\Phi$ 必须直接对 $\hat{y}$ 的质量做出判断,这正是当前主流的 LLM-as-a-Judge 场景,也是 Rubric-based Evaluation 主要发力的领域。

三类传统范式的局限

评估范式 代表方法 局限
自动指标 ROUGE / BLEU / BERTScore 依赖表层词汇匹配或单一参考答案,无法评估开放式、多维度的生成质量
人工评估 众包打分、专家评审 成本高、难以规模化,标注者间一致性(IAA)低,且评判依据难以复用与追溯
整体式 LLM-as-a-Judge 直接打 1-5 分 / 成对比较 黑盒、不可解释,容易受 prompt 措辞影响导致方差大,且在强化学习训练中容易被"奖励黑客”(reward hacking)钻空子

Rubric 的形式化改造:从整体打分到细则聚合

Rubric-based Evaluation 的核心思路,是把整体式的打分函数 $\Phi$ 拆解为一组独立、可核查的评分细则 $\mathcal{R} = \{r_1, r_2, \dots, r_K\}$。每一条细则 $r_k$ 本质是一个可以被明确验证的子问题(例如"响应是否给出了具体的代码示例?““是否遗漏了用户明确要求的约束条件?"),输出一个离散判断(通常是 Yes/No 或 0/1):

$$ r_k(\hat{y}, x) \in \{0, 1\},\quad k = 1, \dots, K $$

最终整体分数由所有细则的判断聚合而成,最简单的形式是均值聚合:

$$ S = \Phi(\hat{y}; x, \mathcal{R}) = \frac{1}{K}\sum_{k=1}^{K} \mathbb{1}\big[r_k(\hat{y}, x) = 1\big] $$

在实践中,聚合方式往往更复杂——例如按重要性加权、要求"关键项"全部满足才能得分(All-or-Nothing 聚合),或者用一个更强的模型对每条细则做 log-probability 打分(取输出 “Yes” token 的归一化概率 $p(\text{Yes})$ 而非硬性 0/1 判断)以获得更平滑的信号。这种"先拆解、再聚合"的设计,正是 Rubric 相比整体式打分能够同时提升可解释性(每一分都能追溯到具体标准)、一致性(标准被显式固定下来,不随 prompt 措辞漂移)与可复用性(同一套 rubric 可被复用在训练和评估的不同环节)的根本原因。

二、Rubric 研究的三级分类体系

参照 RUC-NLPIR 综述的组织方式,近两年的 Rubric 相关工作可以归纳为三大方向:

Rubrics for LLMs
├── Rubrics Construction(如何构建 Rubric)
│   ├── Direct Generation(直接生成)
│   ├── Contrastive Generation(对比式生成)
│   ├── Iterative Refinement(迭代精炼:验证驱动 / 结构化分解 / 去重压缩)
│   └── Online and Co-evolving Generation(在线协同演化)
├── Rubrics for Model Training(Rubric 用于模型训练)
│   ├── Rubrics for Policy Model Training(标准 Rubric-RL / 高级奖励设计)
│   └── Rubrics for Reward Model Training(可解释性 / 数据构建)
└── Rubrics for Evaluation(Rubric 用于评估)
    ├── 通用任务评估:推理 / 深度研究 / Agent 能力 / 对齐评估
    └── 特定任务评估:内容质量、安全审查、专业呈现、个性化偏好

三者并非割裂——同一套 rubric 生成方法,既可能被拿去训练一个策略模型(作为 RL 奖励),也可能被拿去评估另一个模型的输出(作为评测基准),下文按"构建 → 训练 → 评估 → 个性化"的脉络展开。

三、Rubric 如何构建(Construction)

Rubric 的构建方式经历了明显的演进:

直接生成(Direct Generation):给定任务,直接用一个强模型(或人工)针对该任务生成一组评分标准。早期工作如 FLASK(Ye et al., ICLR 2024 Spotlight)将粗粒度整体打分分解为逻辑思维、背景知识、问题处理、文本表达等多个技能维度的实例级评分标准;Prometheus(Kim et al., ICLR 2024)则进一步训练了一个专用评估模型,在给定自定义 rubric 的条件下打分能力可媲美 GPT-4。

图1:FLASK 的评估流程——为每个任务标注技能集、领域与难度,再让评估器针对每个技能维度分别打分(图片来源:Ye et al., FLASK, ICLR 2024)。

对比式生成(Contrastive Generation):直接生成的 rubric 容易"泛泛而谈”,缺乏判别力。对比式生成的思路是利用负样本反推出真正有区分度的标准——即一条好的 rubric 应当能让"好响应"通过、“坏响应"不通过。形式化地说,给定正样本 $y^+$(如用户真实撰写的响应)和一组负样本 $\mathcal{Y}^{-}$(其他方法生成的响应),理想的 rubric 集合 $\mathcal{R}$ 应当满足:

$$ S(y^+; \mathcal{R}) > S(y^-; \mathcal{R}), \quad \forall\, y^- \in \mathcal{Y}^{-} $$

即真实/优质响应的打分要显著高于负样本,这一思路后续被 PARL、CDRRM 等工作系统化为可优化的训练目标(详见第七节)。

迭代精炼(Iterative Refinement):通过验证驱动(生成后反过来检验 rubric 本身是否合理)、结构化分解(把复杂标准拆成更细的子项)、去重压缩(合并冗余标准)等手段持续优化 rubric 质量,代表工作如 Auto-Rubric、RubricHub 等。

在线协同演化(Online and Co-evolving Generation):rubric 生成器与策略模型交替优化,甚至引入对抗机制——如 RLAC(RL with Adversarial Critic)让一个"评判者"持续寻找当前 rubric 的漏洞,反过来推动 rubric 不断进化,是目前最前沿、最动态的构建范式。

四、Rubric 作为强化学习奖励(Rubric-as-Reward)

从 RLVR 到开放域

强化学习训练大模型的一大突破是 RLVR(Reinforcement Learning with Verifiable Rewards):在数学、代码等有明确对错答案的任务上,用"答案是否正确"这一可验证信号作为奖励,训练效果显著且不易被奖励黑客。但绝大多数真实任务(写作、开放式问答、Agent 决策)并不存在这样的"标准答案”,RLVR 无法直接套用。

Rubrics as Rewards(RaR,Gunjal et al., ICLR 2026) 是这条思路上影响力最大的工作之一:它把 RLVR 的"可验证奖励"替换为结构化的 rubric 反馈,让原本无法验证的开放域任务也能获得细粒度、可解释的训练信号。给定一组 rubric $\mathcal{R} = \{r_1, \dots, r_K\}$,策略模型的响应 $\hat{y}$ 得到的奖励可以写成对各条细则满足情况的聚合:

$$ R_{\text{RaR}}(\hat{y}) = \sum_{k=1}^{K} w_k \cdot \mathbb{1}\big[r_k(\hat{y}, x) = 1\big] $$
图2:Rubrics as Rewards(RaR)流程——左侧由 LLM 与人类专家共同生成带权重的 rubric,右侧策略模型的 rollout 由 LLM Judge 依据 rubric 打分并通过 GRPO 更新(图片来源:Gunjal et al., RaR, ICLR 2026)。

其中 $w_k$ 是每条细则的重要性权重。相比整体式 reward model 给出的单一标量,这种奖励天然具备可解释性:训练日志中可以清楚看到策略是在哪些细则上取得进步、又在哪些细则上停滞。

Checklist 反馈:RLCF

Checklists Are Better Than Reward Models(RLCF,Viswanathan et al., NeurIPS 2025) 提出了一条平行但独立验证的路径:从指令中自动提取 checklist(检查项清单),分别用语言模型和代码执行去验证响应对每一项的满足程度,再将结果汇总为奖励信号:

$$ R_{\text{RLCF}}(\hat{y}) = \frac{1}{K}\sum_{k=1}^{K} c_k(\hat{y}) $$
图3:RLCF 的 checklist 反馈流程——教师模型针对指令生成带权重的检查项清单,判别打分结果经 DPO 反馈给学生模型(图片来源:Viswanathan et al., RLCF, NeurIPS 2025)。

其中 $c_k(\hat{y}) \in [0,1]$ 是第 $k$ 项检查的满足程度(可以是模型判断的概率,也可以是代码执行结果的 0/1)。该工作最重要的实证贡献是证明了:在处理包含多重复杂约束的指令时,这种细粒度 checklist 反馈的对齐效果系统性优于传统的整体式 reward model——这也是"rubric/checklist 优于单一 RM"这一论点目前最直接、影响力最大的证据。

缓解 Reward Hacking:CARMO

无论是 RaR 还是 RLCF,如果 rubric 本身是跨样本固定的,策略模型仍有可能学会"应付标准"而非真正提升质量。CARMO(Gupta et al., Findings ACL 2025)提出"上下文感知奖励建模”:先根据具体上下文动态生成相关的评判标准,再用这些标准约束奖励模型打分。这种"先生成标准、再打分"的两阶段设计,理论分析表明能够缓解静态 rubric 容易被针对性利用的问题,在 RewardBench 上取得了当时的 SOTA 提升。

五、Rubric 用于评估基准与 Judge 元评测

除了作为训练信号,rubric 更早、更广泛的应用场景是评估基准本身。

  • LLM-Rubric(Hashemi et al., ACL 2024 Long):人工构造 9 维度评分 rubric,让 LLM 对每个问题输出概率分布,再训练一个小型前馈网络将多个 LLM 判断校准到不同人类评委的真实打分习惯上,为"评委异质性"问题提供了解决方案。
  • BiGGen Bench(Kim et al., NAACL 2025 最佳论文):覆盖 9 大能力、77 个任务的通用细粒度评测基准,核心创新是为每个测试实例单独设计评分 rubric,而非全数据集共用一套标准,显著提升评估的针对性,是当前"实例级 Rubric"评测基准的标杆工作。
  • JudgeBench(Tan et al., ICLR 2025):不评估模型本身,而是评估"LLM 作为裁判"这件事本身是否可靠,覆盖知识、推理、数学、代码等具有挑战性的响应对,用于诊断 LLM-as-Judge 范式自身的系统性偏差——这是打破"用 LLM 评 LLM"自证循环的重要元评测方向。
  • RUBRIC-MQM(Kim et al., ACL 2025 Industry):将机器翻译经典的 MQM 框架与 LLM-as-Judge 结合,做 span 级别(而非整句)的细粒度错误标注。
  • HealthBench(Arora et al., OpenAI, arXiv 2025)与 Decomposed Criteria-Based Evaluation(Yu et al., EMNLP 2025 Industry):分别面向医疗、法律等高风险专业领域,用大量专家撰写的 rubric 衡量回答的专业性与安全性,解决整体式指标在专业场景下失真的问题。
图4:BiGGen Bench 中不同任务(指令遵循、事实推理、工具使用等)均配备专属于该实例的评分标准示例(图片来源:Kim et al., BiGGen Bench, NAACL 2025)。

六、Rubric 在推荐系统场景中的落地

Rubric 拆解的思路并不局限于通用文本生成,也正在向推荐系统这一具体应用领域渗透——这一延伸恰好为下一节的"个性化"话题做了铺垫,因为推荐本身就是最典型的个性化任务。

生成式推荐系统(Gen-RecSys)把传统的"排序型推荐"扩展为可以直接生成解释、对话式推荐理由乃至完整多轮对话的开放式系统,这使得 NDCG、Recall@K 等传统排序指标不再能够覆盖新的评估维度:生成的推荐理由是否真实可信(factual grounding)、是否放大了偏见、是否符合平台合规要求。Deldjoo 等人在《Toward Holistic Evaluation of Recommender Systems Powered by Generative Models》(arXiv 2504.06667)中提出了面向 Gen-RecSys 的整体评估框架,主张用带有明确评分标准的 LLM-as-Judge 取代人工逐场景标注,覆盖相关性、事实一致性、偏见检测、政策合规等多个独立维度——这正是第一节"拆解-聚合"思想在推荐领域的具体化:把"这条推荐好不好"拆解为"是否相关、是否真实、是否安全、是否合规"等可分别核查的子问题。

图5:Gen-RecSys 整体评估框架——从“为什么评估”、“评估什么输出”、“如何评估”到“为谁而评估”四个维度组织多指标检查体系(图片来源:Deldjoo et al., arXiv 2504.06667)。

在训练侧,rubric-style 的多维奖励也开始被用于对话式推荐/协商类智能体的强化学习训练。例如美团提出的 UserLM-R1(Zhang et al., arXiv 2601.09215)在训练用户模拟器(user simulator,用于对话式推荐、协商等场景的智能体后训练环境)时,没有采用单一的整体对话质量分数作为奖励,而是让 LLM judge 从角色一致性、风格连贯性、策略合理性等多个独立维度分别打分再组合为多重奖励信号,这与第四节介绍的 RaR、RLCF 思路高度一致,表明 rubric-as-reward 的方法论正从通用对齐任务向对话式推荐、用户模拟等垂直场景延伸。

七、个性化 Rubric 评估:从"群体标准"到"千人千面"

前述所有工作有一个共同的隐含假设:评判标准是跨用户共享的——所有人对"什么是好的回答"看法一致。但对于写作风格、内容偏好等高度主观的任务,这个假设并不成立:同一篇文案,A 用户偏好简洁直接,B 用户偏好细腻抒情,用同一套 rubric 去评判两者显然不合理。

PARL(Preference-Aware Rubric Learning,Qiu et al.)把这个问题形式化为:给定用户 $u$ 的历史交互 $\mathcal{H}_u = \{(x_i, y_i)\}_{i=1}^n$($y_i$ 为该用户真实撰写的响应)与一个新的、没有真实答案的任务 $x$,评估函数需要衡量新响应 $\hat{y}$ 对该用户偏好的贴合程度:

$$ S = \Phi(\hat{y};\ x,\ \mathcal{H}_u) \in [0,1] $$

与第一节的通用形式化相比,PARL 用用户历史 $\mathcal{H}_u$ 替代了固定的参考答案 $y^*$,把"无参考评估"进一步细化为"以用户历史为隐式参照的个性化无参考评估"。为了让打分可验证,PARL 从 $\mathcal{H}_u$ 中归纳出该用户专属的 rubric 集合 $\mathcal{R}_u$,并用判别式强化学习锐化其判别边界,训练目标正是第三节提到的对比式生成思想的具体实现——让真实响应 $y_T$ 相对于负样本(其他生成方法的输出)获得显著更高的打分:

$$ \Gamma(\mathcal{R}_u) = \prod_{y' \in \mathcal{Y}_T^{\text{neg}}} \sigma\Big(\kappa \cdot \big(S(y_T; \mathcal{R}_u) - S(y'; \mathcal{R}_u)\big)\Big) $$

其中 $\sigma(\cdot)$ 为 sigmoid 函数,$\kappa$ 为温度系数。这一目标本质上与第三节的对比式判别不等式一脉相承,只是把"正/负样本"具体化为"用户真实响应 / 各类生成方法的输出"。

图6:PARL 整体框架——模块1从用户历史归纳并自验证 rubric,模块2通过判别式强化学习锐化其判别边界,最终输出满足代表性、用户一致性、判别性三大原则的个性化 rubric(图片来源:Qiu et al., PARL, arXiv 2605.31545)。

与 PARL 平行的工作还有 Tailoring LLMs to Individual Preferences(Zollo et al., ICLR 2025,从对齐算法层面探讨个体偏好建模)和 Evaluating LLMs by Individual Preferences(Garbacea et al., Findings of ACL 2026,正式提出"个性化基准测试"概念)。相比这两者,PARL 的差异化贡献在于把"代表性、用户一致性、判别性"形式化为三条可验证的设计原则,并给出了完整的"归纳—验证—判别式 RL"三段式实现,是目前个性化 rubric 评估方向上工程实现最完整的工作之一。不过值得注意的是,这类方法普遍存在一个方法论上的潜在张力:当训练目标(如上式的 $\Gamma$)与评估指标在结构上高度同构时,“性能提升"在多大程度上反映了真实的用户偏好对齐质量,而非训练与评估在同一套标准下的自我印证,仍是这一方向需要持续审视的问题。

八、趋势与开放问题

综合上述工作,当前 Rubric 相关研究呈现出以下几个值得关注的趋势与尚未解决的问题:

  1. Reward Hacking 尚未根治。无论是整体式 reward model 还是 rubric-based reward,只要奖励信号参与训练,就存在被"钻空子"的风险。CARMO、RLCF 等工作试图通过动态生成标准或细粒度检查表缓解,但尚无理论上完全杜绝此现象的方案。
  2. 训练目标与评估指标的同构性陷阱。当同一套 rubric 既是 RL 训练的奖励信号,又是最终效果的评估指标时,容易陷入"自我验证"式的循环论证——这一点在 PARL 等个性化评估工作中体现得尤为明显。JudgeBench、RubricEval 等专门评估"rubric/Judge 本身是否可靠"的元评测框架,是打破这一循环的重要方向。
  3. 评估偏差(Evaluation Bias)。LLM 评委本身可能带有位置偏差、长度偏好、自我偏好(偏爱自己生成的回答)等系统性偏差,需要专门的量化研究。
  4. 个性化仍是新兴方向。绝大多数现有 rubric 工作仍面向"通用、群体平均化"的质量标准,仅 PARL 等少数工作真正将"评判标准本身因人而异"作为核心命题,是一个快速发展但竞争尚不激烈的子方向。
  5. Rubric 安全性。当 rubric 被用于对齐训练时,其设计缺陷或被恶意诱导生成的偏差 rubric,可能被用来绕过安全对齐,这是一个与"越狱攻击"研究交叉的新兴议题。
  6. 构建方式的演进:从早期人工/直接生成固定 rubric,逐步演进到对比式生成、再到在线协同演化(甚至引入对抗机制)——整体趋势是让 rubric 生成过程本身变得更动态、更贴合具体任务/用户、更抗博弈。

九、总结

Rubric-based Evaluation 的核心贡献,是把"这个回答好不好"这个笼统问题,重新表述为"这个回答在哪些具体标准上达标、在哪些标准上不达标”——这一结构化改造同时惠及了模型的训练(作为可解释、抗黑客的奖励信号)与评估(作为可复用、可追溯的评测依据)两个环节。从 FLASK、Prometheus 等早期评估器工作,到 RaR、RLCF 将 rubric 引入强化学习训练,再到 PARL 等工作把"评判标准本身"也变成一个需要因人而异学习的对象,Rubric 正在从一个评估技巧演变为大语言模型对齐研究的一条主线方法论。它并非没有局限——训练与评估的同构性问题、reward hacking、评估偏差都还是开放挑战——但其"可分解、可解释、可复用"的设计哲学,很可能会持续影响下一代 LLM 评估基准与对齐算法的设计方式。

Citation

本文为个人调研整理笔记,核心内容参考 RUC-NLPIR/Rubrics_Survey(《The Rules of the Game: A Survey of Rubrics for Large Language Models》)及下列各论文原文整理而成,如需引用请以原始论文为准。

References

[1] Liu et al. “G-Eval: NLG Evaluation using GPT-4 with Better Human Alignment.” EMNLP 2023.

[2] Zheng et al. “Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena.” NeurIPS 2023.

[3] Ye et al. “FLASK: Fine-grained Language Model Evaluation based on Alignment Skill Sets.” ICLR 2024 (Spotlight).

[4] Kim et al. “Prometheus: Inducing Fine-grained Evaluation Capability in Language Models.” ICLR 2024.

[5] Hashemi et al. “LLM-Rubric: A Multidimensional, Calibrated Approach to Automated Evaluation of Natural Language Texts.” ACL 2024.

[6] Qin et al. “InFoBench: Evaluating Instruction Following Ability in Large Language Models.” Findings of ACL 2024.

[7] Fan et al. “SedarEval: Automated Evaluation using Self-Adaptive Rubrics.” Findings of EMNLP 2024.

[8] Mu et al. “Rule Based Rewards for Language Model Safety.” NeurIPS 2024.

[9] Lin et al. “WildBench: Benchmarking LLMs with Challenging Tasks from Real Users in the Wild.” ICLR 2025.

[10] Tan et al. “JudgeBench: A Benchmark for Evaluating LLM-based Judges.” ICLR 2025.

[11] Zollo et al. “Tailoring Language Models to Individual Preferences.” ICLR 2025.

[12] Kim et al. “The BiGGen Bench: A Principled Benchmark for Fine-grained Evaluation of Language Models with Language Models.” NAACL 2025 (Best Paper).

[13] Gupta et al. “CARMO: Dynamic Criteria Generation for Context-Aware Reward Modelling.” Findings of ACL 2025.

[14] Kim et al. “RUBRIC-MQM: Span-Level LLM-as-judge in Machine Translation.” ACL 2025 (Industry).

[15] Yu et al. “Decomposed Criteria-Based Evaluation of LLM Responses.” EMNLP 2025 (Industry).

[16] Arora et al. “HealthBench: Evaluating Large Language Models Towards Improved Human Health.” arXiv 2025 (OpenAI).

[17] Viswanathan et al. “Checklists Are Better Than Reward Models For Aligning Language Models.” NeurIPS 2025.

[18] Deldjoo et al. “Toward Holistic Evaluation of Recommender Systems Powered by Generative Models.” arXiv 2025.

[19] Zhang et al. “UserLM-R1: Modeling Human Reasoning in User Language Models with Multi-Reward Reinforcement Learning.” arXiv 2026(美团)。

[20] Garbacea et al. “Evaluating LLMs by Individual Preferences.” Findings of ACL 2026.

[21] Gunjal et al. “Rubrics as Rewards: Reinforcement Learning Beyond Verifiable Domains.” ICLR 2026.

[22] Qiu et al. “PARL: Preference-Aware Rubric Learning for Personalized Evaluation.” arXiv 2026.

[23] RUC-NLPIR. “Rubrics_Survey: The Rules of the Game — A Survey of Rubrics for Large Language Models.” 2026.