RubricHub
收藏资源简介:
RubricHub是一个大规模(约110k)多领域的评分标准数据集,通过自动化的从粗到细的评分标准生成框架构建。该数据集结合了原则引导的合成、多模型聚合和难度演化,能够捕捉模型响应中的细微差别。数据集覆盖五个主要领域:医疗(27.1%)、科学(27.1%)、指令遵循、写作(15.9%)和聊天(9.0%),其中复杂领域如写作和医疗平均每个查询包含超过30个细粒度标准。
RubricHub is a large-scale (~110k) multi-domain grading rubric dataset constructed through an automated coarse-to-fine rubric generation framework. It integrates principle-guided synthesis, multi-model aggregation, and difficulty evolution, enabling it to capture subtle differences in model responses. The dataset covers five major domains: healthcare (27.1%), science (27.1%), instruction following, writing (15.9%), and chatting (9.0%). For complex domains such as writing and healthcare, each query contains an average of over 30 fine-grained rubrics.
RubricHub 数据集概述
数据集基本信息
- 数据集名称:RubricHub
- 核心内容:一个通过自动化“由粗到细”生成框架构建的大规模、多领域评分标准数据集。
- 数据规模:约 110,000 条高质量查询-评分标准对。
- 发布状态:数据集已发布。
- 论文状态:相关论文已发布。
- 许可证:Apache 2.0 许可证。
数据集详情
构建方法
数据集通过自动化由粗到细评分标准生成框架构建,该框架包含三个阶段:
- 原则引导与响应锚定生成:在特定响应上下文中合成标准,并由元原则引导,以防止生成通用或虚构的标准。
- 多模型聚合:聚合来自异构前沿模型(例如 GPT-5.1、Gemini 3 Pro)的视角,以消除单一来源的偏见。
- 难度演进:演进标准以捕捉“优秀”和“卓越”响应之间的细微差别,防止分数饱和。
领域分布
数据集涵盖五个主要领域:
- 🏥 医疗:27.1%
- 🔬 科学:27.1%
- 📝 指令遵循:比例未明确说明。
- ✍️ 写作:15.9%
- 💬 聊天:9.0%
数据特点
- 高密度监督:复杂领域(如写作和医疗)平均每个查询包含超过 30 个细粒度标准。
- 高区分性:旨在捕捉模型响应中的细微差别。
实验与应用
实验验证
- 基础模型:使用 Qwen3 基础模型进行验证。
- 关键结果:在 HealthBench 基准测试中,使用 RubricHub 进行后训练的 Qwen3-14B 模型取得了 69.3 的分数,超过了 GPT-5 (67.2)。
后训练流程
基于 RubricHub 提出了一个两阶段的后训练流程:
- RuFT:基于评分标准的拒绝采样微调。
- RuRL:基于评分标准的强化学习(使用评分标准分数作为密集奖励,基于
verl框架构建)。
获取与引用
- 数据集地址:https://huggingface.co/datasets/sojuL/RubricHub_v1
- 论文地址:https://arxiv.org/abs/2601.08430
- 引用格式: bibtex @article{li2026rubrichub, title={RubricHub: A Comprehensive and Highly Discriminative Rubric Dataset via Automated Coarse-to-Fine Generation}, author={Li, Sunzhu and Zhao, Jiale and Wei, Miteto and Ren, Huimin and Zhou, Yang and Yang, Jingwen and Liu, Shunyu and Zhang, Kaike and Chen, Wei}, journal={arXiv preprint arXiv:2601.08430}, year={2026} }
备注
- 数据合成代码及后训练代码即将发布。




