Rubric Feedback Bench
收藏资源简介:
Rubric Feedback Bench是由Komorebi AI Technologies创建的一个新颖评估数据集,包含42个精心设计的场景,用于研究基于结构化评分标准的反馈学习。该数据集涵盖五个不同的任务类别,主要涉及开放式写作,包括各种媒体的自定义写作风格分析、AI助手的行为准则以及道德推理任务等。每个任务类别都包含多维度的评分标准,具有明确的性能等级和权重分配,确保评估的一致性和可重复性。该数据集旨在通过模拟人类反馈,帮助语言模型从评分标准中学习并改进其表现,适用于自然语言处理和机器学习领域的研究。
Rubric Feedback Bench is a novel evaluation dataset created by Komorebi AI Technologies. It contains 42 carefully designed scenarios for research on feedback learning based on structured grading rubrics. The dataset covers five distinct task categories, primarily focusing on open-ended writing, including custom writing style analysis across various media, AI assistant code of conduct tasks, and moral reasoning tasks, among others. Each task category includes multi-dimensional grading rubrics, with clear performance tiers and weight assignments to ensure the consistency and reproducibility of evaluations. This dataset aims to help large language models learn from grading rubrics and improve their performance by simulating human feedback, and is applicable to research in the fields of natural language processing and machine learning.
Rubric Feedback Bench 数据集概述
数据集基本信息
- 数据集名称:Rubric Feedback Bench
- 发布者:Victor Gallego
- 发布日期:2025年
- 许可协议:MIT License
- 语言:英语 (en)
- 数据规模:小规模 (n<1K)
- 任务类别:文本生成
- 标签:rubric
数据集构成
- 总样本数:42
- 数据分割:仅包含训练集 (train)
- 数据集大小:197,589 字节
- 下载大小:23,297 字节
- 数据格式:JSON
- 特征字段:
prompt:需要被评估的任务描述或问题rubric:包含评分标准和表现等级的详细多维度评分细则task:任务类别
任务类别与内容
数据集包含42个场景,涵盖5个不同的任务组,每组包含8-10个共享同一高质量、细粒度评分细则的提示。
-
视觉写作 (8个提示)
- 焦点:分析媒体内容的视觉和摄影质量
- 评分细则:10分制,评估技术知识、特异性、影响评估、结构和写作质量
- 示例:电影评论、艺术品描述、电影场景分析、用户界面批评
-
混沌写作 (8个提示)
- 焦点:打破传统形式的实验性、非传统的创造性回应
- 评分细则:“反评分细则”,奖励碎片化、诗意和非传统的文本产物
- 示例:受达达主义启发的评论、元反思性评论、算法诗歌
-
类Claude行为 (10个提示)
- 焦点:评估对Claude特定个性特征和行为准则的遵守情况
- 评分细则:对帮助性、真实性、透明度、安全性和角色一致性的多维度评估
- 示例:编码协助、敏感话题处理、对话互动、格式精确性
-
结果主义宪法 (8个提示)
- 焦点:基于结果优化和功利主义原则的道德推理
- 评分细则:评估能最大化整体福祉和长期积极后果的决策
- 示例:涉及个人与集体利益权衡的道德困境
-
义务论宪法 (8个提示)
- 焦点:基于普遍义务和基于权利的伦理学的道德推理
- 评分细则:评估对道德规则的遵守(无论后果如何),强调人的尊严和权利
- 示例:测试对讲真话、信守承诺和绝对道德禁令的承诺的场景
主要特点
- 详细评分细则:每个任务组包含全面的评分细则,具有多维度评分标准、细粒度表现等级、具体行为描述符和加权评分系统。
- 评估器训练重点:专为能够提供基于详细评分细则的定量分数、生成解释分数背后原因的定性反馈,并在每个类别内保持跨相似任务一致性的LLM评估器设计。
- 多样化的任务复杂度:任务范围从简单的创意写作到复杂的伦理推理,确保评估器训练涵盖分析性任务、创造性任务、行为评估和道德推理。
主要用途
- 系统提示优化:使用文本批评迭代改进系统提示。
- 模型比较:系统比较LLM在不同任务类型上的表现。
- 评分细则开发:研究针对不同评估场景的有效评分细则设计。
评估方法
使用此数据集时,评估器模型应训练至能够:
- 解析评分细则以理解评分维度和标准。
- 分析给定提示在所有评分细则维度上的回应。
- 根据评分细则指南为每个维度分配定量分数。
- 生成解释分数并提供具体改进建议的文本反馈。
- 保持与评分细则评分哲学和示例的一致性。
质量保证
- 专家精心设计的评分细则:每个评分细则都针对特定的评估目标精心设计。
- 平衡的任务分布:各任务类别具有大致相等的代表性。
- 多样化的提示复杂度:从简单任务到复杂的多维度挑战。
- 清晰的评估标准:详细的绩效描述符以确保评分一致性。
引用信息
若在研究中使用此数据集,请引用: bibtex @dataset{gallego2025rubricfeedback, title={Rubric Feedback Bench}, author={Victor Gallego}, year={2025}, url={https://huggingface.co/datasets/vicgalle/rubric-feedback-bench} }




