相关数据集
m-a-p/MusicTheoryBench
MusicTheoryBench是一个基准测试,旨在评估当前大型语言模型在音乐理解方面的高级能力。数据集包含372个多项选择题,分为音乐知识和音乐推理两个子集。音乐知识子集涵盖东西方音乐的30个主题,如音符、节奏、和弦等,难度对应高中和大学音乐专业学生水平。音乐推理子集的问题需要音乐知识和推理能力,涉及和弦、旋律、音阶、节奏等的详细分析和多步逻辑推理。数据集由专业音乐教师根据大学教材和考试试卷制作
Hugging Face2024-03-01 更新1440
m-a-p/CodeFeedback-Filtered-Instruction
--- language: - en pipeline_tag: text-generation tags: - code license: apache-2.0 task_categories: - question-answering size_categories: - 10K OpenCodeInterpreter: Inte
Hugging Face2024-02-26 更新390
m-a-p/Writing-Preference-Bench
WritingPreferenceBench是一个跨语种基准数据集,用于评估语言模型在识别主观写作质量方面的能力,如创造性、风格复杂性和情感共鸣,同时中性化语法、事实性和长度等客观信号。该数据集包含1800个人类验证的偏好对,分布在8个创意写作体裁和51个细粒度类别中。
Hugging Face2025-10-17 更新130
m-a-p/COIG-Kun
COIG-Kun数据集是用于训练语言模型的指令数据集,主要包含中文指令。数据集由三个子集组成:wudao、wanjuan和skypile,分别包含139,852、328,294和71,560个数据实例。每个数据实例以JSON格式存储,包含`instruction`和`output`两个字段。该数据集旨在提供高质量的指令数据,以增强语言模型的训练效果,特别是在指令理解和响应生成方面。
Hugging Face2024-04-08 更新520
m-a-p/GIEBench
GIE-Bench数据集是一个综合性的基准测试,包含11个身份维度,覆盖97个群体身份,总共有999个与特定群体身份相关的单选题。该数据集旨在评估大型语言模型(LLMs)在面对特定群体身份(如性别、年龄、职业和种族)时的共情能力,强调其从特定群体立场回应的能力。数据集通过使用网络资源、手动选择和GPT-4生成有争议的话题,并从这些身份的视角标注态度标签。此外,还使用GPT-4为每个话题生成四个回答
Hugging Face2024-06-23 更新230



