相关数据集
m-a-p/MusicTheoryBench
MusicTheoryBench是一个基准测试,旨在评估当前大型语言模型在音乐理解方面的高级能力。数据集包含372个多项选择题,分为音乐知识和音乐推理两个子集。音乐知识子集涵盖东西方音乐的30个主题,如音符、节奏、和弦等,难度对应高中和大学音乐专业学生水平。音乐推理子集的问题需要音乐知识和推理能力,涉及和弦、旋律、音阶、节奏等的详细分析和多步逻辑推理。数据集由专业音乐教师根据大学教材和考试试卷制作
Hugging Face2024-03-01 更新1440
m-a-p/COIG-Writer
该数据集提供了一个高质量的中文创作与思考过程数据集,包含了各种类型的中文创意写作文本,每个文本都配有一个详细的“Query”(提示)和一个“Thought”(清晰的思考过程)。该数据集旨在解决机器生成文本中常见的“AI风味”问题,如逻辑不一致、缺乏个性、分析肤浅、语言过于繁琐或叙事发展薄弱等。主要目标是提供一个资源,帮助训练语言模型生成流畅、具有深度连贯性、个性、洞察力和复杂叙事结构的内容,更接近
Hugging Face2026-02-09 更新101
m-a-p/COIG-Kun
COIG-Kun数据集是用于训练语言模型的指令数据集,主要包含中文指令。数据集由三个子集组成:wudao、wanjuan和skypile,分别包含139,852、328,294和71,560个数据实例。每个数据实例以JSON格式存储,包含`instruction`和`output`两个字段。该数据集旨在提供高质量的指令数据,以增强语言模型的训练效果,特别是在指令理解和响应生成方面。
Hugging Face2024-04-08 更新520
m-a-p/CriticLeanBench
CriticLeanBench是一个全面的基准测试,旨在评估模型在将自然语言数学陈述翻译成Lean 4中形式化验证的定理声明方面的批判性推理能力。它包含500对经过人工验证的问题,涵盖了不同的数学领域和难度级别,并为错误样本提供了详细的错误注释。
Hugging Face2025-07-09 更新110



