MMLU-Pro 数据集是一个更强大且更具挑战性的大规模多任务理解数据集,旨在更严格地对大型语言模型的功能进行基准测试。该数据集包含 12K 个跨学科的复杂问题。该数据集由滑铁卢大学,多伦多大学,卡内基梅隆大学的研究人员于 2024 年发布,相关论文成果为「MMLU-Pro: A More Robust and Challenging Multi-Task Language Understandi
Morables-PD数据集是EMNLP 2025论文《Morables: A Benchmark for Assessing Abstract Moral Reasoning in LLMs with Fables》中使用的数据的公共领域版本,采用CC BY 4.0许可证发布。该数据集专门设计用于评估大型语言模型在抽象道德推理方面的能力。数据集包含308条记录,每条记录构成一个标题-寓言-寓意三