遇见数据集

unlearning-cleanslate/generations-qwen3-8b-simnpo-gentle-bm25-6t

收藏
Hugging Face2026-04-30 更新2026-05-03 收录
官方服务:

资源简介:

该数据集是一个用于评估AI模型推理能力的集合,包含多个配置。主要配置包括ARC挑战(arc_challenge)和BBH(Big-Bench Hard)的多个任务,如布尔表达式、因果判断、日期理解、消歧问答、Dyck语言、形式谬误、几何形状、超巴顿、逻辑推理(三、五、七对象)、电影推荐、多步算术、导航、对象计数、企鹅表格、彩色对象推理和名称毁损等。每个配置包含结构化特征,如问题、答案键、输入、目标、生成参数、响应、过滤响应、哈希值和分数。数据集用于训练和评估模型在复杂推理任务上的性能。

This dataset is a collection for evaluating AI model reasoning capabilities, comprising multiple configurations. Key configurations include ARC Challenge (arc_challenge) and various BBH (Big-Bench Hard) tasks such as boolean expressions, causal judgement, date understanding, disambiguation QA, Dyck languages, formal fallacies, geometric shapes, hyperbaton, logical deduction (three, five, seven objects), movie recommendation, multistep arithmetic, navigate, object counting, penguins in a table, reasoning about colored objects, and ruin names. Each configuration includes structured features like questions, answer keys, inputs, targets, generation arguments, responses, filtered responses, hash values, and scores. The dataset is used for training and assessing model performance on complex reasoning tasks.

提供机构:
unlearning-cleanslate
二维码
社区交流群
二维码
科研交流群
商业服务