nvarc-artifacts-puzzles
收藏资源简介:
该数据集包含四个子集(inputs、mixtures、outputs、summaries),每个子集均包含与推理相关的字段,如提示(prompt)、推理过程(reasoning)和完成结果(completion),以及混合名称、摘要名称、谜题名称、模型名称和推理级别等字段。数据规模较大,其中outputs子集样本数超过200万,可用于训练或评估模型在推理任务上的表现。
This dataset comprises four subsets: inputs, mixtures, outputs, and summaries. Each subset includes fields relevant to reasoning tasks, such as prompt, reasoning, and completion, alongside additional fields including mixture name, summary name, puzzle name, model name, and reasoning level. Boasting a large overall scale, the outputs subset alone contains over 2 million samples. This dataset is applicable for training or evaluating model performance on reasoning tasks.
数据集概述:ccde/nvarc-artifacts-puzzles
该数据集包含四个配置(config),每个配置对应不同的数据文件,所有配置均仅包含训练集(train)。
数据集配置详情
1. inputs(输入配置)
- 样本数:193,793 条
- 数据大小:约 13.05 GB(下载大小约 5.73 GB)
- 特征字段:
mix_name,summary_name1,summary_name2,puzzle_name1,puzzle_name2,model_name,reasoning_level,prompt,reasoning,completion(均为字符串类型) - 数据文件路径:
inputs/train-*
2. mixtures(混合配置)
- 样本数:266,593 条
- 数据大小:约 9.92 GB(下载大小约 4.27 GB)
- 特征字段:与
inputs配置相同(均为字符串类型) - 数据文件路径:
mixtures/train-*
3. outputs(输出配置)
- 样本数:2,050,249 条
- 数据大小:约 124.17 GB(下载大小约 37.44 GB)
- 特征字段:包含
inputs配置中的字段,并额外增加sid(整数类型) - 数据文件路径:
outputs/train-*
4. summaries(摘要配置)
- 样本数:3,263 条
- 数据大小:约 122.54 MB(下载大小约 46.38 MB)
- 特征字段:
summary_name,puzzle_name,model_name,reasoning_level,prompt,reasoning,completion(均为字符串类型) - 数据文件路径:
summaries/train-*
字段说明
- 标识字段:
mix_name,summary_name1,summary_name2,puzzle_name1,puzzle_name2,summary_name,puzzle_name,model_name,reasoning_level - 内容字段:
prompt,reasoning,completion - 特殊字段:
sid(仅存在于outputs配置中,为整数类型)
数据集用途推测
该数据集可能用于推理(reasoning)相关的任务,包含输入、混合、输出和摘要四个层级的数据,可能涉及谜题解答、模型推理能力的训练或评估。所有配置均只有训练集,无验证集或测试集划分。




