puzzles
收藏资源简介:
该数据集是一个文本数据集,包含5,702个样本,其中5,131个用于训练,571个用于测试。数据集涵盖五个核心字段:id(样本唯一标识符)、family(任务家族分类,包括cipher、gravity、roman、unit四种类别)、prompt(输入提示文本)、response(模型响应文本)和answer(参考答案文本)。数据以纯文本形式组织,适用于指令遵循、文本生成、问答系统等自然语言处理任务的训练与评估。数据按任务类型(family)进行了分类,便于针对特定任务进行模型训练或分析。
This dataset is a text dataset containing 5,702 samples, with 5,131 for training and 571 for testing. It includes five core fields: id (unique sample identifier), family (task family classification, covering categories such as cipher, gravity, roman, and unit), prompt (input prompt text), response (model response text), and answer (reference answer text). The data is organized in plain text format and is suitable for training and evaluation in natural language processing tasks such as instruction following, text generation, and question-answering systems. The data is classified by task type (family), facilitating model training or analysis for specific tasks.
- 数据集名称:
puzzles - 数据集地址:https://huggingface.co/datasets/cdtmc/puzzles
- 数据集特点:包含谜题类数据,每个样本由唯一标识、谜题类型、提示、正确答案和可选回复组成,适用于训练或评估模型在特定谜题任务上的表现。
- 数据规模:训练集 5131 条样本,测试集 571 条样本,总样本数 5702 条。
- 数据大小:下载大小约 5.95 MB,数据集总大小约 17.74 MB。
- 数据划分:分为
train和test两个子集。 - 数据字段:
id:字符串类型,样本唯一标识符。family:分类标签,包含 4 个类别,分别是cipher(密码类)、gravity(重力类)、roman(罗马类)、unit(单位类)。prompt:字符串类型,谜题的提示或题目内容。response:字符串类型,模型或用户对谜题的回复。answer:字符串类型,谜题的标准答案。




