rl_data
收藏资源简介:
该数据集是一个问答相关数据集,包含问题(question)、数据来源(data_source)和问题反馈(question_feedback)等字段。数据集分为训练集(65221 条)、验证集(500 条)、自蒸馏集(29480 条)和过滤训练集(26826 条),共计约 12 万条样本。数据以 UUID 作为唯一标识,适用于问答模型训练、评估或反馈分析等任务。
This dataset is a question-answering related dataset, containing fields such as question, data_source, and question_feedback. The dataset is divided into training set (65221 samples), validation set (500 samples), self-distillation set (29480 samples), and filtered training set (26826 samples), totaling approximately 120,000 samples. Data is identified by UUID, suitable for tasks such as question-answering model training, evaluation, or feedback analysis.
数据集详情:formalmathatepfl/rl_data
数据集概述
该数据集由 formalmathatepfl 组织发布,主要面向强化学习(RL)相关的数学推理任务,包含问题文本及对应的反馈信息,可用于模型训练、验证与自蒸馏学习。
数据字段
- uuid(字符串):唯一标识符,用于区分每条数据。
- data_source(字符串):数据来源标识,表明数据的具体出处。
- question(字符串):数学问题描述,即模型的输入文本。
- question_feedback(字符串):针对问题的反馈信息,可能用于强化学习中的奖励或提示。
数据集划分
该数据集共包含四个划分(split),各自的数据量如下:
| 划分名称 | 样本数 | 大小(字节) |
|---|---|---|
| train | 65,221 | 161,263,160 |
| validation | 500 | 1,228,150 |
| self_distillation | 29,480 | 72,984,900 |
| train_filtered | 26,826 | 64,288,539 |
- train:训练集,样本量最大,用于模型的主训练。
- validation:验证集,样本量较小,用于模型性能验证。
- self_distillation:自蒸馏集,用于模型自身的知识蒸馏或迭代优化。
- train_filtered:过滤后的训练集,样本量少于原始训练集,可能经过质量筛选或去重。
数据集大小
- 总计数据大小:299,764,749 字节(约 299.76 MB)
- 下载大小:70,677,523 字节(约 70.68 MB)
数据文件说明
数据文件按划分存储,路径格式为 data/{split}-*,支持通过通配符加载全部相关文件。每个划分对应独立的数据文件集,便于分批次读取和使用。




