遇见数据集

arithmetic-circuit-overloading/synthetic-dataset-2d-1M-100K-0.1-reverse-padzero

收藏
Hugging Face2026-02-26 更新2026-03-29 收录
官方服务:

资源简介:

--- dataset_info: - config_name: '100' features: - name: _id dtype: string - name: base_operation dtype: string - name: target_operation dtype: string - name: fs_examples list: string - name: question dtype: string - name: answer dtype: string - name: prompt dtype: string splits: - name: train num_bytes: 236326350 num_examples: 1000000 - name: validation num_bytes: 23336637 num_examples: 100000 download_size: 103802626 dataset_size: 259662987 - config_name: mul-sub-50 features: - name: _id dtype: string - name: base_operation dtype: string - name: target_operation dtype: string - name: fs_examples list: string - name: question dtype: string - name: answer dtype: string - name: prompt dtype: string splits: - name: train num_bytes: 237623158 num_examples: 1000000 - name: validation num_bytes: 23464057 num_examples: 100000 download_size: 106932254 dataset_size: 261087215 - config_name: mul-sub-75 features: - name: _id dtype: string - name: base_operation dtype: string - name: target_operation dtype: string - name: fs_examples list: string - name: question dtype: string - name: answer dtype: string - name: prompt dtype: string splits: - name: train num_bytes: 236975683 num_examples: 1000000 - name: validation num_bytes: 23400499 num_examples: 100000 download_size: 106804681 dataset_size: 260376182 - config_name: mul-sub-90 features: - name: _id dtype: string - name: base_operation dtype: string - name: target_operation dtype: string - name: fs_examples list: string - name: question dtype: string - name: answer dtype: string - name: prompt dtype: string splits: - name: train num_bytes: 236582963 num_examples: 1000000 - name: validation num_bytes: 23363162 num_examples: 100000 download_size: 106129937 dataset_size: 259946125 - config_name: mul-sub-95 features: - name: _id dtype: string - name: base_operation dtype: string - name: target_operation dtype: string - name: fs_examples list: string - name: question dtype: string - name: answer dtype: string - name: prompt dtype: string splits: - name: train num_bytes: 236455797 num_examples: 1000000 - name: validation num_bytes: 23349720 num_examples: 100000 download_size: 105819584 dataset_size: 259805517 - config_name: mul-sub-99 features: - name: _id dtype: string - name: base_operation dtype: string - name: target_operation dtype: string - name: fs_examples list: string - name: question dtype: string - name: answer dtype: string - name: prompt dtype: string splits: - name: train num_bytes: 236351684 num_examples: 1000000 - name: validation num_bytes: 23339886 num_examples: 100000 download_size: 105066385 dataset_size: 259691570 - config_name: plus-mul-50 features: - name: _id dtype: string - name: base_operation dtype: string - name: target_operation dtype: string - name: fs_examples list: string - name: question dtype: string - name: answer dtype: string - name: prompt dtype: string splits: - name: train num_bytes: 238365718 num_examples: 1000000 - name: validation num_bytes: 23538174 num_examples: 100000 download_size: 106898365 dataset_size: 261903892 - config_name: plus-mul-75 features: - name: _id dtype: string - name: base_operation dtype: string - name: target_operation dtype: string - name: fs_examples list: string - name: question dtype: string - name: answer dtype: string - name: prompt dtype: string splits: - name: train num_bytes: 237342454 num_examples: 1000000 - name: validation num_bytes: 23437405 num_examples: 100000 download_size: 106742880 dataset_size: 260779859 - config_name: plus-mul-90 features: - name: _id dtype: string - name: base_operation dtype: string - name: target_operation dtype: string - name: fs_examples list: string - name: question dtype: string - name: answer dtype: string - name: prompt dtype: string splits: - name: train num_bytes: 236731114 num_examples: 1000000 - name: validation num_bytes: 23378123 num_examples: 100000 download_size: 106130256 dataset_size: 260109237 - config_name: plus-mul-95 features: - name: _id dtype: string - name: base_operation dtype: string - name: target_operation dtype: string - name: fs_examples list: string - name: question dtype: string - name: answer dtype: string - name: prompt dtype: string splits: - name: train num_bytes: 236529753 num_examples: 1000000 - name: validation num_bytes: 23357353 num_examples: 100000 download_size: 105796335 dataset_size: 259887106 - config_name: plus-mul-99 features: - name: _id dtype: string - name: base_operation dtype: string - name: target_operation dtype: string - name: fs_examples list: string - name: question dtype: string - name: answer dtype: string - name: prompt dtype: string splits: - name: train num_bytes: 236367384 num_examples: 1000000 - name: validation num_bytes: 23341373 num_examples: 100000 download_size: 105016651 dataset_size: 259708757 - config_name: plus-mul-sub-50 features: - name: _id dtype: string - name: base_operation dtype: string - name: target_operation dtype: string - name: fs_examples list: string - name: question dtype: string - name: answer dtype: string - name: prompt dtype: string splits: - name: train num_bytes: 236322698 num_examples: 1000000 - name: validation num_bytes: 23333364 num_examples: 100000 download_size: 109272189 dataset_size: 259656062 - config_name: plus-mul-sub-75 features: - name: _id dtype: string - name: base_operation dtype: string - name: target_operation dtype: string - name: fs_examples list: string - name: question dtype: string - name: answer dtype: string - name: prompt dtype: string splits: - name: train num_bytes: 236319278 num_examples: 1000000 - name: validation num_bytes: 23335215 num_examples: 100000 download_size: 108679896 dataset_size: 259654493 - config_name: plus-mul-sub-90 features: - name: _id dtype: string - name: base_operation dtype: string - name: target_operation dtype: string - name: fs_examples list: string - name: question dtype: string - name: answer dtype: string - name: prompt dtype: string splits: - name: train num_bytes: 236324666 num_examples: 1000000 - name: validation num_bytes: 23336884 num_examples: 100000 download_size: 107796059 dataset_size: 259661550 - config_name: plus-mul-sub-95 features: - name: _id dtype: string - name: base_operation dtype: string - name: target_operation dtype: string - name: fs_examples list: string - name: question dtype: string - name: answer dtype: string - name: prompt dtype: string splits: - name: train num_bytes: 236325098 num_examples: 1000000 - name: validation num_bytes: 23336558 num_examples: 100000 download_size: 107005092 dataset_size: 259661656 - config_name: plus-mul-sub-99 features: - name: _id dtype: string - name: base_operation dtype: string - name: target_operation dtype: string - name: fs_examples list: string - name: question dtype: string - name: answer dtype: string - name: prompt dtype: string splits: - name: train num_bytes: 236325838 num_examples: 1000000 - name: validation num_bytes: 23337325 num_examples: 100000 download_size: 105267785 dataset_size: 259663163 - config_name: plus-sub-50 features: - name: _id dtype: string - name: base_operation dtype: string - name: target_operation dtype: string - name: fs_examples list: string - name: question dtype: string - name: answer dtype: string - name: prompt dtype: string splits: - name: train num_bytes: 233023448 num_examples: 1000000 - name: validation num_bytes: 23004316 num_examples: 100000 download_size: 103769210 dataset_size: 256027764 - config_name: plus-sub-75 features: - name: _id dtype: string - name: base_operation dtype: string - name: target_operation dtype: string - name: fs_examples list: string - name: question dtype: string - name: answer dtype: string - name: prompt dtype: string splits: - name: train num_bytes: 234674574 num_examples: 1000000 - name: validation num_bytes: 23171121 num_examples: 100000 download_size: 104898971 dataset_size: 257845695 - config_name: plus-sub-90 features: - name: _id dtype: string - name: base_operation dtype: string - name: target_operation dtype: string - name: fs_examples list: string - name: question dtype: string - name: answer dtype: string - name: prompt dtype: string splits: - name: train num_bytes: 235662679 num_examples: 1000000 - name: validation num_bytes: 23271230 num_examples: 100000 download_size: 105350088 dataset_size: 258933909 - config_name: plus-sub-95 features: - name: _id dtype: string - name: base_operation dtype: string - name: target_operation dtype: string - name: fs_examples list: string - name: question dtype: string - name: answer dtype: string - name: prompt dtype: string splits: - name: train num_bytes: 235995616 num_examples: 1000000 - name: validation num_bytes: 23303846 num_examples: 100000 download_size: 105359456 dataset_size: 259299462 - config_name: plus-sub-99 features: - name: _id dtype: string - name: base_operation dtype: string - name: target_operation dtype: string - name: fs_examples list: string - name: question dtype: string - name: answer dtype: string - name: prompt dtype: string splits: - name: train num_bytes: 236259923 num_examples: 1000000 - name: validation num_bytes: 23330744 num_examples: 100000 download_size: 104932866 dataset_size: 259590667 configs: - config_name: '100' data_files: - split: train path: 100/train-* - split: validation path: 100/validation-* - config_name: mul-sub-50 data_files: - split: train path: mul-sub-50/train-* - split: validation path: mul-sub-50/validation-* - config_name: mul-sub-75 data_files: - split: train path: mul-sub-75/train-* - split: validation path: mul-sub-75/validation-* - config_name: mul-sub-90 data_files: - split: train path: mul-sub-90/train-* - split: validation path: mul-sub-90/validation-* - config_name: mul-sub-95 data_files: - split: train path: mul-sub-95/train-* - split: validation path: mul-sub-95/validation-* - config_name: mul-sub-99 data_files: - split: train path: mul-sub-99/train-* - split: validation path: mul-sub-99/validation-* - config_name: plus-mul-50 data_files: - split: train path: plus-mul-50/train-* - split: validation path: plus-mul-50/validation-* - config_name: plus-mul-75 data_files: - split: train path: plus-mul-75/train-* - split: validation path: plus-mul-75/validation-* - config_name: plus-mul-90 data_files: - split: train path: plus-mul-90/train-* - split: validation path: plus-mul-90/validation-* - config_name: plus-mul-95 data_files: - split: train path: plus-mul-95/train-* - split: validation path: plus-mul-95/validation-* - config_name: plus-mul-99 data_files: - split: train path: plus-mul-99/train-* - split: validation path: plus-mul-99/validation-* - config_name: plus-mul-sub-50 data_files: - split: train path: plus-mul-sub-50/train-* - split: validation path: plus-mul-sub-50/validation-* - config_name: plus-mul-sub-75 data_files: - split: train path: plus-mul-sub-75/train-* - split: validation path: plus-mul-sub-75/validation-* - config_name: plus-mul-sub-90 data_files: - split: train path: plus-mul-sub-90/train-* - split: validation path: plus-mul-sub-90/validation-* - config_name: plus-mul-sub-95 data_files: - split: train path: plus-mul-sub-95/train-* - split: validation path: plus-mul-sub-95/validation-* - config_name: plus-mul-sub-99 data_files: - split: train path: plus-mul-sub-99/train-* - split: validation path: plus-mul-sub-99/validation-* - config_name: plus-sub-50 data_files: - split: train path: plus-sub-50/train-* - split: validation path: plus-sub-50/validation-* - config_name: plus-sub-75 data_files: - split: train path: plus-sub-75/train-* - split: validation path: plus-sub-75/validation-* - config_name: plus-sub-90 data_files: - split: train path: plus-sub-90/train-* - split: validation path: plus-sub-90/validation-* - config_name: plus-sub-95 data_files: - split: train path: plus-sub-95/train-* - split: validation path: plus-sub-95/validation-* - config_name: plus-sub-99 data_files: - split: train path: plus-sub-99/train-* - split: validation path: plus-sub-99/validation-* ---

该数据集包含多组配置子集,所有配置子集的特征字段结构完全统一,具体如下: 每个样本包含以下7个字段: 1. `_id`:数据类型为字符串,为样本唯一标识符 2. `base_operation`:数据类型为字符串,代表基础操作文本 3. `target_operation`:数据类型为字符串,代表目标操作文本 4. `fs_examples`:数据类型为字符串列表,存储少样本示例(few-shot examples)集合 5. `question`:数据类型为字符串,为问题文本 6. `answer`:数据类型为字符串,为对应问题的答案文本 7. `prompt`:数据类型为字符串,为模型输入提示词文本 每组配置子集均包含训练集与验证集两个数据划分: - 训练集:样本数量固定为1000000,字节大小随配置不同存在差异 - 验证集:样本数量固定为100000,字节大小随配置不同存在差异 同时每组配置均标注了单独的下载总大小与数据集总大小。 该数据集的所有配置子集及其对应的数据文件路径规则如下: 每个配置子集的训练集文件路径格式为`{配置名称}/train-*`,验证集文件路径格式为`{配置名称}/validation-*`,其中配置名称涵盖`100`、`mul-sub-50`、`mul-sub-75`、`mul-sub-90`、`mul-sub-95`、`mul-sub-99`、`plus-mul-50`、`plus-mul-75`、`plus-mul-90`、`plus-mul-95`、`plus-mul-99`、`plus-mul-sub-50`、`plus-mul-sub-75`、`plus-mul-sub-90`、`plus-mul-sub-95`、`plus-mul-sub-99`、`plus-sub-50`、`plus-sub-75`、`plus-sub-90`、`plus-sub-95`、`plus-sub-99`。

二维码
社区交流群
二维码
科研交流群
商业服务