OrionLLM/OpenCodeReasoning-mini
收藏资源简介:
--- dataset_info: features: - name: input dtype: string - name: output dtype: string - name: language dtype: string splits: - name: train num_bytes: 509326226 num_examples: 20000 download_size: 217446226 dataset_size: 509326226 configs: - config_name: default data_files: - split: train path: data/train-* license: apache-2.0 tags: - code size_categories: - 10K<n<100K --- # OpenCodeReasoning-mini OpenCodeReasoning-mini is a small subset of [OpenCodeReasoning](https://huggingface.co/datasets/nvidia/OpenCodeReasoning). OpenCodeReasoning-mini is designed for supervised fine-tuning (SFT). ## Dataset Composition This dataset contains a balanced collection of: - **10,000 Python examples** - **10,000 C++ examples**
--- 数据集信息: 数据特征: - 名称:输入(input),数据类型:字符串(string) - 名称:输出(output),数据类型:字符串(string) - 名称:语言(language),数据类型:字符串(string) 数据集划分: - 名称:训练集(train),占用字节数:509326226,样本数量:20000 下载大小:217446226 数据集总大小:509326226 配置项: - 配置名称:默认(default),数据文件: - 划分:训练集(train),路径:data/train-* 许可证:Apache-2.0 标签: - 代码(code) 规模分类: - 10K<n<100K --- # OpenCodeReasoning-mini(开源代码推理迷你版) OpenCodeReasoning-mini(开源代码推理迷你版)是[OpenCodeReasoning](https://huggingface.co/datasets/nvidia/OpenCodeReasoning)的小型子集,专为监督微调(SFT)场景设计。 ## 数据集构成 本数据集包含均衡分布的样本集合: - **10000个Python示例** - **10000个C++示例**



