Farhannr28/Preprocessed-SemEval-2026-Task13
收藏资源简介:
--- dataset_info: features: - name: ID dtype: int64 - name: code dtype: string - name: language dtype: string - name: sanitized dtype: string - name: natural_language dtype: string - name: label dtype: class_label: names: '0': Human '1': DeepSeek-AI '2': Qwen '3': 01-ai '4': BigCode '5': Gemma '6': Phi '7': Meta-LLaMA '8': IBM-Granite '9': Mistral '10': OpenAI splits: - name: train num_bytes: 915890966 num_examples: 364460 - name: validation num_bytes: 357167271 num_examples: 100000 - name: test num_bytes: 1933130224 num_examples: 500000 - name: downsampled num_bytes: 190099017.76336497 num_examples: 75646 download_size: 1454991932 dataset_size: 3396287478.763365 configs: - config_name: default data_files: - split: train path: data/train-* - split: validation path: data/validation-* - split: test path: data/test-* - split: downsampled path: data/downsampled-* ---
数据集信息: ## 特征字段 1. ID:数据唯一标识符,类型为64位整数(int64) 2. code:代码文本,类型为字符串(string) 3. language:语言属性,类型为字符串(string) 4. sanitized:清洗后代码(sanitized),类型为字符串(string) 5. natural_language:自然语言文本,类型为字符串(string) 6. label:样本标签,类型为类别标签(class_label),对应类别名称如下: - 0: 人类 (Human) - 1: DeepSeek-AI - 2: Qwen - 3: 01-ai - 4: BigCode - 5: Gemma - 6: Phi - 7: Meta-LLaMA - 8: IBM-Granite - 9: Mistral - 10: OpenAI ## 数据划分 1. 训练集(train):数据量915,890,966字节,样本数364,460 2. 验证集(validation):数据量357,167,271字节,样本数100,000 3. 测试集(test):数据量1,933,130,224字节,样本数500,000 4. 下采样子集(downsampled):数据量190,099,017.76336497字节,样本数75,646 ## 全局参数 - 下载总大小:1,454,991,932字节 - 数据集总存储大小:3,396,287,478.763365字节 ## 配置项 默认配置(default)对应的数据集文件路径如下: - 训练集划分:`data/train-*` - 验证集划分:`data/validation-*` - 测试集划分:`data/test-*` - 下采样子集划分:`data/downsampled-*`



