group2sealion/uet_iai_nlp_data_for_llms
收藏资源简介:
--- license: apache-2.0 dataset_info: features: - name: 'Unnamed: 0' dtype: int64 - name: text dtype: string - name: timestamp dtype: string - name: url dtype: string - name: label dtype: int64 splits: - name: train num_bytes: 2442035868 num_examples: 589988 download_size: 1250972059 dataset_size: 2442035868 configs: - config_name: default data_files: - split: train path: data/train-* --- Data sources come from the following categories: 1.Web crawler dataset: - Website UET (ĐH Công nghệ): tuyensinh.uet.vnu.edu.vn; new.uet.vnu.edu.vn - Website HUS (ĐH KHTN): hus.vnu.edu.vn - Website EUB (ĐH Kinh tế): ueb.vnu.edu.vn - Website IS (ĐH Quốc tế): is.vnu.edu.vn - Website Eduacation (ĐH Giáo dục): education.vnu.edu.vn - Website NXB ĐHQG: press.vnu.edu.vn [List domain web crawler](https://docs.google.com/spreadsheets/d/1zbkltkSPRm6f48Lb1Jo3Njq1-LrSd8H6/edit?gid=409337688#gid=409337688) 2. CC100: [link to CC100 vi](https://huggingface.co/datasets/statmt/cc100) 3. Vietnews: [link to bk vietnews dataset](https://github.com/ThanhChinhBK/vietnews) 4. C4_vi: [link to C4_vi](https://huggingface.co/datasets/allenai/c4) Folder Toxic store files demo for toxic filtering.We filtered C4_validation dataset, vietnews samples dataset and a part(1/50) of CC100_vi dataset.After the process, datasets split into nontoxic part and toxic part. Folder Dedup store files after the deduplication process of above files. Folder Toxic_2, Dedup_2, Tokenized_2 is the result of the second process that we executed on 17 files of C4_vi dataset wich contains 1b tokens Folders with index 3 and final is the best result of filtering C4_vi which contains 1,156,218,780 from first 20 files
--- 许可证:Apache-2.0 数据集信息: 特征字段: - 名称:Unnamed: 0(未命名列0),数据类型:int64 - 名称:text(文本),数据类型:string - 名称:timestamp(时间戳),数据类型:string - 名称:url(统一资源定位符),数据类型:string - 名称:label(标签),数据类型:int64 划分集: - 名称:train(训练集),字节数:2442035868,样本数:589988 下载大小:1250972059 数据集存储大小:2442035868 配置项: - 配置名称:default(默认配置),数据文件: - 划分集:train,路径:data/train-* --- 本数据集的数据来源涵盖以下类别: 1. 网络爬虫数据集: - UET网站(越南河内国家大学工程技术大学):tuyensinh.uet.vnu.edu.vn、new.uet.vnu.edu.vn - HUS网站(越南河内国家大学自然科学大学):hus.vnu.edu.vn - EUB网站(越南河内国家大学经济大学):ueb.vnu.edu.vn - IS网站(越南河内国家大学国际学院):is.vnu.edu.vn - 教育类网站(越南河内国家大学教育大学):education.vnu.edu.vn - 越南国家大学出版社(NXB ĐHQG):press.vnu.edu.vn [网络爬虫域名列表](https://docs.google.com/spreadsheets/d/1zbkltkSPRm6f48Lb1Jo3Njq1-LrSd8H6/edit?gid=409337688#gid=409337688) 2. CC100数据集: [CC100越南语子集链接](https://huggingface.co/datasets/statmt/cc100) 3. Vietnews数据集: [bk vietnews数据集链接](https://github.com/ThanhChinhBK/vietnews) 4. C4_vi数据集: [C4_vi数据集链接](https://huggingface.co/datasets/allenai/c4) Toxic文件夹用于存放毒性过滤相关的演示文件:我们对C4_validation数据集、Vietnews样本数据集以及CC100_vi数据集的1/50部分进行了过滤处理,处理后将数据集划分为无毒样本子集与有毒样本子集。 Dedup文件夹用于存放上述文件经过去重处理后的结果。 Toxic_2、Dedup_2与Tokenized_2文件夹为我们对包含10亿Token的C4_vi数据集的17个文件执行第二轮处理后的结果。 带有索引3与final后缀的文件夹为针对C4_vi数据集前20个文件进行过滤后的最优结果,共包含1,156,218,780条样本。



