WikiQuality/frac_unique_trigrams_lo
收藏资源简介:
--- dataset_info: - config_name: am features: - name: id dtype: string - name: url dtype: string - name: title dtype: string - name: text dtype: string splits: - name: train num_bytes: 5827567.9346160395 num_examples: 3268 - name: test num_bytes: 308497.32334411715 num_examples: 173 download_size: 4452105 dataset_size: 6136065.257960157 - config_name: ary features: - name: id dtype: string - name: url dtype: string - name: title dtype: string - name: text dtype: string splits: - name: train num_bytes: 4231124.246781115 num_examples: 2893 - name: test num_bytes: 223768.40987124463 num_examples: 153 download_size: 2059719 dataset_size: 4454892.65665236 - config_name: bm features: - name: url dtype: string - name: id dtype: string - name: title dtype: string - name: text dtype: string splits: - name: train num_bytes: 167993.52713178293 num_examples: 246 - name: test num_bytes: 8877.706718346253 num_examples: 13 download_size: 149125 dataset_size: 176871.23385012918 - config_name: ee features: - name: url dtype: string - name: id dtype: string - name: title dtype: string - name: text dtype: string splits: - name: train num_bytes: 133408.30055248618 num_examples: 152 - name: test num_bytes: 7021.489502762431 num_examples: 8 download_size: 217060 dataset_size: 140429.79005524862 - config_name: fon features: - name: url dtype: string - name: id dtype: string - name: title dtype: string - name: text dtype: string splits: - name: train num_bytes: 152973.45840130505 num_examples: 179 - name: test num_bytes: 8546.00326264274 num_examples: 10 download_size: 158462 dataset_size: 161519.4616639478 - config_name: ha features: - name: id dtype: string - name: url dtype: string - name: title dtype: string - name: text dtype: string splits: - name: train num_bytes: 16137552.006841505 num_examples: 7524 - name: test num_bytes: 851489.6526735881 num_examples: 397 download_size: 19214456 dataset_size: 16989041.659515094 - config_name: ig features: - name: id dtype: string - name: url dtype: string - name: title dtype: string - name: text dtype: string splits: - name: train num_bytes: 13454025.810135353 num_examples: 4732 - name: test num_bytes: 710800.1801635331 num_examples: 250 download_size: 15690382 dataset_size: 14164825.990298886 - config_name: lg features: - name: id dtype: string - name: url dtype: string - name: title dtype: string - name: text dtype: string splits: - name: train num_bytes: 1138842.8110717735 num_examples: 586 - name: test num_bytes: 60245.950756356615 num_examples: 31 download_size: 1676383 dataset_size: 1199088.76182813 - config_name: ln features: - name: id dtype: string - name: url dtype: string - name: title dtype: string - name: text dtype: string splits: - name: train num_bytes: 376368.34879348165 num_examples: 657 - name: test num_bytes: 20050.064243183955 num_examples: 35 download_size: 500444 dataset_size: 396418.4130366656 - config_name: ny features: - name: url dtype: string - name: id dtype: string - name: title dtype: string - name: text dtype: string splits: - name: train num_bytes: 281829.3618756371 num_examples: 181 - name: test num_bytes: 15570.682976554535 num_examples: 10 download_size: 430164 dataset_size: 297400.04485219164 - config_name: om features: - name: url dtype: string - name: id dtype: string - name: title dtype: string - name: text dtype: string splits: - name: train num_bytes: 439746.628190899 num_examples: 241 - name: test num_bytes: 23720.77247502775 num_examples: 13 download_size: 895114 dataset_size: 463467.40066592675 - config_name: pcm features: - name: url dtype: string - name: id dtype: string - name: title dtype: string - name: text dtype: string splits: - name: train num_bytes: 455213.022260274 num_examples: 305 - name: test num_bytes: 25372.529109589042 num_examples: 17 download_size: 543983 dataset_size: 480585.55136986304 - config_name: rn features: - name: url dtype: string - name: id dtype: string - name: title dtype: string - name: text dtype: string splits: - name: train num_bytes: 52346.54651162791 num_examples: 76 - name: test num_bytes: 3443.8517441860463 num_examples: 5 download_size: 156734 dataset_size: 55790.398255813954 - config_name: rw features: - name: id dtype: string - name: url dtype: string - name: title dtype: string - name: text dtype: string splits: - name: train num_bytes: 2739124.2571390625 num_examples: 1938 - name: test num_bytes: 144164.43458626643 num_examples: 102 download_size: 2982314 dataset_size: 2883288.691725329 - config_name: sn features: - name: id dtype: string - name: url dtype: string - name: title dtype: string - name: text dtype: string splits: - name: train num_bytes: 3032429.956975467 num_examples: 3650 - name: test num_bytes: 160344.92649212742 num_examples: 193 download_size: 2429878 dataset_size: 3192774.8834675946 - config_name: so features: - name: id dtype: string - name: url dtype: string - name: title dtype: string - name: text dtype: string splits: - name: train num_bytes: 2124337.5272727273 num_examples: 1479 - name: test num_bytes: 112034.02780748664 num_examples: 78 download_size: 3428977 dataset_size: 2236371.555080214 - config_name: sw features: - name: id dtype: string - name: url dtype: string - name: title dtype: string - name: text dtype: string splits: - name: train num_bytes: 19168079.19596118 num_examples: 18529 - name: test num_bytes: 1009662.9766991264 num_examples: 976 download_size: 17117313 dataset_size: 20177742.172660306 - config_name: ti features: - name: url dtype: string - name: id dtype: string - name: title dtype: string - name: text dtype: string splits: - name: train num_bytes: 93570.8446866485 num_examples: 50 - name: test num_bytes: 5614.25068119891 num_examples: 3 download_size: 171585 dataset_size: 99185.09536784742 - config_name: tn features: - name: url dtype: string - name: id dtype: string - name: title dtype: string - name: text dtype: string splits: - name: train num_bytes: 481006.4650537634 num_examples: 260 - name: test num_bytes: 25900.34811827957 num_examples: 14 download_size: 737491 dataset_size: 506906.813172043 - config_name: ts features: - name: url dtype: string - name: id dtype: string - name: title dtype: string - name: text dtype: string splits: - name: train num_bytes: 191525.6255319149 num_examples: 174 - name: test num_bytes: 11007.219858156028 num_examples: 10 download_size: 234882 dataset_size: 202532.84539007093 - config_name: tw features: - name: id dtype: string - name: url dtype: string - name: title dtype: string - name: text dtype: string splits: - name: train num_bytes: 1747490.6975193385 num_examples: 911 - name: test num_bytes: 92074.15310749534 num_examples: 48 download_size: 1809267 dataset_size: 1839564.8506268337 - config_name: wo features: - name: url dtype: string - name: id dtype: string - name: title dtype: string - name: text dtype: string splits: - name: train num_bytes: 196988.98025909933 num_examples: 107 - name: test num_bytes: 11046.111042566317 num_examples: 6 download_size: 852713 dataset_size: 208035.09130166564 - config_name: yo features: - name: id dtype: string - name: url dtype: string - name: title dtype: string - name: text dtype: string splits: - name: train num_bytes: 1989924.0449648711 num_examples: 1818 - name: test num_bytes: 105078.49742388759 num_examples: 96 download_size: 3504965 dataset_size: 2095002.5423887586 - config_name: zu features: - name: id dtype: string - name: url dtype: string - name: title dtype: string - name: text dtype: string splits: - name: train num_bytes: 592898.4454545454 num_examples: 895 - name: test num_bytes: 31797.905454545453 num_examples: 48 download_size: 1708319 dataset_size: 624696.3509090908 configs: - config_name: am data_files: - split: train path: am/train-* - split: test path: am/test-* - config_name: ary data_files: - split: train path: ary/train-* - split: test path: ary/test-* - config_name: bm data_files: - split: train path: bm/train-* - split: test path: bm/test-* - config_name: ee data_files: - split: train path: ee/train-* - split: test path: ee/test-* - config_name: fon data_files: - split: train path: fon/train-* - split: test path: fon/test-* - config_name: ha data_files: - split: train path: ha/train-* - split: test path: ha/test-* - config_name: ig data_files: - split: train path: ig/train-* - split: test path: ig/test-* - config_name: lg data_files: - split: train path: lg/train-* - split: test path: lg/test-* - config_name: ln data_files: - split: train path: ln/train-* - split: test path: ln/test-* - config_name: ny data_files: - split: train path: ny/train-* - split: test path: ny/test-* - config_name: om data_files: - split: train path: om/train-* - split: test path: om/test-* - config_name: pcm data_files: - split: train path: pcm/train-* - split: test path: pcm/test-* - config_name: rn data_files: - split: train path: rn/train-* - split: test path: rn/test-* - config_name: rw data_files: - split: train path: rw/train-* - split: test path: rw/test-* - config_name: sn data_files: - split: train path: sn/train-* - split: test path: sn/test-* - config_name: so data_files: - split: train path: so/train-* - split: test path: so/test-* - config_name: sw data_files: - split: train path: sw/train-* - split: test path: sw/test-* - config_name: ti data_files: - split: train path: ti/train-* - split: test path: ti/test-* - config_name: tn data_files: - split: train path: tn/train-* - split: test path: tn/test-* - config_name: ts data_files: - split: train path: ts/train-* - split: test path: ts/test-* - config_name: tw data_files: - split: train path: tw/train-* - split: test path: tw/test-* - config_name: wo data_files: - split: train path: wo/train-* - split: test path: wo/test-* - config_name: yo data_files: - split: train path: yo/train-* - split: test path: yo/test-* - config_name: zu data_files: - split: train path: zu/train-* - split: test path: zu/test-* ---
### 数据集信息 本数据集包含多语言配置项,各配置详情如下: 1. **配置名称:am** 包含特征字段: - `id`:字符串类型 - `url`:字符串类型 - `title`:字符串类型 - `text`:字符串类型 数据集划分: - 训练集(train):占用字节数5827567.93,样本量3268 - 测试集(test):占用字节数308497.32,样本量173 下载总大小:4452105字节,数据集总大小:6136065.26字节 2. **配置名称:ary** 包含特征字段: - `id`:字符串类型 - `url`:字符串类型 - `title`:字符串类型 - `text`:字符串类型 数据集划分: - 训练集:占用字节数4231124.25,样本量2893 - 测试集:占用字节数223768.41,样本量153 下载总大小:2059719字节,数据集总大小:4454892.66字节 3. **配置名称:bm** 包含特征字段: - `url`:字符串类型 - `id`:字符串类型 - `title`:字符串类型 - `text`:字符串类型 数据集划分: - 训练集:占用字节数167993.53,样本量246 - 测试集:占用字节数8877.71,样本量13 下载总大小:149125字节,数据集总大小:176871.23字节 4. **配置名称:ee** 包含特征字段: - `url`:字符串类型 - `id`:字符串类型 - `title`:字符串类型 - `text`:字符串类型 数据集划分: - 训练集:占用字节数133408.30,样本量152 - 测试集:占用字节数7021.49,样本量8 下载总大小:217060字节,数据集总大小:140429.79字节 5. **配置名称:fon** 包含特征字段: - `url`:字符串类型 - `id`:字符串类型 - `title`:字符串类型 - `text`:字符串类型 数据集划分: - 训练集:占用字节数152973.46,样本量179 - 测试集:占用字节数8546.00,样本量10 下载总大小:158462字节,数据集总大小:161519.46字节 6. **配置名称:ha** 包含特征字段: - `id`:字符串类型 - `url`:字符串类型 - `title`:字符串类型 - `text`:字符串类型 数据集划分: - 训练集:占用字节数16137552.01,样本量7524 - 测试集:占用字节数851489.65,样本量397 下载总大小:19214456字节,数据集总大小:16989041.66字节 7. **配置名称:ig** 包含特征字段: - `id`:字符串类型 - `url`:字符串类型 - `title`:字符串类型 - `text`:字符串类型 数据集划分: - 训练集:占用字节数13454025.81,样本量4732 - 测试集:占用字节数710800.18,样本量250 下载总大小:15690382字节,数据集总大小:14164825.99字节 8. **配置名称:lg** 包含特征字段: - `id`:字符串类型 - `url`:字符串类型 - `title`:字符串类型 - `text`:字符串类型 数据集划分: - 训练集:占用字节数1138842.81,样本量586 - 测试集:占用字节数60245.95,样本量31 下载总大小:1676383字节,数据集总大小:1199088.76字节 9. **配置名称:ln** 包含特征字段: - `id`:字符串类型 - `url`:字符串类型 - `title`:字符串类型 - `text`:字符串类型 数据集划分: - 训练集:占用字节数376368.35,样本量657 - 测试集:占用字节数20050.06,样本量35 下载总大小:500444字节,数据集总大小:396418.41字节 10. **配置名称:ny** 包含特征字段: - `url`:字符串类型 - `id`:字符串类型 - `title`:字符串类型 - `text`:字符串类型 数据集划分: - 训练集:占用字节数281829.36,样本量181 - 测试集:占用字节数15570.68,样本量10 下载总大小:430164字节,数据集总大小:297400.04字节 11. **配置名称:om** 包含特征字段: - `url`:字符串类型 - `id`:字符串类型 - `title`:字符串类型 - `text`:字符串类型 数据集划分: - 训练集:占用字节数439746.63,样本量241 - 测试集:占用字节数23720.77,样本量13 下载总大小:895114字节,数据集总大小:463467.40字节 12. **配置名称:pcm** 包含特征字段: - `id`:字符串类型 - `url`:字符串类型 - `title`:字符串类型 - `text`:字符串类型 数据集划分: - 训练集:占用字节数455213.02,样本量305 - 测试集:占用字节数25372.53,样本量17 下载总大小:543983字节,数据集总大小:480585.55字节 13. **配置名称:rn** 包含特征字段: - `url`:字符串类型 - `id`:字符串类型 - `title`:字符串类型 - `text`:字符串类型 数据集划分: - 训练集:占用字节数52346.55,样本量76 - 测试集:占用字节数3443.85,样本量5 下载总大小:156734字节,数据集总大小:55790.40字节 14. **配置名称:rw** 包含特征字段: - `id`:字符串类型 - `url`:字符串类型 - `title`:字符串类型 - `text`:字符串类型 数据集划分: - 训练集:占用字节数2739124.26,样本量1938 - 测试集:占用字节数144164.43,样本量102 下载总大小:2982314字节,数据集总大小:2883288.69字节 15. **配置名称:sn** 包含特征字段: - `id`:字符串类型 - `url`:字符串类型 - `title`:字符串类型 - `text`:字符串类型 数据集划分: - 训练集:占用字节数3032429.96,样本量3650 - 测试集:占用字节数160344.93,样本量193 下载总大小:2429878字节,数据集总大小:3192774.88字节 16. **配置名称:so** 包含特征字段: - `id`:字符串类型 - `url`:字符串类型 - `title`:字符串类型 - `text`:字符串类型 数据集划分: - 训练集:占用字节数2124337.53,样本量1479 - 测试集:占用字节数112034.03,样本量78 下载总大小:3428977字节,数据集总大小:2236371.56字节 17. **配置名称:sw** 包含特征字段: - `id`:字符串类型 - `url`:字符串类型 - `title`:字符串类型 - `text`:字符串类型 数据集划分: - 训练集:占用字节数19168079.20,样本量18529 - 测试集:占用字节数1009662.98,样本量976 下载总大小:17117313字节,数据集总大小:20177742.17字节 18. **配置名称:ti** 包含特征字段: - `id`:字符串类型 - `url`:字符串类型 - `title`:字符串类型 - `text`:字符串类型 数据集划分: - 训练集:占用字节数93570.84,样本量50 - 测试集:占用字节数5614.25,样本量3 下载总大小:171585字节,数据集总大小:99185.10字节 19. **配置名称:tn** 包含特征字段: - `url`:字符串类型 - `id`:字符串类型 - `title`:字符串类型 - `text`:字符串类型 数据集划分: - 训练集:占用字节数481006.47,样本量260 - 测试集:占用字节数25900.35,样本量14 下载总大小:737491字节,数据集总大小:506906.81字节 20. **配置名称:ts** 包含特征字段: - `url`:字符串类型 - `id`:字符串类型 - `title`:字符串类型 - `text`:字符串类型 数据集划分: - 训练集:占用字节数191525.63,样本量174 - 测试集:占用字节数11007.22,样本量10 下载总大小:234882字节,数据集总大小:202532.85字节 21. **配置名称:tw** 包含特征字段: - `id`:字符串类型 - `url`:字符串类型 - `title`:字符串类型 - `text`:字符串类型 数据集划分: - 训练集:占用字节数1747490.70,样本量911 - 测试集:占用字节数92074.15,样本量48 下载总大小:1809267字节,数据集总大小:1839564.85字节 22. **配置名称:wo** 包含特征字段: - `url`:字符串类型 - `id`:字符串类型 - `title`:字符串类型 - `text`:字符串类型 数据集划分: - 训练集:占用字节数196988.98,样本量107 - 测试集:占用字节数11046.11,样本量6 下载总大小:852713字节,数据集总大小:208035.09字节 23. **配置名称:yo** 包含特征字段: - `id`:字符串类型 - `url`:字符串类型 - `title`:字符串类型 - `text`:字符串类型 数据集划分: - 训练集:占用字节数1989924.04,样本量1818 - 测试集:占用字节数105078.50,样本量96 下载总大小:3504965字节,数据集总大小:2095002.54字节 24. **配置名称:zu** 包含特征字段: - `id`:字符串类型 - `url`:字符串类型 - `title`:字符串类型 - `text`:字符串类型 数据集划分: - 训练集:占用字节数592898.45,样本量895 - 测试集:占用字节数31797.91,样本量48 下载总大小:1708319字节,数据集总大小:624696.35字节 ### 配置文件映射 所有配置均对应如下数据文件路径规则: - 训练集数据文件:`{配置名称}/train-*` - 测试集数据文件:`{配置名称}/test-*`



