遇见数据集

wannaphong/wikipedia-monthly

收藏
Hugging Face2026-05-04 更新2026-05-31 收录
官方服务:

资源简介:

--- dataset_info: 20260301.en: &id001 splits: - name: train num_examples: 7155624 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.en: *id001 20260301.de: &id002 splits: - name: train num_examples: 3098600 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.de: *id002 20260301.es: &id003 splits: - name: train num_examples: 2030756 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.es: *id003 20260301.fr: &id004 splits: - name: train num_examples: 2743535 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.fr: *id004 20260301.ceb: &id005 splits: - name: train num_examples: 6116120 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.ceb: *id005 20260301.he: &id006 splits: - name: train num_examples: 381145 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.he: *id006 20260301.ko: &id007 splits: - name: train num_examples: 738861 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.ko: *id007 20260301.hu: &id008 splits: - name: train num_examples: 566952 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.hu: *id008 20260301.ar: &id009 splits: - name: train num_examples: 1348418 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.ar: *id009 20260301.vi: &id010 splits: - name: train num_examples: 1299143 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.vi: *id010 20260301.nl: &id011 splits: - name: train num_examples: 2214057 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.nl: *id011 20260301.pl: &id012 splits: - name: train num_examples: 1687182 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.pl: *id012 20260301.ja: &id014 splits: - name: train num_examples: 1490629 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 20260301.sv: &id013 splits: - name: train num_examples: 2621931 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.sv: *id013 latest.ja: *id014 20260301.pt: &id015 splits: - name: train num_examples: 1166154 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.pt: *id015 20260301.el: &id016 splits: - name: train num_examples: 266123 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.el: *id016 20260301.sr: &id017 splits: - name: train num_examples: 750406 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.sr: *id017 20260301.th: &id018 splits: - name: train num_examples: 180388 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.th: *id018 20260301.tr: &id019 splits: - name: train num_examples: 670209 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.tr: *id019 20260301.uk: &id020 splits: - name: train num_examples: 1410890 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.uk: *id020 20260301.ru: &id021 splits: - name: train num_examples: 2089089 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.ru: *id021 20260301.zh: &id022 splits: - name: train num_examples: 1523056 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.zh: *id022 20260301.aa: &id025 splits: - name: train num_examples: 0 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 20260301.ab: &id026 splits: - name: train num_examples: 6541 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 20260301.ace: &id023 splits: - name: train num_examples: 13122 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 20260301.ady: &id027 splits: - name: train num_examples: 790 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 20260301.ak: &id024 splits: - name: train num_examples: 1 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 20260301.alt: &id028 splits: - name: train num_examples: 1107 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 20260301.am: &id029 splits: - name: train num_examples: 14310 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 20260301.ami: &id030 splits: - name: train num_examples: 1850 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.ace: *id023 latest.ak: *id024 latest.aa: *id025 latest.ab: *id026 latest.ady: *id027 latest.alt: *id028 latest.am: *id029 latest.ami: *id030 20260301.ang: &id031 splits: - name: train num_examples: 5268 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 20260301.ann: &id032 splits: - name: train num_examples: 491 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 20260301.anp: &id033 splits: - name: train num_examples: 3169 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 20260301.arc: &id034 splits: - name: train num_examples: 1960 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.ang: *id031 latest.ann: *id032 latest.anp: *id033 latest.arc: *id034 20260301.ary: &id035 splits: - name: train num_examples: 11212 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.ary: *id035 20260301.atj: &id036 splits: - name: train num_examples: 2089 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.atj: *id036 20260301.av: &id037 splits: - name: train num_examples: 4080 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.av: *id037 20260301.awa: &id038 splits: - name: train num_examples: 3824 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.awa: *id038 20260301.avk: &id039 splits: - name: train num_examples: 29776 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 20260301.ay: &id040 splits: - name: train num_examples: 5439 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.avk: *id039 latest.ay: *id040 20260301.as: &id041 splits: - name: train num_examples: 22352 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.as: *id041 20260301.an: &id042 splits: - name: train num_examples: 55672 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.an: *id042 20260301.af: &id043 splits: - name: train num_examples: 128199 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.af: *id043 20260301.ban: &id044 splits: - name: train num_examples: 36050 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 20260301.bar: &id045 splits: - name: train num_examples: 27297 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.ban: *id044 latest.bar: *id045 20260301.bbc: &id046 splits: - name: train num_examples: 1454 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.bbc: *id046 20260301.bdr: &id047 splits: - name: train num_examples: 670 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.bdr: *id047 20260301.ba: &id048 splits: - name: train num_examples: 63913 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.ba: *id048 20260301.bcl: &id049 splits: - name: train num_examples: 21776 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.bcl: *id049 20260301.bew: &id050 splits: - name: train num_examples: 3416 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.bew: *id050 20260301.bh: &id051 splits: - name: train num_examples: 8951 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.bh: *id051 20260301.be-tarask: &id052 splits: - name: train num_examples: 0 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 20260301.bi: &id053 splits: - name: train num_examples: 1608 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.be-tarask: *id052 latest.bi: *id053 20260301.azb: &id054 splits: - name: train num_examples: 244651 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 20260301.bjn: &id055 splits: - name: train num_examples: 11691 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.azb: *id054 latest.bjn: *id055 20260301.blk: &id056 splits: - name: train num_examples: 3270 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.blk: *id056 20260301.bm: &id057 splits: - name: train num_examples: 1225 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.bm: *id057 20260301.bo: &id058 splits: - name: train num_examples: 15047 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 20260301.bpy: &id059 splits: - name: train num_examples: 25171 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.bo: *id058 latest.bpy: *id059 20260301.ast: &id060 splits: - name: train num_examples: 138881 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.ast: *id060 20260301.az: &id061 splits: - name: train num_examples: 212178 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.az: *id061 20260301.btm: &id062 splits: - name: train num_examples: 1366 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.btm: *id062 20260301.br: &id063 splits: - name: train num_examples: 90921 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.br: *id063 20260301.bug: &id064 splits: - name: train num_examples: 15965 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.bug: *id064 20260301.bxr: &id065 splits: - name: train num_examples: 2936 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.bxr: *id065 20260301.bg: &id066 splits: - name: train num_examples: 308137 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.bg: *id066 20260301.arz: &id067 splits: - name: train num_examples: 1630801 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.arz: *id067 20260301.bn: &id068 splits: - name: train num_examples: 184579 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.bn: *id068 20260301.be: &id069 splits: - name: train num_examples: 261743 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.be: *id069 20260301.bs: &id070 splits: - name: train num_examples: 30000 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.bs: *id070 20260301.cdo: &id071 splits: - name: train num_examples: 16721 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.cdo: *id071 20260301.ch: &id072 splits: - name: train num_examples: 607 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.ch: *id072 20260301.cho: &id073 splits: - name: train num_examples: 13 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 20260301.chr: &id074 splits: - name: train num_examples: 1040 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.cho: *id073 latest.chr: *id074 20260301.chy: &id075 splits: - name: train num_examples: 824 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.chy: *id075 20260301.cbk-zam: &id077 splits: - name: train num_examples: 0 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 20260301.co: &id078 splits: - name: train num_examples: 8652 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 20260301.cr: &id076 splits: - name: train num_examples: 1 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.cr: *id076 latest.cbk-zam: *id077 latest.co: *id078 20260301.crh: &id079 splits: - name: train num_examples: 29723 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.crh: *id079 20260301.csb: &id080 splits: - name: train num_examples: 5547 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.csb: *id080 20260301.cu: &id081 splits: - name: train num_examples: 1358 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.cu: *id081 20260301.ckb: &id082 splits: - name: train num_examples: 81554 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.ckb: *id082 20260301.cv: &id083 splits: - name: train num_examples: 58955 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.cv: *id083 20260301.dag: &id084 splits: - name: train num_examples: 15257 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.dag: *id084 20260301.dga: &id085 splits: - name: train num_examples: 4004 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.dga: *id085 20260301.din: &id086 splits: - name: train num_examples: 461 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.din: *id086 20260301.diq: &id087 splits: - name: train num_examples: 42727 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.diq: *id087 20260301.dsb: &id088 splits: - name: train num_examples: 3464 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.dsb: *id088 20260301.dtp: &id089 splits: - name: train num_examples: 1994 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.dtp: *id089 20260301.cy: &id090 splits: - name: train num_examples: 284019 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.cy: *id090 20260301.dty: &id091 splits: - name: train num_examples: 3929 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.dty: *id091 20260301.dv: &id092 splits: - name: train num_examples: 4552 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 20260301.dz: &id093 splits: - name: train num_examples: 1308 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.dv: *id092 latest.dz: *id093 20260301.ee: &id094 splits: - name: train num_examples: 1509 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.ee: *id094 20260301.eml: &id095 splits: - name: train num_examples: 13345 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.eml: *id095 20260301.ce: &id096 splits: - name: train num_examples: 818096 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.ce: *id096 20260301.da: &id097 splits: - name: train num_examples: 313165 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.da: *id097 20260301.ext: &id098 splits: - name: train num_examples: 4304 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.ext: *id098 20260301.et: &id099 splits: - name: train num_examples: 258338 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.et: *id099 20260301.fat: &id100 splits: - name: train num_examples: 2156 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.fat: *id100 20260301.ff: &id101 splits: - name: train num_examples: 26162 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.ff: *id101 20260301.eu: &id102 splits: - name: train num_examples: 471565 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.eu: *id102 20260301.fj: &id103 splits: - name: train num_examples: 1719 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.fj: *id103 20260301.fo: &id104 splits: - name: train num_examples: 14239 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.fo: *id104 20260301.fon: &id105 splits: - name: train num_examples: 3779 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.fon: *id105 20260301.frp: &id106 splits: - name: train num_examples: 5856 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.frp: *id106 20260301.frr: &id107 splits: - name: train num_examples: 20832 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.frr: *id107 20260301.eo: &id108 splits: - name: train num_examples: 382400 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.eo: *id108 20260301.fur: &id109 splits: - name: train num_examples: 5047 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.fur: *id109 20260301.ga: &id110 splits: - name: train num_examples: 63045 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.ga: *id110 20260301.gag: &id111 splits: - name: train num_examples: 3164 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.gag: *id111 20260301.fy: &id112 splits: - name: train num_examples: 59405 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.fy: *id112 20260301.gan: &id113 splits: - name: train num_examples: 6865 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.gan: *id113 20260301.gcr: &id114 splits: - name: train num_examples: 2404 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.gcr: *id114 20260301.gd: &id115 splits: - name: train num_examples: 16122 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.gd: *id115 20260301.glk: &id116 splits: - name: train num_examples: 48565 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.glk: *id116 20260301.gn: &id117 splits: - name: train num_examples: 6037 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.gn: *id117 20260301.gom: &id118 splits: - name: train num_examples: 4309 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.gom: *id118 20260301.gor: &id119 splits: - name: train num_examples: 15842 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.gor: *id119 20260301.got: &id120 splits: - name: train num_examples: 1135 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.got: *id120 20260301.gpe: &id121 splits: - name: train num_examples: 4774 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.gpe: *id121 20260301.gsw: &id122 splits: - name: train num_examples: 0 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 20260301.gu: &id123 splits: - name: train num_examples: 30921 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.gsw: *id122 latest.gu: *id123 20260301.guc: &id124 splits: - name: train num_examples: 921 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.guc: *id124 20260301.gur: &id125 splits: - name: train num_examples: 1645 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.gur: *id125 20260301.guw: &id126 splits: - name: train num_examples: 1727 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.guw: *id126 20260301.gv: &id127 splits: - name: train num_examples: 7090 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.gv: *id127 20260301.cs: &id128 splits: - name: train num_examples: 587573 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 20260301.gl: &id129 splits: - name: train num_examples: 229985 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.cs: *id128 latest.gl: *id129 20260301.hak: &id130 splits: - name: train num_examples: 10494 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.hak: *id130 20260301.haw: &id131 splits: - name: train num_examples: 3085 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.haw: *id131 20260301.ca: &id132 splits: - name: train num_examples: 792293 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 20260301.hif: &id133 splits: - name: train num_examples: 12392 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.ca: *id132 latest.hif: *id133 20260301.ha: &id134 splits: - name: train num_examples: 94013 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 20260301.ho: &id135 splits: - name: train num_examples: 3 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.ha: *id134 latest.ho: *id135 20260301.hsb: &id136 splits: - name: train num_examples: 14278 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.hsb: *id136 20260301.ht: &id137 splits: - name: train num_examples: 73165 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.ht: *id137 20260301.hi: &id138 splits: - name: train num_examples: 171312 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.hi: *id138 20260301.fa: &id139 splits: - name: train num_examples: 840000 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 20260301.fi: &id140 splits: - name: train num_examples: 560000 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.fa: *id139 latest.fi: *id140 20260301.hr: &id141 splits: - name: train num_examples: 70000 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.hr: *id141 20260301.hyw: &id142 splits: - name: train num_examples: 13592 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.hyw: *id142 20260301.hz: &id143 splits: - name: train num_examples: 0 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 20260301.ia: &id144 splits: - name: train num_examples: 30497 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.hz: *id143 latest.ia: *id144 20260301.hy: &id145 splits: - name: train num_examples: 100000 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 20260301.iba: &id146 splits: - name: train num_examples: 2344 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.hy: *id145 latest.iba: *id146 20260301.ie: &id147 splits: - name: train num_examples: 13554 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.ie: *id147 20260301.igl: &id148 splits: - name: train num_examples: 1156 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 20260301.ii: &id149 splits: - name: train num_examples: 14 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 20260301.ik: &id150 splits: - name: train num_examples: 839 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.igl: *id148 latest.ii: *id149 latest.ik: *id150 20260301.ilo: &id151 splits: - name: train num_examples: 15448 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 20260301.inh: &id152 splits: - name: train num_examples: 2419 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.ilo: *id151 latest.inh: *id152 20260301.ig: &id153 splits: - name: train num_examples: 52018 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 20260301.io: &id154 splits: - name: train num_examples: 61590 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.ig: *id153 latest.io: *id154 20260301.iu: &id155 splits: - name: train num_examples: 550 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.iu: *id155 20260301.jam: &id156 splits: - name: train num_examples: 1798 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 20260301.jbo: &id157 splits: - name: train num_examples: 1427 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.jam: *id156 latest.jbo: *id157 20260301.is: &id158 splits: - name: train num_examples: 61325 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.is: *id158 20260301.kaa: &id159 splits: - name: train num_examples: 11486 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 20260301.kab: &id160 splits: - name: train num_examples: 6209 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.kaa: *id159 latest.kab: *id160 20260301.kaj: &id161 splits: - name: train num_examples: 998 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.kaj: *id161 20260301.jv: &id162 splits: - name: train num_examples: 75577 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.jv: *id162 20260301.kbd: &id163 splits: - name: train num_examples: 1682 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.kbd: *id163 20260301.kbp: &id164 splits: - name: train num_examples: 1970 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.kbp: *id164 20260301.kai: &id167 splits: - name: train num_examples: 0 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 20260301.kcg: &id165 splits: - name: train num_examples: 1829 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 20260301.kg: &id166 splits: - name: train num_examples: 2018 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.kcg: *id165 latest.kg: *id166 latest.kai: *id167 20260301.kge: &id168 splits: - name: train num_examples: 3016 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.kge: *id168 20260301.ki: &id169 splits: - name: train num_examples: 2410 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 20260301.kj: &id170 splits: - name: train num_examples: 5 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.ki: *id169 latest.kj: *id170 20260301.kl: &id171 splits: - name: train num_examples: 1 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.kl: *id171 20260301.km: &id172 splits: - name: train num_examples: 13579 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.km: *id172 20260301.knc: &id173 splits: - name: train num_examples: 2247 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.knc: *id173 20260301.koi: &id174 splits: - name: train num_examples: 3522 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.koi: *id174 20260301.ka: &id175 splits: - name: train num_examples: 191708 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 20260301.kn: &id176 splits: - name: train num_examples: 35774 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.ka: *id175 latest.kn: *id176 20260301.kr: &id177 splits: - name: train num_examples: 0 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 20260301.krc: &id178 splits: - name: train num_examples: 2781 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.kr: *id177 latest.krc: *id178 20260301.ks: &id179 splits: - name: train num_examples: 8917 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 20260301.ksh: &id180 splits: - name: train num_examples: 3066 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.ks: *id179 latest.ksh: *id180 20260301.kus: &id181 splits: - name: train num_examples: 1631 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.kus: *id181 20260301.kv: &id182 splits: - name: train num_examples: 6148 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.kv: *id182 20260301.ku: &id183 splits: - name: train num_examples: 91109 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 20260301.kw: &id184 splits: - name: train num_examples: 7152 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.ku: *id183 latest.kw: *id184 20260301.kk: &id185 splits: - name: train num_examples: 245799 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 20260301.ky: &id186 splits: - name: train num_examples: 76606 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 20260301.lad: &id187 splits: - name: train num_examples: 3947 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.kk: *id185 latest.ky: *id186 latest.lad: *id187 20260301.lbe: &id188 splits: - name: train num_examples: 1089 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.lbe: *id188 20260301.lez: &id189 splits: - name: train num_examples: 4410 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.lez: *id189 20260301.lfn: &id190 splits: - name: train num_examples: 5106 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.lfn: *id190 20260301.lb: &id191 splits: - name: train num_examples: 66728 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 20260301.lg: &id192 splits: - name: train num_examples: 5918 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.lb: *id191 latest.lg: *id192 20260301.la: &id193 splits: - name: train num_examples: 141103 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.la: *id193 20260301.li: &id194 splits: - name: train num_examples: 15170 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 20260301.lij: &id195 splits: - name: train num_examples: 11489 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.li: *id194 latest.lij: *id195 20260301.ln: &id196 splits: - name: train num_examples: 5192 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 20260301.lo: &id197 splits: - name: train num_examples: 5926 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.ln: *id196 latest.lo: *id197 20260301.lld: &id198 splits: - name: train num_examples: 180854 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 20260301.lmo: &id199 splits: - name: train num_examples: 79996 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 20260301.lrc: &id200 splits: - name: train num_examples: 1 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.lld: *id198 latest.lmo: *id199 latest.lrc: *id200 20260301.ltg: &id201 splits: - name: train num_examples: 1123 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.ltg: *id201 20260301.mad: &id202 splits: - name: train num_examples: 6624 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.mad: *id202 20260301.lzh: &id203 splits: - name: train num_examples: 0 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 20260301.mai: &id204 splits: - name: train num_examples: 15122 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.lzh: *id203 latest.mai: *id204 20260301.mdf: &id205 splits: - name: train num_examples: 7718 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.mdf: *id205 20260301.map-bms: &id206 splits: - name: train num_examples: 0 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 20260301.mh: &id207 splits: - name: train num_examples: 8 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.map-bms: *id206 latest.mh: *id207 20260301.mhr: &id208 splits: - name: train num_examples: 11440 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.mhr: *id208 20260301.mg: &id209 splits: - name: train num_examples: 102392 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.mg: *id209 20260301.mi: &id210 splits: - name: train num_examples: 8075 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.mi: *id210 20260301.lv: &id211 splits: - name: train num_examples: 141489 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 20260301.min: &id212 splits: - name: train num_examples: 229281 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.lv: *id211 latest.min: *id212 20260301.lt: &id213 splits: - name: train num_examples: 222658 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.lt: *id213 20260301.mn: &id214 splits: - name: train num_examples: 30119 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 20260301.mni: &id215 splits: - name: train num_examples: 11131 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.mn: *id214 latest.mni: *id215 20260301.mnw: &id216 splits: - name: train num_examples: 3428 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 20260301.mos: &id217 splits: - name: train num_examples: 1698 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.mnw: *id216 latest.mos: *id217 20260301.mrj: &id218 splits: - name: train num_examples: 10539 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.mrj: *id218 20260301.ml: &id219 splits: - name: train num_examples: 88685 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.ml: *id219 20260301.mr: &id220 splits: - name: train num_examples: 101670 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 20260301.mt: &id221 splits: - name: train num_examples: 7734 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.mr: *id220 latest.mt: *id221 20260301.mus: &id222 splits: - name: train num_examples: 2 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.mus: *id222 20260301.mk: &id223 splits: - name: train num_examples: 159422 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 20260301.mwl: &id224 splits: - name: train num_examples: 4540 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.mk: *id223 latest.mwl: *id224 20260301.myv: &id225 splits: - name: train num_examples: 8129 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.myv: *id225 20260301.mzn: &id226 splits: - name: train num_examples: 66620 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 20260301.na: &id227 splits: - name: train num_examples: 0 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 20260301.nah: &id228 splits: - name: train num_examples: 4462 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.mzn: *id226 latest.na: *id227 latest.nah: *id228 20260301.my: &id229 splits: - name: train num_examples: 112317 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 20260301.nap: &id230 splits: - name: train num_examples: 15032 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.my: *id229 latest.nap: *id230 20260301.nan: &id231 splits: - name: train num_examples: 0 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 20260301.nds: &id232 splits: - name: train num_examples: 85805 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.nan: *id231 latest.nds: *id232 20260301.nds-nl: &id233 splits: - name: train num_examples: 0 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 20260301.ne: &id234 splits: - name: train num_examples: 29823 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 20260301.ng: &id235 splits: - name: train num_examples: 18 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.nds-nl: *id233 latest.ne: *id234 latest.ng: *id235 20260301.new: &id236 splits: - name: train num_examples: 73785 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 20260301.nia: &id237 splits: - name: train num_examples: 1827 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.new: *id236 latest.nia: *id237 20260301.nov: &id238 splits: - name: train num_examples: 2167 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.nov: *id238 20260301.nqo: &id239 splits: - name: train num_examples: 1692 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.nqo: *id239 20260301.nr: &id240 splits: - name: train num_examples: 549 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.nr: *id240 20260301.nrm: &id241 splits: - name: train num_examples: 5104 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.nrm: *id241 20260301.nso: &id242 splits: - name: train num_examples: 9115 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.nso: *id242 20260301.nup: &id243 splits: - name: train num_examples: 1330 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.nup: *id243 20260301.nn: &id244 splits: - name: train num_examples: 177393 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.nn: *id244 20260301.nv: &id245 splits: - name: train num_examples: 22549 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.nv: *id245 20260301.ny: &id246 splits: - name: train num_examples: 1224 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.ny: *id246 20260301.olo: &id247 splits: - name: train num_examples: 5048 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.olo: *id247 20260301.om: &id248 splits: - name: train num_examples: 2406 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.om: *id248 20260301.ms: &id249 splits: - name: train num_examples: 437501 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.ms: *id249 20260301.oc: &id250 splits: - name: train num_examples: 90775 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.oc: *id250 20260301.or: &id251 splits: - name: train num_examples: 20581 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.or: *id251 20260301.os: &id252 splits: - name: train num_examples: 21540 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.os: *id252 20260301.pag: &id253 splits: - name: train num_examples: 2730 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.pag: *id253 20260301.pa: &id254 splits: - name: train num_examples: 59694 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 20260301.pam: &id255 splits: - name: train num_examples: 10469 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 20260301.pap: &id256 splits: - name: train num_examples: 5298 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.pa: *id254 latest.pam: *id255 latest.pap: *id256 20260301.pcd: &id257 splits: - name: train num_examples: 6215 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 20260301.pcm: &id258 splits: - name: train num_examples: 1823 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 20260301.pdc: &id259 splits: - name: train num_examples: 2262 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.pcd: *id257 latest.pcm: *id258 latest.pdc: *id259 20260301.pfl: &id260 splits: - name: train num_examples: 2854 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 20260301.pi: &id262 splits: - name: train num_examples: 203 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 20260301.pih: &id261 splits: - name: train num_examples: 1 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.pfl: *id260 latest.pih: *id261 latest.pi: *id262 20260301.pms: &id263 splits: - name: train num_examples: 71005 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 20260301.pnt: &id264 splits: - name: train num_examples: 577 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.pms: *id263 latest.pnt: *id264 20260301.ppl: &id265 splits: - name: train num_examples: 910 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.ppl: *id265 20260301.ps: &id266 splits: - name: train num_examples: 23041 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 20260301.pwn: &id267 splits: - name: train num_examples: 454 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.ps: *id266 latest.pwn: *id267 20260301.rki: &id268 splits: - name: train num_examples: 1717 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.rki: *id268 20260301.pnb: &id269 splits: - name: train num_examples: 75931 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 20260301.qu: &id270 splits: - name: train num_examples: 24680 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 20260301.rm: &id271 splits: - name: train num_examples: 3889 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.pnb: *id269 latest.qu: *id270 latest.rm: *id271 20260301.id: &id272 splits: - name: train num_examples: 761417 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 20260301.rmy: &id273 splits: - name: train num_examples: 834 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 20260301.rn: &id274 splits: - name: train num_examples: 972 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.id: *id272 latest.rmy: *id273 latest.rn: *id274 20260301.rsk: &id275 splits: - name: train num_examples: 1160 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.rsk: *id275 20260301.rue: &id276 splits: - name: train num_examples: 10205 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.rue: *id276 20260301.roa-tara: &id277 splits: - name: train num_examples: 0 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 20260301.rw: &id278 splits: - name: train num_examples: 11415 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.roa-tara: *id277 latest.rw: *id278 20260301.rup: &id279 splits: - name: train num_examples: 0 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 20260301.sa: &id280 splits: - name: train num_examples: 12789 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 20260301.sah: &id281 splits: - name: train num_examples: 18220 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.rup: *id279 latest.sa: *id280 latest.sah: *id281 20260301.sat: &id282 splits: - name: train num_examples: 15322 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 20260301.sc: &id283 splits: - name: train num_examples: 7929 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.sat: *id282 latest.sc: *id283 20260301.scn: &id284 splits: - name: train num_examples: 26373 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.scn: *id284 20260301.it: &id285 splits: - name: train num_examples: 580000 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.it: *id285 20260301.no: &id286 splits: - name: train num_examples: 470000 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.no: *id286 20260301.ro: &id287 splits: - name: train num_examples: 100000 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.ro: *id287 20260301.sco: &id288 splits: - name: train num_examples: 10000 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.sco: *id288 20260301.se: &id289 splits: - name: train num_examples: 8096 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.se: *id289 20260301.sd: &id290 splits: - name: train num_examples: 21269 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 20260301.sg: &id291 splits: - name: train num_examples: 495 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.sd: *id290 latest.sg: *id291 20260301.shi: &id292 splits: - name: train num_examples: 10954 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.shi: *id292 20260301.sgs: &id293 splits: - name: train num_examples: 0 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.sgs: *id293 20260301.shn: &id294 splits: - name: train num_examples: 15127 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.shn: *id294 20260301.sh: &id295 splits: - name: train num_examples: 0 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 20260301.si: &id296 splits: - name: train num_examples: 27952 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.sh: *id295 latest.si: *id296 20260301.simple: &id297 splits: - name: train num_examples: 279678 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.simple: *id297 20260301.skr: &id298 splits: - name: train num_examples: 24449 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.skr: *id298 20260301.sl: &id299 splits: - name: train num_examples: 196798 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.sl: *id299 20260301.sm: &id300 splits: - name: train num_examples: 1246 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.sm: *id300 20260301.smn: &id301 splits: - name: train num_examples: 6519 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.smn: *id301 20260301.sn: &id302 splits: - name: train num_examples: 11902 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.sn: *id302 20260301.sk: &id303 splits: - name: train num_examples: 252849 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.sk: *id303 20260301.so: &id304 splits: - name: train num_examples: 11899 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.so: *id304 20260301.srn: &id305 splits: - name: train num_examples: 1226 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.srn: *id305 20260301.ss: &id306 splits: - name: train num_examples: 1372 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.ss: *id306 20260301.st: &id307 splits: - name: train num_examples: 2118 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.st: *id307 20260301.stq: &id308 splits: - name: train num_examples: 4167 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.stq: *id308 20260301.sq: &id309 splits: - name: train num_examples: 114873 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.sq: *id309 20260301.su: &id310 splits: - name: train num_examples: 62251 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.su: *id310 20260301.sw: &id311 splits: - name: train num_examples: 107790 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 20260301.syl: &id312 splits: - name: train num_examples: 1132 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.sw: *id311 latest.syl: *id312 20260301.szl: &id313 splits: - name: train num_examples: 59526 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 20260301.szy: &id314 splits: - name: train num_examples: 5400 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.szl: *id313 latest.szy: *id314 20260301.tay: &id315 splits: - name: train num_examples: 2933 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.tay: *id315 20260301.tcy: &id316 splits: - name: train num_examples: 3247 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.tcy: *id316 20260301.tdd: &id317 splits: - name: train num_examples: 552 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.tdd: *id317 20260301.ta: &id318 splits: - name: train num_examples: 182908 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.ta: *id318 20260301.tet: &id319 splits: - name: train num_examples: 1508 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.tet: *id319 20260301.te: &id320 splits: - name: train num_examples: 120925 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.te: *id320 20260301.tg: &id321 splits: - name: train num_examples: 116865 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 20260301.ti: &id322 splits: - name: train num_examples: 531 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.tg: *id321 latest.ti: *id322 20260301.tig: &id323 splits: - name: train num_examples: 373 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.tig: *id323 20260301.tk: &id324 splits: - name: train num_examples: 8054 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.tk: *id324 20260301.tly: &id325 splits: - name: train num_examples: 12117 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.tly: *id325 20260301.tn: &id326 splits: - name: train num_examples: 4851 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.tn: *id326 20260301.tl: &id327 splits: - name: train num_examples: 48762 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 20260301.to: &id328 splits: - name: train num_examples: 1933 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.tl: *id327 latest.to: *id328 20260301.tok: &id329 splits: - name: train num_examples: 3457 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 20260301.tpi: &id330 splits: - name: train num_examples: 1445 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.tok: *id329 latest.tpi: *id330 20260301.trv: &id331 splits: - name: train num_examples: 1968 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 20260301.ts: &id332 splits: - name: train num_examples: 1221 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.trv: *id331 latest.ts: *id332 20260301.tum: &id333 splits: - name: train num_examples: 18950 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.tum: *id333 20260301.tw: &id334 splits: - name: train num_examples: 5459 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.tw: *id334 20260301.ty: &id335 splits: - name: train num_examples: 1388 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.ty: *id335 20260301.tyv: &id336 splits: - name: train num_examples: 4210 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.tyv: *id336 20260301.udm: &id337 splits: - name: train num_examples: 5923 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.udm: *id337 20260301.ug: &id338 splits: - name: train num_examples: 10386 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.ug: *id338 20260301.tt: &id339 splits: - name: train num_examples: 610193 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.tt: *id339 20260301.ur: &id340 splits: - name: train num_examples: 240377 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.ur: *id340 20260301.ve: &id341 splits: - name: train num_examples: 1074 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.ve: *id341 20260301.vec: &id342 splits: - name: train num_examples: 69598 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.vec: *id342 20260301.uz: &id343 splits: - name: train num_examples: 333156 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 20260301.vep: &id344 splits: - name: train num_examples: 7108 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.uz: *id343 latest.vep: *id344 20260301.vls: &id345 splits: - name: train num_examples: 8355 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.vls: *id345 20260301.vo: &id346 splits: - name: train num_examples: 48644 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.vo: *id346 20260301.wa: &id347 splits: - name: train num_examples: 12921 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.wa: *id347 20260301.vro: &id348 splits: - name: train num_examples: 0 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 20260301.wo: &id349 splits: - name: train num_examples: 1814 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.vro: *id348 latest.wo: *id349 20260301.wuu: &id350 splits: - name: train num_examples: 48007 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.wuu: *id350 20260301.xal: &id351 splits: - name: train num_examples: 1764 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.xal: *id351 20260301.xh: &id352 splits: - name: train num_examples: 2753 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.xh: *id352 20260301.xmf: &id353 splits: - name: train num_examples: 21429 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.xmf: *id353 20260301.yi: &id354 splits: - name: train num_examples: 15455 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.yi: *id354 20260301.yo: &id355 splits: - name: train num_examples: 37163 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.yo: *id355 20260301.yue: &id356 splits: - name: train num_examples: 0 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 20260301.za: &id357 splits: - name: train num_examples: 3093 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.yue: *id356 latest.za: *id357 20260301.zea: &id358 splits: - name: train num_examples: 7240 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.zea: *id358 20260301.zgh: &id359 splits: - name: train num_examples: 12059 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.zgh: *id359 20260301.zu: &id360 splits: - name: train num_examples: 12666 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.zu: *id360 20260301.war: &id361 splits: - name: train num_examples: 1266956 - name: '1000' num_examples: 1000 - name: '5000' num_examples: 5000 - name: '10000' num_examples: 10000 latest.war: *id361 configs: - config_name: 20260101.en data_files: - split: train path: 20260101/en/train/train_part_*.parquet - split: '1000' path: 20260101/en/samples/1000_part_*.parquet - split: '5000' path: 20260101/en/samples/5000_part_*.parquet - split: '10000' path: 20260101/en/samples/10000_part_*.parquet - config_name: 20260101.de data_files: - split: train path: 20260101/de/train/train_part_*.parquet - split: '1000' path: 20260101/de/samples/1000_part_*.parquet - split: '5000' path: 20260101/de/samples/5000_part_*.parquet - split: '10000' path: 20260101/de/samples/10000_part_*.parquet - config_name: 20260101.es data_files: - split: train path: 20260101/es/train/train_part_*.parquet - split: '1000' path: 20260101/es/samples/1000_part_*.parquet - split: '5000' path: 20260101/es/samples/5000_part_*.parquet - split: '10000' path: 20260101/es/samples/10000_part_*.parquet - config_name: 20260101.fr data_files: - split: train path: 20260101/fr/train/train_part_*.parquet - split: '1000' path: 20260101/fr/samples/1000_part_*.parquet - split: '5000' path: 20260101/fr/samples/5000_part_*.parquet - split: '10000' path: 20260101/fr/samples/10000_part_*.parquet - config_name: 20260101.ceb data_files: - split: train path: 20260101/ceb/train/train_part_*.parquet - split: '1000' path: 20260101/ceb/samples/1000_part_*.parquet - split: '5000' path: 20260101/ceb/samples/5000_part_*.parquet - split: '10000' path: 20260101/ceb/samples/10000_part_*.parquet - config_name: 20260101.el data_files: - split: train path: 20260101/el/train/train_part_*.parquet - split: '1000' path: 20260101/el/samples/1000_part_*.parquet - split: '5000' path: 20260101/el/samples/5000_part_*.parquet - split: '10000' path: 20260101/el/samples/10000_part_*.parquet - config_name: 20260101.he data_files: - split: train path: 20260101/he/train/train_part_*.parquet - split: '1000' path: 20260101/he/samples/1000_part_*.parquet - split: '5000' path: 20260101/he/samples/5000_part_*.parquet - split: '10000' path: 20260101/he/samples/10000_part_*.parquet - config_name: 20260101.hu data_files: - split: train path: 20260101/hu/train/train_part_*.parquet - split: '1000' path: 20260101/hu/samples/1000_part_*.parquet - split: '5000' path: 20260101/hu/samples/5000_part_*.parquet - split: '10000' path: 20260101/hu/samples/10000_part_*.parquet - config_name: 20260101.ko data_files: - split: train path: 20260101/ko/train/train_part_*.parquet - split: '1000' path: 20260101/ko/samples/1000_part_*.parquet - split: '5000' path: 20260101/ko/samples/5000_part_*.parquet - split: '10000' path: 20260101/ko/samples/10000_part_*.parquet - config_name: 20260101.nl data_files: - split: train path: 20260101/nl/train/train_part_*.parquet - split: '1000' path: 20260101/nl/samples/1000_part_*.parquet - split: '5000' path: 20260101/nl/samples/5000_part_*.parquet - split: '10000' path: 20260101/nl/samples/10000_part_*.parquet - config_name: 20260101.pl data_files: - split: train path: 20260101/pl/train/train_part_*.parquet - split: '1000' path: 20260101/pl/samples/1000_part_*.parquet - split: '5000' path: 20260101/pl/samples/5000_part_*.parquet - split: '10000' path: 20260101/pl/samples/10000_part_*.parquet - config_name: 20260101.pt data_files: - split: train path: 20260101/pt/train/train_part_*.parquet - split: '1000' path: 20260101/pt/samples/1000_part_*.parquet - split: '5000' path: 20260101/pt/samples/5000_part_*.parquet - split: '10000' path: 20260101/pt/samples/10000_part_*.parquet - config_name: 20260101.sr data_files: - split: train path: 20260101/sr/train/train_part_*.parquet - split: '1000' path: 20260101/sr/samples/1000_part_*.parquet - split: '5000' path: 20260101/sr/samples/5000_part_*.parquet - split: '10000' path: 20260101/sr/samples/10000_part_*.parquet - config_name: 20260101.sv data_files: - split: train path: 20260101/sv/train/train_part_*.parquet - split: '1000' path: 20260101/sv/samples/1000_part_*.parquet - split: '5000' path: 20260101/sv/samples/5000_part_*.parquet - split: '10000' path: 20260101/sv/samples/10000_part_*.parquet - config_name: 20260101.tr data_files: - split: train path: 20260101/tr/train/train_part_*.parquet - split: '1000' path: 20260101/tr/samples/1000_part_*.parquet - split: '5000' path: 20260101/tr/samples/5000_part_*.parquet - split: '10000' path: 20260101/tr/samples/10000_part_*.parquet - config_name: 20260101.uk data_files: - split: train path: 20260101/uk/train/train_part_*.parquet - split: '1000' path: 20260101/uk/samples/1000_part_*.parquet - split: '5000' path: 20260101/uk/samples/5000_part_*.parquet - split: '10000' path: 20260101/uk/samples/10000_part_*.parquet - config_name: 20260101.vi data_files: - split: train path: 20260101/vi/train/train_part_*.parquet - split: '1000' path: 20260101/vi/samples/1000_part_*.parquet - split: '5000' path: 20260101/vi/samples/5000_part_*.parquet - split: '10000' path: 20260101/vi/samples/10000_part_*.parquet - config_name: 20260101.zh data_files: - split: train path: 20260101/zh/train/train_part_*.parquet - split: '1000' path: 20260101/zh/samples/1000_part_*.parquet - split: '5000' path: 20260101/zh/samples/5000_part_*.parquet - split: '10000' path: 20260101/zh/samples/10000_part_*.parquet - config_name: 20260101.th data_files: - split: train path: 20260101/th/train/train_part_*.parquet - split: '1000' path: 20260101/th/samples/1000_part_*.parquet - split: '5000' path: 20260101/th/samples/5000_part_*.parquet - split: '10000' path: 20260101/th/samples/10000_part_*.parquet - config_name: 20260101.ar data_files: - split: train path: 20260101/ar/train/train_part_*.parquet - split: '1000' path: 20260101/ar/samples/1000_part_*.parquet - split: '5000' path: 20260101/ar/samples/5000_part_*.parquet - split: '10000' path: 20260101/ar/samples/10000_part_*.parquet - config_name: 20260101.ja data_files: - split: train path: 20260101/ja/train/train_part_*.parquet - split: '1000' path: 20260101/ja/samples/1000_part_*.parquet - split: '5000' path: 20260101/ja/samples/5000_part_*.parquet - split: '10000' path: 20260101/ja/samples/10000_part_*.parquet - config_name: 20260101.ru data_files: - split: train path: 20260101/ru/train/train_part_*.parquet - split: '1000' path: 20260101/ru/samples/1000_part_*.parquet - split: '5000' path: 20260101/ru/samples/5000_part_*.parquet - split: '10000' path: 20260101/ru/samples/10000_part_*.parquet - config_name: 20260101.cho data_files: - split: train path: 20260101/cho/train/train_part_*.parquet - split: '1000' path: 20260101/cho/samples/1000_part_*.parquet - split: '5000' path: 20260101/cho/samples/5000_part_*.parquet - split: '10000' path: 20260101/cho/samples/10000_part_*.parquet - config_name: 20260101.chy data_files: - split: train path: 20260101/chy/train/train_part_*.parquet - split: '1000' path: 20260101/chy/samples/1000_part_*.parquet - split: '5000' path: 20260101/chy/samples/5000_part_*.parquet - split: '10000' path: 20260101/chy/samples/10000_part_*.parquet - config_name: 20260101.cr data_files: - split: train path: 20260101/cr/train/train_part_*.parquet - split: '1000' path: 20260101/cr/samples/1000_part_*.parquet - split: '5000' path: 20260101/cr/samples/5000_part_*.parquet - split: '10000' path: 20260101/cr/samples/10000_part_*.parquet - config_name: 20260101.ace data_files: - split: train path: 20260101/ace/train/train_part_*.parquet - split: '1000' path: 20260101/ace/samples/1000_part_*.parquet - split: '5000' path: 20260101/ace/samples/5000_part_*.parquet - split: '10000' path: 20260101/ace/samples/10000_part_*.parquet - config_name: 20260101.ak data_files: - split: train path: 20260101/ak/train/train_part_*.parquet - split: '1000' path: 20260101/ak/samples/1000_part_*.parquet - split: '5000' path: 20260101/ak/samples/5000_part_*.parquet - split: '10000' path: 20260101/ak/samples/10000_part_*.parquet - config_name: 20260101.as data_files: - split: train path: 20260101/as/train/train_part_*.parquet - split: '1000' path: 20260101/as/samples/1000_part_*.parquet - split: '5000' path: 20260101/as/samples/5000_part_*.parquet - split: '10000' path: 20260101/as/samples/10000_part_*.parquet - config_name: 20260101.atj data_files: - split: train path: 20260101/atj/train/train_part_*.parquet - split: '1000' path: 20260101/atj/samples/1000_part_*.parquet - split: '5000' path: 20260101/atj/samples/5000_part_*.parquet - split: '10000' path: 20260101/atj/samples/10000_part_*.parquet - config_name: 20260101.bh data_files: - split: train path: 20260101/bh/train/train_part_*.parquet - split: '1000' path: 20260101/bh/samples/1000_part_*.parquet - split: '5000' path: 20260101/bh/samples/5000_part_*.parquet - split: '10000' path: 20260101/bh/samples/10000_part_*.parquet - config_name: 20260101.bn data_files: - split: train path: 20260101/bn/train/train_part_*.parquet - split: '1000' path: 20260101/bn/samples/1000_part_*.parquet - split: '5000' path: 20260101/bn/samples/5000_part_*.parquet - split: '10000' path: 20260101/bn/samples/10000_part_*.parquet - config_name: 20260101.chr data_files: - split: train path: 20260101/chr/train/train_part_*.parquet - split: '1000' path: 20260101/chr/samples/1000_part_*.parquet - split: '5000' path: 20260101/chr/samples/5000_part_*.parquet - split: '10000' path: 20260101/chr/samples/10000_part_*.parquet - config_name: 20260101.eo data_files: - split: train path: 20260101/eo/train/train_part_*.parquet - split: '1000' path: 20260101/eo/samples/1000_part_*.parquet - split: '5000' path: 20260101/eo/samples/5000_part_*.parquet - split: '10000' path: 20260101/eo/samples/10000_part_*.parquet - config_name: 20260101.gpe data_files: - split: train path: 20260101/gpe/train/train_part_*.parquet - split: '1000' path: 20260101/gpe/samples/1000_part_*.parquet - split: '5000' path: 20260101/gpe/samples/5000_part_*.parquet - split: '10000' path: 20260101/gpe/samples/10000_part_*.parquet - config_name: 20260101.hyw data_files: - split: train path: 20260101/hyw/train/train_part_*.parquet - split: '1000' path: 20260101/hyw/samples/1000_part_*.parquet - split: '5000' path: 20260101/hyw/samples/5000_part_*.parquet - split: '10000' path: 20260101/hyw/samples/10000_part_*.parquet - config_name: 20260101.aa data_files: - split: train path: 20260101/aa/train/train_part_*.parquet - split: '1000' path: 20260101/aa/samples/1000_part_*.parquet - split: '5000' path: 20260101/aa/samples/5000_part_*.parquet - split: '10000' path: 20260101/aa/samples/10000_part_*.parquet - config_name: 20260101.ab data_files: - split: train path: 20260101/ab/train/train_part_*.parquet - split: '1000' path: 20260101/ab/samples/1000_part_*.parquet - split: '5000' path: 20260101/ab/samples/5000_part_*.parquet - split: '10000' path: 20260101/ab/samples/10000_part_*.parquet - config_name: 20260101.ady data_files: - split: train path: 20260101/ady/train/train_part_*.parquet - split: '1000' path: 20260101/ady/samples/1000_part_*.parquet - split: '5000' path: 20260101/ady/samples/5000_part_*.parquet - split: '10000' path: 20260101/ady/samples/10000_part_*.parquet - config_name: 20260101.af data_files: - split: train path: 20260101/af/train/train_part_*.parquet - split: '1000' path: 20260101/af/samples/1000_part_*.parquet - split: '5000' path: 20260101/af/samples/5000_part_*.parquet - split: '10000' path: 20260101/af/samples/10000_part_*.parquet - config_name: 20260101.alt data_files: - split: train path: 20260101/alt/train/train_part_*.parquet - split: '1000' path: 20260101/alt/samples/1000_part_*.parquet - split: '5000' path: 20260101/alt/samples/5000_part_*.parquet - split: '10000' path: 20260101/alt/samples/10000_part_*.parquet - config_name: 20260101.am data_files: - split: train path: 20260101/am/train/train_part_*.parquet - split: '1000' path: 20260101/am/samples/1000_part_*.parquet - split: '5000' path: 20260101/am/samples/5000_part_*.parquet - split: '10000' path: 20260101/am/samples/10000_part_*.parquet - config_name: 20260101.ami data_files: - split: train path: 20260101/ami/train/train_part_*.parquet - split: '1000' path: 20260101/ami/samples/1000_part_*.parquet - split: '5000' path: 20260101/ami/samples/5000_part_*.parquet - split: '10000' path: 20260101/ami/samples/10000_part_*.parquet - config_name: 20260101.an data_files: - split: train path: 20260101/an/train/train_part_*.parquet - split: '1000' path: 20260101/an/samples/1000_part_*.parquet - split: '5000' path: 20260101/an/samples/5000_part_*.parquet - split: '10000' path: 20260101/an/samples/10000_part_*.parquet - config_name: 20260101.ang data_files: - split: train path: 20260101/ang/train/train_part_*.parquet - split: '1000' path: 20260101/ang/samples/1000_part_*.parquet - split: '5000' path: 20260101/ang/samples/5000_part_*.parquet - split: '10000' path: 20260101/ang/samples/10000_part_*.parquet - config_name: 20260101.ann data_files: - split: train path: 20260101/ann/train/train_part_*.parquet - split: '1000' path: 20260101/ann/samples/1000_part_*.parquet - split: '5000' path: 20260101/ann/samples/5000_part_*.parquet - split: '10000' path: 20260101/ann/samples/10000_part_*.parquet - config_name: 20260101.anp data_files: - split: train path: 20260101/anp/train/train_part_*.parquet - split: '1000' path: 20260101/anp/samples/1000_part_*.parquet - split: '5000' path: 20260101/anp/samples/5000_part_*.parquet - split: '10000' path: 20260101/anp/samples/10000_part_*.parquet - config_name: 20260101.arc data_files: - split: train path: 20260101/arc/train/train_part_*.parquet - split: '1000' path: 20260101/arc/samples/1000_part_*.parquet - split: '5000' path: 20260101/arc/samples/5000_part_*.parquet - split: '10000' path: 20260101/arc/samples/10000_part_*.parquet - config_name: 20260101.ary data_files: - split: train path: 20260101/ary/train/train_part_*.parquet - split: '1000' path: 20260101/ary/samples/1000_part_*.parquet - split: '5000' path: 20260101/ary/samples/5000_part_*.parquet - split: '10000' path: 20260101/ary/samples/10000_part_*.parquet - config_name: 20260101.ast data_files: - split: train path: 20260101/ast/train/train_part_*.parquet - split: '1000' path: 20260101/ast/samples/1000_part_*.parquet - split: '5000' path: 20260101/ast/samples/5000_part_*.parquet - split: '10000' path: 20260101/ast/samples/10000_part_*.parquet - config_name: 20260101.av data_files: - split: train path: 20260101/av/train/train_part_*.parquet - split: '1000' path: 20260101/av/samples/1000_part_*.parquet - split: '5000' path: 20260101/av/samples/5000_part_*.parquet - split: '10000' path: 20260101/av/samples/10000_part_*.parquet - config_name: 20260101.avk data_files: - split: train path: 20260101/avk/train/train_part_*.parquet - split: '1000' path: 20260101/avk/samples/1000_part_*.parquet - split: '5000' path: 20260101/avk/samples/5000_part_*.parquet - split: '10000' path: 20260101/avk/samples/10000_part_*.parquet - config_name: 20260101.awa data_files: - split: train path: 20260101/awa/train/train_part_*.parquet - split: '1000' path: 20260101/awa/samples/1000_part_*.parquet - split: '5000' path: 20260101/awa/samples/5000_part_*.parquet - split: '10000' path: 20260101/awa/samples/10000_part_*.parquet - config_name: 20260101.ay data_files: - split: train path: 20260101/ay/train/train_part_*.parquet - split: '1000' path: 20260101/ay/samples/1000_part_*.parquet - split: '5000' path: 20260101/ay/samples/5000_part_*.parquet - split: '10000' path: 20260101/ay/samples/10000_part_*.parquet - config_name: 20260101.az data_files: - split: train path: 20260101/az/train/train_part_*.parquet - split: '1000' path: 20260101/az/samples/1000_part_*.parquet - split: '5000' path: 20260101/az/samples/5000_part_*.parquet - split: '10000' path: 20260101/az/samples/10000_part_*.parquet - config_name: 20260101.azb data_files: - split: train path: 20260101/azb/train/train_part_*.parquet - split: '1000' path: 20260101/azb/samples/1000_part_*.parquet - split: '5000' path: 20260101/azb/samples/5000_part_*.parquet - split: '10000' path: 20260101/azb/samples/10000_part_*.parquet - config_name: 20260101.ba data_files: - split: train path: 20260101/ba/train/train_part_*.parquet - split: '1000' path: 20260101/ba/samples/1000_part_*.parquet - split: '5000' path: 20260101/ba/samples/5000_part_*.parquet - split: '10000' path: 20260101/ba/samples/10000_part_*.parquet - config_name: 20260101.ban data_files: - split: train path: 20260101/ban/train/train_part_*.parquet - split: '1000' path: 20260101/ban/samples/1000_part_*.parquet - split: '5000' path: 20260101/ban/samples/5000_part_*.parquet - split: '10000' path: 20260101/ban/samples/10000_part_*.parquet - config_name: 20260101.bar data_files: - split: train path: 20260101/bar/train/train_part_*.parquet - split: '1000' path: 20260101/bar/samples/1000_part_*.parquet - split: '5000' path: 20260101/bar/samples/5000_part_*.parquet - split: '10000' path: 20260101/bar/samples/10000_part_*.parquet - config_name: 20260101.bbc data_files: - split: train path: 20260101/bbc/train/train_part_*.parquet - split: '1000' path: 20260101/bbc/samples/1000_part_*.parquet - split: '5000' path: 20260101/bbc/samples/5000_part_*.parquet - split: '10000' path: 20260101/bbc/samples/10000_part_*.parquet - config_name: 20260101.bcl data_files: - split: train path: 20260101/bcl/train/train_part_*.parquet - split: '1000' path: 20260101/bcl/samples/1000_part_*.parquet - split: '5000' path: 20260101/bcl/samples/5000_part_*.parquet - split: '10000' path: 20260101/bcl/samples/10000_part_*.parquet - config_name: 20260101.bdr data_files: - split: train path: 20260101/bdr/train/train_part_*.parquet - split: '1000' path: 20260101/bdr/samples/1000_part_*.parquet - split: '5000' path: 20260101/bdr/samples/5000_part_*.parquet - split: '10000' path: 20260101/bdr/samples/10000_part_*.parquet - config_name: 20260101.be data_files: - split: train path: 20260101/be/train/train_part_*.parquet - split: '1000' path: 20260101/be/samples/1000_part_*.parquet - split: '5000' path: 20260101/be/samples/5000_part_*.parquet - split: '10000' path: 20260101/be/samples/10000_part_*.parquet - config_name: 20260101.be-tarask data_files: - split: train path: 20260101/be-tarask/train/train_part_*.parquet - split: '1000' path: 20260101/be-tarask/samples/1000_part_*.parquet - split: '5000' path: 20260101/be-tarask/samples/5000_part_*.parquet - split: '10000' path: 20260101/be-tarask/samples/10000_part_*.parquet - config_name: 20260101.bew data_files: - split: train path: 20260101/bew/train/train_part_*.parquet - split: '1000' path: 20260101/bew/samples/1000_part_*.parquet - split: '5000' path: 20260101/bew/samples/5000_part_*.parquet - split: '10000' path: 20260101/bew/samples/10000_part_*.parquet - config_name: 20260101.bg data_files: - split: train path: 20260101/bg/train/train_part_*.parquet - split: '1000' path: 20260101/bg/samples/1000_part_*.parquet - split: '5000' path: 20260101/bg/samples/5000_part_*.parquet - split: '10000' path: 20260101/bg/samples/10000_part_*.parquet - config_name: 20260101.bi data_files: - split: train path: 20260101/bi/train/train_part_*.parquet - split: '1000' path: 20260101/bi/samples/1000_part_*.parquet - split: '5000' path: 20260101/bi/samples/5000_part_*.parquet - split: '10000' path: 20260101/bi/samples/10000_part_*.parquet - config_name: 20260101.bjn data_files: - split: train path: 20260101/bjn/train/train_part_*.parquet - split: '1000' path: 20260101/bjn/samples/1000_part_*.parquet - split: '5000' path: 20260101/bjn/samples/5000_part_*.parquet - split: '10000' path: 20260101/bjn/samples/10000_part_*.parquet - config_name: 20260101.blk data_files: - split: train path: 20260101/blk/train/train_part_*.parquet - split: '1000' path: 20260101/blk/samples/1000_part_*.parquet - split: '5000' path: 20260101/blk/samples/5000_part_*.parquet - split: '10000' path: 20260101/blk/samples/10000_part_*.parquet - config_name: 20260101.bm data_files: - split: train path: 20260101/bm/train/train_part_*.parquet - split: '1000' path: 20260101/bm/samples/1000_part_*.parquet - split: '5000' path: 20260101/bm/samples/5000_part_*.parquet - split: '10000' path: 20260101/bm/samples/10000_part_*.parquet - config_name: 20260101.bo data_files: - split: train path: 20260101/bo/train/train_part_*.parquet - split: '1000' path: 20260101/bo/samples/1000_part_*.parquet - split: '5000' path: 20260101/bo/samples/5000_part_*.parquet - split: '10000' path: 20260101/bo/samples/10000_part_*.parquet - config_name: 20260101.bpy data_files: - split: train path: 20260101/bpy/train/train_part_*.parquet - split: '1000' path: 20260101/bpy/samples/1000_part_*.parquet - split: '5000' path: 20260101/bpy/samples/5000_part_*.parquet - split: '10000' path: 20260101/bpy/samples/10000_part_*.parquet - config_name: 20260101.br data_files: - split: train path: 20260101/br/train/train_part_*.parquet - split: '1000' path: 20260101/br/samples/1000_part_*.parquet - split: '5000' path: 20260101/br/samples/5000_part_*.parquet - split: '10000' path: 20260101/br/samples/10000_part_*.parquet - config_name: 20260101.bs data_files: - split: train path: 20260101/bs/train/train_part_*.parquet - split: '1000' path: 20260101/bs/samples/1000_part_*.parquet - split: '5000' path: 20260101/bs/samples/5000_part_*.parquet - split: '10000' path: 20260101/bs/samples/10000_part_*.parquet - config_name: 20260101.btm data_files: - split: train path: 20260101/btm/train/train_part_*.parquet - split: '1000' path: 20260101/btm/samples/1000_part_*.parquet - split: '5000' path: 20260101/btm/samples/5000_part_*.parquet - split: '10000' path: 20260101/btm/samples/10000_part_*.parquet - config_name: 20260101.bug data_files: - split: train path: 20260101/bug/train/train_part_*.parquet - split: '1000' path: 20260101/bug/samples/1000_part_*.parquet - split: '5000' path: 20260101/bug/samples/5000_part_*.parquet - split: '10000' path: 20260101/bug/samples/10000_part_*.parquet - config_name: 20260101.bxr data_files: - split: train path: 20260101/bxr/train/train_part_*.parquet - split: '1000' path: 20260101/bxr/samples/1000_part_*.parquet - split: '5000' path: 20260101/bxr/samples/5000_part_*.parquet - split: '10000' path: 20260101/bxr/samples/10000_part_*.parquet - config_name: 20260101.ca data_files: - split: train path: 20260101/ca/train/train_part_*.parquet - split: '1000' path: 20260101/ca/samples/1000_part_*.parquet - split: '5000' path: 20260101/ca/samples/5000_part_*.parquet - split: '10000' path: 20260101/ca/samples/10000_part_*.parquet - config_name: 20260101.cbk-zam data_files: - split: train path: 20260101/cbk-zam/train/train_part_*.parquet - split: '1000' path: 20260101/cbk-zam/samples/1000_part_*.parquet - split: '5000' path: 20260101/cbk-zam/samples/5000_part_*.parquet - split: '10000' path: 20260101/cbk-zam/samples/10000_part_*.parquet - config_name: 20260101.cdo data_files: - split: train path: 20260101/cdo/train/train_part_*.parquet - split: '1000' path: 20260101/cdo/samples/1000_part_*.parquet - split: '5000' path: 20260101/cdo/samples/5000_part_*.parquet - split: '10000' path: 20260101/cdo/samples/10000_part_*.parquet - config_name: 20260101.ce data_files: - split: train path: 20260101/ce/train/train_part_*.parquet - split: '1000' path: 20260101/ce/samples/1000_part_*.parquet - split: '5000' path: 20260101/ce/samples/5000_part_*.parquet - split: '10000' path: 20260101/ce/samples/10000_part_*.parquet - config_name: 20260101.ch data_files: - split: train path: 20260101/ch/train/train_part_*.parquet - split: '1000' path: 20260101/ch/samples/1000_part_*.parquet - split: '5000' path: 20260101/ch/samples/5000_part_*.parquet - split: '10000' path: 20260101/ch/samples/10000_part_*.parquet - config_name: 20260101.ckb data_files: - split: train path: 20260101/ckb/train/train_part_*.parquet - split: '1000' path: 20260101/ckb/samples/1000_part_*.parquet - split: '5000' path: 20260101/ckb/samples/5000_part_*.parquet - split: '10000' path: 20260101/ckb/samples/10000_part_*.parquet - config_name: 20260101.co data_files: - split: train path: 20260101/co/train/train_part_*.parquet - split: '1000' path: 20260101/co/samples/1000_part_*.parquet - split: '5000' path: 20260101/co/samples/5000_part_*.parquet - split: '10000' path: 20260101/co/samples/10000_part_*.parquet - config_name: 20260101.crh data_files: - split: train path: 20260101/crh/train/train_part_*.parquet - split: '1000' path: 20260101/crh/samples/1000_part_*.parquet - split: '5000' path: 20260101/crh/samples/5000_part_*.parquet - split: '10000' path: 20260101/crh/samples/10000_part_*.parquet - config_name: 20260101.cs data_files: - split: train path: 20260101/cs/train/train_part_*.parquet - split: '1000' path: 20260101/cs/samples/1000_part_*.parquet - split: '5000' path: 20260101/cs/samples/5000_part_*.parquet - split: '10000' path: 20260101/cs/samples/10000_part_*.parquet - config_name: 20260101.csb data_files: - split: train path: 20260101/csb/train/train_part_*.parquet - split: '1000' path: 20260101/csb/samples/1000_part_*.parquet - split: '5000' path: 20260101/csb/samples/5000_part_*.parquet - split: '10000' path: 20260101/csb/samples/10000_part_*.parquet - config_name: 20260101.cu data_files: - split: train path: 20260101/cu/train/train_part_*.parquet - split: '1000' path: 20260101/cu/samples/1000_part_*.parquet - split: '5000' path: 20260101/cu/samples/5000_part_*.parquet - split: '10000' path: 20260101/cu/samples/10000_part_*.parquet - config_name: 20260101.cv data_files: - split: train path: 20260101/cv/train/train_part_*.parquet - split: '1000' path: 20260101/cv/samples/1000_part_*.parquet - split: '5000' path: 20260101/cv/samples/5000_part_*.parquet - split: '10000' path: 20260101/cv/samples/10000_part_*.parquet - config_name: 20260101.cy data_files: - split: train path: 20260101/cy/train/train_part_*.parquet - split: '1000' path: 20260101/cy/samples/1000_part_*.parquet - split: '5000' path: 20260101/cy/samples/5000_part_*.parquet - split: '10000' path: 20260101/cy/samples/10000_part_*.parquet - config_name: 20260101.da data_files: - split: train path: 20260101/da/train/train_part_*.parquet - split: '1000' path: 20260101/da/samples/1000_part_*.parquet - split: '5000' path: 20260101/da/samples/5000_part_*.parquet - split: '10000' path: 20260101/da/samples/10000_part_*.parquet - config_name: 20260101.dag data_files: - split: train path: 20260101/dag/train/train_part_*.parquet - split: '1000' path: 20260101/dag/samples/1000_part_*.parquet - split: '5000' path: 20260101/dag/samples/5000_part_*.parquet - split: '10000' path: 20260101/dag/samples/10000_part_*.parquet - config_name: 20260101.dga data_files: - split: train path: 20260101/dga/train/train_part_*.parquet - split: '1000' path: 20260101/dga/samples/1000_part_*.parquet - split: '5000' path: 20260101/dga/samples/5000_part_*.parquet - split: '10000' path: 20260101/dga/samples/10000_part_*.parquet - config_name: 20260101.din data_files: - split: train path: 20260101/din/train/train_part_*.parquet - split: '1000' path: 20260101/din/samples/1000_part_*.parquet - split: '5000' path: 20260101/din/samples/5000_part_*.parquet - split: '10000' path: 20260101/din/samples/10000_part_*.parquet - config_name: 20260101.diq data_files: - split: train path: 20260101/diq/train/train_part_*.parquet - split: '1000' path: 20260101/diq/samples/1000_part_*.parquet - split: '5000' path: 20260101/diq/samples/5000_part_*.parquet - split: '10000' path: 20260101/diq/samples/10000_part_*.parquet - config_name: 20260101.dsb data_files: - split: train path: 20260101/dsb/train/train_part_*.parquet - split: '1000' path: 20260101/dsb/samples/1000_part_*.parquet - split: '5000' path: 20260101/dsb/samples/5000_part_*.parquet - split: '10000' path: 20260101/dsb/samples/10000_part_*.parquet - config_name: 20260101.dtp data_files: - split: train path: 20260101/dtp/train/train_part_*.parquet - split: '1000' path: 20260101/dtp/samples/1000_part_*.parquet - split: '5000' path: 20260101/dtp/samples/5000_part_*.parquet - split: '10000' path: 20260101/dtp/samples/10000_part_*.parquet - config_name: 20260101.dty data_files: - split: train path: 20260101/dty/train/train_part_*.parquet - split: '1000' path: 20260101/dty/samples/1000_part_*.parquet - split: '5000' path: 20260101/dty/samples/5000_part_*.parquet - split: '10000' path: 20260101/dty/samples/10000_part_*.parquet - config_name: 20260101.dv data_files: - split: train path: 20260101/dv/train/train_part_*.parquet - split: '1000' path: 20260101/dv/samples/1000_part_*.parquet - split: '5000' path: 20260101/dv/samples/5000_part_*.parquet - split: '10000' path: 20260101/dv/samples/10000_part_*.parquet - config_name: 20260101.dz data_files: - split: train path: 20260101/dz/train/train_part_*.parquet - split: '1000' path: 20260101/dz/samples/1000_part_*.parquet - split: '5000' path: 20260101/dz/samples/5000_part_*.parquet - split: '10000' path: 20260101/dz/samples/10000_part_*.parquet - config_name: 20260101.ee data_files: - split: train path: 20260101/ee/train/train_part_*.parquet - split: '1000' path: 20260101/ee/samples/1000_part_*.parquet - split: '5000' path: 20260101/ee/samples/5000_part_*.parquet - split: '10000' path: 20260101/ee/samples/10000_part_*.parquet - config_name: 20260101.eml data_files: - split: train path: 20260101/eml/train/train_part_*.parquet - split: '1000' path: 20260101/eml/samples/1000_part_*.parquet - split: '5000' path: 20260101/eml/samples/5000_part_*.parquet - split: '10000' path: 20260101/eml/samples/10000_part_*.parquet - config_name: 20260101.et data_files: - split: train path: 20260101/et/train/train_part_*.parquet - split: '1000' path: 20260101/et/samples/1000_part_*.parquet - split: '5000' path: 20260101/et/samples/5000_part_*.parquet - split: '10000' path: 20260101/et/samples/10000_part_*.parquet - config_name: 20260101.eu data_files: - split: train path: 20260101/eu/train/train_part_*.parquet - split: '1000' path: 20260101/eu/samples/1000_part_*.parquet - split: '5000' path: 20260101/eu/samples/5000_part_*.parquet - split: '10000' path: 20260101/eu/samples/10000_part_*.parquet - config_name: 20260101.ext data_files: - split: train path: 20260101/ext/train/train_part_*.parquet - split: '1000' path: 20260101/ext/samples/1000_part_*.parquet - split: '5000' path: 20260101/ext/samples/5000_part_*.parquet - split: '10000' path: 20260101/ext/samples/10000_part_*.parquet - config_name: 20260101.fa data_files: - split: train path: 20260101/fa/train/train_part_*.parquet - split: '1000' path: 20260101/fa/samples/1000_part_*.parquet - split: '5000' path: 20260101/fa/samples/5000_part_*.parquet - split: '10000' path: 20260101/fa/samples/10000_part_*.parquet - config_name: 20260101.fat data_files: - split: train path: 20260101/fat/train/train_part_*.parquet - split: '1000' path: 20260101/fat/samples/1000_part_*.parquet - split: '5000' path: 20260101/fat/samples/5000_part_*.parquet - split: '10000' path: 20260101/fat/samples/10000_part_*.parquet - config_name: 20260101.ff data_files: - split: train path: 20260101/ff/train/train_part_*.parquet - split: '1000' path: 20260101/ff/samples/1000_part_*.parquet - split: '5000' path: 20260101/ff/samples/5000_part_*.parquet - split: '10000' path: 20260101/ff/samples/10000_part_*.parquet - config_name: 20260101.fi data_files: - split: train path: 20260101/fi/train/train_part_*.parquet - split: '1000' path: 20260101/fi/samples/1000_part_*.parquet - split: '5000' path: 20260101/fi/samples/5000_part_*.parquet - split: '10000' path: 20260101/fi/samples/10000_part_*.parquet - config_name: 20260101.fj data_files: - split: train path: 20260101/fj/train/train_part_*.parquet - split: '1000' path: 20260101/fj/samples/1000_part_*.parquet - split: '5000' path: 20260101/fj/samples/5000_part_*.parquet - split: '10000' path: 20260101/fj/samples/10000_part_*.parquet - config_name: 20260101.fo data_files: - split: train path: 20260101/fo/train/train_part_*.parquet - split: '1000' path: 20260101/fo/samples/1000_part_*.parquet - split: '5000' path: 20260101/fo/samples/5000_part_*.parquet - split: '10000' path: 20260101/fo/samples/10000_part_*.parquet - config_name: 20260101.fon data_files: - split: train path: 20260101/fon/train/train_part_*.parquet - split: '1000' path: 20260101/fon/samples/1000_part_*.parquet - split: '5000' path: 20260101/fon/samples/5000_part_*.parquet - split: '10000' path: 20260101/fon/samples/10000_part_*.parquet - config_name: 20260101.frp data_files: - split: train path: 20260101/frp/train/train_part_*.parquet - split: '1000' path: 20260101/frp/samples/1000_part_*.parquet - split: '5000' path: 20260101/frp/samples/5000_part_*.parquet - split: '10000' path: 20260101/frp/samples/10000_part_*.parquet - config_name: 20260101.frr data_files: - split: train path: 20260101/frr/train/train_part_*.parquet - split: '1000' path: 20260101/frr/samples/1000_part_*.parquet - split: '5000' path: 20260101/frr/samples/5000_part_*.parquet - split: '10000' path: 20260101/frr/samples/10000_part_*.parquet - config_name: 20260101.fur data_files: - split: train path: 20260101/fur/train/train_part_*.parquet - split: '1000' path: 20260101/fur/samples/1000_part_*.parquet - split: '5000' path: 20260101/fur/samples/5000_part_*.parquet - split: '10000' path: 20260101/fur/samples/10000_part_*.parquet - config_name: 20260101.fy data_files: - split: train path: 20260101/fy/train/train_part_*.parquet - split: '1000' path: 20260101/fy/samples/1000_part_*.parquet - split: '5000' path: 20260101/fy/samples/5000_part_*.parquet - split: '10000' path: 20260101/fy/samples/10000_part_*.parquet - config_name: 20260101.ga data_files: - split: train path: 20260101/ga/train/train_part_*.parquet - split: '1000' path: 20260101/ga/samples/1000_part_*.parquet - split: '5000' path: 20260101/ga/samples/5000_part_*.parquet - split: '10000' path: 20260101/ga/samples/10000_part_*.parquet - config_name: 20260101.gag data_files: - split: train path: 20260101/gag/train/train_part_*.parquet - split: '1000' path: 20260101/gag/samples/1000_part_*.parquet - split: '5000' path: 20260101/gag/samples/5000_part_*.parquet - split: '10000' path: 20260101/gag/samples/10000_part_*.parquet - config_name: 20260101.gan data_files: - split: train path: 20260101/gan/train/train_part_*.parquet - split: '1000' path: 20260101/gan/samples/1000_part_*.parquet - split: '5000' path: 20260101/gan/samples/5000_part_*.parquet - split: '10000' path: 20260101/gan/samples/10000_part_*.parquet - config_name: 20260101.gcr data_files: - split: train path: 20260101/gcr/train/train_part_*.parquet - split: '1000' path: 20260101/gcr/samples/1000_part_*.parquet - split: '5000' path: 20260101/gcr/samples/5000_part_*.parquet - split: '10000' path: 20260101/gcr/samples/10000_part_*.parquet - config_name: 20260101.gd data_files: - split: train path: 20260101/gd/train/train_part_*.parquet - split: '1000' path: 20260101/gd/samples/1000_part_*.parquet - split: '5000' path: 20260101/gd/samples/5000_part_*.parquet - split: '10000' path: 20260101/gd/samples/10000_part_*.parquet - config_name: 20260101.gl data_files: - split: train path: 20260101/gl/train/train_part_*.parquet - split: '1000' path: 20260101/gl/samples/1000_part_*.parquet - split: '5000' path: 20260101/gl/samples/5000_part_*.parquet - split: '10000' path: 20260101/gl/samples/10000_part_*.parquet - config_name: 20260101.glk data_files: - split: train path: 20260101/glk/train/train_part_*.parquet - split: '1000' path: 20260101/glk/samples/1000_part_*.parquet - split: '5000' path: 20260101/glk/samples/5000_part_*.parquet - split: '10000' path: 20260101/glk/samples/10000_part_*.parquet - config_name: 20260101.gn data_files: - split: train path: 20260101/gn/train/train_part_*.parquet - split: '1000' path: 20260101/gn/samples/1000_part_*.parquet - split: '5000' path: 20260101/gn/samples/5000_part_*.parquet - split: '10000' path: 20260101/gn/samples/10000_part_*.parquet - config_name: 20260101.gom data_files: - split: train path: 20260101/gom/train/train_part_*.parquet - split: '1000' path: 20260101/gom/samples/1000_part_*.parquet - split: '5000' path: 20260101/gom/samples/5000_part_*.parquet - split: '10000' path: 20260101/gom/samples/10000_part_*.parquet - config_name: 20260101.gor data_files: - split: train path: 20260101/gor/train/train_part_*.parquet - split: '1000' path: 20260101/gor/samples/1000_part_*.parquet - split: '5000' path: 20260101/gor/samples/5000_part_*.parquet - split: '10000' path: 20260101/gor/samples/10000_part_*.parquet - config_name: 20260101.got data_files: - split: train path: 20260101/got/train/train_part_*.parquet - split: '1000' path: 20260101/got/samples/1000_part_*.parquet - split: '5000' path: 20260101/got/samples/5000_part_*.parquet - split: '10000' path: 20260101/got/samples/10000_part_*.parquet - config_name: 20260101.gsw data_files: - split: train path: 20260101/gsw/train/train_part_*.parquet - split: '1000' path: 20260101/gsw/samples/1000_part_*.parquet - split: '5000' path: 20260101/gsw/samples/5000_part_*.parquet - split: '10000' path: 20260101/gsw/samples/10000_part_*.parquet - config_name: 20260101.gu data_files: - split: train path: 20260101/gu/train/train_part_*.parquet - split: '1000' path: 20260101/gu/samples/1000_part_*.parquet - split: '5000' path: 20260101/gu/samples/5000_part_*.parquet - split: '10000' path: 20260101/gu/samples/10000_part_*.parquet - config_name: 20260101.guc data_files: - split: train path: 20260101/guc/train/train_part_*.parquet - split: '1000' path: 20260101/guc/samples/1000_part_*.parquet - split: '5000' path: 20260101/guc/samples/5000_part_*.parquet - split: '10000' path: 20260101/guc/samples/10000_part_*.parquet - config_name: 20260101.gur data_files: - split: train path: 20260101/gur/train/train_part_*.parquet - split: '1000' path: 20260101/gur/samples/1000_part_*.parquet - split: '5000' path: 20260101/gur/samples/5000_part_*.parquet - split: '10000' path: 20260101/gur/samples/10000_part_*.parquet - config_name: 20260101.guw data_files: - split: train path: 20260101/guw/train/train_part_*.parquet - split: '1000' path: 20260101/guw/samples/1000_part_*.parquet - split: '5000' path: 20260101/guw/samples/5000_part_*.parquet - split: '10000' path: 20260101/guw/samples/10000_part_*.parquet - config_name: 20260101.gv data_files: - split: train path: 20260101/gv/train/train_part_*.parquet - split: '1000' path: 20260101/gv/samples/1000_part_*.parquet - split: '5000' path: 20260101/gv/samples/5000_part_*.parquet - split: '10000' path: 20260101/gv/samples/10000_part_*.parquet - config_name: 20260101.ha data_files: - split: train path: 20260101/ha/train/train_part_*.parquet - split: '1000' path: 20260101/ha/samples/1000_part_*.parquet - split: '5000' path: 20260101/ha/samples/5000_part_*.parquet - split: '10000' path: 20260101/ha/samples/10000_part_*.parquet - config_name: 20260101.hak data_files: - split: train path: 20260101/hak/train/train_part_*.parquet - split: '1000' path: 20260101/hak/samples/1000_part_*.parquet - split: '5000' path: 20260101/hak/samples/5000_part_*.parquet - split: '10000' path: 20260101/hak/samples/10000_part_*.parquet - config_name: 20260101.haw data_files: - split: train path: 20260101/haw/train/train_part_*.parquet - split: '1000' path: 20260101/haw/samples/1000_part_*.parquet - split: '5000' path: 20260101/haw/samples/5000_part_*.parquet - split: '10000' path: 20260101/haw/samples/10000_part_*.parquet - config_name: 20260101.hi data_files: - split: train path: 20260101/hi/train/train_part_*.parquet - split: '1000' path: 20260101/hi/samples/1000_part_*.parquet - split: '5000' path: 20260101/hi/samples/5000_part_*.parquet - split: '10000' path: 20260101/hi/samples/10000_part_*.parquet - config_name: 20260101.hif data_files: - split: train path: 20260101/hif/train/train_part_*.parquet - split: '1000' path: 20260101/hif/samples/1000_part_*.parquet - split: '5000' path: 20260101/hif/samples/5000_part_*.parquet - split: '10000' path: 20260101/hif/samples/10000_part_*.parquet - config_name: 20260101.ho data_files: - split: train path: 20260101/ho/train/train_part_*.parquet - split: '1000' path: 20260101/ho/samples/1000_part_*.parquet - split: '5000' path: 20260101/ho/samples/5000_part_*.parquet - split: '10000' path: 20260101/ho/samples/10000_part_*.parquet - config_name: 20260101.hr data_files: - split: train path: 20260101/hr/train/train_part_*.parquet - split: '1000' path: 20260101/hr/samples/1000_part_*.parquet - split: '5000' path: 20260101/hr/samples/5000_part_*.parquet - split: '10000' path: 20260101/hr/samples/10000_part_*.parquet - config_name: 20260101.hsb data_files: - split: train path: 20260101/hsb/train/train_part_*.parquet - split: '1000' path: 20260101/hsb/samples/1000_part_*.parquet - split: '5000' path: 20260101/hsb/samples/5000_part_*.parquet - split: '10000' path: 20260101/hsb/samples/10000_part_*.parquet - config_name: 20260101.ht data_files: - split: train path: 20260101/ht/train/train_part_*.parquet - split: '1000' path: 20260101/ht/samples/1000_part_*.parquet - split: '5000' path: 20260101/ht/samples/5000_part_*.parquet - split: '10000' path: 20260101/ht/samples/10000_part_*.parquet - config_name: 20260101.hy data_files: - split: train path: 20260101/hy/train/train_part_*.parquet - split: '1000' path: 20260101/hy/samples/1000_part_*.parquet - split: '5000' path: 20260101/hy/samples/5000_part_*.parquet - split: '10000' path: 20260101/hy/samples/10000_part_*.parquet - config_name: 20260101.hz data_files: - split: train path: 20260101/hz/train/train_part_*.parquet - split: '1000' path: 20260101/hz/samples/1000_part_*.parquet - split: '5000' path: 20260101/hz/samples/5000_part_*.parquet - split: '10000' path: 20260101/hz/samples/10000_part_*.parquet - config_name: 20260101.ia data_files: - split: train path: 20260101/ia/train/train_part_*.parquet - split: '1000' path: 20260101/ia/samples/1000_part_*.parquet - split: '5000' path: 20260101/ia/samples/5000_part_*.parquet - split: '10000' path: 20260101/ia/samples/10000_part_*.parquet - config_name: 20260101.iba data_files: - split: train path: 20260101/iba/train/train_part_*.parquet - split: '1000' path: 20260101/iba/samples/1000_part_*.parquet - split: '5000' path: 20260101/iba/samples/5000_part_*.parquet - split: '10000' path: 20260101/iba/samples/10000_part_*.parquet - config_name: 20260101.id data_files: - split: train path: 20260101/id/train/train_part_*.parquet - split: '1000' path: 20260101/id/samples/1000_part_*.parquet - split: '5000' path: 20260101/id/samples/5000_part_*.parquet - split: '10000' path: 20260101/id/samples/10000_part_*.parquet - config_name: 20260101.ie data_files: - split: train path: 20260101/ie/train/train_part_*.parquet - split: '1000' path: 20260101/ie/samples/1000_part_*.parquet - split: '5000' path: 20260101/ie/samples/5000_part_*.parquet - split: '10000' path: 20260101/ie/samples/10000_part_*.parquet - config_name: 20260101.ig data_files: - split: train path: 20260101/ig/train/train_part_*.parquet - split: '1000' path: 20260101/ig/samples/1000_part_*.parquet - split: '5000' path: 20260101/ig/samples/5000_part_*.parquet - split: '10000' path: 20260101/ig/samples/10000_part_*.parquet - config_name: 20260101.igl data_files: - split: train path: 20260101/igl/train/train_part_*.parquet - split: '1000' path: 20260101/igl/samples/1000_part_*.parquet - split: '5000' path: 20260101/igl/samples/5000_part_*.parquet - split: '10000' path: 20260101/igl/samples/10000_part_*.parquet - config_name: 20260101.ii data_files: - split: train path: 20260101/ii/train/train_part_*.parquet - split: '1000' path: 20260101/ii/samples/1000_part_*.parquet - split: '5000' path: 20260101/ii/samples/5000_part_*.parquet - split: '10000' path: 20260101/ii/samples/10000_part_*.parquet - config_name: 20260101.ik data_files: - split: train path: 20260101/ik/train/train_part_*.parquet - split: '1000' path: 20260101/ik/samples/1000_part_*.parquet - split: '5000' path: 20260101/ik/samples/5000_part_*.parquet - split: '10000' path: 20260101/ik/samples/10000_part_*.parquet - config_name: 20260101.ilo data_files: - split: train path: 20260101/ilo/train/train_part_*.parquet - split: '1000' path: 20260101/ilo/samples/1000_part_*.parquet - split: '5000' path: 20260101/ilo/samples/5000_part_*.parquet - split: '10000' path: 20260101/ilo/samples/10000_part_*.parquet - config_name: 20260101.inh data_files: - split: train path: 20260101/inh/train/train_part_*.parquet - split: '1000' path: 20260101/inh/samples/1000_part_*.parquet - split: '5000' path: 20260101/inh/samples/5000_part_*.parquet - split: '10000' path: 20260101/inh/samples/10000_part_*.parquet - config_name: 20260101.io data_files: - split: train path: 20260101/io/train/train_part_*.parquet - split: '1000' path: 20260101/io/samples/1000_part_*.parquet - split: '5000' path: 20260101/io/samples/5000_part_*.parquet - split: '10000' path: 20260101/io/samples/10000_part_*.parquet - config_name: 20260101.is data_files: - split: train path: 20260101/is/train/train_part_*.parquet - split: '1000' path: 20260101/is/samples/1000_part_*.parquet - split: '5000' path: 20260101/is/samples/5000_part_*.parquet - split: '10000' path: 20260101/is/samples/10000_part_*.parquet - config_name: 20260101.it data_files: - split: train path: 20260101/it/train/train_part_*.parquet - split: '1000' path: 20260101/it/samples/1000_part_*.parquet - split: '5000' path: 20260101/it/samples/5000_part_*.parquet - split: '10000' path: 20260101/it/samples/10000_part_*.parquet - config_name: 20260101.iu data_files: - split: train path: 20260101/iu/train/train_part_*.parquet - split: '1000' path: 20260101/iu/samples/1000_part_*.parquet - split: '5000' path: 20260101/iu/samples/5000_part_*.parquet - split: '10000' path: 20260101/iu/samples/10000_part_*.parquet - config_name: 20260101.jam data_files: - split: train path: 20260101/jam/train/train_part_*.parquet - split: '1000' path: 20260101/jam/samples/1000_part_*.parquet - split: '5000' path: 20260101/jam/samples/5000_part_*.parquet - split: '10000' path: 20260101/jam/samples/10000_part_*.parquet - config_name: 20260101.jbo data_files: - split: train path: 20260101/jbo/train/train_part_*.parquet - split: '1000' path: 20260101/jbo/samples/1000_part_*.parquet - split: '5000' path: 20260101/jbo/samples/5000_part_*.parquet - split: '10000' path: 20260101/jbo/samples/10000_part_*.parquet - config_name: 20260101.jv data_files: - split: train path: 20260101/jv/train/train_part_*.parquet - split: '1000' path: 20260101/jv/samples/1000_part_*.parquet - split: '5000' path: 20260101/jv/samples/5000_part_*.parquet - split: '10000' path: 20260101/jv/samples/10000_part_*.parquet - config_name: 20260101.ka data_files: - split: train path: 20260101/ka/train/train_part_*.parquet - split: '1000' path: 20260101/ka/samples/1000_part_*.parquet - split: '5000' path: 20260101/ka/samples/5000_part_*.parquet - split: '10000' path: 20260101/ka/samples/10000_part_*.parquet - config_name: 20260101.kaa data_files: - split: train path: 20260101/kaa/train/train_part_*.parquet - split: '1000' path: 20260101/kaa/samples/1000_part_*.parquet - split: '5000' path: 20260101/kaa/samples/5000_part_*.parquet - split: '10000' path: 20260101/kaa/samples/10000_part_*.parquet - config_name: 20260101.kab data_files: - split: train path: 20260101/kab/train/train_part_*.parquet - split: '1000' path: 20260101/kab/samples/1000_part_*.parquet - split: '5000' path: 20260101/kab/samples/5000_part_*.parquet - split: '10000' path: 20260101/kab/samples/10000_part_*.parquet - config_name: 20260101.kaj data_files: - split: train path: 20260101/kaj/train/train_part_*.parquet - split: '1000' path: 20260101/kaj/samples/1000_part_*.parquet - split: '5000' path: 20260101/kaj/samples/5000_part_*.parquet - split: '10000' path: 20260101/kaj/samples/10000_part_*.parquet - config_name: 20260101.kbd data_files: - split: train path: 20260101/kbd/train/train_part_*.parquet - split: '1000' path: 20260101/kbd/samples/1000_part_*.parquet - split: '5000' path: 20260101/kbd/samples/5000_part_*.parquet - split: '10000' path: 20260101/kbd/samples/10000_part_*.parquet - config_name: 20260101.kbp data_files: - split: train path: 20260101/kbp/train/train_part_*.parquet - split: '1000' path: 20260101/kbp/samples/1000_part_*.parquet - split: '5000' path: 20260101/kbp/samples/5000_part_*.parquet - split: '10000' path: 20260101/kbp/samples/10000_part_*.parquet - config_name: 20260101.kcg data_files: - split: train path: 20260101/kcg/train/train_part_*.parquet - split: '1000' path: 20260101/kcg/samples/1000_part_*.parquet - split: '5000' path: 20260101/kcg/samples/5000_part_*.parquet - split: '10000' path: 20260101/kcg/samples/10000_part_*.parquet - config_name: 20260101.kg data_files: - split: train path: 20260101/kg/train/train_part_*.parquet - split: '1000' path: 20260101/kg/samples/1000_part_*.parquet - split: '5000' path: 20260101/kg/samples/5000_part_*.parquet - split: '10000' path: 20260101/kg/samples/10000_part_*.parquet - config_name: 20260101.kge data_files: - split: train path: 20260101/kge/train/train_part_*.parquet - split: '1000' path: 20260101/kge/samples/1000_part_*.parquet - split: '5000' path: 20260101/kge/samples/5000_part_*.parquet - split: '10000' path: 20260101/kge/samples/10000_part_*.parquet - config_name: 20260101.ki data_files: - split: train path: 20260101/ki/train/train_part_*.parquet - split: '1000' path: 20260101/ki/samples/1000_part_*.parquet - split: '5000' path: 20260101/ki/samples/5000_part_*.parquet - split: '10000' path: 20260101/ki/samples/10000_part_*.parquet - config_name: 20260101.kj data_files: - split: train path: 20260101/kj/train/train_part_*.parquet - split: '1000' path: 20260101/kj/samples/1000_part_*.parquet - split: '5000' path: 20260101/kj/samples/5000_part_*.parquet - split: '10000' path: 20260101/kj/samples/10000_part_*.parquet - config_name: 20260101.kk data_files: - split: train path: 20260101/kk/train/train_part_*.parquet - split: '1000' path: 20260101/kk/samples/1000_part_*.parquet - split: '5000' path: 20260101/kk/samples/5000_part_*.parquet - split: '10000' path: 20260101/kk/samples/10000_part_*.parquet - config_name: 20260101.kl data_files: - split: train path: 20260101/kl/train/train_part_*.parquet - split: '1000' path: 20260101/kl/samples/1000_part_*.parquet - split: '5000' path: 20260101/kl/samples/5000_part_*.parquet - split: '10000' path: 20260101/kl/samples/10000_part_*.parquet - config_name: 20260101.km data_files: - split: train path: 20260101/km/train/train_part_*.parquet - split: '1000' path: 20260101/km/samples/1000_part_*.parquet - split: '5000' path: 20260101/km/samples/5000_part_*.parquet - split: '10000' path: 20260101/km/samples/10000_part_*.parquet - config_name: 20260101.kn data_files: - split: train path: 20260101/kn/train/train_part_*.parquet - split: '1000' path: 20260101/kn/samples/1000_part_*.parquet - split: '5000' path: 20260101/kn/samples/5000_part_*.parquet - split: '10000' path: 20260101/kn/samples/10000_part_*.parquet - config_name: 20260101.knc data_files: - split: train path: 20260101/knc/train/train_part_*.parquet - split: '1000' path: 20260101/knc/samples/1000_part_*.parquet - split: '5000' path: 20260101/knc/samples/5000_part_*.parquet - split: '10000' path: 20260101/knc/samples/10000_part_*.parquet - config_name: 20260101.koi data_files: - split: train path: 20260101/koi/train/train_part_*.parquet - split: '1000' path: 20260101/koi/samples/1000_part_*.parquet - split: '5000' path: 20260101/koi/samples/5000_part_*.parquet - split: '10000' path: 20260101/koi/samples/10000_part_*.parquet - config_name: 20260101.kr data_files: - split: train path: 20260101/kr/train/train_part_*.parquet - split: '1000' path: 20260101/kr/samples/1000_part_*.parquet - split: '5000' path: 20260101/kr/samples/5000_part_*.parquet - split: '10000' path: 20260101/kr/samples/10000_part_*.parquet - config_name: 20260101.krc data_files: - split: train path: 20260101/krc/train/train_part_*.parquet - split: '1000' path: 20260101/krc/samples/1000_part_*.parquet - split: '5000' path: 20260101/krc/samples/5000_part_*.parquet - split: '10000' path: 20260101/krc/samples/10000_part_*.parquet - config_name: 20260101.ks data_files: - split: train path: 20260101/ks/train/train_part_*.parquet - split: '1000' path: 20260101/ks/samples/1000_part_*.parquet - split: '5000' path: 20260101/ks/samples/5000_part_*.parquet - split: '10000' path: 20260101/ks/samples/10000_part_*.parquet - config_name: 20260101.ksh data_files: - split: train path: 20260101/ksh/train/train_part_*.parquet - split: '1000' path: 20260101/ksh/samples/1000_part_*.parquet - split: '5000' path: 20260101/ksh/samples/5000_part_*.parquet - split: '10000' path: 20260101/ksh/samples/10000_part_*.parquet - config_name: 20260101.ku data_files: - split: train path: 20260101/ku/train/train_part_*.parquet - split: '1000' path: 20260101/ku/samples/1000_part_*.parquet - split: '5000' path: 20260101/ku/samples/5000_part_*.parquet - split: '10000' path: 20260101/ku/samples/10000_part_*.parquet - config_name: 20260101.kus data_files: - split: train path: 20260101/kus/train/train_part_*.parquet - split: '1000' path: 20260101/kus/samples/1000_part_*.parquet - split: '5000' path: 20260101/kus/samples/5000_part_*.parquet - split: '10000' path: 20260101/kus/samples/10000_part_*.parquet - config_name: 20260101.kv data_files: - split: train path: 20260101/kv/train/train_part_*.parquet - split: '1000' path: 20260101/kv/samples/1000_part_*.parquet - split: '5000' path: 20260101/kv/samples/5000_part_*.parquet - split: '10000' path: 20260101/kv/samples/10000_part_*.parquet - config_name: 20260101.kw data_files: - split: train path: 20260101/kw/train/train_part_*.parquet - split: '1000' path: 20260101/kw/samples/1000_part_*.parquet - split: '5000' path: 20260101/kw/samples/5000_part_*.parquet - split: '10000' path: 20260101/kw/samples/10000_part_*.parquet - config_name: 20260101.ky data_files: - split: train path: 20260101/ky/train/train_part_*.parquet - split: '1000' path: 20260101/ky/samples/1000_part_*.parquet - split: '5000' path: 20260101/ky/samples/5000_part_*.parquet - split: '10000' path: 20260101/ky/samples/10000_part_*.parquet - config_name: 20260101.la data_files: - split: train path: 20260101/la/train/train_part_*.parquet - split: '1000' path: 20260101/la/samples/1000_part_*.parquet - split: '5000' path: 20260101/la/samples/5000_part_*.parquet - split: '10000' path: 20260101/la/samples/10000_part_*.parquet - config_name: 20260101.lad data_files: - split: train path: 20260101/lad/train/train_part_*.parquet - split: '1000' path: 20260101/lad/samples/1000_part_*.parquet - split: '5000' path: 20260101/lad/samples/5000_part_*.parquet - split: '10000' path: 20260101/lad/samples/10000_part_*.parquet - config_name: 20260101.lb data_files: - split: train path: 20260101/lb/train/train_part_*.parquet - split: '1000' path: 20260101/lb/samples/1000_part_*.parquet - split: '5000' path: 20260101/lb/samples/5000_part_*.parquet - split: '10000' path: 20260101/lb/samples/10000_part_*.parquet - config_name: 20260101.lbe data_files: - split: train path: 20260101/lbe/train/train_part_*.parquet - split: '1000' path: 20260101/lbe/samples/1000_part_*.parquet - split: '5000' path: 20260101/lbe/samples/5000_part_*.parquet - split: '10000' path: 20260101/lbe/samples/10000_part_*.parquet - config_name: 20260101.lez data_files: - split: train path: 20260101/lez/train/train_part_*.parquet - split: '1000' path: 20260101/lez/samples/1000_part_*.parquet - split: '5000' path: 20260101/lez/samples/5000_part_*.parquet - split: '10000' path: 20260101/lez/samples/10000_part_*.parquet - config_name: 20260101.lfn data_files: - split: train path: 20260101/lfn/train/train_part_*.parquet - split: '1000' path: 20260101/lfn/samples/1000_part_*.parquet - split: '5000' path: 20260101/lfn/samples/5000_part_*.parquet - split: '10000' path: 20260101/lfn/samples/10000_part_*.parquet - config_name: 20260101.lg data_files: - split: train path: 20260101/lg/train/train_part_*.parquet - split: '1000' path: 20260101/lg/samples/1000_part_*.parquet - split: '5000' path: 20260101/lg/samples/5000_part_*.parquet - split: '10000' path: 20260101/lg/samples/10000_part_*.parquet - config_name: 20260101.li data_files: - split: train path: 20260101/li/train/train_part_*.parquet - split: '1000' path: 20260101/li/samples/1000_part_*.parquet - split: '5000' path: 20260101/li/samples/5000_part_*.parquet - split: '10000' path: 20260101/li/samples/10000_part_*.parquet - config_name: 20260101.lij data_files: - split: train path: 20260101/lij/train/train_part_*.parquet - split: '1000' path: 20260101/lij/samples/1000_part_*.parquet - split: '5000' path: 20260101/lij/samples/5000_part_*.parquet - split: '10000' path: 20260101/lij/samples/10000_part_*.parquet - config_name: 20260101.lld data_files: - split: train path: 20260101/lld/train/train_part_*.parquet - split: '1000' path: 20260101/lld/samples/1000_part_*.parquet - split: '5000' path: 20260101/lld/samples/5000_part_*.parquet - split: '10000' path: 20260101/lld/samples/10000_part_*.parquet - config_name: 20260101.lmo data_files: - split: train path: 20260101/lmo/train/train_part_*.parquet - split: '1000' path: 20260101/lmo/samples/1000_part_*.parquet - split: '5000' path: 20260101/lmo/samples/5000_part_*.parquet - split: '10000' path: 20260101/lmo/samples/10000_part_*.parquet - config_name: 20260101.ln data_files: - split: train path: 20260101/ln/train/train_part_*.parquet - split: '1000' path: 20260101/ln/samples/1000_part_*.parquet - split: '5000' path: 20260101/ln/samples/5000_part_*.parquet - split: '10000' path: 20260101/ln/samples/10000_part_*.parquet - config_name: 20260101.lo data_files: - split: train path: 20260101/lo/train/train_part_*.parquet - split: '1000' path: 20260101/lo/samples/1000_part_*.parquet - split: '5000' path: 20260101/lo/samples/5000_part_*.parquet - split: '10000' path: 20260101/lo/samples/10000_part_*.parquet - config_name: 20260101.lrc data_files: - split: train path: 20260101/lrc/train/train_part_*.parquet - split: '1000' path: 20260101/lrc/samples/1000_part_*.parquet - split: '5000' path: 20260101/lrc/samples/5000_part_*.parquet - split: '10000' path: 20260101/lrc/samples/10000_part_*.parquet - config_name: 20260101.lt data_files: - split: train path: 20260101/lt/train/train_part_*.parquet - split: '1000' path: 20260101/lt/samples/1000_part_*.parquet - split: '5000' path: 20260101/lt/samples/5000_part_*.parquet - split: '10000' path: 20260101/lt/samples/10000_part_*.parquet - config_name: 20260101.ltg data_files: - split: train path: 20260101/ltg/train/train_part_*.parquet - split: '1000' path: 20260101/ltg/samples/1000_part_*.parquet - split: '5000' path: 20260101/ltg/samples/5000_part_*.parquet - split: '10000' path: 20260101/ltg/samples/10000_part_*.parquet - config_name: 20260101.lv data_files: - split: train path: 20260101/lv/train/train_part_*.parquet - split: '1000' path: 20260101/lv/samples/1000_part_*.parquet - split: '5000' path: 20260101/lv/samples/5000_part_*.parquet - split: '10000' path: 20260101/lv/samples/10000_part_*.parquet - config_name: 20260101.lzh data_files: - split: train path: 20260101/lzh/train/train_part_*.parquet - split: '1000' path: 20260101/lzh/samples/1000_part_*.parquet - split: '5000' path: 20260101/lzh/samples/5000_part_*.parquet - split: '10000' path: 20260101/lzh/samples/10000_part_*.parquet - config_name: 20260101.mad data_files: - split: train path: 20260101/mad/train/train_part_*.parquet - split: '1000' path: 20260101/mad/samples/1000_part_*.parquet - split: '5000' path: 20260101/mad/samples/5000_part_*.parquet - split: '10000' path: 20260101/mad/samples/10000_part_*.parquet - config_name: 20260101.mai data_files: - split: train path: 20260101/mai/train/train_part_*.parquet - split: '1000' path: 20260101/mai/samples/1000_part_*.parquet - split: '5000' path: 20260101/mai/samples/5000_part_*.parquet - split: '10000' path: 20260101/mai/samples/10000_part_*.parquet - config_name: 20260101.map-bms data_files: - split: train path: 20260101/map-bms/train/train_part_*.parquet - split: '1000' path: 20260101/map-bms/samples/1000_part_*.parquet - split: '5000' path: 20260101/map-bms/samples/5000_part_*.parquet - split: '10000' path: 20260101/map-bms/samples/10000_part_*.parquet - config_name: 20260101.mdf data_files: - split: train path: 20260101/mdf/train/train_part_*.parquet - split: '1000' path: 20260101/mdf/samples/1000_part_*.parquet - split: '5000' path: 20260101/mdf/samples/5000_part_*.parquet - split: '10000' path: 20260101/mdf/samples/10000_part_*.parquet - config_name: 20260101.mg data_files: - split: train path: 20260101/mg/train/train_part_*.parquet - split: '1000' path: 20260101/mg/samples/1000_part_*.parquet - split: '5000' path: 20260101/mg/samples/5000_part_*.parquet - split: '10000' path: 20260101/mg/samples/10000_part_*.parquet - config_name: 20260101.mh data_files: - split: train path: 20260101/mh/train/train_part_*.parquet - split: '1000' path: 20260101/mh/samples/1000_part_*.parquet - split: '5000' path: 20260101/mh/samples/5000_part_*.parquet - split: '10000' path: 20260101/mh/samples/10000_part_*.parquet - config_name: 20260101.mhr data_files: - split: train path: 20260101/mhr/train/train_part_*.parquet - split: '1000' path: 20260101/mhr/samples/1000_part_*.parquet - split: '5000' path: 20260101/mhr/samples/5000_part_*.parquet - split: '10000' path: 20260101/mhr/samples/10000_part_*.parquet - config_name: 20260101.mi data_files: - split: train path: 20260101/mi/train/train_part_*.parquet - split: '1000' path: 20260101/mi/samples/1000_part_*.parquet - split: '5000' path: 20260101/mi/samples/5000_part_*.parquet - split: '10000' path: 20260101/mi/samples/10000_part_*.parquet - config_name: 20260101.min data_files: - split: train path: 20260101/min/train/train_part_*.parquet - split: '1000' path: 20260101/min/samples/1000_part_*.parquet - split: '5000' path: 20260101/min/samples/5000_part_*.parquet - split: '10000' path: 20260101/min/samples/10000_part_*.parquet - config_name: 20260101.mk data_files: - split: train path: 20260101/mk/train/train_part_*.parquet - split: '1000' path: 20260101/mk/samples/1000_part_*.parquet - split: '5000' path: 20260101/mk/samples/5000_part_*.parquet - split: '10000' path: 20260101/mk/samples/10000_part_*.parquet - config_name: 20260101.ml data_files: - split: train path: 20260101/ml/train/train_part_*.parquet - split: '1000' path: 20260101/ml/samples/1000_part_*.parquet - split: '5000' path: 20260101/ml/samples/5000_part_*.parquet - split: '10000' path: 20260101/ml/samples/10000_part_*.parquet - config_name: 20260101.mn data_files: - split: train path: 20260101/mn/train/train_part_*.parquet - split: '1000' path: 20260101/mn/samples/1000_part_*.parquet - split: '5000' path: 20260101/mn/samples/5000_part_*.parquet - split: '10000' path: 20260101/mn/samples/10000_part_*.parquet - config_name: 20260101.mni data_files: - split: train path: 20260101/mni/train/train_part_*.parquet - split: '1000' path: 20260101/mni/samples/1000_part_*.parquet - split: '5000' path: 20260101/mni/samples/5000_part_*.parquet - split: '10000' path: 20260101/mni/samples/10000_part_*.parquet - config_name: 20260101.mnw data_files: - split: train path: 20260101/mnw/train/train_part_*.parquet - split: '1000' path: 20260101/mnw/samples/1000_part_*.parquet - split: '5000' path: 20260101/mnw/samples/5000_part_*.parquet - split: '10000' path: 20260101/mnw/samples/10000_part_*.parquet - config_name: 20260101.mos data_files: - split: train path: 20260101/mos/train/train_part_*.parquet - split: '1000' path: 20260101/mos/samples/1000_part_*.parquet - split: '5000' path: 20260101/mos/samples/5000_part_*.parquet - split: '10000' path: 20260101/mos/samples/10000_part_*.parquet - config_name: 20260101.mr data_files: - split: train path: 20260101/mr/train/train_part_*.parquet - split: '1000' path: 20260101/mr/samples/1000_part_*.parquet - split: '5000' path: 20260101/mr/samples/5000_part_*.parquet - split: '10000' path: 20260101/mr/samples/10000_part_*.parquet - config_name: 20260101.mrj data_files: - split: train path: 20260101/mrj/train/train_part_*.parquet - split: '1000' path: 20260101/mrj/samples/1000_part_*.parquet - split: '5000' path: 20260101/mrj/samples/5000_part_*.parquet - split: '10000' path: 20260101/mrj/samples/10000_part_*.parquet - config_name: 20260101.ms data_files: - split: train path: 20260101/ms/train/train_part_*.parquet - split: '1000' path: 20260101/ms/samples/1000_part_*.parquet - split: '5000' path: 20260101/ms/samples/5000_part_*.parquet - split: '10000' path: 20260101/ms/samples/10000_part_*.parquet - config_name: 20260101.mt data_files: - split: train path: 20260101/mt/train/train_part_*.parquet - split: '1000' path: 20260101/mt/samples/1000_part_*.parquet - split: '5000' path: 20260101/mt/samples/5000_part_*.parquet - split: '10000' path: 20260101/mt/samples/10000_part_*.parquet - config_name: 20260101.mus data_files: - split: train path: 20260101/mus/train/train_part_*.parquet - split: '1000' path: 20260101/mus/samples/1000_part_*.parquet - split: '5000' path: 20260101/mus/samples/5000_part_*.parquet - split: '10000' path: 20260101/mus/samples/10000_part_*.parquet - config_name: 20260101.mwl data_files: - split: train path: 20260101/mwl/train/train_part_*.parquet - split: '1000' path: 20260101/mwl/samples/1000_part_*.parquet - split: '5000' path: 20260101/mwl/samples/5000_part_*.parquet - split: '10000' path: 20260101/mwl/samples/10000_part_*.parquet - config_name: 20260101.my data_files: - split: train path: 20260101/my/train/train_part_*.parquet - split: '1000' path: 20260101/my/samples/1000_part_*.parquet - split: '5000' path: 20260101/my/samples/5000_part_*.parquet - split: '10000' path: 20260101/my/samples/10000_part_*.parquet - config_name: 20260101.myv data_files: - split: train path: 20260101/myv/train/train_part_*.parquet - split: '1000' path: 20260101/myv/samples/1000_part_*.parquet - split: '5000' path: 20260101/myv/samples/5000_part_*.parquet - split: '10000' path: 20260101/myv/samples/10000_part_*.parquet - config_name: 20260101.mzn data_files: - split: train path: 20260101/mzn/train/train_part_*.parquet - split: '1000' path: 20260101/mzn/samples/1000_part_*.parquet - split: '5000' path: 20260101/mzn/samples/5000_part_*.parquet - split: '10000' path: 20260101/mzn/samples/10000_part_*.parquet - config_name: 20260101.na data_files: - split: train path: 20260101/na/train/train_part_*.parquet - split: '1000' path: 20260101/na/samples/1000_part_*.parquet - split: '5000' path: 20260101/na/samples/5000_part_*.parquet - split: '10000' path: 20260101/na/samples/10000_part_*.parquet - config_name: 20260101.nah data_files: - split: train path: 20260101/nah/train/train_part_*.parquet - split: '1000' path: 20260101/nah/samples/1000_part_*.parquet - split: '5000' path: 20260101/nah/samples/5000_part_*.parquet - split: '10000' path: 20260101/nah/samples/10000_part_*.parquet - config_name: 20260101.nan data_files: - split: train path: 20260101/nan/train/train_part_*.parquet - split: '1000' path: 20260101/nan/samples/1000_part_*.parquet - split: '5000' path: 20260101/nan/samples/5000_part_*.parquet - split: '10000' path: 20260101/nan/samples/10000_part_*.parquet - config_name: 20260101.nap data_files: - split: train path: 20260101/nap/train/train_part_*.parquet - split: '1000' path: 20260101/nap/samples/1000_part_*.parquet - split: '5000' path: 20260101/nap/samples/5000_part_*.parquet - split: '10000' path: 20260101/nap/samples/10000_part_*.parquet - config_name: 20260101.nds data_files: - split: train path: 20260101/nds/train/train_part_*.parquet - split: '1000' path: 20260101/nds/samples/1000_part_*.parquet - split: '5000' path: 20260101/nds/samples/5000_part_*.parquet - split: '10000' path: 20260101/nds/samples/10000_part_*.parquet - config_name: 20260101.nds-nl data_files: - split: train path: 20260101/nds-nl/train/train_part_*.parquet - split: '1000' path: 20260101/nds-nl/samples/1000_part_*.parquet - split: '5000' path: 20260101/nds-nl/samples/5000_part_*.parquet - split: '10000' path: 20260101/nds-nl/samples/10000_part_*.parquet - config_name: 20260101.ne data_files: - split: train path: 20260101/ne/train/train_part_*.parquet - split: '1000' path: 20260101/ne/samples/1000_part_*.parquet - split: '5000' path: 20260101/ne/samples/5000_part_*.parquet - split: '10000' path: 20260101/ne/samples/10000_part_*.parquet - config_name: 20260101.new data_files: - split: train path: 20260101/new/train/train_part_*.parquet - split: '1000' path: 20260101/new/samples/1000_part_*.parquet - split: '5000' path: 20260101/new/samples/5000_part_*.parquet - split: '10000' path: 20260101/new/samples/10000_part_*.parquet - config_name: 20260101.ng data_files: - split: train path: 20260101/ng/train/train_part_*.parquet - split: '1000' path: 20260101/ng/samples/1000_part_*.parquet - split: '5000' path: 20260101/ng/samples/5000_part_*.parquet - split: '10000' path: 20260101/ng/samples/10000_part_*.parquet - config_name: 20260101.nia data_files: - split: train path: 20260101/nia/train/train_part_*.parquet - split: '1000' path: 20260101/nia/samples/1000_part_*.parquet - split: '5000' path: 20260101/nia/samples/5000_part_*.parquet - split: '10000' path: 20260101/nia/samples/10000_part_*.parquet - config_name: 20260101.nn data_files: - split: train path: 20260101/nn/train/train_part_*.parquet - split: '1000' path: 20260101/nn/samples/1000_part_*.parquet - split: '5000' path: 20260101/nn/samples/5000_part_*.parquet - split: '10000' path: 20260101/nn/samples/10000_part_*.parquet - config_name: 20260101.no data_files: - split: train path: 20260101/no/train/train_part_*.parquet - split: '1000' path: 20260101/no/samples/1000_part_*.parquet - split: '5000' path: 20260101/no/samples/5000_part_*.parquet - split: '10000' path: 20260101/no/samples/10000_part_*.parquet - config_name: 20260101.nov data_files: - split: train path: 20260101/nov/train/train_part_*.parquet - split: '1000' path: 20260101/nov/samples/1000_part_*.parquet - split: '5000' path: 20260101/nov/samples/5000_part_*.parquet - split: '10000' path: 20260101/nov/samples/10000_part_*.parquet - config_name: 20260101.nqo data_files: - split: train path: 20260101/nqo/train/train_part_*.parquet - split: '1000' path: 20260101/nqo/samples/1000_part_*.parquet - split: '5000' path: 20260101/nqo/samples/5000_part_*.parquet - split: '10000' path: 20260101/nqo/samples/10000_part_*.parquet - config_name: 20260101.nr data_files: - split: train path: 20260101/nr/train/train_part_*.parquet - split: '1000' path: 20260101/nr/samples/1000_part_*.parquet - split: '5000' path: 20260101/nr/samples/5000_part_*.parquet - split: '10000' path: 20260101/nr/samples/10000_part_*.parquet - config_name: 20260101.nrm data_files: - split: train path: 20260101/nrm/train/train_part_*.parquet - split: '1000' path: 20260101/nrm/samples/1000_part_*.parquet - split: '5000' path: 20260101/nrm/samples/5000_part_*.parquet - split: '10000' path: 20260101/nrm/samples/10000_part_*.parquet - config_name: 20260101.nso data_files: - split: train path: 20260101/nso/train/train_part_*.parquet - split: '1000' path: 20260101/nso/samples/1000_part_*.parquet - split: '5000' path: 20260101/nso/samples/5000_part_*.parquet - split: '10000' path: 20260101/nso/samples/10000_part_*.parquet - config_name: 20260101.nup data_files: - split: train path: 20260101/nup/train/train_part_*.parquet - split: '1000' path: 20260101/nup/samples/1000_part_*.parquet - split: '5000' path: 20260101/nup/samples/5000_part_*.parquet - split: '10000' path: 20260101/nup/samples/10000_part_*.parquet - config_name: 20260101.nv data_files: - split: train path: 20260101/nv/train/train_part_*.parquet - split: '1000' path: 20260101/nv/samples/1000_part_*.parquet - split: '5000' path: 20260101/nv/samples/5000_part_*.parquet - split: '10000' path: 20260101/nv/samples/10000_part_*.parquet - config_name: 20260101.ny data_files: - split: train path: 20260101/ny/train/train_part_*.parquet - split: '1000' path: 20260101/ny/samples/1000_part_*.parquet - split: '5000' path: 20260101/ny/samples/5000_part_*.parquet - split: '10000' path: 20260101/ny/samples/10000_part_*.parquet - config_name: 20260101.oc data_files: - split: train path: 20260101/oc/train/train_part_*.parquet - split: '1000' path: 20260101/oc/samples/1000_part_*.parquet - split: '5000' path: 20260101/oc/samples/5000_part_*.parquet - split: '10000' path: 20260101/oc/samples/10000_part_*.parquet - config_name: 20260101.olo data_files: - split: train path: 20260101/olo/train/train_part_*.parquet - split: '1000' path: 20260101/olo/samples/1000_part_*.parquet - split: '5000' path: 20260101/olo/samples/5000_part_*.parquet - split: '10000' path: 20260101/olo/samples/10000_part_*.parquet - config_name: 20260101.om data_files: - split: train path: 20260101/om/train/train_part_*.parquet - split: '1000' path: 20260101/om/samples/1000_part_*.parquet - split: '5000' path: 20260101/om/samples/5000_part_*.parquet - split: '10000' path: 20260101/om/samples/10000_part_*.parquet - config_name: 20260101.or data_files: - split: train path: 20260101/or/train/train_part_*.parquet - split: '1000' path: 20260101/or/samples/1000_part_*.parquet - split: '5000' path: 20260101/or/samples/5000_part_*.parquet - split: '10000' path: 20260101/or/samples/10000_part_*.parquet - config_name: 20260101.os data_files: - split: train path: 20260101/os/train/train_part_*.parquet - split: '1000' path: 20260101/os/samples/1000_part_*.parquet - split: '5000' path: 20260101/os/samples/5000_part_*.parquet - split: '10000' path: 20260101/os/samples/10000_part_*.parquet - config_name: 20260101.pa data_files: - split: train path: 20260101/pa/train/train_part_*.parquet - split: '1000' path: 20260101/pa/samples/1000_part_*.parquet - split: '5000' path: 20260101/pa/samples/5000_part_*.parquet - split: '10000' path: 20260101/pa/samples/10000_part_*.parquet - config_name: 20260101.pag data_files: - split: train path: 20260101/pag/train/train_part_*.parquet - split: '1000' path: 20260101/pag/samples/1000_part_*.parquet - split: '5000' path: 20260101/pag/samples/5000_part_*.parquet - split: '10000' path: 20260101/pag/samples/10000_part_*.parquet - config_name: 20260101.pam data_files: - split: train path: 20260101/pam/train/train_part_*.parquet - split: '1000' path: 20260101/pam/samples/1000_part_*.parquet - split: '5000' path: 20260101/pam/samples/5000_part_*.parquet - split: '10000' path: 20260101/pam/samples/10000_part_*.parquet - config_name: 20260101.pap data_files: - split: train path: 20260101/pap/train/train_part_*.parquet - split: '1000' path: 20260101/pap/samples/1000_part_*.parquet - split: '5000' path: 20260101/pap/samples/5000_part_*.parquet - split: '10000' path: 20260101/pap/samples/10000_part_*.parquet - config_name: 20260101.pcd data_files: - split: train path: 20260101/pcd/train/train_part_*.parquet - split: '1000' path: 20260101/pcd/samples/1000_part_*.parquet - split: '5000' path: 20260101/pcd/samples/5000_part_*.parquet - split: '10000' path: 20260101/pcd/samples/10000_part_*.parquet - config_name: 20260101.pcm data_files: - split: train path: 20260101/pcm/train/train_part_*.parquet - split: '1000' path: 20260101/pcm/samples/1000_part_*.parquet - split: '5000' path: 20260101/pcm/samples/5000_part_*.parquet - split: '10000' path: 20260101/pcm/samples/10000_part_*.parquet - config_name: 20260101.pdc data_files: - split: train path: 20260101/pdc/train/train_part_*.parquet - split: '1000' path: 20260101/pdc/samples/1000_part_*.parquet - split: '5000' path: 20260101/pdc/samples/5000_part_*.parquet - split: '10000' path: 20260101/pdc/samples/10000_part_*.parquet - config_name: 20260101.pfl data_files: - split: train path: 20260101/pfl/train/train_part_*.parquet - split: '1000' path: 20260101/pfl/samples/1000_part_*.parquet - split: '5000' path: 20260101/pfl/samples/5000_part_*.parquet - split: '10000' path: 20260101/pfl/samples/10000_part_*.parquet - config_name: 20260101.pih data_files: - split: train path: 20260101/pih/train/train_part_*.parquet - split: '1000' path: 20260101/pih/samples/1000_part_*.parquet - split: '5000' path: 20260101/pih/samples/5000_part_*.parquet - split: '10000' path: 20260101/pih/samples/10000_part_*.parquet - config_name: 20260101.ps data_files: - split: train path: 20260101/ps/train/train_part_*.parquet - split: '1000' path: 20260101/ps/samples/1000_part_*.parquet - split: '5000' path: 20260101/ps/samples/5000_part_*.parquet - split: '10000' path: 20260101/ps/samples/10000_part_*.parquet - config_name: 20260101.rki data_files: - split: train path: 20260101/rki/train/train_part_*.parquet - split: '1000' path: 20260101/rki/samples/1000_part_*.parquet - split: '5000' path: 20260101/rki/samples/5000_part_*.parquet - split: '10000' path: 20260101/rki/samples/10000_part_*.parquet - config_name: 20260101.tn data_files: - split: train path: 20260101/tn/train/train_part_*.parquet - split: '1000' path: 20260101/tn/samples/1000_part_*.parquet - split: '5000' path: 20260101/tn/samples/5000_part_*.parquet - split: '10000' path: 20260101/tn/samples/10000_part_*.parquet - config_name: 20260101.arz data_files: - split: train path: 20260101/arz/train/train_part_*.parquet - split: '1000' path: 20260101/arz/samples/1000_part_*.parquet - split: '5000' path: 20260101/arz/samples/5000_part_*.parquet - split: '10000' path: 20260101/arz/samples/10000_part_*.parquet - config_name: 20260101.pi data_files: - split: train path: 20260101/pi/train/train_part_*.parquet - split: '1000' path: 20260101/pi/samples/1000_part_*.parquet - split: '5000' path: 20260101/pi/samples/5000_part_*.parquet - split: '10000' path: 20260101/pi/samples/10000_part_*.parquet - config_name: 20260101.pms data_files: - split: train path: 20260101/pms/train/train_part_*.parquet - split: '1000' path: 20260101/pms/samples/1000_part_*.parquet - split: '5000' path: 20260101/pms/samples/5000_part_*.parquet - split: '10000' path: 20260101/pms/samples/10000_part_*.parquet - config_name: 20260101.pnb data_files: - split: train path: 20260101/pnb/train/train_part_*.parquet - split: '1000' path: 20260101/pnb/samples/1000_part_*.parquet - split: '5000' path: 20260101/pnb/samples/5000_part_*.parquet - split: '10000' path: 20260101/pnb/samples/10000_part_*.parquet - config_name: 20260101.pnt data_files: - split: train path: 20260101/pnt/train/train_part_*.parquet - split: '1000' path: 20260101/pnt/samples/1000_part_*.parquet - split: '5000' path: 20260101/pnt/samples/5000_part_*.parquet - split: '10000' path: 20260101/pnt/samples/10000_part_*.parquet - config_name: 20260101.pwn data_files: - split: train path: 20260101/pwn/train/train_part_*.parquet - split: '1000' path: 20260101/pwn/samples/1000_part_*.parquet - split: '5000' path: 20260101/pwn/samples/5000_part_*.parquet - split: '10000' path: 20260101/pwn/samples/10000_part_*.parquet - config_name: 20260101.qu data_files: - split: train path: 20260101/qu/train/train_part_*.parquet - split: '1000' path: 20260101/qu/samples/1000_part_*.parquet - split: '5000' path: 20260101/qu/samples/5000_part_*.parquet - split: '10000' path: 20260101/qu/samples/10000_part_*.parquet - config_name: 20260101.rm data_files: - split: train path: 20260101/rm/train/train_part_*.parquet - split: '1000' path: 20260101/rm/samples/1000_part_*.parquet - split: '5000' path: 20260101/rm/samples/5000_part_*.parquet - split: '10000' path: 20260101/rm/samples/10000_part_*.parquet - config_name: 20260101.rmy data_files: - split: train path: 20260101/rmy/train/train_part_*.parquet - split: '1000' path: 20260101/rmy/samples/1000_part_*.parquet - split: '5000' path: 20260101/rmy/samples/5000_part_*.parquet - split: '10000' path: 20260101/rmy/samples/10000_part_*.parquet - config_name: 20260101.rn data_files: - split: train path: 20260101/rn/train/train_part_*.parquet - split: '1000' path: 20260101/rn/samples/1000_part_*.parquet - split: '5000' path: 20260101/rn/samples/5000_part_*.parquet - split: '10000' path: 20260101/rn/samples/10000_part_*.parquet - config_name: 20260101.ro data_files: - split: train path: 20260101/ro/train/train_part_*.parquet - split: '1000' path: 20260101/ro/samples/1000_part_*.parquet - split: '5000' path: 20260101/ro/samples/5000_part_*.parquet - split: '10000' path: 20260101/ro/samples/10000_part_*.parquet - config_name: 20260101.roa-tara data_files: - split: train path: 20260101/roa-tara/train/train_part_*.parquet - split: '1000' path: 20260101/roa-tara/samples/1000_part_*.parquet - split: '5000' path: 20260101/roa-tara/samples/5000_part_*.parquet - split: '10000' path: 20260101/roa-tara/samples/10000_part_*.parquet - config_name: 20260101.rsk data_files: - split: train path: 20260101/rsk/train/train_part_*.parquet - split: '1000' path: 20260101/rsk/samples/1000_part_*.parquet - split: '5000' path: 20260101/rsk/samples/5000_part_*.parquet - split: '10000' path: 20260101/rsk/samples/10000_part_*.parquet - config_name: 20260101.rue data_files: - split: train path: 20260101/rue/train/train_part_*.parquet - split: '1000' path: 20260101/rue/samples/1000_part_*.parquet - split: '5000' path: 20260101/rue/samples/5000_part_*.parquet - split: '10000' path: 20260101/rue/samples/10000_part_*.parquet - config_name: 20260101.rup data_files: - split: train path: 20260101/rup/train/train_part_*.parquet - split: '1000' path: 20260101/rup/samples/1000_part_*.parquet - split: '5000' path: 20260101/rup/samples/5000_part_*.parquet - split: '10000' path: 20260101/rup/samples/10000_part_*.parquet - config_name: 20260101.rw data_files: - split: train path: 20260101/rw/train/train_part_*.parquet - split: '1000' path: 20260101/rw/samples/1000_part_*.parquet - split: '5000' path: 20260101/rw/samples/5000_part_*.parquet - split: '10000' path: 20260101/rw/samples/10000_part_*.parquet - config_name: 20260101.sa data_files: - split: train path: 20260101/sa/train/train_part_*.parquet - split: '1000' path: 20260101/sa/samples/1000_part_*.parquet - split: '5000' path: 20260101/sa/samples/5000_part_*.parquet - split: '10000' path: 20260101/sa/samples/10000_part_*.parquet - config_name: 20260101.sah data_files: - split: train path: 20260101/sah/train/train_part_*.parquet - split: '1000' path: 20260101/sah/samples/1000_part_*.parquet - split: '5000' path: 20260101/sah/samples/5000_part_*.parquet - split: '10000' path: 20260101/sah/samples/10000_part_*.parquet - config_name: 20260101.sat data_files: - split: train path: 20260101/sat/train/train_part_*.parquet - split: '1000' path: 20260101/sat/samples/1000_part_*.parquet - split: '5000' path: 20260101/sat/samples/5000_part_*.parquet - split: '10000' path: 20260101/sat/samples/10000_part_*.parquet - config_name: 20260101.sc data_files: - split: train path: 20260101/sc/train/train_part_*.parquet - split: '1000' path: 20260101/sc/samples/1000_part_*.parquet - split: '5000' path: 20260101/sc/samples/5000_part_*.parquet - split: '10000' path: 20260101/sc/samples/10000_part_*.parquet - config_name: 20260101.scn data_files: - split: train path: 20260101/scn/train/train_part_*.parquet - split: '1000' path: 20260101/scn/samples/1000_part_*.parquet - split: '5000' path: 20260101/scn/samples/5000_part_*.parquet - split: '10000' path: 20260101/scn/samples/10000_part_*.parquet - config_name: 20260101.sco data_files: - split: train path: 20260101/sco/train/train_part_*.parquet - split: '1000' path: 20260101/sco/samples/1000_part_*.parquet - split: '5000' path: 20260101/sco/samples/5000_part_*.parquet - split: '10000' path: 20260101/sco/samples/10000_part_*.parquet - config_name: 20260101.sd data_files: - split: train path: 20260101/sd/train/train_part_*.parquet - split: '1000' path: 20260101/sd/samples/1000_part_*.parquet - split: '5000' path: 20260101/sd/samples/5000_part_*.parquet - split: '10000' path: 20260101/sd/samples/10000_part_*.parquet - config_name: 20260101.se data_files: - split: train path: 20260101/se/train/train_part_*.parquet - split: '1000' path: 20260101/se/samples/1000_part_*.parquet - split: '5000' path: 20260101/se/samples/5000_part_*.parquet - split: '10000' path: 20260101/se/samples/10000_part_*.parquet - config_name: 20260101.sg data_files: - split: train path: 20260101/sg/train/train_part_*.parquet - split: '1000' path: 20260101/sg/samples/1000_part_*.parquet - split: '5000' path: 20260101/sg/samples/5000_part_*.parquet - split: '10000' path: 20260101/sg/samples/10000_part_*.parquet - config_name: 20260101.sgs data_files: - split: train path: 20260101/sgs/train/train_part_*.parquet - split: '1000' path: 20260101/sgs/samples/1000_part_*.parquet - split: '5000' path: 20260101/sgs/samples/5000_part_*.parquet - split: '10000' path: 20260101/sgs/samples/10000_part_*.parquet - config_name: 20260101.sh data_files: - split: train path: 20260101/sh/train/train_part_*.parquet - split: '1000' path: 20260101/sh/samples/1000_part_*.parquet - split: '5000' path: 20260101/sh/samples/5000_part_*.parquet - split: '10000' path: 20260101/sh/samples/10000_part_*.parquet - config_name: 20260101.shi data_files: - split: train path: 20260101/shi/train/train_part_*.parquet - split: '1000' path: 20260101/shi/samples/1000_part_*.parquet - split: '5000' path: 20260101/shi/samples/5000_part_*.parquet - split: '10000' path: 20260101/shi/samples/10000_part_*.parquet - config_name: 20260101.shn data_files: - split: train path: 20260101/shn/train/train_part_*.parquet - split: '1000' path: 20260101/shn/samples/1000_part_*.parquet - split: '5000' path: 20260101/shn/samples/5000_part_*.parquet - split: '10000' path: 20260101/shn/samples/10000_part_*.parquet - config_name: 20260101.si data_files: - split: train path: 20260101/si/train/train_part_*.parquet - split: '1000' path: 20260101/si/samples/1000_part_*.parquet - split: '5000' path: 20260101/si/samples/5000_part_*.parquet - split: '10000' path: 20260101/si/samples/10000_part_*.parquet - config_name: 20260101.simple data_files: - split: train path: 20260101/simple/train/train_part_*.parquet - split: '1000' path: 20260101/simple/samples/1000_part_*.parquet - split: '5000' path: 20260101/simple/samples/5000_part_*.parquet - split: '10000' path: 20260101/simple/samples/10000_part_*.parquet - config_name: 20260101.sk data_files: - split: train path: 20260101/sk/train/train_part_*.parquet - split: '1000' path: 20260101/sk/samples/1000_part_*.parquet - split: '5000' path: 20260101/sk/samples/5000_part_*.parquet - split: '10000' path: 20260101/sk/samples/10000_part_*.parquet - config_name: 20260101.skr data_files: - split: train path: 20260101/skr/train/train_part_*.parquet - split: '1000' path: 20260101/skr/samples/1000_part_*.parquet - split: '5000' path: 20260101/skr/samples/5000_part_*.parquet - split: '10000' path: 20260101/skr/samples/10000_part_*.parquet - config_name: 20260101.sl data_files: - split: train path: 20260101/sl/train/train_part_*.parquet - split: '1000' path: 20260101/sl/samples/1000_part_*.parquet - split: '5000' path: 20260101/sl/samples/5000_part_*.parquet - split: '10000' path: 20260101/sl/samples/10000_part_*.parquet - config_name: 20260101.sm data_files: - split: train path: 20260101/sm/train/train_part_*.parquet - split: '1000' path: 20260101/sm/samples/1000_part_*.parquet - split: '5000' path: 20260101/sm/samples/5000_part_*.parquet - split: '10000' path: 20260101/sm/samples/10000_part_*.parquet - config_name: 20260101.smn data_files: - split: train path: 20260101/smn/train/train_part_*.parquet - split: '1000' path: 20260101/smn/samples/1000_part_*.parquet - split: '5000' path: 20260101/smn/samples/5000_part_*.parquet - split: '10000' path: 20260101/smn/samples/10000_part_*.parquet - config_name: 20260101.sn data_files: - split: train path: 20260101/sn/train/train_part_*.parquet - split: '1000' path: 20260101/sn/samples/1000_part_*.parquet - split: '5000' path: 20260101/sn/samples/5000_part_*.parquet - split: '10000' path: 20260101/sn/samples/10000_part_*.parquet - config_name: 20260101.so data_files: - split: train path: 20260101/so/train/train_part_*.parquet - split: '1000' path: 20260101/so/samples/1000_part_*.parquet - split: '5000' path: 20260101/so/samples/5000_part_*.parquet - split: '10000' path: 20260101/so/samples/10000_part_*.parquet - config_name: 20260101.sq data_files: - split: train path: 20260101/sq/train/train_part_*.parquet - split: '1000' path: 20260101/sq/samples/1000_part_*.parquet - split: '5000' path: 20260101/sq/samples/5000_part_*.parquet - split: '10000' path: 20260101/sq/samples/10000_part_*.parquet - config_name: 20260101.srn data_files: - split: train path: 20260101/srn/train/train_part_*.parquet - split: '1000' path: 20260101/srn/samples/1000_part_*.parquet - split: '5000' path: 20260101/srn/samples/5000_part_*.parquet - split: '10000' path: 20260101/srn/samples/10000_part_*.parquet - config_name: 20260101.ss data_files: - split: train path: 20260101/ss/train/train_part_*.parquet - split: '1000' path: 20260101/ss/samples/1000_part_*.parquet - split: '5000' path: 20260101/ss/samples/5000_part_*.parquet - split: '10000' path: 20260101/ss/samples/10000_part_*.parquet - config_name: 20260101.st data_files: - split: train path: 20260101/st/train/train_part_*.parquet - split: '1000' path: 20260101/st/samples/1000_part_*.parquet - split: '5000' path: 20260101/st/samples/5000_part_*.parquet - split: '10000' path: 20260101/st/samples/10000_part_*.parquet - config_name: 20260101.stq data_files: - split: train path: 20260101/stq/train/train_part_*.parquet - split: '1000' path: 20260101/stq/samples/1000_part_*.parquet - split: '5000' path: 20260101/stq/samples/5000_part_*.parquet - split: '10000' path: 20260101/stq/samples/10000_part_*.parquet - config_name: 20260101.su data_files: - split: train path: 20260101/su/train/train_part_*.parquet - split: '1000' path: 20260101/su/samples/1000_part_*.parquet - split: '5000' path: 20260101/su/samples/5000_part_*.parquet - split: '10000' path: 20260101/su/samples/10000_part_*.parquet - config_name: 20260101.sw data_files: - split: train path: 20260101/sw/train/train_part_*.parquet - split: '1000' path: 20260101/sw/samples/1000_part_*.parquet - split: '5000' path: 20260101/sw/samples/5000_part_*.parquet - split: '10000' path: 20260101/sw/samples/10000_part_*.parquet - config_name: 20260101.syl data_files: - split: train path: 20260101/syl/train/train_part_*.parquet - split: '1000' path: 20260101/syl/samples/1000_part_*.parquet - split: '5000' path: 20260101/syl/samples/5000_part_*.parquet - split: '10000' path: 20260101/syl/samples/10000_part_*.parquet - config_name: 20260101.szl data_files: - split: train path: 20260101/szl/train/train_part_*.parquet - split: '1000' path: 20260101/szl/samples/1000_part_*.parquet - split: '5000' path: 20260101/szl/samples/5000_part_*.parquet - split: '10000' path: 20260101/szl/samples/10000_part_*.parquet - config_name: 20260101.szy data_files: - split: train path: 20260101/szy/train/train_part_*.parquet - split: '1000' path: 20260101/szy/samples/1000_part_*.parquet - split: '5000' path: 20260101/szy/samples/5000_part_*.parquet - split: '10000' path: 20260101/szy/samples/10000_part_*.parquet - config_name: 20260101.ta data_files: - split: train path: 20260101/ta/train/train_part_*.parquet - split: '1000' path: 20260101/ta/samples/1000_part_*.parquet - split: '5000' path: 20260101/ta/samples/5000_part_*.parquet - split: '10000' path: 20260101/ta/samples/10000_part_*.parquet - config_name: 20260101.tay data_files: - split: train path: 20260101/tay/train/train_part_*.parquet - split: '1000' path: 20260101/tay/samples/1000_part_*.parquet - split: '5000' path: 20260101/tay/samples/5000_part_*.parquet - split: '10000' path: 20260101/tay/samples/10000_part_*.parquet - config_name: 20260101.tcy data_files: - split: train path: 20260101/tcy/train/train_part_*.parquet - split: '1000' path: 20260101/tcy/samples/1000_part_*.parquet - split: '5000' path: 20260101/tcy/samples/5000_part_*.parquet - split: '10000' path: 20260101/tcy/samples/10000_part_*.parquet - config_name: 20260101.tdd data_files: - split: train path: 20260101/tdd/train/train_part_*.parquet - split: '1000' path: 20260101/tdd/samples/1000_part_*.parquet - split: '5000' path: 20260101/tdd/samples/5000_part_*.parquet - split: '10000' path: 20260101/tdd/samples/10000_part_*.parquet - config_name: 20260101.te data_files: - split: train path: 20260101/te/train/train_part_*.parquet - split: '1000' path: 20260101/te/samples/1000_part_*.parquet - split: '5000' path: 20260101/te/samples/5000_part_*.parquet - split: '10000' path: 20260101/te/samples/10000_part_*.parquet - config_name: 20260101.tet data_files: - split: train path: 20260101/tet/train/train_part_*.parquet - split: '1000' path: 20260101/tet/samples/1000_part_*.parquet - split: '5000' path: 20260101/tet/samples/5000_part_*.parquet - split: '10000' path: 20260101/tet/samples/10000_part_*.parquet - config_name: 20260101.tg data_files: - split: train path: 20260101/tg/train/train_part_*.parquet - split: '1000' path: 20260101/tg/samples/1000_part_*.parquet - split: '5000' path: 20260101/tg/samples/5000_part_*.parquet - split: '10000' path: 20260101/tg/samples/10000_part_*.parquet - config_name: 20260101.ti data_files: - split: train path: 20260101/ti/train/train_part_*.parquet - split: '1000' path: 20260101/ti/samples/1000_part_*.parquet - split: '5000' path: 20260101/ti/samples/5000_part_*.parquet - split: '10000' path: 20260101/ti/samples/10000_part_*.parquet - config_name: 20260101.tig data_files: - split: train path: 20260101/tig/train/train_part_*.parquet - split: '1000' path: 20260101/tig/samples/1000_part_*.parquet - split: '5000' path: 20260101/tig/samples/5000_part_*.parquet - split: '10000' path: 20260101/tig/samples/10000_part_*.parquet - config_name: 20260101.tk data_files: - split: train path: 20260101/tk/train/train_part_*.parquet - split: '1000' path: 20260101/tk/samples/1000_part_*.parquet - split: '5000' path: 20260101/tk/samples/5000_part_*.parquet - split: '10000' path: 20260101/tk/samples/10000_part_*.parquet - config_name: 20260101.tl data_files: - split: train path: 20260101/tl/train/train_part_*.parquet - split: '1000' path: 20260101/tl/samples/1000_part_*.parquet - split: '5000' path: 20260101/tl/samples/5000_part_*.parquet - split: '10000' path: 20260101/tl/samples/10000_part_*.parquet - config_name: 20260101.tly data_files: - split: train path: 20260101/tly/train/train_part_*.parquet - split: '1000' path: 20260101/tly/samples/1000_part_*.parquet - split: '5000' path: 20260101/tly/samples/5000_part_*.parquet - split: '10000' path: 20260101/tly/samples/10000_part_*.parquet - config_name: 20260101.to data_files: - split: train path: 20260101/to/train/train_part_*.parquet - split: '1000' path: 20260101/to/samples/1000_part_*.parquet - split: '5000' path: 20260101/to/samples/5000_part_*.parquet - split: '10000' path: 20260101/to/samples/10000_part_*.parquet - config_name: 20260101.tok data_files: - split: train path: 20260101/tok/train/train_part_*.parquet - split: '1000' path: 20260101/tok/samples/1000_part_*.parquet - split: '5000' path: 20260101/tok/samples/5000_part_*.parquet - split: '10000' path: 20260101/tok/samples/10000_part_*.parquet - config_name: 20260101.tpi data_files: - split: train path: 20260101/tpi/train/train_part_*.parquet - split: '1000' path: 20260101/tpi/samples/1000_part_*.parquet - split: '5000' path: 20260101/tpi/samples/5000_part_*.parquet - split: '10000' path: 20260101/tpi/samples/10000_part_*.parquet - config_name: 20260101.trv data_files: - split: train path: 20260101/trv/train/train_part_*.parquet - split: '1000' path: 20260101/trv/samples/1000_part_*.parquet - split: '5000' path: 20260101/trv/samples/5000_part_*.parquet - split: '10000' path: 20260101/trv/samples/10000_part_*.parquet - config_name: 20260101.ts data_files: - split: train path: 20260101/ts/train/train_part_*.parquet - split: '1000' path: 20260101/ts/samples/1000_part_*.parquet - split: '5000' path: 20260101/ts/samples/5000_part_*.parquet - split: '10000' path: 20260101/ts/samples/10000_part_*.parquet - config_name: 20260101.tt data_files: - split: train path: 20260101/tt/train/train_part_*.parquet - split: '1000' path: 20260101/tt/samples/1000_part_*.parquet - split: '5000' path: 20260101/tt/samples/5000_part_*.parquet - split: '10000' path: 20260101/tt/samples/10000_part_*.parquet - config_name: 20260101.tum data_files: - split: train path: 20260101/tum/train/train_part_*.parquet - split: '1000' path: 20260101/tum/samples/1000_part_*.parquet - split: '5000' path: 20260101/tum/samples/5000_part_*.parquet - split: '10000' path: 20260101/tum/samples/10000_part_*.parquet - config_name: 20260101.tw data_files: - split: train path: 20260101/tw/train/train_part_*.parquet - split: '1000' path: 20260101/tw/samples/1000_part_*.parquet - split: '5000' path: 20260101/tw/samples/5000_part_*.parquet - split: '10000' path: 20260101/tw/samples/10000_part_*.parquet - config_name: 20260101.ty data_files: - split: train path: 20260101/ty/train/train_part_*.parquet - split: '1000' path: 20260101/ty/samples/1000_part_*.parquet - split: '5000' path: 20260101/ty/samples/5000_part_*.parquet - split: '10000' path: 20260101/ty/samples/10000_part_*.parquet - config_name: 20260101.tyv data_files: - split: train path: 20260101/tyv/train/train_part_*.parquet - split: '1000' path: 20260101/tyv/samples/1000_part_*.parquet - split: '5000' path: 20260101/tyv/samples/5000_part_*.parquet - split: '10000' path: 20260101/tyv/samples/10000_part_*.parquet - config_name: 20260101.udm data_files: - split: train path: 20260101/udm/train/train_part_*.parquet - split: '1000' path: 20260101/udm/samples/1000_part_*.parquet - split: '5000' path: 20260101/udm/samples/5000_part_*.parquet - split: '10000' path: 20260101/udm/samples/10000_part_*.parquet - config_name: 20260101.ug data_files: - split: train path: 20260101/ug/train/train_part_*.parquet - split: '1000' path: 20260101/ug/samples/1000_part_*.parquet - split: '5000' path: 20260101/ug/samples/5000_part_*.parquet - split: '10000' path: 20260101/ug/samples/10000_part_*.parquet - config_name: 20260101.ur data_files: - split: train path: 20260101/ur/train/train_part_*.parquet - split: '1000' path: 20260101/ur/samples/1000_part_*.parquet - split: '5000' path: 20260101/ur/samples/5000_part_*.parquet - split: '10000' path: 20260101/ur/samples/10000_part_*.parquet - config_name: 20260101.uz data_files: - split: train path: 20260101/uz/train/train_part_*.parquet - split: '1000' path: 20260101/uz/samples/1000_part_*.parquet - split: '5000' path: 20260101/uz/samples/5000_part_*.parquet - split: '10000' path: 20260101/uz/samples/10000_part_*.parquet - config_name: 20260101.ve data_files: - split: train path: 20260101/ve/train/train_part_*.parquet - split: '1000' path: 20260101/ve/samples/1000_part_*.parquet - split: '5000' path: 20260101/ve/samples/5000_part_*.parquet - split: '10000' path: 20260101/ve/samples/10000_part_*.parquet - config_name: 20260101.vec data_files: - split: train path: 20260101/vec/train/train_part_*.parquet - split: '1000' path: 20260101/vec/samples/1000_part_*.parquet - split: '5000' path: 20260101/vec/samples/5000_part_*.parquet - split: '10000' path: 20260101/vec/samples/10000_part_*.parquet - config_name: 20260101.vep data_files: - split: train path: 20260101/vep/train/train_part_*.parquet - split: '1000' path: 20260101/vep/samples/1000_part_*.parquet - split: '5000' path: 20260101/vep/samples/5000_part_*.parquet - split: '10000' path: 20260101/vep/samples/10000_part_*.parquet - config_name: 20260101.vls data_files: - split: train path: 20260101/vls/train/train_part_*.parquet - split: '1000' path: 20260101/vls/samples/1000_part_*.parquet - split: '5000' path: 20260101/vls/samples/5000_part_*.parquet - split: '10000' path: 20260101/vls/samples/10000_part_*.parquet - config_name: 20260101.vo data_files: - split: train path: 20260101/vo/train/train_part_*.parquet - split: '1000' path: 20260101/vo/samples/1000_part_*.parquet - split: '5000' path: 20260101/vo/samples/5000_part_*.parquet - split: '10000' path: 20260101/vo/samples/10000_part_*.parquet - config_name: 20260101.vro data_files: - split: train path: 20260101/vro/train/train_part_*.parquet - split: '1000' path: 20260101/vro/samples/1000_part_*.parquet - split: '5000' path: 20260101/vro/samples/5000_part_*.parquet - split: '10000' path: 20260101/vro/samples/10000_part_*.parquet - config_name: 20260101.wa data_files: - split: train path: 20260101/wa/train/train_part_*.parquet - split: '1000' path: 20260101/wa/samples/1000_part_*.parquet - split: '5000' path: 20260101/wa/samples/5000_part_*.parquet - split: '10000' path: 20260101/wa/samples/10000_part_*.parquet - config_name: 20260101.war data_files: - split: train path: 20260101/war/train/train_part_*.parquet - split: '1000' path: 20260101/war/samples/1000_part_*.parquet - split: '5000' path: 20260101/war/samples/5000_part_*.parquet - split: '10000' path: 20260101/war/samples/10000_part_*.parquet - config_name: 20260101.wo data_files: - split: train path: 20260101/wo/train/train_part_*.parquet - split: '1000' path: 20260101/wo/samples/1000_part_*.parquet - split: '5000' path: 20260101/wo/samples/5000_part_*.parquet - split: '10000' path: 20260101/wo/samples/10000_part_*.parquet - config_name: 20260101.wuu data_files: - split: train path: 20260101/wuu/train/train_part_*.parquet - split: '1000' path: 20260101/wuu/samples/1000_part_*.parquet - split: '5000' path: 20260101/wuu/samples/5000_part_*.parquet - split: '10000' path: 20260101/wuu/samples/10000_part_*.parquet - config_name: 20260101.xal data_files: - split: train path: 20260101/xal/train/train_part_*.parquet - split: '1000' path: 20260101/xal/samples/1000_part_*.parquet - split: '5000' path: 20260101/xal/samples/5000_part_*.parquet - split: '10000' path: 20260101/xal/samples/10000_part_*.parquet - config_name: 20260101.xh data_files: - split: train path: 20260101/xh/train/train_part_*.parquet - split: '1000' path: 20260101/xh/samples/1000_part_*.parquet - split: '5000' path: 20260101/xh/samples/5000_part_*.parquet - split: '10000' path: 20260101/xh/samples/10000_part_*.parquet - config_name: 20260101.xmf data_files: - split: train path: 20260101/xmf/train/train_part_*.parquet - split: '1000' path: 20260101/xmf/samples/1000_part_*.parquet - split: '5000' path: 20260101/xmf/samples/5000_part_*.parquet - split: '10000' path: 20260101/xmf/samples/10000_part_*.parquet - config_name: 20260101.yi data_files: - split: train path: 20260101/yi/train/train_part_*.parquet - split: '1000' path: 20260101/yi/samples/1000_part_*.parquet - split: '5000' path: 20260101/yi/samples/5000_part_*.parquet - split: '10000' path: 20260101/yi/samples/10000_part_*.parquet - config_name: 20260101.yo data_files: - split: train path: 20260101/yo/train/train_part_*.parquet - split: '1000' path: 20260101/yo/samples/1000_part_*.parquet - split: '5000' path: 20260101/yo/samples/5000_part_*.parquet - split: '10000' path: 20260101/yo/samples/10000_part_*.parquet - config_name: 20260101.yue data_files: - split: train path: 20260101/yue/train/train_part_*.parquet - split: '1000' path: 20260101/yue/samples/1000_part_*.parquet - split: '5000' path: 20260101/yue/samples/5000_part_*.parquet - split: '10000' path: 20260101/yue/samples/10000_part_*.parquet - config_name: 20260101.za data_files: - split: train path: 20260101/za/train/train_part_*.parquet - split: '1000' path: 20260101/za/samples/1000_part_*.parquet - split: '5000' path: 20260101/za/samples/5000_part_*.parquet - split: '10000' path: 20260101/za/samples/10000_part_*.parquet - config_name: 20260101.zea data_files: - split: train path: 20260101/zea/train/train_part_*.parquet - split: '1000' path: 20260101/zea/samples/1000_part_*.parquet - split: '5000' path: 20260101/zea/samples/5000_part_*.parquet - split: '10000' path: 20260101/zea/samples/10000_part_*.parquet - config_name: 20260101.zgh data_files: - split: train path: 20260101/zgh/train/train_part_*.parquet - split: '1000' path: 20260101/zgh/samples/1000_part_*.parquet - split: '5000' path: 20260101/zgh/samples/5000_part_*.parquet - split: '10000' path: 20260101/zgh/samples/10000_part_*.parquet - config_name: 20260101.zu data_files: - split: train path: 20260101/zu/train/train_part_*.parquet - split: '1000' path: 20260101/zu/samples/1000_part_*.parquet - split: '5000' path: 20260101/zu/samples/5000_part_*.parquet - split: '10000' path: 20260101/zu/samples/10000_part_*.parquet - config_name: 20260101.ppl data_files: - split: train path: 20260101/ppl/train/train_part_*.parquet - split: '1000' path: 20260101/ppl/samples/1000_part_*.parquet - split: '5000' path: 20260101/ppl/samples/5000_part_*.parquet - split: '10000' path: 20260101/ppl/samples/10000_part_*.parquet - config_name: 20260301.en data_files: &id362 - split: train path: 20260301/en/train/train_part_*.parquet - split: '1000' path: 20260301/en/samples/1000_part_*.parquet - split: '5000' path: 20260301/en/samples/5000_part_*.parquet - split: '10000' path: 20260301/en/samples/10000_part_*.parquet - config_name: 20260301.de data_files: &id363 - split: train path: 20260301/de/train/train_part_*.parquet - split: '1000' path: 20260301/de/samples/1000_part_*.parquet - split: '5000' path: 20260301/de/samples/5000_part_*.parquet - split: '10000' path: 20260301/de/samples/10000_part_*.parquet - config_name: 20260301.es data_files: &id364 - split: train path: 20260301/es/train/train_part_*.parquet - split: '1000' path: 20260301/es/samples/1000_part_*.parquet - split: '5000' path: 20260301/es/samples/5000_part_*.parquet - split: '10000' path: 20260301/es/samples/10000_part_*.parquet - config_name: 20260301.fr data_files: &id365 - split: train path: 20260301/fr/train/train_part_*.parquet - split: '1000' path: 20260301/fr/samples/1000_part_*.parquet - split: '5000' path: 20260301/fr/samples/5000_part_*.parquet - split: '10000' path: 20260301/fr/samples/10000_part_*.parquet - config_name: 20260301.ceb data_files: &id366 - split: train path: 20260301/ceb/train/train_part_*.parquet - split: '1000' path: 20260301/ceb/samples/1000_part_*.parquet - split: '5000' path: 20260301/ceb/samples/5000_part_*.parquet - split: '10000' path: 20260301/ceb/samples/10000_part_*.parquet - config_name: 20260301.he data_files: &id368 - split: train path: 20260301/he/train/train_part_*.parquet - split: '1000' path: 20260301/he/samples/1000_part_*.parquet - split: '5000' path: 20260301/he/samples/5000_part_*.parquet - split: '10000' path: 20260301/he/samples/10000_part_*.parquet - config_name: 20260301.ko data_files: &id370 - split: train path: 20260301/ko/train/train_part_*.parquet - split: '1000' path: 20260301/ko/samples/1000_part_*.parquet - split: '5000' path: 20260301/ko/samples/5000_part_*.parquet - split: '10000' path: 20260301/ko/samples/10000_part_*.parquet - config_name: 20260301.hu data_files: &id369 - split: train path: 20260301/hu/train/train_part_*.parquet - split: '1000' path: 20260301/hu/samples/1000_part_*.parquet - split: '5000' path: 20260301/hu/samples/5000_part_*.parquet - split: '10000' path: 20260301/hu/samples/10000_part_*.parquet - config_name: 20260301.ar data_files: &id381 - split: train path: 20260301/ar/train/train_part_*.parquet - split: '1000' path: 20260301/ar/samples/1000_part_*.parquet - split: '5000' path: 20260301/ar/samples/5000_part_*.parquet - split: '10000' path: 20260301/ar/samples/10000_part_*.parquet - config_name: 20260301.vi data_files: &id378 - split: train path: 20260301/vi/train/train_part_*.parquet - split: '1000' path: 20260301/vi/samples/1000_part_*.parquet - split: '5000' path: 20260301/vi/samples/5000_part_*.parquet - split: '10000' path: 20260301/vi/samples/10000_part_*.parquet - config_name: 20260301.nl data_files: &id371 - split: train path: 20260301/nl/train/train_part_*.parquet - split: '1000' path: 20260301/nl/samples/1000_part_*.parquet - split: '5000' path: 20260301/nl/samples/5000_part_*.parquet - split: '10000' path: 20260301/nl/samples/10000_part_*.parquet - config_name: 20260301.pl data_files: &id372 - split: train path: 20260301/pl/train/train_part_*.parquet - split: '1000' path: 20260301/pl/samples/1000_part_*.parquet - split: '5000' path: 20260301/pl/samples/5000_part_*.parquet - split: '10000' path: 20260301/pl/samples/10000_part_*.parquet - config_name: 20260301.ja data_files: &id382 - split: train path: 20260301/ja/train/train_part_*.parquet - split: '1000' path: 20260301/ja/samples/1000_part_*.parquet - split: '5000' path: 20260301/ja/samples/5000_part_*.parquet - split: '10000' path: 20260301/ja/samples/10000_part_*.parquet - config_name: 20260301.sv data_files: &id375 - split: train path: 20260301/sv/train/train_part_*.parquet - split: '1000' path: 20260301/sv/samples/1000_part_*.parquet - split: '5000' path: 20260301/sv/samples/5000_part_*.parquet - split: '10000' path: 20260301/sv/samples/10000_part_*.parquet - config_name: 20260301.pt data_files: &id373 - split: train path: 20260301/pt/train/train_part_*.parquet - split: '1000' path: 20260301/pt/samples/1000_part_*.parquet - split: '5000' path: 20260301/pt/samples/5000_part_*.parquet - split: '10000' path: 20260301/pt/samples/10000_part_*.parquet - config_name: 20260301.el data_files: &id367 - split: train path: 20260301/el/train/train_part_*.parquet - split: '1000' path: 20260301/el/samples/1000_part_*.parquet - split: '5000' path: 20260301/el/samples/5000_part_*.parquet - split: '10000' path: 20260301/el/samples/10000_part_*.parquet - config_name: 20260301.sr data_files: &id374 - split: train path: 20260301/sr/train/train_part_*.parquet - split: '1000' path: 20260301/sr/samples/1000_part_*.parquet - split: '5000' path: 20260301/sr/samples/5000_part_*.parquet - split: '10000' path: 20260301/sr/samples/10000_part_*.parquet - config_name: 20260301.th data_files: &id380 - split: train path: 20260301/th/train/train_part_*.parquet - split: '1000' path: 20260301/th/samples/1000_part_*.parquet - split: '5000' path: 20260301/th/samples/5000_part_*.parquet - split: '10000' path: 20260301/th/samples/10000_part_*.parquet - config_name: 20260301.tr data_files: &id376 - split: train path: 20260301/tr/train/train_part_*.parquet - split: '1000' path: 20260301/tr/samples/1000_part_*.parquet - split: '5000' path: 20260301/tr/samples/5000_part_*.parquet - split: '10000' path: 20260301/tr/samples/10000_part_*.parquet - config_name: 20260301.uk data_files: &id377 - split: train path: 20260301/uk/train/train_part_*.parquet - split: '1000' path: 20260301/uk/samples/1000_part_*.parquet - split: '5000' path: 20260301/uk/samples/5000_part_*.parquet - split: '10000' path: 20260301/uk/samples/10000_part_*.parquet - config_name: 20260301.ru data_files: &id383 - split: train path: 20260301/ru/train/train_part_*.parquet - split: '1000' path: 20260301/ru/samples/1000_part_*.parquet - split: '5000' path: 20260301/ru/samples/5000_part_*.parquet - split: '10000' path: 20260301/ru/samples/10000_part_*.parquet - config_name: 20260301.zh data_files: &id379 - split: train path: 20260301/zh/train/train_part_*.parquet - split: '1000' path: 20260301/zh/samples/1000_part_*.parquet - split: '5000' path: 20260301/zh/samples/5000_part_*.parquet - split: '10000' path: 20260301/zh/samples/10000_part_*.parquet - config_name: 20260301.aa data_files: &id397 - split: train path: 20260301/aa/train/train_part_*.parquet - split: '1000' path: 20260301/aa/samples/1000_part_*.parquet - split: '5000' path: 20260301/aa/samples/5000_part_*.parquet - split: '10000' path: 20260301/aa/samples/10000_part_*.parquet - config_name: 20260301.ab data_files: &id398 - split: train path: 20260301/ab/train/train_part_*.parquet - split: '1000' path: 20260301/ab/samples/1000_part_*.parquet - split: '5000' path: 20260301/ab/samples/5000_part_*.parquet - split: '10000' path: 20260301/ab/samples/10000_part_*.parquet - config_name: 20260301.ace data_files: &id387 - split: train path: 20260301/ace/train/train_part_*.parquet - split: '1000' path: 20260301/ace/samples/1000_part_*.parquet - split: '5000' path: 20260301/ace/samples/5000_part_*.parquet - split: '10000' path: 20260301/ace/samples/10000_part_*.parquet - config_name: 20260301.ady data_files: &id399 - split: train path: 20260301/ady/train/train_part_*.parquet - split: '1000' path: 20260301/ady/samples/1000_part_*.parquet - split: '5000' path: 20260301/ady/samples/5000_part_*.parquet - split: '10000' path: 20260301/ady/samples/10000_part_*.parquet - config_name: 20260301.ak data_files: &id388 - split: train path: 20260301/ak/train/train_part_*.parquet - split: '1000' path: 20260301/ak/samples/1000_part_*.parquet - split: '5000' path: 20260301/ak/samples/5000_part_*.parquet - split: '10000' path: 20260301/ak/samples/10000_part_*.parquet - config_name: 20260301.alt data_files: &id401 - split: train path: 20260301/alt/train/train_part_*.parquet - split: '1000' path: 20260301/alt/samples/1000_part_*.parquet - split: '5000' path: 20260301/alt/samples/5000_part_*.parquet - split: '10000' path: 20260301/alt/samples/10000_part_*.parquet - config_name: 20260301.am data_files: &id402 - split: train path: 20260301/am/train/train_part_*.parquet - split: '1000' path: 20260301/am/samples/1000_part_*.parquet - split: '5000' path: 20260301/am/samples/5000_part_*.parquet - split: '10000' path: 20260301/am/samples/10000_part_*.parquet - config_name: 20260301.ami data_files: &id403 - split: train path: 20260301/ami/train/train_part_*.parquet - split: '1000' path: 20260301/ami/samples/1000_part_*.parquet - split: '5000' path: 20260301/ami/samples/5000_part_*.parquet - split: '10000' path: 20260301/ami/samples/10000_part_*.parquet - config_name: 20260301.ang data_files: &id405 - split: train path: 20260301/ang/train/train_part_*.parquet - split: '1000' path: 20260301/ang/samples/1000_part_*.parquet - split: '5000' path: 20260301/ang/samples/5000_part_*.parquet - split: '10000' path: 20260301/ang/samples/10000_part_*.parquet - config_name: 20260301.ann data_files: &id406 - split: train path: 20260301/ann/train/train_part_*.parquet - split: '1000' path: 20260301/ann/samples/1000_part_*.parquet - split: '5000' path: 20260301/ann/samples/5000_part_*.parquet - split: '10000' path: 20260301/ann/samples/10000_part_*.parquet - config_name: 20260301.anp data_files: &id407 - split: train path: 20260301/anp/train/train_part_*.parquet - split: '1000' path: 20260301/anp/samples/1000_part_*.parquet - split: '5000' path: 20260301/anp/samples/5000_part_*.parquet - split: '10000' path: 20260301/anp/samples/10000_part_*.parquet - config_name: 20260301.arc data_files: &id408 - split: train path: 20260301/arc/train/train_part_*.parquet - split: '1000' path: 20260301/arc/samples/1000_part_*.parquet - split: '5000' path: 20260301/arc/samples/5000_part_*.parquet - split: '10000' path: 20260301/arc/samples/10000_part_*.parquet - config_name: 20260301.ary data_files: &id409 - split: train path: 20260301/ary/train/train_part_*.parquet - split: '1000' path: 20260301/ary/samples/1000_part_*.parquet - split: '5000' path: 20260301/ary/samples/5000_part_*.parquet - split: '10000' path: 20260301/ary/samples/10000_part_*.parquet - config_name: 20260301.atj data_files: &id390 - split: train path: 20260301/atj/train/train_part_*.parquet - split: '1000' path: 20260301/atj/samples/1000_part_*.parquet - split: '5000' path: 20260301/atj/samples/5000_part_*.parquet - split: '10000' path: 20260301/atj/samples/10000_part_*.parquet - config_name: 20260301.av data_files: &id411 - split: train path: 20260301/av/train/train_part_*.parquet - split: '1000' path: 20260301/av/samples/1000_part_*.parquet - split: '5000' path: 20260301/av/samples/5000_part_*.parquet - split: '10000' path: 20260301/av/samples/10000_part_*.parquet - config_name: 20260301.awa data_files: &id413 - split: train path: 20260301/awa/train/train_part_*.parquet - split: '1000' path: 20260301/awa/samples/1000_part_*.parquet - split: '5000' path: 20260301/awa/samples/5000_part_*.parquet - split: '10000' path: 20260301/awa/samples/10000_part_*.parquet - config_name: 20260301.avk data_files: &id412 - split: train path: 20260301/avk/train/train_part_*.parquet - split: '1000' path: 20260301/avk/samples/1000_part_*.parquet - split: '5000' path: 20260301/avk/samples/5000_part_*.parquet - split: '10000' path: 20260301/avk/samples/10000_part_*.parquet - config_name: 20260301.ay data_files: &id414 - split: train path: 20260301/ay/train/train_part_*.parquet - split: '1000' path: 20260301/ay/samples/1000_part_*.parquet - split: '5000' path: 20260301/ay/samples/5000_part_*.parquet - split: '10000' path: 20260301/ay/samples/10000_part_*.parquet - config_name: 20260301.as data_files: &id389 - split: train path: 20260301/as/train/train_part_*.parquet - split: '1000' path: 20260301/as/samples/1000_part_*.parquet - split: '5000' path: 20260301/as/samples/5000_part_*.parquet - split: '10000' path: 20260301/as/samples/10000_part_*.parquet - config_name: 20260301.an data_files: &id404 - split: train path: 20260301/an/train/train_part_*.parquet - split: '1000' path: 20260301/an/samples/1000_part_*.parquet - split: '5000' path: 20260301/an/samples/5000_part_*.parquet - split: '10000' path: 20260301/an/samples/10000_part_*.parquet - config_name: 20260301.af data_files: &id400 - split: train path: 20260301/af/train/train_part_*.parquet - split: '1000' path: 20260301/af/samples/1000_part_*.parquet - split: '5000' path: 20260301/af/samples/5000_part_*.parquet - split: '10000' path: 20260301/af/samples/10000_part_*.parquet - config_name: 20260301.ban data_files: &id418 - split: train path: 20260301/ban/train/train_part_*.parquet - split: '1000' path: 20260301/ban/samples/1000_part_*.parquet - split: '5000' path: 20260301/ban/samples/5000_part_*.parquet - split: '10000' path: 20260301/ban/samples/10000_part_*.parquet - config_name: 20260301.bar data_files: &id419 - split: train path: 20260301/bar/train/train_part_*.parquet - split: '1000' path: 20260301/bar/samples/1000_part_*.parquet - split: '5000' path: 20260301/bar/samples/5000_part_*.parquet - split: '10000' path: 20260301/bar/samples/10000_part_*.parquet - config_name: 20260301.bbc data_files: &id420 - split: train path: 20260301/bbc/train/train_part_*.parquet - split: '1000' path: 20260301/bbc/samples/1000_part_*.parquet - split: '5000' path: 20260301/bbc/samples/5000_part_*.parquet - split: '10000' path: 20260301/bbc/samples/10000_part_*.parquet - config_name: 20260301.bdr data_files: &id422 - split: train path: 20260301/bdr/train/train_part_*.parquet - split: '1000' path: 20260301/bdr/samples/1000_part_*.parquet - split: '5000' path: 20260301/bdr/samples/5000_part_*.parquet - split: '10000' path: 20260301/bdr/samples/10000_part_*.parquet - config_name: 20260301.ba data_files: &id417 - split: train path: 20260301/ba/train/train_part_*.parquet - split: '1000' path: 20260301/ba/samples/1000_part_*.parquet - split: '5000' path: 20260301/ba/samples/5000_part_*.parquet - split: '10000' path: 20260301/ba/samples/10000_part_*.parquet - config_name: 20260301.bcl data_files: &id421 - split: train path: 20260301/bcl/train/train_part_*.parquet - split: '1000' path: 20260301/bcl/samples/1000_part_*.parquet - split: '5000' path: 20260301/bcl/samples/5000_part_*.parquet - split: '10000' path: 20260301/bcl/samples/10000_part_*.parquet - config_name: 20260301.bew data_files: &id425 - split: train path: 20260301/bew/train/train_part_*.parquet - split: '1000' path: 20260301/bew/samples/1000_part_*.parquet - split: '5000' path: 20260301/bew/samples/5000_part_*.parquet - split: '10000' path: 20260301/bew/samples/10000_part_*.parquet - config_name: 20260301.bh data_files: &id391 - split: train path: 20260301/bh/train/train_part_*.parquet - split: '1000' path: 20260301/bh/samples/1000_part_*.parquet - split: '5000' path: 20260301/bh/samples/5000_part_*.parquet - split: '10000' path: 20260301/bh/samples/10000_part_*.parquet - config_name: 20260301.be-tarask data_files: &id424 - split: train path: 20260301/be-tarask/train/train_part_*.parquet - split: '1000' path: 20260301/be-tarask/samples/1000_part_*.parquet - split: '5000' path: 20260301/be-tarask/samples/5000_part_*.parquet - split: '10000' path: 20260301/be-tarask/samples/10000_part_*.parquet - config_name: 20260301.bi data_files: &id427 - split: train path: 20260301/bi/train/train_part_*.parquet - split: '1000' path: 20260301/bi/samples/1000_part_*.parquet - split: '5000' path: 20260301/bi/samples/5000_part_*.parquet - split: '10000' path: 20260301/bi/samples/10000_part_*.parquet - config_name: 20260301.azb data_files: &id416 - split: train path: 20260301/azb/train/train_part_*.parquet - split: '1000' path: 20260301/azb/samples/1000_part_*.parquet - split: '5000' path: 20260301/azb/samples/5000_part_*.parquet - split: '10000' path: 20260301/azb/samples/10000_part_*.parquet - config_name: 20260301.bjn data_files: &id428 - split: train path: 20260301/bjn/train/train_part_*.parquet - split: '1000' path: 20260301/bjn/samples/1000_part_*.parquet - split: '5000' path: 20260301/bjn/samples/5000_part_*.parquet - split: '10000' path: 20260301/bjn/samples/10000_part_*.parquet - config_name: 20260301.blk data_files: &id429 - split: train path: 20260301/blk/train/train_part_*.parquet - split: '1000' path: 20260301/blk/samples/1000_part_*.parquet - split: '5000' path: 20260301/blk/samples/5000_part_*.parquet - split: '10000' path: 20260301/blk/samples/10000_part_*.parquet - config_name: 20260301.bm data_files: &id430 - split: train path: 20260301/bm/train/train_part_*.parquet - split: '1000' path: 20260301/bm/samples/1000_part_*.parquet - split: '5000' path: 20260301/bm/samples/5000_part_*.parquet - split: '10000' path: 20260301/bm/samples/10000_part_*.parquet - config_name: 20260301.bo data_files: &id431 - split: train path: 20260301/bo/train/train_part_*.parquet - split: '1000' path: 20260301/bo/samples/1000_part_*.parquet - split: '5000' path: 20260301/bo/samples/5000_part_*.parquet - split: '10000' path: 20260301/bo/samples/10000_part_*.parquet - config_name: 20260301.bpy data_files: &id432 - split: train path: 20260301/bpy/train/train_part_*.parquet - split: '1000' path: 20260301/bpy/samples/1000_part_*.parquet - split: '5000' path: 20260301/bpy/samples/5000_part_*.parquet - split: '10000' path: 20260301/bpy/samples/10000_part_*.parquet - config_name: 20260301.ast data_files: &id410 - split: train path: 20260301/ast/train/train_part_*.parquet - split: '1000' path: 20260301/ast/samples/1000_part_*.parquet - split: '5000' path: 20260301/ast/samples/5000_part_*.parquet - split: '10000' path: 20260301/ast/samples/10000_part_*.parquet - config_name: 20260301.az data_files: &id415 - split: train path: 20260301/az/train/train_part_*.parquet - split: '1000' path: 20260301/az/samples/1000_part_*.parquet - split: '5000' path: 20260301/az/samples/5000_part_*.parquet - split: '10000' path: 20260301/az/samples/10000_part_*.parquet - config_name: 20260301.btm data_files: &id435 - split: train path: 20260301/btm/train/train_part_*.parquet - split: '1000' path: 20260301/btm/samples/1000_part_*.parquet - split: '5000' path: 20260301/btm/samples/5000_part_*.parquet - split: '10000' path: 20260301/btm/samples/10000_part_*.parquet - config_name: 20260301.br data_files: &id433 - split: train path: 20260301/br/train/train_part_*.parquet - split: '1000' path: 20260301/br/samples/1000_part_*.parquet - split: '5000' path: 20260301/br/samples/5000_part_*.parquet - split: '10000' path: 20260301/br/samples/10000_part_*.parquet - config_name: 20260301.bug data_files: &id436 - split: train path: 20260301/bug/train/train_part_*.parquet - split: '1000' path: 20260301/bug/samples/1000_part_*.parquet - split: '5000' path: 20260301/bug/samples/5000_part_*.parquet - split: '10000' path: 20260301/bug/samples/10000_part_*.parquet - config_name: 20260301.bxr data_files: &id437 - split: train path: 20260301/bxr/train/train_part_*.parquet - split: '1000' path: 20260301/bxr/samples/1000_part_*.parquet - split: '5000' path: 20260301/bxr/samples/5000_part_*.parquet - split: '10000' path: 20260301/bxr/samples/10000_part_*.parquet - config_name: 20260301.bg data_files: &id426 - split: train path: 20260301/bg/train/train_part_*.parquet - split: '1000' path: 20260301/bg/samples/1000_part_*.parquet - split: '5000' path: 20260301/bg/samples/5000_part_*.parquet - split: '10000' path: 20260301/bg/samples/10000_part_*.parquet - config_name: 20260301.arz data_files: &id627 - split: train path: 20260301/arz/train/train_part_*.parquet - split: '1000' path: 20260301/arz/samples/1000_part_*.parquet - split: '5000' path: 20260301/arz/samples/5000_part_*.parquet - split: '10000' path: 20260301/arz/samples/10000_part_*.parquet - config_name: 20260301.bn data_files: &id392 - split: train path: 20260301/bn/train/train_part_*.parquet - split: '1000' path: 20260301/bn/samples/1000_part_*.parquet - split: '5000' path: 20260301/bn/samples/5000_part_*.parquet - split: '10000' path: 20260301/bn/samples/10000_part_*.parquet - config_name: 20260301.be data_files: &id423 - split: train path: 20260301/be/train/train_part_*.parquet - split: '1000' path: 20260301/be/samples/1000_part_*.parquet - split: '5000' path: 20260301/be/samples/5000_part_*.parquet - split: '10000' path: 20260301/be/samples/10000_part_*.parquet - config_name: 20260301.bs data_files: &id434 - split: train path: 20260301/bs/train/train_part_*.parquet - split: '1000' path: 20260301/bs/samples/1000_part_*.parquet - split: '5000' path: 20260301/bs/samples/5000_part_*.parquet - split: '10000' path: 20260301/bs/samples/10000_part_*.parquet - config_name: 20260301.cdo data_files: &id440 - split: train path: 20260301/cdo/train/train_part_*.parquet - split: '1000' path: 20260301/cdo/samples/1000_part_*.parquet - split: '5000' path: 20260301/cdo/samples/5000_part_*.parquet - split: '10000' path: 20260301/cdo/samples/10000_part_*.parquet - config_name: 20260301.ch data_files: &id442 - split: train path: 20260301/ch/train/train_part_*.parquet - split: '1000' path: 20260301/ch/samples/1000_part_*.parquet - split: '5000' path: 20260301/ch/samples/5000_part_*.parquet - split: '10000' path: 20260301/ch/samples/10000_part_*.parquet - config_name: 20260301.cho data_files: &id384 - split: train path: 20260301/cho/train/train_part_*.parquet - split: '1000' path: 20260301/cho/samples/1000_part_*.parquet - split: '5000' path: 20260301/cho/samples/5000_part_*.parquet - split: '10000' path: 20260301/cho/samples/10000_part_*.parquet - config_name: 20260301.chr data_files: &id393 - split: train path: 20260301/chr/train/train_part_*.parquet - split: '1000' path: 20260301/chr/samples/1000_part_*.parquet - split: '5000' path: 20260301/chr/samples/5000_part_*.parquet - split: '10000' path: 20260301/chr/samples/10000_part_*.parquet - config_name: 20260301.chy data_files: &id385 - split: train path: 20260301/chy/train/train_part_*.parquet - split: '1000' path: 20260301/chy/samples/1000_part_*.parquet - split: '5000' path: 20260301/chy/samples/5000_part_*.parquet - split: '10000' path: 20260301/chy/samples/10000_part_*.parquet - config_name: 20260301.cbk-zam data_files: &id439 - split: train path: 20260301/cbk-zam/train/train_part_*.parquet - split: '1000' path: 20260301/cbk-zam/samples/1000_part_*.parquet - split: '5000' path: 20260301/cbk-zam/samples/5000_part_*.parquet - split: '10000' path: 20260301/cbk-zam/samples/10000_part_*.parquet - config_name: 20260301.co data_files: &id444 - split: train path: 20260301/co/train/train_part_*.parquet - split: '1000' path: 20260301/co/samples/1000_part_*.parquet - split: '5000' path: 20260301/co/samples/5000_part_*.parquet - split: '10000' path: 20260301/co/samples/10000_part_*.parquet - config_name: 20260301.cr data_files: &id386 - split: train path: 20260301/cr/train/train_part_*.parquet - split: '1000' path: 20260301/cr/samples/1000_part_*.parquet - split: '5000' path: 20260301/cr/samples/5000_part_*.parquet - split: '10000' path: 20260301/cr/samples/10000_part_*.parquet - config_name: 20260301.crh data_files: &id445 - split: train path: 20260301/crh/train/train_part_*.parquet - split: '1000' path: 20260301/crh/samples/1000_part_*.parquet - split: '5000' path: 20260301/crh/samples/5000_part_*.parquet - split: '10000' path: 20260301/crh/samples/10000_part_*.parquet - config_name: 20260301.csb data_files: &id447 - split: train path: 20260301/csb/train/train_part_*.parquet - split: '1000' path: 20260301/csb/samples/1000_part_*.parquet - split: '5000' path: 20260301/csb/samples/5000_part_*.parquet - split: '10000' path: 20260301/csb/samples/10000_part_*.parquet - config_name: 20260301.cu data_files: &id448 - split: train path: 20260301/cu/train/train_part_*.parquet - split: '1000' path: 20260301/cu/samples/1000_part_*.parquet - split: '5000' path: 20260301/cu/samples/5000_part_*.parquet - split: '10000' path: 20260301/cu/samples/10000_part_*.parquet - config_name: 20260301.ckb data_files: &id443 - split: train path: 20260301/ckb/train/train_part_*.parquet - split: '1000' path: 20260301/ckb/samples/1000_part_*.parquet - split: '5000' path: 20260301/ckb/samples/5000_part_*.parquet - split: '10000' path: 20260301/ckb/samples/10000_part_*.parquet - config_name: 20260301.cv data_files: &id449 - split: train path: 20260301/cv/train/train_part_*.parquet - split: '1000' path: 20260301/cv/samples/1000_part_*.parquet - split: '5000' path: 20260301/cv/samples/5000_part_*.parquet - split: '10000' path: 20260301/cv/samples/10000_part_*.parquet - config_name: 20260301.dag data_files: &id452 - split: train path: 20260301/dag/train/train_part_*.parquet - split: '1000' path: 20260301/dag/samples/1000_part_*.parquet - split: '5000' path: 20260301/dag/samples/5000_part_*.parquet - split: '10000' path: 20260301/dag/samples/10000_part_*.parquet - config_name: 20260301.dga data_files: &id453 - split: train path: 20260301/dga/train/train_part_*.parquet - split: '1000' path: 20260301/dga/samples/1000_part_*.parquet - split: '5000' path: 20260301/dga/samples/5000_part_*.parquet - split: '10000' path: 20260301/dga/samples/10000_part_*.parquet - config_name: 20260301.din data_files: &id454 - split: train path: 20260301/din/train/train_part_*.parquet - split: '1000' path: 20260301/din/samples/1000_part_*.parquet - split: '5000' path: 20260301/din/samples/5000_part_*.parquet - split: '10000' path: 20260301/din/samples/10000_part_*.parquet - config_name: 20260301.diq data_files: &id455 - split: train path: 20260301/diq/train/train_part_*.parquet - split: '1000' path: 20260301/diq/samples/1000_part_*.parquet - split: '5000' path: 20260301/diq/samples/5000_part_*.parquet - split: '10000' path: 20260301/diq/samples/10000_part_*.parquet - config_name: 20260301.dsb data_files: &id456 - split: train path: 20260301/dsb/train/train_part_*.parquet - split: '1000' path: 20260301/dsb/samples/1000_part_*.parquet - split: '5000' path: 20260301/dsb/samples/5000_part_*.parquet - split: '10000' path: 20260301/dsb/samples/10000_part_*.parquet - config_name: 20260301.dtp data_files: &id457 - split: train path: 20260301/dtp/train/train_part_*.parquet - split: '1000' path: 20260301/dtp/samples/1000_part_*.parquet - split: '5000' path: 20260301/dtp/samples/5000_part_*.parquet - split: '10000' path: 20260301/dtp/samples/10000_part_*.parquet - config_name: 20260301.cy data_files: &id450 - split: train path: 20260301/cy/train/train_part_*.parquet - split: '1000' path: 20260301/cy/samples/1000_part_*.parquet - split: '5000' path: 20260301/cy/samples/5000_part_*.parquet - split: '10000' path: 20260301/cy/samples/10000_part_*.parquet - config_name: 20260301.dty data_files: &id458 - split: train path: 20260301/dty/train/train_part_*.parquet - split: '1000' path: 20260301/dty/samples/1000_part_*.parquet - split: '5000' path: 20260301/dty/samples/5000_part_*.parquet - split: '10000' path: 20260301/dty/samples/10000_part_*.parquet - config_name: 20260301.dv data_files: &id459 - split: train path: 20260301/dv/train/train_part_*.parquet - split: '1000' path: 20260301/dv/samples/1000_part_*.parquet - split: '5000' path: 20260301/dv/samples/5000_part_*.parquet - split: '10000' path: 20260301/dv/samples/10000_part_*.parquet - config_name: 20260301.dz data_files: &id460 - split: train path: 20260301/dz/train/train_part_*.parquet - split: '1000' path: 20260301/dz/samples/1000_part_*.parquet - split: '5000' path: 20260301/dz/samples/5000_part_*.parquet - split: '10000' path: 20260301/dz/samples/10000_part_*.parquet - config_name: 20260301.ee data_files: &id461 - split: train path: 20260301/ee/train/train_part_*.parquet - split: '1000' path: 20260301/ee/samples/1000_part_*.parquet - split: '5000' path: 20260301/ee/samples/5000_part_*.parquet - split: '10000' path: 20260301/ee/samples/10000_part_*.parquet - config_name: 20260301.eml data_files: &id462 - split: train path: 20260301/eml/train/train_part_*.parquet - split: '1000' path: 20260301/eml/samples/1000_part_*.parquet - split: '5000' path: 20260301/eml/samples/5000_part_*.parquet - split: '10000' path: 20260301/eml/samples/10000_part_*.parquet - config_name: 20260301.ce data_files: &id441 - split: train path: 20260301/ce/train/train_part_*.parquet - split: '1000' path: 20260301/ce/samples/1000_part_*.parquet - split: '5000' path: 20260301/ce/samples/5000_part_*.parquet - split: '10000' path: 20260301/ce/samples/10000_part_*.parquet - config_name: 20260301.da data_files: &id451 - split: train path: 20260301/da/train/train_part_*.parquet - split: '1000' path: 20260301/da/samples/1000_part_*.parquet - split: '5000' path: 20260301/da/samples/5000_part_*.parquet - split: '10000' path: 20260301/da/samples/10000_part_*.parquet - config_name: 20260301.ext data_files: &id465 - split: train path: 20260301/ext/train/train_part_*.parquet - split: '1000' path: 20260301/ext/samples/1000_part_*.parquet - split: '5000' path: 20260301/ext/samples/5000_part_*.parquet - split: '10000' path: 20260301/ext/samples/10000_part_*.parquet - config_name: 20260301.et data_files: &id463 - split: train path: 20260301/et/train/train_part_*.parquet - split: '1000' path: 20260301/et/samples/1000_part_*.parquet - split: '5000' path: 20260301/et/samples/5000_part_*.parquet - split: '10000' path: 20260301/et/samples/10000_part_*.parquet - config_name: 20260301.fat data_files: &id467 - split: train path: 20260301/fat/train/train_part_*.parquet - split: '1000' path: 20260301/fat/samples/1000_part_*.parquet - split: '5000' path: 20260301/fat/samples/5000_part_*.parquet - split: '10000' path: 20260301/fat/samples/10000_part_*.parquet - config_name: 20260301.ff data_files: &id468 - split: train path: 20260301/ff/train/train_part_*.parquet - split: '1000' path: 20260301/ff/samples/1000_part_*.parquet - split: '5000' path: 20260301/ff/samples/5000_part_*.parquet - split: '10000' path: 20260301/ff/samples/10000_part_*.parquet - config_name: 20260301.eu data_files: &id464 - split: train path: 20260301/eu/train/train_part_*.parquet - split: '1000' path: 20260301/eu/samples/1000_part_*.parquet - split: '5000' path: 20260301/eu/samples/5000_part_*.parquet - split: '10000' path: 20260301/eu/samples/10000_part_*.parquet - config_name: 20260301.fj data_files: &id470 - split: train path: 20260301/fj/train/train_part_*.parquet - split: '1000' path: 20260301/fj/samples/1000_part_*.parquet - split: '5000' path: 20260301/fj/samples/5000_part_*.parquet - split: '10000' path: 20260301/fj/samples/10000_part_*.parquet - config_name: 20260301.fo data_files: &id471 - split: train path: 20260301/fo/train/train_part_*.parquet - split: '1000' path: 20260301/fo/samples/1000_part_*.parquet - split: '5000' path: 20260301/fo/samples/5000_part_*.parquet - split: '10000' path: 20260301/fo/samples/10000_part_*.parquet - config_name: 20260301.fon data_files: &id472 - split: train path: 20260301/fon/train/train_part_*.parquet - split: '1000' path: 20260301/fon/samples/1000_part_*.parquet - split: '5000' path: 20260301/fon/samples/5000_part_*.parquet - split: '10000' path: 20260301/fon/samples/10000_part_*.parquet - config_name: 20260301.frp data_files: &id473 - split: train path: 20260301/frp/train/train_part_*.parquet - split: '1000' path: 20260301/frp/samples/1000_part_*.parquet - split: '5000' path: 20260301/frp/samples/5000_part_*.parquet - split: '10000' path: 20260301/frp/samples/10000_part_*.parquet - config_name: 20260301.frr data_files: &id474 - split: train path: 20260301/frr/train/train_part_*.parquet - split: '1000' path: 20260301/frr/samples/1000_part_*.parquet - split: '5000' path: 20260301/frr/samples/5000_part_*.parquet - split: '10000' path: 20260301/frr/samples/10000_part_*.parquet - config_name: 20260301.eo data_files: &id394 - split: train path: 20260301/eo/train/train_part_*.parquet - split: '1000' path: 20260301/eo/samples/1000_part_*.parquet - split: '5000' path: 20260301/eo/samples/5000_part_*.parquet - split: '10000' path: 20260301/eo/samples/10000_part_*.parquet - config_name: 20260301.fur data_files: &id475 - split: train path: 20260301/fur/train/train_part_*.parquet - split: '1000' path: 20260301/fur/samples/1000_part_*.parquet - split: '5000' path: 20260301/fur/samples/5000_part_*.parquet - split: '10000' path: 20260301/fur/samples/10000_part_*.parquet - config_name: 20260301.ga data_files: &id477 - split: train path: 20260301/ga/train/train_part_*.parquet - split: '1000' path: 20260301/ga/samples/1000_part_*.parquet - split: '5000' path: 20260301/ga/samples/5000_part_*.parquet - split: '10000' path: 20260301/ga/samples/10000_part_*.parquet - config_name: 20260301.gag data_files: &id478 - split: train path: 20260301/gag/train/train_part_*.parquet - split: '1000' path: 20260301/gag/samples/1000_part_*.parquet - split: '5000' path: 20260301/gag/samples/5000_part_*.parquet - split: '10000' path: 20260301/gag/samples/10000_part_*.parquet - config_name: 20260301.fy data_files: &id476 - split: train path: 20260301/fy/train/train_part_*.parquet - split: '1000' path: 20260301/fy/samples/1000_part_*.parquet - split: '5000' path: 20260301/fy/samples/5000_part_*.parquet - split: '10000' path: 20260301/fy/samples/10000_part_*.parquet - config_name: 20260301.gan data_files: &id479 - split: train path: 20260301/gan/train/train_part_*.parquet - split: '1000' path: 20260301/gan/samples/1000_part_*.parquet - split: '5000' path: 20260301/gan/samples/5000_part_*.parquet - split: '10000' path: 20260301/gan/samples/10000_part_*.parquet - config_name: 20260301.gcr data_files: &id480 - split: train path: 20260301/gcr/train/train_part_*.parquet - split: '1000' path: 20260301/gcr/samples/1000_part_*.parquet - split: '5000' path: 20260301/gcr/samples/5000_part_*.parquet - split: '10000' path: 20260301/gcr/samples/10000_part_*.parquet - config_name: 20260301.gd data_files: &id481 - split: train path: 20260301/gd/train/train_part_*.parquet - split: '1000' path: 20260301/gd/samples/1000_part_*.parquet - split: '5000' path: 20260301/gd/samples/5000_part_*.parquet - split: '10000' path: 20260301/gd/samples/10000_part_*.parquet - config_name: 20260301.glk data_files: &id483 - split: train path: 20260301/glk/train/train_part_*.parquet - split: '1000' path: 20260301/glk/samples/1000_part_*.parquet - split: '5000' path: 20260301/glk/samples/5000_part_*.parquet - split: '10000' path: 20260301/glk/samples/10000_part_*.parquet - config_name: 20260301.gn data_files: &id484 - split: train path: 20260301/gn/train/train_part_*.parquet - split: '1000' path: 20260301/gn/samples/1000_part_*.parquet - split: '5000' path: 20260301/gn/samples/5000_part_*.parquet - split: '10000' path: 20260301/gn/samples/10000_part_*.parquet - config_name: 20260301.gom data_files: &id485 - split: train path: 20260301/gom/train/train_part_*.parquet - split: '1000' path: 20260301/gom/samples/1000_part_*.parquet - split: '5000' path: 20260301/gom/samples/5000_part_*.parquet - split: '10000' path: 20260301/gom/samples/10000_part_*.parquet - config_name: 20260301.gor data_files: &id486 - split: train path: 20260301/gor/train/train_part_*.parquet - split: '1000' path: 20260301/gor/samples/1000_part_*.parquet - split: '5000' path: 20260301/gor/samples/5000_part_*.parquet - split: '10000' path: 20260301/gor/samples/10000_part_*.parquet - config_name: 20260301.got data_files: &id487 - split: train path: 20260301/got/train/train_part_*.parquet - split: '1000' path: 20260301/got/samples/1000_part_*.parquet - split: '5000' path: 20260301/got/samples/5000_part_*.parquet - split: '10000' path: 20260301/got/samples/10000_part_*.parquet - config_name: 20260301.gpe data_files: &id395 - split: train path: 20260301/gpe/train/train_part_*.parquet - split: '1000' path: 20260301/gpe/samples/1000_part_*.parquet - split: '5000' path: 20260301/gpe/samples/5000_part_*.parquet - split: '10000' path: 20260301/gpe/samples/10000_part_*.parquet - config_name: 20260301.gsw data_files: &id488 - split: train path: 20260301/gsw/train/train_part_*.parquet - split: '1000' path: 20260301/gsw/samples/1000_part_*.parquet - split: '5000' path: 20260301/gsw/samples/5000_part_*.parquet - split: '10000' path: 20260301/gsw/samples/10000_part_*.parquet - config_name: 20260301.gu data_files: &id489 - split: train path: 20260301/gu/train/train_part_*.parquet - split: '1000' path: 20260301/gu/samples/1000_part_*.parquet - split: '5000' path: 20260301/gu/samples/5000_part_*.parquet - split: '10000' path: 20260301/gu/samples/10000_part_*.parquet - config_name: 20260301.guc data_files: &id490 - split: train path: 20260301/guc/train/train_part_*.parquet - split: '1000' path: 20260301/guc/samples/1000_part_*.parquet - split: '5000' path: 20260301/guc/samples/5000_part_*.parquet - split: '10000' path: 20260301/guc/samples/10000_part_*.parquet - config_name: 20260301.gur data_files: &id491 - split: train path: 20260301/gur/train/train_part_*.parquet - split: '1000' path: 20260301/gur/samples/1000_part_*.parquet - split: '5000' path: 20260301/gur/samples/5000_part_*.parquet - split: '10000' path: 20260301/gur/samples/10000_part_*.parquet - config_name: 20260301.guw data_files: &id492 - split: train path: 20260301/guw/train/train_part_*.parquet - split: '1000' path: 20260301/guw/samples/1000_part_*.parquet - split: '5000' path: 20260301/guw/samples/5000_part_*.parquet - split: '10000' path: 20260301/guw/samples/10000_part_*.parquet - config_name: 20260301.gv data_files: &id493 - split: train path: 20260301/gv/train/train_part_*.parquet - split: '1000' path: 20260301/gv/samples/1000_part_*.parquet - split: '5000' path: 20260301/gv/samples/5000_part_*.parquet - split: '10000' path: 20260301/gv/samples/10000_part_*.parquet - config_name: 20260301.cs data_files: &id446 - split: train path: 20260301/cs/train/train_part_*.parquet - split: '1000' path: 20260301/cs/samples/1000_part_*.parquet - split: '5000' path: 20260301/cs/samples/5000_part_*.parquet - split: '10000' path: 20260301/cs/samples/10000_part_*.parquet - config_name: 20260301.gl data_files: &id482 - split: train path: 20260301/gl/train/train_part_*.parquet - split: '1000' path: 20260301/gl/samples/1000_part_*.parquet - split: '5000' path: 20260301/gl/samples/5000_part_*.parquet - split: '10000' path: 20260301/gl/samples/10000_part_*.parquet - config_name: 20260301.hak data_files: &id495 - split: train path: 20260301/hak/train/train_part_*.parquet - split: '1000' path: 20260301/hak/samples/1000_part_*.parquet - split: '5000' path: 20260301/hak/samples/5000_part_*.parquet - split: '10000' path: 20260301/hak/samples/10000_part_*.parquet - config_name: 20260301.haw data_files: &id496 - split: train path: 20260301/haw/train/train_part_*.parquet - split: '1000' path: 20260301/haw/samples/1000_part_*.parquet - split: '5000' path: 20260301/haw/samples/5000_part_*.parquet - split: '10000' path: 20260301/haw/samples/10000_part_*.parquet - config_name: 20260301.ca data_files: &id438 - split: train path: 20260301/ca/train/train_part_*.parquet - split: '1000' path: 20260301/ca/samples/1000_part_*.parquet - split: '5000' path: 20260301/ca/samples/5000_part_*.parquet - split: '10000' path: 20260301/ca/samples/10000_part_*.parquet - config_name: 20260301.hif data_files: &id498 - split: train path: 20260301/hif/train/train_part_*.parquet - split: '1000' path: 20260301/hif/samples/1000_part_*.parquet - split: '5000' path: 20260301/hif/samples/5000_part_*.parquet - split: '10000' path: 20260301/hif/samples/10000_part_*.parquet - config_name: 20260301.ha data_files: &id494 - split: train path: 20260301/ha/train/train_part_*.parquet - split: '1000' path: 20260301/ha/samples/1000_part_*.parquet - split: '5000' path: 20260301/ha/samples/5000_part_*.parquet - split: '10000' path: 20260301/ha/samples/10000_part_*.parquet - config_name: 20260301.ho data_files: &id499 - split: train path: 20260301/ho/train/train_part_*.parquet - split: '1000' path: 20260301/ho/samples/1000_part_*.parquet - split: '5000' path: 20260301/ho/samples/5000_part_*.parquet - split: '10000' path: 20260301/ho/samples/10000_part_*.parquet - config_name: 20260301.hsb data_files: &id501 - split: train path: 20260301/hsb/train/train_part_*.parquet - split: '1000' path: 20260301/hsb/samples/1000_part_*.parquet - split: '5000' path: 20260301/hsb/samples/5000_part_*.parquet - split: '10000' path: 20260301/hsb/samples/10000_part_*.parquet - config_name: 20260301.ht data_files: &id502 - split: train path: 20260301/ht/train/train_part_*.parquet - split: '1000' path: 20260301/ht/samples/1000_part_*.parquet - split: '5000' path: 20260301/ht/samples/5000_part_*.parquet - split: '10000' path: 20260301/ht/samples/10000_part_*.parquet - config_name: 20260301.hi data_files: &id497 - split: train path: 20260301/hi/train/train_part_*.parquet - split: '1000' path: 20260301/hi/samples/1000_part_*.parquet - split: '5000' path: 20260301/hi/samples/5000_part_*.parquet - split: '10000' path: 20260301/hi/samples/10000_part_*.parquet - config_name: 20260301.fa data_files: &id466 - split: train path: 20260301/fa/train/train_part_*.parquet - split: '1000' path: 20260301/fa/samples/1000_part_*.parquet - split: '5000' path: 20260301/fa/samples/5000_part_*.parquet - split: '10000' path: 20260301/fa/samples/10000_part_*.parquet - config_name: 20260301.fi data_files: &id469 - split: train path: 20260301/fi/train/train_part_*.parquet - split: '1000' path: 20260301/fi/samples/1000_part_*.parquet - split: '5000' path: 20260301/fi/samples/5000_part_*.parquet - split: '10000' path: 20260301/fi/samples/10000_part_*.parquet - config_name: 20260301.hr data_files: &id500 - split: train path: 20260301/hr/train/train_part_*.parquet - split: '1000' path: 20260301/hr/samples/1000_part_*.parquet - split: '5000' path: 20260301/hr/samples/5000_part_*.parquet - split: '10000' path: 20260301/hr/samples/10000_part_*.parquet - config_name: 20260301.hyw data_files: &id396 - split: train path: 20260301/hyw/train/train_part_*.parquet - split: '1000' path: 20260301/hyw/samples/1000_part_*.parquet - split: '5000' path: 20260301/hyw/samples/5000_part_*.parquet - split: '10000' path: 20260301/hyw/samples/10000_part_*.parquet - config_name: 20260301.hz data_files: &id504 - split: train path: 20260301/hz/train/train_part_*.parquet - split: '1000' path: 20260301/hz/samples/1000_part_*.parquet - split: '5000' path: 20260301/hz/samples/5000_part_*.parquet - split: '10000' path: 20260301/hz/samples/10000_part_*.parquet - config_name: 20260301.ia data_files: &id505 - split: train path: 20260301/ia/train/train_part_*.parquet - split: '1000' path: 20260301/ia/samples/1000_part_*.parquet - split: '5000' path: 20260301/ia/samples/5000_part_*.parquet - split: '10000' path: 20260301/ia/samples/10000_part_*.parquet - config_name: 20260301.hy data_files: &id503 - split: train path: 20260301/hy/train/train_part_*.parquet - split: '1000' path: 20260301/hy/samples/1000_part_*.parquet - split: '5000' path: 20260301/hy/samples/5000_part_*.parquet - split: '10000' path: 20260301/hy/samples/10000_part_*.parquet - config_name: 20260301.iba data_files: &id506 - split: train path: 20260301/iba/train/train_part_*.parquet - split: '1000' path: 20260301/iba/samples/1000_part_*.parquet - split: '5000' path: 20260301/iba/samples/5000_part_*.parquet - split: '10000' path: 20260301/iba/samples/10000_part_*.parquet - config_name: 20260301.ie data_files: &id508 - split: train path: 20260301/ie/train/train_part_*.parquet - split: '1000' path: 20260301/ie/samples/1000_part_*.parquet - split: '5000' path: 20260301/ie/samples/5000_part_*.parquet - split: '10000' path: 20260301/ie/samples/10000_part_*.parquet - config_name: 20260301.igl data_files: &id510 - split: train path: 20260301/igl/train/train_part_*.parquet - split: '1000' path: 20260301/igl/samples/1000_part_*.parquet - split: '5000' path: 20260301/igl/samples/5000_part_*.parquet - split: '10000' path: 20260301/igl/samples/10000_part_*.parquet - config_name: 20260301.ii data_files: &id511 - split: train path: 20260301/ii/train/train_part_*.parquet - split: '1000' path: 20260301/ii/samples/1000_part_*.parquet - split: '5000' path: 20260301/ii/samples/5000_part_*.parquet - split: '10000' path: 20260301/ii/samples/10000_part_*.parquet - config_name: 20260301.ik data_files: &id512 - split: train path: 20260301/ik/train/train_part_*.parquet - split: '1000' path: 20260301/ik/samples/1000_part_*.parquet - split: '5000' path: 20260301/ik/samples/5000_part_*.parquet - split: '10000' path: 20260301/ik/samples/10000_part_*.parquet - config_name: 20260301.ilo data_files: &id513 - split: train path: 20260301/ilo/train/train_part_*.parquet - split: '1000' path: 20260301/ilo/samples/1000_part_*.parquet - split: '5000' path: 20260301/ilo/samples/5000_part_*.parquet - split: '10000' path: 20260301/ilo/samples/10000_part_*.parquet - config_name: 20260301.inh data_files: &id514 - split: train path: 20260301/inh/train/train_part_*.parquet - split: '1000' path: 20260301/inh/samples/1000_part_*.parquet - split: '5000' path: 20260301/inh/samples/5000_part_*.parquet - split: '10000' path: 20260301/inh/samples/10000_part_*.parquet - config_name: 20260301.ig data_files: &id509 - split: train path: 20260301/ig/train/train_part_*.parquet - split: '1000' path: 20260301/ig/samples/1000_part_*.parquet - split: '5000' path: 20260301/ig/samples/5000_part_*.parquet - split: '10000' path: 20260301/ig/samples/10000_part_*.parquet - config_name: 20260301.io data_files: &id515 - split: train path: 20260301/io/train/train_part_*.parquet - split: '1000' path: 20260301/io/samples/1000_part_*.parquet - split: '5000' path: 20260301/io/samples/5000_part_*.parquet - split: '10000' path: 20260301/io/samples/10000_part_*.parquet - config_name: 20260301.iu data_files: &id518 - split: train path: 20260301/iu/train/train_part_*.parquet - split: '1000' path: 20260301/iu/samples/1000_part_*.parquet - split: '5000' path: 20260301/iu/samples/5000_part_*.parquet - split: '10000' path: 20260301/iu/samples/10000_part_*.parquet - config_name: 20260301.jam data_files: &id519 - split: train path: 20260301/jam/train/train_part_*.parquet - split: '1000' path: 20260301/jam/samples/1000_part_*.parquet - split: '5000' path: 20260301/jam/samples/5000_part_*.parquet - split: '10000' path: 20260301/jam/samples/10000_part_*.parquet - config_name: 20260301.jbo data_files: &id520 - split: train path: 20260301/jbo/train/train_part_*.parquet - split: '1000' path: 20260301/jbo/samples/1000_part_*.parquet - split: '5000' path: 20260301/jbo/samples/5000_part_*.parquet - split: '10000' path: 20260301/jbo/samples/10000_part_*.parquet - config_name: 20260301.is data_files: &id516 - split: train path: 20260301/is/train/train_part_*.parquet - split: '1000' path: 20260301/is/samples/1000_part_*.parquet - split: '5000' path: 20260301/is/samples/5000_part_*.parquet - split: '10000' path: 20260301/is/samples/10000_part_*.parquet - config_name: 20260301.kaa data_files: &id523 - split: train path: 20260301/kaa/train/train_part_*.parquet - split: '1000' path: 20260301/kaa/samples/1000_part_*.parquet - split: '5000' path: 20260301/kaa/samples/5000_part_*.parquet - split: '10000' path: 20260301/kaa/samples/10000_part_*.parquet - config_name: 20260301.kab data_files: &id524 - split: train path: 20260301/kab/train/train_part_*.parquet - split: '1000' path: 20260301/kab/samples/1000_part_*.parquet - split: '5000' path: 20260301/kab/samples/5000_part_*.parquet - split: '10000' path: 20260301/kab/samples/10000_part_*.parquet - config_name: 20260301.kaj data_files: &id525 - split: train path: 20260301/kaj/train/train_part_*.parquet - split: '1000' path: 20260301/kaj/samples/1000_part_*.parquet - split: '5000' path: 20260301/kaj/samples/5000_part_*.parquet - split: '10000' path: 20260301/kaj/samples/10000_part_*.parquet - config_name: 20260301.jv data_files: &id521 - split: train path: 20260301/jv/train/train_part_*.parquet - split: '1000' path: 20260301/jv/samples/1000_part_*.parquet - split: '5000' path: 20260301/jv/samples/5000_part_*.parquet - split: '10000' path: 20260301/jv/samples/10000_part_*.parquet - config_name: 20260301.kbd data_files: &id526 - split: train path: 20260301/kbd/train/train_part_*.parquet - split: '1000' path: 20260301/kbd/samples/1000_part_*.parquet - split: '5000' path: 20260301/kbd/samples/5000_part_*.parquet - split: '10000' path: 20260301/kbd/samples/10000_part_*.parquet - config_name: 20260301.kbp data_files: &id527 - split: train path: 20260301/kbp/train/train_part_*.parquet - split: '1000' path: 20260301/kbp/samples/1000_part_*.parquet - split: '5000' path: 20260301/kbp/samples/5000_part_*.parquet - split: '10000' path: 20260301/kbp/samples/10000_part_*.parquet - config_name: 20260301.kai data_files: &id722 - split: train path: 20260301/kai/train/train_part_*.parquet - split: '1000' path: 20260301/kai/samples/1000_part_*.parquet - split: '5000' path: 20260301/kai/samples/5000_part_*.parquet - split: '10000' path: 20260301/kai/samples/10000_part_*.parquet - config_name: 20260301.kcg data_files: &id528 - split: train path: 20260301/kcg/train/train_part_*.parquet - split: '1000' path: 20260301/kcg/samples/1000_part_*.parquet - split: '5000' path: 20260301/kcg/samples/5000_part_*.parquet - split: '10000' path: 20260301/kcg/samples/10000_part_*.parquet - config_name: 20260301.kg data_files: &id529 - split: train path: 20260301/kg/train/train_part_*.parquet - split: '1000' path: 20260301/kg/samples/1000_part_*.parquet - split: '5000' path: 20260301/kg/samples/5000_part_*.parquet - split: '10000' path: 20260301/kg/samples/10000_part_*.parquet - config_name: 20260301.kge data_files: &id530 - split: train path: 20260301/kge/train/train_part_*.parquet - split: '1000' path: 20260301/kge/samples/1000_part_*.parquet - split: '5000' path: 20260301/kge/samples/5000_part_*.parquet - split: '10000' path: 20260301/kge/samples/10000_part_*.parquet - config_name: 20260301.ki data_files: &id531 - split: train path: 20260301/ki/train/train_part_*.parquet - split: '1000' path: 20260301/ki/samples/1000_part_*.parquet - split: '5000' path: 20260301/ki/samples/5000_part_*.parquet - split: '10000' path: 20260301/ki/samples/10000_part_*.parquet - config_name: 20260301.kj data_files: &id532 - split: train path: 20260301/kj/train/train_part_*.parquet - split: '1000' path: 20260301/kj/samples/1000_part_*.parquet - split: '5000' path: 20260301/kj/samples/5000_part_*.parquet - split: '10000' path: 20260301/kj/samples/10000_part_*.parquet - config_name: 20260301.kl data_files: &id534 - split: train path: 20260301/kl/train/train_part_*.parquet - split: '1000' path: 20260301/kl/samples/1000_part_*.parquet - split: '5000' path: 20260301/kl/samples/5000_part_*.parquet - split: '10000' path: 20260301/kl/samples/10000_part_*.parquet - config_name: 20260301.km data_files: &id535 - split: train path: 20260301/km/train/train_part_*.parquet - split: '1000' path: 20260301/km/samples/1000_part_*.parquet - split: '5000' path: 20260301/km/samples/5000_part_*.parquet - split: '10000' path: 20260301/km/samples/10000_part_*.parquet - config_name: 20260301.knc data_files: &id537 - split: train path: 20260301/knc/train/train_part_*.parquet - split: '1000' path: 20260301/knc/samples/1000_part_*.parquet - split: '5000' path: 20260301/knc/samples/5000_part_*.parquet - split: '10000' path: 20260301/knc/samples/10000_part_*.parquet - config_name: 20260301.koi data_files: &id538 - split: train path: 20260301/koi/train/train_part_*.parquet - split: '1000' path: 20260301/koi/samples/1000_part_*.parquet - split: '5000' path: 20260301/koi/samples/5000_part_*.parquet - split: '10000' path: 20260301/koi/samples/10000_part_*.parquet - config_name: 20260301.ka data_files: &id522 - split: train path: 20260301/ka/train/train_part_*.parquet - split: '1000' path: 20260301/ka/samples/1000_part_*.parquet - split: '5000' path: 20260301/ka/samples/5000_part_*.parquet - split: '10000' path: 20260301/ka/samples/10000_part_*.parquet - config_name: 20260301.kn data_files: &id536 - split: train path: 20260301/kn/train/train_part_*.parquet - split: '1000' path: 20260301/kn/samples/1000_part_*.parquet - split: '5000' path: 20260301/kn/samples/5000_part_*.parquet - split: '10000' path: 20260301/kn/samples/10000_part_*.parquet - config_name: 20260301.kr data_files: &id539 - split: train path: 20260301/kr/train/train_part_*.parquet - split: '1000' path: 20260301/kr/samples/1000_part_*.parquet - split: '5000' path: 20260301/kr/samples/5000_part_*.parquet - split: '10000' path: 20260301/kr/samples/10000_part_*.parquet - config_name: 20260301.krc data_files: &id540 - split: train path: 20260301/krc/train/train_part_*.parquet - split: '1000' path: 20260301/krc/samples/1000_part_*.parquet - split: '5000' path: 20260301/krc/samples/5000_part_*.parquet - split: '10000' path: 20260301/krc/samples/10000_part_*.parquet - config_name: 20260301.ks data_files: &id541 - split: train path: 20260301/ks/train/train_part_*.parquet - split: '1000' path: 20260301/ks/samples/1000_part_*.parquet - split: '5000' path: 20260301/ks/samples/5000_part_*.parquet - split: '10000' path: 20260301/ks/samples/10000_part_*.parquet - config_name: 20260301.ksh data_files: &id542 - split: train path: 20260301/ksh/train/train_part_*.parquet - split: '1000' path: 20260301/ksh/samples/1000_part_*.parquet - split: '5000' path: 20260301/ksh/samples/5000_part_*.parquet - split: '10000' path: 20260301/ksh/samples/10000_part_*.parquet - config_name: 20260301.kus data_files: &id544 - split: train path: 20260301/kus/train/train_part_*.parquet - split: '1000' path: 20260301/kus/samples/1000_part_*.parquet - split: '5000' path: 20260301/kus/samples/5000_part_*.parquet - split: '10000' path: 20260301/kus/samples/10000_part_*.parquet - config_name: 20260301.kv data_files: &id545 - split: train path: 20260301/kv/train/train_part_*.parquet - split: '1000' path: 20260301/kv/samples/1000_part_*.parquet - split: '5000' path: 20260301/kv/samples/5000_part_*.parquet - split: '10000' path: 20260301/kv/samples/10000_part_*.parquet - config_name: 20260301.ku data_files: &id543 - split: train path: 20260301/ku/train/train_part_*.parquet - split: '1000' path: 20260301/ku/samples/1000_part_*.parquet - split: '5000' path: 20260301/ku/samples/5000_part_*.parquet - split: '10000' path: 20260301/ku/samples/10000_part_*.parquet - config_name: 20260301.kw data_files: &id546 - split: train path: 20260301/kw/train/train_part_*.parquet - split: '1000' path: 20260301/kw/samples/1000_part_*.parquet - split: '5000' path: 20260301/kw/samples/5000_part_*.parquet - split: '10000' path: 20260301/kw/samples/10000_part_*.parquet - config_name: 20260301.kk data_files: &id533 - split: train path: 20260301/kk/train/train_part_*.parquet - split: '1000' path: 20260301/kk/samples/1000_part_*.parquet - split: '5000' path: 20260301/kk/samples/5000_part_*.parquet - split: '10000' path: 20260301/kk/samples/10000_part_*.parquet - config_name: 20260301.ky data_files: &id547 - split: train path: 20260301/ky/train/train_part_*.parquet - split: '1000' path: 20260301/ky/samples/1000_part_*.parquet - split: '5000' path: 20260301/ky/samples/5000_part_*.parquet - split: '10000' path: 20260301/ky/samples/10000_part_*.parquet - config_name: 20260301.lad data_files: &id549 - split: train path: 20260301/lad/train/train_part_*.parquet - split: '1000' path: 20260301/lad/samples/1000_part_*.parquet - split: '5000' path: 20260301/lad/samples/5000_part_*.parquet - split: '10000' path: 20260301/lad/samples/10000_part_*.parquet - config_name: 20260301.lbe data_files: &id551 - split: train path: 20260301/lbe/train/train_part_*.parquet - split: '1000' path: 20260301/lbe/samples/1000_part_*.parquet - split: '5000' path: 20260301/lbe/samples/5000_part_*.parquet - split: '10000' path: 20260301/lbe/samples/10000_part_*.parquet - config_name: 20260301.lez data_files: &id552 - split: train path: 20260301/lez/train/train_part_*.parquet - split: '1000' path: 20260301/lez/samples/1000_part_*.parquet - split: '5000' path: 20260301/lez/samples/5000_part_*.parquet - split: '10000' path: 20260301/lez/samples/10000_part_*.parquet - config_name: 20260301.lfn data_files: &id553 - split: train path: 20260301/lfn/train/train_part_*.parquet - split: '1000' path: 20260301/lfn/samples/1000_part_*.parquet - split: '5000' path: 20260301/lfn/samples/5000_part_*.parquet - split: '10000' path: 20260301/lfn/samples/10000_part_*.parquet - config_name: 20260301.lb data_files: &id550 - split: train path: 20260301/lb/train/train_part_*.parquet - split: '1000' path: 20260301/lb/samples/1000_part_*.parquet - split: '5000' path: 20260301/lb/samples/5000_part_*.parquet - split: '10000' path: 20260301/lb/samples/10000_part_*.parquet - config_name: 20260301.lg data_files: &id554 - split: train path: 20260301/lg/train/train_part_*.parquet - split: '1000' path: 20260301/lg/samples/1000_part_*.parquet - split: '5000' path: 20260301/lg/samples/5000_part_*.parquet - split: '10000' path: 20260301/lg/samples/10000_part_*.parquet - config_name: 20260301.la data_files: &id548 - split: train path: 20260301/la/train/train_part_*.parquet - split: '1000' path: 20260301/la/samples/1000_part_*.parquet - split: '5000' path: 20260301/la/samples/5000_part_*.parquet - split: '10000' path: 20260301/la/samples/10000_part_*.parquet - config_name: 20260301.li data_files: &id555 - split: train path: 20260301/li/train/train_part_*.parquet - split: '1000' path: 20260301/li/samples/1000_part_*.parquet - split: '5000' path: 20260301/li/samples/5000_part_*.parquet - split: '10000' path: 20260301/li/samples/10000_part_*.parquet - config_name: 20260301.lij data_files: &id556 - split: train path: 20260301/lij/train/train_part_*.parquet - split: '1000' path: 20260301/lij/samples/1000_part_*.parquet - split: '5000' path: 20260301/lij/samples/5000_part_*.parquet - split: '10000' path: 20260301/lij/samples/10000_part_*.parquet - config_name: 20260301.ln data_files: &id559 - split: train path: 20260301/ln/train/train_part_*.parquet - split: '1000' path: 20260301/ln/samples/1000_part_*.parquet - split: '5000' path: 20260301/ln/samples/5000_part_*.parquet - split: '10000' path: 20260301/ln/samples/10000_part_*.parquet - config_name: 20260301.lo data_files: &id560 - split: train path: 20260301/lo/train/train_part_*.parquet - split: '1000' path: 20260301/lo/samples/1000_part_*.parquet - split: '5000' path: 20260301/lo/samples/5000_part_*.parquet - split: '10000' path: 20260301/lo/samples/10000_part_*.parquet - config_name: 20260301.lld data_files: &id557 - split: train path: 20260301/lld/train/train_part_*.parquet - split: '1000' path: 20260301/lld/samples/1000_part_*.parquet - split: '5000' path: 20260301/lld/samples/5000_part_*.parquet - split: '10000' path: 20260301/lld/samples/10000_part_*.parquet - config_name: 20260301.lmo data_files: &id558 - split: train path: 20260301/lmo/train/train_part_*.parquet - split: '1000' path: 20260301/lmo/samples/1000_part_*.parquet - split: '5000' path: 20260301/lmo/samples/5000_part_*.parquet - split: '10000' path: 20260301/lmo/samples/10000_part_*.parquet - config_name: 20260301.lrc data_files: &id561 - split: train path: 20260301/lrc/train/train_part_*.parquet - split: '1000' path: 20260301/lrc/samples/1000_part_*.parquet - split: '5000' path: 20260301/lrc/samples/5000_part_*.parquet - split: '10000' path: 20260301/lrc/samples/10000_part_*.parquet - config_name: 20260301.ltg data_files: &id563 - split: train path: 20260301/ltg/train/train_part_*.parquet - split: '1000' path: 20260301/ltg/samples/1000_part_*.parquet - split: '5000' path: 20260301/ltg/samples/5000_part_*.parquet - split: '10000' path: 20260301/ltg/samples/10000_part_*.parquet - config_name: 20260301.mad data_files: &id566 - split: train path: 20260301/mad/train/train_part_*.parquet - split: '1000' path: 20260301/mad/samples/1000_part_*.parquet - split: '5000' path: 20260301/mad/samples/5000_part_*.parquet - split: '10000' path: 20260301/mad/samples/10000_part_*.parquet - config_name: 20260301.lzh data_files: &id565 - split: train path: 20260301/lzh/train/train_part_*.parquet - split: '1000' path: 20260301/lzh/samples/1000_part_*.parquet - split: '5000' path: 20260301/lzh/samples/5000_part_*.parquet - split: '10000' path: 20260301/lzh/samples/10000_part_*.parquet - config_name: 20260301.mai data_files: &id567 - split: train path: 20260301/mai/train/train_part_*.parquet - split: '1000' path: 20260301/mai/samples/1000_part_*.parquet - split: '5000' path: 20260301/mai/samples/5000_part_*.parquet - split: '10000' path: 20260301/mai/samples/10000_part_*.parquet - config_name: 20260301.mdf data_files: &id569 - split: train path: 20260301/mdf/train/train_part_*.parquet - split: '1000' path: 20260301/mdf/samples/1000_part_*.parquet - split: '5000' path: 20260301/mdf/samples/5000_part_*.parquet - split: '10000' path: 20260301/mdf/samples/10000_part_*.parquet - config_name: 20260301.map-bms data_files: &id568 - split: train path: 20260301/map-bms/train/train_part_*.parquet - split: '1000' path: 20260301/map-bms/samples/1000_part_*.parquet - split: '5000' path: 20260301/map-bms/samples/5000_part_*.parquet - split: '10000' path: 20260301/map-bms/samples/10000_part_*.parquet - config_name: 20260301.mh data_files: &id571 - split: train path: 20260301/mh/train/train_part_*.parquet - split: '1000' path: 20260301/mh/samples/1000_part_*.parquet - split: '5000' path: 20260301/mh/samples/5000_part_*.parquet - split: '10000' path: 20260301/mh/samples/10000_part_*.parquet - config_name: 20260301.mhr data_files: &id572 - split: train path: 20260301/mhr/train/train_part_*.parquet - split: '1000' path: 20260301/mhr/samples/1000_part_*.parquet - split: '5000' path: 20260301/mhr/samples/5000_part_*.parquet - split: '10000' path: 20260301/mhr/samples/10000_part_*.parquet - config_name: 20260301.mg data_files: &id570 - split: train path: 20260301/mg/train/train_part_*.parquet - split: '1000' path: 20260301/mg/samples/1000_part_*.parquet - split: '5000' path: 20260301/mg/samples/5000_part_*.parquet - split: '10000' path: 20260301/mg/samples/10000_part_*.parquet - config_name: 20260301.mi data_files: &id573 - split: train path: 20260301/mi/train/train_part_*.parquet - split: '1000' path: 20260301/mi/samples/1000_part_*.parquet - split: '5000' path: 20260301/mi/samples/5000_part_*.parquet - split: '10000' path: 20260301/mi/samples/10000_part_*.parquet - config_name: 20260301.lv data_files: &id564 - split: train path: 20260301/lv/train/train_part_*.parquet - split: '1000' path: 20260301/lv/samples/1000_part_*.parquet - split: '5000' path: 20260301/lv/samples/5000_part_*.parquet - split: '10000' path: 20260301/lv/samples/10000_part_*.parquet - config_name: 20260301.min data_files: &id574 - split: train path: 20260301/min/train/train_part_*.parquet - split: '1000' path: 20260301/min/samples/1000_part_*.parquet - split: '5000' path: 20260301/min/samples/5000_part_*.parquet - split: '10000' path: 20260301/min/samples/10000_part_*.parquet - config_name: 20260301.lt data_files: &id562 - split: train path: 20260301/lt/train/train_part_*.parquet - split: '1000' path: 20260301/lt/samples/1000_part_*.parquet - split: '5000' path: 20260301/lt/samples/5000_part_*.parquet - split: '10000' path: 20260301/lt/samples/10000_part_*.parquet - config_name: 20260301.mn data_files: &id577 - split: train path: 20260301/mn/train/train_part_*.parquet - split: '1000' path: 20260301/mn/samples/1000_part_*.parquet - split: '5000' path: 20260301/mn/samples/5000_part_*.parquet - split: '10000' path: 20260301/mn/samples/10000_part_*.parquet - config_name: 20260301.mni data_files: &id578 - split: train path: 20260301/mni/train/train_part_*.parquet - split: '1000' path: 20260301/mni/samples/1000_part_*.parquet - split: '5000' path: 20260301/mni/samples/5000_part_*.parquet - split: '10000' path: 20260301/mni/samples/10000_part_*.parquet - config_name: 20260301.mnw data_files: &id579 - split: train path: 20260301/mnw/train/train_part_*.parquet - split: '1000' path: 20260301/mnw/samples/1000_part_*.parquet - split: '5000' path: 20260301/mnw/samples/5000_part_*.parquet - split: '10000' path: 20260301/mnw/samples/10000_part_*.parquet - config_name: 20260301.mos data_files: &id580 - split: train path: 20260301/mos/train/train_part_*.parquet - split: '1000' path: 20260301/mos/samples/1000_part_*.parquet - split: '5000' path: 20260301/mos/samples/5000_part_*.parquet - split: '10000' path: 20260301/mos/samples/10000_part_*.parquet - config_name: 20260301.mrj data_files: &id582 - split: train path: 20260301/mrj/train/train_part_*.parquet - split: '1000' path: 20260301/mrj/samples/1000_part_*.parquet - split: '5000' path: 20260301/mrj/samples/5000_part_*.parquet - split: '10000' path: 20260301/mrj/samples/10000_part_*.parquet - config_name: 20260301.ml data_files: &id576 - split: train path: 20260301/ml/train/train_part_*.parquet - split: '1000' path: 20260301/ml/samples/1000_part_*.parquet - split: '5000' path: 20260301/ml/samples/5000_part_*.parquet - split: '10000' path: 20260301/ml/samples/10000_part_*.parquet - config_name: 20260301.mr data_files: &id581 - split: train path: 20260301/mr/train/train_part_*.parquet - split: '1000' path: 20260301/mr/samples/1000_part_*.parquet - split: '5000' path: 20260301/mr/samples/5000_part_*.parquet - split: '10000' path: 20260301/mr/samples/10000_part_*.parquet - config_name: 20260301.mt data_files: &id584 - split: train path: 20260301/mt/train/train_part_*.parquet - split: '1000' path: 20260301/mt/samples/1000_part_*.parquet - split: '5000' path: 20260301/mt/samples/5000_part_*.parquet - split: '10000' path: 20260301/mt/samples/10000_part_*.parquet - config_name: 20260301.mus data_files: &id585 - split: train path: 20260301/mus/train/train_part_*.parquet - split: '1000' path: 20260301/mus/samples/1000_part_*.parquet - split: '5000' path: 20260301/mus/samples/5000_part_*.parquet - split: '10000' path: 20260301/mus/samples/10000_part_*.parquet - config_name: 20260301.mk data_files: &id575 - split: train path: 20260301/mk/train/train_part_*.parquet - split: '1000' path: 20260301/mk/samples/1000_part_*.parquet - split: '5000' path: 20260301/mk/samples/5000_part_*.parquet - split: '10000' path: 20260301/mk/samples/10000_part_*.parquet - config_name: 20260301.mwl data_files: &id586 - split: train path: 20260301/mwl/train/train_part_*.parquet - split: '1000' path: 20260301/mwl/samples/1000_part_*.parquet - split: '5000' path: 20260301/mwl/samples/5000_part_*.parquet - split: '10000' path: 20260301/mwl/samples/10000_part_*.parquet - config_name: 20260301.myv data_files: &id588 - split: train path: 20260301/myv/train/train_part_*.parquet - split: '1000' path: 20260301/myv/samples/1000_part_*.parquet - split: '5000' path: 20260301/myv/samples/5000_part_*.parquet - split: '10000' path: 20260301/myv/samples/10000_part_*.parquet - config_name: 20260301.mzn data_files: &id589 - split: train path: 20260301/mzn/train/train_part_*.parquet - split: '1000' path: 20260301/mzn/samples/1000_part_*.parquet - split: '5000' path: 20260301/mzn/samples/5000_part_*.parquet - split: '10000' path: 20260301/mzn/samples/10000_part_*.parquet - config_name: 20260301.na data_files: &id590 - split: train path: 20260301/na/train/train_part_*.parquet - split: '1000' path: 20260301/na/samples/1000_part_*.parquet - split: '5000' path: 20260301/na/samples/5000_part_*.parquet - split: '10000' path: 20260301/na/samples/10000_part_*.parquet - config_name: 20260301.nah data_files: &id591 - split: train path: 20260301/nah/train/train_part_*.parquet - split: '1000' path: 20260301/nah/samples/1000_part_*.parquet - split: '5000' path: 20260301/nah/samples/5000_part_*.parquet - split: '10000' path: 20260301/nah/samples/10000_part_*.parquet - config_name: 20260301.my data_files: &id587 - split: train path: 20260301/my/train/train_part_*.parquet - split: '1000' path: 20260301/my/samples/1000_part_*.parquet - split: '5000' path: 20260301/my/samples/5000_part_*.parquet - split: '10000' path: 20260301/my/samples/10000_part_*.parquet - config_name: 20260301.nap data_files: &id593 - split: train path: 20260301/nap/train/train_part_*.parquet - split: '1000' path: 20260301/nap/samples/1000_part_*.parquet - split: '5000' path: 20260301/nap/samples/5000_part_*.parquet - split: '10000' path: 20260301/nap/samples/10000_part_*.parquet - config_name: 20260301.nan data_files: &id592 - split: train path: 20260301/nan/train/train_part_*.parquet - split: '1000' path: 20260301/nan/samples/1000_part_*.parquet - split: '5000' path: 20260301/nan/samples/5000_part_*.parquet - split: '10000' path: 20260301/nan/samples/10000_part_*.parquet - config_name: 20260301.nds data_files: &id594 - split: train path: 20260301/nds/train/train_part_*.parquet - split: '1000' path: 20260301/nds/samples/1000_part_*.parquet - split: '5000' path: 20260301/nds/samples/5000_part_*.parquet - split: '10000' path: 20260301/nds/samples/10000_part_*.parquet - config_name: 20260301.nds-nl data_files: &id595 - split: train path: 20260301/nds-nl/train/train_part_*.parquet - split: '1000' path: 20260301/nds-nl/samples/1000_part_*.parquet - split: '5000' path: 20260301/nds-nl/samples/5000_part_*.parquet - split: '10000' path: 20260301/nds-nl/samples/10000_part_*.parquet - config_name: 20260301.ne data_files: &id596 - split: train path: 20260301/ne/train/train_part_*.parquet - split: '1000' path: 20260301/ne/samples/1000_part_*.parquet - split: '5000' path: 20260301/ne/samples/5000_part_*.parquet - split: '10000' path: 20260301/ne/samples/10000_part_*.parquet - config_name: 20260301.ng data_files: &id598 - split: train path: 20260301/ng/train/train_part_*.parquet - split: '1000' path: 20260301/ng/samples/1000_part_*.parquet - split: '5000' path: 20260301/ng/samples/5000_part_*.parquet - split: '10000' path: 20260301/ng/samples/10000_part_*.parquet - config_name: 20260301.new data_files: &id597 - split: train path: 20260301/new/train/train_part_*.parquet - split: '1000' path: 20260301/new/samples/1000_part_*.parquet - split: '5000' path: 20260301/new/samples/5000_part_*.parquet - split: '10000' path: 20260301/new/samples/10000_part_*.parquet - config_name: 20260301.nia data_files: &id599 - split: train path: 20260301/nia/train/train_part_*.parquet - split: '1000' path: 20260301/nia/samples/1000_part_*.parquet - split: '5000' path: 20260301/nia/samples/5000_part_*.parquet - split: '10000' path: 20260301/nia/samples/10000_part_*.parquet - config_name: 20260301.nov data_files: &id602 - split: train path: 20260301/nov/train/train_part_*.parquet - split: '1000' path: 20260301/nov/samples/1000_part_*.parquet - split: '5000' path: 20260301/nov/samples/5000_part_*.parquet - split: '10000' path: 20260301/nov/samples/10000_part_*.parquet - config_name: 20260301.nqo data_files: &id603 - split: train path: 20260301/nqo/train/train_part_*.parquet - split: '1000' path: 20260301/nqo/samples/1000_part_*.parquet - split: '5000' path: 20260301/nqo/samples/5000_part_*.parquet - split: '10000' path: 20260301/nqo/samples/10000_part_*.parquet - config_name: 20260301.nr data_files: &id604 - split: train path: 20260301/nr/train/train_part_*.parquet - split: '1000' path: 20260301/nr/samples/1000_part_*.parquet - split: '5000' path: 20260301/nr/samples/5000_part_*.parquet - split: '10000' path: 20260301/nr/samples/10000_part_*.parquet - config_name: 20260301.nrm data_files: &id605 - split: train path: 20260301/nrm/train/train_part_*.parquet - split: '1000' path: 20260301/nrm/samples/1000_part_*.parquet - split: '5000' path: 20260301/nrm/samples/5000_part_*.parquet - split: '10000' path: 20260301/nrm/samples/10000_part_*.parquet - config_name: 20260301.nso data_files: &id606 - split: train path: 20260301/nso/train/train_part_*.parquet - split: '1000' path: 20260301/nso/samples/1000_part_*.parquet - split: '5000' path: 20260301/nso/samples/5000_part_*.parquet - split: '10000' path: 20260301/nso/samples/10000_part_*.parquet - config_name: 20260301.nup data_files: &id607 - split: train path: 20260301/nup/train/train_part_*.parquet - split: '1000' path: 20260301/nup/samples/1000_part_*.parquet - split: '5000' path: 20260301/nup/samples/5000_part_*.parquet - split: '10000' path: 20260301/nup/samples/10000_part_*.parquet - config_name: 20260301.nn data_files: &id600 - split: train path: 20260301/nn/train/train_part_*.parquet - split: '1000' path: 20260301/nn/samples/1000_part_*.parquet - split: '5000' path: 20260301/nn/samples/5000_part_*.parquet - split: '10000' path: 20260301/nn/samples/10000_part_*.parquet - config_name: 20260301.nv data_files: &id608 - split: train path: 20260301/nv/train/train_part_*.parquet - split: '1000' path: 20260301/nv/samples/1000_part_*.parquet - split: '5000' path: 20260301/nv/samples/5000_part_*.parquet - split: '10000' path: 20260301/nv/samples/10000_part_*.parquet - config_name: 20260301.ny data_files: &id609 - split: train path: 20260301/ny/train/train_part_*.parquet - split: '1000' path: 20260301/ny/samples/1000_part_*.parquet - split: '5000' path: 20260301/ny/samples/5000_part_*.parquet - split: '10000' path: 20260301/ny/samples/10000_part_*.parquet - config_name: 20260301.olo data_files: &id611 - split: train path: 20260301/olo/train/train_part_*.parquet - split: '1000' path: 20260301/olo/samples/1000_part_*.parquet - split: '5000' path: 20260301/olo/samples/5000_part_*.parquet - split: '10000' path: 20260301/olo/samples/10000_part_*.parquet - config_name: 20260301.om data_files: &id612 - split: train path: 20260301/om/train/train_part_*.parquet - split: '1000' path: 20260301/om/samples/1000_part_*.parquet - split: '5000' path: 20260301/om/samples/5000_part_*.parquet - split: '10000' path: 20260301/om/samples/10000_part_*.parquet - config_name: 20260301.ms data_files: &id583 - split: train path: 20260301/ms/train/train_part_*.parquet - split: '1000' path: 20260301/ms/samples/1000_part_*.parquet - split: '5000' path: 20260301/ms/samples/5000_part_*.parquet - split: '10000' path: 20260301/ms/samples/10000_part_*.parquet - config_name: 20260301.oc data_files: &id610 - split: train path: 20260301/oc/train/train_part_*.parquet - split: '1000' path: 20260301/oc/samples/1000_part_*.parquet - split: '5000' path: 20260301/oc/samples/5000_part_*.parquet - split: '10000' path: 20260301/oc/samples/10000_part_*.parquet - config_name: 20260301.or data_files: &id613 - split: train path: 20260301/or/train/train_part_*.parquet - split: '1000' path: 20260301/or/samples/1000_part_*.parquet - split: '5000' path: 20260301/or/samples/5000_part_*.parquet - split: '10000' path: 20260301/or/samples/10000_part_*.parquet - config_name: 20260301.os data_files: &id614 - split: train path: 20260301/os/train/train_part_*.parquet - split: '1000' path: 20260301/os/samples/1000_part_*.parquet - split: '5000' path: 20260301/os/samples/5000_part_*.parquet - split: '10000' path: 20260301/os/samples/10000_part_*.parquet - config_name: 20260301.pag data_files: &id616 - split: train path: 20260301/pag/train/train_part_*.parquet - split: '1000' path: 20260301/pag/samples/1000_part_*.parquet - split: '5000' path: 20260301/pag/samples/5000_part_*.parquet - split: '10000' path: 20260301/pag/samples/10000_part_*.parquet - config_name: 20260301.pa data_files: &id615 - split: train path: 20260301/pa/train/train_part_*.parquet - split: '1000' path: 20260301/pa/samples/1000_part_*.parquet - split: '5000' path: 20260301/pa/samples/5000_part_*.parquet - split: '10000' path: 20260301/pa/samples/10000_part_*.parquet - config_name: 20260301.pam data_files: &id617 - split: train path: 20260301/pam/train/train_part_*.parquet - split: '1000' path: 20260301/pam/samples/1000_part_*.parquet - split: '5000' path: 20260301/pam/samples/5000_part_*.parquet - split: '10000' path: 20260301/pam/samples/10000_part_*.parquet - config_name: 20260301.pap data_files: &id618 - split: train path: 20260301/pap/train/train_part_*.parquet - split: '1000' path: 20260301/pap/samples/1000_part_*.parquet - split: '5000' path: 20260301/pap/samples/5000_part_*.parquet - split: '10000' path: 20260301/pap/samples/10000_part_*.parquet - config_name: 20260301.pcd data_files: &id619 - split: train path: 20260301/pcd/train/train_part_*.parquet - split: '1000' path: 20260301/pcd/samples/1000_part_*.parquet - split: '5000' path: 20260301/pcd/samples/5000_part_*.parquet - split: '10000' path: 20260301/pcd/samples/10000_part_*.parquet - config_name: 20260301.pcm data_files: &id620 - split: train path: 20260301/pcm/train/train_part_*.parquet - split: '1000' path: 20260301/pcm/samples/1000_part_*.parquet - split: '5000' path: 20260301/pcm/samples/5000_part_*.parquet - split: '10000' path: 20260301/pcm/samples/10000_part_*.parquet - config_name: 20260301.pdc data_files: &id621 - split: train path: 20260301/pdc/train/train_part_*.parquet - split: '1000' path: 20260301/pdc/samples/1000_part_*.parquet - split: '5000' path: 20260301/pdc/samples/5000_part_*.parquet - split: '10000' path: 20260301/pdc/samples/10000_part_*.parquet - config_name: 20260301.pfl data_files: &id622 - split: train path: 20260301/pfl/train/train_part_*.parquet - split: '1000' path: 20260301/pfl/samples/1000_part_*.parquet - split: '5000' path: 20260301/pfl/samples/5000_part_*.parquet - split: '10000' path: 20260301/pfl/samples/10000_part_*.parquet - config_name: 20260301.pi data_files: &id628 - split: train path: 20260301/pi/train/train_part_*.parquet - split: '1000' path: 20260301/pi/samples/1000_part_*.parquet - split: '5000' path: 20260301/pi/samples/5000_part_*.parquet - split: '10000' path: 20260301/pi/samples/10000_part_*.parquet - config_name: 20260301.pih data_files: &id623 - split: train path: 20260301/pih/train/train_part_*.parquet - split: '1000' path: 20260301/pih/samples/1000_part_*.parquet - split: '5000' path: 20260301/pih/samples/5000_part_*.parquet - split: '10000' path: 20260301/pih/samples/10000_part_*.parquet - config_name: 20260301.pms data_files: &id629 - split: train path: 20260301/pms/train/train_part_*.parquet - split: '1000' path: 20260301/pms/samples/1000_part_*.parquet - split: '5000' path: 20260301/pms/samples/5000_part_*.parquet - split: '10000' path: 20260301/pms/samples/10000_part_*.parquet - config_name: 20260301.pnt data_files: &id631 - split: train path: 20260301/pnt/train/train_part_*.parquet - split: '1000' path: 20260301/pnt/samples/1000_part_*.parquet - split: '5000' path: 20260301/pnt/samples/5000_part_*.parquet - split: '10000' path: 20260301/pnt/samples/10000_part_*.parquet - config_name: 20260301.ppl data_files: &id721 - split: train path: 20260301/ppl/train/train_part_*.parquet - split: '1000' path: 20260301/ppl/samples/1000_part_*.parquet - split: '5000' path: 20260301/ppl/samples/5000_part_*.parquet - split: '10000' path: 20260301/ppl/samples/10000_part_*.parquet - config_name: 20260301.ps data_files: &id624 - split: train path: 20260301/ps/train/train_part_*.parquet - split: '1000' path: 20260301/ps/samples/1000_part_*.parquet - split: '5000' path: 20260301/ps/samples/5000_part_*.parquet - split: '10000' path: 20260301/ps/samples/10000_part_*.parquet - config_name: 20260301.pwn data_files: &id632 - split: train path: 20260301/pwn/train/train_part_*.parquet - split: '1000' path: 20260301/pwn/samples/1000_part_*.parquet - split: '5000' path: 20260301/pwn/samples/5000_part_*.parquet - split: '10000' path: 20260301/pwn/samples/10000_part_*.parquet - config_name: 20260301.rki data_files: &id625 - split: train path: 20260301/rki/train/train_part_*.parquet - split: '1000' path: 20260301/rki/samples/1000_part_*.parquet - split: '5000' path: 20260301/rki/samples/5000_part_*.parquet - split: '10000' path: 20260301/rki/samples/10000_part_*.parquet - config_name: 20260301.pnb data_files: &id630 - split: train path: 20260301/pnb/train/train_part_*.parquet - split: '1000' path: 20260301/pnb/samples/1000_part_*.parquet - split: '5000' path: 20260301/pnb/samples/5000_part_*.parquet - split: '10000' path: 20260301/pnb/samples/10000_part_*.parquet - config_name: 20260301.qu data_files: &id633 - split: train path: 20260301/qu/train/train_part_*.parquet - split: '1000' path: 20260301/qu/samples/1000_part_*.parquet - split: '5000' path: 20260301/qu/samples/5000_part_*.parquet - split: '10000' path: 20260301/qu/samples/10000_part_*.parquet - config_name: 20260301.rm data_files: &id634 - split: train path: 20260301/rm/train/train_part_*.parquet - split: '1000' path: 20260301/rm/samples/1000_part_*.parquet - split: '5000' path: 20260301/rm/samples/5000_part_*.parquet - split: '10000' path: 20260301/rm/samples/10000_part_*.parquet - config_name: 20260301.id data_files: &id507 - split: train path: 20260301/id/train/train_part_*.parquet - split: '1000' path: 20260301/id/samples/1000_part_*.parquet - split: '5000' path: 20260301/id/samples/5000_part_*.parquet - split: '10000' path: 20260301/id/samples/10000_part_*.parquet - config_name: 20260301.rmy data_files: &id635 - split: train path: 20260301/rmy/train/train_part_*.parquet - split: '1000' path: 20260301/rmy/samples/1000_part_*.parquet - split: '5000' path: 20260301/rmy/samples/5000_part_*.parquet - split: '10000' path: 20260301/rmy/samples/10000_part_*.parquet - config_name: 20260301.rn data_files: &id636 - split: train path: 20260301/rn/train/train_part_*.parquet - split: '1000' path: 20260301/rn/samples/1000_part_*.parquet - split: '5000' path: 20260301/rn/samples/5000_part_*.parquet - split: '10000' path: 20260301/rn/samples/10000_part_*.parquet - config_name: 20260301.rsk data_files: &id639 - split: train path: 20260301/rsk/train/train_part_*.parquet - split: '1000' path: 20260301/rsk/samples/1000_part_*.parquet - split: '5000' path: 20260301/rsk/samples/5000_part_*.parquet - split: '10000' path: 20260301/rsk/samples/10000_part_*.parquet - config_name: 20260301.rue data_files: &id640 - split: train path: 20260301/rue/train/train_part_*.parquet - split: '1000' path: 20260301/rue/samples/1000_part_*.parquet - split: '5000' path: 20260301/rue/samples/5000_part_*.parquet - split: '10000' path: 20260301/rue/samples/10000_part_*.parquet - config_name: 20260301.roa-tara data_files: &id638 - split: train path: 20260301/roa-tara/train/train_part_*.parquet - split: '1000' path: 20260301/roa-tara/samples/1000_part_*.parquet - split: '5000' path: 20260301/roa-tara/samples/5000_part_*.parquet - split: '10000' path: 20260301/roa-tara/samples/10000_part_*.parquet - config_name: 20260301.rw data_files: &id642 - split: train path: 20260301/rw/train/train_part_*.parquet - split: '1000' path: 20260301/rw/samples/1000_part_*.parquet - split: '5000' path: 20260301/rw/samples/5000_part_*.parquet - split: '10000' path: 20260301/rw/samples/10000_part_*.parquet - config_name: 20260301.rup data_files: &id641 - split: train path: 20260301/rup/train/train_part_*.parquet - split: '1000' path: 20260301/rup/samples/1000_part_*.parquet - split: '5000' path: 20260301/rup/samples/5000_part_*.parquet - split: '10000' path: 20260301/rup/samples/10000_part_*.parquet - config_name: 20260301.sa data_files: &id643 - split: train path: 20260301/sa/train/train_part_*.parquet - split: '1000' path: 20260301/sa/samples/1000_part_*.parquet - split: '5000' path: 20260301/sa/samples/5000_part_*.parquet - split: '10000' path: 20260301/sa/samples/10000_part_*.parquet - config_name: 20260301.sah data_files: &id644 - split: train path: 20260301/sah/train/train_part_*.parquet - split: '1000' path: 20260301/sah/samples/1000_part_*.parquet - split: '5000' path: 20260301/sah/samples/5000_part_*.parquet - split: '10000' path: 20260301/sah/samples/10000_part_*.parquet - config_name: 20260301.sat data_files: &id645 - split: train path: 20260301/sat/train/train_part_*.parquet - split: '1000' path: 20260301/sat/samples/1000_part_*.parquet - split: '5000' path: 20260301/sat/samples/5000_part_*.parquet - split: '10000' path: 20260301/sat/samples/10000_part_*.parquet - config_name: 20260301.sc data_files: &id646 - split: train path: 20260301/sc/train/train_part_*.parquet - split: '1000' path: 20260301/sc/samples/1000_part_*.parquet - split: '5000' path: 20260301/sc/samples/5000_part_*.parquet - split: '10000' path: 20260301/sc/samples/10000_part_*.parquet - config_name: 20260301.scn data_files: &id647 - split: train path: 20260301/scn/train/train_part_*.parquet - split: '1000' path: 20260301/scn/samples/1000_part_*.parquet - split: '5000' path: 20260301/scn/samples/5000_part_*.parquet - split: '10000' path: 20260301/scn/samples/10000_part_*.parquet - config_name: 20260301.it data_files: &id517 - split: train path: 20260301/it/train/train_part_*.parquet - split: '1000' path: 20260301/it/samples/1000_part_*.parquet - split: '5000' path: 20260301/it/samples/5000_part_*.parquet - split: '10000' path: 20260301/it/samples/10000_part_*.parquet - config_name: 20260301.no data_files: &id601 - split: train path: 20260301/no/train/train_part_*.parquet - split: '1000' path: 20260301/no/samples/1000_part_*.parquet - split: '5000' path: 20260301/no/samples/5000_part_*.parquet - split: '10000' path: 20260301/no/samples/10000_part_*.parquet - config_name: 20260301.ro data_files: &id637 - split: train path: 20260301/ro/train/train_part_*.parquet - split: '1000' path: 20260301/ro/samples/1000_part_*.parquet - split: '5000' path: 20260301/ro/samples/5000_part_*.parquet - split: '10000' path: 20260301/ro/samples/10000_part_*.parquet - config_name: 20260301.sco data_files: &id648 - split: train path: 20260301/sco/train/train_part_*.parquet - split: '1000' path: 20260301/sco/samples/1000_part_*.parquet - split: '5000' path: 20260301/sco/samples/5000_part_*.parquet - split: '10000' path: 20260301/sco/samples/10000_part_*.parquet - config_name: 20260301.se data_files: &id650 - split: train path: 20260301/se/train/train_part_*.parquet - split: '1000' path: 20260301/se/samples/1000_part_*.parquet - split: '5000' path: 20260301/se/samples/5000_part_*.parquet - split: '10000' path: 20260301/se/samples/10000_part_*.parquet - config_name: 20260301.sd data_files: &id649 - split: train path: 20260301/sd/train/train_part_*.parquet - split: '1000' path: 20260301/sd/samples/1000_part_*.parquet - split: '5000' path: 20260301/sd/samples/5000_part_*.parquet - split: '10000' path: 20260301/sd/samples/10000_part_*.parquet - config_name: 20260301.sg data_files: &id651 - split: train path: 20260301/sg/train/train_part_*.parquet - split: '1000' path: 20260301/sg/samples/1000_part_*.parquet - split: '5000' path: 20260301/sg/samples/5000_part_*.parquet - split: '10000' path: 20260301/sg/samples/10000_part_*.parquet - config_name: 20260301.shi data_files: &id654 - split: train path: 20260301/shi/train/train_part_*.parquet - split: '1000' path: 20260301/shi/samples/1000_part_*.parquet - split: '5000' path: 20260301/shi/samples/5000_part_*.parquet - split: '10000' path: 20260301/shi/samples/10000_part_*.parquet - config_name: 20260301.sgs data_files: &id652 - split: train path: 20260301/sgs/train/train_part_*.parquet - split: '1000' path: 20260301/sgs/samples/1000_part_*.parquet - split: '5000' path: 20260301/sgs/samples/5000_part_*.parquet - split: '10000' path: 20260301/sgs/samples/10000_part_*.parquet - config_name: 20260301.shn data_files: &id655 - split: train path: 20260301/shn/train/train_part_*.parquet - split: '1000' path: 20260301/shn/samples/1000_part_*.parquet - split: '5000' path: 20260301/shn/samples/5000_part_*.parquet - split: '10000' path: 20260301/shn/samples/10000_part_*.parquet - config_name: 20260301.sh data_files: &id653 - split: train path: 20260301/sh/train/train_part_*.parquet - split: '1000' path: 20260301/sh/samples/1000_part_*.parquet - split: '5000' path: 20260301/sh/samples/5000_part_*.parquet - split: '10000' path: 20260301/sh/samples/10000_part_*.parquet - config_name: 20260301.si data_files: &id656 - split: train path: 20260301/si/train/train_part_*.parquet - split: '1000' path: 20260301/si/samples/1000_part_*.parquet - split: '5000' path: 20260301/si/samples/5000_part_*.parquet - split: '10000' path: 20260301/si/samples/10000_part_*.parquet - config_name: 20260301.simple data_files: &id657 - split: train path: 20260301/simple/train/train_part_*.parquet - split: '1000' path: 20260301/simple/samples/1000_part_*.parquet - split: '5000' path: 20260301/simple/samples/5000_part_*.parquet - split: '10000' path: 20260301/simple/samples/10000_part_*.parquet - config_name: 20260301.skr data_files: &id659 - split: train path: 20260301/skr/train/train_part_*.parquet - split: '1000' path: 20260301/skr/samples/1000_part_*.parquet - split: '5000' path: 20260301/skr/samples/5000_part_*.parquet - split: '10000' path: 20260301/skr/samples/10000_part_*.parquet - config_name: 20260301.sl data_files: &id660 - split: train path: 20260301/sl/train/train_part_*.parquet - split: '1000' path: 20260301/sl/samples/1000_part_*.parquet - split: '5000' path: 20260301/sl/samples/5000_part_*.parquet - split: '10000' path: 20260301/sl/samples/10000_part_*.parquet - config_name: 20260301.sm data_files: &id661 - split: train path: 20260301/sm/train/train_part_*.parquet - split: '1000' path: 20260301/sm/samples/1000_part_*.parquet - split: '5000' path: 20260301/sm/samples/5000_part_*.parquet - split: '10000' path: 20260301/sm/samples/10000_part_*.parquet - config_name: 20260301.smn data_files: &id662 - split: train path: 20260301/smn/train/train_part_*.parquet - split: '1000' path: 20260301/smn/samples/1000_part_*.parquet - split: '5000' path: 20260301/smn/samples/5000_part_*.parquet - split: '10000' path: 20260301/smn/samples/10000_part_*.parquet - config_name: 20260301.sn data_files: &id663 - split: train path: 20260301/sn/train/train_part_*.parquet - split: '1000' path: 20260301/sn/samples/1000_part_*.parquet - split: '5000' path: 20260301/sn/samples/5000_part_*.parquet - split: '10000' path: 20260301/sn/samples/10000_part_*.parquet - config_name: 20260301.sk data_files: &id658 - split: train path: 20260301/sk/train/train_part_*.parquet - split: '1000' path: 20260301/sk/samples/1000_part_*.parquet - split: '5000' path: 20260301/sk/samples/5000_part_*.parquet - split: '10000' path: 20260301/sk/samples/10000_part_*.parquet - config_name: 20260301.so data_files: &id664 - split: train path: 20260301/so/train/train_part_*.parquet - split: '1000' path: 20260301/so/samples/1000_part_*.parquet - split: '5000' path: 20260301/so/samples/5000_part_*.parquet - split: '10000' path: 20260301/so/samples/10000_part_*.parquet - config_name: 20260301.srn data_files: &id666 - split: train path: 20260301/srn/train/train_part_*.parquet - split: '1000' path: 20260301/srn/samples/1000_part_*.parquet - split: '5000' path: 20260301/srn/samples/5000_part_*.parquet - split: '10000' path: 20260301/srn/samples/10000_part_*.parquet - config_name: 20260301.ss data_files: &id667 - split: train path: 20260301/ss/train/train_part_*.parquet - split: '1000' path: 20260301/ss/samples/1000_part_*.parquet - split: '5000' path: 20260301/ss/samples/5000_part_*.parquet - split: '10000' path: 20260301/ss/samples/10000_part_*.parquet - config_name: 20260301.st data_files: &id668 - split: train path: 20260301/st/train/train_part_*.parquet - split: '1000' path: 20260301/st/samples/1000_part_*.parquet - split: '5000' path: 20260301/st/samples/5000_part_*.parquet - split: '10000' path: 20260301/st/samples/10000_part_*.parquet - config_name: 20260301.stq data_files: &id669 - split: train path: 20260301/stq/train/train_part_*.parquet - split: '1000' path: 20260301/stq/samples/1000_part_*.parquet - split: '5000' path: 20260301/stq/samples/5000_part_*.parquet - split: '10000' path: 20260301/stq/samples/10000_part_*.parquet - config_name: 20260301.sq data_files: &id665 - split: train path: 20260301/sq/train/train_part_*.parquet - split: '1000' path: 20260301/sq/samples/1000_part_*.parquet - split: '5000' path: 20260301/sq/samples/5000_part_*.parquet - split: '10000' path: 20260301/sq/samples/10000_part_*.parquet - config_name: 20260301.su data_files: &id670 - split: train path: 20260301/su/train/train_part_*.parquet - split: '1000' path: 20260301/su/samples/1000_part_*.parquet - split: '5000' path: 20260301/su/samples/5000_part_*.parquet - split: '10000' path: 20260301/su/samples/10000_part_*.parquet - config_name: 20260301.sw data_files: &id671 - split: train path: 20260301/sw/train/train_part_*.parquet - split: '1000' path: 20260301/sw/samples/1000_part_*.parquet - split: '5000' path: 20260301/sw/samples/5000_part_*.parquet - split: '10000' path: 20260301/sw/samples/10000_part_*.parquet - config_name: 20260301.syl data_files: &id672 - split: train path: 20260301/syl/train/train_part_*.parquet - split: '1000' path: 20260301/syl/samples/1000_part_*.parquet - split: '5000' path: 20260301/syl/samples/5000_part_*.parquet - split: '10000' path: 20260301/syl/samples/10000_part_*.parquet - config_name: 20260301.szl data_files: &id673 - split: train path: 20260301/szl/train/train_part_*.parquet - split: '1000' path: 20260301/szl/samples/1000_part_*.parquet - split: '5000' path: 20260301/szl/samples/5000_part_*.parquet - split: '10000' path: 20260301/szl/samples/10000_part_*.parquet - config_name: 20260301.szy data_files: &id674 - split: train path: 20260301/szy/train/train_part_*.parquet - split: '1000' path: 20260301/szy/samples/1000_part_*.parquet - split: '5000' path: 20260301/szy/samples/5000_part_*.parquet - split: '10000' path: 20260301/szy/samples/10000_part_*.parquet - config_name: 20260301.tay data_files: &id676 - split: train path: 20260301/tay/train/train_part_*.parquet - split: '1000' path: 20260301/tay/samples/1000_part_*.parquet - split: '5000' path: 20260301/tay/samples/5000_part_*.parquet - split: '10000' path: 20260301/tay/samples/10000_part_*.parquet - config_name: 20260301.tcy data_files: &id677 - split: train path: 20260301/tcy/train/train_part_*.parquet - split: '1000' path: 20260301/tcy/samples/1000_part_*.parquet - split: '5000' path: 20260301/tcy/samples/5000_part_*.parquet - split: '10000' path: 20260301/tcy/samples/10000_part_*.parquet - config_name: 20260301.tdd data_files: &id678 - split: train path: 20260301/tdd/train/train_part_*.parquet - split: '1000' path: 20260301/tdd/samples/1000_part_*.parquet - split: '5000' path: 20260301/tdd/samples/5000_part_*.parquet - split: '10000' path: 20260301/tdd/samples/10000_part_*.parquet - config_name: 20260301.ta data_files: &id675 - split: train path: 20260301/ta/train/train_part_*.parquet - split: '1000' path: 20260301/ta/samples/1000_part_*.parquet - split: '5000' path: 20260301/ta/samples/5000_part_*.parquet - split: '10000' path: 20260301/ta/samples/10000_part_*.parquet - config_name: 20260301.tet data_files: &id680 - split: train path: 20260301/tet/train/train_part_*.parquet - split: '1000' path: 20260301/tet/samples/1000_part_*.parquet - split: '5000' path: 20260301/tet/samples/5000_part_*.parquet - split: '10000' path: 20260301/tet/samples/10000_part_*.parquet - config_name: 20260301.te data_files: &id679 - split: train path: 20260301/te/train/train_part_*.parquet - split: '1000' path: 20260301/te/samples/1000_part_*.parquet - split: '5000' path: 20260301/te/samples/5000_part_*.parquet - split: '10000' path: 20260301/te/samples/10000_part_*.parquet - config_name: 20260301.tg data_files: &id681 - split: train path: 20260301/tg/train/train_part_*.parquet - split: '1000' path: 20260301/tg/samples/1000_part_*.parquet - split: '5000' path: 20260301/tg/samples/5000_part_*.parquet - split: '10000' path: 20260301/tg/samples/10000_part_*.parquet - config_name: 20260301.ti data_files: &id682 - split: train path: 20260301/ti/train/train_part_*.parquet - split: '1000' path: 20260301/ti/samples/1000_part_*.parquet - split: '5000' path: 20260301/ti/samples/5000_part_*.parquet - split: '10000' path: 20260301/ti/samples/10000_part_*.parquet - config_name: 20260301.tig data_files: &id683 - split: train path: 20260301/tig/train/train_part_*.parquet - split: '1000' path: 20260301/tig/samples/1000_part_*.parquet - split: '5000' path: 20260301/tig/samples/5000_part_*.parquet - split: '10000' path: 20260301/tig/samples/10000_part_*.parquet - config_name: 20260301.tk data_files: &id684 - split: train path: 20260301/tk/train/train_part_*.parquet - split: '1000' path: 20260301/tk/samples/1000_part_*.parquet - split: '5000' path: 20260301/tk/samples/5000_part_*.parquet - split: '10000' path: 20260301/tk/samples/10000_part_*.parquet - config_name: 20260301.tly data_files: &id686 - split: train path: 20260301/tly/train/train_part_*.parquet - split: '1000' path: 20260301/tly/samples/1000_part_*.parquet - split: '5000' path: 20260301/tly/samples/5000_part_*.parquet - split: '10000' path: 20260301/tly/samples/10000_part_*.parquet - config_name: 20260301.tn data_files: &id626 - split: train path: 20260301/tn/train/train_part_*.parquet - split: '1000' path: 20260301/tn/samples/1000_part_*.parquet - split: '5000' path: 20260301/tn/samples/5000_part_*.parquet - split: '10000' path: 20260301/tn/samples/10000_part_*.parquet - config_name: 20260301.tl data_files: &id685 - split: train path: 20260301/tl/train/train_part_*.parquet - split: '1000' path: 20260301/tl/samples/1000_part_*.parquet - split: '5000' path: 20260301/tl/samples/5000_part_*.parquet - split: '10000' path: 20260301/tl/samples/10000_part_*.parquet - config_name: 20260301.to data_files: &id687 - split: train path: 20260301/to/train/train_part_*.parquet - split: '1000' path: 20260301/to/samples/1000_part_*.parquet - split: '5000' path: 20260301/to/samples/5000_part_*.parquet - split: '10000' path: 20260301/to/samples/10000_part_*.parquet - config_name: 20260301.tok data_files: &id688 - split: train path: 20260301/tok/train/train_part_*.parquet - split: '1000' path: 20260301/tok/samples/1000_part_*.parquet - split: '5000' path: 20260301/tok/samples/5000_part_*.parquet - split: '10000' path: 20260301/tok/samples/10000_part_*.parquet - config_name: 20260301.tpi data_files: &id689 - split: train path: 20260301/tpi/train/train_part_*.parquet - split: '1000' path: 20260301/tpi/samples/1000_part_*.parquet - split: '5000' path: 20260301/tpi/samples/5000_part_*.parquet - split: '10000' path: 20260301/tpi/samples/10000_part_*.parquet - config_name: 20260301.trv data_files: &id690 - split: train path: 20260301/trv/train/train_part_*.parquet - split: '1000' path: 20260301/trv/samples/1000_part_*.parquet - split: '5000' path: 20260301/trv/samples/5000_part_*.parquet - split: '10000' path: 20260301/trv/samples/10000_part_*.parquet - config_name: 20260301.ts data_files: &id691 - split: train path: 20260301/ts/train/train_part_*.parquet - split: '1000' path: 20260301/ts/samples/1000_part_*.parquet - split: '5000' path: 20260301/ts/samples/5000_part_*.parquet - split: '10000' path: 20260301/ts/samples/10000_part_*.parquet - config_name: 20260301.tum data_files: &id693 - split: train path: 20260301/tum/train/train_part_*.parquet - split: '1000' path: 20260301/tum/samples/1000_part_*.parquet - split: '5000' path: 20260301/tum/samples/5000_part_*.parquet - split: '10000' path: 20260301/tum/samples/10000_part_*.parquet - config_name: 20260301.tw data_files: &id694 - split: train path: 20260301/tw/train/train_part_*.parquet - split: '1000' path: 20260301/tw/samples/1000_part_*.parquet - split: '5000' path: 20260301/tw/samples/5000_part_*.parquet - split: '10000' path: 20260301/tw/samples/10000_part_*.parquet - config_name: 20260301.ty data_files: &id695 - split: train path: 20260301/ty/train/train_part_*.parquet - split: '1000' path: 20260301/ty/samples/1000_part_*.parquet - split: '5000' path: 20260301/ty/samples/5000_part_*.parquet - split: '10000' path: 20260301/ty/samples/10000_part_*.parquet - config_name: 20260301.tyv data_files: &id696 - split: train path: 20260301/tyv/train/train_part_*.parquet - split: '1000' path: 20260301/tyv/samples/1000_part_*.parquet - split: '5000' path: 20260301/tyv/samples/5000_part_*.parquet - split: '10000' path: 20260301/tyv/samples/10000_part_*.parquet - config_name: 20260301.udm data_files: &id697 - split: train path: 20260301/udm/train/train_part_*.parquet - split: '1000' path: 20260301/udm/samples/1000_part_*.parquet - split: '5000' path: 20260301/udm/samples/5000_part_*.parquet - split: '10000' path: 20260301/udm/samples/10000_part_*.parquet - config_name: 20260301.ug data_files: &id698 - split: train path: 20260301/ug/train/train_part_*.parquet - split: '1000' path: 20260301/ug/samples/1000_part_*.parquet - split: '5000' path: 20260301/ug/samples/5000_part_*.parquet - split: '10000' path: 20260301/ug/samples/10000_part_*.parquet - config_name: 20260301.tt data_files: &id692 - split: train path: 20260301/tt/train/train_part_*.parquet - split: '1000' path: 20260301/tt/samples/1000_part_*.parquet - split: '5000' path: 20260301/tt/samples/5000_part_*.parquet - split: '10000' path: 20260301/tt/samples/10000_part_*.parquet - config_name: 20260301.ur data_files: &id699 - split: train path: 20260301/ur/train/train_part_*.parquet - split: '1000' path: 20260301/ur/samples/1000_part_*.parquet - split: '5000' path: 20260301/ur/samples/5000_part_*.parquet - split: '10000' path: 20260301/ur/samples/10000_part_*.parquet - config_name: 20260301.ve data_files: &id701 - split: train path: 20260301/ve/train/train_part_*.parquet - split: '1000' path: 20260301/ve/samples/1000_part_*.parquet - split: '5000' path: 20260301/ve/samples/5000_part_*.parquet - split: '10000' path: 20260301/ve/samples/10000_part_*.parquet - config_name: 20260301.vec data_files: &id702 - split: train path: 20260301/vec/train/train_part_*.parquet - split: '1000' path: 20260301/vec/samples/1000_part_*.parquet - split: '5000' path: 20260301/vec/samples/5000_part_*.parquet - split: '10000' path: 20260301/vec/samples/10000_part_*.parquet - config_name: 20260301.uz data_files: &id700 - split: train path: 20260301/uz/train/train_part_*.parquet - split: '1000' path: 20260301/uz/samples/1000_part_*.parquet - split: '5000' path: 20260301/uz/samples/5000_part_*.parquet - split: '10000' path: 20260301/uz/samples/10000_part_*.parquet - config_name: 20260301.vep data_files: &id703 - split: train path: 20260301/vep/train/train_part_*.parquet - split: '1000' path: 20260301/vep/samples/1000_part_*.parquet - split: '5000' path: 20260301/vep/samples/5000_part_*.parquet - split: '10000' path: 20260301/vep/samples/10000_part_*.parquet - config_name: 20260301.vls data_files: &id704 - split: train path: 20260301/vls/train/train_part_*.parquet - split: '1000' path: 20260301/vls/samples/1000_part_*.parquet - split: '5000' path: 20260301/vls/samples/5000_part_*.parquet - split: '10000' path: 20260301/vls/samples/10000_part_*.parquet - config_name: 20260301.vo data_files: &id705 - split: train path: 20260301/vo/train/train_part_*.parquet - split: '1000' path: 20260301/vo/samples/1000_part_*.parquet - split: '5000' path: 20260301/vo/samples/5000_part_*.parquet - split: '10000' path: 20260301/vo/samples/10000_part_*.parquet - config_name: 20260301.wa data_files: &id707 - split: train path: 20260301/wa/train/train_part_*.parquet - split: '1000' path: 20260301/wa/samples/1000_part_*.parquet - split: '5000' path: 20260301/wa/samples/5000_part_*.parquet - split: '10000' path: 20260301/wa/samples/10000_part_*.parquet - config_name: 20260301.vro data_files: &id706 - split: train path: 20260301/vro/train/train_part_*.parquet - split: '1000' path: 20260301/vro/samples/1000_part_*.parquet - split: '5000' path: 20260301/vro/samples/5000_part_*.parquet - split: '10000' path: 20260301/vro/samples/10000_part_*.parquet - config_name: 20260301.wo data_files: &id709 - split: train path: 20260301/wo/train/train_part_*.parquet - split: '1000' path: 20260301/wo/samples/1000_part_*.parquet - split: '5000' path: 20260301/wo/samples/5000_part_*.parquet - split: '10000' path: 20260301/wo/samples/10000_part_*.parquet - config_name: 20260301.wuu data_files: &id710 - split: train path: 20260301/wuu/train/train_part_*.parquet - split: '1000' path: 20260301/wuu/samples/1000_part_*.parquet - split: '5000' path: 20260301/wuu/samples/5000_part_*.parquet - split: '10000' path: 20260301/wuu/samples/10000_part_*.parquet - config_name: 20260301.xal data_files: &id711 - split: train path: 20260301/xal/train/train_part_*.parquet - split: '1000' path: 20260301/xal/samples/1000_part_*.parquet - split: '5000' path: 20260301/xal/samples/5000_part_*.parquet - split: '10000' path: 20260301/xal/samples/10000_part_*.parquet - config_name: 20260301.xh data_files: &id712 - split: train path: 20260301/xh/train/train_part_*.parquet - split: '1000' path: 20260301/xh/samples/1000_part_*.parquet - split: '5000' path: 20260301/xh/samples/5000_part_*.parquet - split: '10000' path: 20260301/xh/samples/10000_part_*.parquet - config_name: 20260301.xmf data_files: &id713 - split: train path: 20260301/xmf/train/train_part_*.parquet - split: '1000' path: 20260301/xmf/samples/1000_part_*.parquet - split: '5000' path: 20260301/xmf/samples/5000_part_*.parquet - split: '10000' path: 20260301/xmf/samples/10000_part_*.parquet - config_name: 20260301.yi data_files: &id714 - split: train path: 20260301/yi/train/train_part_*.parquet - split: '1000' path: 20260301/yi/samples/1000_part_*.parquet - split: '5000' path: 20260301/yi/samples/5000_part_*.parquet - split: '10000' path: 20260301/yi/samples/10000_part_*.parquet - config_name: 20260301.yo data_files: &id715 - split: train path: 20260301/yo/train/train_part_*.parquet - split: '1000' path: 20260301/yo/samples/1000_part_*.parquet - split: '5000' path: 20260301/yo/samples/5000_part_*.parquet - split: '10000' path: 20260301/yo/samples/10000_part_*.parquet - config_name: 20260301.yue data_files: &id716 - split: train path: 20260301/yue/train/train_part_*.parquet - split: '1000' path: 20260301/yue/samples/1000_part_*.parquet - split: '5000' path: 20260301/yue/samples/5000_part_*.parquet - split: '10000' path: 20260301/yue/samples/10000_part_*.parquet - config_name: 20260301.za data_files: &id717 - split: train path: 20260301/za/train/train_part_*.parquet - split: '1000' path: 20260301/za/samples/1000_part_*.parquet - split: '5000' path: 20260301/za/samples/5000_part_*.parquet - split: '10000' path: 20260301/za/samples/10000_part_*.parquet - config_name: 20260301.zea data_files: &id718 - split: train path: 20260301/zea/train/train_part_*.parquet - split: '1000' path: 20260301/zea/samples/1000_part_*.parquet - split: '5000' path: 20260301/zea/samples/5000_part_*.parquet - split: '10000' path: 20260301/zea/samples/10000_part_*.parquet - config_name: 20260301.zgh data_files: &id719 - split: train path: 20260301/zgh/train/train_part_*.parquet - split: '1000' path: 20260301/zgh/samples/1000_part_*.parquet - split: '5000' path: 20260301/zgh/samples/5000_part_*.parquet - split: '10000' path: 20260301/zgh/samples/10000_part_*.parquet - config_name: 20260301.zu data_files: &id720 - split: train path: 20260301/zu/train/train_part_*.parquet - split: '1000' path: 20260301/zu/samples/1000_part_*.parquet - split: '5000' path: 20260301/zu/samples/5000_part_*.parquet - split: '10000' path: 20260301/zu/samples/10000_part_*.parquet - config_name: 20260301.war data_files: &id708 - split: train path: 20260301/war/train/train_part_*.parquet - split: '1000' path: 20260301/war/samples/1000_part_*.parquet - split: '5000' path: 20260301/war/samples/5000_part_*.parquet - split: '10000' path: 20260301/war/samples/10000_part_*.parquet - config_name: latest.en data_files: *id362 - config_name: latest.de data_files: *id363 - config_name: latest.es data_files: *id364 - config_name: latest.fr data_files: *id365 - config_name: latest.ceb data_files: *id366 - config_name: latest.el data_files: *id367 - config_name: latest.he data_files: *id368 - config_name: latest.hu data_files: *id369 - config_name: latest.ko data_files: *id370 - config_name: latest.nl data_files: *id371 - config_name: latest.pl data_files: *id372 - config_name: latest.pt data_files: *id373 - config_name: latest.sr data_files: *id374 - config_name: latest.sv data_files: *id375 - config_name: latest.tr data_files: *id376 - config_name: latest.uk data_files: *id377 - config_name: latest.vi data_files: *id378 - config_name: latest.zh data_files: *id379 - config_name: latest.th data_files: *id380 - config_name: latest.ar data_files: *id381 - config_name: latest.ja data_files: *id382 - config_name: latest.ru data_files: *id383 - config_name: latest.cho data_files: *id384 - config_name: latest.chy data_files: *id385 - config_name: latest.cr data_files: *id386 - config_name: latest.ace data_files: *id387 - config_name: latest.ak data_files: *id388 - config_name: latest.as data_files: *id389 - config_name: latest.atj data_files: *id390 - config_name: latest.bh data_files: *id391 - config_name: latest.bn data_files: *id392 - config_name: latest.chr data_files: *id393 - config_name: latest.eo data_files: *id394 - config_name: latest.gpe data_files: *id395 - config_name: latest.hyw data_files: *id396 - config_name: latest.aa data_files: *id397 - config_name: latest.ab data_files: *id398 - config_name: latest.ady data_files: *id399 - config_name: latest.af data_files: *id400 - config_name: latest.alt data_files: *id401 - config_name: latest.am data_files: *id402 - config_name: latest.ami data_files: *id403 - config_name: latest.an data_files: *id404 - config_name: latest.ang data_files: *id405 - config_name: latest.ann data_files: *id406 - config_name: latest.anp data_files: *id407 - config_name: latest.arc data_files: *id408 - config_name: latest.ary data_files: *id409 - config_name: latest.ast data_files: *id410 - config_name: latest.av data_files: *id411 - config_name: latest.avk data_files: *id412 - config_name: latest.awa data_files: *id413 - config_name: latest.ay data_files: *id414 - config_name: latest.az data_files: *id415 - config_name: latest.azb data_files: *id416 - config_name: latest.ba data_files: *id417 - config_name: latest.ban data_files: *id418 - config_name: latest.bar data_files: *id419 - config_name: latest.bbc data_files: *id420 - config_name: latest.bcl data_files: *id421 - config_name: latest.bdr data_files: *id422 - config_name: latest.be data_files: *id423 - config_name: latest.be-tarask data_files: *id424 - config_name: latest.bew data_files: *id425 - config_name: latest.bg data_files: *id426 - config_name: latest.bi data_files: *id427 - config_name: latest.bjn data_files: *id428 - config_name: latest.blk data_files: *id429 - config_name: latest.bm data_files: *id430 - config_name: latest.bo data_files: *id431 - config_name: latest.bpy data_files: *id432 - config_name: latest.br data_files: *id433 - config_name: latest.bs data_files: *id434 - config_name: latest.btm data_files: *id435 - config_name: latest.bug data_files: *id436 - config_name: latest.bxr data_files: *id437 - config_name: latest.ca data_files: *id438 - config_name: latest.cbk-zam data_files: *id439 - config_name: latest.cdo data_files: *id440 - config_name: latest.ce data_files: *id441 - config_name: latest.ch data_files: *id442 - config_name: latest.ckb data_files: *id443 - config_name: latest.co data_files: *id444 - config_name: latest.crh data_files: *id445 - config_name: latest.cs data_files: *id446 - config_name: latest.csb data_files: *id447 - config_name: latest.cu data_files: *id448 - config_name: latest.cv data_files: *id449 - config_name: latest.cy data_files: *id450 - config_name: latest.da data_files: *id451 - config_name: latest.dag data_files: *id452 - config_name: latest.dga data_files: *id453 - config_name: latest.din data_files: *id454 - config_name: latest.diq data_files: *id455 - config_name: latest.dsb data_files: *id456 - config_name: latest.dtp data_files: *id457 - config_name: latest.dty data_files: *id458 - config_name: latest.dv data_files: *id459 - config_name: latest.dz data_files: *id460 - config_name: latest.ee data_files: *id461 - config_name: latest.eml data_files: *id462 - config_name: latest.et data_files: *id463 - config_name: latest.eu data_files: *id464 - config_name: latest.ext data_files: *id465 - config_name: latest.fa data_files: *id466 - config_name: latest.fat data_files: *id467 - config_name: latest.ff data_files: *id468 - config_name: latest.fi data_files: *id469 - config_name: latest.fj data_files: *id470 - config_name: latest.fo data_files: *id471 - config_name: latest.fon data_files: *id472 - config_name: latest.frp data_files: *id473 - config_name: latest.frr data_files: *id474 - config_name: latest.fur data_files: *id475 - config_name: latest.fy data_files: *id476 - config_name: latest.ga data_files: *id477 - config_name: latest.gag data_files: *id478 - config_name: latest.gan data_files: *id479 - config_name: latest.gcr data_files: *id480 - config_name: latest.gd data_files: *id481 - config_name: latest.gl data_files: *id482 - config_name: latest.glk data_files: *id483 - config_name: latest.gn data_files: *id484 - config_name: latest.gom data_files: *id485 - config_name: latest.gor data_files: *id486 - config_name: latest.got data_files: *id487 - config_name: latest.gsw data_files: *id488 - config_name: latest.gu data_files: *id489 - config_name: latest.guc data_files: *id490 - config_name: latest.gur data_files: *id491 - config_name: latest.guw data_files: *id492 - config_name: latest.gv data_files: *id493 - config_name: latest.ha data_files: *id494 - config_name: latest.hak data_files: *id495 - config_name: latest.haw data_files: *id496 - config_name: latest.hi data_files: *id497 - config_name: latest.hif data_files: *id498 - config_name: latest.ho data_files: *id499 - config_name: latest.hr data_files: *id500 - config_name: latest.hsb data_files: *id501 - config_name: latest.ht data_files: *id502 - config_name: latest.hy data_files: *id503 - config_name: latest.hz data_files: *id504 - config_name: latest.ia data_files: *id505 - config_name: latest.iba data_files: *id506 - config_name: latest.id data_files: *id507 - config_name: latest.ie data_files: *id508 - config_name: latest.ig data_files: *id509 - config_name: latest.igl data_files: *id510 - config_name: latest.ii data_files: *id511 - config_name: latest.ik data_files: *id512 - config_name: latest.ilo data_files: *id513 - config_name: latest.inh data_files: *id514 - config_name: latest.io data_files: *id515 - config_name: latest.is data_files: *id516 - config_name: latest.it data_files: *id517 - config_name: latest.iu data_files: *id518 - config_name: latest.jam data_files: *id519 - config_name: latest.jbo data_files: *id520 - config_name: latest.jv data_files: *id521 - config_name: latest.ka data_files: *id522 - config_name: latest.kaa data_files: *id523 - config_name: latest.kab data_files: *id524 - config_name: latest.kaj data_files: *id525 - config_name: latest.kbd data_files: *id526 - config_name: latest.kbp data_files: *id527 - config_name: latest.kcg data_files: *id528 - config_name: latest.kg data_files: *id529 - config_name: latest.kge data_files: *id530 - config_name: latest.ki data_files: *id531 - config_name: latest.kj data_files: *id532 - config_name: latest.kk data_files: *id533 - config_name: latest.kl data_files: *id534 - config_name: latest.km data_files: *id535 - config_name: latest.kn data_files: *id536 - config_name: latest.knc data_files: *id537 - config_name: latest.koi data_files: *id538 - config_name: latest.kr data_files: *id539 - config_name: latest.krc data_files: *id540 - config_name: latest.ks data_files: *id541 - config_name: latest.ksh data_files: *id542 - config_name: latest.ku data_files: *id543 - config_name: latest.kus data_files: *id544 - config_name: latest.kv data_files: *id545 - config_name: latest.kw data_files: *id546 - config_name: latest.ky data_files: *id547 - config_name: latest.la data_files: *id548 - config_name: latest.lad data_files: *id549 - config_name: latest.lb data_files: *id550 - config_name: latest.lbe data_files: *id551 - config_name: latest.lez data_files: *id552 - config_name: latest.lfn data_files: *id553 - config_name: latest.lg data_files: *id554 - config_name: latest.li data_files: *id555 - config_name: latest.lij data_files: *id556 - config_name: latest.lld data_files: *id557 - config_name: latest.lmo data_files: *id558 - config_name: latest.ln data_files: *id559 - config_name: latest.lo data_files: *id560 - config_name: latest.lrc data_files: *id561 - config_name: latest.lt data_files: *id562 - config_name: latest.ltg data_files: *id563 - config_name: latest.lv data_files: *id564 - config_name: latest.lzh data_files: *id565 - config_name: latest.mad data_files: *id566 - config_name: latest.mai data_files: *id567 - config_name: latest.map-bms data_files: *id568 - config_name: latest.mdf data_files: *id569 - config_name: latest.mg data_files: *id570 - config_name: latest.mh data_files: *id571 - config_name: latest.mhr data_files: *id572 - config_name: latest.mi data_files: *id573 - config_name: latest.min data_files: *id574 - config_name: latest.mk data_files: *id575 - config_name: latest.ml data_files: *id576 - config_name: latest.mn data_files: *id577 - config_name: latest.mni data_files: *id578 - config_name: latest.mnw data_files: *id579 - config_name: latest.mos data_files: *id580 - config_name: latest.mr data_files: *id581 - config_name: latest.mrj data_files: *id582 - config_name: latest.ms data_files: *id583 - config_name: latest.mt data_files: *id584 - config_name: latest.mus data_files: *id585 - config_name: latest.mwl data_files: *id586 - config_name: latest.my data_files: *id587 - config_name: latest.myv data_files: *id588 - config_name: latest.mzn data_files: *id589 - config_name: latest.na data_files: *id590 - config_name: latest.nah data_files: *id591 - config_name: latest.nan data_files: *id592 - config_name: latest.nap data_files: *id593 - config_name: latest.nds data_files: *id594 - config_name: latest.nds-nl data_files: *id595 - config_name: latest.ne data_files: *id596 - config_name: latest.new data_files: *id597 - config_name: latest.ng data_files: *id598 - config_name: latest.nia data_files: *id599 - config_name: latest.nn data_files: *id600 - config_name: latest.no data_files: *id601 - config_name: latest.nov data_files: *id602 - config_name: latest.nqo data_files: *id603 - config_name: latest.nr data_files: *id604 - config_name: latest.nrm data_files: *id605 - config_name: latest.nso data_files: *id606 - config_name: latest.nup data_files: *id607 - config_name: latest.nv data_files: *id608 - config_name: latest.ny data_files: *id609 - config_name: latest.oc data_files: *id610 - config_name: latest.olo data_files: *id611 - config_name: latest.om data_files: *id612 - config_name: latest.or data_files: *id613 - config_name: latest.os data_files: *id614 - config_name: latest.pa data_files: *id615 - config_name: latest.pag data_files: *id616 - config_name: latest.pam data_files: *id617 - config_name: latest.pap data_files: *id618 - config_name: latest.pcd data_files: *id619 - config_name: latest.pcm data_files: *id620 - config_name: latest.pdc data_files: *id621 - config_name: latest.pfl data_files: *id622 - config_name: latest.pih data_files: *id623 - config_name: latest.ps data_files: *id624 - config_name: latest.rki data_files: *id625 - config_name: latest.tn data_files: *id626 - config_name: latest.arz data_files: *id627 - config_name: latest.pi data_files: *id628 - config_name: latest.pms data_files: *id629 - config_name: latest.pnb data_files: *id630 - config_name: latest.pnt data_files: *id631 - config_name: latest.pwn data_files: *id632 - config_name: latest.qu data_files: *id633 - config_name: latest.rm data_files: *id634 - config_name: latest.rmy data_files: *id635 - config_name: latest.rn data_files: *id636 - config_name: latest.ro data_files: *id637 - config_name: latest.roa-tara data_files: *id638 - config_name: latest.rsk data_files: *id639 - config_name: latest.rue data_files: *id640 - config_name: latest.rup data_files: *id641 - config_name: latest.rw data_files: *id642 - config_name: latest.sa data_files: *id643 - config_name: latest.sah data_files: *id644 - config_name: latest.sat data_files: *id645 - config_name: latest.sc data_files: *id646 - config_name: latest.scn data_files: *id647 - config_name: latest.sco data_files: *id648 - config_name: latest.sd data_files: *id649 - config_name: latest.se data_files: *id650 - config_name: latest.sg data_files: *id651 - config_name: latest.sgs data_files: *id652 - config_name: latest.sh data_files: *id653 - config_name: latest.shi data_files: *id654 - config_name: latest.shn data_files: *id655 - config_name: latest.si data_files: *id656 - config_name: latest.simple data_files: *id657 - config_name: latest.sk data_files: *id658 - config_name: latest.skr data_files: *id659 - config_name: latest.sl data_files: *id660 - config_name: latest.sm data_files: *id661 - config_name: latest.smn data_files: *id662 - config_name: latest.sn data_files: *id663 - config_name: latest.so data_files: *id664 - config_name: latest.sq data_files: *id665 - config_name: latest.srn data_files: *id666 - config_name: latest.ss data_files: *id667 - config_name: latest.st data_files: *id668 - config_name: latest.stq data_files: *id669 - config_name: latest.su data_files: *id670 - config_name: latest.sw data_files: *id671 - config_name: latest.syl data_files: *id672 - config_name: latest.szl data_files: *id673 - config_name: latest.szy data_files: *id674 - config_name: latest.ta data_files: *id675 - config_name: latest.tay data_files: *id676 - config_name: latest.tcy data_files: *id677 - config_name: latest.tdd data_files: *id678 - config_name: latest.te data_files: *id679 - config_name: latest.tet data_files: *id680 - config_name: latest.tg data_files: *id681 - config_name: latest.ti data_files: *id682 - config_name: latest.tig data_files: *id683 - config_name: latest.tk data_files: *id684 - config_name: latest.tl data_files: *id685 - config_name: latest.tly data_files: *id686 - config_name: latest.to data_files: *id687 - config_name: latest.tok data_files: *id688 - config_name: latest.tpi data_files: *id689 - config_name: latest.trv data_files: *id690 - config_name: latest.ts data_files: *id691 - config_name: latest.tt data_files: *id692 - config_name: latest.tum data_files: *id693 - config_name: latest.tw data_files: *id694 - config_name: latest.ty data_files: *id695 - config_name: latest.tyv data_files: *id696 - config_name: latest.udm data_files: *id697 - config_name: latest.ug data_files: *id698 - config_name: latest.ur data_files: *id699 - config_name: latest.uz data_files: *id700 - config_name: latest.ve data_files: *id701 - config_name: latest.vec data_files: *id702 - config_name: latest.vep data_files: *id703 - config_name: latest.vls data_files: *id704 - config_name: latest.vo data_files: *id705 - config_name: latest.vro data_files: *id706 - config_name: latest.wa data_files: *id707 - config_name: latest.war data_files: *id708 - config_name: latest.wo data_files: *id709 - config_name: latest.wuu data_files: *id710 - config_name: latest.xal data_files: *id711 - config_name: latest.xh data_files: *id712 - config_name: latest.xmf data_files: *id713 - config_name: latest.yi data_files: *id714 - config_name: latest.yo data_files: *id715 - config_name: latest.yue data_files: *id716 - config_name: latest.za data_files: *id717 - config_name: latest.zea data_files: *id718 - config_name: latest.zgh data_files: *id719 - config_name: latest.zu data_files: *id720 - config_name: latest.ppl data_files: *id721 - config_name: latest.kai data_files: *id722 license: cc-by-sa-4.0 tags: - multilingual - wikipedia - 100K<n<1M - 10K<n<100K - 10M<n<100M - 1K<n<10K - 1M<n<10M - n<1K - text-generation task_categories: - text-generation language: - ab - ace - ady - af - ak - als - alt - am - ami - an - ang - ann - anp - ar - arc - ary - arz - as - ast - atj - av - avk - awa - ay - az - azb - ba - ban - bar - bbc - bcl - bdr - be - bew - bg - bh - bi - bjn - blk - bm - bn - bo - bpy - br - bs - btm - bug - bxr - ca - cdo - ce - ceb - ch - cho - chr - chy - ckb - co - cr - crh - cs - csb - cu - cv - cy - da - dag - de - dga - din - diq - dsb - dtp - dty - dv - dz - ee - el - eml - en - eo - es - et - eu - ext - fa - fat - ff - fi - fj - fo - fon - fr - frp - frr - fur - fy - ga - gag - gan - gcr - gd - gl - glk - gn - gom - gor - got - gpe - gu - guc - gur - guw - gv - ha - hak - haw - he - hi - hif - ho - hr - hsb - ht - hu - hy - hyw - ia - iba - id - ie - ig - igl - ii - ik - ilo - inh - io - is - it - iu - ja - jam - jbo - jv - ka - kaa - kab - kbd - kbp - kcg - kg - kge - ki - kj - kk - kl - km - kn - knc - ko - koi - krc - ks - ksh - ku - kus - kv - kw - ky - la - lad - lb - lbe - lez - lfn - lg - li - lij - lld - lmo - ln - lo - lrc - lt - ltg - lv - mad - mai - mdf - mg - mh - mhr - mi - min - mk - ml - mn - mni - mnw - mos - mr - mrj - ms - mt - mus - mwl - my - myv - mzn - nah - nap - nds - ne - new - ng - nia - nl - nn - 'no' - nov - nqo - nr - nrm - nso - nup - nv - ny - oc - olo - om - or - os - pa - pag - pam - pap - pcd - pcm - pdc - pfl - pi - pih - pl - pms - pnb - pnt - ps - pt - pwn - qu - rm - rmy - rn - ro - rsk - ru - rue - rw - sa - sah - sat - sc - scn - sco - sd - se - sg - sh - shi - shn - si - sk - skr - sl - sm - smn - sn - so - sq - sr - srn - ss - st - stq - su - sv - sw - syl - szl - szy - ta - tay - tcy - tdd - te - tet - tg - th - ti - tig - tk - tl - tly - tn - to - tpi - tr - trv - ts - tt - tum - tw - ty - tyv - udm - ug - uk - ur - uz - ve - vec - vep - vi - vls - vo - wa - war - wo - wuu - xal - xh - xmf - yi - yo - za - zea - zgh - zh - zu - rki - aa - gsw - hz - kr - lzh - na - nan - rup - sgs - tok - vro - yue - kaj - ppl - kai --- # 🚀 Wikipedia Monthly *Last updated: March 14, 2026, 21:06 UTC* This repository provides **monthly, multilingual dumps of Wikipedia**, processed and prepared for easy use in NLP projects. ## 📊 Current Statistics | Metric | Current Export (March 2026) | All Exports (Total) | |--------|------------|----------| | **Languages** | 343 | 361 | | **Articles** | 62.8M | 62.8M | ## Usage Load any language with a single line of code using 🤗 `datasets`. `latest` always refers to the most recent dump, while dated configs refer to specific dumps, starting from `20250901`. ```python from datasets import load_dataset # Load the English dataset from the latest dump dataset = load_dataset("omarkamali/wikipedia-monthly", "latest.en", split="train", streaming=True) ``` 🆕 **Using Wikisets** Create your own Wikipedia-based dataset with efficient sampling, filtering, and more with [Wikisets](https://github.com/omarkamali/wikisets). ```python from wikisets import Wikiset, WikisetConfig # Create a multi-language dataset config = WikisetConfig( languages=[ {"lang": "en", "size": 10000}, # 10k sample {"lang": "fr", "size": "50%"}, # 50% of French Wikipedia {"lang": "ar", "size": 0.1}, # 10% of Arabic Wikipedia ], date="20251101", # optional, defaults to latest seed=42 ) dataset = Wikiset.create(config) # Access like any HuggingFace dataset print(len(dataset)) print(dataset[0]) # {"id": "123", "url": "https://en.wikipedia.org/wiki/Example", "title": "Example", "text": "Example text"} ``` --- ## Data Fields Each row in the dataset corresponds to a single Wikipedia article and contains the following fields: * `id`: The unique Wikipedia page ID (`string`). * `url`: The URL to the live article (`string`). * `title`: The title of the article (`string`). * `text`: The clean, plain text content of the article (`string`). --- ## Why Use This Dataset? 1. **Freshness**: We run our pipeline monthly to capture the latest versions of all articles. 2. **Clean & Ready**: We handle the messy parts of parsing MediaWiki markup. You get clean plain text ready for use. 3. **Easy Access**: Load any language with a single line of code using 🤗 `datasets`. [Learn about the Wikipedia Monthly project in this blog post](https://omarkama.li/blog/wikipedia-monthly-fresh-clean-dumps-nlp-ai-research). --- ## 🌍 Language Subsets This dataset is organized into configurations, one for each language dump. The table below lists all available subsets. For new languages, the article count will show as "Processing..." until the first full run is complete. | Language Code | Language | Date of last export | Articles | Size | |---|---|---|---|---| | `aa` | Afar | 2026-03-01 | N/A | N/A | | `ab` | Abkhazian | 2026-03-01 | 6.5K | — | | `ace` | Acehnese | 2026-03-01 | 13.1K | — | | `ady` | Adyghe | 2026-03-01 | 790 | — | | `af` | Afrikaans | 2026-03-01 | 128.2K | — | | `ak` | Akan | 2026-03-01 | 1 | — | | `alt` | Southern Altai | 2026-03-01 | 1.1K | — | | `am` | Amharic | 2026-03-01 | 14.3K | — | | `ami` | Amis | 2026-03-01 | 1.9K | — | | `an` | Aragonese | 2026-03-01 | 55.7K | — | | `ang` | Old English | 2026-03-01 | 5.3K | — | | `ann` | Obolo | 2026-03-01 | 491 | — | | `anp` | Angika | 2026-03-01 | 3.2K | — | | `ar` | Arabic | 2026-03-01 | 1.3M | — | | `arc` | Aramaic | 2026-03-01 | 2.0K | — | | `ary` | Moroccan Arabic | 2026-03-01 | 11.2K | — | | `arz` | Egyptian Arabic | 2026-03-01 | 1.6M | — | | `as` | Assamese | 2026-03-01 | 22.4K | — | | `ast` | Asturian | 2026-03-01 | 138.9K | — | | `atj` | Atikamekw | 2026-03-01 | 2.1K | — | | `av` | Avaric | 2026-03-01 | 4.1K | — | | `avk` | Kotava | 2026-03-01 | 29.8K | — | | `awa` | Awadhi | 2026-03-01 | 3.8K | — | | `ay` | Aymara | 2026-03-01 | 5.4K | — | | `az` | Azerbaijani | 2026-03-01 | 212.2K | — | | `azb` | South Azerbaijani | 2026-03-01 | 244.7K | — | | `ba` | Bashkir | 2026-03-01 | 63.9K | — | | `ban` | Balinese | 2026-03-01 | 36.0K | — | | `bar` | Bavarian | 2026-03-01 | 27.3K | — | | `bbc` | Batak Toba | 2026-03-01 | 1.5K | — | | `bcl` | Central Bikol | 2026-03-01 | 21.8K | — | | `bdr` | West Coast Bajau | 2026-03-01 | 670 | — | | `be` | Belarusian | 2026-03-01 | 261.7K | — | | `be-tarask` | Belarusian (Taraškievica) | 2026-03-01 | N/A | N/A | | `bew` | Betawi | 2026-03-01 | 3.4K | — | | `bg` | Bulgarian | 2026-03-01 | 308.1K | — | | `bh` | Bihari languages | 2026-03-01 | 9.0K | — | | `bi` | Bislama | 2026-03-01 | 1.6K | — | | `bjn` | Banjar | 2026-03-01 | 11.7K | — | | `blk` | Pa'o Karen | 2026-03-01 | 3.3K | — | | `bm` | Bambara | 2026-03-01 | 1.2K | — | | `bn` | Bengali | 2026-03-01 | 184.6K | — | | `bo` | Tibetan | 2026-03-01 | 15.0K | — | | `bpy` | Bishnupriya | 2026-03-01 | 25.2K | — | | `br` | Breton | 2026-03-01 | 90.9K | — | | `bs` | Bosnian | 2026-03-01 | 30.0K | — | | `btm` | Batak Mandailing | 2026-03-01 | 1.4K | — | | `bug` | Buginese | 2026-03-01 | 16.0K | — | | `bxr` | Russia Buriat | 2026-03-01 | 2.9K | — | | `ca` | Catalan | 2026-03-01 | 792.3K | — | | `cbk-zam` | Chavacano | 2026-03-01 | N/A | N/A | | `cdo` | Min Dong Chinese | 2026-03-01 | 16.7K | — | | `ce` | Chechen | 2026-03-01 | 818.1K | — | | `ceb` | Cebuano | 2026-03-01 | 6.1M | — | | `ch` | Chamorro | 2026-03-01 | 607 | — | | `cho` | Choctaw | 2026-03-01 | 13 | — | | `chr` | Cherokee | 2026-03-01 | 1.0K | — | | `chy` | Cheyenne | 2026-03-01 | 824 | — | | `ckb` | Central Kurdish | 2026-03-01 | 81.6K | — | | `co` | Corsican | 2026-03-01 | 8.7K | — | | `cr` | Cree | 2026-03-01 | 1 | — | | `crh` | Crimean Tatar | 2026-03-01 | 29.7K | — | | `cs` | Czech | 2026-03-01 | 587.6K | — | | `csb` | Kashubian | 2026-03-01 | 5.5K | — | | `cu` | Church Slavic | 2026-03-01 | 1.4K | — | | `cv` | Chuvash | 2026-03-01 | 59.0K | — | | `cy` | Welsh | 2026-03-01 | 284.0K | — | | `da` | Danish | 2026-03-01 | 313.2K | — | | `dag` | Dagbani | 2026-03-01 | 15.3K | — | | `de` | German | 2026-03-01 | 3.1M | — | | `dga` | Southern Dagaare | 2026-03-01 | 4.0K | — | | `din` | Dinka | 2026-03-01 | 461 | — | | `diq` | Dimli (individual language) | 2026-03-01 | 42.7K | — | | `dsb` | Lower Sorbian | 2026-03-01 | 3.5K | — | | `dtp` | Central Dusun | 2026-03-01 | 2.0K | — | | `dty` | Dotyali | 2026-03-01 | 3.9K | — | | `dv` | Divehi | 2026-03-01 | 4.6K | — | | `dz` | Dzongkha | 2026-03-01 | 1.3K | — | | `ee` | Ewe | 2026-03-01 | 1.5K | — | | `el` | Greek | 2026-03-01 | 266.1K | — | | `eml` | Modenese | 2026-03-01 | 13.3K | — | | `en` | English | 2026-03-01 | 7.2M | — | | `eo` | Esperanto | 2026-03-01 | 382.4K | — | | `es` | Spanish | 2026-03-01 | 2.0M | — | | `et` | Estonian | 2026-03-01 | 258.3K | — | | `eu` | Basque | 2026-03-01 | 471.6K | — | | `ext` | Extremaduran | 2026-03-01 | 4.3K | — | | `fa` | Persian | 2026-03-01 | 840.0K | — | | `fat` | Fanti | 2026-03-01 | 2.2K | — | | `ff` | Fula | 2026-03-01 | 26.2K | — | | `fi` | Finnish | 2026-03-01 | 560.0K | — | | `fj` | Fijian | 2026-03-01 | 1.7K | — | | `fo` | Faroese | 2026-03-01 | 14.2K | — | | `fon` | Fon | 2026-03-01 | 3.8K | — | | `fr` | French | 2026-03-01 | 2.7M | — | | `frp` | Franco-Provençal (Arpitan) | 2026-03-01 | 5.9K | — | | `frr` | Northern Frisian | 2026-03-01 | 20.8K | — | | `fur` | Friulian | 2026-03-01 | 5.0K | — | | `fy` | Western Frisian | 2026-03-01 | 59.4K | — | | `ga` | Irish | 2026-03-01 | 63.0K | — | | `gag` | Gagauz | 2026-03-01 | 3.2K | — | | `gan` | Gan Chinese | 2026-03-01 | 6.9K | — | | `gcr` | Guianese Creole French | 2026-03-01 | 2.4K | — | | `gd` | Scottish Gaelic | 2026-03-01 | 16.1K | — | | `gl` | Galician | 2026-03-01 | 230.0K | — | | `glk` | Gilaki | 2026-03-01 | 48.6K | — | | `gn` | Guarani | 2026-03-01 | 6.0K | — | | `gom` | Goan Konkani | 2026-03-01 | 4.3K | — | | `gor` | Gorontalo | 2026-03-01 | 15.8K | — | | `got` | Gothic | 2026-03-01 | 1.1K | — | | `gpe` | Ghanaian Pidgin English | 2026-03-01 | 4.8K | — | | `gsw` | Swiss German | 2026-03-01 | N/A | N/A | | `gu` | Gujarati | 2026-03-01 | 30.9K | — | | `guc` | Wayuu | 2026-03-01 | 921 | — | | `gur` | Frafra | 2026-03-01 | 1.6K | — | | `guw` | Gun | 2026-03-01 | 1.7K | — | | `gv` | Manx | 2026-03-01 | 7.1K | — | | `ha` | Hausa | 2026-03-01 | 94.0K | — | | `hak` | Hakka Chinese | 2026-03-01 | 10.5K | — | | `haw` | Hawaiian | 2026-03-01 | 3.1K | — | | `he` | Hebrew | 2026-03-01 | 381.1K | — | | `hi` | Hindi | 2026-03-01 | 171.3K | — | | `hif` | Fiji Hindi | 2026-03-01 | 12.4K | — | | `ho` | Hiri Motu | 2026-03-01 | 3 | — | | `hr` | Croatian | 2026-03-01 | 70.0K | — | | `hsb` | Upper Sorbian | 2026-03-01 | 14.3K | — | | `ht` | Haitian Creole | 2026-03-01 | 73.2K | — | | `hu` | Hungarian | 2026-03-01 | 567.0K | — | | `hy` | Armenian | 2026-03-01 | 100.0K | — | | `hyw` | Western Armenian | 2026-03-01 | 13.6K | — | | `hz` | Herero | 2026-03-01 | N/A | N/A | | `ia` | Interlingua | 2026-03-01 | 30.5K | — | | `iba` | Iban | 2026-03-01 | 2.3K | — | | `id` | Indonesian | 2026-03-01 | 761.4K | — | | `ie` | Interlingue | 2026-03-01 | 13.6K | — | | `ig` | Igbo | 2026-03-01 | 52.0K | — | | `igl` | Igala | 2026-03-01 | 1.2K | — | | `ii` | Sichuan Yi | 2026-03-01 | 14 | — | | `ik` | Inupiaq | 2026-03-01 | 839 | — | | `ilo` | Iloko | 2026-03-01 | 15.4K | — | | `inh` | Ingush | 2026-03-01 | 2.4K | — | | `io` | Ido | 2026-03-01 | 61.6K | — | | `is` | Icelandic | 2026-03-01 | 61.3K | — | | `it` | Italian | 2026-03-01 | 580.0K | — | | `iu` | Inuktitut | 2026-03-01 | 550 | — | | `ja` | Japanese | 2026-03-01 | 1.5M | — | | `jam` | Jamaican Creole English | 2026-03-01 | 1.8K | — | | `jbo` | Lojban | 2026-03-01 | 1.4K | — | | `jv` | Javanese | 2026-03-01 | 75.6K | — | | `ka` | Georgian | 2026-03-01 | 191.7K | — | | `kaa` | Kara-Kalpak | 2026-03-01 | 11.5K | — | | `kab` | Kabyle | 2026-03-01 | 6.2K | — | | `kai` | Karekare | 2026-03-01 | N/A | N/A | | `kaj` | Jju | 2026-03-01 | 998 | — | | `kbd` | Kabardian | 2026-03-01 | 1.7K | — | | `kbp` | Kabiyè | 2026-03-01 | 2.0K | — | | `kcg` | Tyap | 2026-03-01 | 1.8K | — | | `kg` | Kongo | 2026-03-01 | 2.0K | — | | `kge` | Komering | 2026-03-01 | 3.0K | — | | `ki` | Kikuyu | 2026-03-01 | 2.4K | — | | `kj` | Kuanyama | 2026-03-01 | 5 | — | | `kk` | Kazakh | 2026-03-01 | 245.8K | — | | `kl` | Kalaallisut | 2026-03-01 | 1 | — | | `km` | Khmer | 2026-03-01 | 13.6K | — | | `kn` | Kannada | 2026-03-01 | 35.8K | — | | `knc` | Central Kanuri | 2026-03-01 | 2.2K | — | | `ko` | Korean | 2026-03-01 | 738.9K | — | | `koi` | Komi-Permyak | 2026-03-01 | 3.5K | — | | `kr` | Kanuri | 2026-03-01 | N/A | N/A | | `krc` | Karachay-Balkar | 2026-03-01 | 2.8K | — | | `ks` | Kashmiri | 2026-03-01 | 8.9K | — | | `ksh` | Colognian | 2026-03-01 | 3.1K | — | | `ku` | Kurdish | 2026-03-01 | 91.1K | — | | `kus` | Kusaal | 2026-03-01 | 1.6K | — | | `kv` | Komi | 2026-03-01 | 6.1K | — | | `kw` | Cornish | 2026-03-01 | 7.2K | — | | `ky` | Kyrgyz | 2026-03-01 | 76.6K | — | | `la` | Latin | 2026-03-01 | 141.1K | — | | `lad` | Ladino | 2026-03-01 | 3.9K | — | | `lb` | Luxembourgish | 2026-03-01 | 66.7K | — | | `lbe` | Lak | 2026-03-01 | 1.1K | — | | `lez` | Lezghian | 2026-03-01 | 4.4K | — | | `lfn` | Lingua Franca Nova | 2026-03-01 | 5.1K | — | | `lg` | Ganda | 2026-03-01 | 5.9K | — | | `li` | Limburgish | 2026-03-01 | 15.2K | — | | `lij` | Ligurian | 2026-03-01 | 11.5K | — | | `lld` | Ladin | 2026-03-01 | 180.9K | — | | `lmo` | Lombard | 2026-03-01 | 80.0K | — | | `ln` | Lingala | 2026-03-01 | 5.2K | — | | `lo` | Lao | 2026-03-01 | 5.9K | — | | `lrc` | Northern Luri | 2026-03-01 | 1 | — | | `lt` | Lithuanian | 2026-03-01 | 222.7K | — | | `ltg` | Latgalian | 2026-03-01 | 1.1K | — | | `lv` | Latvian | 2026-03-01 | 141.5K | — | | `lzh` | Literary Chinese | 2026-03-01 | N/A | N/A | | `mad` | Madurese | 2026-03-01 | 6.6K | — | | `mai` | Maithili | 2026-03-01 | 15.1K | — | | `map-bms` | Banyumasan | 2026-03-01 | N/A | N/A | | `mdf` | Moksha | 2026-03-01 | 7.7K | — | | `mg` | Malagasy | 2026-03-01 | 102.4K | — | | `mh` | Marshallese | 2026-03-01 | 8 | — | | `mhr` | Eastern Mari | 2026-03-01 | 11.4K | — | | `mi` | Māori | 2026-03-01 | 8.1K | — | | `min` | Minangkabau | 2026-03-01 | 229.3K | — | | `mk` | Macedonian | 2026-03-01 | 159.4K | — | | `ml` | Malayalam | 2026-03-01 | 88.7K | — | | `mn` | Mongolian | 2026-03-01 | 30.1K | — | | `mni` | Manipuri | 2026-03-01 | 11.1K | — | | `mnw` | Mon | 2026-03-01 | 3.4K | — | | `mos` | Mossi | 2026-03-01 | 1.7K | — | | `mr` | Marathi | 2026-03-01 | 101.7K | — | | `mrj` | Western Mari | 2026-03-01 | 10.5K | — | | `ms` | Malay | 2026-03-01 | 437.5K | — | | `mt` | Maltese | 2026-03-01 | 7.7K | — | | `mus` | Muscogee | 2026-03-01 | 2 | — | | `mwl` | Mirandese | 2026-03-01 | 4.5K | — | | `my` | Burmese | 2026-03-01 | 112.3K | — | | `myv` | Erzya | 2026-03-01 | 8.1K | — | | `mzn` | Mazanderani | 2026-03-01 | 66.6K | — | | `na` | Nauru | 2026-03-01 | N/A | N/A | | `nah` | Nahuatl languages | 2026-03-01 | 4.5K | — | | `nan` | Min Nan Chinese | 2026-03-01 | N/A | N/A | | `nap` | Neapolitan | 2026-03-01 | 15.0K | — | | `nds` | Low German | 2026-03-01 | 85.8K | — | | `nds-nl` | Low Saxon (Netherlands) | 2026-03-01 | N/A | N/A | | `ne` | Nepali | 2026-03-01 | 29.8K | — | | `new` | Newari | 2026-03-01 | 73.8K | — | | `ng` | Ndonga | 2026-03-01 | 18 | — | | `nia` | Nias | 2026-03-01 | 1.8K | — | | `nl` | Dutch | 2026-03-01 | 2.2M | — | | `nn` | Norwegian Nynorsk | 2026-03-01 | 177.4K | — | | `no` | Norwegian | 2026-03-01 | 470.0K | — | | `nov` | Novial | 2026-03-01 | 2.2K | — | | `nqo` | N’Ko | 2026-03-01 | 1.7K | — | | `nr` | South Ndebele | 2026-03-01 | 549 | — | | `nrm` | Narom | 2026-03-01 | 5.1K | — | | `nso` | Northern Sotho | 2026-03-01 | 9.1K | — | | `nup` | Nupe-Nupe-Tako | 2026-03-01 | 1.3K | — | | `nv` | Navajo | 2026-03-01 | 22.5K | — | | `ny` | Nyanja | 2026-03-01 | 1.2K | — | | `oc` | Occitan | 2026-03-01 | 90.8K | — | | `olo` | Livvi | 2026-03-01 | 5.0K | — | | `om` | Oromo | 2026-03-01 | 2.4K | — | | `or` | Odia | 2026-03-01 | 20.6K | — | | `os` | Ossetic | 2026-03-01 | 21.5K | — | | `pa` | Punjabi | 2026-03-01 | 59.7K | — | | `pag` | Pangasinan | 2026-03-01 | 2.7K | — | | `pam` | Pampanga | 2026-03-01 | 10.5K | — | | `pap` | Papiamento | 2026-03-01 | 5.3K | — | | `pcd` | Picard | 2026-03-01 | 6.2K | — | | `pcm` | Nigerian Pidgin | 2026-03-01 | 1.8K | — | | `pdc` | Pennsylvania German | 2026-03-01 | 2.3K | — | | `pfl` | Palatine German | 2026-03-01 | 2.9K | — | | `pi` | Pali | 2026-03-01 | 203 | — | | `pih` | Pitcairn-Norfolk | 2026-03-01 | 1 | — | | `pl` | Polish | 2026-03-01 | 1.7M | — | | `pms` | Piedmontese | 2026-03-01 | 71.0K | — | | `pnb` | Western Panjabi | 2026-03-01 | 75.9K | — | | `pnt` | Pontic | 2026-03-01 | 577 | — | | `ppl` | Pipil | 2026-03-01 | 910 | — | | `ps` | Pashto | 2026-03-01 | 23.0K | — | | `pt` | Portuguese | 2026-03-01 | 1.2M | — | | `pwn` | Paiwan | 2026-03-01 | 454 | — | | `qu` | Quechua | 2026-03-01 | 24.7K | — | | `rki` | Rakhine | 2026-03-01 | 1.7K | — | | `rm` | Romansh | 2026-03-01 | 3.9K | — | | `rmy` | Vlax Romani | 2026-03-01 | 834 | — | | `rn` | Rundi | 2026-03-01 | 972 | — | | `ro` | Romanian | 2026-03-01 | 100.0K | — | | `roa-tara` | Tarantino | 2026-03-01 | N/A | N/A | | `rsk` | Pannonian Rusyn | 2026-03-01 | 1.2K | — | | `ru` | Russian | 2026-03-01 | 2.1M | — | | `rue` | Rusyn | 2026-03-01 | 10.2K | — | | `rup` | Aromanian | 2026-03-01 | N/A | N/A | | `rw` | Kinyarwanda | 2026-03-01 | 11.4K | — | | `sa` | Sanskrit | 2026-03-01 | 12.8K | — | | `sah` | Yakut | 2026-03-01 | 18.2K | — | | `sat` | Santali | 2026-03-01 | 15.3K | — | | `sc` | Sardinian | 2026-03-01 | 7.9K | — | | `scn` | Sicilian | 2026-03-01 | 26.4K | — | | `sco` | Scots | 2026-03-01 | 10.0K | — | | `sd` | Sindhi | 2026-03-01 | 21.3K | — | | `se` | Northern Sami | 2026-03-01 | 8.1K | — | | `sg` | Sango | 2026-03-01 | 495 | — | | `sgs` | Samogitian | 2026-03-01 | N/A | N/A | | `sh` | Serbian | 2026-03-01 | N/A | N/A | | `shi` | Tachelhit | 2026-03-01 | 11.0K | — | | `shn` | Shan | 2026-03-01 | 15.1K | — | | `si` | Sinhala | 2026-03-01 | 28.0K | — | | `simple` | Simple English | 2026-03-01 | 279.7K | — | | `sk` | Slovak | 2026-03-01 | 252.8K | — | | `skr` | Saraiki | 2026-03-01 | 24.4K | — | | `sl` | Slovenian | 2026-03-01 | 196.8K | — | | `sm` | Samoan | 2026-03-01 | 1.2K | — | | `smn` | Inari Sami | 2026-03-01 | 6.5K | — | | `sn` | Shona | 2026-03-01 | 11.9K | — | | `so` | Somali | 2026-03-01 | 11.9K | — | | `sq` | Albanian | 2026-03-01 | 114.9K | — | | `sr` | Serbian | 2026-03-01 | 750.4K | — | | `srn` | Sranan Tongo | 2026-03-01 | 1.2K | — | | `ss` | Swati | 2026-03-01 | 1.4K | — | | `st` | Southern Sotho | 2026-03-01 | 2.1K | — | | `stq` | Saterland Frisian | 2026-03-01 | 4.2K | — | | `su` | Sundanese | 2026-03-01 | 62.3K | — | | `sv` | Swedish | 2026-03-01 | 2.6M | — | | `sw` | Swahili | 2026-03-01 | 107.8K | — | | `syl` | Sylheti | 2026-03-01 | 1.1K | — | | `szl` | Silesian | 2026-03-01 | 59.5K | — | | `szy` | Sakizaya | 2026-03-01 | 5.4K | — | | `ta` | Tamil | 2026-03-01 | 182.9K | — | | `tay` | Atayal | 2026-03-01 | 2.9K | — | | `tcy` | Tulu | 2026-03-01 | 3.2K | — | | `tdd` | Tai Nüa | 2026-03-01 | 552 | — | | `te` | Telugu | 2026-03-01 | 120.9K | — | | `tet` | Tetum | 2026-03-01 | 1.5K | — | | `tg` | Tajik | 2026-03-01 | 116.9K | — | | `th` | Thai | 2026-03-01 | 180.4K | — | | `ti` | Tigrinya | 2026-03-01 | 531 | — | | `tig` | Tigre | 2026-03-01 | 373 | — | | `tk` | Turkmen | 2026-03-01 | 8.1K | — | | `tl` | Filipino | 2026-03-01 | 48.8K | — | | `tly` | Talysh | 2026-03-01 | 12.1K | — | | `tn` | Tswana | 2026-03-01 | 4.9K | — | | `to` | Tongan | 2026-03-01 | 1.9K | — | | `tok` | Toki Pona | 2026-03-01 | 3.5K | — | | `tpi` | Tok Pisin | 2026-03-01 | 1.4K | — | | `tr` | Turkish | 2026-03-01 | 670.2K | — | | `trv` | Taroko | 2026-03-01 | 2.0K | — | | `ts` | Tsonga | 2026-03-01 | 1.2K | — | | `tt` | Tatar | 2026-03-01 | 610.2K | — | | `tum` | Tumbuka | 2026-03-01 | 18.9K | — | | `tw` | Twi | 2026-03-01 | 5.5K | — | | `ty` | Tahitian | 2026-03-01 | 1.4K | — | | `tyv` | Tuvinian | 2026-03-01 | 4.2K | — | | `udm` | Udmurt | 2026-03-01 | 5.9K | — | | `ug` | Uyghur | 2026-03-01 | 10.4K | — | | `uk` | Ukrainian | 2026-03-01 | 1.4M | — | | `ur` | Urdu | 2026-03-01 | 240.4K | — | | `uz` | Uzbek | 2026-03-01 | 333.2K | — | | `ve` | Venda | 2026-03-01 | 1.1K | — | | `vec` | Venetian | 2026-03-01 | 69.6K | — | | `vep` | Veps | 2026-03-01 | 7.1K | — | | `vi` | Vietnamese | 2026-03-01 | 1.3M | — | | `vls` | West Flemish | 2026-03-01 | 8.4K | — | | `vo` | Volapük | 2026-03-01 | 48.6K | — | | `vro` | Võro | 2026-03-01 | N/A | N/A | | `wa` | Walloon | 2026-03-01 | 12.9K | — | | `war` | Waray | 2026-03-01 | 1.3M | — | | `wo` | Wolof | 2026-03-01 | 1.8K | — | | `wuu` | Wu Chinese | 2026-03-01 | 48.0K | — | | `xal` | Kalmyk | 2026-03-01 | 1.8K | — | | `xh` | Xhosa | 2026-03-01 | 2.8K | — | | `xmf` | Mingrelian | 2026-03-01 | 21.4K | — | | `yi` | Yiddish | 2026-03-01 | 15.5K | — | | `yo` | Yoruba | 2026-03-01 | 37.2K | — | | `yue` | Cantonese | 2026-03-01 | N/A | N/A | | `za` | Zhuang | 2026-03-01 | 3.1K | — | | `zea` | Zeelandic | 2026-03-01 | 7.2K | — | | `zgh` | Standard Moroccan Tamazight | 2026-03-01 | 12.1K | — | | `zh` | Chinese | 2026-03-01 | 1.5M | — | | `zu` | Zulu | 2026-03-01 | 12.7K | — | --- ## Dataset Creation Process Our pipeline is designed for transparency and robustness: 1. **Download**: We fetch the latest `pages-articles.xml.bz2` dump for each language directly from the official [Wikimedia dumps server](https://dumps.wikimedia.org/). 2. **Filter**: We stream the dump and process **only main articles** (namespace `0`), filtering out user pages, talk pages, and other metadata. 3. **Process**: Using `mwparserfromhell`, we parse the MediaWiki syntax to extract clean, readable content. 4. **Format**: We generate a plain text representation by applying additional post-processing on the output from `mwparserfromhell`. 5. **Upload**: The resulting dataset is uploaded to the Hugging Face Hub with a configuration name corresponding to the dump date and language (e.g., `20250710.en`). ## Maintainer Wikipedia Monthly is compiled, processed and published by [Omar Kamali](https://omarkama.li) based on the official Wikipedia dumps. ## License Wikipedia Monthly is built on top of the incredible work by the Wikimedia Foundation and the open-source community. All content maintains the original CC-BY-SA-4.0 license. ## Citation If you find this dataset useful, please consider citing it: ```bibtex @misc{wikipedia_kamali_2025, author = { Omar Kamali and Omneity Labs }, title = { Wikipedia Monthly }, year = { 2025 }, url = { https://huggingface.co/datasets/omarkamali/wikipedia-monthly }, doi = { 10.57967/hf/6575 }, publisher = { Hugging Face } } ```

提供机构:
wannaphong
二维码
社区交流群
二维码
科研交流群
商业服务