djstrong/oscar-small
收藏资源简介:
OSCAR(Open Super-large Crawled ALMAnaCH coRpus)是一个巨大的多语言语料库,通过对Common Crawl语料库进行语言分类和过滤获得。数据按语言分发,提供原始版本和去重版本。该数据集主要用于预训练语言模型和词表示,包含166种语言。数据集的创建使用了goclassy架构,该架构基于fastText的线性分类器,并进行了并行化处理。数据集未包含额外的注释,但可能包含个人和敏感信息,使用时需谨慎。
OSCAR (Open Super-large Crawled ALMAnaCH coRpus) is a massive multilingual corpus obtained by conducting language classification and filtering on the Common Crawl corpus. The dataset is distributed by language, with both raw and deduplicated versions available. This dataset includes 166 languages and is primarily used for pre-training language models and word representations. It was constructed using the goclassy architecture, which is based on fastText's linear classifier and has been parallelized. No additional annotations are included in this dataset; however, it may contain personal and sensitive information, requiring careful usage.
数据集概述
名称: OSCAR (Open Super-large Crawled ALMAnaCH coRpus)
类型: 多语言文本数据集
语言: 包含166种语言,如af, am, ar, arz, as, az, azb, ba, be, bg, bn, bo, br, ca, ce, ceb, ckb, cs, cv, cy, da, de, dv, el, en, eo, es, et, eu, fa, fi, fr, fy, ga, gl, gu, he, hi, hr, hu, hy, id, is, it, ja, ka, kk, km, kn, ko, ku, ky, la, lb, lo, lt, lv, mg, mhr, mk, ml, mn, mr, ms, mt, my, nds, ne, nl, nn, no, or, os, pa, pl, pnb, ps, pt, ro, ru, sa, sah, sd, sh, si, sk, sl, sq, sr, sv, sw, ta, te, tg, th, tk, tl, tr, tt, ug, uk, ur, uz, vi, yi, zh等。
来源: 通过语言分类和过滤Common Crawl数据集构建。
用途: 主要用于预训练语言模型和词表示。
许可证: CC0-1.0
数据集结构
- 数据实例: 数据集由多个语言的文本文件组成,每个文件包含多个网站的纯文本及其元数据头。
- 数据字段: 包括原始文本和元数据信息。
- 数据分割: 数据集被分割成多个分片并压缩。
数据集创建
- 筛选理由: 使用goclassy架构从Common Crawl中提取和分类数据,以支持多语言应用。
- 源数据: 从Common Crawl的WET文件中提取,使用2018年11月的快照,超过20TB未压缩数据。
- 注释: 数据集不包含额外注释。
- 个人和敏感信息: 可能包含个人和敏感信息,使用时需谨慎。
使用数据集的考虑
- 社会影响: 旨在为多种语言提供大量数据,特别是低资源语言,以支持先进的语言模型预训练。
- 偏见讨论: 数据集尚未完全过滤,可能导致训练模型中存在偏见。
- 其他已知限制: 使用的fastText线性分类器在性能和可识别语言种类上有限,可能影响某些子语料库的质量。
附加信息




