HiTZ/euscrawl
收藏资源简介:
EusCrawl是一个高质量的巴斯克语语料库,包含1250万份文档和4.23亿个标记,总计2.1 GiB的未压缩文本。该数据集通过专门的爬虫从33个巴斯克语网站中提取高质量内容,生成的文本相比通用方法更为干净。数据集主要用于语言建模和掩码语言建模的预训练任务。数据集的字段包括id、标题、文本、来源、许可证和URL。数据集仅包含一个训练分割,适用于预训练语言模型。
EusCrawl is a high-quality Basque language corpus containing 12.5 million documents and 423 million tokens, totaling 2.1 GiB of uncompressed text. This dataset extracts high-quality content from 33 Basque-language websites via a specialized crawler, and the generated text is cleaner than that produced by general-purpose methods. The dataset is primarily used for pretraining tasks such as language modeling and masked language modeling. Its fields include id, title, text, source, license, and URL. The dataset only contains a single training split, which is suitable for pretraining language models.
数据集概述
数据集名称: EusCrawl
语言: 巴斯克语 (eu)
许可证: Creative Commons (cc)
多语言性: 单语种
数据集大小: 10M<n<100M
数据来源: 原始数据
标签: 高质量, 网络爬虫
任务类别: 文本生成, 填充掩码
任务ID: 语言建模, 掩码语言建模
数据集结构
数据实例
json { "id": 6, "title": "Herriko enpresa handien eta txikien arteko topaketak egingo dituzte", "text": "09:30ean hasiko da bilera eta aurkezpena egingo dute Tubacex, JEZ, Envases, Guardian eta Vidrala enpresek. Eskualdeko lantegi motorrekin beste enpresa txikiak eta ertainak egongo dira. Erakunde publikoaren helburua da euren artean ezagutzea eta elkarlana sustatzea.", "source": "aiaraldea", "license": "cc-by-sa 3.0", "url": "https://aiaraldea.eus/laudio/1494603159768-herriko-enpresa-handien-eta-txikien-arteko-topaketak-egingo-dituzte", }
数据字段
- "id": 示例ID
- "title": 文章标题
- "text": 文章内容
- "source": 文章来源
- "license": 文章许可证
- "url": 文章URL
数据分割
- 训练集: 1724544个实例, 2314407002字节
数据集创建
许可证信息
数据集中的所有文档均在其原始网站上发布,并根据Creative Commons许可证授权。每个文档的特定许可证变体可在每个文档的"license"字段中找到。
引用信息
bibtex @misc{artetxe2022euscrawl, title={Does corpus quality really matter for low-resource languages?}, author={Mikel Artetxe, Itziar Aldabe, Rodrigo Agerri, Olatz Perez-de-Viñaspre, Aitor Soroa}, year={2022}, eprint={2203.08111}, archivePrefix={arXiv}, primaryClass={cs.CL} }




