raj2708/wikipedia-ar
收藏资源简介:
一个经过清理和预处理的阿拉伯语维基百科转储版本,适用于大型语言模型(LLM)的预训练。该数据集基于阿拉伯语维基百科(ar.wikipedia.org)的完整转储,经过下载、解析、过滤重定向和短文章、清理模板和文件/图像链接、去除多余空白等处理步骤,并包含基于标点符号比例的质量评分。数据格式为JSON,包含文章文本、元数据(如标题、许可证、抓取日期、质量评分、词数和标记数等),总大小为4.1 GB,语言为阿拉伯语(ar),许可证为CC-BY-SA 4.0,转储日期为2026年5月。
--- license: CC BY-SA 4.0 language: - ar tags: - 维基百科 - ar - 预训练 size_categories: - 1M<n<10M --- # 阿拉伯语维基百科——预处理版 本数据集为经清洗与预处理后的阿拉伯语维基百科(Arabic Wikipedia)转储文件,可直接用于大语言模型(LLM)的预训练任务。 ## 统计信息 | 字段 | 取值 | |-------|-------| | 语言 | 阿拉伯语(ar) | | 总大小 | 4.1 GB | | 许可证 | CC-BY-SA 4.0 | | 来源 | ar.wikipedia.org | | 转储日期 | 2026年5月 | ## 处理流程 1. **下载**完整阿拉伯语维基百科XML BZ2转储文件 2. **解析**文章:使用`mwparserfromhell`将维基标记语言(wikitext)转换为纯文本 3. **过滤**重定向页面与短篇幅文章 4. **清洗**数据:移除模板、文件/图片链接以及冗余空白字符 5. **质量评分**:基于标点符号占比对文本进行质量评估 ## 数据格式 json { "id": "uuid-v4", "source": "wikipedia_ar", "type": "text", "language": "ar", "text": "Article text...", "metadata": { "url": "https://ar.wikipedia.org/wiki/Title", "title": "Article Title", "license": "CC-BY-SA-4.0", "scraped_at": "2026-05-29T00:00:00+00:00", "quality_score": 0.95, "token_count": 512, "word_count": 384 } } ## 使用示例 python from datasets import load_dataset ds = load_dataset("raj2708/wikipedia-ar", split="train", streaming=True) for row in ds: print(row["metadata"]["title"]) print(row["text"][:300]) break




