遇见数据集

raj2708/wikipedia-ar

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

一个经过清理和预处理的阿拉伯语维基百科转储版本,适用于大型语言模型(LLM)的预训练。该数据集基于阿拉伯语维基百科(ar.wikipedia.org)的完整转储,经过下载、解析、过滤重定向和短文章、清理模板和文件/图像链接、去除多余空白等处理步骤,并包含基于标点符号比例的质量评分。数据格式为JSON,包含文章文本、元数据(如标题、许可证、抓取日期、质量评分、词数和标记数等),总大小为4.1 GB,语言为阿拉伯语(ar),许可证为CC-BY-SA 4.0,转储日期为2026年5月。

--- license: CC BY-SA 4.0 language: - ar tags: - 维基百科 - ar - 预训练 size_categories: - 1M<n<10M --- # 阿拉伯语维基百科——预处理版 本数据集为经清洗与预处理后的阿拉伯语维基百科(Arabic Wikipedia)转储文件,可直接用于大语言模型(LLM)的预训练任务。 ## 统计信息 | 字段 | 取值 | |-------|-------| | 语言 | 阿拉伯语(ar) | | 总大小 | 4.1 GB | | 许可证 | CC-BY-SA 4.0 | | 来源 | ar.wikipedia.org | | 转储日期 | 2026年5月 | ## 处理流程 1. **下载**完整阿拉伯语维基百科XML BZ2转储文件 2. **解析**文章:使用`mwparserfromhell`将维基标记语言(wikitext)转换为纯文本 3. **过滤**重定向页面与短篇幅文章 4. **清洗**数据:移除模板、文件/图片链接以及冗余空白字符 5. **质量评分**:基于标点符号占比对文本进行质量评估 ## 数据格式 json { "id": "uuid-v4", "source": "wikipedia_ar", "type": "text", "language": "ar", "text": "Article text...", "metadata": { "url": "https://ar.wikipedia.org/wiki/Title", "title": "Article Title", "license": "CC-BY-SA-4.0", "scraped_at": "2026-05-29T00:00:00+00:00", "quality_score": 0.95, "token_count": 512, "word_count": 384 } } ## 使用示例 python from datasets import load_dataset ds = load_dataset("raj2708/wikipedia-ar", split="train", streaming=True) for row in ds: print(row["metadata"]["title"]) print(row["text"][:300]) break

提供机构:
raj2708
搜集汇总
数据集介绍
raj2708/wikipedia-ar 数据集图片
构建方式
该数据集源自阿拉伯语维基百科的完整XML BZ2转储文件,经由一系列精细的预处理流程构建而成。首先,利用mwparserfromhell工具将维基文本解析为纯文本格式,随后过滤掉重定向页面与篇幅过短的文章。通过移除模板、文件与图像链接以及多余空白符,实现了文本的深度清洁。最后,基于标点符号比率对文章进行质量评分,确保输出内容的可读性与一致性。
特点
作为专为大型语言模型预训练设计的语料库,该数据集呈现出诸多卓越特性。其规模达4.1 GB,涵盖超过百万篇高质量的阿拉伯语文章,语料丰富而多元。每条记录均以结构化的JSON格式存储,不仅包含纯净文本,还携带标题、URL、许可协议及质量评分等元数据,便于研究者进行数据筛选与模型适应性调整。流式加载的支持更为大规模训练提供了高效的数据访问方案。
使用方法
研究者可通过HuggingFace的datasets库轻松调用该数据集。加载时仅需指定数据集标识符与分割选项,并可启用流式模式以应对内存限制。遍历数据条目时,可直接获取文章标题与文本内容,元数据中的质量评分与词数统计则可用于构建定制化的数据采样策略。例如,设置阈值筛选高质量样本,或根据词数对长文本进行截断处理,从而灵活适配不同训练任务的需求。
背景与挑战
背景概述
维基百科作为全球最大的自由百科全书,其多语言语料库为自然语言处理领域提供了宝贵的数据资源。阿拉伯语作为联合国六种官方语言之一,拥有超过4亿使用者,但由于其复杂的形态句法结构和丰富的方言变体,高质量阿拉伯语预训练语料的匮乏长期制约着该语言大语言模型的发展。wikipedia-ar数据集由研究者于2026年5月从阿拉伯语维基百科完整转储中构建,经系统化清洗与质量评分后形成约4.1GB的纯净文本语料,旨在为阿拉伯语预训练提供标准化、可复现的基础资源。该数据集采用CC-BY-SA-4.0许可协议,通过UUID标识、元数据记录及质量分数标注,显著提升了数据可用性,推动阿拉伯语自然语言理解与生成研究的进展。
当前挑战
该数据集所解决的领域核心挑战在于:阿拉伯语在预训练阶段面临语料稀缺、噪声冗余及方言混杂等突出问题,现有通用多语数据集往往忽视阿拉伯语独特的书写系统与形态复杂性,导致模型在下游任务中表现欠佳。在数据构建过程中,挑战主要体现在三方面:第一,维基百科原始转储包含大量重定向、短条目及冗余模板,需高效过滤以保留有意义的文章主体;第二,阿拉伯语富含附着词缀、表意符号及右至左书写方向,使得wikitext解析与文本清洗规则设计极为复杂;第三,为保障语料质量,研究者引入基于标点密度的评分机制,但如何确定合理阈值以平衡覆盖率与纯净度仍是技术难点,同时需确保清洗流程不损失阿拉伯语特有的语义表达。
常用场景
经典使用场景
作为阿拉伯语自然语言处理领域的基石性资源,wikipedia-ar数据集最经典的用途在于为大语言模型的预训练提供大规模、高质量的纯文本语料。该数据集源自阿拉伯语维基百科的完整转储文件,经过精心的解析、过滤与清洗流程,去除了模板、图片链接及冗余空白,并依据标点比例进行质量评分,最终形成了4.1GB的纯净文本集合。研究者可借助HuggingFace Datasets库的流式加载功能,轻松将其集成至自监督学习框架中,开展掩码语言建模或因果语言建模等经典预训练任务,为阿拉伯语模型奠定扎实的语言基础。
解决学术问题
该数据集着力解决低资源语言中大规模结构化语料匮乏的学术困境。相较于英语等资源丰富的语言,阿拉伯语在预处理标准化、非正式文本污染及跨方言混淆等方面长期面临挑战,严重制约了模型的泛化能力与下游任务表现。wikipedia-ar通过系统化的清洗与质量筛选机制,提供了具备一致性格式与高可信度的文章语料,使研究者能够聚焦于模型架构创新与训练策略优化,而非耗费精力在数据杂质的处理上。此举不仅显著降低了阿拉伯语预训练的门槛,更推动了跨语言模型迁移学习效果的提升,对丰富多语言自然语言处理的理论与实践体系产生了深远的积极影响。
衍生相关工作
围绕wikipedia-ar数据集,衍生出诸多促进阿拉伯语自然语言处理发展的经典工作。一方面,研究者基于该语料训练出各类规模的基础语言模型,如AraBERT、Arabic GPT等,这些模型在情感分析、命名实体识别等任务上取得了当时的最优结果;另一方面,该数据集常被用作构建多语言对齐语料的桥梁,与其他语种的维基数据集协同训练跨语言嵌入,催生了诸如XLM-R等强大模型在阿拉伯语上的适配版本。此外,其公开的预处理管线与质量评分策略也为后来构建阿拉伯语特定领域数据集(如医疗、法律)提供了方法论参考,形成了持续迭代与扩展的良性学术生态。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务