open-wikipedia
收藏资源简介:
Open Wikipedia (Wikitext) 数据集包含了所有语言版本的维基百科文章,以原始的 MediaWiki wikitext 标记格式保存。数据集保留了所有原始标记元素,如模板、信息框、引用、表格等,未进行任何转换或简化。数据来源于 Wikimedia 的官方数据库转储,按语言组织,每个语言的完整文章以分片的 Apache Parquet 文件形式存储,并采用 Zstandard 压缩。数据集包含 139.4K 篇文章,涵盖 1 种语言(拉丁语),适用于文本生成、特征提取、文本分类、问答、摘要和翻译等多种 NLP 任务。数据集还提供了详细的字段说明,包括文章 ID、标题、wikitext 内容、URL、语言代码、长度和时间戳等。使用该数据集可以分析模板使用模式、提取结构化数据、研究编辑惯例以及训练支持标记的模型。数据集采用 CC BY-SA 4.0 许可协议。
The Open Wikipedia (Wikitext) Dataset contains Wikipedia articles from all language versions, preserved in their original MediaWiki wikitext markup format. The dataset retains all original markup elements, including templates, infoboxes, citations, tables, and more, without any conversion or simplification. The data is sourced from Wikimedia's official database dumps, organized by language. Full articles for each language are stored as sharded Apache Parquet files, compressed with Zstandard. The dataset comprises 139.4K articles covering 1 language (Latin), and is applicable to a variety of NLP tasks including text generation, feature extraction, text classification, question answering, summarization, and machine translation. The dataset also provides detailed field descriptions, including article ID, title, wikitext content, URL, language code, article length, and timestamp, among others. Using this dataset enables analysis of template usage patterns, extraction of structured data, research into editing conventions, and training of markup-aware models. The dataset is licensed under CC BY-SA 4.0.
Open Wikipedia (Wikitext) 数据集概述
数据集基本信息
- 数据集名称: Open Wikipedia (Wikitext)
- 发布者: Open Index
- 发布日期: 2026-04-03
- 许可证: Creative Commons Attribution-ShareAlike 4.0 International License (CC BY-SA 4.0)
- 数据来源: 官方 Wikimedia 数据库转储 (https://dumps.wikimedia.org/)
- 数据集地址: https://huggingface.co/datasets/open-index/open-wikipedia
数据集内容与规模
- 内容描述: 该数据集包含所有语言版本的维基百科文章,以原始的 MediaWiki wikitext 源标记形式提供。所有模板、信息框、参考文献、表格、分类、文件链接和其他 MediaWiki 结构均被完整保留。
- 数据规模: 包含 139.4K 篇文章,涵盖 1 种语言。
- 语言: 拉丁语 (语言代码:
la)
数据结构与格式
- 数据格式: Apache Parquet 文件,采用 Zstandard 压缩。
- 文件组织: 按语言目录组织,每种语言包含分片的 Parquet 文件。
- 数据分割: 仅包含训练集 (
train),共 139,421 个样本。
数据模式 (Schema)
每个 Parquet 文件共享相同的结构:
| 列名 | 数据类型 | 描述 |
|---|---|---|
id |
int64 |
维基百科页面 ID,在每种语言版本中唯一 |
title |
string |
文章标题,与维基百科上显示的一致 |
wikitext |
string |
以原始 MediaWiki wikitext 标记格式呈现的完整文章正文 |
url |
string |
指向维基百科文章的直接 URL |
lang |
string |
ISO 639 语言代码 (例如 en, de, fr, ja) |
length |
int32 |
Wikitext 正文的字节长度 |
timestamp |
string |
最后修订时间戳 (ISO 8601 格式) |
数据处理流程
- 下载: 从 https://dumps.wikimedia.org/ 流式下载最新的
{lang}wiki-latest-pages-articles.xml.bz2转储文件。 - 解析: 使用流式 XML 解析器处理 bzip2 压缩的转储文件,仅保留命名空间-0 的页面(文章)。
- 过滤: 排除纯文本等效内容短于 100 字节的文章(移除存根、消歧页面等)。
- 分片: 文章被写入 Zstandard 压缩的 Parquet 文件,每个分片大约包含 500,000 行。
- 发布: 每种语言的分片在处理完成后提交至 Hugging Face 仓库。
预期用途与优势
- 构建或评估 wikitext 解析器: 为开发 MediaWiki 解析器或转换器提供跨多种语言的大量真实测试用例。
- 分析模板使用模式: 保留信息框、引用模板和导航模板中编码的结构化知识。
- 从信息框中提取结构化数据: 解析信息框模板中的键值对以构建结构化知识库。
- 研究编辑规范: 原始标记揭示了不同语言社区组织和格式化文章的方式。
- 训练支持标记的模型: 在 wikitext 上训练的语言模型可以学习生成或补全 MediaWiki 标记,这对编辑工具和机器人很有用。
已知限制
- 这是原始页面源代码,而非渲染后的 HTML: 模板未展开,解析器函数未求值,Lua 模块未执行。
- 单一时间点快照: 数据集代表每种语言转储的单一快照,不包含编辑历史或文章修订。
- 转储可用性各异: 并非所有语言版本都始终提供其转储文件。
- 部分文章体积非常大: 少数文章(列表、时间线、参考页面)的 wikitext 正文可能超过 1 MB。
相关数据集
- Open Wikipedia (Markdown): https://huggingface.co/datasets/open-index/open-wikipedia-markdown - 相同文章转换为干净的 Markdown 格式。
- Open Wikipedia (Text): https://huggingface.co/datasets/open-index/open-wikipedia-text - 相同文章以纯文本形式提供,所有格式和标记均已移除。
引用方式
bibtex @dataset{open_wikipedia, title = {Open Wikipedia (Wikitext)}, author = {Open Index}, year = {2026}, url = {https://huggingface.co/datasets/open-index/open-wikipedia}, license = {CC BY-SA 4.0}, publisher = {Hugging Face} }




