遇见数据集

wikipedia-2001-2019

收藏
Hugging Face2026-06-04 更新2026-06-05 收录
官方服务:

资源简介:

Wikipedia 2008 & 2010数据集是一个精心整理的英语文本数据集,基于维基百科2008年和2010年两个快照时期的文章,共收录约479万篇文章,旨在为大规模语言模型预训练提供高效、干净的知识语料。数据集分为两个分片:wiki_2008包含1,903,473篇文章(压缩后2.43 GB),wiki_2010包含2,885,860篇文章(压缩后3.63 GB),总计压缩大小约6.05 GB。数据以Parquet格式存储,采用zstd压缩,相比原始JSONL格式节省约60%存储空间,支持快速列式读取和流式处理。每个样本包含清理后的文章正文内容、文章标题、快照年份、转储标识符、清理后的字符数、清理前的原始字符数、唯一的十六进制文章标识符以及数据转换时间戳。该数据集适用于文本生成模型的预训练,并为研究维基百科知识随时间的演化(时间分析)提供资源。原始数据来源于维基百科XML转储文件,经过提取、去除Wiki标记和保留元数据等处理,遵循CC BY-SA 4.0许可证,使用时需注明来源并归属维基百科和维基媒体基金会。

创建时间:
2026-05-31
原始信息汇总

数据集概述:Wikipedia 2008 & 2010

该数据集是一个精选的维基百科文章集合,包含 479 万篇文章,涵盖 2008 年和 2010 年的快照版本。数据经过清洗和压缩,适用于大规模语言模型的预训练,同时也为时间序列分析、知识演化研究和基础模型训练提供了宝贵的资源。

数据集统计

数据划分 文章数量 压缩后大小 原始 JSONL 大小
wiki_2008 1,903,473 2.43 GB 5.70 GB
wiki_2010 2,885,860 3.63 GB 8.65 GB
总计 4,789,333 6.05 GB 14.35 GB

格式与模式

  • 存储格式:Parquet 文件,采用 zstd 压缩,相比原始 JSONL 节省约 60% 的空间,同时支持快速列式读取和流式传输。
  • 数据模式:包含以下字段:
    • text:清洗后的文章正文内容
    • title:文章标题
    • year:快照年份(2008 或 2010)
    • snapshot:具体的数据转储标识符
    • length_chars:清洗后的字符数
    • raw_length_chars:剥离之前的原始字符数
    • id:唯一的十六进制文章标识符
    • processed_at:转换时的 ISO 时间戳

使用方法

用户可以直接从 Hugging Face 流式加载数据集,无需下载完整的 6GB 数据。示例代码如下:

python from datasets import load_dataset

流式加载 2008 年文章

ds_2008 = load_dataset("adhyanshaa/wikipideia-2008-2010", split="wiki_2008", streaming=True)

或加载 2010 年数据划分

ds_2010 = load_dataset("adhyanshaa/wikipideia-2008-2010", split="wiki_2010", streaming=True)

for article in ds_2008: print(article["title"], len(article["text"])) break

数据来源与处理

  • 来源:原始数据来自维基百科的 XML 转储文件(2008 年和 2010 年快照)。
  • 处理流程:提取文章内容,剥离 Wiki 标记,保留元数据。转换流程使用流式 PyArrow,并采用原子写入和行数验证,确保从 JSONL 到 Parquet 的转换过程中数据零丢失。

许可证

该数据集采用 CC BY-SA 4.0 许可证发布,以保持与原始维基百科内容许可证的一致。在用于模型训练或重新分发时,需要注明维基百科和维基媒体基金会的来源。

搜集汇总
数据集介绍
wikipedia-2001-2019 数据集图片
构建方式
该数据集源自维基百科2008年与2010年的XML快照转储,通过提取文章正文、剥离维基标记并保留元数据而构建。清洗流水线采用流式PyArrow技术,辅以原子写入与行计数验证机制,确保从JSONL到Parquet格式转换过程中的零数据丢失。最终以zstd压缩的Parquet文件存储,相较原始JSONL节省约60%空间,同时支持高效的列式读取与流式加载。
使用方法
使用者可通过Hugging Face的`datasets`库直接加载,无需预先下载完整的6GB压缩包。利用流式模式(`streaming=True`)按需迭代读取文章,例如分别加载2008或2010年的子集。每个样本以字典形式返回,包含`title`与`text`等字段,便于进行文本生成、知识检索或时序比较等下游任务。数据遵循CC BY-SA 4.0许可协议,使用需注明维基百科及维基媒体基金会出处。
背景与挑战
背景概述
作为大规模语言模型预训练的核心语料之一,维基百科因其结构化、多领域覆盖及相对严谨的编纂机制,长期以来被视为知识密集型自然语言处理任务的重要数据来源。wikipedia-2001-2019数据集由研究者Adhyanshaa等人从2008年和2010年的维基百科XML快照中提取构建,总计包含约479万篇经过清洗与压缩的文章,其核心研究问题在于如何为计算机理解语言提供跨越时间维度的百科全书式知识基底。该数据集不仅为GPT、BERT等经典模型的预训练贡献了关键语料,还通过保留年代标注的篇章结构,推动了知识演化与语料时效性分析领域的发展,在语言模型社区中具有广泛影响力。
当前挑战
该数据集所面对的领域挑战主要源于语言模型对知识时效性与覆盖完整性的双重需求:维基百科内容随人类认知更新而快速迭代,而2008年和2010年的快照虽能捕捉特定历史节点的知识状态,却无法涵盖后续涌现的新概念,这限制了训练出的模型在动态知识追踪任务上的表现。在构建过程中,研究者面临的核心挑战包括从数TB的原始XML中高效提取并剔除维基标记,同时保留文章标题、年份及长度等元数据,此外还需设计流式处理管线以确保将480万篇文章从JSONL转换为Parquet格式时,在zstd压缩下实现零数据丢失与行数校验,这在大规模转换中尤为耗费计算资源与调试精力。
常用场景
经典使用场景
在自然语言处理与知识工程领域,Wikipedia-2001-2019数据集因其横跨2008至2010年的两个快照版本,囊括了近479万篇经过清洗的百科全书文章,成为大规模语言模型预训练的理想语料。研究者常利用其丰富的文本内容与结构化元数据,如标题、年份及快照标识,进行语言生成模型的训练,尤其适用于需要捕捉特定时期语言风格与知识体系的场景。该数据集以Parquet格式存储并支持流式加载,极大提升了数据处理的效率,使其在预训练任务中备受青睐。
解决学术问题
该数据集在学术研究中主要解决了知识随时间演化这一核心议题。通过对比2008年与2010年两个时间节点的百科内容,学者得以量化分析特定概念、术语或事实的语义变迁,进而探索社会文化、科学技术等领域的知识动态更新模式。这种时序视角不仅为知识图谱的动态维护提供了实证基础,也推动了语言模型在时间感知能力上的理论突破——例如评估预训练模型对历史知识的忠实程度,或是构建能够处理知识时效性的新型架构。其影响深远,为理解人类集体智慧的演进规律贡献了关键数据支撑。
实际应用
在实际应用层面,此数据集可赋能多个场景。基于其高质量百科文本,开发者可构建面向特定时间段的信息检索系统或智能问答机器人,提升对历史查询的响应精确度。教育领域可利用其快照特性,制作反映知识发展脉络的互动教学材料,辅助学生理解学科概念的演变。此外,新闻媒体与舆情分析机构可借助该数据集训练模型,自动检测文本中蕴含的过时信息,从而在事实核查、历史文献数字化等任务中发挥重要作用,推动信息处理的智能化与精准化。
数据集最近研究
最新研究方向
该数据集凭借其横跨2008与2010两个时间节点的维基百科快照,为探究知识演化轨迹与语言模型时序表征学习开辟了独特路径。前沿研究正聚焦于利用此类时序语料捕捉知识图谱的动态变迁,例如监测实体间关系的消长、概念定义的更迭以及新兴术语的涌现,从而训练具备时间感知能力的预训练模型。此类工作不仅有助于理解互联网知识的传播与重构机制,更在对抗语言模型知识过时问题上展现出重要价值,为构建能够同步现实世界知识更新的动态语言模型奠定了数据基石。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务