Wikinium
收藏资源简介:
Wikinium是一个专为大型语言模型(LLM)预训练优化的、持续演进的维基百科数据集,被称为“活数据集”。与传统静态的维基百科数据快照不同,它通过名为Wikinium-Maker的自动化处理系统,持续从维基百科获取、处理并发布内容,更新频率约为每10分钟至1小时。更新内容包括新文章、文章修订、数据增长和质量改进。原始维基百科页面中的HTML样板、导航结构等无关噪声被移除,并转换为干净、结构化的Markdown格式,以最大化保留知识、提高标记效率和训练质量。数据集的生成和更新过程在Hugging Face Spaces上公开可见,允许实时观察演变。其核心设计理念是与维基百科保持同步的持续知识流,而非固定存档,特别适用于需要最新、高质量文本语料的语言模型开发。
Wikinium is a continuously evolving Wikipedia dataset optimized for large language model (LLM) pre-training, referred to as a living dataset. Unlike traditional static Wikipedia snapshots, it uses an automated processing system called Wikinium-Maker to continuously fetch, process, and publish content from Wikipedia, with updates occurring approximately every 10 minutes to 1 hour. Updates include newly created Wikipedia articles, revisions to existing articles, dataset growth, and quality improvements from the processing pipeline. Irrelevant noise from original Wikipedia pages, such as HTML templates, navigation structures, interface elements, style metadata, and template artifacts, is removed and converted into clean, structured Markdown format to maximize knowledge retention, improve tokenization efficiency, and enhance training quality. The entire generation and update process is publicly visible on Hugging Face Spaces, allowing users to observe the datasets evolution in real-time. Its core design philosophy is to maintain a continuous knowledge flow synchronized with Wikipedia itself, rather than a fixed historical archive, making it particularly suitable for language model development requiring up-to-date, high-quality text corpora.
数据集名称
Wikinium(代号:The Living Wikipedia Dataset)
许可协议
CC-BY-SA-4.0
核心定位
Wikinium 是一个面向大语言模型(LLM)预训练、持续更新的Wikipedia数据集。与一次性生成并逐渐过时的传统Wikipedia数据集不同,Wikinium 始终与Wikipedia本身的演化保持同步,通过持续采集、处理和发布机制,确保数据内容的实时性和有效性。
关键特性
| 特性 | 说明 |
|---|---|
| 活数据集 | 是 |
| 持续增长 | 新文章不断加入 |
| 现有文章刷新 | 是 |
| 自动运行 | 是 |
| 原生Markdown格式 | 是 |
| LLM优化 | 是 |
| 公开处理管道 | 是 |
| Hugging Face原生 | 是 |
更新机制
Wikinium 大约每 10分钟到1小时 自动更新一次,更新内容涵盖:
- 新创建的Wikipedia文章
- 现有文章的修订版本
- 数据集的持续规模增长
- 处理管道的质量改进
数据处理流程
- Wikipedia文章采集
- 内容提取
- 高级噪声去除
- 高保真Markdown转换
- LLM预训练优化
- 持续发布至
Rikunarita-ORG/Wikinium
处理目标
- 保留知识
- 去除噪声(如HTML样板、导航结构、界面元素、样式元数据、模板残留等)
- 维持结构
- 提升Token效率
- 最大化训练质量
生成与维护系统
Wikinium 由 Wikinium-Maker 自动处理系统生成与维护,该系统部署在Hugging Face Spaces上,人工干预极少。公开实例地址:
- https://huggingface.co/spaces/Rikunarita-ORG/Wikinium-Maker
- https://huggingface.co/spaces/Rikunarita-ORG/Wikinium-Maker-2nd
用户可以通过以上Space实时观察数据集的生成过程。
哲学理念
传统数据集保存的是一个时间点,而Wikinium保存的是一个持续流动的知识流。它不是一个静态的Wikipedia文章集合,而是一个与Wikipedia共演进、与人类知识共增长的知识语料库。




