UkrLM-wiki
收藏资源简介:
UkrLM — Wikipedia Corpus 是一个用于语言模型预训练的大规模乌克兰语维基百科语料库。该数据集包含来自乌克兰语维基百科(uk.wikipedia.org)的清理过的文章,共1,134,432条记录。每条记录包含以下字段:文章文本(text)、文章标题(title)、来源标识(source,固定为'wikipedia_uk')、内容许可(license,固定为'CC-BY-SA-4.0')和收集日期(date)。数据集总大小为5,647,322,338字节,下载大小为2,631,278,461字节。该数据集适用于乌克兰语的自然语言处理任务,特别是语言模型预训练。需要注意的是,部分文章可能包含结构相似但不完全相同的模板化部分。数据集遵循CC-BY-SA 4.0许可协议。
UkrLM — Wikipedia Corpus 数据集概述
数据集基本信息
- 数据集名称:UkrLM — Wikipedia Corpus
- 托管地址:https://huggingface.co/datasets/ruvimx/UkrLM-wiki
- 许可证:CC-BY-SA 4.0
- 主要语言:乌克兰语 (uk)
- 标签:ukrainian, pretraining, wikipedia
- 规模分类:100M < n < 1B
数据集描述
这是一个用于语言模型预训练的大规模乌克兰语维基百科语料库。它包含了经过清理的乌克兰语维基百科(uk.wikipedia.org)内容。
数据集配置与内容
- 配置名称:
wikipedia - 数据描述:来自 uk.wikipedia.org 的文章,已清理掉维基标记。
- 记录数量:1,134,432 条
- 数据文件:
- 分割:train
- 路径:wikipedia/train-*
数据集结构
特征字段
| 字段名 | 数据类型 | 描述 |
|---|---|---|
text |
large_string | 文章正文 |
title |
large_string | 文章标题 |
source |
large_string | 来源标识符 (wikipedia_uk) |
license |
large_string | 内容许可证 (CC-BY-SA-4.0) |
date |
timestamp[us] | 收集日期 |
数据分割
- 分割名称:train
- 示例数量:1,134,416
- 数据集大小:5,647,322,338 字节
- 下载大小:2,631,278,461 字节
使用方法
python from datasets import load_dataset ds = load_dataset("ruvimx/UkrLM-wiki", "wikipedia")
已知限制
部分文章包含重复的模板化章节,这些章节在结构上相似,但在不同条目中并非完全相同。
引用信息
bibtex @dataset{savytskyi2026ukrlm, author = {Savytskyi, Ruvim}, title = {UkrLM: Ukrainian Wikipedia Corpus}, year = {2026}, publisher = {Hugging Face}, url = {https://huggingface.co/datasets/ruvimx/UkrLM-wiki} }




