遇见数据集

Wikipedia-translated

收藏
Hugging Face2026-07-20 更新2026-07-21 收录
官方服务:

资源简介:

该数据集是英文维基百科的斯洛文尼亚语翻译版本,以 Markdown 格式提供。英文原始数据来源于 zidsi/wikipedia_markdown 数据集(2025年1月23日快照),并利用 cjvt/GaMS-DPO-Translator 模型进行自动翻译。数据集规模庞大,包含约 690 万份文档,翻译后的斯洛文尼亚语文本总计约 36 亿单词。数据集结构清晰,每条记录包含以下字段:唯一标识符 (`id`)、原始英文文章 URL (`url`)、原始英文文章标题 (`title`)、原始英文文章全文 (`text`)、为适应翻译模型上下文窗口而切分的英文文本块序列 (`chopped_document`),以及对应的斯洛文尼亚语翻译文章 (`text_sl`)。该数据集仅包含一个训练分割,样本数量为 6,941,400 个。其主要语言为斯洛文尼亚语。该资源在 PoVeJMo 研究计划(特别是 SloLLaMai 项目)框架下创建,旨在为斯洛文尼亚语提供开放访问且计算高效的语言模型资源,获得了斯洛文尼亚研究与创新署、NextGenerationEU 以及欧盟 Horizon Europe 计划的资金支持。数据集采用 CC BY 4.0 许可协议发布。它适用于机器翻译模型训练与评估、构建斯洛文尼亚语-英语双语语料库、跨语言信息检索、以及作为斯洛文尼亚语大语言模型预训练或指令微调的高质量语料。

This dataset is a Slovenian translation of the English Wikipedia, provided in Markdown format. The original English data is sourced from the 'zidsi/wikipedia_markdown' dataset (snapshot dated January 23, 2025), and was automatically translated using the 'cjvt/GaMS-DPO-Translator' model. This is a large-scale dataset containing approximately 6.9 million documents, with the total volume of translated Slovenian text reaching about 3.6 billion words. The dataset has a well-defined structure, where each record includes the following fields: unique identifier (`id`), URL of the original English article (`url`), title of the original English article (`title`), full text of the original English article (`text`), sequence of chopped English text blocks split to fit the context window of the translation model (`chopped_document`), and the corresponding Slovenian translated article (`text_sl`). This dataset only contains one training split, with a total of 6,941,400 samples, and its primary language is Slovenian. This resource was developed under the framework of the PoVeJMo research program, specifically the SloLLaMai project, with the goal of providing open-access and computationally efficient language model resources for Slovenian. It has received funding from the Slovenian Research and Innovation Agency, NextGenerationEU, and the EU Horizon Europe program. The dataset is released under the CC BY 4.0 license. It is applicable for training and evaluating machine translation models, constructing Slovenian-English bilingual corpora, cross-lingual information retrieval, and serving as high-quality corpus for pre-training or instruction fine-tuning of Slovenian large language models (LLMs).

创建时间:
2026-07-13
原始信息汇总

数据集概述:Slovene translation of English Wikipedia

该数据集是英文维基百科的斯洛文尼亚语翻译版本,以 Markdown 格式提供。

  • 语言:斯洛文尼亚语 (sl)
  • 许可证:CC BY 4.0
  • 数据来源:英文维基百科数据取自 zidsi/wikipedia_markdown 数据集,使用的快照日期为 2025年1月23日
  • 翻译模型:使用 cjvt/GaMS-DPO-Translator 模型进行翻译。

数据规模

  • 文档数量:约 690 万 篇文档
  • 斯洛文尼亚语词汇量:约 36 亿 个词

数据字段

数据集包含以下字段:

  • id:文档 ID
  • url:文档 URL
  • title:原始(英文)文章标题
  • text:原始(英文)文章内容
  • chopped_document:为适配 GaMS-DPO-Translator 模型上下文窗口而切分的较小文本单元列表
  • text_sl:英文文章的斯洛文尼亚语翻译

数据集划分

该数据集仅包含一个划分:

  • train:共 6,941,400 个样本,数据大小约 63.9 GB(下载大小约 37.8 GB

引用

bibtex misc{vreš2026buildingstronginstructionlanguage, title={Building a Strong Instruction Language Model for a Less-Resourced Language}, author={Domen Vreš and Tjaša Arčon and Timotej Petrič and Dario Vajda and Marko Robnik-Šikonja and Iztok Lebar Bajec}, year={2026}, eprint={2603.01691}, archivePrefix={arXiv}, primaryClass={cs.CL}, url={https://arxiv.org/abs/2603.01691}, }

搜集汇总
数据集介绍
Wikipedia-translated 数据集图片
构建方式
Wikipedia-translated数据集是基于英文维基百科的斯洛文尼亚语翻译版本,其构建过程严谨而系统。首先,研究团队从zidsi/wikipedia_markdown数据集中获取了2025年1月23日生成的英文维基百科数据,共计约694万篇文档。随后,利用cjvt/GaMS-DPO-Translator模型对这些文档进行逐篇翻译。为了克服模型上下文窗口的限制,原文被切分为多个更小的文本单元(即chopped_document字段),每个单元均被独立翻译,最终拼接为完整的斯洛文尼亚语文本(text_sl字段)。这一流程确保了翻译的覆盖率和语料的完整性。
使用方法
使用该数据集时,研究者可直接通过HuggingFace平台加载,默认配置下所有数据位于训练集(train)中。每条记录包含六个字段,其中text提供英文原文,text_sl则是对应的斯洛文尼亚语译文。对于需要对齐双语语料的任务,如机器翻译或跨语言信息检索,可通过id或url字段建立一一映射。若处理长文本,可利用chopped_document字段查看翻译前的分段信息。数据以Markdown格式存储,可直接用于训练语言模型或构建问答系统。使用时应引用原论文以尊重贡献。
背景与挑战
背景概述
在自然语言处理领域,大规模多语种语料库的构建是推动低资源语言模型发展的关键基石。Wikipedia-translated数据集由斯洛文尼亚卢布尔雅那大学计算机与信息科学学院及斯洛文尼亚研究与创新机构(ARIS)的研究团队于2025年创建,核心成员包括Domen Vreš、Tjaša Arčon等,隶属于PoVeJMo研究项目。该数据集以2025年1月23日的英语维基百科快照为源,利用先进的GaMS-DPO-Translator神经翻译模型将其自动翻译为斯洛文尼亚语,形成了包含694万篇文档、约36亿斯洛文尼亚语词的庞大规模。这一资源有效弥补了斯洛文尼亚语在高质量、大规模平行语料方面的严重缺失,为开发低资源语言的大语言模型、指令微调及跨语言迁移学习提供了坚实的数据基础,对推动斯洛文尼亚语及类似小语种的自然语言处理研究具有深远影响。
当前挑战
该数据集面临的核心挑战源于斯洛文尼亚语作为低资源语言的先天劣势。在领域问题层面,斯洛文尼亚语缺乏大规模、高质量的公开语料库,使得大语言模型训练极易陷入数据稀疏与过拟合困境,严重制约模型泛化能力;同时,自动翻译可能引入的噪声(如术语错译、长句截断导致的语义断裂)进一步加剧了数据质量的不确定性。在构建过程中,研究团队需应对英语维基百科文档长度远超翻译模型上下文窗口的技术难题,为此创新性地设计了文档切分策略(chopped_document字段),但如何确保切分后各子单元在翻译时保持上下文连贯性,以及如何在后处理中高效重构完整译文,仍是构造过程中的显著瓶颈。此外,版权合规与跨机构协作的数据治理也对数据集的可复现性提出了严苛要求。
常用场景
经典使用场景
Wikipedia-translated数据集的核心价值在于为斯洛文尼亚语等低资源语言提供了大规模、高质量的平行语料。其经典使用场景包括机器翻译模型的训练与评估,尤其是英-斯洛文尼亚语方向的神经机器翻译系统开发。研究者可基于该数据集构建从英语到斯洛文尼亚语的翻译模型,借助其包含的690万篇文档和约36亿斯洛文尼亚语词汇,显著缓解低资源语言在翻译任务中的数据匮乏问题。此外,该数据集也广泛用于跨语言信息检索、多语言文本分类以及语言模型预训练,为斯洛文尼亚语的自然语言处理研究奠定了坚实的语料基础。
解决学术问题
该数据集直面低资源语言在自然语言处理领域的核心困境——标注数据稀缺与高质量语料不足。在学术层面,它有效支撑了面向斯洛文尼亚语的机器翻译、文本生成及语义理解等任务的研究,解决了因训练数据规模过小而导致的模型性能瓶颈问题。通过提供结构清晰、内容丰富的英-斯洛文尼亚语平行文本,该数据集推动了跨语言迁移学习、多语言预训练模型适配以及低资源语言指令微调等方向的发展,其成果对促进语言技术的多样性与包容性具有重要学术意义。
实际应用
在实际应用层面,Wikipedia-translated数据集为斯洛文尼亚语的信息服务系统提供了关键支持。它可被用于开发面向斯洛文尼亚用户的机器翻译工具,例如网页翻译插件、多语言客服系统或文档自动翻译平台。同时,该数据集有助于构建斯洛文尼亚语智能搜索与问答系统,提升当地用户获取英语知识资源的效率。此外,基于该数据集训练的模型还可服务于教育领域,例如辅助斯洛文尼亚语学习者理解英文内容,或为政府、企业提供多语言内容管理解决方案。
数据集最近研究
最新研究方向
在低资源语言自然语言处理领域,Wikipedia-translated数据集的发布标志着机器翻译与大规模语言模型融合的前沿探索取得了关键性突破。该数据集依托斯洛文尼亚研究项目PoVeJMo与SloLLaMai,利用先进的GaMS-DPO-Translator模型将海量英文维基百科内容自动转化为斯洛文尼亚语,构建了包含694万文档、约36亿词汇的平行语料库。这一开源成果(CC BY 4.0)不仅为斯洛文尼亚语等低资源语种提供了稀缺的大规模训练数据,更聚焦于如何通过指令微调与跨语言对齐技术,在资源受限环境下打造高性能语言模型。其意义深远:一方面,它响应了欧盟AI4DH倡议对多元语言数字人文的迫切需求,推动了非英语语种在生成式AI时代的平等参与;另一方面,该工作为全球低资源语言处理树立了可复制的技术范式——通过高效翻译模型与结构化数据加工流程,弥合语言鸿沟,支撑起更包容的智能生态系统。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务