遇见数据集

Nemotron-Pretraining-SFT_translated

收藏
Hugging Face2026-07-21 更新2026-07-22 收录
官方服务:

资源简介:

本数据集是Nemotron Pretraining SFT数据的斯洛文尼亚语翻译版本,源数据取自nvidia/Nemotron-Pretraining-SFT-v1数据集的Nemotron-SFT-General子集,并进行了子采样。使用cjvt/GaMS-DPO-Translator模型进行自动翻译,包含约90万个文档,翻译后的斯洛文尼亚语文本约含8.89亿单词。每个样本包含以下字段:id(保留原始标识符)、text(原始英文文本)、metadata(保留原始元数据,包括模型和类别信息)、chopped_document(为适应翻译模型上下文窗口而分割的较小文本单元列表)、text_sl(英文文本的斯洛文尼亚语翻译)。该数据集适用于斯洛文尼亚语的自然语言处理任务,特别是机器翻译、多语言语言模型预训练与指令微调、以及低资源语言的大语言模型研究。在PoVeJMo研究计划(自适应自然语言处理与大语言模型)和SloLLaMai研究项目(斯洛文尼亚语高效开源模型)支持下开发,采用CC BY 4.0许可证发布。

This dataset is a Slovenian translation version of the Nemotron Pretraining SFT data, sourced from the nvidia/Nemotron-Pretraining-SFT-v1 dataset, specifically a subsample of the Nemotron-SFT-General subset. It was automatically translated using the cjvt/GaMS-DPO-Translator model. The dataset contains approximately 900,000 documents, with the translated Slovenian text comprising about 889 million words. Each sample includes the following fields: id (retaining the original dataset identifier), text (original English text), metadata (retaining original metadata, including model and category information), chopped_document (a list of smaller text units segmented to fit the translation models context window), and text_sl (Slovenian translation of the English text). The dataset is suitable for Slovenian natural language processing tasks, particularly machine translation, multilingual language model pretraining and instruction fine-tuning, and large language model research for low-resource languages. It was developed with support from the PoVeJMo research initiative (Adaptive Natural Language Processing and Large Language Models) and the SloLLaMai research project (Efficient Open Models for Slovenian), and is released under the CC BY 4.0 license.

创建时间:
2026-07-13
原始信息汇总

数据集概述

数据规模

  • 文档数量:约 900,000 个文档(训练集具体包含 907,416 个样本)
  • 斯洛文尼亚语词汇量:翻译后的文档包含约 8.89 亿个斯洛文尼亚语单词
  • 数据集大小
    • 下载大小:6,407,592,816 字节
    • 数据集大小:14,592,578,522 字节

数据结构

数据集包含以下字段:

  • id:原始数据集中的唯一标识符(字符串类型)
  • text:原始英文示例(字符串类型)
  • metadata:原始数据集的元数据,包含:
    • models_used:使用的模型(字符串类型)
    • category:类别(字符串类型)
  • chopped_document:为适应翻译模型上下文窗口而切分的较小子文本单元列表(字符串序列)
  • text_sl:英文示例的斯洛文尼亚语翻译(字符串类型)

许可协议

数据集采用 CC BY 4.0 许可证发布。

相关项目与致谢

  • 数据集开发基于 PoVeJMo 研究计划(自适应大语言模型自然语言处理),特别是其中的子项目 SloLLaMai(面向斯洛文尼亚语的开源高效计算模型)。
  • 该研究计划由斯洛文尼亚研究与创新机构(ARIS)和 NextGenerationEU 通过复苏与韧性计划资助。
  • 作者同时感谢斯洛文尼亚研究与创新机构的核心研究资助(编号 P6-0411 — 斯洛文尼亚语语言资源与技术)。
  • 本项目还获得欧盟 Horizon Europe 计划(项目编号 101186647 – AI4DH)资助。

引用信息

bibtex misc{vreš2026buildingstronginstructionlanguage, title={Building a Strong Instruction Language Model for a Less-Resourced Language}, author={Domen Vreš and Tjaša Arčon and Timotej Petrič and Dario Vajda and Marko Robnik-Šikonja and Iztok Lebar Bajec}, year={2026}, eprint={2603.01691}, archivePrefix={arXiv}, primaryClass={cs.CL}, url={https://arxiv.org/abs/2603.01691}, }

搜集汇总
数据集介绍
Nemotron-Pretraining-SFT_translated 数据集图片
构建方式
Nemotron-Pretraining-SFT_translated数据集源自NVIDIA发布的Nemotron-Pretraining-SFT-v1语料,专注于斯洛文尼亚语的跨语言迁移。在原始数据基础上,研究团队选取了其子集Nemotron-SFT-General,并利用cjvt/GaMS-DPO-Translator模型进行高质量翻译。为克服模型上下文窗口限制,原始英文样本被切分为一系列更小的文本单元,存储于chopped_document字段中,随后逐一完成翻译并整合为完整的斯洛文尼亚语版本。最终数据集包含约90.7万条样本,对应约8.89亿斯洛文尼亚语词汇,为低资源语言的自然语言处理研究提供了坚实基础。
使用方法
本数据集适用于斯洛文尼亚语大语言模型的指令微调与对齐训练。用户可直接读取train分片中的text_sl字段作为模型输入,配合原始英文text字段进行双语对比学习或验证翻译质量。metadata字段中的category信息可用于按任务类别进行子集筛选,Chopped_document则为细粒度文本分析提供了便利。推荐采用标准transformers库加载DataLoader,将text_sl与对应标签配对,以构建序列到序列的训练流程。数据集以parquet格式存储,兼容主流深度学习框架,便于直接集成入已有流水线中。
背景与挑战
背景概述
在自然语言处理领域,高质量的多语言指令微调数据集对于构建性能卓越的语言模型至关重要,尤其是对于资源稀缺的语言。Nemotron-Pretraining-SFT_translated数据集正是在这一背景下于2026年由Domen Vreš、Tjaša Arčon等研究人员在斯洛文尼亚研究机构创建,旨在为斯洛文尼亚语提供大规模、高质量的指令微调数据。该数据集从NVIDIA发布的Nemotron-SFT-General子集中采样,并利用专门的翻译模型将英文文本精准转换为斯洛文尼亚语,从而有效弥补了该语言在预训练和指令微调阶段的数据匮乏问题。作为PoVeJMo研究计划与SloLLaMai项目的重要成果,该数据集不仅推动了低资源语言大语言模型的发展,还为相关领域的跨语言迁移学习提供了宝贵的基准资源。
当前挑战
该数据集所面临的核心挑战在于解决资源稀缺语言的领域问题,即斯洛文尼亚语在预训练指令微调阶段缺乏大规模、多样化的高质量语料,导致模型在理解和生成该语言文本时性能受限。在构建过程中,主要挑战包括:如何从庞杂的英文源数据中筛选出适合斯洛文尼亚语特点的高质量子集;如何确保机器翻译模型(如GaMS-DPO-Translator)在处理长文本、领域术语和文化特定表达时保持语义忠实度与语言自然度;以及如何有效处理约900k文档的翻译一致性,避免因语境截断而导致的信息丢失或歧义。这些技术难题的克服,直接决定了数据集在提升低资源语言模型能力方面的效用与可靠性。
常用场景
经典使用场景
在自然语言处理领域,Nemotron-Pretraining-SFT_translated数据集的核心用途在于为低资源语言——斯洛文尼亚语——提供大规模、高质量的指令微调(Supervised Fine-Tuning, SFT)数据。该数据集源自NVIDIA的Nemotron-Pretraining-SFT-v1,经由先进的翻译模型GaMS-DPO-Translator完成语种迁移,保留了原始数据中丰富的任务类型与对话结构。研究者常将其作为构建斯洛文尼亚语指令跟随模型的基础训练语料,用于提升模型在多轮对话、文本生成、知识问答等任务上的表现。此外,该数据集同样适用于跨语言迁移学习的研究,探索从英语到斯洛文尼亚语的知识传递效率与语言适配策略。
解决学术问题
该数据集有力回应了低资源语言大语言模型(LLM)发展中数据匮乏的瓶颈问题。传统上,斯洛文尼亚语等小语种面临高质量指令数据稀缺的困境,限制了其大语言模型在复杂语义理解与生成任务上的性能。Nemotron-Pretraining-SFT_translated通过系统性地将大规模英文SFT数据翻译为斯洛文尼亚语,为学术界提供了首个公开可用的、量级达90万条指令的斯洛文尼亚语微调基准。这不仅填补了该语种在指令微调维度上的数据空白,还为评估不同翻译策略对模型下游能力的影响提供了实验基础,推动了多语言LLM鲁棒性与泛化能力的理论研究。
实际应用
在实际应用中,该数据集赋予了斯洛文尼亚语大语言模型(LLM)在真实场景中的部署能力。基于此数据集训练的指令模型可被集成至斯洛文尼亚本土的数字政务系统、智能客服平台以及教育辅助工具中,实现流畅的本地语言交互。例如,在公共信息咨询场景下,模型能够精准理解公民用斯洛文尼亚语提出的政策问题并给出合规答复;在学术领域,研究者可利用该数据集构建斯洛文尼亚语学术写作助手或文献摘要工具。此外,该数据集同样适用于医疗问诊、法律文本翻译等对语言精确性要求较高的行业,显著降低了低资源语言中NLP技术的应用门槛。
数据集最近研究
最新研究方向
在低资源语言大模型构建的前沿探索中,Nemotron-Pretraining-SFT_translated 数据集的出现为斯洛文尼亚语等小众语言的指令微调开辟了新路径。该数据集基于英伟达原版指令数据,借助先进的翻译模型实现了跨语言知识迁移,其高达900k样本的规模与约8.89亿词的内容,为训练强健的斯洛文尼亚语指令模型提供了宝贵资源。这一工作不仅呼应了欧盟推动的AI4DH等大型数字人文项目,更彰显了在全球化背景下守护语言多样性的深层意义——通过高质量翻译数据桥接,使前沿大语言模型能力得以惠及更广泛的非英语社群,加速了多语言NLP的民主化进程,对平衡全球AI生态具有不可忽视的战略价值。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务