遇见数据集

Nemotron-CC-Math-4plus_translated

收藏
Hugging Face2026-07-21 更新2026-07-22 收录
官方服务:

资源简介:

Nemotron CC-Math 4plus翻译数据集是一个斯洛文尼亚语翻译版本,源数据来自NVIDIA的Nemotron-CC-Math-v1数据集的4plus子集,并经过子采样处理。该数据集通过GaMS-DPO-Translator模型进行自动翻译,旨在支持斯洛文尼亚语的自然语言处理研究,特别是为低资源语言构建指令语言模型。数据集包含约96万个文档,翻译后文本总计约8.74亿斯洛文尼亚语单词。每个样本包含以下字段:id(原始数据标识符)、text(原始英文文本)、metadata(原始元数据,包括WARC文件名、ID、Finemath和Nemocurator的整数与分数评分、类别和使用的模型)、chopped_document(为适应翻译模型上下文窗口而切分的文本单元列表)以及text_sl(斯洛文尼亚语翻译文本)。该数据集适用于机器翻译质量评估、跨语言文本生成、数学内容的多语言处理以及低资源语言模型训练等任务。开发工作属于PoVeJMo研究计划(自适应自然语言处理与大语言模型)下的SloLLaMai项目,资金来源于斯洛文尼亚研究与创新机构、NextGenerationEU和欧盟Horizon Europe计划。数据集采用CC BY 4.0许可证发布。

The Nemotron CC-Math 4plus translation dataset is a Slovenian translation version, sourced from the 4plus subset of NVIDIAs Nemotron-CC-Math-v1 dataset, specifically a subsample. This dataset is automatically translated using the GaMS-DPO-Translator model, aiming to support Slovenian natural language processing research, particularly for building instruction language models for low-resource languages. It contains approximately 960,000 documents, with translated text totaling about 874 million Slovenian words. Each sample includes the following fields: id (original data identifier), text (original English text), metadata (original metadata, including WARC file name, ID, integer and fractional scores from Finemath and Nemocurator, categories, and models used), chopped_document (a list of text units segmented to fit the translation models context window), and text_sl (Slovenian translated text). The dataset is suitable for tasks such as machine translation quality evaluation, cross-lingual text generation, multilingual processing of mathematical content, and training low-resource language models. The development work falls under the SloLLaMai project within the PoVeJMo research initiative (Adaptive Natural Language Processing and Large Language Models), funded by the Slovenian Research and Innovation Agency, NextGenerationEU, and the EU Horizon Europe program. The dataset is released under the CC BY 4.0 license.

创建时间:
2026-07-13
原始信息汇总

数据集概述:Nemotron CC-Math 4plus translation

该数据集是 Nemotron CC Math 数据集的斯洛文尼亚语翻译版本。原始数据集取自 nvidia/Nemotron-CC-Math-v14plus 子集,并使用 cjvt/GaMS-DPO-Translator 模型完成翻译。

数据规模

  • 文档数量:约 96万
  • 翻译后文本:包含约 8.74亿 个斯洛文尼亚语单词

数据规模详情

  • 训练集(train):
    • 文件大小:12,595,324,755 字节
    • 样本数量:959,058 条
  • 下载大小:6,306,067,561 字节

数据结构

每条数据包含以下字段:

  • id:源数据集中的原始标识符
  • text:原始英文文本
  • metadata:源数据集的元数据(包括 WARC 文件名、ID、数学分数、类别、所用模型等)
  • chopped_document:为适配翻译模型上下文窗口而切分的文本单元列表
  • text_sl:英文文本对应的斯洛文尼亚语翻译

许可协议

该数据集采用 CC BY 4.0 许可协议发布。

搜集汇总
数据集介绍
Nemotron-CC-Math-4plus_translated 数据集图片
构建方式
该数据集源自NVIDIA发布的Nemotron-CC-Math-v1语料库,聚焦于其中评分超过4分的数学子集。研究团队利用专为斯洛文尼亚语设计的GaMS-DPO-Translator模型,将原始英文数学文本逐段翻译为斯洛文尼亚语。为确保长文档适配模型上下文窗口的限制,原文被切分为若干更小的文本单元,翻译后再整合为完整的斯洛文尼亚语文本。最终构建包含约96万条文档、约8.74亿斯洛文尼亚词语的高质量数学语料集。
特点
数据集保留了原始英文文本、元数据及唯一标识符,同时新增斯洛文尼亚语翻译字段和切分文档记录。其核心特色在于聚焦高难度数学内容(4分以上子集),并通过专业翻译模型保证跨语言语义保真度。元数据中涵盖FineMath和NemoCurator的多维评分,便于研究者按质量或主题进行筛选。此外,数据规模适中,既覆盖足够丰富的数学领域知识,又便于低资源场景下的训练与评估。
使用方法
该数据集可直接用于斯洛文尼亚语数学大语言模型的预训练或指令微调。用户可通过`text_sl`字段获取斯洛文尼亚语翻译文本,结合`text`字段进行双语对照学习或跨语言任务。`metadata`中的评分信息(如`finemath_scores`)可用于过滤低质量或特定难度级别的样本。数据以HuggingFace Datasets格式存储,支持按`train`分割加载,适合与Transformers等框架无缝集成。
背景与挑战
背景概述
Nemotron-CC-Math-4plus_translated数据集由斯洛文尼亚研究团队于2026年发布,依托于PoVeJMo研究计划及SloLLaMai项目,核心研究机构包括卢布尔雅那大学等。该数据集专注于数学文本的斯洛文尼亚语翻译,旨在为低资源语言构建强大的指令语言模型,解决了多语言自然语言处理中数学领域数据匮乏的核心问题。其原始来源为英伟达的Nemotron-CC-Math-v1,通过GaMS-DPO-Translator模型进行翻译,涵盖约96万篇文档及8.74亿斯洛文尼亚语词汇,显著推动了低资源语言在数学推理与语言模型训练领域的研究进展。
当前挑战
该数据集面临的核心挑战包括:领域问题方面,数学文本的语言抽象性与逻辑严谨性对翻译质量提出高要求,斯洛文尼亚语缺乏大规模高质量数学语料,导致模型在维持术语准确性与上下文一致性上困难重重;构建过程中,需处理原始文档的上下文窗口限制,通过切分为更小子单元以确保翻译可行性,同时需平衡翻译效率与语义保真度,并解决多源评分(如finemath_scores)与翻译结果对齐的复杂性,最终在CC BY 4.0许可下开放,服务于低资源语言的学术与工业应用。
常用场景
经典使用场景
在自然语言处理领域,Nemotron-CC-Math-4plus_translated数据集主要服务于低资源语言——斯洛文尼亚语的数学科学文本理解与生成任务。该数据集源自NVIDIA的Nemotron-CC-Math-v1,并经由先进的翻译模型GaMS-DPO-Translator精心处理,将英文数学文档转化为高质量斯洛文尼亚语语料。研究者通常利用其近96万篇涵盖多种数学范畴的文档,构建和微调面向数学领域的语言模型,从而提升模型在斯洛文尼亚语数学推理、问题求解以及技术文献处理上的能力。这一数据集的出现有效弥补了斯洛文尼亚语在高质量数学语料方面的匮乏,为该语言下的AI研究提供了坚实的数据基础。
实际应用
在实际应用层面,该数据集直接服务于斯洛文尼亚语智能教育系统的开发,例如自动化数学题解答、个性化学习辅导及科学文献的智能摘要与问答。基于此数据集训练的模型能够理解当地数学教材与习题,为学生提供实时反馈和解释。此外,它还支持斯洛文尼亚语的技术文档翻译、学术论文辅助撰写以及科技情报的自动化处理,帮助科研人员快速获取和整理信息。在公共领域,该数据集也可用于构建智能客服或信息检索系统,提升斯洛文尼亚用户获取数学和科学知识的效率,具有显著的社会经济价值。
衍生相关工作
Nemotron-CC-Math-4plus_translated的诞生直接催生了多项相关研究。其中最具代表性的是提出GaMS-DPO-Translator模型的原始工作,该模型专为低资源语言的高保真翻译优化,其方法可推广至其他领域。另一项重要工作是论文《Building a Strong Instruction Language Model for a Less-Resourced Language》,该文详细阐述了如何利用该数据集构建强大的斯洛文尼亚语指令语言模型,证明了数据增强与翻译策略的有效性。此外,该数据集也为跨语言数学推理基准测试的开发提供了基础,并启发了后续研究者在其他语种上复用类似的数据合成流水线,形成了面向少数民族语言的人工智能基础设施构建新范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务