遇见数据集

cjvt/Nemotron-CC-Math-4plus_translated

收藏
Hugging Face2026-07-21 更新2026-07-22 收录
官方服务:

资源简介:

该数据集是Nemotron CC-Math数据的斯洛文尼亚语翻译版本,源数据集来自nvidia/Nemotron-CC-Math-v1,是4plus子集的子样本。数据集使用cjvt/GaMS-DPO-Translator模型进行翻译,包含96万份文档,翻译后的文档约有8.74亿斯洛文尼亚语单词。数据结构包括id(从原始数据集保留)、text(原始英文示例)、metadata(从原始数据集保留)、chopped_document(适合翻译模型上下文窗口的较小文本单元列表)和text_sl(英文示例的斯洛文尼亚语翻译)。该数据集在PoVeJMo研究项目(特别是SloLLaMai项目)中开发,受斯洛文尼亚研究机构和欧盟资助,旨在支持斯洛文尼亚语语言模型研究,采用CC BY 4.0许可证。

This dataset is a Slovene translation of the Nemotron CC-Math data, sourced from nvidia/Nemotron-CC-Math-v1 and is a subsample of the 4plus subset. It was translated using the cjvt/GaMS-DPO-Translator model. The dataset contains 960k documents, with translated documents comprising approximately 874 million Slovene words. The data structure includes id (retained from the original dataset), text (original English example), metadata (retained from the original dataset), chopped_document (a list of smaller text units fitting the translator models context window), and text_sl (Slovene translation of the English example). Developed within the PoVeJMo research program, specifically the SloLLaMai project, it is funded by Slovenian research agencies and the European Union to support Slovenian language model research, and is released under the CC BY 4.0 license.

提供机构:
cjvt
搜集汇总
数据集介绍
cjvt/Nemotron-CC-Math-4plus_translated 数据集图片
构建方式
Nemotron-CC-Math-4plus_translated数据集源于NVIDIA发布的Nemotron-CC-Math-v1语料库,聚焦于其中评分门槛较高的4plus子集。为确保小语种资源匮乏场景下高效建模,研究团队采用基于斯洛文尼亚语的GaMS-DPO-Translator模型,对原始英文数学文本进行逐句机器翻译。翻译过程中,原始文档被切分为适配模型上下文窗口的文本块(chopped_document),最终生成同源的双语平行结构,为低资源语言提供高质量的数学领域训练数据。
特点
该数据集包含约96万篇文档,译后文本涵盖约8.74亿斯洛文尼亚语词汇,规模显著且领域聚焦于数学内容。每条样本保留原始英文文本(text)与完整元数据(metadata),包括来源文件标识和质量评分(如finemath_scores、nemocurator_scores),同时提供斯洛文尼亚语翻译(text_sl)及文本分块信息。这种多字段结构兼顾数据溯源与语言适配,凸显了在数学教育场景下提升小语种模型推理能力的应用价值。
使用方法
数据集以HuggingFace Datasets标准格式存储,提供default配置下的训练分片(train-*),可通过load_dataset函数直接加载。用户可灵活调用原始英文文本与斯洛文尼亚语翻译字段,适用于机器翻译评估、数学知识蒸馏或低资源语言大模型微调。建议在任务中结合metadata中的质量评分筛选高频词汇样本,或利用chopped_document字段控制输入长度,以优化模型在斯洛文尼亚语数学推理任务中的表现。
背景与挑战
背景概述
Nemotron-CC-Math-4plus_translated数据集由斯洛文尼亚研究团队于2026年构建,依托PoVeJMo研究项目与SloLLaMai计划,由卢布尔雅那大学等机构的研究人员主导开发。该数据集聚焦低资源语言(斯洛文尼亚语)的数学推理能力提升,通过翻译NVIDIA发布的Nemotron-CC-Math-v1数据子集,为斯洛文尼亚语大语言模型提供高质量数学训练语料。其核心研究问题在于如何利用跨语言迁移技术,缓解非英语语言在科学、技术、工程和数学(STEM)领域训练数据匮乏的困境。该数据集涵盖约96万篇文档、8.74亿斯洛文尼亚语词汇,采用GaMS-DPO-Translator模型进行专业翻译,并保留原始元数据以支持细粒度筛选。作为斯洛文尼亚首个大规模数学推理语料库,它为低资源语言的自然语言处理研究提供了重要基准,并推动了多语言数学推理能力的评估与开发。
当前挑战
该数据集主要应对两大挑战。领域问题层面,低资源语言如斯洛文尼亚语在数学推理任务中面临严重的数据稀缺性,现有模型多依赖英语训练数据,导致跨语言泛化性能不足,而直接训练又受限于标注成本与专业术语的匮乏。构建过程中,翻译质量是核心难题:数学文本需要精确保留符号、公式与逻辑结构,机器翻译可能引入歧义或语义偏差,因此研究团队采用分块翻译策略(chopped_document)以适应模型上下文窗口,但长文本的连贯性与专业术语的准确性仍需验证。此外,数据筛选依赖FineMath和NemoCurator等评分系统,如何平衡难易样本分布(仅保留4+高难度子集)并避免翻译噪声累积,成为保持数据质量的关键挑战。
常用场景
经典使用场景
Nemotron-CC-Math-4plus_translated数据集作为斯洛文尼亚语数学语料库的典型代表,其经典用途在于为低资源语言的大语言模型提供高质量的数学推理训练数据。该数据集包含约96万篇文档,涵盖近8.74亿斯洛文尼亚语词汇,通过将英文数学内容精准翻译为斯洛文尼亚语,有效弥补了该语言在数学领域高质量文本匮乏的困境。研究人员常利用此数据集对预训练模型进行领域适配微调,以提升模型在数学问题求解、逻辑推理和符号计算等任务中的表现,尤其适用于构建面向斯洛文尼亚语用户的智能教育工具和学术研究平台。
解决学术问题
该数据集有效解决了低资源语言在数学自然语言处理研究中面临的数据稀缺与领域偏移两大核心难题。在学术层面,它为研究者提供了一个规模宏大、标注一致且经过质量筛选的斯洛文尼亚语数学语料库,从而支撑了多项基础性研究问题的探索,包括跨语言数学推理能力迁移、少样本学习下的复杂问题求解以及语言模型数学知识的内化机制。该数据集的发布推动了低资源语言大模型的理论发展,为验证多语言模型在数学领域通用性提供了关键基准,并促进了语言技术与教育公平的交叉研究。
衍生相关工作
基于Nemotron-CC-Math-4plus_translated数据集,学术界衍生了一系列重要的研究工作。其中最具代表性的是利用该数据微调斯洛文尼亚语指令语言模型,探索低资源语言中数学推理能力的增强策略,相关成果已发表于顶级自然语言处理会议。同时,该数据集被用作构建多语言数学基准测试套件的核心组件,支撑了跨语言模型数学能力对比研究。此外,围绕该数据集的翻译质量评估、领域适配微调方法以及知识蒸馏技术,衍生出多项系统性研究,共同推动了低资源语言数理自然语言处理领域的快速发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务