Nemotron-SFT-Multilingual-v2
收藏资源简介:
Nemotron-SFT-Multilingual-v2 是一个用于文本生成模型后训练的多语言监督微调数据集。该数据集通过翻译来自 Nemotron-Math-v2、Nemotron-Competitive-Programming-v1 和 Nemotron-Science-v1 的种子数据生成,旨在扩展对印地语(hi)、韩语(ko)、巴西葡萄牙语(pt-br)以及经过质量刷新的日语(ja)的多语言覆盖。数据集采用新的数据处理流程生成,避免了翻译过程中的换行问题,并使用 DeepSeek-V3-0324 作为翻译模型。种子样本被精简为简洁的 JSON 对象进行翻译,经翻译后通过启发式格式和数据验证过滤器进行检查,最后恢复被剥离的 JSON 字段。其中,STEM(科学、技术、工程、数学)子集还进一步使用 Qwen3-4B-Thinking-2507 大型语言模型进行后编辑,以修复格式不匹配问题。在数据格式上,提示和最终答案以目标语言提供,而推理轨迹则保留为英文,这是为了适配 Nemotron 3 系列模型的架构设计。数据集按领域和语言组织为多个子集,包括代码(code)、数学(math)和 STEM 领域,每个领域下对应四种目标语言。总计包含约 370,081 个对话样本,磁盘占用约 12GB,数据格式为 JSONL。该数据集主要用于后训练大型语言模型,为其补充来自数学、编程和科学种子数据翻译而来的多语言监督微调示例,尤其适用于提升模型在印地语、韩语、巴西葡萄牙语和日语上的表现。数据集基于 CC BY 4.0 和 CC BY-SA 4.0 许可证,可用于商业用途。
Nemotron-SFT-Multilingual-v2 is a multilingual supervised fine-tuning dataset for post-training text generation models. It is generated by translating seed data from Nemotron-Math-v2, Nemotron-Competitive-Programming-v1, and Nemotron-Science-v1, aiming to extend multilingual coverage for Hindi (hi), Korean (ko), Brazilian Portuguese (pt-br), and Japanese (ja) with quality refresh. The dataset is produced using a new data processing pipeline that avoids newline issues during translation, employing DeepSeek-V3-0324 as the translation model. Seed samples are streamlined into concise JSON objects for translation, which are then checked through heuristic format and data validation filters, and stripped JSON fields are restored. The STEM (Science, Technology, Engineering, Mathematics) subset is further post-edited using the Qwen3-4B-Thinking-2507 large language model to fix format mismatches. In terms of data format, prompts and final answers are provided in the target language, while reasoning traces are retained in English, designed to adapt to the architecture of the Nemotron 3 series models. The dataset is organized into multiple subsets by domain and language, including code, math, and STEM domains, each corresponding to four target languages. It contains approximately 370,081 conversation samples, occupies about 12GB of disk space, and is in JSONL format. This dataset is primarily used for post-training large language models, supplementing them with multilingual supervised fine-tuning examples translated from mathematical, programming, and scientific seed data, particularly for enhancing performance in Hindi, Korean, Brazilian Portuguese, and Japanese. The dataset is based on CC BY 4.0 and CC BY-SA 4.0 licenses and is suitable for commercial use.
数据集概述
数据集名称:Nemotron-SFT-Multilingual-v2
所有者:NVIDIA Corporation
创建日期:2026年3月11日
许可证:
- CC BY 4.0:适用于所有合成数据集、代码/SWE 数据集、GPQA 合成数据、CUDA、InfiniByte、ToolUseInteractiveAgent、structured outputs、Terminal Bench、ITS-HelpSteer、Code GenSelect。
- CC BY-SA 4.0:适用于源自 StackOverflow 的数据集(Math GPT-OSS StackOverflow、Lean SFT、Math GenSelect)。
语言覆盖:英语(en)、印地语(hi)、日语(ja)、韩语(ko)、葡萄牙语(pt)。
数据集描述
Nemotron-SFT-Multilingual-v2 是一个多语言监督微调(SFT)数据集,用于文本生成模型的后训练。该数据集通过翻译以下种子数据生成,并增加了对印地语(hi)、韩语(ko)、巴西葡萄牙语(pt-br)以及刷新后的日语(ja)的多语言覆盖:
数据生成流程采用新的处理管道,避免翻译过程中的换行问题,并使用 DeepSeek-V3-0324 作为翻译模型。种子示例被精简为简洁的 JSON 对象进行翻译,翻译后通过启发式格式和数据验证过滤器检查,然后恢复被精简的 JSON 字段。STEM 子集进一步使用 Qwen3-4B-Thinking-2507 进行后编辑,以修复格式不匹配问题。
数据集中提供目标语言的提示和最终答案,而推理轨迹保留为英语。
预期用途
该数据集用于后训练大型语言模型,特别是提高印地语、韩语、巴西葡萄牙语和日语的多语言 SFT 数据覆盖。可补充现有的 SFT 混合数据,提供源自数学、编程和科学种子数据的翻译多语言示例。
如果与上一版本 Nemotron-SFT-Multilingual-v1 一起使用,建议用本版本的高质量日语数据替换旧版日语数据,然后合并两个数据集并根据需要平衡语言分布。
由于数据集翻译自现有种子数据,不旨在增加特定语言地区的本地或区域知识。
数据集特征
- 数据收集方法:混合方式。种子数据取自 Nemotron-Math-v2、Nemotron-Competitive-Programming-v1 和 Nemotron-Science-v1,额外的多语言数据通过 DeepSeek-V3-0324 合成翻译生成。
- 标注方法:合成方式。翻译由 DeepSeek-V3-0324 生成。STEM 子集进一步由 Qwen3-4B-Thinking-2507 进行后编辑以修复格式不匹配问题。过滤仅基于启发式格式检查和数据验证规则。
数据集格式
- 模态:文本
- 格式:JSONL
- 结构:文本 + 元数据
数据集量化
数据集包含大约 370,081 条对话样本(磁盘占用约 12GB)。各子集样本数量如下:
| 子集 | 样本数 |
|---|---|
| code_hi | 34,845 |
| code_ja | 34,358 |
| code_ko | 34,923 |
| code_pt | 34,822 |
| math_hi | 19,911 |
| math_ja | 34,926 |
| math_ko | 34,913 |
| math_pt | 33,199 |
| stem_hi | 26,638 |
| stem_ja | 6,165 |
| stem_ko | 11,810 |
| stem_pt | 63,571 |
| 总计 | 370,081 |
伦理考量
NVIDIA 认为可信 AI 是共同责任,已建立政策和实践以支持广泛的 AI 应用开发。开发者应与其内部开发团队协作,确保此数据集满足相关行业和用例的要求,并解决不可预见的产品滥用问题。质量、风险、安全漏洞或 NVIDIA AI 相关问题可报告至:NVIDIA 安全漏洞提交。




