遇见数据集

Nemotron-Pretraining-Code-v3

收藏
Hugging Face2026-06-04 更新2026-06-05 收录
官方服务:

资源简介:

Nemotron-Pretraining-Code-v3数据集是Nemotron预训练数据集合的一部分,旨在提升大语言模型(LLMs)的编码能力。该数据集包含对应原始源代码更新的元数据,是Nemotron-Pretraining-Code-v2和v1源代码语料库的增量扩展,新增了来自GitHub的1.46亿个新文件(约1730亿个词元),数据截止日期为2025年9月30日。该数据集仅包含增量新文件,必须与v2和v1语料库联合使用。数据集采用单一配置Nemotron-Code-Metadata,包含以下列:commit_id(Git提交哈希的前七个字符)、rel_path(相对于仓库根目录的文件路径)和language(检测到的编程语言)。数据形式为文本,存储格式为Parquet,记录数量为1.463亿个样本,总存储量为8.2 GB。数据收集和标注方法均为自动化。数据集适用于文本生成和预训练任务,标签包括文本、预训练、人类、法律和Nemotron_3_Ultra,语言为代码,规模类别在1亿到10亿之间。数据集基于CC-BY-4.0许可证发布,可用于商业用途,由NVIDIA Corporation于2026年5月18日创建。使用该数据集时,建议引用NVIDIA Nemotron 3 Ultra技术报告,并注意伦理考虑,确保符合相关行业和使用场景的要求。

The Nemotron-Pretraining-Code-v3 dataset is part of the Nemotron pretraining data collection, designed to enhance the coding capabilities of large language models (LLMs). It includes metadata corresponding to updates in original source code, serving as an incremental expansion of the Nemotron-Pretraining-Code-v2 and v1 source code corpora, adding 146 million new files (approximately 173 billion tokens) from GitHub, with data up to September 30, 2025. This dataset contains only incremental new files and must be used in conjunction with the v2 and v1 corpora. It features a single configuration, Nemotron-Code-Metadata, with columns: commit_id (first seven characters of Git commit hash), rel_path (file path relative to the repository root), and language (detected programming language). The data is in text form, stored in Parquet format, with 146.3 million samples and a total storage size of 8.2 GB. Data collection and annotation methods are automated. The dataset is suitable for text generation and pretraining tasks, with tags including text, pretraining, human, legal, and Nemotron_3_Ultra, language as code, and a scale category between 100 million and 1 billion. It is released under the CC-BY-4.0 license, permissible for commercial use, and created by NVIDIA Corporation on May 18, 2026. When using this dataset, it is recommended to cite the NVIDIA Nemotron 3 Ultra technical report and consider ethical implications to ensure compliance with relevant industry and usage scenario requirements.

提供机构:
NVIDIA
创建时间:
2026-05-29
原始信息汇总

数据集概述

  • 名称: Nemotron-Pretraining-Code-v3
  • 所有者: NVIDIA Corporation
  • 创建日期: 2026年5月18日
  • 许可证: Creative Commons Attribution 4.0 International (CC-BY-4.0)
  • 版本: v3(扩展自 v2 和 v1,需合并使用)

任务与标签

  • 任务类别: 文本生成(text-generation)
  • 标签: 文本、预训练、人类、合法、Nemotron_3_Ultra
  • 语言: 代码(code)

数据规模与格式

  • 样本数量: 146.3M(约1.46亿)
  • 数据存储大小: 8.2 GB
  • 数据格式: Parquet
  • 模态: 文本

数据集组成

  • 配置名称: Nemotron-Code-Metadata
  • 数据拆分: 单拆分(train),包含多个 Parquet 文件(part_00000 至 part_00063)
  • 数据列说明:
    • commit_id: Git 提交哈希的前七位字符
    • rel_path: 相对仓库根目录的文件路径
    • language: 检测到的编程语言

数据来源与构建

  • 数据收集方法: 自动化
  • 标注方法: 自动化
  • 数据来源: GitHub,截止日期为2025年9月30日
  • 新增内容: 146M 新文件(173B tokens),仅为增量文件,需与 v2 和 v1 语料库联合使用

用途与引用

伦理与合规

搜集汇总
数据集介绍
Nemotron-Pretraining-Code-v3 数据集图片
构建方式
Nemotron-Pretraining-Code-v3数据集是NVIDIA为提升大型语言模型代码生成能力而精心构建的预训练语料库。作为Nemotron 3系列LLM训练数据的重要组成部分,该数据集在先前发布的v1与v2版本基础上进行了增量扩展,从GitHub平台上采集了截至2025年9月30日的新增源代码文件,共计1.46亿个文件,对应约1730亿个令牌。数据集以Parquet格式存储元数据,每条记录包含提交哈希值前七位、相对于仓库根目录的文件路径以及检测所得的编程语言类型三个字段,旨在与旧版本联合使用以构建完整的代码训练语料。
特点
该数据集最显著的特征在于其增量更新策略和高质量的元数据标注。仅收录v1和v2版本发布后新出现的代码文件,避免了重复数据对模型训练的干扰。元数据中精准标注了文件路径与编程语言类型,便于研究者根据语言类别或项目结构进行灵活筛选。数据集规模庞大(8.2 GB,1.463亿样本),覆盖了丰富的现代代码实践,且采用宽松的CC-BY-4.0许可证,支持商业用途,为开源社区提供了合法、可靠且持续进化的代码预训练资源。
使用方法
使用此数据集时,需将其与Nemotron-Pretraining-Code-v1及v2数据集合并,通过读取Parquet文件中的元数据索引获取对应的源代码内容。开发者可根据语言字段过滤特定编程语言的样本,或按rel_path字段组织文件结构以适配自监督学习任务。数据集已预划分为单一训练集(Nemotron-Code-Metadata),可直接用于文本生成类模型的预训练或微调流程,建议结合NVIDIA Nemotron 3技术报告中描述的训练配置与Cite信息进行引用,以复现官方实验效果。
背景与挑战
背景概述
在大型语言模型(LLM)的演进历程中,预训练数据的质量与规模直接决定了模型在下游任务中的表现。为强化LLM的代码生成与理解能力,NVIDIA于2026年5月18日发布了Nemotron-Pretraining-Code-v3数据集。该数据集由NVIDIA团队主导开发,专为其Nemotron 3系列LLM设计,旨在解决现有模型在复杂编程任务中泛化能力不足的核心问题。作为Nemotron-Pretraining-Code系列的第三版扩展,它新增了来自GitHub的1.46亿份源代码文件,总计约1730亿词元,覆盖2025年9月30日前的代码更新。这一数据集的推出显著丰富了代码预训练的资源储备,为提升LLM的编程推理、错误修复及多语言支持能力奠定了坚实基础,对自然语言处理与软件工程交叉领域产生了深远影响。
当前挑战
该数据集面临的核心挑战涵盖两大层面。在领域问题层面,代码预训练需应对编程语言多样性(如Python、C++、JavaScript等)带来的语义鸿沟,以及代码逻辑的时空依赖性与自然语言文本的显著差异,传统文本预训练范式难以直接迁移。此外,开源代码中普遍存在的冗余、错误或过时片段可能误导模型学习。在构建过程中,数据采集需从海量GitHub仓库中筛选高价值代码,并确保法律合规性——如遵循CC-BY-4.0许可,排除含侵权风险的资源。同时,增量更新策略要求与v1/v2版本无缝衔接,避免重复或冲突标记,这对元数据一致性(如commit_id、语言标签)的自动化标注精度提出了严苛挑战。
常用场景
经典使用场景
在大型语言模型预训练领域,代码数据的质量与时效性对模型编码能力的提升至关重要。Nemotron-Pretraining-Code-v3数据集作为NVIDIA Nemotron 3系列LLM的核心训练资源,专注于提供源自GitHub的高质量源代码元数据。该数据集通过增量方式补充了146M个新文件(约173B tokens),其经典使用场景是与v1和v2版本联合使用,共同构建大规模、时序连续的代码预训练语料库,从而增强模型对现代编程范式、新兴库及最新代码实践的掌握能力。
衍生相关工作
该数据集衍生了一系列探索代码预训练数据规模与时效性影响的经典工作。研究者利用其增量特性,分析了数据新鲜度对模型在HumanEval、MBPP等编程基准上表现的影响,验证了持续更新训练数据的必要性。同时,基于该数据集的元数据结构,相关领域涌现出动态数据筛选与课程学习策略的研究,旨在通过精细化的数据管理进一步优化模型在代码摘要、缺陷检测等下游任务中的专业化性能,推动了代码预训练范式的迭代演进。
数据集最近研究
最新研究方向
在大型语言模型(LLM)的代码生成与理解能力持续演进的前沿,Nemotron-Pretraining-Code-v3数据集代表了面向代码预训练数据的高时效性扩展策略。该数据集作为NVIDIA Nemotron 3系列模型的关键组件,通过引入截至2025年9月30日的146百万个新增代码文件(1730亿token),精准捕捉了开源社区最新的编程范式与库更新。这一增量式迭代方法,与前代v1和v2版本协同使用,有效解决了静态语料库随时间推移产生的知识陈旧问题,为模型在动态演变的软件生态中保持竞争力提供了数据基础。随着GitHub上AI辅助编码工具与自动化工作流的普及,该数据集所涵盖的最新提交元数据,对于训练能够理解现代语法、安全补丁及新兴框架的LLM具有不可替代的学术与工业价值,有力推动了代码智能模型向实时化、可持续演进的方向发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务