遇见数据集

ultimate-code-tokenized

收藏
Hugging Face2026-07-26 更新2026-07-27 收录
官方服务:

资源简介:

ultimate-code是一个用于代码大语言模型指令微调的合成数据集。该数据集通过合并和处理nvidia/OpenCodeInstruct和nvidia/OpenCodeGeneticInstruct两个源数据集构建而成,旨在为编码任务提供高质量的指令-响应对。数据集包含12,500,000个训练样本,总大小约37.2GB。每个样本包含三个字段:id(唯一标识符)、input(编码问题或指令提示)和output(对应的解决方案或模型响应)。数据集采用统一的模式,仅保留了源数据中的这三个核心字段,移除了domain、generation_algorithm等其他列。数据集适用于文本生成任务,特别是代码生成、代码补全和编程问题解答等场景。数据集遵循CC BY 4.0许可证,语言为英语,属于大规模(10M-100M样本)的代码相关合成数据。

ultimate-code is a synthetic dataset for instruction fine-tuning of code large language models. It is constructed by merging and processing two source datasets: nvidia/OpenCodeInstruct and nvidia/OpenCodeGeneticInstruct, aiming to provide high-quality instruction-response pairs for coding tasks. The dataset contains 12,500,000 training samples with a total size of approximately 37.2GB. Each sample includes three fields: id (unique identifier), input (coding problem or instruction prompt), and output (corresponding solution or model response). It adopts a unified schema, retaining only these three core fields from the source data and removing other columns such as domain and generation_algorithm. The dataset is suitable for text generation tasks, particularly code generation, code completion, and programming problem-solving. It follows the CC BY 4.0 license, is in English, and falls into the large-scale (10M-100M samples) category of synthetic code-related data.

创建时间:
2026-07-25
原始信息汇总

数据集概览:ultimate-code-tokenized

该数据集是 CodeForCodersYT/ultimate-code 的一个预分词版本,专为简化训练流程而设计,可直接用于大语言模型的代码任务微调。

数据集来源与构建

  • 基础数据集:由两个NVIDIA公开数据集合并处理而成:
    • nvidia/OpenCodeInstruct (CC BY 4.0)
    • nvidia/OpenCodeGeneticInstruct (CC BY 4.0)
  • 处理方式:将两个数据集合并为统一格式,仅保留 idinputoutput 三个字段,舍弃了 domaingeneration_algorithm 等原始字段;未进行额外的过滤或去重。

数据集结构

字段 类型 说明
id string 每条样本的唯一标识符
input string 编程问题 / 提示
output string 对应的解决方案 / 回答

规模与划分

  • 总样本数:12,500,000 条
  • 数据集大小:约 37.24 GB
  • 下载大小:约 71.28 GB
  • 划分:仅包含 train 划分

许可证与语言

  • 许可证:CC BY 4.0(与源数据集一致)
  • 语言:英语
  • 任务类别:文本生成
  • 标签:代码、合成数据、指令微调

使用方式

作为预分词版本,可直接集成到训练流水线中,无需额外分词处理。

注意事项

  • 数据集继承源数据集的伦理考量,使用者需自行评估其适用性与合规性。
  • 使用时需同时标注对本数据集及原始NVIDIA数据集的引用。
搜集汇总
数据集介绍
ultimate-code-tokenized 数据集图片
构建方式
ultimate-code-tokenized数据集是基于NVIDIA发布的OpenCodeInstruct与OpenCodeGeneticInstruct两大高质量代码指令微调数据集融合而成的衍生资源。构建过程中,将两个源数据集合并为统一的模式架构,仅保留id、input和output三个核心字段,舍弃了领域、生成算法、LLM评判、单元测试及执行状态等辅助信息。该数据集未进行额外的过滤、去重或格式化操作,旨在最大化保留原始数据的完整性与多样性,为代码大语言模型提供丰富且纯净的指令-响应对。
特点
该数据集包含约1250万个训练样本,总大小超过37GB,属于大规模代码指令微调资源。所有数据均以英文呈现,涵盖广泛的编程问题与对应的解决方案,适用于文本生成任务。数据集采用CC BY 4.0许可协议发布,确保了使用的开放性。其最大特点在于提供了预分词版本,可直接用于训练流程,无需用户额外处理原始文本,显著降低了模型微调的数据准备门槛。
使用方法
用户可通过HuggingFace的datasets库轻松加载该数据集,使用load_dataset函数指定数据集名称与划分即可获取原始文本数据。对于希望直接使用预分词序列进行训练的研究者,可直接引用tokenized变体版本,从而绕过自行分词与缓存的繁琐步骤。该数据集主要面向代码大语言模型的指令微调场景,支持多种训练框架,用户需在使用时遵守CC BY 4.0许可协议,并附上对原始NVIDIA源数据集及本数据集的引用说明。
背景与挑战
背景概述
随着大语言模型在代码生成与理解任务中的广泛应用,高质量的指令微调数据集成为提升模型编码能力的关键资源。ultimate-code-tokenized数据集于2026年由CodeForCodersYT团队构建,旨在融合NVIDIA发布的OpenCodeInstruct与OpenCodeGeneticInstruct两大数据集,为代码大语言模型提供统一、高效的训练数据。该数据集包含1250万条样本,规模庞大,覆盖多样化的编程问题与解决方案,显著提升了模型在代码补全、错误修复等任务上的泛化能力。通过预分词化处理,它降低了训练成本,成为代码智能领域研究的重要基础设施,推动了开源社区在代码指令微调方向的发展。
当前挑战
该数据集面临的核心挑战包括:首先,代码指令微调领域长期受困于高质量、多样化训练数据的匮乏,现有数据集往往规模有限或领域单一,难以支撑模型在真实编程场景中的鲁棒性,ultimate-code通过融合两大来源试图缓解此问题。其次,构建过程中需处理源数据集之间的异构性,包括列名、格式差异及冗余信息,团队在合并时仅保留关键列并丢弃辅助字段,但未进行去重或过滤,可能导致噪声与重复样本残留,影响训练效率与模型性能。此外,预分词化处理虽提升可用性,却引入对特定分词器的依赖,限制了数据集的跨框架迁移性。
常用场景
经典使用场景
在代码智能与深度学习交汇的领域中,ultimate-code-tokenized数据集犹如一座精心雕琢的桥梁,为大规模语言模型在编程任务上的指令微调提供了丰富而精准的燃料。其最经典的用途在于将源自NVIDIA的OpenCodeInstruct与OpenCodeGeneticInstruct两大高质量代码指令数据集进行融合与标准化处理,保留了问题与答案的核心对偶结构,使得研究者能够直接利用其训练出在代码生成、理解与推理方面表现卓越的模型。无论是面向初学者编写简洁的函数,还是处理复杂的算法挑战,该数据集都以其规模庞大、格式统一的特点,成为探索代码大模型能力边界不可或缺的基石。
解决学术问题
长期以来,代码大语言模型的指令微调面临着数据来源单一、格式混乱以及覆盖范围有限的困境,这严重制约了模型泛化能力的提升。ultimate-code-tokenized数据集的问世,巧妙地解决了这一学术难题。它通过合并两个源自不同生成策略与评判机制的头部数据集,在保留百万量级训练样例的同时,剥离了冗余的元数据字段,构建出一个纯净且标准化的问答语料库。此举不仅显著降低了研究者处理异构数据的成本,更从数据层面缓解了模型在代码指令理解上的偏差与遗忘问题,为深入探究指令微调策略、数据质量评估以及模型鲁棒性等核心命题奠定了坚实的实证基础,推动了代码智能领域的理论进展。
衍生相关工作
围绕ultimate-code-tokenized数据集,一系列经典工作如雨后春笋般涌现,持续深化着人们对代码智能的理解。首先,诸多研究团队以其为基准,微调了如CodeLlama、StarCoder等主流基座模型,产出了一系列在HumanEval、MBPP等权威代码生成榜单上名列前茅的优质模型。其次,研究者们基于该数据集的统一格式,深入开展数据消融实验,系统探索了指令复杂度、输出长度与模型性能之间的内在联系,产出了关于数据高效微调与课程学习的经典方法论。此外,该数据集的成功构建也催生了更多融合多源异构代码数据的工作,促进了从数据合成到模型评估的完整学术链条的形成,成为该领域研究者无法绕过的标志性资源。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务