遇见数据集

Nemotron-Coding-and-Software-Engineering-prompt-only

收藏
Hugging Face2026-07-25 更新2026-07-27 收录
官方服务:

资源简介:

本数据集是一个专为模型蒸馏实验设计的、按能力主题组合的提示(prompt)数据集,聚焦于编程与软件工程领域。它整合了来自8个不同来源的提示数据,经过规范化去重处理,最终包含1,964,794个唯一提示(源自5,827,983条原始数据行,移除了3,863,189个完全相同的重复项)。数据行保留了标准的提示提取列,并新增了 `source_repo_id` 字段以追溯数据来源。去重过程基于 `system_prompt`、`prompt`、`tools` 和 `schema_str` 字段的规范化值进行,并保留在清单顺序中首次出现的行。原始数据源的许可证和使用条款继续适用。数据集提供了三种配置:默认配置包含主要的去重提示数据;doubleword 配置提供了规模分别为10万、50万和100万请求的、模型无关的JSONL批次,适用于 `dw files prepare`;deepseek-v4 配置则包含10万条由 DeepSeek-V4-Flash 模型生成的完整编程对话,并已转换为适用于 TorchSpec 训练的格式,每条数据包含 `conversations`(原始请求消息及助手回复)、`reasoning_content`(模型返回的独立推理内容)、`tool_calls`(无损保留的OpenAI格式函数调用)和 `tools`(原始请求的工具定义)字段。该数据集适用于代码生成、软件工程任务相关的模型训练、蒸馏和评估。

This dataset is a prompt dataset designed for model distillation experiments, organized by capability themes and focused on programming and software engineering. It integrates prompt data from eight different sources, undergoes normalization and deduplication, and ultimately contains 1,964,794 unique prompts (derived from 5,827,983 original data rows, with 3,863,189 exact duplicates removed). Data rows retain standard prompt extraction columns and add a `source_repo_id` field to trace data origins. Deduplication is based on normalized values of the `system_prompt`, `prompt`, `tools`, and `schema_str` fields, preserving the first occurrence in the list order. Licenses and terms of use from the original data sources continue to apply. The dataset offers three configurations: the default configuration contains the main deduplicated prompt data; the doubleword configuration provides model-agnostic JSONL batches of 100k, 500k, and 1 million requests, suitable for `dw files prepare`; the deepseek-v4 configuration includes 100k complete programming conversations generated by the DeepSeek-V4-Flash model, converted into a format suitable for TorchSpec training, with each data entry containing `conversations` (original request messages and assistant responses), `reasoning_content` (independent reasoning content returned by the model), `tool_calls` (losslessly preserved OpenAI-format function calls), and `tools` (tool definitions from the original request) fields. This dataset is applicable for model training, distillation, and evaluation related to code generation and software engineering tasks.

创建时间:
2026-07-17
原始信息汇总

数据集概述

数据集名称:Coding and Software Engineering Prompt-Only(编码与软件工程提示词专用数据集)

数据集用途:该数据集按能力主题整合了多个仅含提示词(prompt-only)的数据集,用于蒸馏实验。


核心统计

  • 唯一提示词数量:1,964,794 条
  • 原始数据行数:5,827,983 行
  • 移除的精确规范重复项:3,863,189 条
  • 去重方法:基于规范化后的 system_promptprompttoolsschema_str 进行去重,保留清单顺序中的首条记录

数据来源

该数据集整合了以下 8 个来源数据集(按原始提示词数量排序):

来源数据集 原始提示词数量
Nemotron-Competitive-Programming-v1-prompt-only 3,927,984
Nemotron-SFT-Competitive-Programming-v2-prompt-only 841,555
Nemotron-SFT-OpenCode-v1-prompt-only 460,254
Nemotron-SFT-SWE-v2-prompt-only 256,254
Nemotron-SFT-SWE-v3-prompt-only 237,970
Nemotron-SWE-v1-prompt-only 51,029
Nemotron-RL-Agentic-SWE-Pivot-v1-prompt-only 50,661
Nemotron-SFT-CUDA-v1-prompt-only 2,276

来源说明:所有来源数据集均属于 jamesdborin 用户下的 Nemotron 系列数据集,涵盖竞争性编程、软件工程(SWE)、CUDA 编程和 OpenCode 等主题。


数据字段

  • 保留各来源数据集规范化的提示词提取列
  • 新增 source_repo_id 字段,用于追踪数据来源
  • 原始来源的许可证和使用条件继续适用

数据集配置

该数据集提供多种配置:

  1. 默认配置(default):包含全部去重后的训练数据,存储为 data/*.csv.gz 格式

  2. Doubleword 批处理配置:模型无关的 JSONL 请求格式,使用 model: "[MODEL]" 占位符,可直接用于 dw files prepare

    • small:100,000 条请求
    • medium:500,000 条请求
    • large:1,000,000 条请求
  3. DeepSeek V4 TorchSpec 配置(deepseek-v4):包含 100,000 条完整的编码对话,由 deepseek-ai/DeepSeek-V4-Flash 生成并转换为 TorchSpec 训练格式


DeepSeek V4 TorchSpec 配置说明

每条数据包含以下字段:

  • conversations:原始请求消息及助手响应
  • reasoning_content:模型返回的独立推理内容
  • tool_calls:保留的 OpenAI 格式助手函数调用
  • tools:原始 OpenAI 格式请求工具定义

特殊处理:请求工具定义同时嵌入系统消息中,以满足 TorchSpec 当前对话加载器的需求;顶层 tools 字段保持不变,供未来工具感知模板使用。conversations 字段可用于 TorchSpec 的 dataset.prompt_key

搜集汇总
数据集介绍
Nemotron-Coding-and-Software-Engineering-prompt-only 数据集图片
构建方式
Nemotron-Coding-and-Software-Engineering-prompt-only数据集由八个源自NVIDIA Nemotron系列模型的提示专属数据集合并而成,涵盖竞赛编程、CUDA编程、软件工程及开放式代码生成等主题。原始数据包含5,827,983条记录,经过去重处理后保留1,964,794条独特提示。去重过程通过标准化系统提示、用户提示、工具定义和模式字符串这四个关键字段,按照数据出现顺序保留首个条目,并删除3,863,189条精确规范重复项。每条记录保留规范提示提取列,并额外添加source_repo_id字段以追溯数据来源。此外,该数据集提供了distillation和doubleword两种配置,前者包含训练集拆分,后者则按规模划分为small、medium和large三个子集。deepseek-v4配置则包含由DeepSeek-V4-Flash模型生成的100,000条完整编码对话。
特点
该数据集的核心特点在于其多源融合与精确去重机制所保证的数据质量与多样性。集成八个不同维度的编程与软件工程提示来源,覆盖从算法竞赛到实际软件开发任务的广泛能力谱系,使模型能够在丰富场景下进行微调与蒸馏实验。去重策略不仅基于提示文本的字符级别匹配,更结合系统提示、工具定义和模式字符串进行规范化比较,从而有效消除语义重复。每条数据均保留原始出处信息,便于研究者追溯数据来源及其原始许可条款。doubleword配置中的三种规模子集可直接用于模型无关的批量请求处理,而deepseek-v4配置则提供了完整的对话结构,包含推理过程、工具调用及系统消息嵌入的工具定义。
使用方法
使用该数据集时,可根据实验目标选择不同配置。对于蒸馏实验,可直接加载default配置下的训练数据,配合source_repo_id字段筛选特定来源的提示。doubleword配置中的JSONL文件已嵌入[MODEL]占位符,可通过dw files prepare命令直接生成模型请求。deepseek-v4配置专为TorchSpec训练设计,其conversations字段包含完整的请求-响应对话对,可作为TorchSpec的dataset.prompt_key使用;尽管当前对话加载器不支持读取同行的其他字段,但工具定义已嵌入系统消息中以确保可用性,同时顶层tools字段保留不变,以支持未来工具感知模板的复用。各来源的合并统计信息可通过merge_report.json文件查阅。
背景与挑战
背景概述
在大型语言模型(LLM)的演进历程中,编程与软件工程能力的提升始终是研究焦点。Nemotron-Coding-and-Software-Engineering-prompt-only数据集由jamesdborin主导构建,于2024年发布,旨在通过蒸馏实验整合高质量提示数据以增强模型在编程领域的表现。该数据集汇聚了来自八个子数据源的近196万个独特提示,涵盖竞争编程、CUDA编程、软件工程及强化学习智能体等多个维度,显著推动了代码生成与软件工程任务的基准研究。其去重机制与溯源设计不仅提升了数据质量,还为后续模型微调与蒸馏实验提供了可靠基石,对相关领域产生了深远影响。
当前挑战
该数据集面临的核心挑战包括:一是解决编程与软件工程领域中模型对复杂任务理解不足、生成代码可执行性与鲁棒性欠佳的问题,需通过多样化提示提升泛化能力;二是在数据构建中,需从近583万原始行中高效去除约386万个完全重复项,同时保留关键属性与许可证合规性,这要求精细的归一化策略与去重算法;三是跨子数据源的异构格式(如JSONL与CSV)整合以及模型无关请求的批次拆分,增加了数据处理复杂度;此外,将工具定义嵌入系统消息以适配TorchSpec训练,需在数据损失与模板兼容间取得平衡。
常用场景
经典使用场景
在代码生成与软件工程领域,大规模提示数据集是驱动大型语言模型能力跃升的基石。Nemotron-Coding-and-Software-Engineering-prompt-only数据集以近两百万条去重提示为核心,汇聚了来自八大专业子集的精华。它最经典的使用场景在于为监督式微调与强化学习提供高质量的提示原料,尤其适用于训练模型应对竞争性编程、CUDA编程、软件工程任务以及开放式代码生成等挑战性场景。研究者可直接利用其开源配置,通过标准化的JSONL格式快速启动批量实验,实现模型在编码逻辑推理与工程实践上的精准对齐。
衍生相关工作
该数据集的融合特性催生了一系列富有影响力的衍生工作。其源数据来自经过验证的专用提示集,如Nemotron-CUDA和Nemotron-SWE系列,为后续研究提供了清晰的血缘谱系。围绕它,研究者已开展知识蒸馏实验,探索将大型教师模型的编码能力高效迁移至轻量学生模型;同时,基于其双字节分批方案,业界孵化出面向海量提示的并行采样框架。此外,该数据集推动了工具增强型对话评估范式的建立,使模型在真实软件工程活动中调用外部API的可靠性成为可量化指标,激发了诸如零样本代码修复、跨语言编程迁移等一系列前沿探索。
数据集最近研究
最新研究方向
该数据集汇聚了近两百万条编程与软件工程领域的纯净提示数据,通过严格的去重策略与多源融合,为知识蒸馏实验提供了高质量的训练基底。当前研究方向聚焦于利用此类大规模提示数据集推动代码智能大模型的泛化能力提升,尤其是在竞争性编程、CUDA优化、软件工程自动化及智能体(Agent)任务中的指令遵循与复杂推理能力。结合业界对高效模型压缩(如DeepSeek V4的TorchSpec训练)与可复现开源基准的迫切需求,本数据集不仅支撑了前沿的蒸馏算法研究,还为跨任务、跨架构的代码生成与软件工程工具链开发奠定了数据基础,对加速大语言模型在开发者工具、自动化测试与智能编程辅助等场景的落地具有重要战略意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务