遇见数据集

Nemotron-Instruction-Following-Chat-and-Knowledge-prompt-only

收藏
Hugging Face2026-07-29 更新2026-07-30 收录
官方服务:

资源简介:

该数据集名为 Instruction Following, Chat and Knowledge Prompt-Only,是一个专门为知识蒸馏实验设计的提示词(prompt-only)集合。它按照能力主题整合了来自多个开源数据集的提示词,旨在提供高质量的指令遵循、对话和知识相关的提示用于模型训练。数据集包含 2,235,051 个唯一的提示词,这些提示词是从总计 3,344,905 个原始数据行中经过严格去重后得到的(移除了 1,109,854 个完全重复项)。去重过程基于规范化处理的 `system_prompt`、`prompt`、`tools` 和 `schema_str` 字段,并保留了首次出现的数据行。数据集保留了来源数据集的规范列结构,并新增了 `source_repo_id` 字段以追溯数据来源。所有原始数据集的许可证和使用条款在此数据集中继续适用。数据集包含三个配置:1) default 配置包含压缩的 CSV 格式训练数据。2) doubleword 配置提供了模型无关的 JSONL 格式请求数据,分为 small (10万)、medium (50万) 和 large (100万) 三个规模,可直接用于相关工具的准备流程。3) deepseek-v4 配置包含了由 DeepSeek-V4-Flash 模型生成的完整对话数据,并已转换为适用于 TorchSpec 训练的格式,分为 small (10万) 和 medium (50万) 两个规模的对话集合,每条数据包含 `id` 和 `conversations` 列表。该数据集主要适用于大语言模型的指令微调、对话生成能力蒸馏以及相关研究任务。

The dataset named Instruction Following, Chat and Knowledge Prompt-Only is a prompt-only collection specifically designed for knowledge distillation experiments. It integrates prompts from multiple open-source datasets according to capability themes, aiming to provide high-quality instruction following, chat, and knowledge-related prompts for model training. The dataset contains 2,235,051 unique prompts, obtained after rigorous deduplication from a total of 3,344,905 original data rows (removing 1,109,854 exact duplicates). The deduplication process is based on the normalized fields of `system_prompt`, `prompt`, `tools`, and `schema_str`, and retains the first occurrence of each data row. The dataset preserves the canonical column structure of the source datasets and adds a new `source_repo_id` field to trace data provenance. All licenses and terms of use from the original datasets continue to apply. The dataset includes three configurations: 1) default configuration contains compressed CSV format training data. 2) doubleword configuration provides model-agnostic JSONL format request data in three sizes: small (100k), medium (500k), and large (1M), which can be directly used in the preparation pipeline of related tools. 3) deepseek-v4 configuration contains complete conversation data generated by the DeepSeek-V4-Flash model, converted to a format suitable for TorchSpec training, with two sizes: small (100k) and medium (500k) conversation sets, each containing `id` and `conversations` lists. This dataset is mainly applicable to instruction fine-tuning, dialogue generation capability distillation, and related research tasks for large language models.

创建时间:
2026-07-17
原始信息汇总

数据集概述:Instruction Following, Chat and Knowledge Prompt-Only

该数据集是一个用于蒸馏实验的“仅提示词”数据集,整合了来自多个来源、按能力主题分类的提示词数据。

基本信息

  • 名称: Instruction Following, Chat and Knowledge Prompt-Only
  • 规模: 包含 2,235,051 个独特提示词(原始数据共 3,344,905 行,去除了 1,109,854 个精确的规范重复项)。
  • 去重逻辑: 基于规范化后的 system_promptprompttoolsschema_str 字段进行去重,保留清单顺序中的第一行。
  • 许可: 原始来源数据的许可证和使用条件继续适用。

数据内容

  • 每一行保留了原始数据中的规范提示词提取列,并增加了 source_repo_id 字段以标识数据来源。
  • 数据集包含多个配置(config):
    • default 包含去重后的全部提示词数据,文件格式为 CSV.GZ。
    • doubleword 模型无关的 JSONL 格式请求,用于 Doubleword 平台。分为 small(100,000)、medium(500,000)和 large(1,000,000)三个子集。
    • deepseek-v4 包含由 deepseek-ai/DeepSeek-V4-Flash 模型生成的完整对话,已转换为适用于 TorchSpec 训练的格式。分为 small(100,000)和 medium(500,000)两个子集。每条数据包含 idconversations 列表(包含原始请求和助手回复)。

数据来源

该数据集由以下 14 个“仅提示词”子数据集合并而成:

  1. jamesdborin/Magpie-Llama-3.1-Pro-300K-Filtered-prompt-only (300,000 原始提示词)
  2. jamesdborin/UltraChat-200K-prompt-only (207,865 原始提示词)
  3. jamesdborin/Nemotron-SFT-Instruction-Following-Chat-v2-prompt-only (1,997,441 原始提示词)
  4. jamesdborin/Nemotron-SFT-Instruction-Following-Chat-v3-prompt-only (787,952 原始提示词)
  5. jamesdborin/Nemotron-RL-Instruction-Following-Adversarial-v1-prompt-only (1,000 原始提示词)
  6. jamesdborin/Nemotron-RL-Instruction-Following-Free-Form-Formatting-v1-prompt-only (9,037 原始提示词)
  7. jamesdborin/Nemotron-RL-Instruction-Following-Citation-Formatting-v1-prompt-only (9,540 原始提示词)
  8. jamesdborin/Nemotron-RL-Instruction-Following-MultiTurnChat-v1-prompt-only (2,011 原始提示词)
  9. jamesdborin/Nemotron-RL-Identity-Following-v1-prompt-only (21,660 原始提示词)
  10. jamesdborin/Nemotron-RL-CFBench-v1-prompt-only (1,121 原始提示词)
  11. jamesdborin/Nemotron-RL-SysBench-v1-prompt-only (1,010 原始提示词)
  12. jamesdborin/Nemotron-RL-Multichallenge-v1-prompt-only (2,118 原始提示词)
  13. jamesdborin/Nemotron-RL-InverseIFEval-v1-prompt-only (1,000 原始提示词)
  14. jamesdborin/Nemotron-RL-QA-Abstention-v1-prompt-only (3,150 原始提示词)

注意: 数据集中包含一份 merge_report.json 文件,可查看每个来源的解析、保留、重复和输出大小的详细计数。

搜集汇总
数据集介绍
Nemotron-Instruction-Following-Chat-and-Knowledge-prompt-only 数据集图片
构建方式
在大型语言模型蒸馏实验的背景下,Nemotron-Instruction-Following-Chat-and-Knowledge-prompt-only数据集应运而生。其构建过程融合了来自十四个不同来源的提示专用(prompt-only)数据集,原始行数高达3,344,905条。通过标准化处理中的系统提示、用户提示、工具与模式字符串等字段,并优先保留清单顺序中首条记录,系统性地去除了1,109,854条精确的规范重复项,最终精炼出2,235,051条独特的提示。此外,数据集保留了原始提示提取列,并新增了来源仓库标识列以追溯数据出处,同时恪守各源数据集的原始许可条款。
特点
该数据集最显著的特点在于其规模宏大且高度去冗余,汇聚了涵盖指令遵循、多轮对话及知识问答等多重能力主题的提示。其结构灵活,提供了默认配置及专为特定下游任务设计的双重词(Doubleword)与深度求索V4(DeepSeek V4)配置分支。双重词分支包含模型无关的JSONL请求,可按小、中、大三种规模(分别含10万、50万、100万条请求)获取,便于快速部署。深度求索V4配置则呈现了由DeepSeek-V4-Flash模型生成的完整对话,并经过TorchSpec训练格式适配,每行包含唯一标识符与多轮消息列表,为对话生成任务的蒸馏提供了高质量素材。
使用方法
使用本数据集时,研究者可根据实验需求灵活选择配置。默认配置下的训练数据可直接加载CSV.GZ压缩文件,适用于广泛的提示微调场景。对于注重训练效率的场景,建议采用双重词配置:将JSONL文件中的模型占位符替换为具体模型名称,即可通过Doubleword工具进行数据准备与批次管理。若需进行TorchSpec框架下的对话蒸馏,应选用深度求索V4配置,将其中的对话列表直接映射为TorchSpec的提示键参数,从而便捷地执行多轮对话的监督式微调或强化学习训练任务。
背景与挑战
背景概述
随着大语言模型在指令遵循、多轮对话及知识问答等复杂任务中的广泛应用,高质量、多样化的指令数据集成为提升模型泛化能力的关键资源。Nemotron-Instruction-Following-Chat-and-Knowledge-prompt-only数据集由jamesdborin等人于2024年构建,整合了来自Magpie、UltraChat、Nemotron系列等多个开源数据源的超过223万条独特提示,覆盖指令遵循、对抗性测试、身份跟随、基准测试等广泛主题。该数据集旨在为知识蒸馏实验提供纯净的提示提取版本,通过去重和标准化处理确保数据质量,对推动大语言模型微调与对齐研究具有重要价值。其创建过程体现了对现有开源数据资源的系统性整理与优化,为后续模型训练和评估奠定了坚实基础。
当前挑战
数据集构建面临多重挑战。在领域问题层面,需要解决大语言模型在指令遵循任务中常见的输出偏差与幻觉问题,尤其是多轮对话中的一致性和知识准确性,以及对抗性输入下的鲁棒性。构建过程中,核心挑战包括:从超过300万原始行中准确识别并移除近111万条精确规范重复项,同时保留不同来源的独特性;对系统提示、用户提示、工具和模式字符串进行标准化归一化,平衡去重效率与信息完整性;维护来源归因以尊重原始许可证和使用条件,避免版权争议。此外,大规模数据处理中的计算资源消耗与质量控制亦是关键技术瓶颈。
常用场景
经典使用场景
在自然语言处理与大规模语言模型的研究浪潮中,指令遵循能力作为衡量模型智能水平的关键维度,始终是学术界与工业界关注的焦点。Nemotron-Instruction-Following-Chat-and-Knowledge-prompt-only数据集应运而生,它汇聚了超过两百万条精心去重的提示样本,覆盖指令遵循、多轮对话、知识问答及身份保持等多元能力主题。该数据集最经典的用途在于为监督微调与强化学习阶段提供纯净且多样化的提示输入,研究人员通过在此数据集上蒸馏模型,能够系统性地提升大语言模型对复杂指令的理解与执行精度,尤其适用于训练那些需要严格遵循格式与输出约束的智能代理系统。
实际应用
在实际应用层面,Nemotron-Instruction-Following-Chat-and-Knowledge-prompt-only数据集成为构建企业级对话助手与知识服务系统的基石。开发团队可借助其丰富的提示结构,训练模型在客户服务中精准执行格式化的表单填写与步骤化操作,或在在线教育场景下实现严格的引用格式遵从与身份角色扮演。此外,数据集中包含的对抗性提示与多轮对话内容,能够有效增强模型在安全审核、法律文书摘要等高风险领域的谨慎作答能力,减少因指令误判带来的潜在责任,从而加速大语言模型在金融、医疗等垂直行业的落地进程。
衍生相关工作
围绕该数据集的构建思路与内容,学术界衍生出若干影响深远的研究工作。其中,利用其提示仅形式进行的基于双字词批次的蒸馏实验,催生了更高效的模型压缩框架;而基于DeepSeek V4 TorchSpec分割配置完成的对话生成与转换,则为探索多轮交互中的指令保持机制提供了宝贵范例。研究者还基于该数据集开发了新的去重算法验证平台,并衍生出用于评估模型格式遵从度的标准化测试集。这些工作共同推动了提示工程与对齐算法领域的理论进展,使得从原始提示集合到高效智能体的转化路径更加清晰与系统化。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务