遇见数据集

Nemotron-RL-Instruction-Following-Citation-Formatting-v1-prompt-only

收藏
Hugging Face2026-06-27 更新2026-06-29 收录
官方服务:

资源简介:

Nemotron-RL-Instruction-Following-Citation-Formatting-v1-prompt-only 是一个专门从源数据集 nvidia/Nemotron-RL-Instruction-Following-Citation-Formatting-v1 中提取的提示集合数据集,专注于指令遵循和引文格式化任务。它属于Nemotron项目的一部分,专为强化学习后训练场景设计,标签包括 nemotron、prompt-only 和 post-training。数据集核心文件为 prompts.csv,包含9540条提取记录,每条记录提供用户提示、分离的系统提示以及结构化的可用工具定义(当源行定义了工具时),其中嵌套值以JSON格式编码存储在CSV单元格中。此外,数据集还包括 summary.md(提供源行数、提取行数、行数差异和失败提示计数的统计摘要)和 null_or_empty_rows.md(记录提示提取为空或无效的行索引)。统计摘要显示提取行数为9540,失败行数为0,行数差异为0,表明数据提取完整且无错误。该数据集由 jamesdborin 通过 Nemotron Post-Training v3 提示提取工作流上传,适用于语言模型的指令微调、强化学习对齐或任务特定评估,尤其适合需要结构化提示和工具定义的研究与应用。

Nemotron-RL-Instruction-Following-Citation-Formatting-v1-prompt-only is a prompt-only dataset specifically extracted from the source dataset nvidia/Nemotron-RL-Instruction-Following-Citation-Formatting-v1, focusing on instruction-following and citation formatting tasks. It is part of the Nemotron project, designed for reinforcement learning post-training scenarios, with labels including nemotron, prompt-only, and post-training. The core file is prompts.csv, containing 9,540 extracted records, each providing a prompt (user prompt), a separate system_prompt, and structured tools (available tool definitions when defined in the source row), with nested values encoded in JSON format within CSV cells. Additionally, the dataset includes summary.md (providing statistical summaries of source row count, extracted row count, row difference, and failed prompt count) and null_or_empty_rows.md (recording row indices where prompt extraction was null or invalid). The statistical summary shows an extracted row count of 9,540, failed row count of 0, and row difference of 0, indicating complete and error-free data extraction. This dataset was uploaded by jamesdborin via the Nemotron Post-Training v3 prompt extraction workflow and is suitable for instruction fine-tuning of language models, reinforcement learning alignment, or task-specific evaluation, particularly for research and applications requiring structured prompts and tool definitions.

创建时间:
2026-06-26
搜集汇总
数据集介绍
Nemotron-RL-Instruction-Following-Citation-Formatting-v1-prompt-only 数据集图片
构建方式
该数据集源自NVIDIA发布的Nemotron-RL-Instruction-Following-Citation-Formatting-v1原始数据集,经由后训练提示提取工作流进行精炼处理。从原始数据中逐行提取提示信息,形成仅包含提示内容的精简版本。每条记录保留原始输入中的用户提示、系统提示,并在存在可用工具定义时,以JSON编码形式嵌入结构化工具信息。最终生成包含9540条有效提示记录的数据集,无提取失败情况,保证了数据完整性与可用性。
特点
该数据集聚焦于指令遵循与引文格式化的强化学习场景,以提示纯文本形式呈现,剔除了冗余信息。每条数据均明确区分用户提示与系统提示,同时保留工具调用的结构化定义,便于模型学习复杂交互中的格式约束与工具使用逻辑。数据规模适中,格式统一,为后训练阶段的对齐优化提供了高质量的输入素材,尤其适用于提升模型在引用规范与指令执行方面的精准度。
使用方法
数据集以CSV格式存储,通过prompts.csv文件提供,支持直接读取。使用时需解析CSV单元格中的JSON编码字段以获取结构化工具信息。推荐与深度学习框架(如PyTorch或TensorFlow)结合,将提示文本转化为模型输入序列,用于监督学习或强化学习训练。该数据集专为后训练阶段设计,可用于指令微调、偏好对齐或格式约束学习任务,无需额外预处理即可快速集成到现有训练流水线中。
背景与挑战
背景概述
该数据集由NVIDIA研究团队于2023年创建,隶属于Nemotron项目后训练阶段,旨在提升大语言模型在指令遵循与引用格式生成方面的能力。核心研究问题聚焦于如何通过强化学习优化模型对复杂格式指令的精准响应,例如在学术写作或技术文档中自动生成符合规范的引用。作为Nemotron系列中专门针对引用格式化的指令微调数据集,它填补了现有数据集在结构化输出验证基准上的空白,为后续的模型对齐训练提供了关键资源,尤其对依赖精确引用格式的科研自动化领域具有重要影响。
当前挑战
当前挑战主要涵盖两个层面:在领域问题层面,大语言模型在处理需严格遵循格式规范的任务时(如引用标注),常出现格式混乱或忽略指令中嵌套约束的问题,该数据集需解决如何让模型在自由生成与格式约束间取得平衡。在构建层面,从源数据集提取提示时需确保系统提示与工具定义的完整性,避免因数据倾斜导致模型对特定格式的过拟合;同时,9540条记录的规模限制了其对长尾引用样式的覆盖,且缺乏多轮交互场景的标注,增加了跨领域泛化的难度。
常用场景
经典使用场景
在大型语言模型的后训练阶段,指令遵循与引用格式的一致性训练至关重要。Nemotron-RL-Instruction-Following-Citation-Formatting-v1-prompt-only数据集专注于为强化学习微调提供高质量的提示文本,这些提示精心设计以引导模型生成严格遵循特定引用格式的响应。其经典使用场景在于作为偏好对齐的数据源,通过奖励模型或直接偏好优化,强化模型在生成引用内容时兼顾格式规范与指令理解的综合能力。
衍生相关工作
该数据集衍生的相关工作主要集中在后训练偏好对齐与检索增强生成领域。受其启发,研究人员探索了将指令引用格式约束融入模型的奖励模型构建,催生了如Nemotron系列中更复杂的多轮对话格式控制方法。此外,它推动了结合外部知识库的引用规范性研究,使得模型在生成时能动态检索并准确格式化引用,为自动化科学写作与知识密集型对话系统提供了强有力的技术支撑。
数据集最近研究
最新研究方向
该数据集聚焦于后训练阶段中指令遵循与引用格式的强化学习对齐,是当前大语言模型精细化调优的前沿方向。随着模型部署对输出规范性要求日益提升,如何通过少量高质量prompt样本实现精确的引用格式控制成为研究热点。Nemotron系列相关工作代表了从通用预训练向任务特异性行为约束的范式转变,该提取版本为研究者提供了纯prompt形式的轻量级资源,便于在强化学习框架中探索格式化指令遵循的奖励机制与泛化能力,对提升学术文献生成、法律文书撰写等专业场景的模型可靠性具有重要实践价值。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务