遇见数据集

Nemotron-RL-Instruction-Following-Calendar-v2-prompt-only

收藏
Hugging Face2026-06-27 更新2026-06-29 收录
官方服务:

资源简介:

Nemotron-RL-Instruction-Following-Calendar-v2-prompt-only是一个从源数据集nvidia/Nemotron-RL-Instruction-Following-Calendar-v2专门提取提示(prompt)部分而创建的衍生数据集。该数据集仅包含提示内容,适用于大型语言模型的后训练和指令跟随任务。核心数据文件为prompts.csv,包含9915条记录,每条记录对应源数据的一行,并包含以下字段:prompt(用户指令)、system_prompt(系统指令,已分离)以及可选的tools(可用工具的结构化描述,当源行定义了工具时)。数据以CSV格式存储,其中的嵌套值使用JSON编码。数据集还提供了summary.md和null_or_empty_rows.md两个辅助文件,分别用于统计摘要(如提取行数、失败行数)和记录提取结果为null或空提示的行索引。该数据集由Nemotron Post-Training v3的提示提取器工作流生成,旨在为强化学习中的指令遵循和日历相关任务提供高质量的提示数据。

Nemotron-RL-Instruction-Following-Calendar-v2-prompt-only is a derivative dataset created by extracting the prompt portion from the source dataset nvidia/Nemotron-RL-Instruction-Following-Calendar-v2. This dataset contains only prompt content and is suitable for post-training and instruction-following tasks of large language models. The core data file is prompts.csv, which contains 9915 records, each corresponding to a row in the source data and includes the following fields: prompt (user instruction), system_prompt (system instruction, separated), and optional tools (structured description of available tools, when the source row defines tools). The data is stored in CSV format, with nested values encoded in JSON. The dataset also provides two auxiliary files, summary.md and null_or_empty_rows.md, for statistical summaries (such as the number of extracted rows and failed rows) and recording row indices where extraction results are null or empty prompts, respectively. This dataset is generated by the Nemotron Post-Training v3 prompt extractor workflow and aims to provide high-quality prompt data for instruction following and calendar-related tasks in reinforcement learning.

创建时间:
2026-06-26
搜集汇总
数据集介绍
Nemotron-RL-Instruction-Following-Calendar-v2-prompt-only 数据集图片
构建方式
Nemotron-RL-Instruction-Following-Calendar-v2-prompt-only 数据集是从 nvidia/Nemotron-RL-Instruction-Following-Calendar-v2 源数据集中提取的纯提示版本。构建过程通过专有的提示提取器工作流,将原始数据集中的每条记录转化为包含 system_prompt、prompt 及结构化 tools 字段的独立提示记录。所有嵌套值均以 JSON 格式嵌入 CSV 单元格中,确保了数据结构的紧凑与可解析性。提取后共生成 9915 条有效提示,无任何提取失败记录,行数亦无增减。
特点
该数据集的核心特色在于其纯净的提示导向设计,专为后训练阶段的强化学习指令跟随任务而优化。每条记录均分离出清晰的 system_prompt 与 prompt 组件,并保留了工具调用的结构化信息,使得模型能够在多轮对话或工具辅助场景下进行精准指令跟随。高提取成功率与零失败记录体现了数据构建的鲁棒性,而 JSON 编码的嵌套字段则为复杂逻辑的建模提供了便利。
使用方法
数据集的使用方式极其简洁:用户可直接读取 prompts.csv 文件,利用其提供的 system_prompt、prompt 及 tools 字段构建输入序列。适用于需要严格指令跟随能力的场景,如开放域对话、工具调用或日程管理任务。建议在构建训练样本时,将 system_prompt 作为上下文注入,将 prompt 作为模型输入,并利用 tools 字段启用外部功能调用,从而模拟真实交互环境中的指令解析与执行流程。
背景与挑战
背景概述
指令遵循能力作为大语言模型核心素养之一,直接决定了模型在复杂任务中的实用性与可靠性。为应对后训练阶段对高质量、结构化指令数据的需求,NVIDIA研究团队于2024年构建了Nemotron-RL-Instruction-Following-Calendar-v2-prompt-only数据集,由研究员James D. Borin主导上传。该数据集从原始的`nvidia/Nemotron-RL-Instruction-Following-Calendar-v2`中提取提示词,聚焦于日历场景下的多轮指令遵循任务,提供了系统提示、结构化工具调用等关键字段。其发布为强化学习与后训练微调提供了标准化的测试与训练资源,在推动模型理解时间维度、事件调度与工具使用能力方面具有重要研究价值。
当前挑战
该数据集所解决的领域问题在于提升模型对包含明确时间约束、日程冲突及依赖关系指令的遵循能力,传统模型在此类任务中易产生幻觉或逻辑错误,而当前数据集通过精心设计的日历场景挑战了模型在时间推理与工具调用上的鲁棒性。在构建过程中,主要挑战包括从原始多轮对话中精确分离出独立的提示词片段,确保系统提示与工具定义结构化完整且不丢失上下文,同时处理嵌套JSON在CSV单元格中的编码一致性,以及批量提取时对9915条记录实现零失败率与零差异的严格质量控制。
常用场景
经典使用场景
Nemotron-RL-Instruction-Following-Calendar-v2-prompt-only 数据集作为从原始日历指令跟随任务中提取的纯提示子集,核心用途在于为强化学习阶段提供高质量、结构化的指令输入。研究者通常利用该数据集训练或微调语言模型,使其能够精确理解包含系统提示、工具定义等复杂上下文的日历相关指令,从而提升模型在日程管理、事件安排等任务上的指令跟随能力。通过剥离原始数据中的响应部分,该数据集尤其适用于需要独立评估提示质量和指令多样性的场景,为后续的奖励建模或策略优化奠定基础。
衍生相关工作
该数据集衍生了一系列关于指令跟随提示优化与后训练方法的经典工作。一方面,开发者基于其纯提示格式设计了新的提示评估框架,用于度量提示质量对模型响应的因果影响;另一方面,该数据集促进了从监督微调向强化学习过渡的提示提取流程标准化,例如其配套的Nemotron Post-Training v3工作流成为同类任务的处理标杆。此外,该数据集还催生了有关日历事件推理的基准测试,推动研究者探索模型在处理动态时间约束和工具整合时的局限性。
数据集最近研究
最新研究方向
随着大规模语言模型在后训练阶段对指令遵循能力的需求日益增长,Nemotron-RL-Instruction-Following-Calendar-v2-prompt-only数据集应运而生,专注于提供高质量的提示-工具交互数据,以增强模型在结构化任务中的表现。该数据集从原始日历指令遵循数据中提取了9915条精确的提示记录,保留了系统提示与工具定义,为强化学习微调提供了关键基础。当前研究热点集中于利用此类精细化的提示集来优化模型对复杂、多步指令的解析能力,尤其是在涉及外部工具调用与时间敏感事件处理的场景中。通过剥离冗余信息并聚焦于指令的核心结构,该数据集有效推动了后训练范式向更高效、更可控的方向发展,其对提升AI助手在日程规划、任务调度等实际应用中的可靠性具有深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务