nemotron-terminal-debugging
收藏资源简介:
nemotron-terminal-debugging 数据集是 nvidia/Nemotron-Terminal-Corpus 数据集的一个过滤子集,专门针对调试任务(source == 'debugging')。该数据集保留了原始数据集的难度分类(easy / medium / mixed),并为未标记难度的数据(来自 dataset_adapters/* 文件)标记为 'na'。数据集包含原始数据集的列(如 conversations, agent, model, model_provider, date, task, episode, run_id, trial_name, enable_thinking)以及新增的列:source(分区键,此处为 'debugging')、difficulty(难度等级)和 original_source(仅在 adapters_code 中存在,保留原始 source 列的值)。数据集适用于代码、终端、代理、跟踪和 sft 相关的问答任务,语言为英语,采用 CC-BY-4.0 许可。
nemotron-terminal-debugging 数据集概述
数据集来源
- 本数据集是 nvidia/Nemotron-Terminal-Corpus 的一个按来源划分的子集。
- 筛选条件为
source == "debugging"。
数据集内容与结构
- 任务类别:问答
- 主要语言:英语
- 标签:代码、终端、智能体、追踪、监督微调
- 分区方案:
- adapters_{code,math,swe}:数据来自
dataset_adapters/{code,math,swe}.parquet。 - {skill}(例如
debugging,security, …):数据来自synthetic_tasks/skill_based/{easy,medium,mixed}/{skill}/data_filtered.parquet。
- adapters_{code,math,swe}:数据来自
- 数据文件:
config_name: defaultsplit: trainpath: data.parquet
数据列说明
- 继承自源数据集的列:
conversations,agent,model,model_provider,date,task,episode,run_id,trial_name,enable_thinking。 - 新增列:
source:分区键,在本数据集中始终为"debugging"。difficulty:难度等级,取值为easy/medium/mixed/na。其中na用于未携带难度标签的dataset_adapters/*文件。original_source:仅出现在adapters_code分区中,用于保留上游文件中原始的source列值(OpenCodeReasoning或synthetic)。
许可信息
- 许可证:CC-BY-4.0
引用信息
bibtex @misc{pi2026dataengineeringscalingllm, title={On Data Engineering for Scaling LLM Terminal Capabilities}, author={Renjie Pi and Grace Lam and Mohammad Shoeybi and Pooya Jannaty and Bryan Catanzaro and Wei Ping}, year={2026}, eprint={2602.21193}, archivePrefix={arXiv}, primaryClass={cs.CL}, url={https://arxiv.org/abs/2602.21193}, }




