nemotron-terminal-data_processing
收藏资源简介:
nemotron-terminal-data_processing 数据集是 nvidia/Nemotron-Terminal-Corpus 的一个子集,专门筛选了 'source == "data_processing"' 的数据。数据集包含多个分区,如 'adapters_{code,math,swe}' 和基于技能的分区(如 'debugging', 'security' 等)。数据列包括从源数据集继承的 'conversations', 'agent', 'model', 'model_provider', 'date', 'task', 'episode', 'run_id', 'trial_name', 'enable_thinking',以及新增的 'source'(分区键,此处为 'data_processing')、'difficulty'(难度等级:'easy' / 'medium' / 'mixed' / 'na')和 'original_source'(仅在 'adapters_code' 中存在,保留原始 'source' 值)。数据集适用于与代码、终端、代理、跟踪和 sft 相关的问答任务,语言为英语,采用 CC-BY-4.0 许可。
`nemotron-terminal-data_processing` 数据集是英伟达(NVIDIA)`Nemotron-Terminal-Corpus` 数据集的一个子集,专门筛选出满足`source == "data_processing"`条件的数据。该数据集包含多个数据分区,例如`adapters_{code,math,swe}`以及按技能划分的分区(如`debugging`、`security`等)。其数据字段既包含从源数据集继承的`conversations`、`agent`、`model`、`model_provider`、`date`、`task`、`episode`、`run_id`、`trial_name`、`enable_thinking`,还包含三类新增数据字段:`source`(分区键,当前取值为`data_processing`)、`difficulty`(难度等级分为`easy`/`medium`/`mixed`/`na`)以及`original_source`(仅在`adapters_code`分区中存在,用于保留原始`source`字段的取值)。本数据集适用于与代码、终端、AI智能体(AI Agent)、跟踪及监督微调(Supervised Fine-Tuning,SFT)相关的问答任务,采用英语编写,遵循CC-BY-4.0开源许可协议。
数据集概述
基本信息
- 数据集名称: nemotron-terminal-data_processing
- 来源: 此数据集是 nvidia/Nemotron-Terminal-Corpus 的一个按来源划分的子集。
- 筛选条件: 筛选出
source == "data_processing"的数据。 - 许可证: CC-BY-4.0
- 原始数据集许可证: CC-BY-4.0
任务与语言
- 主要任务类别: 问答
- 语言: 英语
- 标签: 代码、终端、智能体、轨迹、监督微调
数据内容与结构
- 配置: 默认配置 (
default),训练集数据文件为data.parquet。 - 划分方案:
- adapters_{code,math,swe}: 来自
dataset_adapters/{code,math,swe}.parquet的数据行。 - {skill} (例如
debugging,security): 来自synthetic_tasks/skill_based/{easy,medium,mixed}/{skill}/data_filtered.parquet的数据行。
- adapters_{code,math,swe}: 来自
- 难度列:
difficulty列保留了原始的easy/medium/mixed划分。对于来自dataset_adapters/*文件的数据,该值为na(未标注难度)。
数据列
包含源数据集的所有列 (conversations, agent, model, model_provider, date, task, episode, run_id, trial_name, enable_thinking),并额外添加了以下列:
source: 划分键,在此数据集中始终为"data_processing"。difficulty: 难度等级,取值为easy/medium/mixed/na。original_source: 仅出现在adapters_code划分中,用于保留上游文件中原始的source列值(OpenCodeReasoning或synthetic)。
引用
如需引用,请使用以下 BibTeX 条目: bibtex @misc{pi2026dataengineeringscalingllm, title={On Data Engineering for Scaling LLM Terminal Capabilities}, author={Renjie Pi and Grace Lam and Mohammad Shoeybi and Pooya Jannaty and Bryan Catanzaro and Wei Ping}, year={2026}, eprint={2602.21193}, archivePrefix={arXiv}, primaryClass={cs.CL}, url={https://arxiv.org/abs/2602.21193}, }




