dev_set_v2_a1_nemotron_cpp_20260810_121605
收藏资源简介:
该数据集包含4562个训练样本,每个样本包含多轮对话(conversations),其中每条对话记录角色(role)和内容(content)。此外,还包含agent、model、model_provider、date、task、episode、run_id、trial_name、result、verifier_output、trace_source等元数据字段。数据集结构表明它是一个用于对话系统或相关任务的结构化多轮对话数据集。
This dataset contains 4562 training samples, each consisting of multi-turn conversations, where each conversation records the role and content. Additionally, it includes metadata fields such as agent, model, model_provider, date, task, episode, run_id, trial_name, result, verifier_output, trace_source, etc. The dataset structure indicates that it is a structured multi-turn dialogue dataset for dialogue systems or related tasks.
数据集概述
该数据集名为 laion/dev_set_v2_a1_nemotron_cpp_20260810_121605,由 LAION 组织发布,托管于 Hugging Face 平台。
基本信息
- 数据集大小:下载大小为 357,627,842 字节(约 341 MB),解压后完整数据集大小为 427,525,188 字节(约 408 MB)。
- 数据划分:仅包含一个训练集(train),包含 4,562 个样本。
- 配置文件:默认配置为
default,数据文件路径为data/train-*。
数据特征
每条样本包含以下字段:
| 字段名 | 类型 | 说明 |
|---|---|---|
conversations |
列表 | 对话内容,每个元素包含 role(角色,字符串)和 content(内容,字符串) |
agent |
字符串 | 智能体标识 |
model |
字符串 | 使用的模型名称 |
model_provider |
字符串 | 模型提供方 |
date |
字符串 | 日期信息 |
task |
字符串 | 任务类型 |
episode |
字符串 | 训练回合标识 |
run_id |
字符串 | 运行 ID |
trial_name |
字符串 | 试验名称 |
result |
字符串 | 执行结果 |
verifier_output |
字符串 | 验证器输出 |
trace_source |
字符串 | 追踪来源 |
典型应用场景
该数据集包含对话、任务执行记录、验证器输出等字段,适用于多轮对话训练、智能体行为分析、任务结果评估、模型输出验证等研究场景。数据集命名中提及 nemotron 和 cpp,可能涉及代码生成(C++)或相关编程任务的对话数据。




