dev_set_v2_a1_nemotron_rust_20260810_151929
收藏资源简介:
该数据集包含多轮对话数据,每条记录由对话历史(conversations,包括角色role和内容content)、智能体名称(agent)、模型名称(model)、模型提供者(model_provider)、日期(date)、任务(task)、回合(episode)、运行ID(run_id)、试验名称(trial_name)、结果(result)、验证器输出(verifier_output)以及追踪来源(trace_source)等字段组成。数据集仅包含一个训练集(train),共5110个样本,总大小约452MB。该数据集适用于对话系统的训练、评估或分析,尤其关注多轮交互中的角色、任务执行和结果验证。
This dataset contains multi-turn dialogue data, each record consists of fields such as conversation history (conversations, including role and content), agent name, model name, model provider, date, task, episode, run ID, trial name, result, verifier output, and trace source. The dataset contains only a training set (train) with 5110 samples, totaling approximately 452MB. This dataset is suitable for training, evaluation, or analysis of dialogue systems, with a particular focus on roles, task execution, and result verification in multi-turn interactions.
数据集详情:laion/dev_set_v2_a1_nemotron_rust_20260810_151929
基本信息
- 数据集名称:dev_set_v2_a1_nemotron_rust_20260810_151929
- 发布机构:LAION
- 数据集大小:约452 MB(452,039,149 字节)
- 下载大小:约388 MB(388,142,902 字节)
- 数据分割:仅包含训练集(train),共 5,110 个样本
数据特征
该数据集每条样本包含以下字段:
| 字段名 | 类型 | 说明 |
|---|---|---|
conversations |
列表(含 role 和 content 两个子字段,均为字符串) |
对话记录,包含角色(如用户/助手)及对应内容 |
agent |
字符串 | 智能体名称或标识 |
model |
字符串 | 使用的模型名称 |
model_provider |
字符串 | 模型提供方 |
date |
字符串 | 数据生成日期 |
task |
字符串 | 任务类型 |
episode |
字符串 | 会话轮次或回合编号 |
run_id |
字符串 | 运行标识符 |
trial_name |
字符串 | 试验名称 |
result |
字符串 | 执行结果 |
verifier_output |
字符串 | 验证器输出 |
trace_source |
字符串 | 追踪来源 |
数据用途
该数据集主要面向智能体(Agent)交互相关的训练与评估场景,包含多轮对话记录、任务执行结果、模型验证输出等结构化信息,适用于:
- 智能体对话行为建模与训练
- 多轮交互任务的效果评估
- 模型输出验证与追踪分析
数据格式与配置
- 配置文件:默认配置(default)
- 数据文件路径:
data/train-*(分片存储) - 存储格式:数据集采用 Hugging Face Datasets 标准格式,支持直接加载与流式读取




