dev_set_v2_a1_taskmaster2_20260815_032257
收藏资源简介:
该数据集是一个多轮对话数据集,包含6516个训练样本,总大小约668MB。每个样本包含一个对话序列(conversations),由角色(role)和内容(content)交替组成。此外,还提供了丰富的元数据字段:agent(智能体标识)、model(模型名称)、model_provider(模型提供商)、date(日期)、task(任务名称)、episode(回合数)、run_id(运行ID)、trial_name(试验名称)、result(结果)、verifier_output(验证器输出)以及trace_source(追踪来源)。这些字段可用于分析对话系统或强化学习场景中的智能体行为、模型表现及任务执行情况。
This dataset is a multi-turn dialogue dataset containing 6516 training samples with a total size of approximately 668MB. Each sample consists of a conversation sequence (conversations) composed of alternating roles (role) and content (content). Additionally, it provides rich metadata fields: agent, model, model_provider, date, task, episode, run_id, trial_name, result, verifier_output, and trace_source. These fields can be used to analyze agent behavior, model performance, and task execution in dialogue systems or reinforcement learning scenarios.
数据集概述
该数据集名为 laion/dev_set_v2_a1_taskmaster2_20260815_032257,由 LAION 发布,是一个用于开发验证的数据集。
数据规模
- 数据集总大小:约 668 MB(668,064,436 字节)
- 下载大小:约 596 MB(596,466,443 字节)
- 数据划分:仅包含
train划分- 样本数量:6,516 条
- 该划分的字节大小:668,064,436 字节
数据字段
每条数据包含以下 12 个字段:
| 字段名 | 类型 | 说明 |
|---|---|---|
conversations |
列表(含 role 和 content 两个字符串子字段) |
对话记录,包含角色与内容 |
agent |
字符串 | 智能体标识 |
model |
字符串 | 使用的模型名称 |
model_provider |
字符串 | 模型提供方 |
date |
字符串 | 日期 |
task |
字符串 | 任务类型 |
episode |
字符串 | 会话轮次标识 |
run_id |
字符串 | 运行 ID |
trial_name |
字符串 | 实验名称 |
result |
字符串 | 结果信息 |
verifier_output |
字符串 | 验证器输出 |
trace_source |
字符串 | 轨迹来源 |
数据格式
- 配置名称:
default - 数据文件路径:
data/train-*(采用通配符匹配多个文件)
应用场景
该数据集包含多轮对话数据及相关的模型运行元数据(如 agent、model、run_id 等),适用于对话系统开发、模型验证以及多智能体协作场景的研究与测试。




